Batch API: חצי מחיר תמורת סבלנות

עד מאה אלף בקשות בקבוצה אחת, בחמישים אחוז הנחה. רוב הקבוצות מסתיימות בתוך שעה, והתקרה הרשמית היא עשרים וארבע.

כל בקשה שלא צריכה תשובה עכשיו יכולה לעלות חצי. זה מה שה-Batch API עושה: שולחים אוסף בקשות, מקבלים מזהה, ואוספים את התוצאות כשהן מוכנות.

ההנחה היא חמישים אחוז על כל השימוש בטוקנים, קלט ופלט. היא לא מותנית בגודל הקבוצה.

המגבלות

עד מאה אלף בקשות או מאתיים חמישים ושישה מגה-בייט בקבוצה, מה שנגמר קודם. התוצאות זמינות עשרים ותשעה ימים מיצירת הקבוצה.

כל יכולות ה-API הרגילות עובדות: ראייה, כלים, מטמון פרומפט. אין תת-קבוצה מוגבלת של פיצ'רים.

מה מתאים לזה

עיבוד קטלוג: סיווג של אלפי מוצרים, סיכום של ארכיון, תיוג של תמונות. הרצת מדדים על ערכת בדיקות. יצירת תוכן שאינה תלוית שעה. כל מה שאדם לא מחכה מולו.

מה שלא מתאים: כל דבר שיש בו משתמש שממתין, וכל דבר שהתשובה שלו מזינה את הבקשה הבאה. הקבוצה היא שכבה אחת ולא שרשרת.

הדבר שהכי קל לטעות בו

התוצאות חוזרות בסדר שרירותי. לא בסדר השליחה.

לכל בקשה בקבוצה נותנים מזהה משלכם, וההתאמה בין תוצאה לבקשה נעשית לפיו בלבד. קוד שמניח שהתוצאה השלישית שייכת לבקשה השלישית ייתן תשובות מוחלפות, בלי שגיאה ובלי סימן חיצוני. זה באג שיושב בשקט בייצור.

מצבי תוצאה

ארבעה. הצליח, נכשל, בוטל, פג. שלושת האחרונים דורשים טיפול שונה זה מזה.

בכישלון יש הבחנה שמשנה מה לעשות: שגיאת בקשה לא תקינה פירושה שהבקשה עצמה שגויה, ואין טעם לנסות שוב לפני שמתקנים אותה. שגיאת שרת פירושה שאפשר לשלוח שוב כמו שהיא.

תוצאה שפגה נשלחת מחדש. זה קורה כשקבוצה לא הסתיימה בתוך חלון הזמן.

תזמון

רוב הקבוצות נגמרות בתוך שעה. ההתחייבות היא עשרים וארבע שעות. אין דרך לזרז ואין עדיפות בתוך הקבוצה, ולכן מי שמתכנן תהליך לילי צריך לתכנן אותו סביב הגבול העליון ולא סביב הממוצע.

הבדיקה נעשית בתשאול של מצב הקבוצה עד שהוא מסתיים. אין התראה דחיפה על סיום.

מה לא זמין שם

הפרמטר שמטפל בסירובים בצד השרת נדחה בקבוצות. גם החזרת אשראי על ניסיון חוזר אחרי סירוב לא נושאת אסימון בתוצאות קבוצה. מי שבונה זרימת נסיגה למודל אחר צריך לעשות אותה בעצמו על התוצאות שחזרו.

וכן: max_tokens אפס, שמשמש לחימום מטמון, נדחה בקבוצות.

מה שנשאר לשקול

מטמון פרומפט וקבוצות מסתדרים יחד, אבל היחס ביניהם לא אינטואיטיבי. בקשות בקבוצה שרצות במקביל לא בהכרח קוראות מהמטמון שאחת מהן כתבה, כי רשומת מטמון נעשית קריאה רק אחרי שהתשובה הראשונה התחילה לזרום. בקבוצה גדולה עם קידומת משותפת גדולה שווה למדוד את זה ולא להניח.

מקורות

  1. Batch processing · Anthropic · 24 ביוני 2026