effort: החוגה שמחליפה את הבחירה בין מודל יקר לזול
חמש רמות שקובעות כמה המודל חושב ופועל. ברוב המקרים הורדת רמה חוסכת יותר מהחלפת מודל, ובלי לשלם באיכות.
הפרמטר effort קובע כמה עמוק המודל חושב וכמה רחוק הוא הולך לפני שהוא עונה. חמש רמות: נמוכה, בינונית, גבוהה, גבוהה במיוחד ומקסימלית. ברירת המחדל היא גבוהה.
הוא יושב בתוך output_config ולא ברמה העליונה של הבקשה. זו טעות נפוצה שמחזירה שגיאה מבלבלת, כי הפרמטר קיים אבל לא במקום שבו חיפשו אותו.
מה הוא בעצם משנה
לא רק את אורך החשיבה. ברמות נמוכות המודל מבצע פחות קריאות לכלים ומאחד אותן, כותב פחות הקדמות, ומצמצם את העבודה למה שהתבקש. ברמות גבוהות הוא בודק את עצמו, חוקר יותר לפני שהוא מתחיל, ומרחיב.
ההבדל בולט במיוחד בעבודה סוכנית. סוכן ברמה נמוכה יגש ישר למשימה. אותו סוכן ברמה גבוהה יקרא קודם את הסביבה, יבנה תוכנית, ויאמת את התוצאה. שתי ההתנהגויות נכונות, לשימושים שונים.
מה לבחור
לקוד ולעבודה סוכנית ההמלצה היא גבוהה במיוחד. לרוב העבודה שרגישה לאיכות, גבוהה כמינימום. בינונית היא ירידה במחיר שמשלמת באיכות במידה שכדאי למדוד ולא להניח. נמוכה מתאימה למשימות קצרות ומוגדרות ולכל מה שרגיש להשהיה ולא לאינטליגנציה: סיווג, חילוץ, שיחה פשוטה.
מקסימלית שווה בדיקה כשנכונות חשובה יותר מעלות, אבל היא לא תמיד עדיפה. היא צורכת הרבה יותר טוקנים, ובמשימות פשוטות היא נוטה לחשוב יתר על המידה.
למה זה מנוף חזק יותר מהחלפת מודל
מודל אחד ברמת מאמץ נמוכה יכול להיות טוב יותר ממודל חלש יותר ברמה גבוהה, ובעלות דומה. בדיקה מול המשימה האמיתית תיתן תשובה מדויקת יותר מכל טבלת השוואה, כי היחס בין הרמות משתנה לפי סוג העבודה.
יש כאן גם אפקט שנוגד את האינטואיציה. בעבודה סוכנית ארוכה, מאמץ גבוה בהתחלה לפעמים מוזיל את הריצה כולה. תכנון טוב יותר מייצר פחות תורות, פחות קריאות לכלים ופחות תיקונים, ולכן פחות טוקנים בסך הכול. הקשר בין מאמץ לעלות לא מונוטוני.
שתי מלכודות
הראשונה: effort לא מקצר את התשובה הגלויה. מי שרוצה פחות מלל צריך לבקש אותו בהנחיות, לא להוריד מאמץ. הורדת מאמץ מזיזה את נפח החשיבה, לא בהכרח את אורך הפלט.
השנייה: ברמות הגבוהות צריך max_tokens נדיב. החשיבה נצרכת מאותה תקרה כמו התשובה, ותקרה שנקבעה לפי אורך התשובה בלבד תקטע את התשובה באמצע. נקודת פתיחה סבירה היא ששים וארבעה אלף, ולכוונן משם.
איך למדוד
סריקה על שלוש רמות מול ערכת בדיקות משלכם היא העבודה. לא סקירה של מדדים פומביים, כי הם נמדדים על משימות שאינן שלכם. הגדרות מאמץ שהועתקו ממודל קודם כמעט תמיד לא נכונות למודל חדש, וזו אחת הסיבות שעדכון מודל דורש כיוונון מחדש ולא רק החלפת מחרוזת.
מה שנשאר לא פתור הוא איך לבחור רמה אוטומטית לפי המשימה. כרגע זו החלטה ידנית לכל מסלול בקוד, ולמי שמריץ כמה סוגי עבודה באותו שירות זה אומר כמה הגדרות ולא אחת.
מקורות
- Effort parameter · Anthropic · 24 ביוני 2026