חשיבה אדפטיבית: למה תקציב הטוקנים הקבוע נעלם

המודל מחליט לבד כמה לחשוב בכל בקשה. מי שנשאר עם budget_tokens מקבל שגיאה, ומי שמעביר קוד ישן צריך להחליף גישה ולא רק פרמטר.

הדרך הישנה לבקש מהמודל לחשוב הייתה לתת לו תקציב טוקנים קבוע: thinking עם enabled ומספר. הדרך החדשה היא adaptive, בלי מספר. המודל מחליט בעצמו כמה לחשוב בכל בקשה, ועומק החשיבה נשלט דרך effort.

זו לא הצעה. במודלים העדכניים budget_tokens מוסר לגמרי ובקשה שכוללת אותו מוחזרת עם שגיאת 400. אין נתיב ביניים.

למה זה עדיף

תקציב קבוע היה תמיד ניחוש. אותה אפליקציה מקבלת שאלה טריוויאלית ושאלה שדורשת חמישה שלבים, ותקציב אחד לא נכון לשתיהן. תקציב גדול מבזבז על הקלה, תקציב קטן חונק את הקשה.

חשיבה אדפטיבית מעבירה את ההחלטה לרמת הבקשה. במדידות פנימיות היא עוקפת את התקציב הקבוע, ואת הרצון לשלוט בהוצאה משרתת רמת המאמץ, שהיא חוגה גסה יותר אבל מכוונת נכון יותר.

מה השתנה בהתנהגות ברירת המחדל

כאן יושבת המלכודת האמיתית של המעבר. במודלים מסוימים בקשה בלי שדה thinking כלל רצה בלי חשיבה. באחרים, ובכללם הדור האחרון, אותה בקשה בדיוק רצה עם חשיבה אדפטיבית.

זה משנה שני דברים בלי שנגעתם בקוד. ראשית, העלות: טוקני חשיבה מחויבים כפלט. שנית, ותר מסוכן, max_tokens הוא תקרה על חשיבה ותשובה יחד, ולכן תקרה שכוילה בעבר לאורך התשובה בלבד עלולה לקטוע תשובות באמצע.

מי שרוצה לשמר את ההתנהגות הישנה צריך לכתוב disabled במפורש. במודלים מסוימים גם זה מוגבל, ומותר רק עד רמת מאמץ מסוימת.

מה חוזר בתשובה

בלוקי חשיבה מופיעים בתשובה, אבל שרשרת המחשבה הגולמית לא מוחזרת. שדה display קובע מה כן: omitted, שהיא ברירת המחדל בדור האחרון, מחזירה בלוק עם טקסט ריק. summarized מחזירה סיכום קריא.

זו החלפה שקטה של ברירת מחדל, והיא שוברת ממשקים. אפליקציה שהציגה למשתמש את החשיבה בזמן אמת מקבלת פתאום בלוקים ריקים, ומה שהמשתמש רואה הוא השהיה ארוכה לפני שהטקסט מתחיל לזרום. התיקון הוא בפרמטר הבקשה ולא בקוד שקורא את התשובה.

display שולט בנראות בלבד. החשיבה קורית ומחויבת אותו דבר בכל הגדרה.

מה לעשות עם בלוקי חשיבה בשיחה רב-תורית

להחזיר אותם כמו שהם. גם כאלה שהטקסט שלהם ריק. ה-API דוחה בלוקים ששונו, לא בלוקים שנקראו, ולכן להציג את הסיכום זה בסדר ולערוך או לשחזר את הבלוק זה לא.

מודל אחר שמקבל בלוקי חשיבה שנוצרו במודל אחר בדרך כלל מתעלם מהם בשקט. יש יוצא דופן אחד: משפחת המודלים החזקה ביותר, שבלוקי החשיבה שלה נזרקים מהפרומפט ולא מרונדרים אליו. הם לא מחויבים, ולכן אין מה לנקות מטעמי עלות.

מה שנשאר פתוח

אין דרך לומר למודל "תחשוב על השאלה הזאת ולא על ההיא" מלבד ניסוח ההנחיות. במערכות עם הנחיות מערכת גדולות ומורכבות המודל נוטה לחשוב יותר מהנדרש, וההנחיה שמצמצמת את זה היא טקסט חופשי, לא הגדרה.

מקורות

  1. Adaptive thinking · Anthropic · 24 ביוני 2026