חלון ההקשר: מה נכנס, מה נופל החוצה, ומה קורה כשהוא מתמלא
כל בקשה למודל נשלחת מחדש עם כל ההיסטוריה. זה מסביר את העלות, את ההאטה, ואת הרגע שבו המודל שוכח מה סוכם לפניו.
חלון ההקשר הוא כמות הטקסט שהמודל יכול להחזיק בבת אחת בבקשה אחת. הוא נמדד בטוקנים, לא במילים, והוא מכסה את הכול: הנחיות המערכת, ההיסטוריה של השיחה, הקבצים שצורפו, תיאורי הכלים, החשיבה של המודל והתשובה שהוא כותב.
הנקודה שהכי מבלבלת מי שמתחיל: המודל לא זוכר כלום בין בקשה לבקשה. ה-API חסר מצב לחלוטין. מה שנראה כמו שיחה מתמשכת הוא בפועל שליחה מחדש של כל ההיסטוריה בכל פנייה. שיחה בת עשרים תורים היא עשרים בקשות, כשכל אחת ארוכה מקודמתה.
למה זה מייקר
מכאן נגזרת התנהגות העלות. אם כל תור מוסיף אלף טוקנים, התור הראשון נושא אלף, השני אלפיים, העשירי עשרת אלפים. הסכום גדל ריבועית, לא ליניארית. שיחה ארוכה עולה הרבה יותר ממה שנראה מהסתכלות על התור הבודד.
זו גם הסיבה שמטמון פרומפט חשוב כל כך. החלק הקבוע של הבקשה, בדרך כלל הנחיות המערכת והכלים, נכתב פעם אחת למטמון ואחר כך נקרא ממנו בכעשירית ממחיר הקלט. בלי מטמון משלמים על אותן הנחיות מלא בכל אחת מעשרים הבקשות.
מה בעצם נספר
טוקן אינו מילה. בעברית היחס גרוע יותר מאשר באנגלית, וכמה טוקנים למילה תלוי במחרוזת עצמה. הדרך היחידה לדעת היא למדוד: נקודת קצה ייעודית לספירת טוקנים מחזירה את המספר המדויק עבור מודל מסוים, ומחשבון שנכתב מול מודל אחד לא בהכרח נכון למודל אחר. אומדנים בסגנון "ארבעה תווים לטוקן" נשברים על עברית, על קוד ועל JSON.
נקודה שנשכחת: max_tokens הוא תקרה על הפלט, והפלט כולל את החשיבה. במודלים שחושבים כברירת מחדל, תקרה שנקבעה לפי אורך התשובה בלבד עלולה לקטוע את התשובה באמצע. החשיבה נצרכה מאותה קופה.
מה קורה כשמתמלא
כשהבקשה חורגת מהחלון, ה-API מחזיר שגיאה. בקוד שרץ בייצור זו בדרך כלל לא האפשרות הרצויה, ולכן יש שני מנגנונים.
הראשון הוא כיווץ. השרת מסכם את ההיסטוריה המוקדמת לבלוק אחד ומחליף בו את מה שסוכם. תנאי אחד קריטי: צריך להחזיר את כל תוכן התשובה בחזרה בבקשה הבאה, לא רק את הטקסט. הבלוק שנוצר הוא מה שמאפשר לשרת לדעת מה כבר סוכם, ומי ששולף רק את המחרוזת מאבד אותו בשקט והכיווץ מפסיק לעבוד.
השני הוא עריכת הקשר. במקום לסכם, היא מוחקת: תוצאות כלים ישנות שכבר לא רלוונטיות, או בלוקים של חשיבה. זה שימושי לסוכן שקרא חמישים קבצים ומעניינים אותו רק השלושה האחרונים.
השניים משלימים ולא מתחרים. עריכה מקצצת מה שהתיישן, כיווץ נכנס כשמתקרבים לגבול ואין מה עוד לקצץ.
מה זה אומר בפועל
חלון של מיליון טוקנים לא מבטל את השיקול, הוא מזיז אותו. תמחור פר טוקן לא משתנה עם גודל החלון, ולכן היכולת למלא אותו היא בעיקר היכולת לשלם עליו. סוכן שנותנים לו לרוץ שעות ימלא כל חלון שיקבל.
מה שעדיין לא ברור הוא איפה עובר הגבול המעשי של איכות. חלון גדול מבטיח שהמידע נמצא בהקשר, לא שהמודל ישתמש בו נכון, ופרסומי הספקים בנושא הזה מודדים בדרך כלל אחזור של עובדה בודדת ולא הסקה על פני החלון כולו.
מקורות
- Context windows · Anthropic · 24 ביוני 2026