מה קורה בבינה מלאכותית
כל ידיעה נשענת על מקור שפורסם ומקושרת אליו. מתעדכן שלוש פעמים ביום.
אחרונות
Prefill: התרגיל שהפסיק לעבוד, ומה בא במקומו
תור עוזר אחרון בהודעות מחזיר ארבע מאות. הפתרון תלוי במה שהתרגיל עשה: פורמט, תווית, או ביטול פתיח.
stop_reason: שבע סיבות עצירה, ורק לאחת יש פרטים
pause_turn אומר שלולאת כלי השרת נגמרה ויש להמשיך. stop_details מאוכלס רק בסירוב, ובכל השאר הוא ריק.
כלים במקביל: כל התוצאות בהודעה אחת, אחרת זה נגמר
פיצול תוצאות לשתי הודעות מלמד את המודל להפסיק לקרוא לכלים במקביל. וכלי שנכשל עדיין חייב תוצאה.
Models API: לשאול את השרת מה המודל יודע, במקום לזכור
אין שדה בשם context_window. יש max_input_tokens, max_tokens, ועץ יכולות שאפשר לסנן לפיו בזמן ריצה.
סוכן שמריץ כלים: הלולאה, ואיפה היא נשברת בייצור
המודל מבקש, הקוד שלכם מריץ. ההפרדה הזאת היא גם מה שמאפשר שער אישור, וגם המקום שבו רוב הבאגים יושבים.
מטמון פרומפט: למה הוא מוריד תשעים אחוז, ולמה הוא נשבר בשקט
התאמת קידומת, לא התאמת תוכן. תו אחד שמשתנה בתחילת הבקשה מבטל את כל מה שאחריו, ואין שגיאה שמודיעה על כך.
חלון ההקשר: מה נכנס, מה נופל החוצה, ומה קורה כשהוא מתמלא
כל בקשה למודל נשלחת מחדש עם כל ההיסטוריה. זה מסביר את העלות, את ההאטה, ואת הרגע שבו המודל שוכח מה סוכם לפניו.
RAG מול חלון ארוך: מה באמת מחליף מה
מיליון טוקנים לא מבטלים אחזור. הם מזיזים את הגבול שממנו הוא משתלם, והשיקול הופך מטכני לכלכלי.
ציטוטים: הפניה לטווח תווים במסמך, לא רק שם המקור
הדגל מפצל את התשובה לבלוקים, וכל בלוק מצוטט נושא את הטקסט המקורי ואת מיקומו המדויק. לא עובד יחד עם פלט מובנה.
הרצת קוד: מכולה מבודדת בלי אינטרנט, שנשארת שלושים יום
מריצים פייתון בסביבה של הספק בלי להתקין כלום. מזהה המכולה מאפשר להמשיך מאיפה שהפסקתם.
Skills: הנחיות שנטענות רק כשהן רלוונטיות
תיקייה עם קובץ הנחיות. התיאור יושב בהקשר תמיד, התוכן נקרא רק כשהמשימה מצדיקה אותו.
זיכרון סוכן: תיקיית קבצים, לא מסד נתונים
המודל קורא וכותב קבצים בתיקייה שאתם מממשים. זה נשמע פשוט, ורוב הכשלים יושבים בדיוק במימוש הזה.
עריכת הקשר: למחוק תוצאות כלים ישנות במקום לסכם אותן
סוכן שקרא חמישים קבצים נושא את כולם בהקשר. עריכה מסירה את מה שהתיישן, ומשאירה את מבנה השיחה שלם.
כיווץ הקשר: הבלוק שחייבים להחזיר, ואיך מאבדים אותו בשקט
השרת מסכם היסטוריה ישנה ומחליף אותה בבלוק. מי ששולף רק את הטקסט מהתשובה מוחק את הבלוק, והכיווץ מפסיק לעבוד בלי שגיאה.
תמחור: פלט עולה פי חמישה מקלט, וזה קובע איך בונים
היחס הזה חוזר כמעט בכל מודל. הוא הופך פרומפט ארוך לזול יחסית, ותשובה מפורטת ליקרה, וזה משנה החלטות תכנון.
מתי לא לבנות סוכן: ארבעה תנאים, ואם אחד נופל אז לא
מורכבות, ערך, היתכנות ומחיר הטעות. רוב מה שנבנה כסוכן היה עובד טוב יותר כקריאה בודדת או כתהליך עם לולאה בקוד.
קריאה תכנותית לכלים: כשהתוצאות לא צריכות להגיע להקשר
המודל כותב סקריפט שקורא לכלים, והסקריפט מסנן. רק הפלט הסופי חוזר להקשר, ולא שלושים תוצאות ביניים.
חיפוש כלים: כשיש שלושים כלים ורק שניים רלוונטיים
כל סכימת כלי יושבת בהקשר בכל בקשה. טעינה נדחית מעלה רק את מה שנחוץ, ובלי לשבור את מטמון הפרומפט.
כלים בצד השרת מול צד הלקוח: מי מריץ, ומי יכול לעצור
חיפוש וקוד רצים אצל הספק ומחזירים תוצאה. bash ועורך הקבצים רצים אצלכם. ההבדל קובע איפה אפשר לשים שער אישור.
תת-סוכנים: כל האצלה עולה סבב שלם
הקשר נפרד לכל תת-סוכן זו התועלת. הבריף מחדש, החקירה מחדש והדוח שחוזר הם המחיר, ובמשימה קטנה הוא גדול מהתועלת.
שגיאות API: מה כדאי לנסות שוב ומה יחזור בדיוק אותו דבר
429 ו-529 שווים ניסיון חוזר, 400 ו-404 לא. תפיסה אחת רחבה של כל השגיאות מוחקת בדיוק את ההבחנה הזאת.
Batch API: חצי מחיר תמורת סבלנות
עד מאה אלף בקשות בקבוצה אחת, בחמישים אחוז הנחה. רוב הקבוצות מסתיימות בתוך שעה, והתקרה הרשמית היא עשרים וארבע.
סטרימינג: לא רק חוויית משתמש, גם מה שמונע פסק זמן
מעל כשישה עשר אלף טוקני פלט בקשה רגילה נופלת על פסק זמן של ה-SDK. סטרימינג הוא הפתרון, וגם הדרך היחידה להגיע לתקרה המלאה.
פלט מובנה: סוף לרגקס שמחלץ JSON מתשובה
סכימה בבקשה מבטיחה תשובה שעומדת בה. זה מוחק את ה-prefill, את רצפי העצירה ואת לולאת הניסיון החוזר שהקיפו אותם.
ספירת טוקנים: למה tiktoken נותן לכם מספר שגוי
הטוקנייזר של OpenAI לא מתאים לקלוד, והפער גדול במיוחד בעברית ובקוד. יש נקודת קצה שמחזירה את המספר האמיתי.
חשיבה אדפטיבית: למה תקציב הטוקנים הקבוע נעלם
המודל מחליט לבד כמה לחשוב בכל בקשה. מי שנשאר עם budget_tokens מקבל שגיאה, ומי שמעביר קוד ישן צריך להחליף גישה ולא רק פרמטר.
effort: החוגה שמחליפה את הבחירה בין מודל יקר לזול
חמש רמות שקובעות כמה המודל חושב ופועל. ברוב המקרים הורדת רמה חוסכת יותר מהחלפת מודל, ובלי לשלם באיכות.