עלות
10 ידיעות
מטמון פרומפט: למה הוא מוריד תשעים אחוז, ולמה הוא נשבר בשקט
התאמת קידומת, לא התאמת תוכן. תו אחד שמשתנה בתחילת הבקשה מבטל את כל מה שאחריו, ואין שגיאה שמודיעה על כך.
חלון ההקשר: מה נכנס, מה נופל החוצה, ומה קורה כשהוא מתמלא
כל בקשה למודל נשלחת מחדש עם כל ההיסטוריה. זה מסביר את העלות, את ההאטה, ואת הרגע שבו המודל שוכח מה סוכם לפניו.
עריכת הקשר: למחוק תוצאות כלים ישנות במקום לסכם אותן
סוכן שקרא חמישים קבצים נושא את כולם בהקשר. עריכה מסירה את מה שהתיישן, ומשאירה את מבנה השיחה שלם.
תמחור: פלט עולה פי חמישה מקלט, וזה קובע איך בונים
היחס הזה חוזר כמעט בכל מודל. הוא הופך פרומפט ארוך לזול יחסית, ותשובה מפורטת ליקרה, וזה משנה החלטות תכנון.
מתי לא לבנות סוכן: ארבעה תנאים, ואם אחד נופל אז לא
מורכבות, ערך, היתכנות ומחיר הטעות. רוב מה שנבנה כסוכן היה עובד טוב יותר כקריאה בודדת או כתהליך עם לולאה בקוד.
קריאה תכנותית לכלים: כשהתוצאות לא צריכות להגיע להקשר
המודל כותב סקריפט שקורא לכלים, והסקריפט מסנן. רק הפלט הסופי חוזר להקשר, ולא שלושים תוצאות ביניים.
תת-סוכנים: כל האצלה עולה סבב שלם
הקשר נפרד לכל תת-סוכן זו התועלת. הבריף מחדש, החקירה מחדש והדוח שחוזר הם המחיר, ובמשימה קטנה הוא גדול מהתועלת.
Batch API: חצי מחיר תמורת סבלנות
עד מאה אלף בקשות בקבוצה אחת, בחמישים אחוז הנחה. רוב הקבוצות מסתיימות בתוך שעה, והתקרה הרשמית היא עשרים וארבע.
ספירת טוקנים: למה tiktoken נותן לכם מספר שגוי
הטוקנייזר של OpenAI לא מתאים לקלוד, והפער גדול במיוחד בעברית ובקוד. יש נקודת קצה שמחזירה את המספר האמיתי.
effort: החוגה שמחליפה את הבחירה בין מודל יקר לזול
חמש רמות שקובעות כמה המודל חושב ופועל. ברוב המקרים הורדת רמה חוסכת יותר מהחלפת מודל, ובלי לשלם באיכות.