מודול "זיכרון פרואקטיבי" חדש מאפשר לסוכני מודלי שפה גדולים (LLM agents) לעקוב אחר דרישות משימה, עובדות סביבתיות וכשלים מהעבר — מבלי לבצע fine-tuning למודל הליבה. בבדיקות ביצועים (benchmarks), התוספת העלתה את הציון של Sonnet 4.5 ב-8.3 נקודות אחוז ב-Terminal-Bench 2.0 וב-6.8 נקודות בערכת τ2-Bench; סוכן זיכרון שאומן בשיטת SETA העלה את ה-pass@1 של מודל קפוא מ-37.6% ל-41.1% בבעיות לא מוכרות.

למה סוכנים מאבדים את הכיוון

כאשר סוכן מונע LLM מבצע הליך רב-שלבי, ה"מצב" (state) הפנימי שלו דועך. חוקרים מכנים זאת "דעיכת מצב התנהגותית" (behavioral state decay): המודל שוכח הוראות קודמות, עובדות מפתח או טעויות שכבר ביצע. התוצאה היא שרשרת של החלטות גרועות שמובילה לביטול המשימה זמן רב לפני השלמתה.

הפתרון הרגיל הוא להגדיל את חלון ההקשר (context window) — מקטע הטקסט שהמודל יכול לעבד בבת אחת. זה עוזר רק עד שהמשימה חורגת מגודל החלון; מידע ישן נזרק והדעיכה מתחדשת.

תזכורת שפועלת רק כשצריך

הגישה החדשה מוסיפה סוכן זיכרון עזר קל משקל שעוקב אחר עקבות ההסקה (reasoning trace) של המודל הראשי ומזריק תזכורות ממוקדות. במקום לשלוף רשימה סטטית של קטעי מידע מהעבר, מודול הזיכרון מחליט מתי ומה להציג, ופועל רק כאשר נראה שהמודל הראשי מתחיל לסטות (drift).

מכיוון שלומד הזיכרון מאומן בנפרד, מודל הפעולה הראשי נשאר קפוא. המחקר מראה שהפרדה זו עדיין מניבה שיפורים משמעותיים במבחני ביצועים לטווח ארוך (long-horizon benchmarks), מה שמוכיח שתזכורות פרואקטיביות יכולות לפצות על חלון הקשר מוגבל.

מה המספרים אומרים

  • Terminal-Bench 2.0: Sonnet 4.5 ק