כיצד זיכרון מובנה עוזר לסוכני AI לכבוש את Slay the Spire 2
חוקרים פיתחו ארכיטקטורת סוכנים חדשה, AgenticSTS, שעולה בביצועיה על סוכני LLM מסורתיים על ידי החלפת יומני צ'אט נפוחים במערכת זיכרון מובנית ומתוחכבת בעלת חמישה שכבות. על ידי התרחקות ממודל ה-"growing transcript" (תמלול מתרחב), גישה זו מפחיתה משמעותית את עלויות הטוקנים (tokens) תוך שהיא מאפשרת לסוכנים ללמוד אסטרטגיות מורכבות לאורך מספר סבבי משחק.
הבעיה ביומני צ'אט מתרחבים
רוב סוכני ה-LLM הנוכחיים, כגון אלו המשתמשים בפריימוורקים (frameworks) של ReAct או Reflexion, מסתמכים על הוספה של כל תצפית עבר, קריאה לכלי (tool call) ורפלקציה עצמית ליומן טקסט רציף. ככל שהסשן מתקדם, חלון ההקשר (context window) מתרחב עד שהוא גולש או עד שקשב המודל נחלש בשל נתונים היסטוריים לא רלוונטיים.
בבדיקות מול משחק ה-roguelike מבוסס בניית חפיסות המורכב Slay the Spire 2, חוסר היעילות הזה היה בולט לעין. מתחרים כמו STS2MCP ו-CharTyr, המשתמשים בתבנית ה-"growing-transcript" הקלאסית, חוו מצב שבו קריאה בודדת למודל התנפחה לכ-527,000 טוקנים. פגם ארכיטקטוני זה מוביל לעיכוב (latency) עצום ולעלויות טוקנים אסטרונומיות, כאשר המתחרים משתמשים בפי 66 עד 90 יותר טוקנים מ-AgenticSTS כדי להשיג ציונים דומים.
פתרון הזיכרון בעל חמש השכבות
AgenticSTS פותרת את בעיית התנפחות ההקשר על ידי בנייה מחדש של כל פרומפט החלטה מחמישה חריצי זיכרון מאורגנים ונפרדים. זה מבטיח שהפרומפט יישאר רזה – בממוצע סביב 5,000 טוקנים – ללא קשר למשך המשחק. השכבות בנויות כך:
- L1 (Fixed Protocol): הוראות ליבה עבור הסוכן.
- L2 (State Schemas): הגדרות של פעולות תקפות כעת.
- L3 (Retrievable Rules): חוקי משחק ספציפיים שנשלפים לפי הצורך.
- L4 (Episodic Memory): סיכומים של סבבי משחק קודמים כדי לספק הקשר ארוך טווח.
- L5 (Skill Library): חוקים טקטיים המופעלים על ידי דפוסים מצביים ספציפיים.
מודולריות זו מאפשרת לחוקרים להצביע בדיוק על הרכיב שמניע את השיפור בביצועים. לדוגמה, הפעלת ספריית המיומנויות L5 לבדה הכפילה את אחוז הניצחונות של הסוכן מ-3 מתוך 10 משחקים ל-6 מתוך 10 משחקים ברמת הקושי A0.
העלאת רמת הקושי באמצעות למידה
הכוח האמיתי של הגישה המובנית טמון בלמידה בין סבבי משחק (inter-run learning). בעוד שסוכנים סטנדרטיים מתקשים להתקדם מעבר לרמות הקושי הנמוכות ביותר, AgenticSTS מנצלת את שכבות L4 ו-L5 שלה כדי לטפס בסולם הקושי של המשחק. ללא זיכרון פעיל המתעדכן בין סבבים, הסוכן נתקע ברמות A2 עד A4; עם זאת, עם זיכרון שנשמר לאורך סשנים, הוא מגיע בהצלחה לרמות הקשות הרבה יותר, A6 עד A8.
מעניין לציין כי החוקרים מצאו שהזיכרון הזה תלוי מאוד במודל הספציפי. כאשר ערימת זיכרון שנוצרה על ידי Gemini 3.1 Pro הועברה ל-Qwen 3.6-27B, הציון של האחרון עלה ב-84.5%, אך הציון של Deepseek V4-Pro דווקא ירד ב-18.1%. הדבר מרמז כי למרות שזיכרון מובנה הוא עוצמתי, ה"ידע" הכלול בו קשור עמוקות לדפוסי ההסקה (reasoning patterns) של המודל שיצר אותו.
למה זה חשוב לתעשיית ה-AI
ההצלחה של AgenticSTS מסמנת שינוי בעיצוב סוכנים: העתיד של AI אוטונומי טמון לא בחלונות הקשר גדולים יותר, אלא בניהול זיכרון חכם ומובנה יותר. עבור מפתחים הבונים סוכנים הפועלים לאורך זמן, ארכיטקטורה זו מציעה מתווה להפחתת עלויות תפעול ועיכובים (latency), תוך שיפור משמעותי של יכולת המודל לבצע הסקה מורכבת ורב-שלבית.
נקודות מפתח
- שיפור ביעילות: AgenticSTS שומרת על פרומפט עקבי של 5,000 טוקנים, ומשתמשת בפי 90 פחות טוקנים מאשר סוכנים המסתמכים על יומני צ'אט מתרחבים.
- ביצועים משופרים: שימוש ב-"Skill Library" (L5) יכול להכפיל את אחוז הניצחונות של הסוכן ולאפשר התקדמות לרמות קושי גבוהות הרבה יותר באמצעות למידה בין סבבים.
- שינוי ארכיטקטוני: המעבר מתמלולים לא מובנים לזיכרון רב-שכבתי פותר את בעיות דלדול הקשב והעלייה המטאורית בזמן התגובה (latency) של המודל.
