השיטה החדשה של ABSeeker, "Answer-Backtracked Credit Assignment" (ABC), מאפשרת לסוכני חיפוש בעלי אופק ארוך לצבור קרדיט על כל שלב בודד במקום רק על התשובה הסופית, ומודל בעל 4 מיליארד פרמטרים שאומן באמצעותה כבר יכול להשתוות למתחרים גדולים בהרבה או אף לעקוף אותם.
הפריצת דרך הזו חשובה מכיוון שרוב הסוכנים הקיימים נשפטים על ידי התוצאה בסוף המשימה בלבד. אם התשובה הסופית נכונה, כל הריצה מסומנת כטובה; אם היא שגויה, כל הרצף מסומן כגרוע. המשוב הזה, שהוא מסוג "הכל או כלום", מסתיר את אותות הלמידה האמיתיים — מהלכים טובים שבמקרה הגיע אחריהם טעות, או לחיצות חסרות תועלת שהובילו למזל לתוצאה הנכונה. הגישה של ABSeeker כותבת מחדש את חוקי המשחק.
מדוע הגישה הישנה אינה מספיקה
כאשר סוכן מבצע חיפוש, כותב קוד או אוסף ראיות, הוא בדרך כלל מבצע פעולות רבות: שליחת שאילתות, פתיחת דפים, הרצת פקודות, בדיקת מצב המערכת וכן הלאה. בריצה בת חמישה עשר שלבים, צעד שגוי אחד עלול להכשיל את התשובה הסופית, למרות שהשלבים שקדמו לו היו תקינים. לעומת זאת, ריצה שמסתיימת בתשובה הנכונה עשויה הייתה להסתמך על מזל, כשרוב השלבים לא הוסיפו שום ערך. אימון על התוצאה הסופית בלבד מאלץ את המודל להתייחס לכל המסלול כאל "קופסה שחורה" אחת, מה שמקשה עליו ללמוד אילו התנהגויות משנה הן באמת מועילות.
המצב הזה משקף את תהליך ניפוי השגיאות (debugging) בהנדסת תוכנה. מפתחים עוקבים אחרי כל שורה, מבודדים את הקריאה שנכשלה ומתקנים אותה. סוכנים, לעומת זאת, לא קיבלו "קבלה" (receipt) דומה של עבודתם הפנימית. ללא עקבות ביקורת כאלה, מפתחים אינם יכולים לדעת אם שיפור נובע משיפור בחשיבה או מסתם מזל, והם אינם יכולים לתקן הרגלים רעים באופן שיטתי.
כיצד ABC משנה את אופן הקצאת הקרדיט
שיטת Answer-Backtracked Credit Assignment עובדת לאחור מהתשובה הסופית הנכונה. תחילה היא מחלצת את הרמזים החיוניים שעליהם תלויה התשובה — פיסות ראיות ספציפיות, תוצאות ביניים או
Answer-Backtracked Credit Assignment משנה את כללי המשחק באופן שבו אנו מלמדים סוכנים לחפש, לתכנת ולהסיק מסקנות. על ידי מתגמול המהלכים הנכונים לאורך הדרך במקום רק את היעד הסופי, השיטה מאפשרת למודל בגודל צנוע ללמוד ביעילות דומה למודלים גדולים בהרבה. עבור כל מי שמפתח סוכנים הנדרשים לבצע עבודה רב-שלבית, אימוץ משטר אימון מבוסס-trace (trace-centric) אינו אופציונלי — זוהי הדרך לבינה מלאכותית אמינה, ניתנת לביקורת, ובסופו של דבר חכמה יותר.
