SWE-Prime מראה שאימון על 10% נבחרים בקפידה מתוך הרצות "pass" מייצר סוכני AI חזקים יותר מאשר הזנת כל מסלול (trajectory) מוצלח למודל, מה שמעלה סימן שאלה לגבי ההרגל ארוך השנים להתייחס לתווית "pass" כמסנן איכות אמין.
התוצאה חשובה לכל מי שבנה סוכנים ליצירת קוד או לניפוי שגיאות (debugging) אוטומטי: יותר נתונים לא מתרגמים אוטומטית לביצועים טובים יותר, וההסתמכות הנאיבית על דגל pass/fail בינארי עלולה למעשה ללמד מודלים לשוטט, לחזור על קריאות כלים חסרות תועלת ולהסתמך על מזל במקום על הסקה (reasoning).
מדוע נסמכו על דגל ה-"pass"
ברוב תהליכי ה-reinforcement-learning-from-human-feedback, מהנדסים מתייגים מסלול (trajectory) – רצף מלא של תצפיות, פעולות וקריאות לכלים – כ-"pass" כאשר התוצאה הסופית עומדת בקריטריוני הבדיקה. ההנחה היא פשוטה: אם הסוכן הצליח, כל הפרק (episode) חייב להכיל התנהגות מועילה. לכן, הם דוחפים כל הרצה שעברה לתוך מאגר האימון, בתקווה שהמודל יספוג את התבניות שהובילו להצלחה.
ההנחה הזו הנחתה איסוף נתונים בקנה מידה גדול עבור סוכני הנדסת תוכנה (SWE) במשך חודשים. הלוגיקה נראית מוצקה: pass מעיד על כך שהסוכן פתר את הבעיה, ולכן הפרק אמור לחזק את המדיניות (policies) שגרמה לכך.
מה SWE-Prime עשה אחרת
מחקר SWE-Prime הפך את התמונה. חוקרים לקחו מדד (benchmark) סטנדרטי של משימות כתיבת קוד וחילקו את ההרצות המוצלחות לשתי קבוצות:
- כל מסלולי ה-pass – סט האימון הקונבנציונלי, המכיל כל פרק שעמד בבדיקה.
- תת-קבוצה שנבחרה בקפידה (10%) – נבחרה ידנית מתוך הסט המלא.
שתי הקבוצות עברו fine-tuning לארכיטקטורות מודל זהות. כאשר הוערכו על בעיות שלא נראו קודם (held-out problems), המודל שאומן על תת-הקבוצה שנבחרה בקפידה הציג ביצועים טובים יותר מהמקבילה שלו שאומנה על סט ה-pass המלא.
תבניות שמשבשות תווית "pass"
המחקר תיעד מספר מצבי כשל חוזרים המסתתרים מאחורי דגל pass:
- ספאם כלים חוזרני – סוכן עשוי להקצין שימוש באותו קומפיילר או linter עשרות פעמים לפני שהוא משיג סוף סוף פלט נכון. ההצלחה הסופית מסתירה את חוסר היעילות.
- שלבי שוטטות ארוכים – סוכנים חוקרים לעיתים חמישה שלבים לא רלוונטיים או יותר לפני שהם נתקלים בפתרון הנכון. הפרק עדיין מסתיים ב-pass, אך רוב המסלול אינו מספק ערך לימו
SWE-Prime מדגימה שדגל בינארי של "עבר את הבדיקה" הוא מסנן לא אמין עבור נתוני אימון. על ידי הסרת פרקים חסרי כיוון, קריאות כלים מיותרות והרצות קלות באופן טריוויאלי, מפתחים יכולים לאמן סוכנים מוכשרים ויעילים יותר תוך הפחתת עלויות מחשוב. הלקח ברור: איכות חשובה יותר מכמות, והדרך לסוכני AI חכמים יותר טמונה בהערכה מפורטת של מה כל שלב תורם בפועל.
