ציוני SWE-bench זינקו מ-1.96% ל-72.7% תוך פחות משנתיים, עלייה שכותרות החדשות תיארו כזינוק פי 37 ביכולת התכנות של ה-AI. הכותרת תופסת את תשומת הלב, אך המספרים משווים בין שתי בחינות שונות, ולא שיפור יציב ויחיד במיומנות הנדסת התוכנה.
המספרים הגולמיים
בשנת 2023, ה-SWE-bench המקורי העריך סוכני AI על בסיס 2,294 בעיות (issues) אמיתיות מ-GitHub. המשימות היו תערובת לא אחידה: תיאורים מעורפלים, בדיקות (tests) שבורות, ובעיות רבות שאפילו בן אדם היה מתקשה לפתור. עד שנת 2025, אותו מדד (benchmark) הופיע עם ציון של 72.7%, אך הבדיקה צומצמה לתת-קבוצה "מאומתת" (Verified) של 500 משימות בלבד, שעברו בדיקה אנושית מבחינת בהירות ויכולת פתרון.
איך הבדיקה השתנתה
המעבר מהקטלוג המלא לסט ה-"Verified" הוא השינוי הראשון והגלוי ביותר. האוסף המקורי ניסה לשקף את המציאות הכאוטית של תרומות קוד פתוח — בעיות שאינן שלמות, חסרות תיעוד או פשוט בלתי אפשריות ללא הקשר נוסף. גרסת ה-Verified, לעומת זאת, מסננת במכוון את הכאוס הזה. היא מציגה סט בעיות נקי ונוח יותר, שבו השגת ציונים גבוהים היא ריאלית.
מכיוון ששתי הגרסאות מודדות חלקים שונים ממרחב הבעיות, השוואה ישירה של אחוזים היא מטעה. הנתון של 1.96% משקף ביצועים על עבודה גולמית ולא מסוננת; הנתון של 72.7% משקף ביצועים על מדגם שנבחר בקפידה, שבו סיכויי ההצלחה גבוהים בהרבה.
הנדסה ממוקדת
שינוי שני, מעודן יותר, התרחש באופן שבו מפתחים ניגשו למדד. בשנת 2023, איש לא בנה סוכנים במיוחד כדי להצטיין ב-SWE-bench; הבדיקה שימשה כדגימה אקראית של אתגרי התכנות בעולם. עד שנת 2025, צוותים הפכו את המדד ללוח תוצאות (scoreboard). הם בנו תשתית (scaffolding), אסטרטגיות הנחיה (prompting strategies) וכיוונו מודלים (fine-tuned models) במטרה מפורשת להשיג ציונים גבוהים בסט ה-Verified.
כאשר מהנדסים מתכננים מערכת כדי לעבור בדיקה מסוימת, הציון משקף עד כמה המערכת מתאימה לאותה בדיקה, ולא עד כמה היא בעלת יכולות רחבות. המדד הפסיק להיות דגימה מייצגת של עבודה בעולם האמיתי ברגע שהוא "תוקן" והפך ליעד.
מה הזינוק באמת אומר
השיפור שמשך את הכותרות הוא אמיתי במובן זה שסוכני תכנות נוכחיים מציגים ביצועים טובים משמעותית במשימות ה-Verified מאשר בסט המקורי. השיפור הזה חשוב לתחרויות, מאמרים מחקריים והדגמות מוצר (product demos) המסתמכים על אותו מדד שנבחר בקפידה.
עם זאת, הזינוק לא מוכיח שסוכני AI יכולים כעת להתמודד עם הכאוס של פיתוח תוכנה יומיומי. הסט המקורי של 2,294 הבעיות עדיין קיים, והציונים בגרסה זו נותרו נמוכים.
שאלות שכדאי לשאול
בכל פעם שאתם רואים תנודה עצומה בתוצאות של מדד (benchmark), קחו בחשבון שלושת הבדיקות הללו:
- איזו גרסה מדווחת? המקורית, Lite, או Verified? שמות זהים יכולים להסתיר מאגרי משימות שונים מאוד.
- מה סונן החוצה? הסרת משימות רועשות או בלתי אפשריות מעלה את הרף לכל מערכת; אך היא גם מסירה את האתגרים עצמם שחשובים בסביבת ייצור (production).
- האם המערכת נבנתה כדי לעבור את הבדיקה הספציפית הזו? אם מפתחים כיוונו מודלים או תהליכי עבודה (pipelines) עבור המדד, הציון מודד אופטימיזציה, לא יכולת גולמית.
מבט לעתיד
עד שערבויות כאלה יהפכו לסטנדרט, המדד הטוב ביותר לשימושיות של מתכנת AI יהיה עדיין הביצועים שלו על בעיות כאוטיות מהעולם האמיתי שבהן מפתחים מתמודדים מדי יום.
שורה תחתונה: ציון גבוה יותר במדד "מתוקן" וממוקד אינו מוכיח באופן אוטומטי שסוכני AI מוכנים לכאוס של קוד בעולם האמיתי; המבחן האמיתי נותר הבעיות הלא-מסוננות שמהנדסים נאבקים איתן מדי יום.
