दोन वर्षांपेक्षा कमी कालावधीत SWE-bench चे स्कोअर १.९६% वरून ७२.७% पर्यंत वाढले आहेत, ज्याला हेडलाईन्सनी AI कोडिंग क्षमतेमध्ये ३७ पटीने झालेली झेप असे संबोधले आहे. ही हेडलाईन लक्ष वेधून घेणारी आहे, परंतु हे आकडे दोन वेगवेगळ्या परीक्षांची तुलना करतात, सॉफ्टवेअर-इंजिनिअरिंग कौशल्यातील एकाच, सातत्यपूर्ण सुधारणेची नाही.
मूळ आकडेवारी
२०२३ मध्ये मूळ SWE-bench ने २,२९४ खऱ्या GitHub इश्यूजवर (issues) AI एजंट्सचे मूल्यमापन केले होते. ही कामे विस्कळीत होती: अस्पष्ट वर्णन, तुटलेले टेस्ट्स आणि अशा अनेक समस्या ज्या सोडवण्यासाठी मानवालाही संघर्ष करावा लागला असता. २०२५ पर्यंत त्याच बेंचमार्कच्या नावाने ७२.७% स्कोअर दिसून आला, परंतु ही चाचणी केवळ ५०० कामांच्या "Verified" (पडताळणी केलेल्या) उपसमूहापर्यंत मर्यादित करण्यात आली होती, ज्यांची स्पष्टता आणि सोडवण्यायोग्यतेसाठी मानवांनी पडताळणी केली होती.
चाचणीमध्ये काय बदल झाले
पूर्ण कॅटलॉगमधून 'Verified' संचाकडे झालेला बदल हा पहिला आणि सर्वात स्पष्ट बदल आहे. मूळ संच ओपन-सोर्स योगदानातील गोंधळलेली वास्तवता दर्शवण्याचा प्रयत्न करत होता—असे इश्यू जे अपूर्ण आहेत, ज्यांचे दस्तऐवजीकरण (documentation) खराब आहे किंवा अतिरिक्त संदर्भाशिवाय सोडवणे केवळ अशक्य आहे. याउलट, 'Verified' आवृत्तीने तो गोंधळ हेतुपुरस्सर गाळून टाकला आहे. ती अधिक स्वच्छ आणि सुलभ समस्यांची मालिका सादर करते जिथे उच्च स्कोअर मिळवणे वास्तववादीदृष्ट्या शक्य आहे.
या दोन आवृत्त्या समस्यांच्या क्षेत्रातील (problem space) वेगवेगळ्या भागांचे मोजमाप करत असल्यामुळे, थेट टक्केवारीची तुलना दिशाभूल करणारी ठरते. १.९६% ही आकडेवारी कच्च्या, अनफिल्टर्ड कामावरील कामगिरी दर्शवते; तर ७२.७% ही आकडेवारी एका निवडक नमुन्यावरील कामगिरी दर्शवते जिथे यशाची शक्यता खूप जास्त आहे.
लक्ष्यित इंजिनिअरिंग
दुसरा, अधिक सूक्ष्म बदल डेव्हलपर्सनी बेंचमार्ककडे पाहण्याच्या दृष्टिकोनात झाला. २०२३ मध्ये, SWE-bench मध्ये उत्तम कामगिरी करण्यासाठी कोणीही विशेषतः एजंट्स तयार केले नव्हते; ही चाचणी जगातील कोडिंग आव्हानांचा एक यादृच्छिक (random) नमुना म्हणून काम करत होती. २०२५ पर्यंत, टीम्सनी या बेंचमार्कचे रूपांतर एका स्कोअरबोर्डमध्ये केले. त्यांनी 'Verified' संचावर चांगले स्कोअर मिळवण्याच्या स्पष्ट उद्दिष्टाने स्कॅफोल्डिंग (scaffolding), प्रॉम्प्टिंग स्ट्रॅटेजीज आणि फाईन-ट्यून केलेले मॉडेल्स तयार केले.
जेव्हा इंजिनिअर्स एखादी विशिष्ट चाचणी उत्तीर्ण होण्यासाठी सिस्टम डिझाइन करतात, तेव्हा तो स्कोअर सिस्टम किती व्यापकपणे सक्षम आहे हे दर्शवत नाही, तर ती सिस्टम त्या चाचणीमध्ये किती चांगल्या प्रकारे बसते हे दर्शवतो. बेंचमार्क ज्या क्षणी "दुरुस्त" करून एक लक्ष्य बनवण्यात आला, त्याच क्षणी तो वास्तविक जगातील कामाचा प्रतिनिधी नमुना राहिला नाही.
या झेपचा खरा अर्थ काय आहे
हेडलाईनमध्ये दिसणारी ही सुधारणा या अर्थाने खरी आहे की, सध्याचे कोडिंग एजंट्स मूळ संचापेक्षा 'Verified' कामांवर लक्षणीयरीत्या चांगली कामगिरी करतात. ही सुधारणा स्पर्धा, संशोधन पेपर्स आणि प्रॉडक्ट डेमोसाठी महत्त्वाची आहे जे याच निवडक बेंचमार्कवर अवलंबून असतात.
तथापि, ही झेप आता AI एजंट्स दैनंदिन सॉफ्टवेअर डेव्हलपमेंटमधील गुंतागुंत हाताळू शकतात हे सिद्ध करत नाही. मूळ २,२९४ इश्यूंचा संच अजूनही अस्तित्वात आहे आणि त्या आवृत्तीवरील स्कोअर अजूनही कमी आहेत.
विचारण्यासारखे प्रश्न
जेव्हा जेव्हा तुम्ही बेंचमार्क निकालांमध्ये मोठी वाढ पाहता, तेव्हा या तीन गोष्टी लक्षात ठेवा:
- कोणत्या आवृत्तीचा अहवाल दिला जात आहे? मूळ (Original), लाईट (Lite) की व्हेरिफाईड (Verified)? सारखीच नावे खूप वेगळ्या टास्क पूल्सना लपवू शकतात.
- काय गाळून टाकण्यात आले आहे? गोंधळात टाकणारे किंवा अशक्य टास्क काढून टाकल्यामुळे कोणत्याही सिस्टमची क्षमता वाढते; परंतु यामुळे प्रत्यक्ष कामात (production) महत्त्वाच्या असलेल्या आव्हानांनाही वगळले जाते.
- ही सिस्टम विशेषतः ही चाचणी उत्तीर्ण होण्यासाठी बनवली होती का? जर डेव्हलपर्सनी बेंचमार्कसाठी मॉडेल्स किंवा पाइपलाइन्स ट्यून केल्या असतील, तर तो स्कोअर केवळ ऑप्टिमायझेशन मोजतो, मूळ क्षमता नाही.
भविष्यातील वाटचाल
जोपर्यंत अशा सुरक्षा उपाययोजना (safeguards) प्रमाणित होत नाहीत, तोपर्यंत AI कोडरच्या उपयुक्ततेचे सर्वोत्तम मोजमाप हे डेव्हलपर्सना दररोज भेडसावणाऱ्या गोंधळलेल्या, वास्तविक जगातील समस्यांवरील त्याच्या कामगिरीवरूनच केले जाईल.
निष्कर्ष (Takeaway): सुधारित आणि लक्ष्यित बेंचमार्कवरील उच्च स्कोअर म्हणजे AI एजंट्स वास्तविक जगातील कोडच्या गुंतागुंतीसाठी तयार आहेत, असा त्याचा आपोआप अर्थ होत नाही; खरी कसोटी अजूनही इंजिनिअर्सना दररोज ज्या अनफिल्टर्ड समस्यांशी लढावे लागते, त्यावरच अवलंबून आहे.
