SWE-bench के स्कोर दो साल से भी कम समय में 1.96% से बढ़कर 72.7% हो गए हैं, एक ऐसी वृद्धि जिसे हेडलाइंस ने AI कोडिंग क्षमता में 37 गुना उछाल के रूप में पेश किया है। हेडलाइन ध्यान आकर्षित करती है, लेकिन ये आंकड़े दो अलग-अलग परीक्षाओं की तुलना कर रहे हैं, न कि सॉफ्टवेयर इंजीनियरिंग कौशल में किसी एक निरंतर सुधार की।

वास्तविक आंकड़े

2023 में, मूल SWE-bench ने 2,294 वास्तविक GitHub इश्यूज पर AI एजेंट्स का मूल्यांकन किया था। कार्य काफी अव्यवस्थित थे: अस्पष्ट विवरण, टूटे हुए टेस्ट और ऐसी कई समस्याएं जिन्हें हल करने में एक इंसान को भी संघर्ष करना पड़ता। 2025 तक, उसी बेंचमार्क के नाम के साथ 72.7% का स्कोर दिखाई दिया, लेकिन टेस्ट को केवल 500 कार्यों के एक "Verified" सबसेट तक सीमित कर दिया गया था, जिन्हें मनुष्यों द्वारा स्पष्टता और समाधान क्षमता के लिए जांचा गया था।

टेस्ट कैसे बदला

पूरे कैटलॉग से Verified सेट की ओर बदलाव पहला और सबसे स्पष्ट परिवर्तन है। मूल संग्रह ओपन-सोर्स योगदान की अराजक वास्तविकता को दर्शाने की कोशिश करता था—ऐसे इश्यूज जो अधूरे हैं, जिनका दस्तावेजीकरण खराब है, या अतिरिक्त संदर्भ के बिना जिन्हें हल करना असंभव है। इसके विपरीत, Verified वर्जन जानबूझकर उस अराजकता को फ़िल्टर कर देता है। यह समस्याओं का एक स्वच्छ और अधिक सुलभ सेट पेश करता है जहाँ उच्च स्कोर प्राप्त करना वास्तविक रूप से संभव है।

क्योंकि दोनों वर्जन समस्या क्षेत्र (problem space) के अलग-अलग हिस्सों को मापते हैं, इसलिए सीधे प्रतिशत की तुलना भ्रामक है। 1.96% का आंकड़ा कच्चे, बिना फ़िल्टर किए गए काम पर प्रदर्शन को दर्शाता है; जबकि 72.7% का आंकड़ा एक क्यूरेटेड सैंपल पर प्रदर्शन को दर्शाता है जहाँ सफलता की संभावना कहीं अधिक होती है।

लक्षित इंजीनियरिंग

दूसरा, अधिक सूक्ष्म बदलाव इस बात में आया कि डेवलपर्स बेंचमार्क के प्रति कैसे दृष्टिकोण रखते थे। 2023 में, किसी ने विशेष रूप से SWE-bench में महारत हासिल करने के लिए एजेंट्स नहीं बनाए थे; टेस्ट दुनिया की कोडिंग चुनौतियों के एक रैंडम सैंपल के रूप में कार्य करता था। 2025 तक, टीमों ने बेंचमार्क को एक स्कोरबोर्ड में बदल दिया। उन्होंने Verified सेट पर अच्छा स्कोर करने के स्पष्ट लक्ष्य के साथ स्कैफोल्डिंग, प्रॉम्प्टिंग रणनीतियाँ और फाइन-ट्यून किए गए मॉडल बनाए।

जब इंजीनियर किसी विशेष टेस्ट को पास करने के लिए सिस्टम डिजाइन करते हैं, तो स्कोर यह दर्शाता है कि सिस्टम उस टेस्ट में कितना फिट बैठता है, न कि वह कितना व्यापक रूप से सक्षम है। जिस क्षण बेंचमार्क को "सुधार" दिया गया और उसे एक लक्ष्य में बदल दिया गया, उसी क्षण वह वास्तविक दुनिया के काम का प्रतिनिधि सैंपल नहीं रह गया।

इस उछाल का वास्तव में क्या अर्थ है

हेडलाइन में दिखने वाला सुधार इस मायने में वास्तविक है कि वर्तमान कोडिंग एजेंट्स Verified कार्यों पर मूल सेट की तुलना में नाटकीय रूप से बेहतर प्रदर्शन करते हैं। वह सुधार प्रतियोगिताओं, रिसर्च पेपर्स और प्रोडक्ट डेमो के लिए मायने रखता है जो उसी क्यूरेटेड बेंचमार्क पर निर्भर करते हैं।

हालाँकि, यह उछाल यह साबित नहीं करता कि AI एजेंट्स अब रोज़मर्रा के सॉफ्टवेयर डेवलपमेंट की जटिलताओं को संभाल सकते हैं। मूल 2,294-इश्यू वाला सेट अभी भी मौजूद है, और उस वर्जन पर स्कोर अभी भी कम हैं।

पूछने योग्य प्रश्न

जब भी आप बेंचमार्क परिणामों में बड़ा बदलाव देखें, तो इन तीन जांचों को ध्यान में रखें:

  • किस वर्जन की रिपोर्ट दी जा रही है? ओरिजिनल, लाइट, या वेरिफाइड? एक जैसे नाम बहुत अलग टास्क पूल्स को छिपा सकते हैं।
  • क्या फ़िल्टर किया गया था? शोर वाले या असंभव कार्यों को हटाने से किसी भी सिस्टम की क्षमता (ceiling) बढ़ जाती है; लेकिन यह उन चुनौतियों को भी हटा देता है जो प्रोडक्शन में मायने रखती हैं।
  • क्या सिस्टम को विशेष रूप से इस टेस्ट को पास करने के लिए बनाया गया था? यदि डेवलपर्स ने बेंचमार्क के लिए मॉडल या पाइपलाइनों को ट्यून किया है, तो स्कोर ऑप्टिमाइज़ेशन को मापता है, न कि वास्तविक क्षमता को।

भविष्य की ओर देखते हुए

जब तक ऐसे सुरक्षा उपाय मानक नहीं बन जाते, तब तक AI कोडर की उपयोगिता का सबसे अच्छा पैमाना वास्तविक दुनिया की उन अराजक समस्याओं पर उसका प्रदर्शन होगा जिनका सामना डेवलपर्स को रोज़ाना करना पड़ता है।

निष्कर्ष (Takeaway): एक सुधारे हुए, लक्षित बेंचमार्क पर उच्च स्कोर यह स्वतः सिद्ध नहीं करता कि AI एजेंट्स वास्तविक दुनिया के कोड की जटिलताओं के लिए तैयार हैं; वास्तविक परीक्षण अभी भी वे बिना फ़िल्टर की गई समस्याएं हैं जिनसे इंजीनियर हर दिन जूझते हैं।