SWE-Prime असे दर्शवते की, प्रत्येक यशस्वी 'ट्रॅजेक्टरी' (trajectory) मॉडेलमध्ये फीड करण्याऐवजी, काळजीपूर्वक निवडलेल्या १०% "pass" रनवर प्रशिक्षण दिल्यास अधिक सक्षम AI एजंट्स तयार होतात. यामुळे 'pass' लेबलला एक विश्वसनीय गुणवत्ता फिल्टर मानण्याच्या जुन्या सवयीवर प्रश्नचिन्ह निर्माण झाले आहे.
कोड-जनरेशन किंवा ऑटोमेटेड डीबगिंग एजंट्स तयार करणाऱ्यांसाठी हे निकाल अत्यंत महत्त्वाचे आहेत: अधिक डेटा म्हणजे आपोआप चांगली कामगिरी मिळेलच असे नाही, आणि केवळ 'pass/fail' या द्विमार्गी (binary) फ्लॅगवर अवलंबून राहिल्यामुळे मॉडेल्सना तर्क करण्याऐवजी भरकटणे, निरर्थक टूल कॉल्स (tool calls) वारंवार करणे आणि नशिबावर अवलंबून राहणे असे चुकीचे प्रकार शिकवले जाऊ शकतात.
"pass" फ्लॅगवर विश्वास का ठेवला जात होता
बहुतेक 'reinforcement-learning-from-human-feedback' पाइपलाइनमध्ये, जेव्हा अंतिम निकाल चाचणीच्या निकषांची पूर्तता करतो, तेव्हा इंजिनिअर्स एका 'ट्रॅजेक्टरी'ला—निरीक्षणे, कृती आणि टूल इन्व्होकेशनचा पूर्ण क्रम—"pass" म्हणून लेबल करतात. याचे गृहितक सोपे आहे: जर एजंट यशस्वी झाला असेल, तर त्या संपूर्ण प्रक्रियेत (episode) उपयुक्त वर्तन असलेच पाहिजे. त्यामुळे, मॉडेलने यशाकडे नेणारे पॅटर्न आत्मसात करावेत या आशेने, ते प्रत्येक 'pass' झालेली रन ट्रेनिंग पूलमध्ये टाकतात.
हे गृहितक गेल्या अनेक महिन्यांपासून सॉफ्टवेअर-इंजिनिअरिंग (SWE) एजंट्ससाठी मोठ्या प्रमाणावरील डेटा संकलनाचे मार्गदर्शन करत आहे. याचे तर्कशास्त्र ठोस वाटते: 'pass' म्हणजे एजंटने समस्या सोडवली आहे, म्हणून त्या प्रक्रियेने त्या यशासाठी कारणीभूत ठरलेल्या धोरणांना (policies) अधिक बळ दिले पाहिजे.
SWE-Prime ने काय वेगळे केले
SWE-Prime च्या अभ्यासाने ही पद्धत पूर्णपणे बदलून टाकली. संशोधकांनी कोड-रायटिंग टास्कचा एक मानक बेंचमार्क घेतला आणि यशस्वी रनना दोन गटांत विभागले:
- सर्व pass ट्रॅजेक्टरीज (All pass trajectories) – पारंपारिक ट्रेनिंग सेट, ज्यामध्ये चाचणी पूर्ण करणाऱ्या सर्व एपिसोड्सचा समावेश आहे.
- एक निवडलेला १०% उपसंच (A curated 10% subset) – संपूर्ण संचातून काळजीपूर्वक निवडलेला भाग.
दोन्ही गटांसाठी समान मॉडेल आर्किटेक्चरचा वापर करून 'fine-tuning' करण्यात आले. जेव्हा नवीन (held-out) समस्यांवर त्यांचे मूल्यमापन करण्यात आले, तेव्हा निवडलेल्या १०% उपसंचावर प्रशिक्षित केलेले मॉडेल, पूर्ण 'pass' संचावर प्रशिक्षित केलेल्या मॉडेलपेक्षा अधिक सरस ठरले.
"pass" लेबलला दूषित करणारे पॅटर्न
या अभ्यासात 'pass' फ्लॅगच्या मागे लपलेल्या अनेक वारंवार घडणाऱ्या त्रुटींचे (failure modes) वर्गीकरण करण्यात आले आहे:
- वारंवार टूल स्पॅमिंग (Repeated tool spamming) – एखादा एजंट योग्य आउटपुट मिळवण्यापूर्वी अनेक वेळा तोच कंपायलर (compiler) किंवा लिंटर (linter) वापरू शकतो. अंतिम यश या अकार्यक्षमतेवर पडदा टाकते.
- दीर्घ भरकटणारे टप्पे (Long meandering phases) – एजंट कधीकधी योग्य समाधानापर्यंत पोहोचण्यापूर्वी पाच किंवा अधिक असंबद्ध पायऱ्यांचा अवलंब करतात. जरी तो एपिसोड 'pass' म्हणून संपला तरी, त्या ट्रॅजेक्टरीचा मोठा भाग प्रशिक्षणासाठी उपयुक्त नसतो.
- साध्या चाचण्या (Trivial tests) – काही बेंचमार्क इतके सोपे असतात की एजंट केवळ एका अंदाजाने किंवा त्रुटीचा (loophole) फायदा घेऊन यशस्वी होऊ शकतो. 'pass' लेबल हे खरे तर्कशास्त्र आणि नशीब यातील फरक सांगू शकत नाही.
जेव्हा असे एपिसोड्स पुन्हा ट्रेनिंग लूपमध्ये येतात, तेव्हा मॉडेलला यादृच्छिक भरकटणे आणि टूलचा अतिवापर यांचा यशाशी संबंध जोडायला शिकवले जाते. परिणामी, एजंट "जोपर्यंत काहीतरी काम करत नाही तोपर्यंत प्रयत्न करत राहा" हा चुकीचा नियम (heuristic) अंगीकारतो, जो कार्यक्षमता आणि स्पष्टता (interpretability) आवश्यक असलेल्या प्रोडक्शन-ग्रेड सिस्टम्ससाठी अवांछनीय आहे.
सेगमेंट-स्तरीय गुणवत्ता विरुद्ध ट्रॅजेक्टरी-स्तरीय निकाल
SWE-Prime कडून मिळालेला एक महत्त्वाचा निष्कर्ष म्हणजे ट्रॅजेक्टरीचा एकूण निकाल आणि त्यातील घटक सेगमेंटची (segment) गुणवत्ता यातील फरक. ट्रॅजेक्टरी हे एक ढोबळ लेबल आहे: ते तुम्हाला अंतिम उत्तर बरोबर होते की नाही हे सांगते, परंतु अंतर्गत निर्णय घेण्याची प्रक्रिया लपवून ठेवते. अभ्यासात असे दिसून आले:
- चांगल्या ट्रॅजेक्टरीजमध्ये वाईट सेगमेंट असू शकतात – एक कार्यक्षम उपाय असूनही त्यात काही अनावश्यक पायऱ्या असू शकतात ज्या अंतिम उत्तरात काहीही योगदान देत नाहीत.
- अयशस्वी ट्रॅजेक्टरीजमध्ये उत्कृष्ट सेगमेंट लपलेले असू शकतात – एखादा एजंट एक उत्तम तर्कसंगत योजना तयार करू शकतो, परंतु एखाद्या असंबद्ध त्रुटीमुळे चाचणी अयशस्वी होऊ शकते.
संपूर्ण रनऐवजी सेगमेंटला स्कोअरिंग करून, संशोधकांनी असे एपिसोड्स ठेवले जिथे एजंटने पहिल्या पायरीपासून हेतूने (intent) कृती केली होती आणि बाकीचे काढून टाकले. यामुळे ट्रेनिंग सिग्नल हे अशा तर्कसंगत पॅटर्नशी सुसंगत होते, ज्याचे मॉडेल्सनी अनुकरण करावे अशी आपली इच्छा असते.
खर्च आणि वेगाचे फायदे
केवळ १०% डेटावर प्रशिक्षण दिल्याने संगणकीय खर्च (compute expenses) देखील लक्षणीयरीत्या कमी झाला. टीमला खूप कमी GPU तास लागले आणि पूर्ण 'pass' संचासाठी लागणाऱ्या वेळेच्या तुलनेत हे काम खूप कमी वेळात पूर्ण झाले. हे एक आश्चर्यकारक विरोधाभास आहे: त्यांनी कमी खर्च करून अधिक चांगली कामगिरी साध्य केली. कमी बजेट असलेल्या किंवा मोठ्या प्रमाणावर उपयोजन (deployment) करण्याचे ध्येय असलेल्या संस्थांसाठी ही बचत अत्यंत महत्त्वाची आहे.
क्युरेशनची (Curation) आव्हाने
ही पद्धत स्वीकारण्यातील सर्वात मोठा अडथळा म्हणजे "चांगला सेगमेंट" म्हणजे नक्की काय, हे परिभाषित करणे. SWE-Prime टीमने नमूद केले की, महागड्या 'रिवॉर्ड मॉडेल'शिवाय (reward model) सेगमेंटला स्कोअर करणे कठीण आहे आणि त्यासाठी एका चतुर, हलक्या (lightweight) मेट्रिकची आवश्यकता आहे.
निष्कर्ष
SWE-Prime हे सिद्ध करते की ट्रेनिंग डेटासाठी बायनरी “passed the test” फ्लॅग हा एक अविश्वसनीय फिल्टर आहे. विस्कळीत भाग (meandering episodes), अनावश्यक टूल कॉल्स आणि अत्यंत सोपे रन वगळून, डेव्हलपर्स कम्प्युट खर्च कमी करत अधिक सक्षम आणि कार्यक्षम एजंट्स प्रशिक्षित करू शकतात. धडा स्पष्ट आहे: प्रमाणापेक्षा गुणवत्ता महत्त्वाची आहे, आणि स्मार्ट AI एजंट्सचा मार्ग प्रत्येक पायरी नेमके काय योगदान देते, याच्या सूक्ष्म मूल्यमापनात दडलेला आहे.
