शोधकर्ताओं ने Ring-Zero नामक एक नए रीइन्फोर्समेंट-लर्निंग (reinforcement-learning) फ्रेमवर्क की घोषणा की है जो एक ट्रिलियन-पैरामीटर वाले लैंग्वेज मॉडल को टोकन-बजट सीमाओं के भीतर रहते हुए तर्क करना (reasoning) सिखाता है, और मॉडल ने 2026 AIME गणित परीक्षा में 84.2% अंक प्राप्त किए। यह परिणाम दर्शाता है कि इस स्तर पर, मॉडल उन चरण-दर-चरण समस्या-समाधान की आदतों को अपना सकता है जिन्हें इंजीनियर पारंपरिक रूप से प्रॉम्प्ट्स (prompts) में हार्ड-कोड करते रहे हैं।
यह क्यों महत्वपूर्ण है
AIME-स्तर का प्रदर्शन लंबे समय से "मानव-स्तर" के मात्रात्मक तर्क (quantitative reasoning) के लिए एक बेंचमार्क रहा है। बिना किसी मानव-लिखित उदाहरण के 84.2% की सीमा तक पहुँचना यह सुझाव देता है कि मॉडल की तर्क करने की क्षमताएँ स्वयं प्रशिक्षण की गतिशीलता (training dynamics) से उभरती हैं, न कि हाथ से तैयार किए गए स्कैफोल्ड्स (scaffolds) से। AI एजेंट बनाने वाली कंपनियों के लिए इसका निहितार्थ स्पष्ट है: विस्तृत प्रॉम्प्ट रेसिपी लिखने और उन्हें बनाए रखने के बजाय, एक ऐसे ट्रेनिंग लूप का उपयोग किया जा सकता है जो मॉडल को यह सिखाता है कि कब अधिक गहराई से सोचना है और कब एक सस्ता शॉर्टकट काम कर जाएगा।
प्रॉम्प्ट इंजीनियरिंग से ट्रेनिंग डायनेमिक्स तक
वर्षों से, डेवलपर्स बड़े लैंग्वेज मॉडल्स को मल्टी-स्टेप रीजनिंग के लिए प्रेरित करने हेतु "समस्या को भागों में तोड़ें" या "अपने उत्तर की जाँच करें" जैसे प्रॉम्प्ट टेम्पलेट्स पर निर्भर रहे हैं। वे टेम्पलेट्स बाहरी स्कैफोल्डिंग के रूप में कार्य करते हैं; मॉडल निर्देशों का पालन तो करता है लेकिन प्रक्रिया को आत्मसात (internalize) नहीं करता है। Ring-Zero इस प्रतिमान (paradigm) को बदल देता है। मॉडल को एक कार्य विवरण के साथ एक सत्यापन योग्य उत्तर (verifiable answer) प्राप्त होता है—एक ऐसा ग्राउंड-ट्रुथ जिसे स्वचालित रूप से जांचा जा सकता है। इसके बाद यह प्रयासों की एक श्रृंखला उत्पन्न करता है, और केवल तभी रिवॉर्ड (reward) प्राप्त करता है जब प्रयास सत्यापन योग्य उत्तर से मेल खाता है, और रीइन्फोर्समेंट लर्निंग के माध्यम से अपनी पॉलिसी को अपडेट करता है।
क्योंकि रिवॉर्ड एक ऐसे उद्देश्य से जुड़ा है जिसे धोखा देना कठिन है (उत्तर केवल विश्वसनीय ही नहीं, बल्कि सही भी होना चाहिए), मॉडल स्वयं ही तर्क करने के पैटर्न खोज लेता है। पेपर का तर्क है कि एक बार विश्वसनीय रिवॉर्ड सिग्नल स्थापित हो जाने के बाद, मॉडल को ट्रिलियन पैरामीटर्स तक स्केल करना स्वचालित रूप से उन प्रॉम्प्ट-इंजीनियरिंग ट्रिक्स को सामने लाता है जिन्हें इंजीनियरों ने छोटे मॉडल्स के लिए मैन्युअल रूप से डाला था।
चार-चरणीय प्रशिक्षण पाइपलाइन
Ring-Zero का प्रशिक्षण चार अलग-अलग चरणों के माध्यम से आगे बढ़ता है:
- प्रथम-चरण RL – मॉडल संभावित रीजनिंग ट्रेसेस (reasoning traces) का पता लगाता है, यह सीखता है कि कौन से टोकन अनुक्रम सही उत्तरों की ओर ले जाते हैं।
- सेल्फ-डिस्टिलेशन (Self-distillation) – उच्च-गुणवत्ता वाले ट्रेसेस वापस मॉडल में प्रवाहित होते हैं, जिससे उभरते हुए रीजनिंग पैटर्न स्थिर होते हैं।
- द्वितीय-चरण RL – एक सूक्ष्म लूप (finer-grained loop) पिछले सुधारों को बनाए रखते हुए पॉलिसी को परिष्कृत करता है।
- टियर्ड ट्रेनिंग (Tiered training) – मॉडल बुद्धिमानी से टोकन बजट आवंटित करना सीखता है, समस्या की कठिनाई के आधार पर छोटे (≈2k टोकन) और लंबे (≈20k टोकन) रीजनिंग पथों के बीच चयन करता है।
टियर्ड ट्रेनिंग सबसे अधिक प्रोडक्शन-प्रासंगिक हिस्सा है। वास्तविक तैनाती (deployments) में, प्रत्येक अतिरिक्त टोकन कंप्यूट लागत बढ़ाता है। मॉडल को यह सिखाकर कि कब कोई समस्या छोटे उत्तर के लिए पर्याप्त सरल है और कब इसके लिए गहन, बहु-चरणीय विश्लेषण की आवश्यकता है, Ring-Zero तर्क की गुणवत्ता को सीधे आर्थिक दक्षता से जोड़ता है।
सीखने के दो चरण: खोज और निखार
लेखक सीखने की प्रक्रिया को दो चरणों वाली प्रक्रिया के रूप में वर्णित करते हैं:
- खोज (Discovery) – शुरुआती रीइन्फोर्समेंट-लर्निंग चरण शोर-शराबे वाले (noisy) होते हैं; मॉडल विभिन्न प्रकार की रणनीतियों को आजमाता है, जिनमें से कई विफल हो जाती हैं। नए रीजनिंग पथों को खोजने के लिए यह भिन्नता (variance) आवश्यक है।
- निखार (Sharpening) – एक बार जब कोई आशाजनक पैटर्न सामने आता है, तो बाद के RL चरण पॉलिसी को कड़ा करते हैं, जिससे भिन्नता कम होती है और व्यवहार सुदृढ़ होता है।
यह प्रगति इस बात को दर्शाती है कि इंसान कैसे सुधार करते हैं: पहले विचार-मंथन (brainstorming) और उसके बाद केंद्रित अभ्यास। मुख्य अंतर्दृष्टि यह है कि "अव्यवस्थित" शुरुआती चरण को दबाने के बजाय अपनाना चाहिए, क्योंकि यह बाद के शोधन (refinement) के लिए कच्चा माल प्रदान करता है।
क्या गलत हो सकता है?
पेपर का आशावाद कुछ मान्यताओं पर टिका है जो जांच का विषय हैं:
- रिवॉर्ड डिज़ाइन – फ्रेमवर्क को ऐसे रिवॉर्ड की आवश्यकता है जो सत्यापन योग्य भी हो और शॉर्टकट से बचने में भी सक्षम हो। कई वास्तविक दुनिया के कार्यों के लिए, ऐसे रिवॉर्ड को परिभाषित करना आसान नहीं है और इसके लिए महंगी एनोटेशन पाइपलाइनों की आवश्यकता हो सकती है।
- पर्यावरणीय बाधाएं (Environmental bottlenecks) – लेखक बताते हैं कि मॉडल का प्रदर्शन उसके आकार से नहीं, बल्कि आसपास के मूल्यांकन बुनियादी ढांचे (टेस्ट सुइट्स, लॉग्स, स्पष्ट मेट्रिक्स) द्वारा सीमित है। उस बुनियादी ढांचे का निर्माण और रखरखाव करना एक बड़ा इंजीनियरिंग प्रयास हो सकता है।
- प्रशिक्षण की कंप्यूट लागत – कई RL चरणों के साथ एक ट्रिलियन-पैरामीटर मॉडल को प्रशिक्षित करना महंगा है। हालांकि टियर्ड ट्रेनिंग इन्फरेंस (inference) लागत को कम करती है, लेकिन शुरुआती प्रशिक्षण बजट उच्च बना रहता है, जो संभावित रूप से इस दृष्टिकोण को केवल अच्छी तरह से वित्त पोषित लैब्स तक ही सीमित कर सकता है।
आगे क्या देखें
AI विशेषज्ञों के लिए व्यावहारिक निष्कर्ष
- प्रॉम्प्ट्स को एकमात्र लीवर न समझें – यह विचार करें कि क्या वह व्यवहार जिसे आप प्रॉम्प्ट्स में कोड कर रहे हैं, उसे रिवॉर्ड-संचालित ट्रेनिंग लूप के माध्यम से सीखा जा सकता है।
- टोकन उपयोग को एक प्राथमिक उद्देश्य बनाएं – शुरुआत में ही बजट-जागरूक संकेत जोड़ें; मॉडल सटीकता और कंप्यूट लागत के बीच संतुलन बनाना सीख जाएगा।
- फीडबैक लूप को पूरा करें – एक ऐसी प्रणाली तैनात करें जो स्वचालित रूप से कार्य प्रदान करे, सत्यापन योग्य उत्तरों के विरुद्ध परिणामों को मापे, और परिणामों को वापस ट्रेनिंग में फीड करे। यही वह लूप है जहाँ मॉडल अपना स्वयं का वर्कफ़्लो खोजता है।
जब रिवॉर्ड स्पष्ट हो और वातावरण सफलता को विश्वसनीय रूप से माप सके, तो मॉडल को स्केल करने से केवल क्षमता ही नहीं बढ़ती—बल्कि यह मॉडल को यह चुनना सिखाता है कि उसे कैसे सोचना है। हस्तलिखित स्कैफोल्डिंग से स्व-निर्देशित तर्क की ओर यह बदलाव AI एजेंट्स को बनाने और उनकी कीमत तय करने के तरीके को नया रूप दे सकता है।
