संशोधकांनी Ring-Zero नावाचा एक नवीन रिइन्फोर्समेंट-लर्निंग (reinforcement-learning) फ्रेमवर्क जाहीर केला आहे, जो ट्रिलियन-पॅरामीटर लँग्वेज मॉडेलला टोकन-बजेट मर्यादेत राहून तर्क करण्याची (reasoning) क्षमता शिकवतो. या मॉडेलने 2026 च्या AIME गणित परीक्षेत 84.2% गुण मिळवले आहेत. या निकालावरून असे दिसून येते की, या स्तरावर मॉडेल अशा स्टेप-बाय-स्टेप समस्या सोडवण्याच्या सवयी आत्मसात करू शकते, ज्या इंजिनिअर्सनी पारंपारिकपणे प्रॉम्प्ट्समध्ये (prompts) हार्ड-कोड केलेल्या असतात.

हे महत्त्वाचे का आहे

AIME-स्तरीय कामगिरी हे दीर्घकाळापासून "मानवी-पातळीच्या" (human-level) संख्यात्मक तर्कासाठी (quantitative reasoning) एक बेंचमार्क राहिले आहे. कोणत्याही मानवी-लिखित उदाहरणांशिवाय 84.2% च्या मर्यादेपर्यंत पोहोचणे हे सुचवते की मॉडेलची तर्क करण्याची क्षमता स्वतः ट्रेनिंग डायनॅमिक्समधून (training dynamics) निर्माण होते, केवळ हाताने तयार केलेल्या साच्यांमधून (scaffolds) नाही. AI एजंट्स तयार करणाऱ्या कंपन्यांसाठी याचा अर्थ स्पष्ट आहे: क्लिष्ट प्रॉम्प्ट रेसिपीज लिहिणे आणि मेंटेन करणे याऐवजी, अशा ट्रेनिंग लूपचा वापर केला जाऊ शकतो जो मॉडेलला कधी अधिक सखोल विचार करायचा आणि कधी सोपा शॉर्टकट वापरायचा हे शिकवेल.

प्रॉम्प्ट इंजिनिअरिंगपासून ट्रेनिंग डायनॅमिक्सपर्यंत

अनेक वर्षांपासून, डेव्हलपर्स मोठ्या लँग्वेज मॉडेल्सना मल्टी-स्टेप रिझनिंगसाठी प्रवृत्त करण्यासाठी "समस्येचे भागांमध्ये विभाजन करा" किंवा "तुमच्या उत्तराची पडताळणी करा" यांसारख्या प्रॉम्प्ट टेम्पलेट्सवर अवलंबून होते. हे टेम्पलेट्स बाह्य साचा (scaffolding) म्हणून काम करतात; मॉडेल सूचनांचे पालन करते परंतु ती प्रक्रिया अंतर्गतरीत्या आत्मसात करत नाही. Ring-Zero ही पद्धत पूर्णपणे बदलून टाकते. मॉडेलला कार्य वर्णनासोबतच एक verifiable answer (पडताळण्यायोग्य उत्तर) मिळते—जे एक 'ग्राउंड-ट्रुथ' असते आणि ज्याची आपोआप तपासणी केली जाऊ शकते. त्यानंतर मॉडेल अनेक प्रयत्न करते, आणि जेव्हा एखादा प्रयत्न त्या पडताळण्यायोग्य उत्तराशी जुळतो, तेव्हाच त्याला रिवॉर्ड (reward) मिळतो आणि रिइन्फोर्समेंट लर्निंगद्वारे ते आपली पॉलिसी अपडेट करते.

रिवॉर्ड एका अशा उद्दिष्टाशी जोडलेला असतो ज्यामध्ये फसवणूक करणे कठीण आहे (उत्तर केवळ पटण्यासारखे असून चालणार नाही, तर ते अचूक असावे लागते), त्यामुळे मॉडेल स्वतःहून तर्क करण्याच्या पद्धती (reasoning patterns) शोधून काढते. शोधनिबंधातील असा युक्तिवाद आहे की, एकदा का विश्वसनीय रिवॉर्ड सिग्नल उपलब्ध झाला की, मॉडेलला ट्रिलियन पॅरामीटर्सपर्यंत स्केल केल्यावर, इंजिनिअर्सनी लहान मॉडेल्ससाठी मॅन्युअली वापरलेल्या प्रॉम्प्ट-इंजिनिअरिंगच्या युक्त्या आपोआप समोर येतात.

चार-टप्प्यांची ट्रेनिंग पाइपलाइन

Ring-Zero चे ट्रेनिंग चार वेगवेगळ्या टप्प्यांतून जाते:

  1. First-stage RL – मॉडेल संभाव्य रिझनिंग ट्रेसेस (reasoning traces) शोधते आणि कोणते टोकन सिक्वेन्स अचूक उत्तरांकडे नेतात हे शिकते.
  2. Self-distillation – उच्च-गुणवत्तेचे ट्रेसेस पुन्हा मॉडेलमध्ये प्रवाहित होतात, ज्यामुळे निर्माण होणाऱ्या रिझनिंग पॅटर्नला स्थिरता मिळते.
  3. Second-stage RL – एक अधिक सूक्ष्म लूप (finer-grained loop) आधीच्या सुधारणा कायम ठेवत पॉलिसीला अधिक अचूक बनवतो.
  4. Tiered training – मॉडेल समस्येच्या कठीणतेनुसार लहान (≈2 k tokens) आणि मोठ्या (≈20 k tokens) रिझनिंग पाथ्समध्ये निवड करून टोकन बजेट बुद्धिमानपणे वाटप करायला शिकते.

Tiered training हा प्रत्यक्ष वापरासाठी (production) सर्वात महत्त्वाचा भाग आहे. प्रत्यक्ष उपयोजनांमध्ये (deployments), प्रत्येक अतिरिक्त टोकनमुळे कम्प्युट खर्च वाढतो. एखादी समस्या कधी लहान उत्तरासाठी पुरेशी सोपी आहे आणि कधी ती सखोल, मल्टी-स्टेप विश्लेषणाची मागणी करते, हे ओळखायला मॉडेलला शिकवून, Ring-Zero तर्कणाच्या गुणवत्तेला थेट आर्थिक कार्यक्षमतेशी जोडते.

शिकण्याचे दोन टप्पे: शोध (discovery) आणि धार लावणे (sharpening)

लेखक शिकण्याच्या प्रक्रियेचे दोन टप्प्यांत वर्णन करतात:

  • Discovery – सुरुवातीचे रिइन्फोर्समेंट-लर्निंग टप्पे गोंधळलेले (noisy) असतात; मॉडेल विविध प्रकारच्या रणनीती वापरून पाहते, ज्यातील अनेक अयशस्वी ठरतात. नवीन तर्क मार्ग शोधण्यासाठी ही विविधता आवश्यक आहे.
  • Sharpening – एकदा का एखादा आश्वासक पॅटर्न समोर आला की, नंतरचे RL टप्पे पॉलिसीला अधिक घट्ट करतात, ज्यामुळे विविधता कमी होते आणि वर्तन अधिक स्थिर होते.

ही प्रगती मानवी सुधारणेसारखीच आहे: सुरुवातीला विचारमंथन आणि त्यानंतर सराव. मुख्य बाब म्हणजे, सुरुवातीचा तो "गोंधळलेला" टप्पा दाबून टाकण्याऐवजी स्वीकारला पाहिजे, कारण तो नंतरच्या सुधारणेसाठी कच्चा माल पुरवतो.

काय समस्या येऊ शकतात?

या शोधनिबंधातील आशावाद काही गृहितकांवर अवलंबून आहे ज्यांची तपासणी करणे आवश्यक आहे:

  • Reward design – या फ्रेमवर्कला अशा रिवॉर्डची गरज आहे जो पडताळण्यायोग्य (verifiable) असेल आणि शॉर्टकट वापरण्यास प्रतिबंध करणारा असेल. अनेक वास्तविक जगातील कामांसाठी, असा रिवॉर्ड परिभाषित करणे सोपे नाही आणि त्यासाठी खर्चिक अ‍ॅनोटेशन पाइपलाइन्सची आवश्यकता असू शकते.
  • Environmental bottlenecks – लेखकांच्या मते, मॉडेलची कामगिरी त्याच्या आकाराने मर्यादित नसून सभोवतालच्या इव्हॅल्युएशन इन्फ्रास्ट्रक्चरमुळे (test suites, logs, clear metrics) मर्यादित आहे. ते इन्फ्रास्ट्रक्चर तयार करणे आणि मेंटेन करणे हा एक मोठा इंजिनिअरिंग प्रयत्न असू शकतो.
  • Compute cost of training – अनेक RL टप्प्यांसह ट्रिलियन-पॅरामीटर मॉडेल प्रशिक्षित करणे खर्चिक आहे. Tiered training मुळे इन्फरन्स खर्च कमी होत असला तरी, सुरुवातीचा ट्रेनिंग बजेट जास्त राहतो, ज्यामुळे हा दृष्टिकोन केवळ मोठ्या निधी असलेल्या लॅब्सपुरता मर्यादित राहू शकतो.

पुढे काय पाहावे

AI व्यावसायिकांसाठी व्यावहारिक महत्त्वाचे मुद्दे

  • प्रॉम्प्ट्सना (prompts) एकमेव साधन समजू नका – तुम्ही प्रॉम्प्ट्समध्ये जे वर्तन (behavior) कोड करत आहात, ते रिवॉर्ड-ड्रिव्हन ट्रेनिंग लूपद्वारे (reward-driven training loop) शिकता येईल का, याचा विचार करा.
  • टोकन वापर (token usage) हे एक प्रमुख उद्दिष्ट बनवा – सुरुवातीलाच बजेट-जागरूक संकेत (budget-aware signals) जोडा; मॉडेल अचूकता आणि कॉम्प्युट खर्च (compute cost) यांचा समतोल राखायला शिकेल.
  • फीडबॅक लूप (feedback loop) पूर्ण करा – अशी प्रणाली तैनात करा जी स्वयंचलितपणे कार्ये पुरवते, पडताळण्यायोग्य उत्तरांच्या आधारे निकालांचे मोजमाप करते आणि निकाल पुन्हा प्रशिक्षणात (training) फीड करते. या लूपमुळेच मॉडेल स्वतःची कार्यपद्धती (workflow) शोधू शकते.

जेव्हा रिवॉर्ड स्पष्ट असतो आणि वातावरण यशाचे विश्वसनीयपणे मोजमाप करू शकते, तेव्हा मॉडेलचे स्केलिंग करणे म्हणजे केवळ क्षमता वाढवणे नव्हे—तर ते मॉडेलला कसे विचार करावे हे निवडण्यास शिकवते. हँड-रिटन स्कॅफोल्डिंगकडून (hand-written scaffolding) स्वयंचलित तर्कशक्तीकडे (self-directed reasoning) होणारे हे संक्रमण आपण AI एजंट्स कसे तयार करतो आणि त्यांची किंमत कशी ठरवतो, याचे स्वरूप बदलू शकते.