SEED पेपर के लेखकों ने एक ऐसी विधि का अनावरण किया है जो reinforcement-learning (RL) एजेंटों को अपने स्वयं के विफलता लॉग (failure logs) को नए प्रशिक्षण डेटा (training data) में बदलने की अनुमति देती है। यह ALFWorld बेंचमार्क पर औसत स्कोर को बढ़ाकर 91.8 कर देता है और प्रशिक्षण डेटा की मात्रा को लगभग 40% कम कर देता है। यही तकनीक उन कार्यों पर 15.3 अंकों की वृद्धि करती है जिन्हें एजेंटों ने पहले कभी नहीं देखा है, जो यह साबित करता है कि एक मॉडल बिना किसी अतिरिक्त मानव-लिखित पर्यवेक्षण (supervision) के अपनी गलतियों से सीख सकता है।

RL एजेंटों को पास/फेल फ्लैग से अधिक की आवश्यकता क्यों होती है

विशिष्ट RL सेटअप में एजेंट को केवल एक लंबे एपिसोड के अंत में पुरस्कृत किया जाता है। सिग्नल सिस्टम को बताता है कि परिणाम गलत था, लेकिन यह इस बारे में कुछ नहीं कहता कि त्रुटि कहाँ हुई। यदि दस कदम पहले कोई गलती हुई थी—शायद कोई गलत सर्च टर्म दिया गया था या कोई गलत फ़ाइल खोली गई थी—तो अंतिम बाइनरी सिग्नल सभी मध्यवर्ती जानकारी को हटा देता है। इस नुकसान के कारण शोधकर्ताओं को विफलता की ओर ले जाने वाले दुर्लभ पैटर्न को समझने के लिए बड़ी संख्या में एपिसोड एकत्र करने पड़ते हैं।

SEED फीडबैक लूप को कैसे बदलता है

SEED (Self-Evolving On-Policy Distillation) प्रत्येक एपिसोड के बाद एक दूसरा लर्निंग पास जोड़ता है:

  1. कार्य पूरा करें – एजेंट कार्य पूरा करता है, और सामान्य सफलता/विफलता लेबल प्राप्त करता है।
  2. अपना स्वयं का ट्रांसक्रिप्ट पढ़ें – कार्यों, अवलोकनों और मध्यवर्ती निर्णयों के अनुक्रम को मॉडल को वापस दिया जाता है।
  3. प्राकृतिक भाषा में सबक लिखें – मॉडल छोटे वाक्य उत्पन्न करता है जो बताते हैं कि क्या गलत हुआ, जैसे, "सर्च टर्म 'X' ने अप्रासंगिक परिणाम दिए" या "'Z' के बजाय फ़ाइल 'Y' खोली गई"।
  4. सबकों को पॉलिसी अपडेट में डिस्टिल करें – वे वाक्य एक नए on-policy distillation चरण के लिए लक्ष्य बन जाते हैं, जो मॉडल को सुधार के पीछे के तर्क को सिखाते हैं।

उत्पन्न सबक इन्फरेंस टाइम (inference time) पर उपयोग किए जाने वाले प्रॉम्प्ट नहीं हैं; वे आंतरिक प्रशिक्षण सिग्नल हैं जो पॉलिसी को नया आकार देते हैं। प्रभावी रूप से, एजेंट अपना स्वयं का शिक्षक बन जाता है, जो कच्चे विफलता लॉग को संरचित ज्ञान में बदल देता है।

क्या इस दृष्टिकोण को मेमोरी ट्रिक्स की तुलना में अधिक कुशल बनाता है

एक सामान्य समाधान एक बाहरी मेमोरी बफर (memory buffer) जोड़ना है जो बाद में याद करने के लिए उल्लेखनीय अवस्थाओं या नोट्स को संग्रहीत करता है। वह रणनीति एक विस्तृत "फाइलिंग कैबिनेट" बनाती है जहाँ एजेंट को सही समय पर सही जानकारी प्राप्त करना सीखना होगा—एक गैर-मामूली समस्या जो ओवरहेड बढ़ाती है और क्रिया और परिणाम के बीच कारण संबंध (causal link) को फिर भी मिस कर सकती है।

SEED रिट्रीवल (retrieval) की समस्या से बचता है। डिस्टिलेशन के माध्यम से सबक को सीधे पॉलिसी में शामिल करके, एजेंट सुधार को बाद में देखने के लिए एक नोट के बजाय एक कौशल के रूप में आत्मसात कर लेता है। इसका परिणाम त्रुटि का पता लगाने और व्यवहार परिवर्तन के बीच एक मजबूत लूप है।

महत्वपूर्ण आंकड़े

  • ALFWorld बेंचमार्क – 91.8 का औसत स्कोर, जो उसी वातावरण का उपयोग करने वाले पारंपरिक RL बेसलाइन को पछाड़ देता है।
  • डेटा दक्षता – लगभग 40% कम प्रशिक्षण एपिसोड के साथ समान या बेहतर प्रदर्शन प्राप्त करता है।
  • सामान्यीकरण (Generalization) – अनदेखे कार्यों पर, यह विधि मानक RL की तुलना में 15.3 अंक जोड़ती है, जो यह संकेत देती है कि स्व-जनित सबक हस्तांतरणीय तर्क पैटर्न (transferable reasoning patterns) को कैप्चर करते हैं।

ये आंकड़े बताते हैं कि SEED जटिल एजेंटों के प्रशिक्षण के लिए कम्प्यूटेशनल और डेटा बजट को कम कर सकता है, जो उन टीमों के लिए एक वरदान है जिनके पास बड़े सिमुलेशन संसाधन नहीं हैं।

जोखिम और सीमाएं

यह तकनीक मॉडल की अपने स्वयं के अनुभव को सही ढंग से व्याख्या करने की क्षमता पर निर्भर करती है। यदि एजेंट पर्यावरण को गलत पढ़ता है—उदाहरण के लिए, विफलता का कारण गलत बताता है—तो वह आत्मविश्वास के साथ गलत सबक दे सकता है। ऐसे भ्रमित करने वाले (hallucinated) सुझावों पर प्रशिक्षण खराब आदतों को मजबूत कर सकता है। लेखक बताते हैं कि यह मानव पोस्टमॉर्टम के समान है, जहाँ विश्लेषक कभी-कभी बहुत अधिक व्यवस्थित स्पष्टीकरण तैयार करते हैं जो गहरी समस्याओं को छिपा देते हैं।

आगे क्या देखें

  • मौजूदा RL पाइपलाइनों के साथ एकीकरण – क्योंकि SEED केवल एक पोस्ट-एपिसोड प्रोसेसिंग स्टेप जोड़ता है, इसे मामूली इंजीनियरिंग प्रयास के साथ कई मौजूदा प्रशिक्षण लूप में डाला जा सकता है।

RL एजेंट बनाने वाले डेवलपर्स को एपिसोड लॉग को केवल आर्काइवल डेटा से अधिक मानना शुरू कर देना चाहिए। प्रत्येक रन के बाद, सिस्टम से निम्नलिखित चीजें सामने लाने के लिए कहें:

  • वह निर्णय जिसने कार्य को सबसे अधिक आगे बढ़ाया।
  • वह धारणा (assumption) जिसके कारण चरणों की सबसे बड़ी बर्बादी हुई।
  • एक सरल जाँच जो त्रुटि को पहले पकड़ सकती थी।

उन नोट्स को ad-hoc प्रॉम्प्ट के रूप में वापस फीड करने के बजाय, उन्हें SEED द्वारा प्रस्तावित डिस्टिलेशन चरण में फीड करें। इसका लाभ स्पष्ट है: बेहतर प्रदर्शन, कम डेटा, और एक ऐसा मॉडल जो अपनी गलतियों को समझाना सीखता है।

निष्कर्ष: विफलता के ट्रांसक्रिप्ट्स को स्वयं-निर्मित सीख में बदलना विरल रिवॉर्ड फीडबैक को एक समृद्ध, पुन: प्रयोज्य प्रशिक्षण संकेत में बदल सकता है, जो तेज़ और अधिक डेटा-कुशल RL के लिए एक व्यावहारिक मार्ग प्रदान करता है।