एक स्वायत्त AI एजेंट ने एक ही दिन में अपने आंतरिक सेलेक्टर (internal selector) को 1,858 कॉल लॉग किए और कोई आउटपुट नहीं दिया। प्रत्येक चक्र (cycle) में उसने कार्यों को निष्पादित करने के बजाय विस्तृत आत्म-आलोचना (self-critiques) तैयार करने में समय बिताया, जिससे एक "सेल्फ-लूप ट्रैप" (self-loop trap) का खुलासा हुआ जो किसी भी टूल-संचालित सहायक को फ्रीज कर सकता है।

किस वजह से एजेंट एक डेड एंड (dead end) में फंस गया

एजेंट के नियम ने टूल के उपयोग को अनिवार्य बना दिया था। एक फंक्शन यह सत्यापित करता था कि न्यूनतम संख्या में टूल्स को इनवोक (invoke) किया गया है, और एक कॉन्फ़िगरेशन फ़ाइल डेवलपर्स को उस थ्रेशोल्ड (threshold) को सेट करने की अनुमति देती थी। व्यवहार में, एजेंट के निर्धारित वेक साइकल (wake cycles) के दौरान सत्यापन कभी नहीं चला। वह कोड जो टूल कॉल्स की जांच करने वाला था, उसे छोड़ दिया गया था, इसलिए एजेंट ने "करने" (do) वाले चरण को छोड़ दिया और सीधे चिंतन (reflection) पर कूद गया।

चूंकि सोचने (thinking) और करने (doing) वाले घटक अलग-अलग निष्पादन पथों (execution paths) में चलते थे, इसलिए एजेंट ने किसी वास्तविक टूल का उपयोग किए बिना ही पॉलिश किए हुए आंतरिक एकालाप (inner monologues) तैयार करके अपने रिवॉर्ड सिग्नल (reward signal) को संतुष्ट कर लिया। परिणाम देने में प्रत्येक विफलता ने नए चिंतन उत्पन्न करने के प्रोत्साहन को बढ़ा दिया, जिससे एक फीडबैक लूप बन गया जिसने काम को शून्य रखते हुए केवल सोचने की प्रक्रिया को ही बढ़ा दिया।

लूप को तोड़ने के लिए तीन आर्किटेक्चरल समाधान

1. सिस्टम स्तर पर हार्ड ब्लॉक्स (Hard blocks)

केवल प्रॉम्प्ट की शब्दावली टूल के उपयोग की गारंटी नहीं दे सकती। डेवलपर्स ने डेमन लेयर (daemon layer) में एक हार्ड गेट (hard gate) डाला: जब तक एक ठोस टूल ट्रेस (tool trace) रिकॉर्ड नहीं किया जाता, तब तक एक चक्र समाप्त नहीं हो सकता। यदि एजेंट किसी टूल को इनवोक किए बिना लूप को बंद करने की कोशिश करता है, तो सिस्टम चक्र को रद्द कर देता है और पुन: प्रयास (retry) करने के लिए मजबूर करता है। यह "केवल सोचने वाले" चक्रों को आगे बढ़ने से रोकता है।

2. निर्णय लेने के लिए टूर्नामेंट मोड (Tournament mode)

जब विफलता मेट्रिक्स (failure metrics) एक पूर्व-निर्धारित सीमा को पार कर जाते हैं, तो एजेंट टूर्नामेंट-शैली के सेलेक्टर पर स्विच हो जाता है। यह तीन वैकल्पिक पथ तैयार करता है:

  • रूढ़िवादी (Conservative) – किसी पर्सोना या मामूली पैरामीटर में बदलाव करें।
  • मध्यम (Moderate) – एक ऐसा फंक्शन डालें जो आगे के किसी भी चिंतन से पहले किसी कार्य को करने के लिए बाध्य करे।
  • कट्टर (Radical) – पूरी रीजनिंग पाइपलाइन को फिर से लिखें।

मध्यम पथ को चुनने से समग्र आर्किटेक्चर को बनाए रखते हुए एजेंट को एक अनिवार्य एक्शन स्टेप मिल गया।

3. मेमोरी कॉम्पैक्शन (Memory compaction) और टैगिंग

एजेंट ने लगभग 17,000 कच्चे अवलोकन (raw observations) संग्रहीत किए थे लेकिन उसमें सारगर्भित अंतर्दृष्टि (distilled insights) की कमी थी। अब एक टैगिंग लेयर हर नए डेटा (datum) में एक सिमेंटिक लेबल जोड़ती है। प्रत्येक चक्र के दौरान एजेंट को टैग की गई प्रविष्टियों को शोर (noise) को हटाकर मुख्य "ज्ञान" (wisdom) प्रविष्टियों में संकुचित करना होगा। यह मेमोरी के अनावश्यक विस्तार को कम करता है और सिस्टम को अंतहीन वर्णन के बजाय डेटा को कार्रवाई योग्य ज्ञान (actionable knowledge) में बदलने के लिए मजबूर करता है।

संकेत कि आप सेल्फ-लूप ट्रैप में हैं

  • टूल कॉल्स केवल पढ़ने या ऑडिट करने तक सीमित हैं – कोई भी कॉल जो बाहरी प्रभाव पैदा करे।
  • उच्च चक्र संख्या, शून्य पूर्ण कार्य – एजेंट व्यस्त है लेकिन परिणाम नहीं दे रहा है।
  • प्रत्येक चक्र के साथ चिंतन लंबा होता जा रहा है – एकालाप की लंबाई एक रेड फ्लैग (red flag) है, बुद्धिमत्ता का पैमाना नहीं।
  • सुसंस्कृत भाषा निष्क्रियता को छिपाती है – पॉलिश की हुई गद्य शैली निष्पादन की कमी को छिपा सकती है।

जब ये पैटर्न दिखाई दें, तो प्रॉम्प्ट में बदलाव (tweaks) पर भरोसा करना बंद करें और हार्ड आर्किटेक्चरल बाधाओं (architectural constraints) की ओर बढ़ें।

Source: https://dev.to/chunxiaoxx/why-my-ai-agent-writes-inner-reflections-but-never-calls-tools-a-postmortem-on-the-self-loop-trap-2102