Meta AI ने एक ड्यूल-एजेंट मेमोरी सिस्टम (dual-agent memory system) का अनावरण किया है जो कमांड-लाइन बेंचमार्क पर स्वायत्त AI सहायकों (autonomous AI assistants) की सफलता दर को 38% से बढ़ाकर 46% और मल्टी-डोमेन कन्वर्सेशनल बेंचमार्क पर 55% से बढ़ाकर 62% कर देता है। यह उछाल एक अपरिवर्तित "एक्शन" मॉडल को एक समर्पित "मेमोरी" कोच के साथ जोड़ने से आता है जो कार्य के हालिया चरणों पर नज़र रखता है और केवल तभी हस्तक्षेप करता है जब संदर्भ (context) खोने का खतरा हो।

लंबे समय तक चलने वाले AI कार्यों में छिपी खामी

जब कोई लैंग्वेज मॉडल किसी बहु-चरणीय (multi-step) समस्या को हल करता है, तो प्रत्येक टर्न बातचीत के इतिहास में अधिक टेक्स्ट जोड़ता है। मॉडल का अगला कदम पूरे ट्रांसक्रिप्ट द्वारा निर्देशित होना चाहिए, लेकिन व्यवहार में प्रासंगिक तथ्य दब जाते हैं। Meta के शोधकर्ता इसे "बिहेवियरल स्टेट डिके" (behavioral state decay) कहते हैं – जैसे-जैसे कॉन्टेक्स्ट विंडो बढ़ती है, एजेंट की उद्देश्य की भावना धीरे-धीरे कम होने लगती है। केवल विंडो को चौड़ा करने से समस्या हल नहीं होती; जानकारी मौजूद तो हो सकती है लेकिन वह मॉडल के अनुमानों (predictions) को प्रभावित नहीं करती है।

पारंपरिक मेमोरी एड-ऑन किसी दस्तावेज़ को पुनः प्राप्त करते हैं या प्रतिक्रियाओं को व्यक्तिगत बनाते हैं। वे कभी यह तय नहीं करते कि कब पिछली जानकारी का कोई हिस्सा वर्तमान क्रिया को प्रभावित करने के लिए पर्याप्त महत्वपूर्ण है। परिणामस्वरूप, लंबे समय तक चलने वाले स्वायत्त एजेंट भटक जाते हैं, गलतियाँ दोहराते हैं, या बातचीत की शुरुआत में बताए गए किसी महत्वपूर्ण प्रतिबंध (constraint) को भूल जाते हैं।

निष्पादन (execution) को निरीक्षण (oversight) से अलग करना

Meta का समाधान एक प्लग-एंड-प्ले आर्किटेक्चर है जो निष्पादन इंजन (execution engine) को एक पर्यवेक्षी मेमोरी लेयर (supervisory memory layer) से अलग करता है।

  • Action Agent – एक अपरिवर्तित लैंग्वेज मॉडल जो कमांड जारी करता है, टूल्स का उपयोग करता है और दृश्य आउटपुट (visible output) प्रदान करता है। प्रयोगों में यह Claude Sonnet 4.5 है।
  • Memory Agent – एक दूसरा मॉडल जो समय-समय पर हालिया चरणों की एक स्लाइडिंग विंडो की समीक्षा करता है। परीक्षणों में यह Claude Opus 4.6 है।

मेमोरी एजेंट एक तीन-भागों वाला मेमोरी बैंक रखता है:

  1. Private Status Field – प्रगति और जोखिम के बारे में आंतरिक फ्लैग्स (internal flags) जिन्हें एक्शन एजेंट नहीं देख सकता।
  2. Knowledge Memory – स्थिर तथ्य जैसे फ़ाइल पाथ, कॉन्फ़िगरेशन वैल्यूज़, या API एंडपॉइंट्स।
  3. Procedural Memory – क्या काम किया और क्या विफल रहा इसका एक लॉग, जिसमें विफल कमांड और उन्हें हल करने वाले सुधार शामिल हैं।

पूरे ट्रांसक्रिप्ट का सारांश देने के बजाय, मेमोरी एजेंट यह तय करता है कि हस्तक्षेप करना है या नहीं। यदि उसे पता चलता है कि कोई महत्वपूर्ण विवरण भुला दिया गया है, तो वह एक संक्षिप्त अनुस्मारक (reminder) डाल देता है; यदि नहीं, तो वह चुप रहता है, जिससे अतिरिक्त टोकन और लेटेंसी (latency) से बचा जा सकता है।

बेंचमार्क अवधारणा को सिद्ध करते हैं

Meta ने दो सार्वजनिक सूट्स पर सिस्टम का परीक्षण किया:

बेंचमार्क बेसलाइन सफलता ड्यूल-एजेंट सफलता
Terminal-Bench 2.0 (command-line) 38% 46%
tau2-Bench (retail, airline, telecom) 55% 62%

ये लाभ उल्लेखनीय हैं क्योंकि दोनों पंक्तियों में एक ही एक्शन मॉडल दिखाई देता है; केवल मेमोरी लेयर बदली गई है। कीवर्ड सर्च पर निर्भर करने वाले व्यापक रूप से उपयोग किए जाने वाले प्रोडक्शन मेमोरी लेयर Mem0 की तुलना में, Meta का दृष्टिकोण बेहतर प्रदर्शन करता है। एक सिम्युलेटेड एयरलाइन-बुकिंग परिदृश्य में, उपयोगकर्ता ने गलत तरीके से "Gold status" का दावा किया। मेमोरी एजेंट ने इस विसंगति को पकड़ा, एक्शन मॉडल को एयरलाइन के API से सत्यापित लॉयल्टी-स्टेटस चेक पर भरोसा करने के लिए याद दिलाया, और लेनदेन सही ढंग से पूरा हो गया।

उद्योग को इस पर ध्यान क्यों देना चाहिए

परिणाम एक ऐसे आगे बढ़ने का रास्ता सुझाते हैं जो लगातार बड़े होते मॉडलों पर निर्भर नहीं है। कॉन्टेक्स्ट मैनेजमेंट को एक हल्के पर्यवेक्षक (lightweight overseer) को सौंपकर, डेवलपर्स प्राथमिक मॉडल के पैरामीटर काउंट को बढ़ाए बिना दर्जनों चरणों तक चलने वाले कार्यों—जैसे सॉफ्टवेयर डिबगिंग, जटिल ग्राहक-सेवा प्रवाह, या स्वायत्त डेटा पाइपलाइन—के लिए विश्वसनीयता में सुधार कर सकते हैं।

स्वायत्त एजेंट बनाने वाली कंपनियों के लिए, यह आर्किटेक्चर प्रदान करता है:

  • Reduced error drift – सिस्टम सक्रिय रूप से भूले हुए प्रतिबंधों से बचाव करता है।
  • Token efficiency – हस्तक्षेप चयनात्मक (selective) होते हैं, इसलिए एक्शन मॉडल कम अप्रासंगिक टोकन प्रोसेस करता है।
  • Modular upgrades – एक्शन कोर को फिर से प्रशिक्षित किए बिना मेमोरी कोच को नए मॉडल के साथ बदला जा सकता है।

ट्रेड-ऑफ और खुले प्रश्न

आगे क्या देखें

निष्कर्ष (Takeaway): एक समर्पित मेमोरी कोच 'बिहेवियरल स्टेट डिके' को रोक सकता है, जो प्राथमिक रीजनिंग मॉडल को फिर से डिज़ाइन किए बिना सफलता दर में दो अंकों की वृद्धि प्रदान करता है। ट्रेड-ऑफ सिस्टम की बढ़ी हुई जटिलता है, लेकिन इसका प्रतिफल—अधिक भरोसेमंद स्वायत्त एजेंट—अतिरिक्त इंजीनियरिंग प्रयास के लायक हो सकता है।