स्ट्रक्चर्ड मेमोरी (Structured Memory) कैसे AI एजेंट्स को Slay the Spire 2 जीतने में मदद करती है
शोधकर्ताओं ने एक नया एजेंटिक आर्किटेक्चर, AgenticSTS, विकसित किया है, जो भारी-भरकम चैट लॉग्स को एक परिष्कृत पांच-स्तरीय स्ट्रक्चर्ड मेमोरी सिस्टम से बदलकर पारंपरिक LLM एजेंट्स से बेहतर प्रदर्शन करता है। "बढ़ते हुए ट्रांसक्रिप्ट" (growing transcript) मॉडल से दूर हटकर, यह दृष्टिकोण टोकन लागत को काफी कम कर देता है और साथ ही एजेंट्स को कई गेमप्ले के दौरान जटिल रणनीतियों को सीखने में सक्षम बनाता है।
बढ़ते हुए चैट लॉग्स की समस्या
अधिकांश वर्तमान LLM एजेंट्स, जैसे कि ReAct या Reflexion फ्रेमवर्क का उपयोग करने वाले, हर पिछले ऑब्जर्वेशन (observation), टूल कॉल और सेल्फ-रिफ्लेक्शन को एक निरंतर टेक्स्ट लॉग में जोड़ने पर निर्भर करते हैं। जैसे-जैसे सत्र आगे बढ़ता है, यह कॉन्टेक्स्ट विंडो तब तक बढ़ती जाती है जब तक कि यह ओवरफ्लो न हो जाए या मॉडल का ध्यान अप्रासंगिक ऐतिहासिक डेटा के कारण कम (diluted) न हो जाए।
जटिल डेक-बिल्डिंग रोगलाइक (roguelike) Slay the Spire 2 के खिलाफ परीक्षण में, यह अक्षमता स्पष्ट रूप से दिखाई दी। STS2MCP और CharTyr जैसे प्रतिस्पर्धी, जो क्लासिक ग्रोइंग-ट्रांसक्रिप्ट पैटर्न का उपयोग करते हैं, उनमें सिंगल मॉडल कॉल लगभग 527,000 टोकन तक बढ़ गए। यह आर्किटेक्चरल खामी भारी लेटेंसी (latency) और अत्यधिक टोकन लागत का कारण बनती है, जहाँ प्रतिस्पर्धी समान स्कोर प्राप्त करने के लिए AgenticSTS की तुलना में 66 से 90 गुना अधिक टोकन का उपयोग करते हैं।
पांच-स्तरीय मेमोरी समाधान
AgenticSTS पांच व्यवस्थित और अलग-अलग मेमोरी स्लॉट्स से प्रत्येक निर्णय प्रॉम्प्ट को फिर से बनाकर कॉन्टेक्स्ट इन्फ्लेशन (context inflation) की समस्या को हल करता है। यह सुनिश्चित करता है कि गेम चाहे कितना भी लंबा चले, प्रॉम्प्ट हल्का बना रहे—औसतन लगभग 5,000 टोकन। लेयर्स को इस प्रकार व्यवस्थित किया गया है:
- L1 (Fixed Protocol): एजेंट के लिए मुख्य निर्देश।
- L2 (State Schemas): वर्तमान में मान्य क्रियाओं (actions) की परिभाषाएं।
- L3 (Retrievable Rules): आवश्यकतानुसार प्राप्त किए जाने वाले विशिष्ट गेम नियम।
- L4 (Episodic Memory): दीर्घकालिक कॉन्टेक्स्ट प्रदान करने के लिए पिछले रन का सारांश।
- L5 (Skill Library): विशिष्ट स्थितिजन्य पैटर्न द्वारा ट्रिगर किए जाने वाले सामरिक नियम।
यह मॉड्यूलरिटी शोधकर्ताओं को सटीक रूप से यह पहचानने की अनुमति देती है कि कौन सा घटक प्रदर्शन में सुधार लाता है। उदाहरण के लिए, केवल L5 स्किल लाइब्रेरी को सक्षम करने से A0 कठिनाई स्तर पर एजेंट की जीत की दर 10 में से 3 से बढ़कर 10 में से 6 हो गई।
लर्निंग के माध्यम से कठिनाई को बढ़ाना
स्ट्रक्चर्ड दृष्टिकोण की असली ताकत 'इंटर-रन लर्निंग' (inter-run learning) में निहित है। जबकि मानक एजेंट सबसे निचले कठिनाई स्तरों से आगे बढ़ने के लिए संघर्ष करते हैं, AgenticSTS गेम की कठिनाई सीढ़ी पर चढ़ने के लिए अपनी L4 और L5 लेयर्स का लाभ उठाता है। बिना सक्रिय मेमोरी के, जो रन के बीच अपडेट होती है, एजेंट A2 से A4 स्तरों पर रुक जाता है; हालाँकि, सत्रों के बीच बनी रहने वाली मेमोरी के साथ, यह सफलतापूर्वक बहुत कठिन A6 से A8 स्तरों तक पहुँच जाता है।
दिलचस्प बात यह है कि शोधकर्ताओं ने पाया कि यह मेमोरी अत्यधिक मॉडल-विशिष्ट (model-specific) है। जब Gemini 3.1 Pro द्वारा जनरेट किया गया मेमोरी स्टैक Qwen 3.6-27B में स्थानांतरित किया गया, तो बाद वाले का स्कोर 84.5% बढ़ गया, लेकिन Deepseek V4-Pro का स्कोर वास्तव में 18.1% गिर गया। यह सुझाव देता है कि हालांकि स्ट्रक्चर्ड मेमोरी शक्तिशाली है, लेकिन इसके भीतर निहित "ज्ञान" उस मॉडल के रीजनिंग पैटर्न से गहराई से जुड़ा हुआ है जिसने इसे बनाया है।
यह AI उद्योग के लिए क्यों महत्वपूर्ण है
AgenticSTS की सफलता एजेंटिक डिज़ाइन में एक बदलाव का संकेत देती है: स्वायत्त AI का भविष्य बड़े कॉन्टेक्स्ट विंडो में नहीं, बल्कि स्मार्ट और अधिक स्ट्रक्चर्ड मेमोरी मैनेजमेंट में है। लंबे समय तक चलने वाले एजेंट बनाने वाले डेवलपर्स के लिए, यह आर्किटेक्चर परिचालन लागत और लेटेंसी को कम करने के साथ-साथ जटिल, बहु-चरणीय रीजनिंग करने की मॉडल की क्षमता में काफी सुधार करने के लिए एक ब्लूप्रिंट प्रदान करता है।
मुख्य बातें
- Efficiency Gains: AgenticSTS एक निरंतर 5,000-टोकन प्रॉम्प्ट बनाए रखता है, जो बढ़ते हुए चैट लॉग्स पर निर्भर एजेंटों की तुलना में 90 गुना तक कम टोकन का उपयोग करता है।
- Enhanced Performance: "Skill Library" (L5) का उपयोग करने से एजेंट की जीत की दर दोगुनी हो सकती है और इंटर-रन लर्निंग के माध्यम से बहुत उच्च कठिनाई स्तरों तक प्रगति संभव हो सकती है।
- Architectural Shift: अनस्ट्रक्चर्ड ट्रांसक्रिप्ट से मल्टी-लेयर्ड मेमोरी की ओर बढ़ने से अटेंशन डिल्यूशन (attention dilution) और तेजी से बढ़ती मॉडल लेटेंसी की समस्याओं का समाधान होता है।
