స్ట్రక్చర్డ్ మెమరీ AI ఏజెంట్లు Slay the Spire 2ని జయించడంలో ఎలా సహాయపడుతుంది
పరిశోధకులు AgenticSTS అనే కొత్త ఏజెంటిక్ ఆర్కిటెక్చర్ను అభివృద్ధి చేశారు. ఇది భారీగా పెరిగిపోయే చాట్ లాగ్లకు బదులుగా, అత్యాధునికమైన ఐదు-అంచెల (five-layer) స్ట్రక్చర్డ్ మెమరీ సిస్టమ్ను ఉపయోగించడం ద్వారా సాంప్రదాయ LLM ఏజెంట్ల కంటే మెరుగైన పనితీరును కనబరుస్తుంది. "పెరుగుతున్న ట్రాన్స్క్రిప్ట్" (growing transcript) మోడల్కు దూరంగా వెళ్లడం ద్వారా, ఈ విధానం టోకెన్ ఖర్చులను గణనీయంగా తగ్గిస్తుంది మరియు ఏజెంట్లు బహుళ ఆటల (playthroughs) ద్వారా సంక్లిష్టమైన వ్యూహాలను నేర్చుకోవడానికి వీలు కల్పిస్తుంది.
పెరుగుతున్న చాట్ లాగ్లతో ఉన్న సమస్య
ReAct లేదా Reflexion ఫ్రేమ్వర్క్లను ఉపయోగించే ప్రస్తుత LLM ఏజెంట్లు చాలా వరకు, ప్రతి గత పరిశీలన (observation), టూల్ కాల్ మరియు స్వయం-ప్రతిబింబాన్ని (self-reflection) ఒక నిరంతర టెక్స్ట్ లాగ్కు జోడించడంపై ఆధారపడతాయి. సెషన్ ముందుకు సాగుతున్న కొద్దీ, ఈ కాంటెక్స్ట్ విండో విస్తరిస్తూ పోతుంది, దీనివల్ల అది ఓవర్ఫ్లో అవ్వడం లేదా అసంబద్ధమైన చారిత్రక డేటా వల్ల మోడల్ యొక్క అటెన్షన్ (attention) తగ్గుతుంది.
సంక్లిష్టమైన డెక్-బిల్డింగ్ రోగ్లైక్ (deck-building roguelike) Slay the Spire 2తో చేసిన పరీక్షలో, ఈ అసమర్థత స్పష్టంగా కనిపించింది. క్లాసిక్ గ్రోయింగ్-ట్రాన్స్క్రిప్ట్ ప్యాటర్న్ను ఉపయోగించే STS2MCP మరియు CharTyr వంటి ప్రత్యర్థులు, ఒకే మోడల్ కాల్ సుమారు 527,000 టోకెన్ల వరకు పెరిగిపోవడాన్ని చూశారు. ఈ ఆర్కిటెక్చరల్ లోపం వల్ల భారీ లాటెన్సీ (latency) మరియు అసాధారణమైన టోకెన్ ఖర్చులు ఏర్పడతాయి; ఇక్కడ ప్రత్యర్థులు అదే స్కోర్లను సాధించడానికి AgenticSTS కంటే 66 నుండి 90 రెట్లు ఎక్కువ టోకెన్లను ఉపయోగిస్తున్నారు.
ఐదు-అంచెల మెమరీ పరిష్కారం
AgenticSTS ఐదు వ్యవస్థీకృత, విడివిడి మెమరీ స్లాట్ల నుండి ప్రతి నిర్ణయ ప్రాంప్ట్ను (decision prompt) తిరిగి నిర్మించడం ద్వారా కాంటెక్స్ట్ ఇన్ఫ్లేషన్ సమస్యను పరిష్కరిస్తుంది. దీనివల్ల ఆట ఎంత కాలం సాగినా, ప్రాంప్ట్ సగటున 5,000 టోకెన్ల వద్ద తక్కువగా (lean) ఉంటుంది. ఈ పొరలు (layers) ఈ క్రింది విధంగా ఉన్నాయి:
- L1 (Fixed Protocol): ఏజెంట్ కోసం ప్రధాన సూచనలు.
- L2 (State Schemas): ప్రస్తుతం చెల్లుబాటు అయ్యే చర్యల నిర్వచనాలు.
- L3 (Retrievable Rules): అవసరమైనప్పుడు సేకరించబడే నిర్దిష్ట గేమ్ నియమాలు.
- L4 (Episodic Memory): దీర్ఘకాలిక కాంటెక్స్ట్ను అందించడానికి మునుపటి రన్ల సారాంశాలు.
- L5 (Skill Library): నిర్దిష్ట పరిస్థితుల ఆధారంగా ప్రేరేపించబడే వ్యూహాత్మక నియమాలు.
ఈ మాడ్యులారిటీ (modularity) వల్ల ఏ భాగం పనితీరు మెరుగుదలకు కారణమవుతుందో పరిశోధకులు ఖచ్చితంగా గుర్తించగలరు. ఉదాహరణకు, కేవలం L5 skill libraryని ఎనేబుల్ చేయడం ద్వారా, A0 డిఫికల్టీ లెవల్లో ఏజెంట్ గెలిచే రేటు 10 ఆటలలో 3 నుండి 10 ఆటలలో 6కి రెట్టింపు అయ్యింది.
నేర్చుకోవడం ద్వారా కష్టతరమైన స్థాయిలను అధిగమించడం
స్ట్రక్చర్డ్ విధానం యొక్క అసలు శక్తి 'ఇంటర్-రన్ లెర్నింగ్' (inter-run learning) లో ఉంది. సాధారణ ఏజెంట్లు తక్కువ కష్టతరమైన స్థాయిల కంటే ముందుకు వెళ్లడానికి ఇబ్బంది పడుతుంటే, AgenticSTS దాని L4 మరియు L5 పొరలను ఉపయోగించి గేమ్ యొక్క కష్టతరమైన స్థాయిలను అధిగమిస్తుంది. రన్ల మధ్య అప్డేట్ అయ్యే యాక్టివ్ మెమరీ లేకపోతే, ఏజెంట్ A2 నుండి A4 స్థాయిల వద్ద ఆగిపోతుంది; అయితే, సెషన్ల అంతటా నిలిచి ఉండే మెమరీతో, అది చాలా కష్టతరమైన A6 నుండి A8 స్థాయిలను విజయవంతంగా చేరుకుంటుంది.
ఆసక్తికరంగా, ఈ మెమరీ మోడల్పై ఆధారపడి ఉంటుందని పరిశోధకులు కనుగొన్నారు. Gemini 3.1 Pro ద్వారా రూపొందించబడిన మెమరీ స్టాక్ను Qwen 3.6-27Bకి బదిలీ చేసినప్పుడు, దాని స్కోరు 84.5% పెరిగింది, కానీ Deepseek V4-Pro స్కోరు 18.1% తగ్గింది. దీనిని బట్టి స్ట్రక్చర్డ్ మెమరీ శక్తివంతమైనదే అయినప్పటికీ, దానిలోని "జ్ఞానం" (knowledge) ఆ మెమరీని సృష్టించిన మోడల్ యొక్క రీజనింగ్ ప్యాటర్న్స్తో (reasoning patterns) లోతుగా ముడిపడి ఉందని అర్థమవుతుంది.
AI పరిశ్రమకు ఇది ఎందుకు ముఖ్యం
AgenticSTS విజయం ఏజెంటిక్ డిజైన్లో ఒక మార్పును సూచిస్తోంది: స్వయంప్రతిపత్తి కలిగిన AI భవిష్యత్తు అనేది పెద్ద కాంటెక్స్ట్ విండోలపై కాకుండా, తెలివైన మరియు మరింత స్ట్రక్చర్డ్ మెమరీ మేనేజ్మెంట్పై ఆధారపడి ఉంటుంది. దీర్ఘకాలం పనిచేసే ఏజెంట్లను నిర్మించే డెవలపర్లకు, ఈ ఆర్కిటెక్చర్ ఆపరేషనల్ ఖర్చులు మరియు లాటెన్సీని తగ్గించడానికి మరియు సంక్లిష్టమైన, బహుళ-దశల రీజనింగ్ను చేసే మోడల్ సామర్థ్యాన్ని గణనీయంగా మెరుగుపరచడానికి ఒక బ్లూప్రింట్ను అందిస్తుంది.
ముఖ్య అంశాలు
- Efficiency Gains: AgenticSTS స్థిరమైన 5,000-టోకెన్ ప్రాంప్ట్ను నిర్వహిస్తుంది, ఇది పెరుగుతున్న చాట్ లాగ్లపై ఆధారపడే ఏజెంట్ల కంటే 90 రెట్లు తక్కువ టోకెన్లను ఉపయోగిస్తుంది.
- Enhanced Performance: "Skill Library" (L5)ని ఉపయోగించడం ద్వారా ఏజెంట్ గెలిచే రేటును రెట్టింపు చేయవచ్చు మరియు ఇంటర్-రన్ లెర్నింగ్ ద్వారా చాలా ఎక్కువ కష్టతరమైన స్థాయిలకు చేరుకోవచ్చు.
- Architectural Shift: అన్స్ట్రక్చర్డ్ ట్రాన్స్క్రిప్ట్ల నుండి మల్టీ-లేయర్డ్ మెమరీకి మారడం వల్ల అటెన్షన్ తగ్గుదల మరియు మోడల్ లాటెన్సీ పెరగడం వంటి సమస్యలు పరిష్కారమవుతాయి.
