ਕਿਵੇਂ ਸਟ੍ਰਕਚਰਡ ਮੈਮੋਰੀ (Structured Memory) AI ਏਜੰਟਾਂ ਨੂੰ Slay the Spire 2 ਜਿੱਤਣ ਵਿੱਚ ਮਦਦ ਕਰਦੀ ਹੈ
ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਇੱਕ ਨਵਾਂ ਏਜੈਂਟਿਕ ਆਰਕੀਟੈਕਚਰ, AgenticSTS, ਵਿਕਸਿਤ ਕੀਤਾ ਹੈ, ਜੋ ਭਾਰੀ ਚੈਟ ਲੌਗਾਂ (chat logs) ਦੀ ਜਗ੍ਹਾ ਇੱਕ ਉੱਨਤ ਪੰਜ-ਪੱਧਰੀ ਸਟ੍ਰਕਚਰਡ ਮੈਮੋਰੀ ਸਿਸਟਮ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਰਵਾਇਤੀ LLM ਏਜੰਟਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ। "ਵਧਦੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ" (growing transcript) ਮਾਡਲ ਤੋਂ ਦੂਰ ਹੋ ਕੇ, ਇਹ ਪਹੁੰਚ ਟੋਕਨਾਂ ਦੀ ਲਾਗਤ ਨੂੰ ਕਾਫ਼ੀ ਘਟਾਉਂਦੀ ਹੈ ਅਤੇ ਨਾਲ ਹੀ ਏਜੰਟਾਂ ਨੂੰ ਕਈ ਵਾਰ ਖੇਡਣ ਦੌਰਾਨ ਗੁੰਝਲਦਾਰ ਰਣਨੀਤੀਆਂ ਸਿੱਖਣ ਦੇ ਯੋਗ ਬਣਾਉਂਦੀ ਹੈ।
ਵਧਦੇ ਚੈਟ ਲੌਗਾਂ ਦੀ ਸਮੱਸਿਆ
ਜ਼ਿਆਦਾਤਰ ਮੌਜੂਦਾ LLM ਏਜੰਟ, ਜਿਵੇਂ ਕਿ ReAct ਜਾਂ Reflexion ਫਰੇਮਵਰਕ ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਾਲੇ, ਹਰ ਪੁਰਾਣੇ ਨਿਰੀਖਣ (observation), ਟੂਲ ਕਾਲ ਅਤੇ ਸਵੈ-ਚਿੰਤਨ (self-reflection) ਨੂੰ ਇੱਕ ਲਗਾਤਾਰ ਟੈਕਸਟ ਲੌਗ ਵਿੱਚ ਜੋੜਨ 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ। ਜਿਵੇਂ-ਜਿਵੇਂ ਸੈਸ਼ਨ ਅੱਗੇ ਵਧਦਾ ਹੈ, ਇਹ ਕੰਟੈਕਸਟ ਵਿੰਡੋ (context window) ਉਦੋਂ ਤੱਕ ਵਧਦੀ ਜਾਂਦੀ ਹੈ ਜਦੋਂ ਤੱਕ ਇਹ ਜਾਂ ਤਾਂ ਭਰ ਨਹੀਂ ਜਾਂਦੀ ਜਾਂ ਮਾਡਲ ਦਾ ਧਿਆਨ ਅਣਪ੍ਰਸੰਗਿਕ ਇਤਿਹਾਸਕ ਡੇਟਾ ਕਾਰਨ ਖਿੰਡ ਨਹੀਂ ਜਾਂਦਾ।
ਗੁੰਝਲਦਾਰ ਡੈੱਕ-ਬਿਲਡਿੰਗ ਰੋਗਲਾਈਕ (deck-building roguelike) Slay the Spire 2 ਦੇ ਵਿਰੁੱਧ ਟੈਸਟਿੰਗ ਦੌਰਾਨ, ਇਹ ਅਕੁਸ਼ਲਤਾ ਬਹੁਤ ਸਾਫ਼ ਦਿਖਾਈ ਦਿੱਤੀ। STS2MCP ਅਤੇ CharTyr ਵਰਗੇ ਮੁਕਾਬਲੇਬਾਜ਼, ਜੋ ਕਿ ਕਲਾਸਿਕ ਵਧਦੇ-ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੈਟਰਨ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ, ਉਨ੍ਹਾਂ ਵਿੱਚ ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਕਾਲ ਲਗਭਗ 527,000 ਟੋਕਨਾਂ ਤੱਕ ਪਹੁੰਚ ਗਈ। ਇਹ ਆਰਕੀਟੈਕਚਰਲ 결 (flaw) ਭਾਰੀ ਲੇਟੈਂਸੀ (latency) ਅਤੇ ਬਹੁਤ ਜ਼ਿਆਦਾ ਟੋਕਨ ਲਾਗਤ ਦਾ ਕਾਰਨ ਬਣਦੀ ਹੈ, ਜਿੱਥੇ ਮੁਕਾਬਲੇਬਾਜ਼ AgenticSTS ਦੇ ਮੁਕਾਬਲੇ ਸਮਾਨ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ 66 ਤੋਂ 90 ਗੁਣਾ ਜ਼ਿਆਦਾ ਟੋਕਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ।
ਪੰਜ-ਪੱਧਰੀ ਮੈਮੋਰੀ ਹੱਲ
AgenticSTS ਹਰ ਫੈਸਲੇ ਵਾਲੇ ਪ੍ਰੋਂਪਟ (decision prompt) ਨੂੰ ਪੰਜ ਸੰਗਠਿਤ ਅਤੇ ਵੱਖਰੇ ਮੈਮੋਰੀ ਸਲੌਟਸ ਤੋਂ ਮੁੜ ਬਣਾ ਕੇ ਕੰਟੈਕਸਟ ਇਨਫਲੇਸ਼ਨ (context inflation) ਦੀ ਸਮੱਸਿਆ ਨੂੰ ਹੱਲ ਕਰਦਾ ਹੈ। ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦਾ ਹੈ ਕਿ ਖੇਡ ਕਿੰਨੀ ਵੀ ਲੰਬੀ ਕਿਉਂ ਨਾ ਹੋਵੇ, ਪ੍ਰੋਂਪਟ ਹਮੇਸ਼ਾ ਘੱਟ ਰਹੇ—ਔਸਤਨ ਲਗਭਗ 5,000 ਟੋਕਨ। ਪੱਧਰ ਇਸ ਤਰ੍ਹਾਂ ਸੰਗਠਿਤ ਹਨ:
- L1 (Fixed Protocol): ਏਜੰਟ ਲਈ ਮੁੱਖ ਨਿਰਦੇਸ਼।
- L2 (State Schemas): ਮੌਜੂਦਾ ਵੈਧ ਕਾਰਵਾਈਆਂ ਦੀਆਂ ਪਰਿਭਾਸ਼ਾਵਾਂ।
- L3 (Retrievable Rules): ਲੋੜ ਅਨੁਸਾਰ ਲਿਆਂਦੇ ਜਾਣ ਵਾਲੇ ਖਾਸ ਗੇਮ ਨਿਯਮ।
- L4 (Episodic Memory): ਲੰਬੇ ਸਮੇਂ ਦਾ ਕੰਟੈਕਸਟ ਪ੍ਰਦਾਨ ਕਰਨ ਲਈ ਪਿਛਲੀਆਂ ਖੇਡਾਂ ਦੇ ਸਾਰ (summaries)।
- L5 (Skill Library): ਖਾਸ ਸਥਿਤੀਆਂ ਦੇ ਅਨੁਸਾਰ ਚਾਲੂ ਹੋਣ ਵਾਲੇ ਰਣਨੀਤਕ ਨਿਯਮ।
ਇਹ ਮੋਡਿਊਲਰਤਾ (modularity) ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਇਹ ਪਤਾ ਲਗਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ ਕਿ ਕਿਹੜਾ ਹਿੱਸਾ ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਸੁਧਾਰ ਕਰ ਰਿਹਾ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਸਿਰਫ਼ L5 ਸਕਿੱਲ ਲਾਇਬ੍ਰੇਰੀ ਨੂੰ ਚਾਲੂ ਕਰਨ ਨਾਲ A0 ਮੁਸ਼ਕਲ ਪੱਧਰ 'ਤੇ ਏਜੰਟ ਦੀ ਜਿੱਤਣ ਦੀ ਦਰ 10 ਵਿੱਚੋਂ 3 ਤੋਂ ਵਧ ਕੇ 10 ਵਿੱਚੋਂ 6 ਹੋ ਗਈ।
ਸਿੱਖਣ ਰਾਹੀਂ ਮੁਸ਼ਕਲ ਪੱਧਰਾਂ ਨੂੰ ਵਧਾਉਣਾ
ਸਟ੍ਰਕਚਰਡ ਪਹੁੰਚ ਦੀ ਅਸਲ ਤਾਕਤ 'ਇੰਟਰ-ਰਨ ਲਰਨਿੰਗ' (inter-run learning) ਵਿੱਚ ਹੈ। ਜਦੋਂ ਕਿ ਸਟੈਂਡਰਡ ਏਜੰਟ ਸਭ ਤੋਂ ਘੱਟ ਮੁਸ਼ਕਲ ਪੱਧਰਾਂ ਤੋਂ ਅੱਗੇ ਵਧਣ ਲਈ ਸੰਘਰਸ਼ ਕਰਦੇ ਹਨ, AgenticSTS ਗੇਮ ਦੀ ਮੁਸ਼ਕਲ ਲੜੀ ਵਿੱਚ ਉੱਪਰ ਜਾਣ ਲਈ ਆਪਣੇ L4 ਅਤੇ L5 ਪੱਧਰਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਬਿਨਾਂ ਕਿਸੇ ਸਰਗਰਮ ਮੈਮੋਰੀ ਦੇ ਜੋ ਖੇਡਾਂ ਦੇ ਵਿਚਕਾਰ ਅਪਡੇਟ ਹੁੰਦੀ ਰਹੇ, ਏਜੰਟ A2 ਤੋਂ A4 ਪੱਧਰਾਂ 'ਤੇ ਰੁਕ ਜਾਂਦਾ ਹੈ; ਹਾਲਾਂਕਿ, ਸੈਸ਼ਨਾਂ ਦੌਰਾਨ ਟਿਕਣ ਵਾਲੀ ਮੈਮੋਰੀ ਦੇ ਨਾਲ, ਇਹ ਸਫਲਤਾਪੂਰਵਕ ਬਹੁਤ ਜ਼ਿਆਦਾ ਮੁਸ਼ਕਲ A6 ਤੋਂ A8 ਪੱਧਰਾਂ ਤੱਕ ਪਹੁੰਚ ਜਾਂਦਾ ਹੈ।
ਦਿਲਚਸਪ ਗੱਲ ਇਹ ਹੈ ਕਿ ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਪਾਇਆ ਕਿ ਇਹ ਮੈਮੋਰੀ ਮਾਡਲ-ਵਿਸ਼ੇਸ਼ (model-specific) ਹੈ। ਜਦੋਂ Gemini 3.1 Pro ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੀ ਗਈ ਮੈਮੋਰੀ ਸਟੈਕ ਨੂੰ Qwen 3.6-27B ਵਿੱਚ ਤਬਦੀਲ ਕੀਤਾ ਗਿਆ, ਤਾਂ ਦੂਜੇ ਦੇ ਸਕੋਰ ਵਿੱਚ 84.5% ਦਾ ਵਾਧਾ ਹੋਇਆ, ਪਰ Deepseek V4-Pro ਦੇ ਸਕੋਰ ਵਿੱਚ ਅਸਲ ਵਿੱਚ 18.1% ਦੀ ਗਿਰਾਵਟ ਆਈ। ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਹਾਲਾਂਕਿ ਸਟ੍ਰਕਚਰਡ ਮੈਮੋਰੀ ਸ਼ਕਤੀਸ਼ਾਲੀ ਹੈ, ਪਰ ਇਸ ਵਿੱਚ ਮੌਜੂਦ "ਗਿਆਨ" ਉਸ ਮਾਡਲ ਦੇ ਤਰਕ ਦੇ ਪੈਟਰਨਾਂ (reasoning patterns) ਨਾਲ ਡੂੰਘਾਈ ਨਾਲ ਜੁੜਿਆ ਹੋਇਆ ਹੈ ਜਿਸਨੇ ਇਸਨੂੰ ਬਣਾਇਆ ਹੈ।
ਇਹ AI ਉਦਯੋਗ ਲਈ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
AgenticSTS ਦੀ ਸਫਲਤਾ ਏਜੈਂਟਿਕ ਡਿਜ਼ਾਈਨ ਵਿੱਚ ਇੱਕ ਬਦਲਾਅ ਦਾ ਸੰਕੇਤ ਦਿੰਦੀ ਹੈ: ਖੁਦਮੁਖਤਿਆਰ AI ਦਾ ਭਵਿੱਖ ਵੱਡੇ ਕੰਟੈਕਸਟ ਵਿੰਡੋਜ਼ ਵਿੱਚ ਨਹੀਂ, ਸਗੋਂ ਸਮਾਰਟ ਅਤੇ ਵਧੇਰੇ ਸਟ੍ਰਕਚਰਡ ਮੈਮੋਰੀ ਪ੍ਰਬੰਧਨ ਵਿੱਚ ਹੈ। ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ ਏਜੰਟ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਲਈ, ਇਹ ਆਰਕੀਟੈਕਚਰ ਕਾਰਜਸ਼ੀਲ ਲਾਗਤਾਂ ਅਤੇ ਲੇਟੈਂਸੀ ਨੂੰ ਘਟਾਉਣ ਦੇ ਨਾਲ-ਨਾਲ ਗੁੰਝਲਦਾਰ, ਬਹੁ-ਪੜਾਅ ਵਾਲੇ ਤਰਕ ਕਰਨ ਦੀ ਮਾਡਲ ਦੀ ਯੋਗਤਾ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਸੁਧਾਰ ਕਰਨ ਲਈ ਇੱਕ ਬਲੂਪ੍ਰਿੰਟ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
ਮੁੱਖ ਗੱਲਾਂ
- Efficiency Gains: AgenticSTS ਇੱਕ ਨਿਰੰਤਰ 5,000-ਟੋਕਨ ਪ੍ਰੋਂਪਟ ਬਣਾਈ ਰੱਖਦਾ ਹੈ, ਜੋ ਕਿ ਵਧਦੇ ਚੈਟ ਲੌਗਾਂ 'ਤੇ ਨਿਰਭਰ ਕਰਨ ਵਾਲੇ ਏਜੰਟਾਂ ਨਾਲੋਂ 90 ਗੁਣਾ ਤੱਕ ਘੱਟ ਟੋਕਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ।
- Enhanced Performance: "Skill Library" (L5) ਦੀ ਵਰਤੋਂ ਕਰਨ ਨਾਲ ਏਜੰਟ ਦੀ ਜਿੱਤਣ ਦੀ ਦਰ ਦੁੱਗਣੀ ਹੋ ਸਕਦੀ ਹੈ ਅਤੇ ਇੰਟਰ-ਰਨ ਲਰਨਿੰਗ ਰਾਹੀਂ ਬਹੁਤ ਉੱਚੇ ਮੁਸ਼ਕਲ ਪੱਧਰਾਂ ਤੱਕ
