কীভাবে স্ট্রাকচার্ড মেমরি AI এজেন্টদের Slay the Spire 2 জয় করতে সাহায্য করে
গবেষকরা একটি নতুন এজেন্টিক আর্কিটেকচার, AgenticSTS তৈরি করেছেন, যা বিশাল চ্যাট লগগুলোকে একটি উন্নত পাঁচ-স্তর বিশিষ্ট স্ট্রাকচার্ড মেমরি সিস্টেম দ্বারা প্রতিস্থাপন করে প্রথাগত LLM এজেন্টদের চেয়েও ভালো পারফরম্যান্স দেখায়। "growing transcript" মডেল থেকে সরে এসে, এই পদ্ধতিটি টোকেন খরচ উল্লেখযোগ্যভাবে কমিয়ে দেয় এবং একই সাথে এজেন্টদের একাধিক গেম খেলার মাধ্যমে জটিল কৌশল শিখতে সক্ষম করে তোলে।
ক্রমবর্ধমান চ্যাট লগের সমস্যা
বর্তমানের বেশিরভাগ LLM এজেন্ট, যেমন ReAct বা Reflexion ফ্রেমওয়ার্ক ব্যবহারকারী এজেন্টরা, প্রতিটি অতীত পর্যবেক্ষণ, টুল কল এবং আত্ম-প্রতিফলন (self-reflection) একটি নিরবচ্ছিন্ন টেক্সট লগের সাথে যুক্ত করার ওপর নির্ভর করে। একটি সেশন যত এগোতে থাকে, এই কনটেক্সট উইন্ডো তত বড় হতে থাকে, যতক্ষণ না এটি ওভারফ্লো হয় অথবা অপ্রাসঙ্গিক ঐতিহাসিক ডেটার কারণে মডেলের মনোযোগ (attention) কমে যায়।
জটিল ডেক-বিল্ডিং রোগলাইক (roguelike) Slay the Spire 2-এর বিরুদ্ধে পরীক্ষার সময় এই অদক্ষতা স্পষ্টভাবে ধরা পড়ে। STS2MCP এবং CharTyr-এর মতো প্রতিযোগী এজেন্টরা, যারা ক্লাসিক "growing-transcript" প্যাটার্ন ব্যবহার করে, তাদের ক্ষেত্রে একটি মাত্র মডেল কল প্রায় ৫,২৭,০০০ টোকেনে পৌঁছে যায়। এই আর্কিটেকচারাল ত্রুটির কারণে বিশাল ল্যাটেন্সি (latency) এবং আকাশচুম্বী টোকেন খরচ হয়; যেখানে একই স্কোর অর্জন করতে প্রতিযোগী এজেন্টরা AgenticSTS-এর তুলনায় ৬৬ থেকে ৯০ গুণ বেশি টোকেন ব্যবহার করে।
পাঁচ-স্তর বিশিষ্ট মেমরি সমাধান
AgenticSTS পাঁচটি সুসংগঠিত এবং স্বতন্ত্র মেমরি স্লট থেকে প্রতিটি ডিসিশন প্রম্পট পুনরায় তৈরি করার মাধ্যমে কনটেক্সট ইনফ্লেশন (context inflation) সমস্যার সমাধান করে। এটি নিশ্চিত করে যে গেমটি যত দীর্ঘই হোক না কেন, প্রম্পটটি সবসময় সংক্ষিপ্ত থাকে—গড়ে প্রায় ৫,০০০ টোকেনের মধ্যে। স্তরগুলো নিম্নরূপভাবে গঠিত:
- L1 (Fixed Protocol): এজেন্টের জন্য মূল নির্দেশাবলী।
- L2 (State Schemas): বর্তমানে বৈধ অ্যাকশনগুলোর সংজ্ঞা।
- L3 (Retrievable Rules): প্রয়োজন অনুযায়ী আনা নির্দিষ্ট গেম রুলস।
- L4 (Episodic Memory): দীর্ঘমেয়াদী কনটেক্সট প্রদানের জন্য পূর্ববর্তী গেমের সারসংক্ষেপ।
- L5 (Skill Library): নির্দিষ্ট পরিস্থিতি অনুযায়ী সক্রিয় হওয়া কৌশলগত নিয়ম।
এই মডুলারিটি গবেষকদের ঠিক কোন উপাদানটি পারফরম্যান্সের উন্নতি ঘটাচ্ছে তা চিহ্নিত করতে সাহায্য করে। উদাহরণস্বরূপ, শুধুমাত্র L5 skill library সক্রিয় করার মাধ্যমে A0 ডিফিকাল্টি লেভেলে এজেন্টের জয়ের হার ১০টি গেমের মধ্যে ৩টি থেকে বেড়ে ৬টিতে উন্নীত হয়েছে।
শেখার মাধ্যমে ডিফিকাল্টি স্কেল করা
এই স্ট্রাকচার্ড পদ্ধতির আসল শক্তি হলো ইন্টার-রান লার্নিং (inter-run learning)। সাধারণ এজেন্টরা যখন সর্বনিম্ন ডিফিকাল্টি লেভেল অতিক্রম করতে হিমশিম খায়, AgenticSTS তখন তার L4 এবং L5 লেয়ার ব্যবহার করে গেমের ডিফিকাল্টি লেভেল বা ধাপগুলো অতিক্রম করতে পারে। গেমের প্রতিটি রাউন্ডের মাঝে আপডেট হওয়া একটি সক্রিয় মেমরি ছাড়া এজেন্ট A2 থেকে A4 লেভেলে আটকে যায়; তবে সেশনগুলোর মধ্যে স্থায়ী মেমরি থাকলে এটি সফলভাবে অনেক কঠিন A6 থেকে A8 লেভেল পর্যন্ত পৌঁছাতে পারে।
মজার বিষয় হলো, গবেষকরা দেখেছেন যে এই মেমরি মডেল-নির্ভর। যখন Gemini 3.1 Pro দ্বারা তৈরি একটি মেমরি স্ট্যাক Qwen 3.6-27B-তে স্থানান্তর করা হয়, তখন শেষেরটির স্কোর ৮৪.৫% বৃদ্ধি পায়, কিন্তু Deepseek V4-Pro-এর স্কোর আসলে ১৮.১% কমে যায়। এটি নির্দেশ করে যে স্ট্রাকচার্ড মেমরি শক্তিশালী হলেও, এর মধ্যে থাকা "জ্ঞান" মূলত যে মডেলটি এটি তৈরি করেছে তার রিজনিং প্যাটার্নের (reasoning patterns) সাথে গভীরভাবে যুক্ত।
কেন এটি AI শিল্পের জন্য গুরুত্বপূর্ণ
AgenticSTS-এর সাফল্য এজেন্টিক ডিজাইনে একটি পরিবর্তনের ইঙ্গিত দেয়: স্বায়ত্তশাসিত (autonomous) AI-এর ভবিষ্যৎ বড় কনটেক্সট উইন্ডোতে নয়, বরং আরও বুদ্ধিমান এবং সুসংগঠিত মেমরি ম্যানেজমেন্টের মধ্যে নিহিত। দীর্ঘমেয়াদী এজেন্ট তৈরির ডেভেলপারদের জন্য, এই আর্কিটেকচারটি অপারেশনাল খরচ এবং ল্যাটেন্সি কমানোর পাশাপাশি জটিল ও বহু-ধাপ বিশিষ্ট রিজনিং করার ক্ষেত্রে মডেলের সক্ষমতা উল্লেখযোগ্যভাবে বৃদ্ধির একটি ব্লুপ্রিন্ট প্রদান করে।
মূল বিষয়সমূহ
- Efficiency Gains: AgenticSTS একটি স্থিতিশীল ৫,০০০-টোকেন প্রম্পট বজায় রাখে, যা ক্রমবর্ধমান চ্যাট লগের ওপর নির্ভরশীল এজেন্টদের তুলনায় ৯০ গুণ পর্যন্ত কম টোকেন ব্যবহার করে।
- Enhanced Performance: একটি "Skill Library" (L5) ব্যবহার করলে এজেন্টের জয়ের হার দ্বিগুণ হতে পারে এবং ইন্টার-রান লার্নিংয়ের মাধ্যমে অনেক উচ্চতর ডিফিকাল্টি টিয়ারে পৌঁছানো সম্ভব হয়।
- Architectural Shift: আনস্ট্রাকচার্ড ট্রান্সক্রিপ্ট থেকে মাল্টি-লেয়ার্ড মেমরিতে স্থানান্তরের মাধ্যমে মনোযোগের বিচ্যুতি (attention dilution) এবং মডেলের ল্যাটেন্সি বেড়ে যাওয়ার সমস্যা সমাধান করা সম্ভব হয়।
