چگونه حافظه ساختاریافته به عوامل هوش مصنوعی در فتح Slay the Spire 2 کمک میکند
محققان معماری عاملمحور جدیدی به نام AgenticSTS توسعه دادهاند که با جایگزینی گزارشهای چت حجیم با یک سیستم حافظه ساختاریافته و پیچیده پنجلایه، از عوامل سنتی LLM عملکرد بهتری ارائه میدهد. این رویکرد با فاصله گرفتن از مدل «رونویس رو به رشد» (growing transcript)، هزینههای توکن را به میزان قابل توجهی کاهش میدهد و در عین حال عوامل را قادر میسازد تا استراتژیهای پیچیده را در طول چندین بار بازی کردن یاد بگیرند.
مشکل گزارشهای چت رو به رشد
اکثر عوامل فعلی LLM، مانند آنهایی که از چارچوبهای ReAct یا Reflexion استفاده میکنند، بر افزودن هر مشاهده گذشته، فراخوانی ابزار و خودبازتابی (self-reflection) به یک گزارش متنی مداوم تکیه دارند. با پیشرفت یک جلسه، این پنجره بافت (context window) گسترش مییابد تا زمانی که یا پر شود (overflow) یا توجه مدل توسط دادههای تاریخی نامرتبط کاهش یابد.
در آزمایش مقابل بازی پیچیده deck-building roguelike یعنی Slay the Spire 2، این ناکارآمدی بسیار آشکار بود. رقبایی مانند STS2MCP و CharTyr که از الگوی کلاسیک رونویس رو به رشد استفاده میکنند، شاهد افزایش حجم فراخوانیهای تکمدلی به حدود ۵۲۷,۰۰۰ توکن بودند. این نقص معماری منجر به تأخیر (latency) بسیار زیاد و هزینههای نجومی توکن میشود؛ به طوری که رقبا برای دستیابی به امتیازات مشابه، ۶۶ تا ۹۰ برابر بیشتر از AgenticSTS از توکن استفاده میکنند.
راهکار حافظه پنجلایه
AgenticSTS مشکل تورم بافت (context inflation) را با بازسازی هر پرامپت تصمیمگیری از پنج اسلات حافظه مجزا و سازمانیافته حل میکند. این کار تضمین میکند که پرامپت، صرفنظر از مدت زمان بازی، سبک باقی بماند (به طور متوسط حدود ۵,۰۰۰ توکن). لایهها به شرح زیر ساختار یافتهاند:
- L1 (پروتکل ثابت): دستورالعملهای اصلی برای عامل.
- L2 (طرحهای وضعیت): تعاریف اقدامات معتبر فعلی.
- L3 (قوانین قابل بازیابی): قوانین خاص بازی که در صورت نیاز فراخوانی میشوند.
- L4 (حافظه اپیزودیک): خلاصهای از مراحل قبلی برای ارائه بافت بلندمدت.
- L5 (کتابخانه مهارت): قوانین تاکتیکی که توسط الگوهای موقعیتی خاص فعال میشوند.
این ماژولار بودن به محققان اجازه میدهد تا دقیقاً مشخص کنند کدام جزء باعث بهبود عملکرد میشود. به عنوان مثال، فعال کردن تنها کتابخانه مهارت L5، نرخ برد عامل را در سطح دشواری A0 از ۳ در ۱۰ بازی به ۶ در ۱۰ بازی افزایش داد.
افزایش سطح دشواری از طریق یادگیری
قدرت واقعی این رویکرد ساختاریافته در یادگیری بین مراحل (inter-run learning) نهفته است. در حالی که عوامل استاندارد برای پیشرفت فراتر از پایینترین سطوح دشواری با مشکل مواجه هستند، AgenticSTS از لایههای L4 و L5 خود برای بالا رفتن از نردبان دشواری بازی استفاده میکند. بدون حافظه فعالی که بین مراحل بهروزرسانی شود، عامل در سطوح A2 تا A4 متوقف میشود؛ اما با حافظهای که در طول جلسات حفظ میشود، با موفقیت به سطوح بسیار سختتر A6 تا A8 میرسد.
جالب اینجاست که محققان دریافتند این حافظه به شدت به مدل وابسته است. زمانی که یک پشته حافظه تولید شده توسط Gemini 3.1 Pro به Qwen 3.6-27B منتقل شد، امتیاز مدل دوم ۸۴.۵٪ افزایش یافت، اما امتیاز Deepseek V4-Pro در واقع ۱۸.۱٪ کاهش یافت. این نشان میدهد که اگرچه حافظه ساختاریافته قدرتمند است، اما «دانش» موجود در آن عمیقاً با الگوهای استدلالی مدلی که آن را ایجاد کرده، گره خورده است.
چرا این موضوع برای صنعت هوش مصنوعی اهمیت دارد
موفقیت AgenticSTS نشاندهنده تغییری در طراحی عاملها است: آینده هوش مصنوعی خودمختار نه در پنجرههای بافت بزرگتر، بلکه در مدیریت حافظه هوشمندتر و ساختاریافتهتر نهفته است. برای توسعهدهندگانی که عوامل طولانیمدت میسازند، این معماری نقشهای برای کاهش هزینههای عملیاتی و تأخیر، و در عین حال بهبود قابل توجه توانایی مدل در انجام استدلالهای پیچیده و چند مرحلهای ارائه میدهد.
نکات کلیدی
- افزایش کارایی: AgenticSTS یک پرامپت ثابت ۵,۰۰۰ توکنی را حفظ میکند و تا ۹۰ برابر کمتر از عواملی که به گزارشهای چت رو به رشد متکی هستند، از توکن استفاده میکند.
- بهبود عملکرد: استفاده از یک «کتابخانه مهارت» (L5) میتواند نرخ برد یک عامل را دو برابر کرده و از طریق یادگیری بین مراحل، پیشرفت به سطوح دشواری بسیار بالاتر را ممکن سازد.
- تغییر معماری: گذار از رونویسهای بدون ساختار به حافظه چندلایه، مشکلات کاهش توجه و افزایش سرسامآور تأخیر مدل را حل میکند.
