چگونه حافظه ساختاریافته به عوامل هوش مصنوعی در فتح Slay the Spire 2 کمک می‌کند

محققان معماری عامل‌محور جدیدی به نام AgenticSTS توسعه داده‌اند که با جایگزینی گزارش‌های چت حجیم با یک سیستم حافظه ساختاریافته و پیچیده پنج‌لایه، از عوامل سنتی LLM عملکرد بهتری ارائه می‌دهد. این رویکرد با فاصله گرفتن از مدل «رونویس رو به رشد» (growing transcript)، هزینه‌های توکن را به میزان قابل توجهی کاهش می‌دهد و در عین حال عوامل را قادر می‌سازد تا استراتژی‌های پیچیده را در طول چندین بار بازی کردن یاد بگیرند.

مشکل گزارش‌های چت رو به رشد

اکثر عوامل فعلی LLM، مانند آن‌هایی که از چارچوب‌های ReAct یا Reflexion استفاده می‌کنند، بر افزودن هر مشاهده گذشته، فراخوانی ابزار و خودبازتابی (self-reflection) به یک گزارش متنی مداوم تکیه دارند. با پیشرفت یک جلسه، این پنجره بافت (context window) گسترش می‌یابد تا زمانی که یا پر شود (overflow) یا توجه مدل توسط داده‌های تاریخی نامرتبط کاهش یابد.

در آزمایش مقابل بازی پیچیده deck-building roguelike یعنی Slay the Spire 2، این ناکارآمدی بسیار آشکار بود. رقبایی مانند STS2MCP و CharTyr که از الگوی کلاسیک رونویس رو به رشد استفاده می‌کنند، شاهد افزایش حجم فراخوانی‌های تک‌مدلی به حدود ۵۲۷,۰۰۰ توکن بودند. این نقص معماری منجر به تأخیر (latency) بسیار زیاد و هزینه‌های نجومی توکن می‌شود؛ به طوری که رقبا برای دستیابی به امتیازات مشابه، ۶۶ تا ۹۰ برابر بیشتر از AgenticSTS از توکن استفاده می‌کنند.

راهکار حافظه پنج‌لایه

AgenticSTS مشکل تورم بافت (context inflation) را با بازسازی هر پرامپت تصمیم‌گیری از پنج اسلات حافظه مجزا و سازمان‌یافته حل می‌کند. این کار تضمین می‌کند که پرامپت، صرف‌نظر از مدت زمان بازی، سبک باقی بماند (به طور متوسط حدود ۵,۰۰۰ توکن). لایه‌ها به شرح زیر ساختار یافته‌اند:

  • L1 (پروتکل ثابت): دستورالعمل‌های اصلی برای عامل.
  • L2 (طرح‌های وضعیت): تعاریف اقدامات معتبر فعلی.
  • L3 (قوانین قابل بازیابی): قوانین خاص بازی که در صورت نیاز فراخوانی می‌شوند.
  • L4 (حافظه اپیزودیک): خلاصه‌ای از مراحل قبلی برای ارائه بافت بلندمدت.
  • L5 (کتابخانه مهارت): قوانین تاکتیکی که توسط الگوهای موقعیتی خاص فعال می‌شوند.

این ماژولار بودن به محققان اجازه می‌دهد تا دقیقاً مشخص کنند کدام جزء باعث بهبود عملکرد می‌شود. به عنوان مثال، فعال کردن تنها کتابخانه مهارت L5، نرخ برد عامل را در سطح دشواری A0 از ۳ در ۱۰ بازی به ۶ در ۱۰ بازی افزایش داد.

افزایش سطح دشواری از طریق یادگیری

قدرت واقعی این رویکرد ساختاریافته در یادگیری بین مراحل (inter-run learning) نهفته است. در حالی که عوامل استاندارد برای پیشرفت فراتر از پایین‌ترین سطوح دشواری با مشکل مواجه هستند، AgenticSTS از لایه‌های L4 و L5 خود برای بالا رفتن از نردبان دشواری بازی استفاده می‌کند. بدون حافظه فعالی که بین مراحل به‌روزرسانی شود، عامل در سطوح A2 تا A4 متوقف می‌شود؛ اما با حافظه‌ای که در طول جلسات حفظ می‌شود، با موفقیت به سطوح بسیار سخت‌تر A6 تا A8 می‌رسد.

جالب اینجاست که محققان دریافتند این حافظه به شدت به مدل وابسته است. زمانی که یک پشته حافظه تولید شده توسط Gemini 3.1 Pro به Qwen 3.6-27B منتقل شد، امتیاز مدل دوم ۸۴.۵٪ افزایش یافت، اما امتیاز Deepseek V4-Pro در واقع ۱۸.۱٪ کاهش یافت. این نشان می‌دهد که اگرچه حافظه ساختاریافته قدرتمند است، اما «دانش» موجود در آن عمیقاً با الگوهای استدلالی مدلی که آن را ایجاد کرده، گره خورده است.

چرا این موضوع برای صنعت هوش مصنوعی اهمیت دارد

موفقیت AgenticSTS نشان‌دهنده تغییری در طراحی عامل‌ها است: آینده هوش مصنوعی خودمختار نه در پنجره‌های بافت بزرگتر، بلکه در مدیریت حافظه هوشمندتر و ساختاریافته‌تر نهفته است. برای توسعه‌دهندگانی که عوامل طولانی‌مدت می‌سازند، این معماری نقشه‌ای برای کاهش هزینه‌های عملیاتی و تأخیر، و در عین حال بهبود قابل توجه توانایی مدل در انجام استدلال‌های پیچیده و چند مرحله‌ای ارائه می‌دهد.

نکات کلیدی

  • افزایش کارایی: AgenticSTS یک پرامپت ثابت ۵,۰۰۰ توکنی را حفظ می‌کند و تا ۹۰ برابر کمتر از عواملی که به گزارش‌های چت رو به رشد متکی هستند، از توکن استفاده می‌کند.
  • بهبود عملکرد: استفاده از یک «کتابخانه مهارت» (L5) می‌تواند نرخ برد یک عامل را دو برابر کرده و از طریق یادگیری بین مراحل، پیشرفت به سطوح دشواری بسیار بالاتر را ممکن سازد.
  • تغییر معماری: گذار از رونویس‌های بدون ساختار به حافظه چندلایه، مشکلات کاهش توجه و افزایش سرسام‌آور تأخیر مدل را حل می‌کند.