یک ماژول جدید «حافظه پیش‌دستانه» (proactive memory) به عامل‌های مدل زبانی بزرگ اجازه می‌دهد تا الزامات وظیفه، حقایق محیطی و شکست‌های گذشته را بدون نیاز به بازتنظیم (fine-tuning) مدل اصلی دنبال کنند. در آزمون‌های معیار (benchmark)، افزودن این ماژول امتیاز Sonnet 4.5 را در Terminal-Bench 2.0 به میزان ۸.۳ واحد درصد و در مجموعه τ2-Bench به میزان ۶.۸ واحد افزایش داد؛ یک عامل حافظه آموزش‌دیده با SETA، نرخ pass@1 یک مدل منجمد (frozen model) را در مسائل دیده‌نشده از ۳۷.۶٪ به ۴۱.۱٪ رساند.

چرا عامل‌ها مسیر را گم می‌کنند

وقتی یک عامل مبتنی بر LLM یک فرآیند چندمرحله‌ای را دنبال می‌کند، «وضعیت» (state) داخلی آن دچار زوال می‌شود. پژوهشگران این پدیده را «زوال حالت رفتاری» (behavioral state decay) می‌نامند: مدل دستورالعمل‌های اولیه، حقایق کلیدی یا اشتباهاتی را که قبلاً مرتکب شده است، فراموش می‌کند. نتیجه این امر، زنجیره‌ای از تصمیمات نادرست است که باعث می‌شود یک وظیفه مدت‌ها پیش از تکمیل، متوقف شود.

راه حل معمول، بزرگ‌تر کردن پنجره بافت (context window) است؛ یعنی بخشی از متن که مدل می‌تواند در یک لحظه به آن توجه کند. این کار تنها تا زمانی کمک می‌کند که حجم وظیفه از اندازه پنجره فراتر نرود؛ پس از آن، اطلاعات قدیمی حذف شده و زوال دوباره آغاز می‌شود.

یادآوری‌ای که فقط در زمان نیاز عمل می‌کند

رویکرد جدید، یک عامل حافظه کمکی سبک‌وزن اضافه می‌کند که ردپای استدلال مدل اصلی را زیر نظر می‌گیرد و یادآوری‌های هدفمند را تزریق می‌کند. ماژول حافظه به جای فراخوانی یک لیست ایستا از قطعات گذشته، تصمیم می‌گیرد چه زمانی و چه چیزی را ارائه دهد و تنها زمانی عمل می‌کند که به نظر می‌رسد مدل اصلی در حال انحراف از مسیر است.

از آنجایی که یادگیرنده حافظه به‌طور جداگانه آموزش می‌بیند، مدل اصلیِ عمل‌کننده منجمد (frozen) باقی می‌ماند. این مطالعه نشان می‌دهد که این جداسازی همچنان دستاوردهای قابل توجهی در بنچمارک‌های با افق بلند (long-horizon) به همراه دارد و ثابت می‌کند که یادآوری‌های پیش‌دستانه می‌توانند کمبود پنجره بافت محدود را جبران کنند.

اعداد چه می‌گویند

  • Terminal-Bench 2.0: امتیاز Sonnet 4.5 نسبت به خط پایه خود ۸.۳ واحد افزایش می‌یابد.
  • مجموعه τ2-Bench: همین مدل ۶.۸ واحد بهبود می‌یابد.
  • Pass@1 در آزمون‌های جداشده: یک عامل حافظه آموزش‌دیده با SETA، یک مدل منجمد را از ۳۷.۶٪ به ۴۱.۱٪ می‌رساند.

این افزایش‌ها بدون هیچ‌گونه بازتنظیم (fine-tuning) اضافی در مدل اصلی رخ می‌دهد، بنابراین مؤلفه حافظه را می‌توان در استقرار‌های موجود جایگزین یا از آن‌ها حذف کرد.

محدودیت‌های کار فعلی

آزمایش‌ها در موارد زیر متوقف شده‌اند و شامل موارد زیر نمی‌شوند:

  • مقیاس: هنوز شواهدی وجود ندارد که نشان دهد ماژول حافظه با مدل‌های چند میلیارد پارامتری یا وظایفی که میلیون‌ها مرحله اجرا می‌شوند، به همین شکل عمل می‌کند.
  • هزینه تولید: ذخیره و بازیابی یادآوری‌ها بار اضافی (overhead) ایجاد می‌کند، اما این مطالعه میزان حافظه یا محاسبات اضافی مورد نیاز در یک سیستم واقعی را تعیین نکرده است.

آنچه باید در آینده زیر نظر داشت

مجموعه‌های بنچمارک آینده باید چیزی فراتر از اندازه خام بافت (context size) را اندازه‌گیری کنند. آزمون‌هایی که به‌طور صریح زوال حالت را ردیابی کرده و به سیستم‌های یادآوری فعال پاداش می‌دهند، تصویر روشن‌تری از قابلیت اطمینان بلندمدت یک عامل ارائه خواهند داد. پژوهشگران همچنین باید نشان دهند که حافظه پیش‌دستانه هم از نظر اندازه مدل و هم از نظر هزینه عملیاتی، به‌طور کارآمد مقیاس‌پذیر است.

نکته کلیدی: یک ماژول حافظه کوچک که به‌طور جداگانه آموزش دیده است، می‌تواند مانند یک نگهبان (watchdog) برای عامل‌های مدل زبانی بزرگ عمل کند و انحراف از مسیر را پیش از آنکه باعث شکست وظیفه شود، شناسایی و اصلاح کند.