یک ماژول جدید «حافظه پیشدستانه» (proactive memory) به عاملهای مدل زبانی بزرگ اجازه میدهد تا الزامات وظیفه، حقایق محیطی و شکستهای گذشته را بدون نیاز به بازتنظیم (fine-tuning) مدل اصلی دنبال کنند. در آزمونهای معیار (benchmark)، افزودن این ماژول امتیاز Sonnet 4.5 را در Terminal-Bench 2.0 به میزان ۸.۳ واحد درصد و در مجموعه τ2-Bench به میزان ۶.۸ واحد افزایش داد؛ یک عامل حافظه آموزشدیده با SETA، نرخ pass@1 یک مدل منجمد (frozen model) را در مسائل دیدهنشده از ۳۷.۶٪ به ۴۱.۱٪ رساند.
چرا عاملها مسیر را گم میکنند
وقتی یک عامل مبتنی بر LLM یک فرآیند چندمرحلهای را دنبال میکند، «وضعیت» (state) داخلی آن دچار زوال میشود. پژوهشگران این پدیده را «زوال حالت رفتاری» (behavioral state decay) مینامند: مدل دستورالعملهای اولیه، حقایق کلیدی یا اشتباهاتی را که قبلاً مرتکب شده است، فراموش میکند. نتیجه این امر، زنجیرهای از تصمیمات نادرست است که باعث میشود یک وظیفه مدتها پیش از تکمیل، متوقف شود.
راه حل معمول، بزرگتر کردن پنجره بافت (context window) است؛ یعنی بخشی از متن که مدل میتواند در یک لحظه به آن توجه کند. این کار تنها تا زمانی کمک میکند که حجم وظیفه از اندازه پنجره فراتر نرود؛ پس از آن، اطلاعات قدیمی حذف شده و زوال دوباره آغاز میشود.
یادآوریای که فقط در زمان نیاز عمل میکند
رویکرد جدید، یک عامل حافظه کمکی سبکوزن اضافه میکند که ردپای استدلال مدل اصلی را زیر نظر میگیرد و یادآوریهای هدفمند را تزریق میکند. ماژول حافظه به جای فراخوانی یک لیست ایستا از قطعات گذشته، تصمیم میگیرد چه زمانی و چه چیزی را ارائه دهد و تنها زمانی عمل میکند که به نظر میرسد مدل اصلی در حال انحراف از مسیر است.
از آنجایی که یادگیرنده حافظه بهطور جداگانه آموزش میبیند، مدل اصلیِ عملکننده منجمد (frozen) باقی میماند. این مطالعه نشان میدهد که این جداسازی همچنان دستاوردهای قابل توجهی در بنچمارکهای با افق بلند (long-horizon) به همراه دارد و ثابت میکند که یادآوریهای پیشدستانه میتوانند کمبود پنجره بافت محدود را جبران کنند.
اعداد چه میگویند
- Terminal-Bench 2.0: امتیاز Sonnet 4.5 نسبت به خط پایه خود ۸.۳ واحد افزایش مییابد.
- مجموعه τ2-Bench: همین مدل ۶.۸ واحد بهبود مییابد.
- Pass@1 در آزمونهای جداشده: یک عامل حافظه آموزشدیده با SETA، یک مدل منجمد را از ۳۷.۶٪ به ۴۱.۱٪ میرساند.
این افزایشها بدون هیچگونه بازتنظیم (fine-tuning) اضافی در مدل اصلی رخ میدهد، بنابراین مؤلفه حافظه را میتوان در استقرارهای موجود جایگزین یا از آنها حذف کرد.
محدودیتهای کار فعلی
آزمایشها در موارد زیر متوقف شدهاند و شامل موارد زیر نمیشوند:
- مقیاس: هنوز شواهدی وجود ندارد که نشان دهد ماژول حافظه با مدلهای چند میلیارد پارامتری یا وظایفی که میلیونها مرحله اجرا میشوند، به همین شکل عمل میکند.
- هزینه تولید: ذخیره و بازیابی یادآوریها بار اضافی (overhead) ایجاد میکند، اما این مطالعه میزان حافظه یا محاسبات اضافی مورد نیاز در یک سیستم واقعی را تعیین نکرده است.
آنچه باید در آینده زیر نظر داشت
مجموعههای بنچمارک آینده باید چیزی فراتر از اندازه خام بافت (context size) را اندازهگیری کنند. آزمونهایی که بهطور صریح زوال حالت را ردیابی کرده و به سیستمهای یادآوری فعال پاداش میدهند، تصویر روشنتری از قابلیت اطمینان بلندمدت یک عامل ارائه خواهند داد. پژوهشگران همچنین باید نشان دهند که حافظه پیشدستانه هم از نظر اندازه مدل و هم از نظر هزینه عملیاتی، بهطور کارآمد مقیاسپذیر است.
نکته کلیدی: یک ماژول حافظه کوچک که بهطور جداگانه آموزش دیده است، میتواند مانند یک نگهبان (watchdog) برای عاملهای مدل زبانی بزرگ عمل کند و انحراف از مسیر را پیش از آنکه باعث شکست وظیفه شود، شناسایی و اصلاح کند.
