Meta AI از یک سیستم حافظه دو-عاملی (dual-agent) رونمایی کرد که نرخ موفقیت دستیارهای هوش مصنوعی خودگردان را در یک بنچمارک خط فرمان از ۳۸٪ به ۴۶٪ و در یک بنچمارک گفتگوی چند-دامنه از ۵۵٪ به ۶۲٪ افزایش میدهد. این بهبود از طریق جفت کردن یک مدل «عملیاتی» (action) بدون تغییر با یک مربی «حافظه» (memory) اختصاصی حاصل شده است که مراحل اخیر وظیفه را زیر نظر میگیرد و تنها زمانی وارد عمل میشود که با خطر از دست رفتن بافتار (context) مواجه شویم.
نقص پنهان در وظایف طولانیمدت هوش مصنوعی
وقتی یک مدل زبانی با یک مسئله چند مرحلهای دست و پنجه نرم میکند، هر نوبت متن بیشتری به تاریخچه گفتگو اضافه میکند. حرکت بعدی مدل باید توسط کل متن گفتگو هدایت شود، اما در عمل، حقایق مرتبط دفن میشوند. محققان Meta این پدیده را «زوال وضعیت رفتاری» (behavioral state decay) مینامند – از دست رفتن تدریجی هدفمندی عامل با بزرگ شدن پنجره بافتار (context window). صرفاً گسترش دادن پنجره مشکل را حل نمیکند؛ اطلاعات ممکن است وجود داشته باشند اما دیگر بر پیشبینیهای مدل تأثیر نمیگذارند.
افزونههای حافظه سنتی، یک سند را بازیابی میکنند یا پاسخها را شخصیسازی میکنند. آنها هرگز تصمیم نمیگیرند که چه زمانی یک قطعه از اطلاعات گذشته به اندازه کافی حیاتی است که بر اقدام فعلی تأثیر بگذارد. در نتیجه، عاملهای خودگردانِ طولانیمدت دچار انحراف میشوند، خطاها را تکرار میکنند یا یک محدودیت حیاتی را که در اوایل تعامل ذکر شده بود، نادیده میگیرند.
جداسازی اجرا از نظارت
پاسخ Meta یک معماری آمادهبهکار (plug-and-play) است که موتور اجرا را از یک لایه حافظه نظارتی جدا میکند.
- Action Agent – یک مدل زبانی تغییرنیافته که دستورات را صادر میکند، ابزارها را فراخوانی میکند و خروجی قابل مشاهده را تولید میکند. در آزمایشها، این مدل Claude Sonnet 4.5 است.
- Memory Agent – مدل دومی که به طور دورهای پنجره لغزان (sliding window) از آخرین مراحل را بازبینی میکند. در آزمایشها، این مدل Claude Opus 4.6 است.
عامل حافظه یک بانک حافظه سه بخشی را نگه میدارد:
- Private Status Field – پرچمهای داخلی درباره پیشرفت و ریسک که عامل عملیاتی نمیتواند آنها را ببیند.
- Knowledge Memory – حقایق پایدار مانند مسیرهای فایل، مقادیر پیکربندی یا نقاط پایانی (endpoints) API.
- Procedural Memory – گزارشی از آنچه کار کرد و آنچه شکست خورد، شامل دستورات ناموفق و اصلاحاتی که آنها را حل کردند.
عامل حافظه به جای خلاصهسازی کل متن گفتگو، تصمیم میگیرد که آیا مداخله کند یا خیر. اگر تشخیص دهد که یک جزئیات حیاتی فراموش شده است، یک یادآوری مختصر را تزریق میکند؛ در غیر این صورت، ساکت میماند و از مصرف توکنهای اضافی و ایجاد تأخیر (latency) جلوگیری میکند.
بنچمارکها مفهوم را اثبات میکنند
Meta این سیستم را روی دو مجموعه عمومی آزمایش کرد:
| بنچمارک | موفقیت پایه | موفقیت دو-عاملی |
|---|---|---|
| Terminal-Bench 2.0 (command-line) | 38% | 46% |
| tau2-Bench (retail, airline, telecom) | 55% | 62% |
این دستاوردها قابل توجه هستند زیرا همان مدل عملیاتی در هر دو ردیف ظاهر میشود؛ تنها لایه حافظه تغییر کرده است. در مقایسه با Mem0، یک لایه حافظه تولیدی پرکاربرد که بر جستجوی کلمات کلیدی متکی است، رویکرد Meta عملکرد بهتری داشت. در یک سناریوی شبیهسازی شده رزرو هواپیما، کاربر به اشتباه ادعا کرد که دارای «وضعیت طلایی» (Gold status) است. عامل حافظه متوجه عدم تطابق شد، به مدل عملیاتی یادآوری کرد که به بررسی وضعیت وفاداری تأیید شده از طریق API هواپیمایی اعتماد کند، و تراکنش به درستی انجام شد.
چرا صنعت باید توجه کند
این نتیجه مسیری را پیشنهاد میکند که به مدلهای بزرگتر و بزرگتر وابسته نیست. با واگذاری مدیریت بافتار به یک ناظر سبکوزن، توسعهدهندگان میتوانند قابلیت اطمینان را برای وظایفی که دهها مرحله را در بر میگیرند – مانند عیبیابی نرمافزار، جریانهای پیچیده خدمات مشتری یا خط لولههای داده خودگردان – بدون افزایش تعداد پارامترهای مدل اصلی بهبود بخشند.
برای شرکتهایی که عاملهای خودگردان میسازند، این معماری موارد زیر را ارائه میدهد:
- کاهش انحراف خطا – سیستم به طور فعال در برابر فراموش شدن محدودیتها محافظت میکند.
- بهرهوری توکن – مداخلات انتخابی هستند، بنابراین مدل عملیاتی توکنهای نامرتبط کمتری را پردازش میکند.
- ارتقاهای ماژولار – مربی حافظه را میتوان بدون بازآموزی هسته عملیاتی، با یک مدل جدیدتر جایگزین کرد.
ملاحظات و پرسشهای بیپاسخ
آنچه باید در آینده زیر نظر داشت
نتیجهگیری: یک مربی حافظه اختصاصی میتواند از زوال وضعیت رفتاری جلوگیری کند و بدون بازطراحی مدل استدلال اصلی، نرخ موفقیت را با ارقام دو رقمی افزایش دهد. هزینه این کار، افزایش پیچیدگی سیستم است، اما پاداش آن – یعنی عاملهای خودگردان قابل اعتمادتر – ممکن است ارزش تلاش مهندسی اضافی را داشته باشد.
