Meta AI از یک سیستم حافظه دو-عاملی (dual-agent) رونمایی کرد که نرخ موفقیت دستیارهای هوش مصنوعی خودگردان را در یک بنچمارک خط فرمان از ۳۸٪ به ۴۶٪ و در یک بنچمارک گفتگوی چند-دامنه از ۵۵٪ به ۶۲٪ افزایش می‌دهد. این بهبود از طریق جفت کردن یک مدل «عملیاتی» (action) بدون تغییر با یک مربی «حافظه» (memory) اختصاصی حاصل شده است که مراحل اخیر وظیفه را زیر نظر می‌گیرد و تنها زمانی وارد عمل می‌شود که با خطر از دست رفتن بافتار (context) مواجه شویم.

نقص پنهان در وظایف طولانی‌مدت هوش مصنوعی

وقتی یک مدل زبانی با یک مسئله چند مرحله‌ای دست و پنجه نرم می‌کند، هر نوبت متن بیشتری به تاریخچه گفتگو اضافه می‌کند. حرکت بعدی مدل باید توسط کل متن گفتگو هدایت شود، اما در عمل، حقایق مرتبط دفن می‌شوند. محققان Meta این پدیده را «زوال وضعیت رفتاری» (behavioral state decay) می‌نامند – از دست رفتن تدریجی هدفمندی عامل با بزرگ شدن پنجره بافتار (context window). صرفاً گسترش دادن پنجره مشکل را حل نمی‌کند؛ اطلاعات ممکن است وجود داشته باشند اما دیگر بر پیش‌بینی‌های مدل تأثیر نمی‌گذارند.

افزونه‌های حافظه سنتی، یک سند را بازیابی می‌کنند یا پاسخ‌ها را شخصی‌سازی می‌کنند. آن‌ها هرگز تصمیم نمی‌گیرند که چه زمانی یک قطعه از اطلاعات گذشته به اندازه کافی حیاتی است که بر اقدام فعلی تأثیر بگذارد. در نتیجه، عامل‌های خودگردانِ طولانی‌مدت دچار انحراف می‌شوند، خطاها را تکرار می‌کنند یا یک محدودیت حیاتی را که در اوایل تعامل ذکر شده بود، نادیده می‌گیرند.

جداسازی اجرا از نظارت

پاسخ Meta یک معماری آماده‌به‌کار (plug-and-play) است که موتور اجرا را از یک لایه حافظه نظارتی جدا می‌کند.

  • Action Agent – یک مدل زبانی تغییرنیافته که دستورات را صادر می‌کند، ابزارها را فراخوانی می‌کند و خروجی قابل مشاهده را تولید می‌کند. در آزمایش‌ها، این مدل Claude Sonnet 4.5 است.
  • Memory Agent – مدل دومی که به طور دوره‌ای پنجره لغزان (sliding window) از آخرین مراحل را بازبینی می‌کند. در آزمایش‌ها، این مدل Claude Opus 4.6 است.

عامل حافظه یک بانک حافظه سه بخشی را نگه می‌دارد:

  1. Private Status Field – پرچم‌های داخلی درباره پیشرفت و ریسک که عامل عملیاتی نمی‌تواند آن‌ها را ببیند.
  2. Knowledge Memory – حقایق پایدار مانند مسیرهای فایل، مقادیر پیکربندی یا نقاط پایانی (endpoints) API.
  3. Procedural Memory – گزارشی از آنچه کار کرد و آنچه شکست خورد، شامل دستورات ناموفق و اصلاحاتی که آن‌ها را حل کردند.

عامل حافظه به جای خلاصه‌سازی کل متن گفتگو، تصمیم می‌گیرد که آیا مداخله کند یا خیر. اگر تشخیص دهد که یک جزئیات حیاتی فراموش شده است، یک یادآوری مختصر را تزریق می‌کند؛ در غیر این صورت، ساکت می‌ماند و از مصرف توکن‌های اضافی و ایجاد تأخیر (latency) جلوگیری می‌کند.

بنچمارک‌ها مفهوم را اثبات می‌کنند

Meta این سیستم را روی دو مجموعه عمومی آزمایش کرد:

بنچمارک موفقیت پایه موفقیت دو-عاملی
Terminal-Bench 2.0 (command-line) 38% 46%
tau2-Bench (retail, airline, telecom) 55% 62%

این دستاوردها قابل توجه هستند زیرا همان مدل عملیاتی در هر دو ردیف ظاهر می‌شود؛ تنها لایه حافظه تغییر کرده است. در مقایسه با Mem0، یک لایه حافظه تولیدی پرکاربرد که بر جستجوی کلمات کلیدی متکی است، رویکرد Meta عملکرد بهتری داشت. در یک سناریوی شبیه‌سازی شده رزرو هواپیما، کاربر به اشتباه ادعا کرد که دارای «وضعیت طلایی» (Gold status) است. عامل حافظه متوجه عدم تطابق شد، به مدل عملیاتی یادآوری کرد که به بررسی وضعیت وفاداری تأیید شده از طریق API هواپیمایی اعتماد کند، و تراکنش به درستی انجام شد.

چرا صنعت باید توجه کند

این نتیجه مسیری را پیشنهاد می‌کند که به مدل‌های بزرگ‌تر و بزرگ‌تر وابسته نیست. با واگذاری مدیریت بافتار به یک ناظر سبک‌وزن، توسعه‌دهندگان می‌توانند قابلیت اطمینان را برای وظایفی که ده‌ها مرحله را در بر می‌گیرند – مانند عیب‌یابی نرم‌افزار، جریان‌های پیچیده خدمات مشتری یا خط لوله‌های داده خودگردان – بدون افزایش تعداد پارامترهای مدل اصلی بهبود بخشند.

برای شرکت‌هایی که عامل‌های خودگردان می‌سازند، این معماری موارد زیر را ارائه می‌دهد:

  • کاهش انحراف خطا – سیستم به طور فعال در برابر فراموش شدن محدودیت‌ها محافظت می‌کند.
  • بهره‌وری توکن – مداخلات انتخابی هستند، بنابراین مدل عملیاتی توکن‌های نامرتبط کمتری را پردازش می‌کند.
  • ارتقاهای ماژولار – مربی حافظه را می‌توان بدون بازآموزی هسته عملیاتی، با یک مدل جدیدتر جایگزین کرد.

ملاحظات و پرسش‌های بی‌پاسخ

آنچه باید در آینده زیر نظر داشت

نتیجه‌گیری: یک مربی حافظه اختصاصی می‌تواند از زوال وضعیت رفتاری جلوگیری کند و بدون بازطراحی مدل استدلال اصلی، نرخ موفقیت را با ارقام دو رقمی افزایش دهد. هزینه این کار، افزایش پیچیدگی سیستم است، اما پاداش آن – یعنی عامل‌های خودگردان قابل اعتمادتر – ممکن است ارزش تلاش مهندسی اضافی را داشته باشد.