كشفت Meta AI عن نظام ذاكرة ثنائي الوكيل (dual-agent memory system) يرفع معدلات نجاح المساعدين الذكيين المستقلين من 38% إلى 46% في اختبار مرجعي لواجهة سطر الأوامر، ومن 55% إلى 62% في اختبار مرجعي للمحادثات متعددة المجالات. ويأتي هذا التعزيز من خلال الجمع بين نموذج "تنفيذ" (action) غير معدل ومدرب "ذاكرة" (memory) مخصص يراقب الخطوات الأخيرة للمهمة ويتدخل فقط عندما يهدد السياق بالضياع.

الخلل الخفي في مهام الذكاء الاصطناعي طويلة الأمد

عندما يتعامل نموذج لغوي مع مشكلة متعددة الخطوات، تضيف كل جولة المزيد من النصوص إلى سجل المحادثة. ومن المفترض أن تكون الخطوة التالية للنموذج مسترشدة بكامل النص، ولكن في الممارسة العملية، تُدفن الحقائق ذات الصلة. يطلق باحثو Meta على هذه الظاهرة اسم "تدهور الحالة السلوكية" (behavioral state decay) – وهو فقدان تدريجي لإدراك الوكيل لهدفه مع تضخم نافذة السياق. ولا يؤدي مجرد توسيع النافذة إلى حل المشكلة؛ فقد تكون المعلومات موجودة ولكنها لم تعد تؤثر على تنبؤات النموذج.

تقوم إضافات الذاكرة التقليدية باسترجاع وثيقة أو تخصيص الاستجابات، لكنها لا تقرر أبداً متى تكون معلومة سابقة بالغة الأهمية للتأثير على الإجراء الحالي. ونتيجة لذلك، تنحرف الوكلاء المستقلون في المهام الطويلة، أو يكررون الأخطاء، أو يتجاهلون قيداً حاسماً ذُكر في بداية التفاعل.

فصل التنفيذ عن الإشراف

حل Meta هو بنية برمجية جاهزة للتشغيل (plug-and-play) تفصل محرك التنفيذ عن طبقة ذاكرة إشرافية.

  • وكيل التنفيذ (Action Agent) – نموذج لغوي غير معدل يصدر الأوامر، ويستدعي الأدوات، وينتج المخرجات المرئية. في التجارب، تم استخدام Claude Sonnet 4.5.
  • وكيل الذاكرة (Memory Agent) – نموذج ثانٍ يراجع بشكل دوري نافذة منزلقة من أحدث الخطوات. في التجارب، تم استخدام Claude Opus 4.6.

يحتفظ وكيل الذاكرة ببنك ذاكرة مكون من ثلاثة أجزاء:

  1. حقل الحالة الخاص (Private Status Field) – علامات داخلية حول التقدم والمخاطر لا يستطيع وكيل التنفيذ رؤيتها.
  2. ذاكرة المعرفة (Knowledge Memory) – حقائق ثابتة مثل مسارات الملفات، أو قيم التكوين، أو نقاط نهاية واجهة برمجة التطبيقات (API endpoints).
  3. الذاكرة الإجرائية (Procedural Memory) – سجل لما نجح وما فشل، بما في ذلك الأوامر الفاشلة والإصلاحات التي عالجتها.

بدلاً من تلخيص النص بالكامل، يقرر وكيل الذاكرة ما إذا كان سيقوم بالتدخل. فإذا اكتشف أن تفصيلاً حاسماً قد نُسي، فإنه يدرج تذكيراً موجزاً؛ وإذا لم يكن الأمر كذلك، فإنه يظل صامتاً، متجنباً استهلاك رموز (tokens) إضافية وزيادة زمن الاستجابة (latency).

الاختبارات المرجعية تثبت المفهوم

اختبرت Meta النظام على مجموعتين عامتين:

الاختبار المرجعي نجاح النموذج الأساسي نجاح النظام ثنائي الوكيل
Terminal-Bench 2.0 (واجهة سطر الأوامر) 38% 46%
tau2-Bench (التجزئة، الطيران، الاتصالات) 55% 62%

تعد هذه المكاسب ملحوظة لأن نفس نموذج التنفيذ يظهر في كلا الصفين؛ طبقة الذاكرة هي الوحيدة التي تغيرت. وبالمقارنة مع Mem0، وهي طبقة ذاكرة مستخدمة على نطاق واسع في الإنتاج وتعتمد على البحث بالكلمات المفتاحية، كان أداء نهج Meta أفضل. ففي سيناريو محاكاة لحجز طيران، ادعى المستخدم بشكل غير صحيح امتلاكه "عضوية ذهبية" (Gold status). رصد وكيل الذاكرة عدم التطابق، وذكّر نموذج التنفيذ بالاعتماد على التحقق من حالة الولاء التي تم التحقق منها من خلال واجهة برمجة تطبيقات (API) شركة الطيران، واستمرت المعاملة بشكل صحيح.

لماذا يجب على قطاع الصناعة الاهتمام

تشير النتيجة إلى مسار للمضي قدماً لا يعتمد على نماذج أكبر فأكبر. فمن خلال نقل إدارة السياق إلى مشرف خفيف الوزن، يمكن للمطورين تحسين الموثوقية للمهام التي تمتد عبر عشرات الخطوات — مثل تصحيح البرمجيات، أو تدفقات خدمة العملاء المعقدة، أو خطوط أنابيب البيانات المستقلة — دون تضخيم عدد معاملات (parameters) النموذج الأساسي.

بالنسبة للشركات التي تبني وكلاء مستقلين، توفر هذه البنية:

  • تقليل انحراف الأخطاء – النظام يحمي بنشاط ضد القيود المنسية.
  • كفاءة الرموز (Tokens) – التدخلات انتقائية، لذا يعالج نموذج التنفيذ عدداً أقل من الرموز غير ذات الصلة.
  • ترقيات معيارية – يمكن استبدال مدرب الذاكرة بنموذج أحدث دون إعادة تدريب نواة التنفيذ.

المقايضات والأسئلة المفتوحة

ما يجب مراقبته لاحقاً

الخلاصة: يمكن لمدرب ذاكرة مخصص أن يوقف تدهور الحالة السلوكية، محققاً ارتفاعات من رقمين في معدلات النجاح دون إعادة تصميم نموذج الاستدلال الأساسي. المقايضة هي زيادة تعقيد النظام، ولكن العائد — وكلاء مستقلون أكثر موثوقية — قد يستحق الجهد الهندسي الإضافي.