تسمح وحدة "ذاكرة استباقية" جديدة لوكلاء النماذج اللغوية الكبيرة بتتبع متطلبات المهام، وحقائق البيئة، والإخفاقات السابقة—دون الحاجة إلى إجراء ضبط دقيق للنموذج الأساسي. وفي اختبارات القياس، رفعت هذه الإضافة من درجة Sonnet 4.5 بمقدار 8.3 نقطة مئوية في Terminal-Bench 2.0 وبمقدار 6.8 نقطة في مجموعة τ2-Bench؛ كما رفع وكيل ذاكرة مدرب بواسطة SETA من معدل pass@1 لنموذج مجمّد من 37.6% إلى 41.1% في المشكلات غير المرئية.

لماذا يفقد الوكلاء مسار العمل

عندما يتبع وكيل مدفوع بنموذج لغوي كبير (LLM) إجراءً متعدد الخطوات، فإن "حالته" الداخلية تتدهور. ويطلق الباحثون على هذا "تدهور الحالة السلوكية": حيث ينسى النموذج التعليمات السابقة، أو الحقائق الرئيسية، أو الأخطاء التي ارتكبها بالفعل. والنتيجة هي سلسلة من القرارات السيئة التي تؤدي إلى إجهاض المهمة قبل اكتمالها بوقت طويل.

الحل المعتاد هو توسيع نافذة السياق (context window)—وهي كتلة النص التي يمكن للنموذج الانتباه إليها في وقت واحد. لكن هذا يساعد فقط إلى أن تتجاوز المهمة حجم النافذة؛ حيث يتم التخلص من المعلومات القديمة ويستأنف التدهور مجدداً.

تذكير يعمل عند الحاجة فقط

يضيف النهج الجديد وكيل ذاكرة مساعداً خفيف الوزن يراقب مسار الاستدلال للنموذج الأساسي ويقوم بحقن تذكيرات مستهدفة. وبدلاً من سحب قائمة ثابتة من المقتطفات السابقة، تقرر وحدة الذاكرة متى وماذا تظهر، حيث تعمل فقط عندما يبدو أن النموذج الأساسي بدأ في الانحراف.

ولأن متعلم الذاكرة يتم تدريبه بشكل منفصل، يظل نموذج العمل الأساسي مجمداً. وتظهر الدراسة أن هذا الفصل لا يزال يحقق مكاسب كبيرة في اختبارات القياس طويلة المدى، مما يثبت أن التذكيرات الاستباقية يمكن أن تعوض عن نافذة السياق المحدودة.

ماذا تقول الأرقام

  • Terminal-Bench 2.0: يقفز Sonnet 4.5 بمقدار 8.3 نقطة فوق خط الأساس الخاص به.
  • τ2-Bench suite: يتحسن النموذج نفسه بمقدار 6.8 نقطة.
  • Pass@1 في الاختبارات المحجوزة: يرفع وكيل ذاكرة مدرب بواسطة SETA نموذجاً مجمداً من 37.6% إلى 41.1%.

تحدث هذه الارتفاعات دون أي ضبط دقيق إضافي للنموذج الأساسي، لذا يمكن استبدال مكون الذاكرة أو إزالته من عمليات النشر الحالية.

حدود العمل الحالي

تتوقف التجارب دون اختبار:

  • النطاق: لا يوجد دليل بعد على أن وحدة الذاكرة تتصرف بنفس الطريقة مع النماذج التي تحتوي على مليارات المعلمات أو المهام التي تستمر لملايين الخطوات.
  • تكلفة الإنتاج: يؤدي تخزين واسترجاع التذكيرات إلى زيادة الأعباء الإضافية، لكن الدراسة لا تحدد كمية الذاكرة أو الحوسبة الإضافية المطلوبة في نظام واقعي.

ما الذي يجب مراقبته لاحقاً

ستحتاج مجموعات اختبارات القياس المستقبلية إلى قياس ما هو أكثر من مجرد حجم السياق الخام. فالاختبارات التي تتبع تدهور الحالة بشكل صريح وتكافئ أنظمة التذكير النشطة ستعطي صورة أوضح عن الموثوقية طويلة الأمد للوكيل. كما يجب على الباحثين إثبات أن الذاكرة الاستباقية تتوسع بكفاءة، سواء من حيث حجم النموذج أو التكلفة التشغيلية.

الخلاصة: يمكن لوحدة ذاكرة صغيرة ومدربة بشكل منفصل أن تعمل كرقيب لوكلاء النماذج اللغوية الكبيرة، حيث تكتشف الانحراف وتصححه قبل أن يؤدي إلى إفشال المهمة.