يُظهر اختبار أداء (benchmark) حديث أن تصميم الذاكرة ثنائي الطبقات — الذي يتكون من مساحة عمل (scratchpad) تعتمد على RAM بالإضافة إلى مخزن SQLite-vec محلي — يحقق متوسط أوقات استعلام أقل من 100 مللي ثانية، مع إلغاء فاتورة الـ 135 دولارًا شهريًا المرتبطة بمخزن متجهات سحابي (cloud vector store) شهير. يمكن للمطورين الذين يبنون وكلاء ذكاء اصطناعي (AI agents) مستقلين تشغيل إعداد محلي بالكامل (on-premise)، والذي كان في هذا الاختبار أسرع ولم يتسبب في أي تكلفة شهرية.

لماذا تقصر أساليب الذاكرة الحالية؟

غالبًا ما يحتاج وكلاء الـ AI إلى استرجاع آلاف التفاعلات السابقة أو الحقائق أو نتائج استدعاء الأدوات (tool-call results) ضمن نافذة استجابة ضيقة. تقوم معظم الفرق بدفع كل تضمين (embedding) إلى قاعدة بيانات متجهات مدارة (managed vector database) والاعتماد على البحث عن المتجهات عن بُعد لكل عملية بحث. هذا النموذج قابل للتوسع، لكنه يجبر كل استعلام على المرور عبر الشبكة، مما يؤدي إلى تضخم وقت الرحلة الكاملة (round-trip time) والإنفاق الشهري. في اختبار الأداء، بلغ متوسط زمن الاستجابة (latency) للخدمة السحابية 127 مللي ثانية، وتجاوزت الفاتورة 135 دولارًا للشهر؛ كما سجلت فترة الاختبار انقطاعًا في الخدمة.

تقسيم الذاكرة إلى مستويين

تفصل البنية ثنائية المستويات بين "الذاكرة العاملة" و"التخزين طويل الأمد":

L1 Scratchpad (RAM)

  • تعمل بالكامل داخل ذاكرة العملية (process memory).
  • تحتفظ بسياق المهمة الحالية وأحدث استدعاءات الأدوات.
  • تخزن النصوص الخام (raw strings)؛ ولا يتم إنشاء أي تضمينات (embeddings).
  • تعيد النتائج في أقل من 3 مللي ثانية، وهو ما يضاهي ذاكرة التخزين المؤقت للمعالج (CPU cache).

L2 Vault (SQLite-vec)

  • تحفظ جميع التضمينات الأخرى في قاعدة بيانات SQLite محلية ممتدة بقدرات البحث عن المتجهات.
  • تتعامل مع المجموعة الكاملة المكونة من 14,726 ذاكرة مستخدمة في اختبار الأداء.
  • تعيد المطابقات في حوالي 94 مللي ثانية، وهو أقل بكثير من هدف الـ 100 مللي ثانية للعديد من الوكلاء الذين يعملون في الوقت الفعلي.
  • لا تكلف شيئًا بخلاف مساحة التخزين في الجهاز المضيف.

SQLite-vec هي إضافة مفتوحة المصدر تضيف ميزة البحث عن أقرب الجيران التقريبي (approximate nearest-neighbor search) إلى ملف علاقي قياسي. ولأن قاعدة البيانات موجودة على نفس الجهاز الذي يعمل عليه الوكيل، فلا توجد قفزة عبر الشبكة (network hop)، كما يعيد المحرك استخدام حيل فهرسة SQLite الموجودة للحفاظ على سرعة عمليات البحث.

أرقام تهمك

النظام متوسط زمن الاستجابة التكلفة الشهرية الموثوقية المسجلة
Cloud vector store (Pinecone) 127 مللي ثانية ~$135 لوحظت انقطاعات
Local SQLite-vec vault 94 مللي ثانية $0 وقت تشغيل 100%

فرق التكلفة هو 0 دولار مقابل حوالي 135 دولارًا شهريًا.

الحفاظ على ترتيب المخزن

يمكن أن يؤدي التفريغ الخام لجميع التضمينات إلى إضعاف الصلة (relevance). قدم مؤلف اختبار الأداء نظام اضمحلال (decay system) يقوم بتقييم الذكريات بناءً على الحداثة والتكرار:

  • تحصل العناصر الجديدة أو التي يتم الوصول إليها بشكل متكرر على وزن أعلى.
  • العناصر التي لم يتم استخدامها لفترة تفقد وزنها تدريجيًا.
  • يقلل الاضمحلال الموزون من "ضوضاء الاسترجاع" (retrieval noise) — أي المطابقات غير ذات الصلة — بنسبة 34%.

من خلال تقليم المدخلات ذات الدرجات المنخفضة أو خفض رتبتها في الفهرس، يتجنب الوكيل البيانات القديمة مع الحفاظ على خفة المخزن بما يكفي لضمان أداء ثابت.

الخلاصة

بالنسبة لوكلاء الـ AI الذين يتعين عليهم التعامل مع آلاف الذكريات تحت ضغط الوقت، فإن استخدام مساحة عمل (scratchpad) تعتمد على RAM أولاً مقترنة بمخزن SQLite-vec محلي يوفر بديلًا عمليًا لمخازن المتجهات السحابية بالكامل. يقلل هذا النهج من أوقات الاستجابة، ويلغي رسوم السحابة المتكررة، ويقدم خدمة غير منقطعة، كل ذلك مع الحفاظ على القدرة على تقليم البيانات غير ذات الصلة. وبالتالي، فإن اعتماد النموذج ثنائي المستويات يمكن أن يجعل الوكلاء أسرع وأرخص وأكثر موثوقية.