PIVOT، وهي تقنية جديدة أثناء وقت الاستنتاج لنماذج الانتباه المتناثر (sparse-attention)، تقلل تكلفة الفهرس (indexer) بما يصل إلى أربعة أضعاف وتخفض زمن الاستجابة الإجمالي بنحو 1.6 ضعف، وكل ذلك دون المساس بأوزان النموذج. تعمل هذه التقنية عن طريق تجميع الاستعلامات والسماح لاستعلام "وسيط" (proxy query) واحد بالقيام بالعمل الشاق.
لماذا يتوقف الانتباه المتناثر عند 100 ألف رمز (tokens)
كان الهدف من الانتباه المتناثر هو السماح لنماذج المحولات (transformers) بالتعامل مع تسلسلات طويلة جدًا — مثل 100 ألف رمز أو أكثر — مع الحفاظ على تكلفة حوسبة معقولة. ولكن من الناحية العملية، يتلاشى تسريع الأداء الموعود بمجرد أن يتجاوز التسلسل بضعة عشرات الآلاف من الرموز. والسبب هو الفهرس (indexer)، الذي يقوم بتقييم كل رمز مقابل كل استعلام لتحديد الرموز التي تنتمي إلى النمط المتناثر. وتتوسع عملية عمله بمعدل O(L²) (حيث L هو طول التسلسل)، لذا عند 100 ألف رمز، يهيمن الفهرس وحده على وقت التشغيل ويقضي على أي فائدة من التناثر.
الملاحظتان وراء PIVOT
وجد الباحثون أن الاستعلامات المتجاورة تختار دائمًا تقريبًا نفس أفضل k من الرموز (top-k tokens) — بنسبة تداخل تبلغ حوالي 90%. وهذا يعني أن استعلامًا تمثيليًا واحدًا يمكن أن يحل محل دفعة كاملة من الاستعلامات المجاورة ويظل قادرًا على إظهار مجموعة مرشحين مفيدة. وتستغل PIVOT ذلك من خلال:
- تجميع عدد ثابت من الاستعلامات المتتالية (بحجم g).
- إيجاد المتوسط للمجموعة لإنشاء استعلام وسيط (proxy query).
- تشغيل الفهرس مرة واحدة على الاستعلام الوسيط بدلاً من تشغيله مرة لكل استعلام أصلي.
- تحسين قائمة المرشحين الخاصة بالاستعلام الوسيط لكل عضو في المجموعة.
تنخفض العمليات الحسابية من O(L²) إلى O(L²/g). ومع حجم مجموعة يبلغ ثمانية، يتم تشغيل الفهرس بثمانية أضعاف أقل من عمليات المسح الكامل.
وضعان للتشغيل
- PIVOT-Refine يحافظ على دقة الفهرس الكثيف (dense indexer) مع توفير زيادة في السرعة تبلغ حوالي ثلاثة أضعاف في مرحلة الفهرسة.
- PIVOT-Reuse يدفع بالسرعة إلى مستويات أبعد، مضحياً بقدر ضئيل من الدقة مقابل تحقيق أقصى قدر من زيادة معدل الإنتاجية (throughput).
تُظهر الاختبارات المرجعية على نماذج DeepSeek-V3.2 و GLM-5.1 تسريعًا ثابتًا للفهرس بمقدار أربعة أضعاف وانخفاضًا بنسبة 1.6× في زمن الاستجابة من البداية إلى النهاية عند تطبيق PIVOT أثناء الاستنتاج.
تنفيذ جاهز للاستخدام (Plug-and-play)
تأتي هذه التقنية كتنفيذ مرجعي يمكن دمجه في أي مسار عمل للانتباه المتناثر الديناميكي (DSA) الحالي. وهي لا تتطلب أي تغييرات في الأوزان، لذا فإن النماذج المدربة باستخدام وصفات الانتباه المتناثر القياسية تعمل دون تغيير. والتحفظ الوحيد هو أن الكود المرجعي يعمل على نوى GPU عامة (generic GPU kernels)؛ وستحتاج عمليات النشر في بيئات الإنتاج إلى نوى Triton أو CUDA مضبوطة يدويًا للوصول إلى كامل إمكانات السرعة.
كيف تبدو المقايضات
تأتي ميزة السرعة في PIVOT-Reuse مع انخفاض طفيف في جودة الانتباه، وهو أمر قد يهم المهام الحساسة للغاية لاختيار الرموز الدقيق. يجب على الفرق موازنة هذا الفقد مقابل ميزانية زمن الاستجابة الخاصة بهم. بالإضافة إلى ذلك، فإن الحاجة إلى نوى مخصصة تزيد من الأعباء الهندسية على المؤسسات التي تفتقر إلى الخبرة في نوى GPU.
ما الذي يجب مراقبته لاحقًا
تُظهر PIVOT أن إعادة ترتيب العمل بذكاء — من خلال تجميع الاستعلامات ومشاركة مسح وسيط — يمكن أن يعيد إحياء وعد الانتباه المتناثر للسياقات الطويلة حقًا، مما يوفر مكاسب ملموسة في السرعة دون تكلفة إعادة التدريب.
