أضافت AWS خيار "التوجيه المدرك للبادئة" (prefix-aware routing) إلى Amazon SageMaker Inference، مما يعد بمعدلات إصابة ذاكرة تخزين مؤقت (cache-hit rates) أعلى وزمن استجابة (latency) أقل بشكل ملحوظ للعملاء الذين يشغلون النماذج اللغوية الكبيرة (LLMs) على بنيتهم التحتية الخاصة. هذا التغيير مهم لأنه يوفر زمن استجابة أقل بشكل ملحوظ ويقلل من تكاليف حوسبة الـ GPU.
لماذا يهم زمن استجابة LLM
عندما يتلقى نموذج LLM طلباً، فإنه يقوم عادةً بإعادة حساب الانتباه (attention) عبر المطالبة (prompt) بأكملها — وهي خطوة مكلفة تزداد مع كل رمز (token) مضاف. إذا تمكن النموذج من إعادة استخدام ذاكرة التخزين المؤقت للانتباه (attention cache) من طلب سابق، فسيحتاج فقط إلى معالجة الجزء الجديد من النص. وتعد أعباء العمل التي ترسل نفس المطالبة النظامية (system prompt) بشكل متكرر أو تحافظ على سجل المحادثة مرشحة مثالية لإعادة استخدام ذاكرة التخزين المؤقت.
في إعداد SageMaker الافتراضي، يتم توزيع الطلبات الواردة عشوائياً عبر مجموعة مثيلات الاستدلال (inference instances). ويعني التوزيع العشوائي أن الطلب الذي كان من الممكن أن يصيب ذاكرة تخزين مؤقت "دافئة" (warm cache) غالباً ما ينتهي به الأمر في مثيل "بارد" (cold instance)، مما يفرض إعادة حساب كاملة. والنتيجة هي زمن استجابة أعلى ودورات GPU إضافية تترجم مباشرة إلى إنفاق أعلى.
كيف يعمل التوجيه المدرك للبادئة (prefix-aware routing)
يعمل وضع التوجيه الجديد على الاحتفاظ بخريطة خفيفة للبادئات (prefixes) الأخيرة للطلبات — وهي في الأساس الجزء الأول من المطالبة الذي يميل إلى البقاء ثابتاً عبر الاستدعاءات. عندما يصل طلب جديد، يتحقق SageMaker من الخريطة ويوجه الطلب إلى مثيل قام بالفعل بمعالجة نفس البادئة. إذا كان المثيل لا يزال يحتفظ بذاكرة التخزين المؤقت للانتباه ذات الصلة، فيمكن للنموذج تخطي الجزء الأكبر من العمل وتوليد الإجابة بشكل أسرع.
نقاط رئيسية:
- لا يتطلب تغييرات في الكود – الميزة موجودة بالكامل في طبقة خدمة الاستدلال.
- ينطبق فقط على النماذج المستضافة ذاتياً – الخدمات المدارة مثل واجهة برمجة تطبيقات OpenAI أو خدمة Anthropic لا تتأثر.
- شفاف للتطبيقات – يظل رابط SageMaker endpoint وعقد واجهة برمجة التطبيقات (API contract) كما هو دون تغيير.
من المستفيد؟
تقوم المؤسسات التي تستضيف نماذج LLM على SageMaker بذلك لأسباب تتراوح من خصوصية البيانات إلى التحكم في التكاليف. بالنسبة لأولئك الذين يشغلون روبوتات الدردشة للدعم، أو مساعدي المبيعات، أو أي وكيل تفاعلي يستخدم مطالبة نظامية ثابتة بشكل متكرر، يمكن لتعديل التوجيه أن يقلل متوسط أوقات الاستجابة. ومن ناحية التكلفة، فإن كل إصابة لذاكرة التخزين المؤقت توفر للـ GPU عناء إعادة تقييم الجزء المشترك من المطالبة.
القيود والنقاط المقابلة
تعتمد الفائدة على وجود بادئات متكررة. أما المطالبات شديدة التباين — مثل الاستعلامات التي تتم لمرة واحدة أو الرسائل النظامية التي يتم إنشاؤها ديناميكياً — فلن تشهد نفس ميزة إصابة ذاكرة التخزين المؤقت.
وبما أن الميزة تقتصر على عمليات النشر المستضافة ذاتياً، فإن العملاء المرتبطين بخدمات LLM المدارة لا يمكنهم الاستفادة منها.
الخلاصة: يمنح التوجيه المدرك للبادئة (prefix-aware routing) مستخدمي SageMaker طريقة بسيطة ولا تتطلب كتابة كود لتقليل زمن الاستجابة في أعباء عمل LLM المتكررة مع خفض تكاليف الـ GPU. بالنسبة للمؤسسات التي تستضيف النماذج بالفعل على المنصة، فإن هذا التحديث هو تعديل منخفض المخاطر يمكن أن يترجم إلى تفاعلات أسرع مع المستخدمين وفواتير أقل.
