AWS قابلیت «prefix-aware routing» را به Amazon SageMaker Inference اضافه کرده است که نویدبخش نرخهای برخورد با حافظه پنهان (cache-hit) بالاتر و تأخیر بهمراتب کمتر برای مشتریانی است که مدلهای زبانی بزرگ (LLMs) را روی زیرساختهای خود اجرا میکنند. این تغییر از آن جهت اهمیت دارد که تأخیر را بهطور محسوسی کاهش داده و هزینههای محاسباتی GPU را کم میکند.
چرا تأخیر در LLM اهمیت دارد
وقتی یک LLM درخواستی دریافت میکند، معمولاً فرآیند توجه (attention) را روی کل پرامپت دوباره محاسبه میکند؛ مرحلهای هزینهبر که با اضافه شدن هر توکن، بزرگتر میشود. اگر مدل بتواند حافظه پنهان توجه (attention cache) را از درخواست قبلی بازاستفاده کند، تنها نیاز به پردازش بخش جدید متن دارد. حجم کاری که بهطور مکرر یک پرامپت سیستم یکسان را ارسال میکنند یا تاریخچه گفتگو را حفظ میکنند، کاندیداهای اصلی برای بازاستفاده از حافظه پنهان هستند.
در تنظیمات پیشفرض SageMaker، درخواستهای ورودی بهصورت تصادفی بین مجموعهای از اینستنسهای استنتاج توزیع میشوند. توزیع تصادفی به این معناست که درخواستی که میتوانست به یک حافظه پنهان گرم برخورد کند، اغلب روی یک اینستنس سرد فرود میآید و باعث محاسبات مجدد کامل میشود. نتیجه این امر، تأخیر بیشتر و سیکلهای اضافی GPU است که مستقیماً به هزینههای بالاتر منجر میشود.
مسیریابی آگاه از پیشوند (prefix-aware routing) چگونه کار میکند
حالت مسیریابی جدید، یک نقشه سبک از پیشوندهای درخواستهای اخیر نگه میدارد؛ یعنی همان بخش اول پرامپت که معمولاً در فراخوانیهای مختلف ثابت میماند. وقتی درخواست جدیدی میرسد، SageMaker نقشه را بررسی کرده و درخواست را به اینسنسی هدایت میکند که قبلاً همان پیشوند را پردازش کرده است. اگر آن اینستنس همچنان حافظه پنهان توجه مربوطه را نگه داشته باشد، مدل میتواند بخش عمده کار را نادیده گرفته و پاسخ را سریعتر تولید کند.
نکات کلیدی:
- بدون نیاز به تغییر کد – این ویژگی کاملاً در لایه سرویس استنتاج قرار دارد.
- فقط برای مدلهای self-hosted اعمال میشود – سرویسهای مدیریتشده مانند API شرکت OpenAI یا سرویس Anthropic تحت تأثیر قرار نمیگیرند.
- شفاف برای اپلیکیشنها – همان URL نقطه پایانی (endpoint) SageMaker و قرارداد API بدون تغییر باقی میمانند.
چه کسانی سود میبرند
سازمانهایی که LLMها را روی SageMaker میزبانی میکنند، به دلایلی از حفظ حریم خصوصی دادهها گرفته تا کنترل هزینهها، این کار را انجام میدهند. برای کسانی که چتباتهای پشتیبانی، دستیاران فروش یا هر عامل تعاملی دیگری را اجرا میکنند که بهطور مکرر از یک پرامپت سیستم ثابت استفاده میکند، این اصلاحِ مسیریابی میتواند میانگین زمان پاسخگویی را کاهش دهد. از نظر هزینه، هر برخورد با حافظه پنهان (cache hit)، از بازارزیابی بخش مشترک پرامپت توسط GPU جلوگیری میکند.
محدودیتها و نکات متقابل
این مزیت به وجود پیشوندهای تکراری بستگی دارد. پرامپتهایی با تغییرات زیاد – مانند پرسوجوهای یکباره یا پیامهای سیستم که بهصورت پویا تولید میشوند – از مزیت برخورد با حافظه پنهان بهرهمند نخواهند شد.
از آنجایی که این ویژگی محدود به استقرارهای self-hosted است، مشتریانی که از سرویسهای مدیریتشده LLM استفاده میکنند، نمیتوانند از آن بهرهمند شوند.
خلاصه کلام: مسیریابی آگاه از پیشوند (prefix-aware routing) راهی ساده و بدون نیاز به کد برای کاربران SageMaker فراهم میکند تا تأخیر را در حجمهای کاری تکراری LLM کاهش داده و همزمان هزینههای GPU را نیز پایین بیاورند. برای سازمانهایی که در حال حاضر مدلها را روی این پلتفرم میزبانی میکنند، این ارتقا یک تغییر کمخطر است که میتواند به تعاملات سریعتر با کاربر و قبضهای کمتر منجر شود.
