AWS قابلیت «prefix-aware routing» را به Amazon SageMaker Inference اضافه کرده است که نویدبخش نرخ‌های برخورد با حافظه پنهان (cache-hit) بالاتر و تأخیر به‌مراتب کمتر برای مشتریانی است که مدل‌های زبانی بزرگ (LLMs) را روی زیرساخت‌های خود اجرا می‌کنند. این تغییر از آن جهت اهمیت دارد که تأخیر را به‌طور محسوسی کاهش داده و هزینه‌های محاسباتی GPU را کم می‌کند.

چرا تأخیر در LLM اهمیت دارد

وقتی یک LLM درخواستی دریافت می‌کند، معمولاً فرآیند توجه (attention) را روی کل پرامپت دوباره محاسبه می‌کند؛ مرحله‌ای هزینه‌بر که با اضافه شدن هر توکن، بزرگ‌تر می‌شود. اگر مدل بتواند حافظه پنهان توجه (attention cache) را از درخواست قبلی بازاستفاده کند، تنها نیاز به پردازش بخش جدید متن دارد. حجم کاری که به‌طور مکرر یک پرامپت سیستم یکسان را ارسال می‌کنند یا تاریخچه گفتگو را حفظ می‌کنند، کاندیداهای اصلی برای بازاستفاده از حافظه پنهان هستند.

در تنظیمات پیش‌فرض SageMaker، درخواست‌های ورودی به‌صورت تصادفی بین مجموعه‌ای از اینستنس‌های استنتاج توزیع می‌شوند. توزیع تصادفی به این معناست که درخواستی که می‌توانست به یک حافظه پنهان گرم برخورد کند، اغلب روی یک اینستنس سرد فرود می‌آید و باعث محاسبات مجدد کامل می‌شود. نتیجه این امر، تأخیر بیشتر و سیکل‌های اضافی GPU است که مستقیماً به هزینه‌های بالاتر منجر می‌شود.

مسیریابی آگاه از پیشوند (prefix-aware routing) چگونه کار می‌کند

حالت مسیریابی جدید، یک نقشه سبک از پیشوندهای درخواست‌های اخیر نگه می‌دارد؛ یعنی همان بخش اول پرامپت که معمولاً در فراخوانی‌های مختلف ثابت می‌ماند. وقتی درخواست جدیدی می‌رسد، SageMaker نقشه را بررسی کرده و درخواست را به اینسنسی هدایت می‌کند که قبلاً همان پیشوند را پردازش کرده است. اگر آن اینستنس همچنان حافظه پنهان توجه مربوطه را نگه داشته باشد، مدل می‌تواند بخش عمده کار را نادیده گرفته و پاسخ را سریع‌تر تولید کند.

نکات کلیدی:

  • بدون نیاز به تغییر کد – این ویژگی کاملاً در لایه سرویس استنتاج قرار دارد.
  • فقط برای مدل‌های self-hosted اعمال می‌شود – سرویس‌های مدیریت‌شده مانند API شرکت OpenAI یا سرویس Anthropic تحت تأثیر قرار نمی‌گیرند.
  • شفاف برای اپلیکیشن‌ها – همان URL نقطه پایانی (endpoint) SageMaker و قرارداد API بدون تغییر باقی می‌مانند.

چه کسانی سود می‌برند

سازمان‌هایی که LLMها را روی SageMaker میزبانی می‌کنند، به دلایلی از حفظ حریم خصوصی داده‌ها گرفته تا کنترل هزینه‌ها، این کار را انجام می‌دهند. برای کسانی که چت‌بات‌های پشتیبانی، دستیاران فروش یا هر عامل تعاملی دیگری را اجرا می‌کنند که به‌طور مکرر از یک پرامپت سیستم ثابت استفاده می‌کند، این اصلاحِ مسیریابی می‌تواند میانگین زمان پاسخگویی را کاهش دهد. از نظر هزینه، هر برخورد با حافظه پنهان (cache hit)، از بازارزیابی بخش مشترک پرامپت توسط GPU جلوگیری می‌کند.

محدودیت‌ها و نکات متقابل

این مزیت به وجود پیشوندهای تکراری بستگی دارد. پرامپت‌هایی با تغییرات زیاد – مانند پرس‌وجوهای یک‌باره یا پیام‌های سیستم که به‌صورت پویا تولید می‌شوند – از مزیت برخورد با حافظه پنهان بهره‌مند نخواهند شد.

از آنجایی که این ویژگی محدود به استقرار‌های self-hosted است، مشتریانی که از سرویس‌های مدیریت‌شده LLM استفاده می‌کنند، نمی‌توانند از آن بهره‌مند شوند.

خلاصه کلام: مسیریابی آگاه از پیشوند (prefix-aware routing) راهی ساده و بدون نیاز به کد برای کاربران SageMaker فراهم می‌کند تا تأخیر را در حجم‌های کاری تکراری LLM کاهش داده و همزمان هزینه‌های GPU را نیز پایین بیاورند. برای سازمان‌هایی که در حال حاضر مدل‌ها را روی این پلتفرم میزبانی می‌کنند، این ارتقا یک تغییر کم‌خطر است که می‌تواند به تعاملات سریع‌تر با کاربر و قبض‌های کمتر منجر شود.