AWS telah menambah pilihan “prefix-aware routing” kepada Amazon SageMaker Inference, yang menjanjikan kadar hit-cache yang lebih tinggi dan kependaman (latency) yang jauh lebih rendah bagi pelanggan yang menjalankan model bahasa besar (LLM) pada infrastruktur mereka sendiri. Perubahan ini penting kerana ia memberikan kependaman yang lebih rendah dan mengurangkan kos pengkomputeran GPU.

Mengapa kependaman LLM penting

Apabila LLM menerima permintaan, ia biasanya mengira semula perhatian (attention) ke atas keseluruhan prom—satu langkah kos tinggi yang meningkat dengan setiap token yang ditambah. Jika model boleh menggunakan semula cache perhatian daripada permintaan sebelumnya, ia hanya perlu memproses bahagian teks yang baharu sahaja. Beban kerja yang menghantar prom sistem yang sama secara berulang kali atau mengekalkan sejarah perbualan adalah calon utama untuk penggunaan semula cache.

Dalam tetapan SageMaker lalai, permintaan yang masuk diagihkan secara rawak merentasi kumpulan instans inferens. Pengagihan rawak bermakna permintaan yang sepatutnya boleh mencapai cache yang sedia ada (warm cache) sering kali jatuh ke atas instans yang sejuk (cold instance), memaksa pengiraan semula sepenuhnya. Hasilnya ialah kependaman yang lebih tinggi dan kitaran GPU tambahan yang diterjemahkan secara langsung kepada perbelanjaan yang lebih tinggi.

Bagaimana prefix-aware routing berfungsi

Mod penghalaan (routing) baharu ini menyimpan peta ringan bagi awalan (prefix) permintaan terkini—pada dasarnya bahagian pertama prom yang cenderung kekal malar merentasi panggilan. Apabila permintaan baharu tiba, SageMaker menyemak peta tersebut dan memajukan permintaan ke instans yang telah memproses awalan yang sama. Jika instans tersebut masih menyimpan cache perhatian yang berkaitan, model boleh melangkau sebahagian besar kerja dan menjana jawapan dengan lebih cepat.

Isi penting:

  • Tiada perubahan kod diperlukan – ciri ini terletak sepenuhnya dalam lapisan perkhidmatan inferens.
  • Hanya terpakai untuk model hos-sendiri (self-hosted) – tawaran terurus seperti API OpenAI atau perkhidmatan Anthropic tidak terjejas.
  • Telus kepada aplikasi – URL titik akhir (endpoint) SageMaker dan kontrak API yang sama tetap kekal.

Siapa yang bakal mendapat manfaat

Perusahaan yang menghoskan LLM pada SageMaker berbuat demikian atas pelbagai sebab, daripada privasi data hingga kawalan kos. Bagi mereka yang menjalankan chatbot sokongan, pembantu jualan, atau mana-mana ejen interaktif yang menggunakan prom sistem tetap secara berulang kali, pengubahsuaian penghalaan ini dapat mengurangkan purata masa tindak balas. Dari segi kos, setiap hit-cache menjimatkan GPU daripada menilai semula bahagian prom yang dikongsi.

Had dan hujah balas

Manfaat ini bergantung kepada kehadiran awalan yang berulang. Prom yang sangat berubah-ubah—seperti pertanyaan sekali guna atau mesej sistem yang dijana secara dinamik—tidak akan mendapat kelebihan hit-cache yang sama.

Oleh kerana ciri ini terhad kepada penggunaan hos-sendiri, pelanggan yang terikat dengan perkhidmatan LLM terurus tidak dapat memanfaatkannya.

Kesimpulannya: Prefix-aware routing memberikan pengguna SageMaker cara yang mudah dan tanpa kod untuk mengurangkan kependaman daripada beban kerja LLM yang berulang sambil menjimatkan kos GPU. Bagi organisasi yang sudah menghoskan model pada platform tersebut, naik taraf ini adalah pengubahsuaian berisiko rendah yang boleh diterjemahkan kepada interaksi pengguna yang lebih pantas dan bil yang lebih rendah.