AWS telah menambahkan opsi “prefix-aware routing” ke Amazon SageMaker Inference, yang menjanjikan tingkat cache-hit yang lebih tinggi dan latensi yang jauh lebih rendah bagi pelanggan yang menjalankan large language models (LLM) pada infrastruktur mereka sendiri. Perubahan ini penting karena memberikan latensi yang jauh lebih rendah dan pengurangan biaya komputasi GPU.

Mengapa latensi LLM itu penting

Saat sebuah LLM menerima permintaan, ia biasanya menghitung ulang attention pada seluruh prompt—sebuah langkah yang memakan biaya dan meningkat seiring dengan setiap token yang ditambahkan. Jika model dapat menggunakan kembali attention cache dari permintaan sebelumnya, ia hanya perlu memproses bagian teks yang baru. Beban kerja yang berulang kali mengirimkan system prompt yang sama atau mempertahankan riwayat percakapan adalah kandidat utama untuk penggunaan kembali cache.

Dalam pengaturan SageMaker default, permintaan yang masuk didistribusikan secara acak ke seluruh kumpulan instance inference. Distribusi acak berarti permintaan yang seharusnya bisa mengenai cache yang hangat (warm cache) sering kali mendarat di instance yang dingin (cold instance), sehingga memaksa penghitungan ulang secara penuh. Hasilnya adalah latensi yang lebih tinggi dan siklus GPU tambahan yang berdampak langsung pada pengeluaran yang lebih tinggi.

Cara kerja prefix-aware routing

Mode routing baru ini menyimpan peta ringan (lightweight map) dari awalan permintaan (request prefixes) terbaru—yang pada dasarnya adalah bagian pertama dari prompt yang cenderung tetap konstan di berbagai panggilan. Ketika permintaan baru tiba, SageMaker memeriksa peta tersebut dan meneruskan permintaan ke instance yang telah memproses awalan yang sama. Jika instance tersebut masih menyimpan attention cache yang relevan, model dapat melewati sebagian besar pekerjaan dan menghasilkan jawaban lebih cepat.

Poin-poin utama:

  • Tidak memerlukan perubahan kode – fitur ini sepenuhnya berada di lapisan layanan inference.
  • Hanya berlaku untuk model yang di-host sendiri (self-hosted) – penawaran terkelola seperti API OpenAI atau layanan Anthropic tidak terpengaruh.
  • Transparan bagi aplikasi – URL endpoint SageMaker dan kontrak API yang sama tetap berlaku.

Siapa yang akan diuntungkan

Perusahaan yang menghosting LLM di SageMaker melakukannya karena berbagai alasan, mulai dari privasi data hingga pengendalian biaya. Bagi mereka yang menjalankan chatbot dukungan, asisten penjualan, atau agen interaktif apa pun yang berulang kali menggunakan system prompt yang tetap, penyesuaian routing ini dapat mengurangi waktu respons rata-rata. Dari sisi biaya, setiap cache hit menghemat GPU dari mengevaluasi ulang bagian prompt yang digunakan bersama.

Batasan dan poin sanggahan

Manfaatnya bergantung pada keberadaan awalan yang berulang. Prompt yang sangat bervariasi—seperti kueri sekali pakai atau pesan sistem yang dihasilkan secara dinamis—tidak akan melihat keuntungan cache-hit yang sama.

Karena fitur ini terbatas pada deployment yang di-host sendiri, pelanggan yang terkunci pada layanan LLM terkelola tidak dapat memanfaatkannya.

Intinya: Prefix-aware routing memberikan pengguna SageMaker cara yang sederhana dan tanpa kode untuk meminimalkan latensi pada beban kerja LLM yang repetitif sekaligus mengurangi biaya GPU. Bagi organisasi yang sudah menghosting model di platform tersebut, peningkatan ini adalah penyesuaian berisiko rendah yang dapat menghasilkan interaksi pengguna yang lebih cepat dan tagihan yang lebih rendah.