AWS, Amazon SageMaker Inference'a, kendi altyapılarında büyük dil modelleri (LLM'ler) çalıştıran müşteriler için daha yüksek önbellek isabet oranları ve fark edilir derecede düşük gecikme süresi vaat eden bir “önek duyarlı yönlendirme” (prefix-aware routing) seçeneği ekledi. Bu değişiklik önemlidir çünkü fark edilir derecede düşük gecikme süresi ve azaltılmış GPU hesaplama maliyetleri sağlar.

LLM gecikmesi neden önemlidir

Bir LLM bir istek aldığında, normalde tüm istem (prompt) üzerinde dikkat (attention) mekanizmasını yeniden hesaplar; bu, eklenen her token ile büyüyen maliyetli bir adımdır. Eğer model, önceki bir istekten gelen dikkat önbelleğini yeniden kullanabilirse, yalnızca metnin yeni kısmını işlemesi gerekir. Sürekli aynı sistem istemini gönderen veya bir sohbet geçmişini sürdüren iş yükleri, önbellek kullanımı için birincil adaylardır.

Varsayılan SageMaker kurulumunda, gelen istekler çıkarım örnekleri (inference instances) havuzuna rastgele dağıtılır. Rastgele dağılım, sıcak bir önbelleğe (warm cache) çarpabilecek bir isteğin genellikle soğuk bir örneğe (cold instance) düşmesi ve tam bir yeniden hesaplamaya zorlanması anlamına gelir. Sonuç, daha yüksek gecikme süresi ve doğrudan daha yüksek harcamaya dönüşen ekstra GPU döngüleridir.

Önek duyarlı yönlendirme nasıl çalışır

Yeni yönlendirme modu, yakın zamandaki istek öneklerinin —temelde çağrılar arasında sabit kalma eğiliminde olan bir istemin ilk kısmı— hafif bir haritasını tutar. Yeni bir istek geldiğinde SageMaker haritayı kontrol eder ve isteği aynı öneki halihazırda işlemiş olan bir örneğe yönlendirir. Eğer örnek ilgili dikkat önbelleğini hala tutuyorsa, model işin büyük kısmını atlayabilir ve cevabı daha hızlı oluşturabilir.

Önemli noktalar:

  • Kod değişikliği gerektirmez – özellik tamamen çıkarım hizmet katmanında yer alır.
  • Yalnızca kendi barındırdığınız (self-hosted) modeller için geçerlidir – OpenAI'ın API'si veya Anthropic'in hizmeti gibi yönetilen teklifler bundan etkilenmez.
  • Uygulamalar için şeffaftır – aynı SageMaker uç nokta (endpoint) URL'si ve API sözleşmesi geçerli kalmaya devam eder.

Kimler kazançlı çıkar

LLM'leri SageMaker üzerinde barındıran kuruluşlar bunu veri gizliliğinden maliyet kontrolüne kadar çeşitli nedenlerle yaparlar. Destek sohbet robotları, satış asistanları veya sabit bir sistem istemini tekrar tekrar kullanan herhangi bir etkileşimli ajan çalıştıranlar için bu yönlendirme iyileştirmesi ortalama yanıt sürelerini azaltabilir. Maliyet tarafında ise, her önbellek isabeti (cache hit), GPU'nun istemin paylaşılan kısmını yeniden değerlendirmesini engeller.

Sınırlar ve karşı görüşler

Fayda, tekrarlanan öneklerin varlığına bağlıdır. Tek seferlik sorgular veya dinamik olarak oluşturulan sistem mesajları gibi yüksek düzeyde değişken istemler, aynı önbellek isabet avantajını görmeyecektir.

Özellik yalnızca kendi barındırılan dağıtımlarla sınırlı olduğundan, yönetilen LLM hizmetlerine bağlı kalan müşteriler bundan yararlanamaz.

Özetle: Önek duyarlı yönlendirme, SageMaker kullanıcılarına, tekrarlayan LLM iş yüklerinde gecikme sürelerini düşürürken GPU maliyetlerini de azaltmalarını sağlayan basit ve sıfır kodlu bir yol sunar. Modelleri halihazırda platformda barındıran kuruluşlar için bu yükseltme, daha hızlı kullanıcı etkileşimlerine ve daha düşük faturalara dönüşebilecek düşük riskli bir iyileştirmedir.