Fatura neden kabardı

Ekip üretken yapay zekayı ilk eklediğinde, her kullanıcı isteğini en yeni ve en yetenekli modele gönderiyordu. Trafik arttıkça, istek başına maliyetler de aynı oranda yükseldi ve CFO'nun hesap çizelgesi, harcamaların kullanıcı büyümesini geride bıraktığını gösterdi. Alışılagelmiş hızlı çözüm olan "sadece daha ucuz bir model kullan" yaklaşımı, üretim ortamında başarısız oluyor; çünkü farklı sorgular farklı akıl yürütme seviyelerine ihtiyaç duyar. Asıl kaldıraç, her zaman hangi modelin kullanıldığı değil, isteğin nasıl gönderildiğidir.

Tasarruf sağlayan bir yönlendirme katmanı oluşturmak

Mühendis, çıkarım (inference) servisini diğer tüm üretim bileşenleri gibi ele aldı: katmanları tanımladı, SLA'ları belirledi ve gecikme (latency) bütçelerini uyguladı. Ortaya çıkan mimari, birlikte %95 oranında tasarruf sağlayan dört hareketli parçadan oluşuyor.

Kademeli yönlendirme

İnce bir ön uç (front-end), gelen her isteği zorluk derecesine göre sınıflandırır. Sorguların yaklaşık %95'i, mütevazı bir model çalıştıran "ucuz" bir katmana düşer; sadece en zor %5'lik kısım premium bir modele yükseltilir. Sınıflandırma, kural tabanlı (örneğin uzunluk, alana özgü anahtar kelimelerin varlığı) olabilir veya geçmiş yükseltme verilerinden öğrenilebilir. Varsayılan olarak düşük maliyetli katman seçilerek, chatbot'un aylık maliyeti 420 dolardan 28 dolara düştü.

Modeli doğru boyutlandırma

Model yeteneğini görev karmaşıklığıyla eşleştirmek en büyük tasarrufu sağlar:

  • Basit sohbet – amiral gemisi model yerine hafif bir model kullanın (%97,5 tasarruf).
  • Sınıflandırma – orta ölçekli bir model yerine daha ucuz bir alternatif kullanın (%98,3 tasarruf).
  • Özetleme – üst düzey modeli orta segment bir modelle değiştirin (%97,2 tasarruf).

Tam model isimleri kritik değildir; temel ilke, en yetenekli modeli gerçekten ihtiyaç duyan az sayıdaki sorgu için yedekte tutmaktır.

Akıllı önbelleğe alma

Her önbellek isabeti (cache hit), bir ağ çağrısını ve bir API ücretini ortadan kaldırır. Dağıtık bir Redis önbelleği, başarılı yanıtların yanı sıra "negatif" yanıtları da ("Bilmiyorum") saklar. Aynı cevapsız soru tekrar ortaya çıktığında, sistem modeli ikinci kez çağırmak yerine önbelleğe alınmış "Bilmiyorum" yanıtını döndürür. Binlerce istek boyunca, sadece bu işlem bile faturadan fark edilir bir miktarı keser.

Prompt sıkıştırma

Uzun promptlar token kullanımını artırır, bu da doğrudan maliyete yansır. Ekip, istemci tarafında veya bir ön işleme adımında ucuz bir özetleyici çalıştırarak, 2.000 tokenlık bir bağlamı pahalı modele ulaşmadan önce yaklaşık 400 token'a indirir. Token azaltımı tüm isteklerde katlanarak artar ve son kullanıcı deneyimini değiştirmeden devasa tasarruf sağlar.

Stratejik toplu işleme

Toplu işleme (batching), birden fazla bağımsız isteği tek bir API çağrısında gruplandırır. Temel kural basittir: Eğer bir kullanıcı cevap bekliyorsa toplu işlem yapmayın; eğer istek arka planda çalışıyorsa (gece raporları, planlanmış işler), her şeyi toplu işleyin. Sadece gece yapılan toplu işler bile harcamadan %10-20 daha tasarruf sağlar.

Optimizasyon döngüsünü izlemek

Ölçemediğiniz şeyi geliştiremezsiniz. Mühendis dört haftalık metrik belirledi:

  1. Katmanlara göre ayrıştırılmış istek başına maliyet.
  2. Her yönlendirme yolu için önbellek isabet oranı.
  3. Ucuz katmandan premium katmana yükseltme oranı.
  4. Müşteri segmenti başına harcama.

Bu sayılar sapmaları (drift) ortaya çıkarır; örneğin, artan bir yükseltme oranı, sınıflandırma mantığının çok agresif olduğunu veya ucuz modelin kalitesinin düştüğünü işaret edebilir. Ekip; eşik değerleri, model atamaları ve önbellek politikaları üzerinde her hafta yinelemeler yaparak, maliyet kontrolünü bir kriz müdahalesi olmaktan çıkarıp bir alışkanlığa dönüştürür.

Özet

İstekleri sınıflandıran, modelleri doğru boyutlandıran, agresif bir şekilde önbelleğe alan, promptları sıkıştıran ve arka plan işlerini toplu işleyen disiplinli bir yönlendirme katmanı, güvenilirliği yüksek tutarken AI-API harcamalarını %95'e kadar azaltabilir. Çıkarım (inference) yığınını bir üretim servisi olarak ele alın: katmanları tanımlayın, sonuçları ölçün ve haftalık olarak yineleyin.