Bu ay yapay zeka servis faturamız, bütçelediğimiz tutarın üç katından fazlası olan 31.000 dolara fırladı; çünkü tek bir satır kod, trafiğimizin yaklaşık %80'ini en pahalı model olan GPT-4o'ya yönlendirmişti.

Fatura neden patladı

Sistemi güvenilirlik üzerine kurmuştuk: hızlı yanıtlar, sıfır kesinti, sorunsuz ölçeklendirme. Bu seçim, token kullanımında klasik bir "bellek sızıntısına" (memory leak) neden oldu; tokenlar, çoğu etkileşim için gereğinden fazla güçlü olan bir modelde harcanmaya devam ediyordu.

Mühendislik yaklaşımındaki değişim: mimari bir sorun olarak maliyet

Yapay zeka harcamalarını bir finans problemi olarak ele almak, asıl kaldıraç olan şeyi gizliyor: her isteğin hangi model tarafından çalıştırılacağına karar veren kod. Model seçimini yönlendirme katmanına (routing layer) taşımak, gizli bir gideri kontrol edilebilir bir değişkene dönüştürdü.

1. Modeli göreve göre eşleştirin

Kural basit: kalite gereksinimini karşılayan en küçük modeli kullanın. Dört yaygın istek türünü daha ucuz alternatiflerle eşleştirdik:

  • Basit sohbet → DeepSeek V4 Flash (%97,5 tasarruf)
  • Sınıflandırma → Qwen3-8B (%98,3 tasarruf)
  • Kod üretimi → DeepSeek Coder (%97,5 tasarruf)
  • Özetleme → Qwen3-32B (%97,2 tasarruf)

Bu yüzdeler, seçilen model ile GPT-4o arasındaki doğrudan token fiyat farkını yansıtmaktadır. Bunun karşılığında, üst düzey muhakeme gerektirmeyen görevlerde yeteneklerde hafif bir düşüş yaşanmaktadır.

2. Bir CDN gibi kademeli yönlendirme

Her isteği önce ucuz modele gönderen iki kademeli bir yönlendirici (router) oluşturduk. Eğer yanıt hızlı bir kalite kontrolünden geçemezse (güven oranı bir eşiğin altındaysa veya gerekli varlıklar eksikse), isteği otomatik olarak daha üst kademeli bir modele yönlendiriyoruz. Bu yedekleme (fallback) mekanizması, premium modeli yalnızca gerçekten ihtiyaç duyulduğunda kullanarak kullanıcı deneyimini koruyor.

3. Tekrarlanan istemleri (prompts) önbelleğe alın

Birçok etkileşim aynı sistem istemini veya SSS (FAQ) metnini yeniden kullanır. Bu çıktıları önbelleğe alarak, aynı yanıtların tekrar hesaplanmasını önlüyoruz. Bellek içi (in-memory) bir önbellek, testlerimizde tekrarlanan istem maliyetlerini yaklaşık %30 oranında düşürdü.

4. Göndermeden önce istemleri sıkıştırın

Uzun sistem istemleri, kullanıcı içeriğiyle aynı oranda token tüketir. İstem üzerinde ucuz bir özetleyici çalıştıran ve istemi pahalı modele iletmeden önce temel bağlama indirgeyen bir ön işlemci (pre-processor) ekledik. Sadece bu adım bile token harcamalarında yıllık binlerce dolar tasarruf sağladı.

Gerçek dünyadaki etkisi

Daha önce bir sohbet robotunun maliyeti aylık 420 dolardı. Sorgularının %85'ini daha ucuz bir modele yönlendirdikten ve önbelleğe alma uyguladıktan sonra fatura 28 dolara düştü. Daha hafif model daha hızlı yanıt verdiği için gecikme süresi (latency) iyileşti ve yedekleme yolu nadiren tetiklendi.

Özet

Yapay zeka harcamalarını birinci sınıf bir mimari karar olarak ele alın. İstekleri uygun modele yönlendirin, kalite tabanlı bir yedekleme mekanizması ekleyin, tekrarlanan istemleri önbelleğe alın ve girdileri sıkıştırın; böylece güvenilirliği korurken maliyetleri ciddi oranda düşürebilirsiniz.