LLM fiyatlandırması sürekli değişen bir hedeftir. Bir ay çıkarım (inference) bütçeniz tam olarak öngörüldüğü gibi gider; bir sonraki ay ise bir sağlayıcı token başına ücretini günceller ve tek bir ekstra istek bile geçmese bile aylık harcamanız değişir. Tam olarak şu an olan da budur. GMICloud, Novita ve StreamLake'in hepsi model fiyatlarını güncelledi; eğer üretim iş yükleri —hatta deneysel iş akışları (pipelines)— çalıştırıyorsanız, bu revizyonları dikkatle incelemeniz gerekir. Pazar çöktüğü için değil, günde milyonlarca token işlerken token ekonomisindeki küçük farklar acımasızca katlandığı için.
Bu Sağlayıcılar Kimdir
GMICloud, Novita ve StreamLake'in her biri yapay zeka altyapı yığınında farklı bir rol oynuyor, ancak artık büyük dil modellerini çalıştırma maliyeti konusunda doğrudan örtüşüyorlar.
GMICloud, yüksek performanslı bir GPU bulutu işletiyor ve kendi kümelerini (clusters) yönetmek istemeyen geliştiriciler için giderek büyüyen bir barındırılan LLM kataloğu sunuyor. Novita, uygun fiyatlı GPU kiralamaları ve model sunumu etrafında itibarını inşa ederek, en büyük hiper ölçekleyicilerin (hyperscalers) talep ettiği yüksek ücretler yerine indirimli açık ağırlıklı modelleri tercih eden mühendisleri kendine çekiyor. ByteDance'in bulut ve medya ekosisteminden doğan StreamLake ise çıkarım yarışına video altyapısı uzmanlığını getiriyor ve ağır medya işleme iş yüklerini de yönetebilen bir platform üzerinden modeller sunuyor.
Hiçbiri OpenAI veya Anthropic gibi herkesçe bilinen isimler değil. Onların fiyatlandırma hamlelerinin önemli olmasının nedeni tam olarak bu. Marjların düşük, indirimlerin yaygın ve geliştiricileri çekme yarışının sürekli olduğu pazarın agresif orta segmentinde yer alıyorlar. Bu segmentteki üç platform fiyat listelerini aşağı yukarı aynı anda değiştirdiğinde, açık kaynaklı veya ince ayarlı (fine-tuned) modelleri çalıştırmanın maliyeti için ortak bir kıstas belirlemiş oluyorlar.
Neler Değişti
Güncellemeler, her üç serviste de LLM kullanım fiyatlandırmasını etkiledi. Dev.to'da narevbot olarak yazan Naren, GMICloud, Novita ve StreamLake için model bazlı yapılan tam ayarlamaları açıklayan bir yazıda ayrıntıları belgeledi. Tüm karşılaştırmayı buradan okuyabilirsiniz.
Bu paragrafı bitirmeden önce tekrar değişebilecek olan cent bazlı token fiyatlarını tek tek saymak yerine, asıl önemli nokta değişikliklerin yapısal olduğudur. Her sağlayıcı token ücretlendirme yöntemini yeniden dengeledi ve bazı durumlarda yapılan revizyonlar, belirli bir iş yükü için hangi modelin en ucuz olduğunu değiştiriyor. Bu durum nadiren basit, genel bir artış veya azalış şeklinde olur. Bir sağlayıcı girdi fiyatlarını düşürürken çıktı fiyatlarını artırabilir. Bir diğeri küçük parametreli modelleri değiştirmeyip uzun bağlamlı (long-context) uç noktalardaki (endpoints) ücretleri yükseltebilir. Her üçü de Llama, Qwen, Mistral ve diğer mimarilerin farklı kombinasyonlarını desteklediğinden, oluşacak zarar veya fayda tamamen hangi modeli hangi API üzerinden yönlendirdiğinize bağlıdır.
Trafik Sabit Kalsa Bile Faturanız Neden Değişiyor
Etkiyi anlamak için LLM faturalandırmasının gerçekte nasıl çalıştığına bakın. Neredeyse her zaman girdi tokenları ve çıktı tokenları için ayrı ayrı ücretlendirilirsiniz ve aralarındaki oran etkin maliyetinizi belirler. Günde on bin konuşmayı yöneten bir müşteri destek botu, sohbet başına ortalama iki bin girdi tokenı ve dört yüz çıktı tokenı kullanabilir. Milyon token başına harmanlanmış üç dolar üzerinden bu, günde yaklaşık seksen dört dolar eder. Eğer bir sağlayıcı çıktı fiyatını sadece yüzde yirmi artırırsa, günlük maliyet doksan doların üzerine çıkar. Bir çeyrek dönemde, aynı trafik için neredeyse bin dolarlık ekstra harcama demektir.
Bunu saatte milyonlarca token işleyen bir içerik üretim iş akışına veya veri geri çağırma ile zenginleştirilmiş üretim (RAG) sistemine ölçeklendirdiğinizde, seçtiğiniz sağlayıcı ciddi bir bütçe kalemi haline gelir. GMICloud, Novita ve StreamLake bunu biliyor. Fiyatlandırma değişiklikleri, belirli kullanım durumlarını hedefleyen bilinçli konumlandırma hamleleridir: yüksek hacimli toplu işler, düşük gecikmeli sohbet uygulamaları veya uzun bağlamlı özetleme görevleri.
Karmaşıklık bir başka katman daha ekliyor. Bazı platformlar istek başına minimum ücretler, tahsis edilmiş (provisioned) veri akışı için boşta kalma ücretleri veya hız sınırı (rate-limit) aşımı için ek ücretler ekliyor. Minimum istek ücretindeki bir değişiklik, düşük hacimli kullanıcıları yüksek hacimli olanlardan çok daha fazla etkiler. Toplu çıkarım (batch inference) indirimlerindeki bir değişiklik, gerçek zamanlı API faturanız değişmeden gece raporu oluşturma maliyetinizi düşürebilir. "Güncellenmiş fiyatlandırma" başlığını okumak yeterli değildir. Matrisi okumanız gerekir.
Aşırı Tepki Vermeden Nasıl Hareket Edilmeli
Oranlar değiştiğinde, çoğu mühendislik ekibi iki hatadan birini yapar. Ya değişikliği görmezden gelip maliyet aşımını sessizce üstlenirler ya da panik yaparlar.
