Novita yakın zamanda LLM fiyatlandırmasını güncelledi. Platform üzerinden üretim ortamı çıkarımı (production inference) çalıştıran ekipler için bu cümle, mevcut harcamalarınızın derhal denetlenmesini gerektirmelidir. API ücret değişiklikleri nadiren uygun bir zamanda gelir ve birden fazla model katmanını etkilediğinde, aylık harcamanız üzerindeki etkisi beklenenden daha sert olabilir.

Çıkarım Fiyatlandırması Neden İlginizi Hak Ediyor

Çoğu modern yapay zeka uygulaması, kendi kendine yönetilen GPU kümeleri üzerine inşa edilmemiştir. Geliştiriciler, talepleri Novita gibi çıkarım sağlayıcılarına yönlendirirler; çünkü alternatif yol donanım temin etmeyi, vLLM veya TGI dağıtımlarını yönetmeyi ve trafik artışları sırasında soğuk başlatma (cold start) durumlarını ele almayı gerektirir. Bu kolaylık değerlidir. Ancak aynı zamanda ölçümlenir. Üretilen her token; kullanıcı oturumları, arka plan işleri ve dahili araçlar genelinde katlanarak artan bir faturaya eklenir.

Bir sağlayıcı fiyatlandırmasını ayarladığında, etkisi tüm teknoloji yığınınızda dalga dalga yayılır. Günde on bin müşteri görüşmesini yöneten bir sohbet botu, bir haftada kırk milyon girdi token'ı ve on iki milyon çıktı token'ı tüketebilir. Milyon başına düşen oranı birkaç dolar bile değiştirseniz, aylık fark hızla önemli bir boyuta ulaşır. Kendi imkanlarıyla büyüyen (bootstrapped) ürünler veya düşük marjlarla çalışan ekipler için bu fark kârlılığı yok edebilir. Bir tarayıcı eklentisi olarak çalışan kodlama asistanı, gece boyunca çalışan toplu özetleme hattı (pipeline) veya her sayfa yüklemesinde bir modele sorgu gönderen dahili bir arama aracı; bunların hepsi aynı hassasiyeti paylaşır. Birim ekonomileri, bir sonraki token'ın tam fiyatına bağlıdır.

Novita'da Ne Değişti

Novita, kataloğundaki farklı modelleri etkileyen yeni maliyetler sundu. Şirket, genel bir yüzde artışı veya indirimi uygulamadı. Bunun yerine, ayarlamalar modele göre değişiklik gösteriyor; bu da faturanızın tam olarak hangi uç noktalara (endpoints) eriştiğinize bağlı olarak değişeceği anlamına geliyor.

Eğer uygulamanız tüm trafiği tek bir büyük dil modeli üzerinden yönlendiriyorsa, hesaplamanız basittir. Eski oranı yenisiyle karşılaştırın ve oluşacak zararı veya tasarrufu öngörün. Ancak çoğu üretim kurulumu daha karmaşıktır. Ekipler genellikle basit sorguları daha hafif modellere gönderen ve ağır sıklet modelleri karmaşık akıl yürütme görevleri için saklayan yönlendirme mantıkları kullanır. Diğerleri ise gecikme süresini (latency) ve kaliteyi karşılaştırmak için birkaç model üzerinde A/B testleri yapar. Bu senaryolarda, sadece bir veya iki modeldeki fiyat değişikliği tüm maliyet yapınızı bozabilir.

Token başına ve istek başına spesifik rakamlar, Narevbot tarafından Dev.to'da yayınlanan ayrıntılı bir dökümde belirtilmiştir. Tam fiyat listesini buradan inceleyebilirsiniz: https://dev.to/narevbot/changes-to-llm-pricing-novita-3plc

Hafızanıza veya dokümantasyonunuzun derinliklerine gömülmüş eski bir ekran görüntüsüne güvenmeyin. Bir sonraki çeyreğinizi planlamadan önce güncel rakamları doğrudan o kaynaktan alın.

Risk Maruziyetinizi Nasıl Denetlersiniz

Varsayımlarla değil, verilerle başlayın. Novita panelinize giriş yapın ve son iki ila üç aylık kullanım geçmişinizi dışa aktarın. Bu verileri modele ve işlem türüne göre segmentlere ayırın. Bütçenizin çoğunu hangi uç noktaların tükettiğini ve istek başına en fazla token'ı hangilerinin ürettiğini bilmek istersiniz.

Şu kalıpları arayın:

  • Yoğunlaşma riski. Harcamanızın yüzde yetmişi tek bir model üzerinden akıyorsa ve o modelde fiyat artışı olduysa, durumun aciliyeti ortadadır. Harcamanız sekiz modele yayılmışsa ve bunlardan üçünde değişiklik yapıldıysa, hesaplama daha uzun sürer ancak risk hala gerçektir.
  • Token şişmesi. Prompt'larınızın gereksiz bağlamlarla (context) şişip şişmediğini kontrol edin. Uzun sistem prompt'ları, tekrarlanan few-shot örnekleri ve ayrıntılı XML formatlaması, girdi maliyetlerini artırır. Fiyat güncellemesi, gereksiz maliyetleri kısmak için mükemmel bir bahanedir.
  • Çıktı verimsizliği. Uygulamanız uzun tamamlamalar (completions) talep ediyor ancak sadece ilk birkaç cümleyi kullanıyorsa, çöpe attığınız token'lar için ödeme yapıyorsunuz demektir. max_token sınırlarınızı ve durdurma dizilerinizi (stop sequences) optimize edin.
  • Boştaki arka plan işleri. Rapor oluşturan veya belgeleri gömen (embed) zamanlanmış bir görev, gereğinden daha sık çalışıyor olabilir. Cron takvimini ve toplu işlem (batch) boyutunu doğrulayın