Yeni bir maliyet analizi, bir büyük dil modelini (LLM) kendi bünyesinde barındırmanın (self-hosting), ticari API'lerden ancak bir işletme ayda yaklaşık 5 ila 10 milyon giriş token'ı işlediğinde daha avantajlı olduğunu gösteriyor. Yapay zeka hizmetleri için bütçe planlayanlar için başabaş noktası, "ücretsiz" açık ağırlıkların (open weights) cazibesinin gerçek tasarrufa dönüşüp dönüşmeyeceğine karar veriyor.
API Modeli
API sağlayıcıları token başına ücret alır; tüm donanım, güç ve soğutma süreçlerini kendileri yönetir. Güncel halka açık fiyatlar şöyledir:
- Claude Sonnet 5 – Milyon giriş token'ı başına 2 $
- GPT-5.6 – Milyon giriş token'ı başına yaklaşık 1 $
- Meta Muse Spark – Gelen (inbound) milyon token başına 1,25 $, giden (outbound) milyon token başına 4,25 $
Model, kullandıkça öde (pay-as-you-go) şeklindedir. Trafik sıfıra indiğinde fatura da sıfıra iner. Kullanıcılar ayrıca GPU arızaları, aygıt yazılımı (firmware) güncellemeleri ve kapasite planlaması gibi zahmetlerden de kurtulmuş olurlar.
Kendi Bünyesinde Barındırma (Self-Hosting) Modeli
Açık ağırlıklı bir modeli kendi donanımınızda çalıştırmak, kullanım miktarından bağımsız olarak hesaplama maliyetinin size ait olması demektir. LLM çıkarımı (inference) için yaygın bir tercih olan tek bir NVIDIA H100'ün maliyeti şöyledir:
- Genel GPU bulut hizmetlerinde saatlik 2 $ – 3 $
- Büyük bulut platformlarında (AWS, Azure) saatlik 7 $ – 12 $
Bu, bir H100'ün kesintisiz çalışması için ayda yaklaşık 1.800 $ – 2.000 $ anlamına gelir. Donanım fiyatı, faturanın sadece görünen kısmıdır.
Rakamların Kesiştiği Nokta
Analiz, aylık giriş token hacmi 5 ila 10 milyon aralığına ulaştığında, kendi bünyesinde barındırmanın premium API'lerden daha ucuz hale geldiğini gösteriyor. Bu eşiğin altında, token başına API ücretleri daha avantajlıdır. Aylık 100 milyon token veya daha fazla hacimlerde, yalnızca donanım maliyet çizgisi API çizgisinin altına iner ve bu da kendi bünyesinde barındırmayı kağıt üzerinde cazip kılar.
Gizli Operasyonel Giderler
GPU kiralaması, bir modeli üretim ortamında (production) çalıştırmanın gerçek maliyetinin yalnızca yaklaşık %30'udur. Geri kalanı şunlardan kaynaklanır:
- Ağ ve depolama – yüksek veri aktarım kapasiteli bağlantılar ve hızlı diskler gecikmeyi (latency) düşük tutar.
- Yedeklilik ve izleme – birden fazla örnek (instance), sağlık kontrolleri ve uyarı hatları hem yazılım hem de donanım harcaması ekler.
- Mühendislik yeteneği – bir modeli güvenilir bir şekilde çevrimiçi tutmak genellikle 1,5 – 2 tam zamanlı mühendis gerektirir. Piyasa oranlarıyla bu, yıllık giderlere 270.000 $ – 550.000 $ ekler.
Bu katmanlar eklendiğinde, yalnızca donanımdan elde edilen görünür tasarruf hızla buharlaşır.
Kimler Kendi Bünyesinde Barındırmayı Düşünmeli
Kendi bünyesinde barındırma yalnızca belirli koşullar altında mantıklıdır:
- Sürekli devasa hacim – kuruluş düzenli olarak 5 milyon token eşiğini aşmalıdır, aksi takdirde token başına API fiyatı daha düşük kalır.
- Düzenleyici veya veri gizliliği kısıtlamaları – bazı sektörler, tescilli veya kişisel verilerin üçüncü taraf uç noktalara (endpoints) gönderilmesini yasaklar.
- Özel özelleştirme veya gecikme garantileri – bir modelin dahili verilerle ince ayar (fine-tune) yapılması veya saniyenin altında yanıtlar vermesi gerektiğinde, teknoloji yığınına (stack) sahip olmak haklı çıkarılabilir.
Eğer bu baskıların hiçbiri mevcut değilse, gizli personel ve altyapı maliyetleri genellikle donanım tasarrufunun önüne geçer.
Hibrit Bir Strateji
Kendi bünyesinde barındırmanın uygulanabilir olduğu bir ölçeğe ulaşan çoğu ekip, yine de karma bir yaklaşım benimser:
- API'ler ile başlayın – ucuzdurlar, entegrasyonları hızlıdır ve deneyler veya düşük hacimli iş yükleri için mükemmeldirler.
- Yüksek hacimli akışları taşıyın – token sayıları tutarlı bir şekilde başabaş noktasını geçtiğinde, bu veri hatlarını şirket içi bir kümeye (cluster) kaydırın.
- Bir güvenlik ağı koruyun – yerinde (on-prem) kaynakların aşırı tahsis edilmesini (over-provisioning) önlemek için ara sıra gelen veya ani artış gösteren (bursty) istekleri API üzerinden tutun.
Token matematiğini düzenli olarak yapın, ardından ham donanım fiyatlarının göz ardı ettiği operasyonel genel giderleri ekleyin. Bu tam tabloya dayanan kararların efsanelerden etkilenme olasılığı çok daha düşüktür.
Özet
Eğer yapay zeka ürününüz her ay birkaç milyon token'dan daha azını işliyorsa, en basit ve en ucuz yol hala bir API çağırmaktır. Kendi bünyesinde barındırma, ancak sürekli ve yüksek hacimli talep, katı uyumluluk gereklilikleri veya özel gecikme ihtiyaçları ortaya çıktığında finansal olarak uygulanabilir hale gelir; ve o zaman bile, bulut teknolojisine karşı zafer ilan etmeden önce personel ve altyapının gizli maliyetleri hesaba katılmalıdır.
