Büyük bir yapay zeka modelini ölçekli bir şekilde çalıştırmak, artık bilimsel bir başarıdan ziyade elektrik faturaları ve veri merkezi kiralarıyla ilgili acımasız bir matematik problemi haline geldi. Gemini'ın ürettiği her token, Google'a gerçek bir maliyet çıkarıyor: silikon döngüleri, bellek bant genişliği ve prizden çekilen wattlar. Sorgu hacmi arttıkça, bir sentin küçük kesirleri kâr marjlarını tamamen yutabilecek tutarlara ulaşıyor. Bu sessiz aciliyet, Google bünyesinde şekillenmeye başlayan dahili bir sunucu çipi projesi olan Frozen v2'nin arkasındaki temel motivasyon. Şirket, genel amaçlı Tensor Processing Unit (TPU) birimlerini bir nesil daha geliştirmek yerine, çok daha radikal bir şey deniyor: Gemini modelinin iskeletini doğrudan silikonun içine dökmek.
Esnek Hızlandırıcılardan Modele Özgü Silikona
Google'ın TPU'ları, yaklaşık on yıldır altyapısının iş beygirleri konumunda. Modelleri eğitiyorlar, arama sıralama algoritmalarına güç veriyorlar ve hatta Nvidia'nın GPU'larına alternatif arayan Meta gibi bulut müşterilerine saatlik olarak kiralanıyorlar. Bu çok yönlülük, bir TPU'yu TPU yapan şeyin ta kendisidir. Yazılımla tanımlayabileceğiniz hemen hemen her sinir ağı tarafından kullanılabilen, matris çarpımı ve bellek hareketi gibi genel bir sözlüğe hitap ederler.
Frozen v2, bu esneklikten bilinçli olarak feragat ediyor. Çip, devreleri Gemini'ın kendi mimarisinin bölümlerini fiziksel olarak yansıtan alana özgü bir hızlandırıcı olarak tasarlanıyor. Bir TPU talimatları alıp bunları yazılım operasyonları olarak yorumlarken, Frozen v2 modelin yapısal taslağını —katmanlarının ve veri yollarının düzenini— doğrudan çipin yerleşimine işleyecektir. Google, model ve metalin bu sıkı birleşimi sayesinde çipin, yapay zeka yanıtlarını sunarken mevcut TPU'lardan altı ila on kat daha verimli olmasını bekliyor. Sorgu başına daha az hesaplama adımı, bir token'ın görünmesi için daha az bekleme süresi ve onu üretmek için çok daha az enerji harcanması anlamına geliyor.
Bu, aynı fikrin sadece daha hızlı bir versiyonu değil. Tek bir model ailesine olan bağlılık uğruna genellikten vazgeçen, farklı bir çip kategorisidir.
İlk "Frozen" Neden Eridi?
Bu yaklaşımın kökleri, Google DeepMind Baş Bilim İnsanı Jeff Dean'e atfedilen daha önceki bir konsepte dayanıyor. Orijinal "Frozen" önerisi, sadece mimariyi değil, aynı zamanda modelin ağırlıklarını —Gemini'ın öğrenilmiş davranışını oluşturan milyarlarca ayarlanmış parametreyi— doğrudan çipin içine sabit kodlayarak (hardcoding) uzmanlaşmayı daha da ileriye götürmeyi öneriyordu.
Mantık tutarlıydı. Modelin tam olarak hangi sayıları kullanacağını biliyorsanız, neden onları harici bellekten çağırmakla uğraşasınız ki? Onları transistörlere işleyebilir ve tüm gecikme kategorilerini ortadan kaldırabilirdiniz.
Sorun ise kalıcılıktı. Yapay zeka modelleri yerinde saymaz. Google, Gemini'ı sürekli olarak yeni verilerle yeniden eğiterek, parametreleri ayarlayarak ve geliştirilmiş sürümler yayınlayarak güncelliyor. Ağırlıkları silikona dondurulmuş bir çip, yeni bir model revizyonu yayınlandığı anda bir kağıt ağırlığına dönüşürdü. Bu esneklik eksikliği, orijinal konseptin sonunu getirdi.
Çapasız Mimari
Frozen v2, ağırlıkları değişmek üzere serbest bırakırken mimariyi sabit kodlayarak eskime tuzağını çözüyor. Bunu, arabayı yola kaynak yapmak yerine, özel bir yarış pisti dökmek gibi düşünebilirsiniz. Devrenin şekli, Gemini'ın belirli hesaplama modelleri için optimize edilmiş şekilde sabit kalır, ancak bu devrelerden akan içerik, bellekten yeni ağırlıklar yüklenerek yenilenebilir.
Bu ayrım pratikte büyük önem taşıyor. Mühendisler yeni bir Gemini checkpoint'i eğittiklerinde, yeni bir çip üretmeye gerek kalmadan bunu Frozen v2 donanımına dağıtabilirler. Tam olarak ne kadar sabit kodlama yapılacağı Google içinde hala açık bir soru; ekipler hangi yapısal unsurların silikon ölümsüzlüğünü hak edeceğine ve hangilerinin yapılandırılabilir kalması gerektiğine tam olarak karar vermeli. Ancak ilke kesinleşti. Şekli dondurup parametreleri akışkan bir şekilde değiştirerek Google, iterasyon yapma yeteneğinden ödün vermeden verimlilik avantajını koruyor.
Kurum İçi Tutmanın Ekonomisi
Frozen v2'yi Google Cloud'un fiyat listesinde görmeyeceğiniz bir başka neden daha var. Çip, Gemini'ın iç yapısına bu kadar yakından şekillendirildiği için, PyTorch veya özel Transformer varyantları çalıştıran dış geliştiriciler için pek bir anlam ifade etmeyecektir. Google'ın bunu genel amaçlı bir ürün olarak satma planı yok. Bu, doğrudan Google'ın kendi veri merkezlerindeki muazzam çıkarım (inference) kapasitesi talebini karşılamaya yönelik dahili bir araç olarak kalacak.
Bu seçim, sert bir ekonomik gerçeği yansıtıyor. Mevcut üretken yapay zeka pazarında, model yetenekleri hızla birbirine yaklaşıyor. Rakipler arasındaki fark, genellikle en büyük modeli token başına en düşük maliyetle çalıştırmayı kimin göze alabildiğine dayanıyor. Çıkarım (inference), artık eğitimin bir yan düşüncesi değil; Gemini gibi yaygın kullanılan bir ürün için en baskın gider kalemidir. Eğer Frozen v2 bu gideri altı kat veya daha fazla azaltırsa, Google rakiplerinin kolayca eşleyemeyeceği bir hareket alanı kazanır. Tasarrufu kâr marjı olarak bünyesinde tutabilir veya API tüketicileri ile ürün entegrasyonları için daha düşük fiyatlar olarak yansıtabilir; bu da OpenAI, Anthropic ve diğerlerinin üzerindeki baskıyı artırır.
Bu Durum Sektör İçin Ne Anlama Geliyor
Google'ın bu hamlesi, daha geniş kapsamlı donanım stratejisinin nereye doğru gittiğine dair de ipuçları veriyor. Yıllardır standart yaklaşım, mümkün olan en esnek hızlandırıcıyı inşa etmek ve özelleştirme işini yazılıma bırakmaktı. Nvidia'nın GPU'ları; moleküler dinamiklerden video oyunlarına ve büyük dil modellerine kadar her şeyi çalıştırabildikleri için piyasaya hakimdir. Google'ın kendi TPU'ları da aynı geniş kullanım amacı ruhuyla tasarlanmıştı.
Frozen v2 bu gelenekten kopuyor. Bu, tek bir model ailesi yeterli sorgu hacmi yarattığında, o modele özel olarak tasarlanmış özel silikonun (custom silicon) maliyetini defalarca amorti edebileceğinin kabulüdür. Diğer hiper ölçekleyiciler de benzer bir mantık izledi (örneğin Amazon'un Trainium ve Inferentia çipleri), ancak Google'ın yaklaşımı, donanımı genel bir ağ sınıfı yerine belirli bir model mimarisi etrafında eş zamanlı olarak tasarlayarak (co-designing) daha derine iniyor.
Risk, elbette, katılık. Eğer Gemini'nin mimarisi, donanıma işlenmiş devrelerin uyum sağlayamayacağı bir yöne evrilirse, Google kendini en yeni fikirlerini çalıştıramayan pahalı silikonlarla baş başa bulabilir. İşte tam da bu yüzden sadece mimariye dayalı uzlaşma önemlidir. Bu, orta bir yol sunar: Dramatik verimlilik kazanımları elde etmek için yeterli özelleştirme ve şirketi köşeye sıkıştırmamak için yeterli esneklik.
Asıl Çıkarım
Frozen v2, bir çip duyurusu olarak değil, yapay zeka rekabetinin gelecekteki şekline yönelik stratejik bir bahis olarak anlaşılmalıdır. Google, kazananların sadece en iyi modelleri inşa etmekle kalmayacağını, modelin taslağından transistörden geçen elektronlara kadar tüm yığını (stack) kontrol edeceğine dair bahis oynuyor. Eğer proje başarılı olursa, getirisi kıyaslama (benchmark) skorlarında görülmeyecektir. Bunun yerine, her bir milyon token başına tasarruf edilen birkaç sentin, üretken yapay zekada ticari olarak mümkün olanın sınırlarını yeniden çizebileceği bir çeyrek dönemlik kazanç raporunun maliyet sütununda görülecektir.
