Transformer'ların Ötesinde: LLM'lerin Bir Sonraki Dönemini Yeniden Tanımlayan Girişimler
Büyük dil modellerinin (LLM'ler) hesaplama talepleri bir kırılma noktasına ulaşırken, transformer dönemi temel bir darboğazla karşı karşıya kalıyor. 2017 tarihli "Attention Is All You Need" makalesi mevcut yapay zeka patlamasının temellerini atmış olsa da, yeni nesil girişimler gerçek verimliliğe ulaşmak için çekirdek mimariyi değiştirmek veya yeniden icat etmek için yarışıyor.
Transformer Darboğazı: Yoğun Dikkat (Dense Attention) Neden Başarısız Oluyor?
Yaklaşık on yıldır transformer, "yoğun dikkat" (dense attention) olarak bilinen bir mekanizma ile çalışan yapay zeka endüstrisinin motoru konumunda. Bu süreç, bir metin bloğundaki her bir token'ı, devasa ölçekli çarpma işlemleri yoluyla diğer tüm token'larla karşılaştırıyor. Anlamsal anlamı yakalamada inanılmaz derecede doğru olsa da, matematiksel karmaşıklık ölçeklenme konusunda yetersiz kalıyor.
Örneğin, 10.000 kelimelik bir belge, bir transformer'ın yaklaşık 50 milyon çarpma işlemi yapmasını gerektirebilir. Hesaplamadaki bu karesel (quadratic) artış, iki büyük zorluğa yol açıyor: fırlayan enerji tüketimi ve sınırlı bağlam pencereleri (context windows). OpenAI'ın bu yıl hesaplama için 50 milyar dolar harcamaya hazırlandığı ve veri merkezi elektrik talebinin 2030 yılına kadar iki katına çıkmasının beklendiği göz önüne alındığında, endüstri hem maliyet hem de fizik kuralları açısından bir duvara çarpıyor.
Dikkat Mekanizmasını Yeniden Düşünmek: Seyrek (Sparse) Mekanizmaların Yükselişi
Verimlilik krizini çözmek için birkaç girişim, yoğun dikkatin dışına çıkarak "seyrek dikkat" (sparse attention) yöntemine geçmeye çalışıyor. Seyrek dikkat, her olası kelime eşleşmesini hesaplamak yerine yalnızca en alakalı bağlantılara odaklanarak hesaplama yükünü önemli ölçüde azaltıyor.
Miami merkezli girişim Subquadratic, SubQ modeli ile bu alanda öncü konumda. Doğruluğu korumakta zorlanan önceki seyrek mekanizmaların aksine Subquadratic, teknolojisinin kodlama ve arama gibi özel görevlerde ana akım LLM'lerle rekabet edebildiğini iddia ediyor. Yaklaşımları, ilgisiz token'lar üzerinde işlem döngülerini boşa harcamak yerine, belirli bir metin parçası için hangi kelimelerin gerçekten önemli olduğunu anlık olarak belirleyen dinamik bir sistem içeriyor.
Güç Tutma (Power Retention): Kademeli Özetlere Doğru Hareket
Bir başka yaklaşım ise dikkat mekanizmasından tamamen uzaklaşmayı içeriyor. San Francisco merkezli Manifest AI, "power retention" (güç tutma) adı verilen bir tekniğe öncülük ediyor. SubQ gibi seyrek dikkat modelleri tüm bağlam penceresinin kaba bir resmini tutmaya çalışırken, power retention yöntemi modele belleğinin kademeli bir özetini (rolling summary) sunarak çalışıyor.
Bağlam penceresine yeni bilgiler girdikçe model, daha az alakalı verileri tanımlayıp eliyor ve böylece girdi boyutundan bağımsız olarak hesaplama yükünün yönetilebilir kalmasını sağlıyor. Manifest AI bu yaklaşımın uygulanabilirliğini halihazırda şu yollarla kanıtladı:
- Güç tutma yöntemini kullanarak açık kaynaklı StarCoder modelini PowerCoder'a dönüştürmek.
- Alibaba'nın popüler Qwen açık kaynak modelleriyle rekabet ettiğini iddia ettikleri Brumby modelini piyasaya sürmek.
Mevcut transformer modellerini minimum yeniden eğitimle power retention modellerine dönüştürebilme yeteneği, modellerin yeni nesli olan "LLM+'ya" geçişin beklenenden çok daha hızlı gerçekleşebileceğini gösteriyor.
Temel Çıkarımlar
- Transformer Sınırı: Yoğun dikkatin karesel ölçeklenmesi, mevcut LLM'lerin çalıştırılmasını inanılmaz derecede pahalı hale getiriyor ve devasa veri kümeleri veya uzun formlu akıl yürütme süreçleri için ölçeklendirilmesini zorlaştırıyor.
- Seyrek vs. Tutma: Girişimler soruna iki farklı açıdan yaklaşıyor: Subquadratic, seyrek hesaplamalar (SubQ) yoluyla dikkati optimize ederken; Manifest AI, dikkati kademeli özetlerle (Power Retention) değiştiriyor.
- Ekonomik Zorunluluk: Yapay zeka hesaplama maliyetleri on milyarlarca dolara ulaşırken, bir sonraki yapay zeka çağının kazananı muhtemelen sadece ham ölçekle değil, verimlilik sorununu çözen taraf olacaktır.
