Büyük dil modelleri üç tanıdık boyut boyunca büyüdü. Daha fazla metin besleyerek ön eğitimi (pre-training) ölçeklendiriyoruz. Talimat takibini keskinleştirmek için onları son eğitimle (post-training) geliştiriyoruz. Yanıtları hızlandırmak için test zamanı hesaplama gücü (test-time compute) ekliyoruz. Bunların her biri modeli daha iyi, daha hızlı ve daha tutarlı metinler üretmeye zorlar. Hiçbiri daha zor bir sorunu doğrudan ele almıyor: üretilen metnin gerçekten doğru olup olmadığını bilmek.

Bu boşluk tehlikeli hale geliyor. Bir model, kusursuz girintilemeye ve mantıksal yapıya sahip, ancak çalıştırıldığı anda hata veren bir Python betiği üretebilir. Tıbbi bir semptomu sakin bir otoriteyle açıklayıp teşhisi ters yapabilir. Sohbet robotları için bunlar utanç verici hatalardır. İnsan denetimi olmadan hareket eden otonom ajanlar için ise bunlar gerçek sonuçları olan başarısızlıklardır. Üretim ve doğruluk aynı beceri değildir ve bu ayrımı fark etmek, güvenebileceğimiz sistemler inşa etmenin ilk adımıdır.

Üretim Tuzağı

Üç standart ölçeklendirme yolu, epistemik doğruluk için değil, akıcılık ve görev tamamlama için optimize edilmiştir. Ön eğitim, trilyonlarca token arasında geniş istatistiksel desenler oluşturur. Son eğitim, modeli insan tercihlerine uyarlar; bu da genellikle titiz doğruluk yerine nezaket ve güvene ödül verir. Test zamanı hesaplama gücü, modelin her istek başına daha fazla düşünme token'ı kullanmasını sağlayarak biçimlendirmeyi ve adım adım yapıyı iyileştirir, ancak yine de nihai çıktıyı kontrol edilmiş bir yanıttan ziyade bir monolog olarak ele alır.

Sonuç, bir akıcılık tuzağıdır. Kod temiz görünür. Açıklamalar otoriter tınlar. Gerçekler doğru hissettirir. Ancak yüzeydeki parlatma, alttaki hataları maskeler. Üretilen kodu incelemeden bir üretim hattına yapıştıran bir geliştirici, sistemin durmasına (downtime) neden olma riski taşır. Bir klinik uzmanı, yapay zeka asistanı kullanırken model iki benzer ilaç etkileşimini birbirine karıştırırsa ciddi bir hukuki sorumlulukla karşı karşıya kalır. Modelleri kendilerini denetlemeleri için değil, performans sergilemeleri için eğittik.

Bir Ölçeklendirme Ekseni Olarak Doğrulama

LLM-as-a-Verifier adlı bir çerçeve, sorunu tamamen yeniden tanımlar. Doğrulamayı sonradan akla gelen bir şey veya ayrı bir insan inceleme adımı olarak görmek yerine, öz değerlendirmeyi ön eğitim, son eğitim ve çıkarım hızlandırmanın yanında dördüncü bir ölçeklendirme ekseni olarak ele alır.

Fikir, modelin mevcut akıl yürütme kapasitesini kendi çıktılarını yargılamak için kullanmaktır. Bir aday yanıt ürettikten sonra, aynı model geri çekilir ve onu değerlendirir. Bu, kapalı bir döngü oluşturur: üret, puanla, gözden geçir, tekrarla. Model yeni ağırlıklar veya veri kümeleriyle yeniden eğitilmez. Sadece halihazırda sahip olduğu zekayı, bir yazar yerine bir eleştirmen olan farklı bir istem (prompt) şablonuna uygular.

Bu değişim önemlidir çünkü yeteneği güvenilirlikten ayırır. İyi doğrulama yapan daha küçük bir model, yapamayan daha büyük bir modelden daha iyi performans gösterebilir. Sadece parametre sayısını değil, muhakeme yeteneğini ölçeklendiriyorsunuz ve bu da sistemin güvenli bir şekilde neler yapabileceğini değiştirir.

Olasılıksal Puanlamanın Gücü

Çoğu doğrulama girişimi, ikili (binary) bir hüküm talep ettiği için başarısız olur. Bu yanıt doğru muydu? Evet veya hayır. Bu kaba sinyal bilgi kaybına neden olur. Bir yanıt çoğunlukla doğru olabilir ancak tek bir ölümcül kusur içerebilir veya çoğunlukla yanlış olup kurtarıcı tek bir içgörü barındırabilir. İkili bir puan, tüm bu nüansları tek bir bite indirger.

LLM-as-a-Verifier bunun yerine olasılıksal puanlama getirir. Başparmak yukarı veya aşağı yerine, model 0,92 gibi sürekli bir sayı döndürür. Bu ondalık sayı bir anlam taşır. Modelin yanıtın doğru olduğundan neredeyse emin olduğunu veya 0,34 değerinde bir şeylerin ters gittiğini hissettiğini size söyler. Sistemi çalıştıran insanlar eşikler belirleyebilir. 0,60'ın altındaki her şey otomatik yeniden üretimi tetikleyebilir. 0,60 ile 0,85 arasındaki bir aralık insan incelemesi için işaretleyebilir. 0,90'ın üzerinde ise sistem otonom olarak hareket eder.

Sürekli puanlar, güven üzerine aritmetik işlemler yapılmasına da olanak tanır. Birden fazla kontrolün ortalamasını alabilir, bunları istem varyasyonuna göre ağırlıklandırabilir veya en iyisini seçmek için farklı aday yanıtlar arasındaki puanları karşılaştırabilirsiniz. İkili yargılar bu tür ince taneli karar verme süreçlerini desteklemez.

Üç Pratik Avantaj

Çerçeve, gücünü üç belirli özellikten alır.

Ayrıntı düzeyi. 0,82'lik bir puan, "doğru" ifadesinin iletmediği bir şeyi iletir. Artık bir şüphe barındıran, neredeyse kesin bir durumu ifade eder. Yazılım mühendisliğinde bu, kodun derlendiği ve ana durumu yönettiği ancak muhtemelen bir uç durumu (edge condition) gözden kaçırdığı anlamına gelebilir. Tıbbi muhakemede ise, hâlâ bir doğrulama testi gerektiren olası bir teşhisi işaret edebilir. Ayrıntılı puanlar, sonraki aşamadaki sistemlerin tüm başarıları eşit kabul etmek yerine tepkilerini kalibre etmelerine olanak tanır.

Tekrar. Doğrulama, üretmeye kıyasla ucuz olduğundan, bunu hafif istem (prompt) varyasyonları veya sıcaklık (temperature) ayarlarıyla birden fazla kez çalıştırabilirsiniz. Eğer üç bağımsız kontrol 0,91, 0,89 ve 0,93 sonuçlarını verirse, bir fikir birliğine varmış olursunuz. Eğer sonuçlar 0,91, 0,42 ve 0,87 gibi geniş bir aralığa yayılıyorsa, modelin belirsiz olduğunu ve cevabın üzerinde çalışılması gerektiğini anlarsınız. İkili yargıçlar arasındaki çoğunluk oylaması kaba bir yöntemdir. Sürekli puanların ortalamasını almak, belirsizliği gün yüzüne çıkarır.

Ayrıştırma. Karmaşık görevler nadiren aynı anda her yerde başarısız olur. Bir robotik görevi; algılama, planlama ve motor yürütme olarak ayrılabilir. Bir yazılım mühendisliği görevi; algoritma tasarımı, uygulama ve test kapsamı olarak ayrılabilir. Olasılıksal puanlama, doğrulayıcının her bir alt bileşeni ayrı ayrı değerlendirmesine olanak tanır. Sadece cevabın zayıf olduğunu değil, nerede zayıf olduğunu da öğrenirsiniz. Bu teşhis hassasiyeti, onarımı daha hızlı ve daha hedef odaklı hale getirir.

Zor Alanlardaki Sonuçlar

Çerçevenin yararlılığı...