Araştırmacılar, trilyon parametreli bir dil modelinin token bütçesi sınırları içinde kalarak akıl yürütmeyi öğrenmesini sağlayan Ring-Zero adlı yeni bir pekiştirmeli öğrenme (reinforcement-learning) çerçevesi duyurdular ve model 2026 AIME matematik sınavında %84,2 puan aldı. Bu sonuç, bu ölçekte bir modelin, mühendislerin geleneksel olarak prompt'lara manuel olarak kodladığı adım adım problem çözme alışkanlıklarını edinebileceğini gösteriyor.

Neden önemli

AIME seviyesindeki performans, uzun süredir "insan seviyesinde" nicel akıl yürütme için bir kıstas olmuştur. Herhangi bir insan tarafından yazılmış örnek olmadan %84,2 aralığına ulaşılması, modelin akıl yürütme yeteneklerinin el yapımı iskelelerden değil, eğitimin kendi dinamiklerinden ortaya çıktığını gösteriyor. Yapay zeka ajanları inşa eden şirketler için çıkarım nettir: Karmaşık prompt tarifleri yazmak ve bunları sürdürmek, modele ne zaman daha derin düşünmesi gerektiğini ve ne zaman ucuz bir kestirmenin yeterli olacağını öğreten bir eğitim döngüsüyle değiştirilebilir.

Prompt mühendisliğinden eğitim dinamiklerine

Yıllardır geliştiriciler, büyük dil modellerini çok adımlı akıl yürütmeye teşvik etmek için "problemi parçalara ayır" veya "cevabını doğrula" gibi prompt şablonlarına güveniyordu. Bu şablonlar dış bir iskele görevi görür; model talimatları takip eder ancak süreci içselleştirmez. Ring-Zero bu paradigmayı tersine çeviriyor. Model, bir görev tanımını doğrulanabilir bir cevapla (otomatik olarak kontrol edilebilen bir ground-truth/doğru veri) birlikte alır. Ardından bir dizi deneme üretir, yalnızca deneme doğrulanabilir cevapla eşleştiğinde ödül alır ve pekiştirmeli öğrenme yoluyla politikasını (policy) günceller.

Ödül, kandırılması zor bir hedefe (cevabın sadece makul değil, doğru olması gerekir) bağlı olduğu için model, akıl yürütme kalıplarını kendi başına keşfeder. Makale, güvenilir bir ödül sinyali yerleştirildikten sonra, modeli trilyon parametreye ölçeklendirmenin, mühendislerin daha küçük modeller için manuel olarak eklediği prompt mühendisliği hilelerini otomatik olarak yüzeye çıkardığını savunuyor.

Dört aşamalı eğitim hattı

Ring-Zero'nun eğitimi dört farklı aşamadan geçer:

  1. Birinci aşama RL – Model, hangi token dizilerinin doğru cevaplara yol açma eğiliminde olduğunu öğrenerek olası akıl yürütme izlerini keşfeder.
  2. Self-distillation (Öz-damıtma) – Yüksek kaliteli izler modele geri akar ve ortaya çıkan akıl yürütme kalıplarını stabilize eder.
  3. İkinci aşama RL – Daha ince taneli bir döngü, önceki iyileştirmeleri korurken politikayı geliştirir.
  4. Kademeli eğitim (Tiered training) – Model, problem zorluğuna bağlı olarak kısa (≈2k token) ve uzun (≈20k token) akıl yürütme yolları arasında seçim yaparak token bütçesini akıllıca tahsis etmeyi öğrenir.

Kademeli eğitim, üretim ortamı için en alakalı kısımdır. Gerçek uygulamalarda, her ek token hesaplama maliyeti ekler. Ring-Zero, bir problemin ne zaman kısa bir cevap için yeterince basit olduğunu ve ne zaman derin, çok adımlı bir analiz gerektirdiğini tanımayı modele öğreterek, akıl yürütme kalitesini doğrudan ekonomik verimliliğe bağlar.

Öğrenmenin iki aşaması: keşif ve keskinleştirme

Yazarlar öğrenme eğrisini iki aşamalı bir süreç olarak tanımlıyor:

  • Keşif (Discovery) – Erken aşama pekiştirmeli öğrenme adımları gürültülüdür; model, çoğu başarısız olan çok çeşitli stratejiler dener. Bu varyans, yeni akıl yürütme yollarını ortaya çıkarmak için gereklidir.
  • Keskinleştirme (Sharpening) – Vaat eden bir kalıp ortaya çıktığında, sonraki RL adımları varyansı azaltarak politikayı sıkılaştırır ve davranışı sağlamlaştırır.

Bu ilerleme, insanların gelişimini yansıtır: önce beyin fırtınası, ardından odaklanmış pratik. Buradaki temel içgörü, "karmaşık" olan erken aşamanın bastırılmak yerine benimsenmesi gerektiğidir; çünkü bu aşama, sonraki iyileştirmeler için ham madde sağlar.

Neler ters gidebilir?

Makaledeki iyimserlik, incelenmesi gereken birkaç varsayıma dayanıyor:

  • Ödül tasarımı – Çerçeve, hem doğrulanabilir hem de kestirme yollara karşı dirençli bir ödüle ihtiyaç duyar. Birçok gerçek dünya görevi için böyle bir ödül tanımlamak kolay değildir ve maliyetli etiketleme süreçleri gerektirebilir.
  • Çevresel darboğazlar – Yazarlar, modelin performansının boyutundan ziyade çevresindeki değerlendirme altyapısı (test paketleri, günlükler, net metrikler) tarafından sınırlandığına dikkat çekiyor. Bu altyapıyı kurmak ve sürdürmek önemli bir mühendislik çabası gerektirebilir.
  • Eğitim hesaplama maliyeti – Birden fazla RL aşamasıyla trilyon parametreli bir modeli eğitmek pahalıdır. Kademeli eğitim çıkarım (inference) maliyetlerini düşürse de, başlangıçtaki eğitim bütçesi yüksek kalmaya devam ederek bu yaklaşımı potansiyel olarak sadece iyi finanse edilen laboratuvarlarla sınırlayabilir.

Sırada ne izlenmeli

Yapay zeka uygulayıcıları için pratik çıkarımlar

  • Promptları tek kaldıraç olarak görmeyin – Promptlara kodladığınız bir davranışın, bunun yerine ödül odaklı bir eğitim döngüsü aracılığıyla öğrenilip öğrenilemeyeceğini sorgulayın.
  • Token kullanımını birinci sınıf bir hedef haline getirin – Bütçe duyarlı sinyalleri erkenden ekleyin; model, doğruluk ile hesaplama maliyeti arasında denge kurmayı öğrenecektir.
  • Geri bildirim döngüsünü kapatın – Görevleri otomatik olarak sağlayan, sonuçları doğrulanabilir yanıtlarla ölçen ve sonuçları eğitime geri besleyen bir sistem kurun. Döngü, modelin kendi iş akışını keşfettiği yerdir.

Ödül net olduğunda ve ortam başarıyı güvenilir bir şekilde ölçebildiğinde, modeli ölçeklendirmek ham kapasite eklemekten daha fazlasını yapar; modele nasıl düşüneceğini seçmeyi öğretir. Elle yazılmış iskelet yapılardan kendi kendine yönlendirilen akıl yürütmeye geçiş, yapay zeka ajanlarını nasıl inşa ettiğimizi ve fiyatlandırdığımızı yeniden şekillendirebilir.