Kırmızı Çizgi İlkesi

Bu hafta yayınlanan deney, doğrulanabilir herhangi bir görevde otonom ajan döngülerini sonlandırmak için nesnel bir "kırmızı çizgi" durdurma sinyalinin, bir LLM'in kendi yargısından daha iyi sonuç verdiğini gösteriyor. Orta zorluktaki bir kodlama kıyaslamasında (benchmark), kırmızı çizgi kullanan ajanlar ortalama 3,3 yineleme sonunda sonuca ulaştı; kendi yargısına güvenen ajanlar ise işi bitirmeden sekiz adımlık katı sınıra takıldı.

Bu karşılaştırma neden önemli?

Otonom yapay zeka ajanları artık insan gözü olmadan kod üretiyor, rapor yazıyor ve yapılandırılmış veriler oluşturuyor. Her yineleme işlem gücü ve depolama tüketir; döngü hatalı çalıştığında ise önceki sonuçları bozabilir. Ajanın ne zaman durması gerektiğine karar vermek temel bir güvenilirlik sorunudur. Yeni veriler, çıktının önceden tanımlanmış bir koşulu karşılayıp karşılamadığını kontrol eden basit ve nesnel bir testin, modele "Bitirdim" dedirtmekten daha iyi performans gösterdiğini kanıtlıyor.

Geçici durdurmalardan nesnel kırmızı çizgilere

Çalışma iki stratejiyi karşılaştırdı:

  • Koşul A – Nesnel kırmızı çizgi: döngü, somut bir test geçtiği anda (örneğin; kodun derlenmesi, JSON'un şemaya uygun olması, bir dosyanın oluşması) durur.
  • Koşul B – LLM öz-yargısı: model, görevin tamamlandığına inandığında "EVET" veya "HAYIR" yanıtını verir.

Her iki yöntem de işlevsel kod yazma gibi doğrulanabilir görevlerde uygulandı. Kırmızı çizgi yaklaşımı her seferinde başarılı oldu; öz-yargı yaklaşımı ise ya önceden belirlenmiş yineleme bütçesini tüketti ya da daha iyi bir cevap ararken doğru çıktının üzerine yazarak sürekli başarısız oldu. Başarısızlık biçimi tek tiptir: model doğru kodu üretir ancak güven düzeyi öz-yargı eşiğini asla geçemez, bu nedenle sistem durmaya zorlayana kadar döngü devam eder. Sonuç: boşa harcanan döngüler ve bazı çalıştırmalarda bozulan dosyalar.

Üç düzeyli kırmızı çizgi sinyalleri

Yazar, durdurma sinyalleri için bir taksonomi öneriyor:

  1. Format Kırmızı Çizgisi – Sözdizimsel özellikleri kontrol eder (doğru JSON, geçerli dosya, uygun işaretleme). İyi yapılandırılmış bir çıktı garanti eder ancak işlevsel doğruluğu onaylayamaz.
  2. Gereksinim Kırmızı Çizgisi – İş mantığını veya test sonuçlarını kontrol eder (örneğin; birim testlerinin geçmesi). Üretim aşamasındaki kodlar için güvenilir sinyal budur.
  3. Anlamsal Kırmızı Çizgi – Mantıksal tutarlılığı veya kaliteyi değerlendirmeye çalışır (örneğin; ikna edici bir rapor). Henüz tam otomatik ve güvenilir bir metrik bulunmadığı için bu düzey bir araştırma alanı olarak kalmaktadır.

Kırmızı çizgiler etrafında bir üretim hattı oluşturmak

  • Nesnel sinyal mevcutsa: kırmızı çizgiyi doğrudan döngüye bağlayın. Test geçtiğinde ajan otomatik olarak durur ve insan incelemesine gerek kalmaz.
  • Kısmi sinyal: döngünün kırmızı çizgide durmasına izin verin ancak bir insanın çıktıların bir kısmını kontrol ettiği bir örnekleme adımı ekleyin. Bu, otomasyon ile güvenlik arasında bir denge sağlar.
  • Sinyal yoksa: katı bir yineleme sınırı uygulayın, sonucu "doğrulanmamış" olarak işaretleyin ve değerlendirme için bir insana yönlendirin.

İlke nettir: otonom bir ajanın amacı "daha fazlasını yapmak" değil, tam olarak ne zaman duracağını bilmektir.

Geliştiriciler için çıkarımlar

Eğer nesnel bir test yazabiliyorsanız, döngünün ne zaman biteceğine bu testin karar vermesine izin verin. Yazamıyorsanız, döngüyü sınırlı bir deney olarak ele alın ve sonucu bir insana devredin. Bir LLM'in tamamlanmayı kendi kendine beyan etmesine güvenmek, üretim ortamında riskli bir kumar olmaya devam ediyor.