Yapay Zeka Arama Ajanları Neden Başarısız Oluyor: Belirsizliğin Kritik Sorunu

Geliştiriciler yapay zeka ajanlarının muhakeme derinliğini artırmaya odaklanırken, otonom araştırmalardaki asıl darboğaz arama yeteneği değil, belirsizlikle başa çıkamama sorunudur. Yeni bir çalışma, en gelişmiş LLM'lerin bile durup açıklama istemekte zorlandığını ve bunun uzun muhakeme zincirlerinde genellikle felaketle sonuçlanan bir "hata silsilesine" (error cascade) yol açtığını ortaya koyuyor.

DiscoBench Atılımı

Tencent Hunyuan ve Tsinghua Üniversitesi'nden araştırmacılar, dil modellerinin belirsiz, eksik veya hatalı kullanıcı sorgularını nasıl ele aldığını değerlendirmek için tasarlanmış özel bir test çerçevesi olan DiscoBench'i tanıttılar. Kusursuz şekilde oluşturulmuş istemleri varsayan GAIA veya BrowseComp gibi önceki kıyaslama testlerinin (benchmarks) aksine DiscoBench, gerçek dünyadaki kaosu simüle ediyor.

Çerçeve; bilim, siyaset ve müzik dahil olmak üzere on bir alanda, 463 spesifik belirsizlik noktası içeren 211 görevden oluşuyor. Her kontrol noktasında bir ajan; aramaya devam mı edeceği, bir cevap mı vereceği yoksa en önemlisi kullanıcıdan açıklama mı isteyeceği konusunda karar vermelidir. İnsan etkileşimini simüle etmek için araştırmacılar, bir ajan yüksek kaliteli bir takip sorusu sorduğunda ipuçları sağlaması amacıyla LLM tabanlı bir kullanıcı simülatörü olarak Gemini 3 Flash'ı kullandılar.

Hata Silsilesi: Neden Daha Fazla Arama Yapmak Daha İyi Değildir?

Çalışma tehlikeli bir örüntü tespit ediyor: Bir ajan belirsiz bir varlıkla veya çelişkili bir kriter setiyle karşılaştığında, yardım istemek yerine genellikle "daha sıkı aramayı" seçiyor. Bu durum, modelin temelden yanlış yönlendirilmiş, temiz ve sözdizimsel olarak doğru aramalar gerçekleştirdiği bir fenomene yol açıyor.

Veriler, "daha fazla aramanın" aslında doğruluğu düşürebileceğini gösteriyor. Modellerin açıklama yapmak yerine tekrar tekrar arama yaptığı ancak sonunda tahmin yürüttüğü "SearchHeavyGuess" profilinde başarı oranları %51,9'a düştü. Buna karşılık, "SearchThenAsk" stratejisini kullanan modeller %93,4 ile çok daha yüksek bir başarı oranına ulaştı. Bu durum, başarısızlığın bilgi geri çağırma eksikliğinden değil, konuşma tabanlı ajanlık (conversational agency) yetisindeki bir hatadan kaynaklandığını kanıtlıyor.

Öncü Modellerin Performans Kıyaslamaları

On bir üst düzey modelin test edilmesi sarsıcı bir gerçeği ortaya çıkardı: Sektör liderleri bile belirsizlikle karşılaştıklarında %50 doğruluk bariyerini aşmakta zorlanıyor.

  • Doubao Seed 2.0 Pro, %43,1 uçtan uca doğruluk oranıyla liderliği göğüsledi.
  • Gemini 3.1 Pro Preview, %40,8 ile onu yakından takip etti.
  • Claude Opus 4.7, daha yüksek bir kontrol noktası geçme oranına (%57) sahip olmasına rağmen %39,8'e ulaştı.
  • Qwen3.6 Max ve MiniMax M2.7 ise sırasıyla %12,3 ve %16,1 ile önemli ölçüde geride kaldı.

İlginç bir şekilde, araştırmacılar modellere belirsizliklere karşı dikkatli olmalarını açıkça söyleyen "Guided" bir sistem istemi (prompt) sağladığında bile, uçtan uca doğruluk sadece %28,6'dan %33,7'ye yükseldi. Bu durum, bir belirsizliği "tespit etmenin" ve bunu "etkileşim yoluyla nasıl çözeceğini bilmenin" iki farklı bilişsel beceri olduğunu gösteriyor.

Yapay Zeka Dünyası İçin Çıkarımlar

Bu araştırma, ajan tabanlı (agentic) yapay zeka geliştirme odağını değiştiriyor. Gerçekten güvenilir otonom araştırmacılar inşa etmek için sektör, "araç çağırma" (tool call) sıklığını artırmanın ötesine geçmeli ve etkileşimli muhakemeye odaklanmalıdır. LLM optimizasyonunun bir sonraki sınırı sadece daha iyi bilgi geri çağırma değil; karmaşık, çok adımlı görevler sırasında hataların birikmesini önlemek için daha iyi bir "açıklama mantığı" (clarification logic) geliştirmektir.

Temel Çıkarımlar

  • Belirsizlik temel başarısızlık noktasıdır: Yapay zeka ajanları bilgi bulamadıkları için değil, bir sorgu yetersiz tanımlandığında açıklama istemeyi başaramadıkları için başarısız olurlar.
  • "Arama Odaklı" (Search-Heavy) Tuzak: Yanlış varlık için tekrar tekrar arama yapmak, sadece tahmin yürütmekten daha zor toparlanabilen bir hata silsilesi yaratır.
  • Tespit $\neq$ Çözüm: Yüksek tespit puanları (bir hatayı tanımlama), otomatik olarak yüksek başarı oranlarına dönüşmez; bu da modellerin konuşma tabanlı problem çözme süreçlerindeki bir boşluğu vurgular.