ActiveVision benchmark'ı, günümüzün önde gelen çok modlu büyük dil modellerinin (LLM'ler), bir görüntüye birden fazla kez bakmayı gerektiren görevlerin yalnızca %10,6'sını çözebildiğini gösteriyor. 17 yinelemeli algı (iterative-perception) zorluğundan oluşan bir testte, insanlar %96,1 oranında başarılı olurken, GPT-5.5 %10,6 ve Claude Fable 5 %3,5 oranında başarılı olabildi; görevlerin on birinde modellerden hiç doğru cevap alınamadı.

Mevcut vizyon modelleri neden tökezliyor

Çoğu vizyon sistemi, bir görüntüyü tek seferlik bir girdi olarak ele alır. Bir "vizyon kodlayıcı" (vision encoder) özellikleri bir kez çıkarır ve ardından akıl yürütme için dil modeline iletir. İş akışı (pipeline) ikinci bir bakış talep edemez, bir bölgeye yakınlaşamaz veya bir hipotezi yeniden değerlendiremez. Buna karşılık insanlar; önce bir tahminde bulunur, odağını değiştirir, yeni kanıtlar toplar ve cevaplarını ayarlar. Benchmark bu döngüyü resmileştiriyor: Her görev, modeli gözlem yapmaya, bir eylem önermeye, sonucu gözlemlemeye ve doğru sonuca ulaşana kadar bunu tekrarlamaya zorluyor.

Benchmark neleri test etti

Araştırmacılar, tekrarlanan gözlem gerektiren 17 senaryo oluşturdu. Sonuçlar çarpıcı:

  • İnsan katılımcılar: %96,1 başarı
  • GPT-5.5: %10,6 başarı
  • Claude Fable 5: %3,5 başarı
  • On bir görev: test edilen her model sıfır puan aldı

Modeller görüntüyü yeniden işlemek için kod üretse bile, kendi çıktılarındaki hataları gözden kaçırdılar; bu da sınırlamanın yalnızca veri odaklı değil, mimari olduğunu doğruluyor.

Geliştiriciler ve endüstri için riskler

Otonom robotlar, denetim dronları veya görsel bilgileri zaman içinde doğrulaması gereken herhangi bir sistem inşa ediyorsanız, tek seferlik (single-shot) bir vizyon modeli kullanmak risklidir. Benchmark, mevcut LLM tabanlı vizyon iş akışlarının geri bildirim odaklı algıyı güvenilir bir şekilde yönetemediğini, bu nedenle kusurları gözden kaçıracaklarını, öğeleri yanlış sayacaklarını veya dinamik sahneleri yanlış yorumlayacaklarını gösteriyor. Daha fazla eğitim verisi eklemek veya parametreleri ölçeklendirmek bu farkı kapatmayacaktır; eksik olan bileşen, kontrollü ve yinelemeli bir gözlem mekanizmasıdır.

Karşı argüman: Daha büyük modeller yardımcı olabilir mi?

Daha fazla eğitim verisi eklemek veya parametreleri ölçeklendirmek bu farkı kapatmayacaktır; eksik olan bileşen, kontrollü ve yinelemeli bir gözlem mekanizmasıdır.

Gelecek yollar

Araştırmacılar tamamlayıcı bir yön öneriyor:

  • Mimari yeniden tasarım – modelin iç durumuna bağlı olarak yeni görünümler talep edebilen, bölgeleri kırpabilen veya ışık koşullarını değiştirebilen kontrol edilebilir bir görsel modül yerleştirilmesi.

Özet: Mevcut çok modlu LLM'ler statik görüntü sorularını yanıtlama konusunda mükemmeldir ancak bir problem tekrar bakmayı gerektirdiğinde yetersiz kalırlar. Gerçek görsel zeka, sadece bir resmi bir kez okuyan değil, kendi görüşünü kontrol edebilen modellere ihtiyaç duyacaktır.