Görme-dil modelleri (VLM'ler) temel görsel görevlerde hâlâ beklentileri karşılayamıyor. Yeni bir PerceptionBench değerlendirmesi, önde gelen on altı sistemden hiçbirinin genel olarak %60 doğruluk oranını aşamadığını ve en güçlü olanın bile herhangi bir bireysel beceride %80'in altında kaldığını ortaya koydu. Bu sonuç, geliştiricileri popüler altyazı oluşturma veya akıl yürütme testlerindeki yüksek puanların güvenilir bir görme yeteneği garantisi vermediği konusunda uyarıyor.
Mevcut testler sorunu neden gizliyor
Çoğu halka açık kıyaslama testi; görüntü açıklama, soru yanıtlama ve sağduyulu akıl yürütmeyi birbirine karıştırıyor. Bir model yanlış bir altyazı ürettiğinde, bu hata bir dil sürçmesi, bir akıl yürütme hatası veya nesneyi tanıyamama gibi basit bir başarısızlıktan kaynaklanıyor olabilir. Bu üç bileşen birbirine geçtiği için, düşük bir puan görsel eksiklik hakkında hiçbir ipucu vermiyor. Bu nedenle uygulama geliştiren ekipler, modelin doğru "gördüğünü" varsayarak manşetlerdeki rakamlardan dolayı aşırı bir güven duyuyorlar.
PerceptionBench neyi farklı yapıyor
PerceptionBench, on görsel yeteneği ayrıştırıyor ve her modeli saf görsel görev setleri üzerinden değerlendiriyor. Dil ve akıl yürütmeyi devre dışı bırakarak, bu kıyaslama testi görsel ön uç kısmının tek başına ne kadar iyi çalıştığını gösteriyor. Genel olarak, en iyi on altı VLM %60 doğruluk eşiğinin altında kalıyor ve en iyi performans gösteren sistem bile tek bir beceride %80'e asla ulaşamıyor. Görüntüde olmayan detaylar üretme yani halüsinasyon, en yaygın hata iken; güçlü ve zayıf yönlerin örüntüsü modeller arasında büyük farklılıklar gösteriyor.
Kimler kaybedebilir
Geliştiriciler, özel görsel sınıflandırıcıları genel yapay zeka modelleriyle değiştirmemelidir.
Argümanın zayıf kaldığı nokta
PerceptionBench verileri azalan getiriler gösteriyor: en büyük modeller bile temel algı görevlerinde hâlâ tökezliyor.
Geliştiriciler için pratik adımlar
- Hassasiyet gerektiren görevler için özel görsel sınıflandırıcıları koruyun; VLM'leri bir ikame olarak değil, tamamlayıcı olarak değerlendirin.
- Kullanıcıya ulaşmadan önce model çıktılarını güvenilir bir dedektörle çapraz kontrol eden bir doğrulama katmanı ekleyin.
- Belirgin halüsinasyonları veya yanlış sınıflandırmaları iş akışının başında yakalamak için hafif bir görsel filtre dağıtın.
Genel amaçlı bir VLM'yi amaca yönelik oluşturulmuş bir görsel bileşenle eşleştirmek, ekiplerin bir yandan modelin akıl yürütme yeteneklerinden yararlanmasını sağlarken diğer yandan görsel kör noktalara karşı korunmasına olanak tanır.
Kaynak: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
