Model bahasa-penglihatan (VLM) masih gagal dalam tugasan visual asas. Penilaian PerceptionBench yang baharu mendapati bahawa tiada satu pun daripada enam belas sistem terkemuka melebihi 60% ketepatan secara keseluruhan, malah yang terkuat pun kekal di bawah 80% bagi mana-mana kemahiran individu. Keputusan ini memberi amaran kepada pembangun bahawa skor tinggi dalam ujian kapsyen atau penaakulan popular tidak menjamin penglihatan yang boleh dipercayai.
Mengapa ujian sedia ada menyembunyikan masalah tersebut
Kebanyakan penanda aras awam mencampurkan penerangan imej, menjawab soalan, dan penaakulan akal budi. Apabila model mengeluarkan kapsyen yang salah, kesilapan tersebut mungkin disebabkan oleh kesilapan bahasa, ralat penaakulan, atau kegagalan mudah untuk mengecam objek. Oleh kerana ketiga-tiga komponen ini bercampur aduk, skor yang rendah tidak memberikan petunjuk tentang kekurangan visual. Oleh itu, pasukan yang membina aplikasi mendapat keyakinan yang melampau daripada angka utama, dengan menganggap model tersebut "melihat" dengan betul.
Apa yang membezakan PerceptionBench
PerceptionBench mengasingkan sepuluh keupayaan visual dan menilai setiap model berdasarkan set tugasan penglihatan tulen. Dengan mengetepikan bahasa dan penaakulan, penanda aras ini menunjukkan sejauh mana bahagian hadapan visual berfungsi secara sendirian. Secara keseluruhannya, enam belas VLM teratas gagal mencapai ambang ketepatan 60%, dan sistem dengan prestasi terbaik tidak pernah mencapai 80% bagi mana-mana kemahiran tunggal. Halusinasi—menghasilkan butiran yang tidak ada dalam imej—adalah ralat yang paling biasa, manakala corak kekuatan dan kelemahan berbeza secara ketara antara model.
Siapa yang bakal rugi
Pembangun tidak seharusnya menggantikan pengelasan visual khusus dengan model AI umum.
Di mana hujah ini goyah
Data PerceptionBench menunjukkan pulangan yang semakin berkurangan: walaupun model yang paling besar masih tersandung dalam tugasan persepsi asas.
Langkah praktikal untuk pembangun
- Kekalkan pengelasan visual khusus untuk tugasan yang memerlukan ketepatan; anggap VLM sebagai pelengkap dan bukannya pengganti.
- Tambah lapisan pengesahan yang menyemak silang output model dengan pengesan yang dipercayai sebelum ia sampai kepada pengguna.
- Gunakan penapis penglihatan ringan untuk mengesan halusinasi atau salah pengelasan yang jelas pada peringkat awal dalam aliran kerja.
Memadankan VLM tujuan umum dengan komponen penglihatan yang dibina khusus membolehkan pasukan menggunakan keupayaan penaakulan model tersebut sambil melindungi daripada titik buta visualnya.
Sumber: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
