I modelli vision-language (VLM) non riescono ancora a centrare l'obiettivo nei compiti visivi elementari. Una nuova valutazione di PerceptionBench ha rilevato che nessuno dei sedici sistemi leader supera il 60% di accuratezza complessiva, e anche il più forte rimane sotto l'80% in qualsiasi singola abilità. Il risultato avverte gli sviluppatori che punteggi elevati nei popolari test di captioning o di ragionamento non garantiscono una visione affidabile.
Perché i test esistenti nascondono il problema
La maggior parte dei benchmark pubblici mescola descrizione delle immagini, question answering e ragionamento di senso comune. Quando un modello genera una didascalia errata, l'errore potrebbe essere un'imprecisione linguistica, un errore di ragionamento o un semplice fallimento nel riconoscere l'oggetto. Poiché i tre componenti sono intrecciati, un punteggio basso non fornisce indizi sulla carenza visiva. Di conseguenza, i team che sviluppano applicazioni traggono una fiducia eccessiva dai numeri principali, assumendo che il modello "veda" correttamente.
Cosa fa di diverso PerceptionBench
PerceptionBench isola dieci abilità visive e valuta ogni modello su un set di compiti di pura visione. Eliminando il linguaggio e il ragionamento, il benchmark mostra quanto funzioni bene il front-end visivo da solo. In generale, i sedici migliori VLM non raggiungono la soglia del 60% di accuratezza, e il sistema con le prestazioni migliori non raggiunge mai l'80% in alcuna singola abilità. L'allucinazione — ovvero la produzione di dettagli non presenti nell'immagine — è l'errore più comune, mentre il pattern di punti di forza e di debolezza varia ampiamente tra i modelli.
Chi rischia di perdere
Gli sviluppatori non dovrebbero sostituire i classificatori visivi dedicati con modelli di IA generica.
Dove l'argomentazione vacilla
I dati di PerceptionBench mostrano rendimenti decrescenti: anche i modelli più grandi inciampano ancora in compiti di percezione di base.
Passaggi pratici per gli sviluppatori
- Mantenere classificatori visivi dedicati per i compiti che richiedono precisione; trattare i VLM come complementari piuttosto che come sostituti.
- Aggiungere uno strato di verifica che incroci gli output del modello con un rilevatore affidabile prima che raggiungano l'utente.
- Implementare un filtro visivo leggero per intercettare precocemente allucinazioni o classificazioni errate evidenti nella pipeline.
Abbinare un VLM general-purpose a un componente di visione costruito ad hoc consente ai team di sfruttare le capacità di ragionamento del primo, proteggendosi al contempo dai suoi punti ciechi visivi.
Fonte: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
