Il benchmark ActiveVision mostra che i principali modelli linguistici di grandi dimensioni (LLM) multimodali odierni hanno risolto solo il 10,6% dei compiti che richiedono di osservare un'immagine più di una volta. In un test su 17 sfide di percezione iterativa, gli esseri umani hanno avuto successo nel 96,1% dei casi, mentre GPT-5.5 è riuscito nel 10,6% e Claude Fable 5 nel 3,5%; undici dei compiti non hanno ricevuto alcuna risposta corretta da parte dei modelli.

Perché gli attuali modelli di visione vacillano

La maggior parte dei sistemi di visione tratta un'immagine come un input singolo. Un “vision encoder” estrae le caratteristiche una sola volta, per poi passarle al modello linguistico per il ragionamento. La pipeline non può richiedere un secondo sguardo, ingrandire una regione o rivalutare un'ipotesi. Gli esseri umani, al contrario, formulano un'ipotesi iniziale, spostano l'attenzione, raccolgono nuove prove e regolano la propria risposta. Il benchmark formalizza questo ciclo: ogni compito costringe il modello a osservare, proporre un'azione, osservare il risultato e ripetere finché non raggiunge una conclusione corretta.

Cosa ha testato il benchmark

I ricercatori hanno creato 17 scenari che richiedono un'osservazione ripetuta. I risultati sono netti:

  • Partecipanti umani: successo del 96,1%
  • GPT-5.5: successo del 10,6%
  • Claude Fable 5: successo del 3,5%
  • Undici compiti: ogni modello testato ha ottenuto zero

Anche quando i modelli hanno generato codice per rielaborare l'immagine, non sono riusciti a individuare errori nei propri output, confermando che il limite è di natura architettonica piuttosto che puramente basata sui dati.

Implicazioni per sviluppatori e industria

Se state costruendo robot autonomi, droni per l'ispezione o qualsiasi sistema che debba verificare informazioni visive nel tempo, un modello di visione single-shot è rischioso. Il benchmark dimostra che le attuali pipeline di visione basate su LLM non possono gestire in modo affidabile la percezione guidata dal feedback, pertanto perderanno difetti, conteranno male gli oggetti o interpreteranno erroneamente scene dinamiche. Aggiungere più dati di addestramento o aumentare i parametri non colmerà il divario; l'elemento mancante è un meccanismo di osservazione controllata e iterativa.

Controargomentazione: i modelli più grandi possono aiutare?

Aggiungere più dati di addestramento o aumentare i parametri non colmerà il divario; l'elemento mancante è un meccanismo di osservazione controllata e iterativa.

Percorsi futuri

I ricercatori suggeriscono una direzione complementare:

  • Riprogettazione architettonica – integrare un modulo visivo controllabile in grado di richiedere nuove inquadrature, ritagliare regioni o alterare le condizioni di illuminazione in base allo stato interno del modello.

Messaggio chiave: Gli attuali LLM multimodali eccellono nel rispondere a domande su immagini statiche, ma si rivelano inadeguati quando un problema richiede di guardare di nuovo. La vera intelligenza visiva richiederà modelli in grado di controllare la propria vista, non solo di leggere un'immagine una volta sola.