Il modello Fable 5 di Anthropic ha ottenuto la prima medaglia della palestra in 1.785 turni, spendendo 65,40 $, giocando a una versione in lingua cinese di Pokémon FireRed utilizzando esclusivamente l'output visivo del gioco. La sessione dimostra che il modello può completare un segmento riconoscibile del gioco senza alcun prompt testuale, ma un'analisi approfondita della catena di pensiero del modello mostra che stava recitando conoscenze di gioco memorizzate piuttosto che "vedere" e ragionare realmente su ogni singolo pixel.
La dichiarazione di Anthropic messa alla prova
Quando Anthropic ha rilasciato Fable 5, l'azienda ha messo in risalto una demo "vision-only" in cui il modello navigava in Pokémon FireRed guardando solo lo schermo. Il titolo faceva sembrare che il sistema potesse interpretare qualsiasi ambiente visivo da zero. Uno sviluppatore ha deciso di verificare tale affermazione riproducendo la configurazione descritta sulla pagina di lancio di Anthropic ed eseguendo il modello su una traduzione cinese del gioco.
Come è stato condotto l'esperimento
Un harness personalizzato ha fornito al modello i fotogrammi video grezzi e ha registrato le sue scelte di azione. L'harness corrispondeva alla descrizione di Anthropic, passando ogni nuovo fotogramma al modello e leggendo l'input del controller selezionato. Il test ha eseguito l'intero ciclo di gioco finché il modello non ha ottenuto la sua prima medaglia della palestra, continuando poi fino al turno 2.000, quando l'avatar ha raggiunto la Rotta 3.
Il risultato quantitativo è stato chiaro:
- Prima medaglia della palestra ottenuta dopo 1.785 turni
- Costo totale di calcolo 65,40 $
- Al turno 2.000 l'avatar si trovava sulla Rotta 3
Cosa rivelano i log
I log grezzi, tuttavia, raccontano una storia diversa su come il modello ci sia arrivato. La "catena di pensiero" interna del modello ha annotato ripetutamente informazioni che non erano ancora apparse sullo schermo.
- Al turno 78, il modello ha notato che il rivale avrebbe scelto Charmander, anche se il gioco non aveva ancora mostrato la scelta del rivale.
- 141 turni dopo, quando il gioco ha finalmente consegnato al giocatore il Pacco di Oak, il modello aveva già registrato il nome dell'oggetto nei suoi appunti.
- Mentre attraversava la Rotta 3, il modello ha identificato un allenatore specifico citando una famosa battuta di dialogo che non era mai apparsa nel feed visivo.
Queste annotazioni non sono il prodotto di un'analisi pixel per pixel. Sono i segni distintivi di un sistema che ha interiorizzato una sceneggiatura dettagliata del gioco — esattamente il tipo di conoscenza che si trova nei walkthrough, nelle wiki e nei video dei fan che popolano internet. In altre parole, il modello sembra usare la visione solo per confermare una mappa che conosce già a memoria.
Perché è importante per i benchmark di ragionamento visivo
L'esperimento evidenzia un difetto sottile ma critico in molti test di ragionamento visivo:
- Un input pulito non garantisce uno stato di conoscenza pulito. Anche quando l'unico canale è un flusso di immagini, il modello può attingere a un enorme serbatoio di fatti memorizzati.
- I prompt di sistema non possono cancellare i dati di addestramento. Un modello che ha visto un walkthrough completo non può essere costretto a "dimenticarlo" senza un nuovo addestramento.
- Le prestazioni potrebbero misurare la memoria, non la percezione. Quando il mondo di test corrisponde a un dataset noto, un modello può avere successo accoppiando pattern a pattern invece di interpretare realmente nuove informazioni visive.
Se i benchmark continueranno a trattare la "vision-only" come un sostituto del ragionamento visivo, rischiano di gonfiare le affermazioni sulla capacità dell'IA di comprendere ambienti nuovi. Le aziende potrebbero vantare numeri impressionanti mentre le competenze sottostanti rimangono limitate — un problema che riguarda investitori, sviluppatori e chiunque costruisca sistemi critici per la sicurezza che devono operare in contesti realmente inediti.
Controargomentazione: la memorizzazione è davvero un problema?
Alcuni sostengono che confermare una mappa nota richieda comunque una forma di ragionamento: il modello deve allineare la sua rappresentazione interna con l'indizio visivo attuale. Da questa prospettiva, la demo dimostra una capacità utile — usare la visione per ancorare una base di conoscenza preesistente. L'obiezione è valida; il compito comporta effettivamente un controllo percettivo.
Tuttavia, l'obiettivo principale del benchmark è valutare l'inferenza visiva generale, non il recupero di una sceneggiatura memorizzata. Quando un modello può prevedere gli eventi prima che appaiano, il test non isola più la percezione. Il confine tra un utile ancoraggio e un vero e proprio imbroglio si fa labile, e i risultati perdono valore diagnostico.
Prossimi passi e risposta della community
Per sondare i limiti della memorizzazione, il tester sta ora eseguendo lo stesso modello su una mappa modificata con una geografia alterata. Tutto il codice, l'harness personalizzato e i file di log completi sono stati resi pubblici, invitando altri ricercatori a replicare l'esperimento o ad applicarlo a giochi diversi. È stato inoltre aperto un canale di discussione su una piattaforma di una community di apprendimento per un dialogo continuo.
Punti chiave
Una demo basata esclusivamente sulla visione che ha successo perché il modello conosce già la risposta non è una prova di un reale ragionamento visivo. I benchmark devono separare la conoscenza memorizzata dalla percezione in tempo reale, altrimenti rischiano di sopravvalutare la capacità dell'IA di navigare in mondi visivi realmente sconosciuti.
