Model Fable 5 od Anthropic zdobył pierwszą odznakę w 1 785 turach, wydając 65,40 USD, grając w chińską wersję Pokémon FireRed, korzystając wyłącznie z wizualnych danych wyjściowych gry. Ten przebieg dowodzi, że model potrafi ukończyć rozpoznawalny fragment gry bez żadnych podpowiedzi tekstowych, jednak głęboka analiza łańcucha myśli modelu pokazuje, że recytował on zapamiętaną wiedzę o grze, zamiast naprawdę „widzieć” i wnioskować na podstawie każdego piksela.

Twierdzenie Anthropic poddane próbie

Kiedy Anthropic wypuściło Fable 5, firma wyróżniła demo typu „vision-only” (wyłącznie wizualne), w którym model nawigował w Pokémon FireRed, patrząc wyłącznie na ekran. Nagłówek sprawiał wrażenie, jakby system potrafił interpretować każde środowisko wizualne od zera. Deweloper postanowił zweryfikować to twierdzenie, odtwarzając konfigurację opisaną na stronie premierowej Anthropic i uruchamiając model na chińskim tłumaczeniu gry.

Jak przeprowadzono eksperyment

Dedykowany mechanizm testowy (harness) dostarczał modelowi surowe klatki wideo i rejestrował jego wybory działań. Mechanizm był zgodny z opisem Anthropic – przekazywał każdą nową klatkę do modelu i odczytywał wybrane polecenia kontrolera. Test przeprowadzał pełną pętlę gry, aż model zdobył swoją pierwszą odznakę, a następnie trwał do 2000. tury, kiedy awatar dotarł do Trasy 3 (Route 3).

Wynik ilościowy był jasny:

  • Pierwsza odznaka zdobyta po 1 785 turach
  • Całkowity koszt obliczeń 65,40 USD
  • W 2000. turze awatar znajdował się na Trasie 3 (Route 3)

Co ujawniają logi

Surowe logi opowiadają jednak inną historię o tym, jak model tam dotarł. Wewnętrzny „łańcuch myśli” modelu wielokrotnie zapisywał informacje, które nie pojawiły się jeszcze na ekranie.

  • W 78. turze model odnotował, że rywal wybierze Charmandera, mimo że gra nie wyświetliła jeszcze wyboru rywala.
  • 141 tur później, gdy gra w końcu przekazała graczowi przesyłkę profesora Oak'a (Oak’s Parcel), model zdążył już zapisać nazwę przedmiotu w swoich notatkach.
  • Podczas przemierzania Trasy 3, model zidentyfikował konkretnego trenera, cytując słynną kwestię dialogową, która nigdy nie pojawiła się w strumieniu wizualnym.

Wpisy te nie są wynikiem analizy piksel po pikselu. Są one znakiem rozpoznawczym systemu, który przyswoił sobie szczegółowy scenariusz gry – dokładnie taki rodzaj wiedzy, jaki można znaleźć w poradnikach, wiki i filmach fanowskich krążących w internecie. Innymi słowy, model zdaje się wykorzystywać wzrok jedynie do potwierdzenia mapy, którą już zna na pamięć.

Dlaczego ma to znaczenie dla benchmarków rozumowania wizualnego

Eksperyment podkreśla subtelną, ale krytyczną wadę wielu testów rozumowania wizualnego:

  • Czysty sygnał wejściowy nie gwarantuje czystego stanu wiedzy. Nawet gdy jedynym kanałem jest strumień obrazu, model może korzystać z ogromnego zasobu zapamiętanych faktów.
  • Promptów systemowych nie da się użyć do usunięcia danych treningowych. Modelu, który widział kompletny poradnik, nie da się zmusić do „zapomnienia” go bez ponownego trenowania.
  • Wydajność może mierzyć pamięć, a nie percepcję. Gdy świat testowy pokrywa się ze znanym zbiorem danych, model może odnieść sukces poprzez dopasowywanie wzorca do wzorca, zamiast faktycznie interpretować nowe informacje wizualne.

Jeśli benchmarki będą nadal traktować „vision-only” jako substytut rozumowania wizualnego, ryzykują wyolbrzymianie twierdzeń o zdolności AI do rozumienia nowych środowisk. Firmy mogą chwalić się imponującymi liczbami, podczas gdy faktyczny zestaw umiejętności pozostaje wąski – jest to kwestia istotna dla inwestorów, deweloperów i każdego, kto buduje systemy krytyczne pod względem bezpieczeństwa, które muszą działać w zupełnie nieznanych warunkach.

Kontrargument: czy zapamiętywanie to naprawdę problem?

Niektórzy argumentują, że potwierdzanie znanej mapy wciąż wymaga pewnej formy rozumowania: model musi dopasować swoją wewnętrzną reprezentację do bieżącego sygnału wizualnego. Z tej perspektywy demo demonstruje przydatną zdolność – wykorzystanie wzroku do osadzania (grounding) istniejącej już bazy wiedzy. Zastrzeżenie to jest zasadne; zadanie faktycznie obejmuje sprawdzenie percepcyjne.

Jednak głównym celem benchmarku jest ocena ogólnego wnioskowania wizualnego, a nie odtwarzania zapisanego scenariusza. Gdy model potrafi przewidzieć zdarzenia, zanim się pojawią, test przestaje izolować percepcję. Granica między przydatnym osadzaniem wiedzy a zwykłym oszustwem zaciera się, a wyniki tracą wartość diagnostyczną.

Dalsze kroki i reakcja społeczności

Aby zbadać granice zapamiętywania, tester uruchamia teraz ten sam model na zmodyfikowanej mapie ze zmienioną geografią. Cały kod, niestandardowe środowisko testowe oraz pełne pliki logów zostały udostępnione publicznie, co ma zachęcić innych badaczy do powtórzenia eksperymentu lub zastosowania go w innych grach. Otwarto również kanał dyskusyjny na platformie społeczności edukacyjnej, aby umożliwić prowadzenie stałego dialogu.

Wnioski

Demo oparte wyłącznie na wizji, które odnosi sukces tylko dlatego, że model zna już odpowiedź, nie stanowi dowodu na rzeczywiste rozumowanie wizualne. Benchmarki muszą oddzielać zapamiętaną wiedzę od percepcji dokonywanej na bieżąco, w przeciwnym razie ryzykują przeszacowanie zdolności AI do nawigowania w prawdziwie nieznanych światach wizualnych.