OpenAI ogłosiło, że ich model GPT-5.6 Sol osiągnął wynik 38,3% w benchmarku logicznym ARC-AGI-3, wyprzedzając Claude Opus 5 od Anthropic, który uzyskał 30,2%. Twierdzenie to wywołało natychmiastowy spór techniczny, ponieważ ten sam model uzyskał jedynie 7,8%, gdy został uruchomiony za pomocą oficjalnego środowiska testowego benchmarku.
Dlaczego wynik ARC-AGI-3 ma znaczenie
ARC-AGI-3 bada zdolność modelu do rozwiązywania zupełnie nowych, wymagających rozumowania problemów, zamiast polegania na zapamiętanych wzorcach. Badacze traktują te wyniki jako wskaźnik postępu w dziedzinie „ogólnej inteligencji” (general intelligence), więc dziesięciopunktowa przewaga wygląda na istotny krok w stronę rozwiązywania problemów na wzór ludzki. To samo w sobie wyjaśnia, dlaczego ta wiadomość odbiła się echem w społeczności AI.
Ukryty mechanizm: Retained Reasoning i Compaction
OpenAI nie oceniało GPT-5.6 Sol za pomocą publicznego środowiska testowego. Zamiast tego użyło własnego Responses API z dwiema zastrzeżonymi opcjami:
- Retained Reasoning – utrzymuje łańcuch myśli modelu (chain of thought) przez wiele kroków, zapobiegając utracie pośredniej logiki, która występuje, gdy każdy krok jest traktowany w izolacji.
- Compaction – kompresuje wcześniejszy kontekst zamiast go odcinać, co pozwala modelowi odwoływać się do dłuższej, podsumowanej historii.
Gdy te ustawienia są aktywne, model łączy dłuższe argumenty i ponownie wykorzystuje wcześniejsze wnioski, co sztucznie zawyża wyniki w zadaniach wieloetapowych. W oficjalnym środowisku, które odrzuca rozumowanie po każdej akcji, wynik tego samego modelu spada do 7,8%, plasując go znacznie poniżej Claude Opus 5.
OpenAI argumentuje, że benchmark powinien mierzyć cały proces wnioskowania (inference pipeline), a nie tylko surowe wagi neuronowe. Z tej perspektywy „wrapper” – czyli logika API, która zachowuje i kompresuje kontekst – stanowi część ocenianego systemu.
Debata o sprawiedliwości
François Chollet, współzałożyciel ARC Prize, który sponsoruje benchmark, zabrał głos w sprawie. Rozróżnił on dedykowane środowiska testowe budowane po to, by „rozwiązać” benchmark, od ogólnych ustawień API, które może włączyć każdy użytkownik. Chollet zauważył, że oryginalne środowisko testowe ARC Prize korzystało ze starszego typu API do uzupełniania tekstów (completions API) w stylu OpenAI, któremu brakowało zaawansowanych funkcji dostępnych obecnie w Claude API od Anthropic. To niedopasowanie mogło postawić OpenAI w gorszej sytuacji w wcześniejszych rundach.
Nie posunął się jednak do stwierdzenia, że porównanie jest nieważne. Chollet powiedział, że bezpośrednie porównanie pozostaje dopuszczalne, jeśli dokładne ustawienia oraz wszelkie powiązane koszty zostaną ujawnione. Przejrzystość, jak argumentował, pozwala społeczności ocenić, czy różnica wynika z architektury modelu, trików inżynieryjnych, czy obu tych czynników.
Kto wygrywa, kto przegrywa
Jeśli wyższy wynik zostanie przyjęty bezkrytycznie, OpenAI zyska wzrost wizerunkowy i silniejszą pozycję negocjacyjną w rozmowach o licencjonowaniu dla przedsiębiorstw. Zespół Claude może wskazać na wydajność surowego modelu w ustandaryzowanym środowisku jako dowód na to, że ich architektura jest bardziej efektywna, gdy zostanie pozbawiona dodatkowych warstw inżynieryjnych.
Badacze i programiści, którzy polegają na rankingach benchmarków przy kierowaniu inwestycjami, mogą uznać tę sytuację za niepokojącą. Przypadek ten pokazuje, że wraz ze wzrostem rozmiarów modeli, oprogramowanie zarządzające ich wnioskowaniem może stać się decydujące. Firmy, które dostarczają wyrafinowane stosy wnioskowania (inference stacks) przy niskim koszcie krańcowym, mogą dominować w nagłówkach dzięki wysokim wynikom, nawet nie posiadając lepszego modelu bazowego.
Co dalej z ARC-AGI-3 i innymi benchmarkami
Spór ten prawdopodobnie skłoni organizatorów ARC Prize do wprowadzenia ściślejszych zasad dotyczących dopuszczalnych konfiguracji wnioskowania. Możliwe reakcje obejmują:
- Publikowanie wyniku „bazowego” (baseline), który odzwierciedla wydajność uzyskaną wyłącznie przy użyciu oficjalnego środowiska testowego.
- Wymaganie od uczestników przedstawienia analizy kosztów wszelkich dodatkowych ustawień, aby wysoki wynik można było zestawić z dodatkowymi kosztami obliczeniowymi lub inżynieryjnymi.
- Dodanie osobnej ścieżki „systemowej” (system-level), która nagradzać będzie pomysłowe wykorzystanie funkcji zarządzania kontekstem.
Takie kroki wymusiłyby wyraźne oddzielenie surowych możliwości modelu od optymalizacji inżynieryjnej, co ułatwiłoby porównywanie przyszłych wyników.
Kontrargument: Benchmarki powinny odzwierciedlać rzeczywiste zastosowania
Jedna ze stron argumentuje, że podejście ograniczające się wyłącznie do „surowego modelu” jest nierealistyczne. W środowisku produkcyjnym programiści rutynowo nakładają na modele językowe mechanizmy buforowania (caching), podsumowywania kontekstu i inne techniki. Jeśli celem benchmarku jest przewidywanie praktycznej użyteczności, powinien on pozwalać – a nawet zachęcać – do takich optymalizacji. Z tej perspektywy Retained Reasoning i Compaction od OpenAI to uprawnione narzędzia, które każdy konkurent mógłby wdrożyć, pod warunkiem, że zostaną one publicznie udokumentowane.
Krytycy odpowiadają, że bez wspólnego punktu odniesienia wyniki stają się ruchomym celem, co podważa rolę benchmarku jako obiektywnej miary. Napięcie między trafnością ekologiczną (odzwierciedlającą rzeczywiste wdrożenia) a czystością metodologiczną (izolującą model) napędza obecny spór.
Wnioski
Twierdzenie dotyczące GPT-5.6 Sol uwypukla rosnący podział w ewaluacji AI: surowy talent modelu kontra ekosystem inżynieryjny, który go wydobywa. Dopóki społeczność będzie domagać się pełnej jawności ustawień wnioskowania oraz ich kosztów, debata będzie się zaostrzać, zamiast zaciemniać nasz obraz postępu w kierunku ogólnej inteligencji.
