OpenAI twierdzi, że jego model GPT-5.6 Sol osiągnął 38,3% skuteczności w benchmarku logicznego rozumowania ARC-AGI-3, wyprzedzając Claude Opus 5 od Anthropic, który uzyskał 30,2%. Przewaga ta pojawia się jedynie wtedy, gdy model działa w oparciu o niestandardowe Responses API od OpenAI, które dodaje dwie sztuczki stosowane podczas wnioskowania (inference-time), których nie pozwala na użycie oficjalny zestaw testowy.
Wstęp: wyścig zbrojeń w benchmarkach
ARC-AGI-3 bada zdolność modelu do rozwiązywania nowych, wieloetapowych problemów bez polegania na zapamiętanych faktach. Na początku tego roku Anthropic ogłosiło czterokrotny skok w tym benchmarku, umieszczając Opus 5 na szczycie publicznej tabeli wyników. Wynik ten wyznaczył nowy punkt odniesienia dla „surowych” możliwości modelu, ponieważ oficjalny zestaw testowy odrzuca wszelkie pośrednie rozumowanie po każdym kroku, zmuszając model do rozpoczynania od nowa za każdym razem.
Twierdzenie OpenAI wpisuje się w ten sam klimat rywalizacji. Publikując wyższy wynik, firma sygnalizuje, że jej najnowsza generacja może nie tylko dorównać, ale i przewyższyć wydajność logiczną swojego głównego rywala. Nagłówek maskuje jednak techniczny niuans, który zmienia sposób, w jaki społeczność interpretuje tabele wyników benchmarków.
Co tak naprawdę oznaczają te liczby
Gdy GPT-5.6 Sol jest oceniany przy użyciu tego samego oficjalnego zestawu testowego ARC-AGI-3, który dał Opus 5 wynik 30,2%, skuteczność modelu spada do 7,8%. Ta różnica nie jest błędem; jest wynikiem dwóch zaprojektowanych funkcji, które OpenAI dołącza do modelu:
- Retained Reasoning – zamiast usuwać łańcuch myśli (chain-of-thought) po każdym podzadaniu, system zachowuje tekst pośredni, pozwalając modelowi odwoływać się do wcześniejszych wniosków i budować skumulowany argument.
- Compaction – zamiast skracać starszy kontekst, aby zmieścić się w limitach tokenów, wrapper kompresuje poprzednie kroki do krótkiego podsumowania, zachowując wątek logiczny przy jednoczesnym utrzymaniu zarządzalnego rozmiaru promptu.
Oba mechanizmy znajdują się w zastrzeżonym Responses API. Dostarczając modelowi bogatszy, ciągły kontekst, OpenAI skutecznie rozszerza „pamięć” modelu i pozwala mu ponownie wykorzystywać własne rozumowanie. Oficjalny zestaw testowy, w przeciwieństwie do tego, wymusza ścisły tryb „bezstanowy” (stateless), który pozbawia model tych zalet.
Dlaczego metodologia ma znaczenie
Ten epizod uwypukla rosnący podział w ewaluacji AI: surowe wyniki modelu kontra wydajność na poziomie systemu. OpenAI argumentuje, że benchmark powinien odzwierciedlać cały stos technologiczny, który programiści faktycznie wdrożą – model, potok wnioskowania (inference pipeline) oraz zarządzanie pamięcią. Z tej perspektywy wynik 38,3% mówi zespołowi produktowemu, że połączona oferta może rozwiązywać więcej zadań w świecie rzeczywistym niż model oceniany w izolacji.
Krytycy twierdzą, że zaciera to postęp naukowy. Jeśli każde laboratorium będzie dodawać własne, dedykowane wrappery, tabela wyników stanie się mozaiką sztuczek inżynieryjnych, a nie czystym porównaniem inteligencji modeli. Oficjalny zestaw testowy ARC-AGI-3 ma na celu wyrównanie szans, zapewniając, że wyższa liczba oznacza faktycznie silniejszy model bazowy, a nie sprytniejszy wrapper.
Stawka dla programistów i inwestorów
Dla startupów budujących produkty oparte na AI różnica ta ma wymiar praktyczny. Model, który potrafi zachować rozumowanie i skompresować kontekst, może wymagać mniej prompt engineeringu, mieć niższe opóźnienia wnioskowania (inference latency) i wymagać mniejszej liczby wywołań API, aby dojść do rozwiązania. Przekłada się to na niższe rachunki za moc obliczeniową i płynniejsze doświadczenia użytkownika. Firmy, które dostarczają gotowe systemy – model wraz ze zoptymalizowaną warstwą wnioskowania – zyskują przewagę konkurencyjną tam, gdzie liczy się szybkość i koszt.
Inwestorzy obserwują wzrosty w benchmarkach jako wskaźniki przyszłych przychodów. Przewaga przyciągająca uwagę mediów może podnieść wycenę firmy, nawet jeśli surowe możliwości modelu bazowego są na poziomie konkurencji. Debata nad tym, co oznaczają liczby, wpływa zatem na przepływ kapitału w sektorze AI.
Na co warto zwrócić uwagę w przyszłości
- Reakcje organizatorów standardów – organizatorzy benchmarków mogą zaostrzyć zasady dotyczące „zewnętrznych” sztuczek podczas wnioskowania lub dodać oddzielną kategorię „systemową”, która wyraźnie na nie pozwala. Ich reakcja ukształtuje kolejną falę publicznych tabel wyników.
- Wrappery open-source – jeśli społeczność udostępni własne implementacje mechanizmów retained reasoning i compaction, przewaga ta może stać się standardową funkcją, a nie zastrzeżoną zaletą.
- Środowiska testowe w świecie rzeczywistym – firmy coraz częściej publikują wyniki na własnych zestawach problemów (np. wewnętrzne zestawy do generowania kodu). Wyniki te, choć trudniejsze do porównania, zaczną mieć większe znaczenie niż pojedynczy publiczny benchmark.
Kontrargument: czy to „naciąganie” benchmarku?
Niektórzy badacze określają stosowanie niestandardowych API mianem „benchmark gaming”, argumentując, że zawyża to wyniki bez rzeczywistego postępu w zrozumieniu rdzenia modelu. Wskazują oni, że model, którego wydajność spada do jednocyfrowych wartości pod rygorystycznymi ograniczeniami, wciąż jest daleko od celu, jakim jest AGI. Istnieje obawa, że dziedzina ta może zacząć nagradzać inżynieryjne drogi na skróty zamiast autentycznych skoków w zdolnościach rozumowania.
Strona OpenAI podkreśla, że granica między modelem a systemem staje się coraz bardziej sztuczna. Nowoczesne aplikacje AI rzadko uruchamiają model w próżni; zawsze działają one za warstwą serwującą, która obsługuje buforowanie, łączenie kontekstu oraz post-processing wyników. Z tej perspektywy mierzenie całego potoku (pipeline) jest bardziej uczciwym odzwierciedleniem tego, czego użytkownicy faktycznie doświadczają.
Wnioski
Historia GPT-5.6 Sol pokazuje, że dzisiejsze zwycięstwa w benchmarkach zależą w takim samym stopniu od inżynierii wnioskowania (inference engineering), co od rozmiaru modelu. To, czy społeczność zaakceptuje wyniki na poziomie systemowym, czy też ukróci stosowanie niestandardowych wrapperów, zadecyduje o tym, jak będziemy interpretować kolejne nagłówki o „liderach rankingów”. Dla każdego, kto buduje lub finansuje produkty AI, lekcja jest jasna: surowe liczby mają znaczenie, ale otaczające je oprogramowanie może być decydującym czynnikiem w rzeczywistej wydajności.
