Badacze ogłosili nowy framework uczenia ze wzmocnieniem o nazwie Ring-Zero, który pozwala językowemu modelowi o bilionie parametrów nauczyć się rozumowania przy jednoczesnym zachowaniu limitów budżetu tokenów, a model uzyskał wynik 84,2% w matematycznym egzaminie AIME z 2026 roku. Wynik ten pokazuje, że w takiej skali model może nabyć nawyki rozwiązywania problemów krok po kroku, które inżynierowie tradycyjnie wpisywali na sztywno w prompty.

Dlaczego to ma znaczenie

Wyniki na poziomie AIME od dawna stanowią punkt odniesienia dla „ludzkiego” rozumowania ilościowego. Osiągnięcie poziomu 84,2% bez żadnych przykładów napisanych przez człowieka sugeruje, że zdolności rozumowania modelu wyłaniają się z samej dynamiki treningu, a nie z ręcznie przygotowanych struktur. Dla firm budujących agentów AI wniosek jest jasny: pisanie i utrzymywanie złożonych receptur promptów może zostać zastąpione przez pętlę treningową, która uczy model, kiedy należy intensywniej myśleć, a kiedy wystarczy tania droga na skróty.

Od inżynierii promptów do dynamiki treningu

Przez lata programiści polegali na szablonach promptów, takich jak „podziel problem na części” lub „zweryfikuj swoją odpowiedź”, aby skłonić duże modele językowe do wieloetapowego rozumowania. Szablony te działają jak zewnętrzne rusztowanie; model podąża za instrukcjami, ale nie internalizuje procesu. Ring-Zero odwraca ten paradygmat. Model otrzymuje opis zadania wraz ze wzorcową odpowiedzią (ground-truth) — prawdą podstawową, którą można automatycznie sprawdzić. Następnie generuje serię prób, otrzymując nagrodę tylko wtedy, gdy próba zgadza się ze wzorcową odpowiedzią, i aktualizuje swoją politykę poprzez uczenie ze wzmocnieniem.

Ponieważ nagroda wiąże się z celem, który trudno oszukać (odpowiedź musi być poprawna, a nie tylko prawdopodobna), model samodzielnie odkrywa wzorce rozumowania. W pracy argumentuje się, że gdy tylko pojawi się niezawodny sygnał nagrody, skalowanie modelu do biliona parametrów automatycznie wydobywa tego rodzaju sztuczki z zakresu inżynierii promptów, które inżynierowie ręcznie wprowadzali dla mniejszych modeli.

Czterostopniowy proces treningowy

Trening Ring-Zero przebiega w czterech odrębnych etapach:

  1. RL w pierwszym etapie – Model eksploruje możliwe ścieżki rozumowania, ucząc się, które sekwencje tokenów mają tendencję do prowadzenia do poprawnych odpowiedzi.
  2. Autodystylacja – Wysokiej jakości ścieżki wracają do modelu, stabilizując wyłaniające się wzorce rozumowania.
  3. RL w drugim etapie – Bardziej precyzyjna pętla dopracowuje politykę, zachowując wcześniejsze ulepszenia.
  4. Trening wielopoziomowy – Model uczy się inteligentnie przydzielać budżety tokenów, wybierając między krótkimi (≈2 tys. tokenów) a długimi (≈20 tys. tokenów) ścieżkami rozumowania w zależności od trudności problemu.

Trening wielopoziomowy jest elementem najbardziej istotnym z punktu widzenia wdrożeń produkcyjnych. W rzeczywistych zastosowaniach każdy dodatkowy token zwiększa koszt obliczeniowy. Ucząc model rozpoznawania, kiedy problem jest wystarczająco prosty dla krótkiej odpowiedzi, a kiedy wymaga głębokiej, wieloetapowej analizy, Ring-Zero bezpośrednio wiąże jakość rozumowania z efektywnością ekonomiczną.

Dwie fazy uczenia: odkrywanie i wyostrzanie

Autorzy opisują krzywą uczenia się jako proces dwufazowy:

  • Odkrywanie – Wczesne kroki uczenia ze wzmocnieniem są szumne; model testuje szeroką gamę strategii, z których wiele kończy się niepowodzeniem. Ta wariancja jest niezbędna do odkrycia nowych ścieżek rozumowania.
  • Wyostrzanie – Gdy pojawi się obiecujący wzorzec, późniejsze kroki RL usztywniają politykę, zmniejszając wariancję i utrwalając zachowanie.

Postęp ten odzwierciedla sposób, w jaki doskonalą się ludzie: początkowa burza mózgów, a następnie skoncentrowana praktyka. Kluczowym spostrzeżeniem jest to, że „chaotyczny” wczesny etap należy zaakceptować, a nie tłumić, ponieważ dostarcza on surowca do późniejszego dopracowania.

Co może pójść nie tak?

Optymizm zawarty w pracy opiera się na kilku założeniach, które zasługują na wnikliwą analizę:

  • Projektowanie nagrody – Framework potrzebuje nagrody, która jest zarówno weryfikowalna, jak i odporna na stosowanie dróg na skróty. W wielu rzeczywistych zadaniach zdefiniowanie takiej nagrody nie jest proste i może wymagać kosztownych procesów adnotacji.
  • Wąskie gardła środowiskowe – Autorzy zauważają, że wydajność modelu jest ograniczona nie przez jego rozmiar, ale przez otaczającą infrastrukturę ewaluacyjną (zestawy testowe, logi, jasne metryki). Budowa i utrzymanie takiej infrastruktury może stanowić znaczny wysiłek inżynieryjny.
  • Koszt obliczeniowy treningu – Trenowanie modelu o bilionie parametrów z wieloma etapami RL jest kosztowne. Choć trening wielopoziomowy obniża koszty wnioskowania, początkowy budżet treningowy pozostaje wysoki, co może ograniczać to podejście do dobrze dofinansowanych laboratoriów.

Co warto obejrzeć dalej

Praktyczne wnioski dla praktyków AI

  • Nie traktuj promptów jako jedynej dźwigni – Zastanów się, czy zachowanie, które kodujesz w promptach, nie mogłoby zostać nabyte poprzez pętlę treningową opartą na nagrodach.
  • Uczyń zużycie tokenów priorytetowym celem – Wprowadź sygnały uwzględniające budżet na wczesnym etapie; model nauczy się balansować między dokładnością a kosztem obliczeniowym.
  • Zamknij pętlę informacji zwrotnej – Wdróż system, który automatycznie dostarcza zadania, mierzy wyniki w odniesieniu do weryfikowalnych odpowiedzi i przekazuje rezultaty z powrotem do procesu trenowania. To właśnie w tej pętli model odkrywa własny workflow.

Gdy nagroda jest jasna, a środowisko potrafi niezawodnie mierzyć sukces, skalowanie modelu robi coś więcej niż tylko zwiększa surową moc obliczeniową – uczy model wyboru sposobu myślenia. Ta zmiana – od ręcznie tworzonych struktur wspierających do samodzielnego rozumowania – może zmienić sposób, w jaki budujemy i wyceniamy agentów AI.