Pesquisadores anunciaram um novo framework de aprendizado por reforço chamado Ring-Zero que permite que um modelo de linguagem de um trilhão de parâmetros aprenda a raciocinar mantendo-se dentro dos limites de orçamento de tokens, e o modelo obteve 84,2% no exame de matemática AIME de 2026. O resultado mostra que, nessa escala, o modelo pode adquirir os hábitos de resolução de problemas passo a passo que os engenheiros tradicionalmente codificavam de forma rígida em prompts.
Por que isso é importante
O desempenho de nível AIME tem sido, há muito tempo, um benchmark para o raciocínio quantitativo de "nível humano". Atingir a faixa de 84,2% sem quaisquer exemplos escritos por humanos sugere que as habilidades de raciocínio do modelo emergem das próprias dinâmicas de treinamento, e não de estruturas de suporte criadas manualmente. Para empresas que constroem agentes de IA, a implicação é clara: escrever e manter receitas elaboradas de prompts poderia ser substituído por um loop de treinamento que ensina o modelo quando pensar mais profundamente e quando um atalho simples será suficiente.
Da engenharia de prompts para as dinâmicas de treinamento
Durante anos, os desenvolvedores confiaram em templates de prompts como “divida o problema em partes” ou “verifique sua resposta” para induzir grandes modelos de linguagem ao raciocínio de múltiplas etapas. Esses templates atuam como um andaime externo; o modelo segue as instruções, mas não internaliza o processo. O Ring-Zero inverte esse paradigma. O modelo recebe uma descrição da tarefa junto com uma resposta verificável — um ground-truth que pode ser verificado automaticamente. Ele então gera uma série de tentativas, recebe uma recompensa apenas quando a tentativa corresponde à resposta verificável e atualiza sua política por meio de aprendizado por reforço.
Como a recompensa está ligada a um objetivo difícil de burlar (a resposta deve estar correta, não apenas ser plausível), o modelo descobre padrões de raciocínio por conta própria. O artigo argumenta que, uma vez estabelecido um sinal de recompensa confiável, escalar o modelo para um trilhão de parâmetros traz à tona automaticamente os tipos de truques de engenharia de prompts que os engenheiros inseriam manualmente em modelos menores.
O pipeline de treinamento de quatro etapas
O treinamento do Ring-Zero procede através de quatro estágios distintos:
- RL de primeira etapa – O modelo explora possíveis rastros de raciocínio, aprendendo quais sequências de tokens tendem a levar a respostas corretas.
- Autodestilação – Rastros de alta qualidade retornam para o modelo, estabilizando os padrões de raciocínio emergentes.
- RL de segunda etapa – Um loop de granularidade mais fina refina a política, preservando as melhorias anteriores.
- Treinamento em camadas (Tiered training) – O modelo aprende a alocar orçamentos de tokens de forma inteligente, escolhendo entre caminhos de raciocínio curtos (≈2 mil tokens) e longos (≈20 mil tokens), dependendo da dificuldade do problema.
O treinamento em camadas é a parte mais relevante para a produção. Em implementações reais, cada token adicional adiciona custo de computação. Ao ensinar o modelo a reconhecer quando um problema é simples o suficiente para uma resposta curta e quando ele justifica uma análise profunda de múltiplas etapas, o Ring-Zero vincula diretamente a qualidade do raciocínio à eficiência econômica.
Duas fases de aprendizado: descoberta e refinamento
Os autores descrevem a curva de aprendizado como um processo de duas fases:
- Descoberta – As etapas iniciais de aprendizado por reforço são ruidosas; o modelo tenta uma ampla variedade de estratégias, muitas das quais falham. Essa variância é essencial para descobrir novos caminhos de raciocínio.
- Refinamento (Sharpening) – Assim que um padrão promissor surge, as etapas posteriores de RL ajustam a política, reduzindo a variância e solidificando o comportamento.
A progressão espelha como os humanos melhoram: um brainstorming inicial seguido de prática focada. A ideia central é que a fase inicial "desorganizada" deve ser abraçada em vez de suprimida, pois ela fornece a matéria-prima para o refinamento posterior.
O que pode dar errado?
O otimismo do artigo depende de algumas suposições que merecem escrutínio:
- Design de recompensa – O framework precisa de uma recompensa que seja tanto verificável quanto resistente a atalhos. Para muitas tarefas do mundo real, definir tal recompensa não é trivial e pode exigir pipelines de anotação dispendiosos.
- Gargalos ambientais – Os autores apontam que o desempenho do modelo é limitado não pelo seu tamanho, mas pela infraestrutura de avaliação circundante (suítes de teste, logs, métricas claras). Construir e manter essa infraestrutura pode ser um esforço de engenharia substancial.
- Custo de computação do treinamento – Treinar um modelo de um trilhão de parâmetros com múltiplas etapas de RL é caro. Embora o treinamento em camadas reduza os custos de inferência, o orçamento inicial de treinamento permanece alto, potencialmente restringindo a abordagem a laboratórios bem financiados.
O que acompanhar a seguir
Lições práticas para profissionais de IA
- Não trate os prompts como a única alavanca – Pergunte-se se um comportamento que você está codificando em prompts poderia, em vez disso, ser aprendido por meio de um loop de treinamento baseado em recompensa.
- Torne o uso de tokens um objetivo de primeira classe – Adicione sinais conscientes do orçamento desde cedo; o modelo aprenderá a equilibrar a precisão em relação ao custo computacional.
- Feche o loop de feedback – Implemente um sistema que forneça tarefas automaticamente, meça os resultados em relação a respostas verificáveis e alimente os resultados de volta no treinamento. O loop é onde o modelo descobre seu próprio fluxo de trabalho.
Quando a recompensa é clara e o ambiente consegue medir o sucesso de forma confiável, escalar o modelo faz mais do que apenas adicionar capacidade bruta — ele ensina o modelo a escolher como pensar. Essa mudança de estruturas escritas à mão para o raciocínio autodirigido pode remodelar a forma como construímos e precificamos agentes de IA.
