연구진은 1조 개의 파라미터를 가진 언어 모델이 토큰 예산 제한 내에서 추론하는 법을 배울 수 있게 하는 새로운 강화 학습 프레임워크인 Ring-Zero를 발표했으며, 이 모델은 2026년 AIME 수학 시험에서 84.2%의 점수를 기록했습니다. 이 결과는 이 정도 규모에서는 모델이 엔지니어들이 전통적으로 프롬프트에 하드코딩해 온 단계별 문제 해결 습관을 스스로 습득할 수 있음을 보여줍니다.
이것이 중요한 이유
AIME 수준의 성능은 오랫동안 "인간 수준"의 정량적 추론을 가늠하는 벤치마크였습니다. 사람이 작성한 예시 없이 84.2% 범위에 도달했다는 것은 모델의 추론 능력이 수작업으로 만든 스캐폴딩(scaffold)이 아니라 학습 역학 자체에서 비롯됨을 시사합니다. AI 에이전트를 구축하는 기업들에게 시사하는 바는 명확합니다. 정교한 프롬프트 레시피를 작성하고 유지 관리하는 대신, 모델에게 언제 더 깊이 생각해야 하고 언제 저렴한 지름길을 사용해도 되는지를 가르치는 학습 루프로 대체될 수 있다는 것입니다.
프롬프트 엔지니어링에서 학습 역학으로
수년 동안 개발자들은 대규모 언어 모델이 다단계 추론을 하도록 유도하기 위해 "문제를 부분으로 나누세요" 또는 "답변을 검증하세요"와 같은 프롬프트 템플릿에 의존해 왔습니다. 이러한 템플릿은 외부 스캐폴딩 역할을 합니다. 모델은 지침을 따르지만 그 과정을 내재화하지는 않습니다. Ring-Zero는 이 패러다임을 뒤집습니다. 모델은 작업 설명과 함께 자동으로 확인할 수 있는 정답인 **검증 가능한 답변(verifiable answer)**을 받습니다. 그런 다음 일련의 시도를 생성하고, 그 시도가 검증 가능한 답변과 일치할 때만 보상을 받으며, 강화 학습을 통해 정책을 업데이트합니다.
보상이 속이기 어려운 목표(답변이 그저 그럴듯한 것이 아니라 반드시 정확해야 함)와 연결되어 있기 때문에, 모델은 스스로 추론 패턴을 발견합니다. 논문은 신뢰할 수 있는 보상 신호가 마련되면, 모델을 1조 개의 파라미터 규모로 확장하는 것만으로도 엔지니어들이 소규모 모델을 위해 수동으로 삽입했던 프롬프트 엔지니어링 기술들이 자동으로 나타난다고 주장합니다.
4단계 학습 파이프라인
Ring-Zero의 학습은 네 가지 뚜렷한 단계를 거쳐 진행됩니다:
- 1단계 RL – 모델이 가능한 추론 경로(reasoning traces)를 탐색하며, 어떤 토큰 시퀀스가 정답으로 이어지는 경향이 있는지 학습합니다.
- 자기 증류(Self-distillation) – 고품질의 추론 경로가 모델로 다시 흘러 들어가, 새롭게 나타나는 추론 패턴을 안정화합니다.
- 2단계 RL – 더 세밀한 루프를 통해 이전의 개선 사항을 유지하면서 정책을 정교화합니다.
- 계층적 학습(Tiered training) – 모델이 문제 난이도에 따라 짧은(≈2k 토큰) 추론 경로와 긴(≈20k 토큰) 추론 경로 중 하나를 선택하여 토큰 예산을 지능적으로 할당하는 법을 배웁니다.
계층적 학습은 실제 서비스 적용 측면에서 가장 중요한 부분입니다. 실제 배포 환경에서는 토큰이 추가될 때마다 컴퓨팅 비용이 발생합니다. Ring-Zero는 모델에게 어떤 문제가 짧은 답변으로 충분할 만큼 간단한지, 그리고 언제 심층적인 다단계 분석이 필요한지를 인식하도록 가르침으로써 추론 품질을 경제적 효율성과 직접적으로 연결합니다.
학습의 두 단계: 발견과 정교화
저자들은 학습 곡선을 두 단계의 과정으로 설명합니다:
- 발견(Discovery) – 초기 강화 학습 단계는 노이즈가 많습니다. 모델은 매우 다양한 전략을 시도하며, 그중 상당수는 실패합니다. 이러한 변동성은 새로운 추론 경로를 찾아내는 데 필수적입니다.
- 정교화(Sharpening) – 유망한 패턴이 나타나면, 이후의 RL 단계에서 정책을 강화하여 변동성을 줄이고 행동을 공고히 합니다.
이러한 과정은 인간이 발전하는 방식, 즉 초기 브레인스토밍 후에 집중적인 연습을 하는 과정과 닮아 있습니다. 핵심 통찰은 "무질서한" 초기 단계를 억제하기보다는 수용해야 한다는 것입니다. 왜냐하면 그 단계가 나중의 정교화를 위한 원재료를 제공하기 때문입니다.
발생할 수 있는 문제점은?
논문의 낙관론은 검토가 필요한 몇 가지 가정에 기반하고 있습니다:
- 보상 설계(Reward design) – 이 프레임워크에는 검증 가능하면서도 지름길(shortcutting)에 저항할 수 있는 보상이 필요합니다. 많은 실제 작업에서 이러한 보상을 정의하는 것은 쉽지 않으며, 비용이 많이 드는 어노테이션 파이프라인이 필요할 수 있습니다.
- 환경적 병목 현상(Environmental bottlenecks) – 저자들은 모델의 성능이 모델의 크기가 아니라 주변의 평가 인프라(테스트 스위트, 로그, 명확한 지표)에 의해 제한된다고 지적합니다. 이러한 인프라를 구축하고 유지 관리하는 것은 상당한 엔지니어링 노력이 필요할 수 있습니다.
- 학습 컴퓨팅 비용(Compute cost of training) – 여러 RL 단계를 거쳐 1조 개의 파라미터를 가진 모델을 학습시키는 것은 매우 비쌉니다. 계층적 학습이 추론 비용은 절감해주지만, 초기 학습 예산은 여전히 높기 때문에 이 접근 방식은 자금력이 풍부한 연구소로 제한될 가능성이 있습니다.
What to watch next
Practical takeaways for AI practitioners
- Don’t treat prompts as the only lever – Ask whether a behavior you are coding into prompts could instead be learned through a reward-driven training loop.
- Make token usage a first-class objective – Add budget-aware signals early; the model will learn to balance accuracy against compute cost.
- Close the feedback loop – Deploy a system that automatically supplies tasks, measures outcomes against verifiable answers, and feeds the results back into training. The loop is where the model discovers its own workflow.
When the reward is clear and the environment can measure success reliably, scaling up the model does more than add raw capacity—it teaches the model to choose how to think. That shift from hand-written scaffolding to self-directed reasoning could reshape how we build and price AI agents.
