OpenAI는 자사의 GPT-5.6 Sol 모델이 ARC-AGI-3 논리 벤치마크에서 38.3%의 점수를 기록하며, Anthropic의 Claude Opus 5(30.2%)를 앞질렀다고 발표했습니다. 하지만 이 주장은 즉각적인 기술적 논쟁을 불러일으켰습니다. 동일한 모델을 벤치마크의 공식 테스트 하네스(test harness)로 실행했을 때 점수가 7.8%에 불과했기 때문입니다.

ARC-AGI-3 점수가 중요한 이유

ARC-AGI-3는 암기된 패턴에 의존하기보다, 완전히 새로운 추론 중심의 문제를 해결하는 모델의 능력을 측정합니다. 연구자들은 이 점수를 '범용 지능(general-intelligence)' 발전의 대리 지표로 인용하며, 10점 차이의 격차는 인간과 유사한 문제 해결 능력에 한 걸음 더 다가선 실질적인 진전으로 보입니다. 이것만으로도 왜 이 소식이 AI 커뮤니티에 큰 파장을 일으켰는지 설명됩니다.

숨겨진 레버: Retained Reasoning과 Compaction

OpenAI는 공개 테스트 하네스로 GPT-5.6 Sol을 평가하지 않았습니다. 대신 두 가지 독자적인 옵션이 포함된 자체 Responses API를 사용했습니다.

  • Retained Reasoning – 모델의 사고 과정(chain of thought)을 여러 단계에 걸쳐 유지하여, 각 단계를 개별적으로 처리할 때 발생하는 중간 논리의 손실을 방지합니다.
  • Compaction – 이전 컨텍스트를 잘라내는 대신 압축하여, 모델이 요약된 더 긴 이력을 참조할 수 있게 합니다.

이러한 설정이 활성화되면 모델은 더 긴 논증을 엮어내고 이전의 추론을 재사용함으로써 다단계 작업에서의 성능을 부풀립니다. 각 작업 후 추론을 폐기하는 공식 하네스에서는 동일한 모델의 점수가 7.8%로 급락하여 Claude Opus 5보다 훨씬 낮은 수준을 기록했습니다.

OpenAI는 벤치마크가 단순히 가공되지 않은 신경망 가중치(raw neural weights)만이 아니라 전체 추론 파이프라인을 측정해야 한다고 주장합니다. 이러한 관점에서 컨텍스트를 보존하고 압축하는 API 로직인 '래퍼(wrapper)'는 평가 대상 시스템의 일부에 해당합니다.

공정성 논쟁

이 벤치마크를 후원하는 ARC Prize의 공동 설립자인 François Chollet이 의견을 냈습니다. 그는 벤치마크를 '풀기 위해' 구축된 맞춤형 하네스와 모든 사용자가 활성화할 수 있는 범용 API 설정 사이를 구분했습니다. Chollet은 기존 ARC Prize 테스트 환경이 Anthropic의 Claude API에서 제공하는 고급 기능이 부족했던 구형 OpenAI 스타일의 completions API를 사용했다는 점을 언급했습니다. 이러한 불일치가 이전 라운드에서 OpenAI에 불리하게 작용했을 수도 있습니다.

그는 비교 자체가 무효라고 선언하지는 않았습니다. Chollet은 정확한 설정과 관련 비용이 공개된다면 정면 승부식 비교도 수용 가능하다고 말했습니다. 그는 투명성이 확보되어야 커뮤니티가 그 격차가 모델 아키텍처 때문인지, 엔지니어링 기법 때문인지, 혹은 둘 다 때문인지를 판단할 수 있다고 주장했습니다.

승자와 패자

높은 점수가 그대로 받아들여진다면, OpenAI는 대중적 인지도를 높이고 기업용 라이선스 협상에서 더 강력한 협상력을 얻게 됩니다. 반면 Claude 팀은 표준화된 하네스에서의 원시 모델(raw-model) 성능을 근거로, 추가적인 엔지니어링 레이어를 제거했을 때 자사의 아키텍처가 더 효율적이라는 점을 강조할 수 있습니다.

벤치마크 순위에 의존해 투자를 결정하는 연구자와 개발자들은 이번 사건을 불안하게 느낄 수 있습니다. 이번 사례는 모델이 커질수록 추론을 조율하는 소프트웨어가 결정적인 역할을 할 수 있음을 보여줍니다. 낮은 한계 비용으로 정교한 추론 스택을 제공하는 기업은 우수한 기본 모델 없이도 헤드라인 점수를 독점할 수 있습니다.

ARC-AGI-3와 기타 벤치마크의 향후 전망

이번 논쟁으로 인해 ARC Prize 주최 측은 허용 가능한 추론 구성에 대해 더 엄격한 규칙을 도입할 가능성이 높습니다. 가능한 대응책으로는 다음과 같은 것들이 있습니다:

  • 공식 하네스만 사용했을 때의 성능을 반영하는 '베이스라인(baseline)' 점수 발표.
  • 참가자들이 추가 설정에 대한 비용 분석을 제출하도록 요구하여, 높은 점수가 추가적인 컴퓨팅 자원이나 엔지니어링 오버헤드 대비 어느 정도의 가치가 있는지 평가할 수 있도록 함.
  • 컨텍스트 관리 기능의 영리한 활용에 보상을 주는 별도의 '시스템 레벨(system-level)' 트랙 추가.

이러한 조치는 원시 모델의 능력과 엔지니어링 최적화 사이를 명확히 구분하게 하여, 향후 발표되는 결과들을 더 쉽게 비교할 수 있게 만들 것입니다.

반론: 벤치마크는 실제 사용 환경을 반영해야 한다

한쪽에서는 엄격한 '원시 모델 전용(raw-model-only)' 관점이 비현실적이라고 주장합니다. 실제 서비스 환경에서 개발자들은 언어 모델에 캐싱, 컨텍스트 요약 및 기타 기법들을 일상적으로 결합하여 사용합니다. 만약 벤치마크의 목적이 실질적인 유용성을 예측하는 것이라면, 이러한 최적화 기법을 허용하거나 심지어 권장해야 합니다. 이러한 관점에서 OpenAI의 Retained Reasoning과 Compaction은 공개적으로 문서화되어 있다면 어떤 경쟁사라도 채택할 수 있는 정당한 도구입니다.

비판론자들은 공통된 기준점(baseline)이 없다면 점수가 유동적인 목표가 되어, 객관적인 척도로서 벤치마크가 수행하는 역할을 약화시킨다고 반박합니다. 생태적 타당성(실제 배포 환경 반영)과 방법론적 순수성(모델의 격리) 사이의 긴장감이 현재의 논란을 가중시키고 있습니다.

시사점

GPT-5.6 Sol 주장은 AI 평가 분야에서 커지고 있는 분열, 즉 모델 자체의 순수한 역량과 이를 끌어내는 엔지니어링 생태계 사이의 대립을 조명합니다. 커뮤니티가 추론 설정과 그 비용에 대한 완전한 공개를 요구하는 한, 이 논쟁은 범용 지능을 향한 진보를 가리기보다는 오히려 더욱 선명해질 것입니다.