Claude AI 에이전트가 임계선(critical line) 위에 있는 리만 제타 영점(Riemann-zeta zeros)의 검증된 비율을 41.6%에서 67.2%로 끌어올렸습니다. 이 수치의 급증이 리만 가설을 증명하는 것은 아니지만, 대규모 AI 기반 워크플로우가 수학적으로 확인 가능한 결과를 생성할 수 있음을 보여줍니다.

리만 가설이 중요한 이유

이 가설은 리만 제타 함수의 모든 자명하지 않은 영점(non-trivial zero)의 실수부가 정확히 1/2이라고 주장합니다. 이러한 영점들은 소수의 분포를 제어하므로, 이 추측을 확인하는 것은 소수 패턴과 복소 해석학 사이의 연결 고리를 더욱 공고히 할 것입니다. 현재까지 영점 중 극히 일부만이 "임계선" 위에 있음이 증명되었습니다. 이 비율을 높이는 것은 연구 진척도를 측정하는 표준 벤치마크입니다.

Anthropic이 67.2%에 도달한 방법

Anthropic은 코드 중심 모델인 Claude Code를 사용하여 두 차례의 집중적인 연구 세션을 진행했습니다. 두 번째 세션에서는 60개의 서브 에이전트를 배치하여 2,400개 이상의 셸 명령어를 통해 협업하고 수백 개의 Python 스크립트를 생성했습니다. 전체 과정에서 약 3,100만 개의 출력 토큰이 생성되었는데, 이는 짧은 소설 한 권 정도의 분량입니다.

팀 내 수학자들이 결과 논문을 검토했으며, 다른 이들이 각 단계를 검증할 수 있도록 기계 검증 증명 언어인 Lean 4 정식화(formalization)를 공개했습니다. 이 작업에는 아직 공개되지 않은 내부 연구용 Claude 버전이 사용되었으며, 검증은 공식적인 동료 검토(peer review)보다는 내부 점검과 짧은 전문가 검토에 의존했습니다.

결과가 실제로 의미하는 것

새로운 논문은 임계선 위에 있는 영점의 증명된 하한선(lower bound)을 41.6%에서 67.2%로 높였습니다. 이 수치는 하한선입니다. 즉, 훨씬 더 많은 영점이 선 위에 있을 수 있지만, 이번 분석이 이를 모두 포착하지는 못했을 뿐입니다.

결정적으로, 이 결과가 가설 자체를 완전한 증명에 더 가깝게 만들어주는 것은 아닙니다. 가설은 모든 자명하지 않은 영점이 선 위에 있어야 한다고 요구합니다. 67.2%라는 하한선은 영점의 3분의 1 이상이 여전히 설명되지 않은 상태로 남겨두는 것입니다.

AI 접근 방식의 한계

Anthropic은 현재의 워크플로우가 곧 가설을 해결할 것으로 기대하지 않는다는 점을 명확히 밝혔습니다. 인간은 여전히 모델의 출력물에서 논리적 결함을 검토해야 하며, 내부 검증 프로세스는 커뮤니티의 동료 검토만큼 엄격하지 않습니다. 또한 연구용 Claude 버전은 공개되어 있지 않아 독립적인 재현이 제한적입니다.

향후 계획

Lean 4 정식화의 공개는 더 넓은 수학계가 이 증명을 검토하도록 독려합니다.

핵심 요약

Anthropic의 Claude 에이전트는 AI가 복잡한 수학적 명제의 검증을 가속화할 수 있음을 입증했으며, 리만 제타 영점에 대해 알려진 하한선을 상당히 개선했습니다. 이번 돌파구는 밀레니엄 난제 자체에 대한 해결책이 아니라, 대규모 연구 에이전트 워크플로우에 대한 개념 증명(proof-of-concept)입니다.