Claude의 자율 단백질 결합체 캠페인은 27%의 적중률을 기록하며, 인간이 운영하는 실험실의 일반적인 적중률인 10~15%를 상회했고, 동일한 타겟을 대상으로 한 병행 인간 연구의 성과를 앞질렀다. 이 결과는 거대하고 잘 설계된 프롬프트가 언어 모델을 가상 바이오테크 워크플로우로 전환할 수 있음을 보여주지만, 모델의 신뢰도 지표가 어긋날 때 해당 접근 방식이 얼마나 취약해질 수 있는지도 강조한다.

수치로 보는 실험

Anthropic은 Claude 모델에 전체 규모의 단백질 설계 프로토콜과 고정된 GPU 예산을 부여한 후, 16개의 단백질 타겟에 대해 엔드투엔드(end-to-end) 캠페인을 실행하도록 했다. 실험실 측의 실패로 타겟 하나가 제외되어 15개의 실행 가능한 캠페인이 남았다. Claude는 이 과정에서 1,320개의 후보 서열을 생성했으며, 실험실 테스트 결과 354개가 실제 결합체(true binders)로 확인되어 26.8%의 성공률을 기록했다.

비교를 위해 살펴보면, 대부분의 인간 주도 결합체 프로젝트는 10%에서 15% 사이의 적중률을 보고한다. RBX1 타겟에 대한 직접적인 대결에서 인간 참가자들은 3.7%의 적중률을 달성한 반면, Claude의 설계는 31.1%를 기록했다. 또한 모델은 자체 순위 지정 능력도 입증했다. Claude가 가장 뛰어나다고 표시한 단일 설계는 49%의 성공률을 보였고, 상위 10개 설계는 39%의 성공률을 보였다.

시스템의 한계

수치 이면에는 두 가지 명백한 사각지대가 숨어 있다. Claude는 MBP 타겟에서 완전히 실패했고 TNFα 타겟에서는 저조한 성과를 보였으나, 해당 실행 과정에서의 내부 신뢰도 점수는 높게 유지되었다. 즉, 실험실의 결과(wet-lab readouts)가 다른 이야기를 하고 있음에도 모델은 자신이 성공하고 있다고 확신했다. 이러한 잘못 조정된(miscalibrated) 신호는 위험성을 드러낸다. 자신의 지표를 신뢰하는 자율형 파이프라인은 막다른 길에 다다른 실험에 자원을 낭비할 수 있다.

새로운 실험 노트로서의 프롬프트 엔지니어링

이 연구에서 가장 놀라운 점은 생물학적 결과가 아니라 이를 구동한 프롬프트다. 숙련된 과학자는 보통 어떤 단백질 영역을 탐색할지, 어떤 계산 도구를 호출할지, 계산 시간을 어떻게 할당할지를 결정하는 데 몇 주를 소비한다. Anthropic은 이러한 전문 지식을 단편 소설 한 권 정도의 길이인 16,000단어 분량의 프롬프트로 압축했다. 텍스트의 약 3분의 2는 타이밍, 예산 모니터링, 외부 소프트웨어를 호출하는 서브 에이전트 오케스트레이션과 같은 운영 관련 사항을 다루었다.

Claude는 RFdiffusion(확산 기반 구조 생성기) 및 ProteinMPNN(서열 설계 네트워크)과 같은 오픈 소스 설계 엔진을 호출했다. 언어 모델은 스케줄러 역할을 수행하며, 이러한 도구들 사이에 중간 결과물을 전달하고, 파라미터를 조정하며, 설계 사이클을 언제 중단할지 결정했다. 결과적으로 프롬프트는 가상의 실험실 관리자가 되어, 인간 과학자들을 워크플로우 조정이라는 번거로운 작업에서 해방시켰다.

결합체의 실제 정체

확인된 354개의 적중체는 모두 타겟 단백질에 물리적으로 부착되는 분자들이다. 논문은 결합 분석(binding assays) 결과를 보고하지만, 기능적 데이터는 제공하지 않는다. 즉, 결합체가 활성을 조절하거나, 구조를 안정화하거나, 치료적 잠재력을 보이는지에 대한 증거는 없다. 마찬가지로 구조적 검증(예: X선 결정학 또는 cryo-EM)도 누락되어 있어 정확한 결합 방식은 추측 단계에 머물러 있다. 따라서 이 캠페인은 신속한 결합체 발견을 위한 개념 증명(proof-of-concept)을 보여주는 것이지, 신약 후보 물질을 인도하는 파이프라인을 보여주는 것은 아니다.

바이오테크 및 AI 연구의 향방

프롬프트 기반 모델이 인간의 적중률을 안정적으로 재현하거나 능가할 수 있다면, 바이오테크 기업들은 초기 단계 발견 비용과 시간을 대폭 절감할 수 있을 것이다. 그러나 MBP와 TNFα에서 나타난 잘못 조정된 신뢰도 점수는 완전한 무인 시스템이 아직 상용화 단계에 있지 않음을 보여준다. 기업들은 여전히 신뢰도 지표를 해석하고 기능적 관련성을 검증하기 위해 인간의 감독이 필요할 것이다.

AI 관점에서 이 작업은 '도구(tool)'와 '에이전트(agent)' 사이의 경계를 허문다. Claude는 새로운 단백질 설계 알고리즘이 아니다. 충분히 상세한 지침 세트가 주어졌을 때 기존의 전문화된 도구들을 조율할 수 있는 범용 언어 모델이다. 이 실험은 AI가 단일 구성 요소를 대체하기보다는, 오픈 소스 과학 소프트웨어의 모듈형 생태계를 하나로 묶는 '접착제(glue)' 역할을 하는 미래를 시사한다.

반론: 프롬프트 복잡성의 숨겨진 비용

연구에서는 16,000단어의 프롬프트를 지식 캡처의 승리로 치켜세우지만, 프롬프트의 방대한 크기 자체가 실무적인 우려를 낳는다. 이러한 문서를 작성하려면 깊은 도메인 전문 지식, 기반 도구에 대한 숙련도, 그리고 예외 상황을 예측하는 능력이 필요하다. 즉, 전문 지식이 사라진 것이 아니라, 실험실 과학자로부터 프롬프트 엔지니어로 이동했을 뿐이다.

게다가, 고정된 GPU 예산에 의존하는 것은 탐색 깊이에 엄격한 제약을 가합니다. 인간 팀은 중간 결과에 따라 자원을 동적으로 재배분할 수 있는 반면, Claude의 캠페인은 사전 설정된 예산에 따라 진행되었으므로 샘플링된 서열 공간의 폭이 제한되었을 가능성이 있습니다.

향후 주목해야 할 점

Anthropic의 논문은 몇 가지 미해결 과제를 남겼습니다. 향후 연구에서는 모델의 자기 평가가 실험 결과와 일치하도록 신뢰도 보정(confidence calibration) 문제를 해결해야 합니다. 효소 억제나 세포 활성과 같은 기능적 분석(functional assays)을 자율 루프에 통합한다면, 이 기술은 단순한 결합체 식별을 넘어 신약 개발에 한 걸음 더 다가갈 수 있을 것입니다. 마지막으로, 더 넓은 범위의 타겟과 다양한 예산 조건에서 이 접근 방식을 벤치마킹함으로써, 관찰된 히트율이 재현 가능한 것인지 아니면 이상치인지 확인할 수 있을 것입니다.

시사점은 명확합니다. 정교한 프롬프트 오케스트레이션은 언어 모델을 가상 바이오테크 실험실로 탈바꿈시켜 인간의 평균을 능가하는 결합체 히트율을 제공할 수 있습니다. 하지만 이 접근 방식은 여전히 전문가의 프롬프트 작성 능력에 의존하며, 비용이 많이 드는 실험을 좌초시킬 수 있는 신뢰도 오판 문제도 안고 있습니다. 커뮤니티가 이러한 파이프라인을 정교화함에 따라, AI의 자율성과 인간의 감독 사이의 균형이 이러한 시스템이 일상적인 도구가 될지, 아니면 실험적인 호기심의 대상으로 남을지를 결정할 것입니다.