Anthropic은 Fable 5 모델에 중요한 업데이트를 적용하여, 안전 계층에 의해 차단되던 무해한 생물학적 질의의 수를 대폭 줄였습니다. 이 전략적 조정은 고위험 생물학적 위협에 대한 엄격한 보호 조치를 유지하면서도, 정당한 과학 연구를 위한 유용성을 회복하는 것을 목표로 합니다.

과학 연구를 위한 마찰 감소

과학계의 비판에 따른 조치로, Anthropic은 Fable 5의 생물학 안전 필터에서 발생하는 오탐(false positives)을 약 85% 줄이는 데 성공했습니다. 이전에는 모델의 안전 분류기가 지나치게 공격적이어서, 정당한 과학적 문의를 빈번하게 차단하고 사용자를 성능이 낮은 Opus 5 모델로 리다이렉트하곤 했습니다.

이번 업데이트를 통해 연구자와 의료 전문가들은 광범위한 무해한 작업에 대해 Fable 5의 전체 추론 능력을 활용할 수 있게 되었습니다. 이제 사용자들은 이전에 생산성을 저해했던 "안전 장벽(safety wall)"에 부딪히지 않고도 실험실 결과 해석, 임상 증상 분석, 정교한 의료 질문 답변과 같은 복잡한 작업을 수행할 수 있습니다.

이중 용도(Dual-Use) 위험에 대한 가드레일 유지

일반적인 생물학적 제한은 완화되었지만, Anthropic은 해로운 목적으로 전용될 수 있는 정보인 "이중 용도(dual-use)" 연구에 대해서는 단호한 입장을 유지하고 있습니다. 회사는 바이러스학, 독성학, 첨단 분자 설계 등 매우 민감한 주제에 대한 제한을 해제하지 않았습니다.

Anthropic의 이러한 판단은 생물학적 위협의 독특한 특성에 근거합니다. 패치나 시스템 종료를 통해 완화할 수 있는 사이버 공격과 달리, 유출된 생물학적 작용제는 확산이 시작되면 "종료"하는 것이 거의 불가능합니다. 회사는 이러한 주의를 기울이게 된 몇 가지 중대한 우려 사항을 다음과 같이 언급했습니다:

  • 생물학적 위험에 관한 미국 정보 기관의 분석.
  • AI가 완전히 합성된 바이러스를 설계하는 데 사용될 수 있음을 보여주는 연구.
  • 기존 LLM으로부터 생물 무기 제조 지침을 요청하려는 사용자들의 기록된 시도들.

안전과 특수 접근 권한의 균형

AI 연구소의 과제는 개방적인 과학적 발전과 파괴적인 오용 방지 사이의 긴장을 조율하는 것입니다. Anthropic은 특수 접근 프로그램(specialized access programs)을 개발함으로써 이 문제를 해결하려 노력하고 있습니다. 이 프로그램은 검증된 연구자가 통제되고 감사 가능한 환경 내에서 바이러스학 또는 분자 모델링과 관련된 제한된 기능에 접근할 수 있도록 설계되었습니다.

무해한 의료적 문의와 위험한 이중 용도 연구를 구분함으로써, Anthropic은 프런티어 모델이 "생물학적 프런티어(biological frontier)"를 다루는 방식에 대한 선례를 세우고자 하며, 현대 의학의 도구가 의도치 않게 생물 테러의 도구가 되지 않도록 보장하고자 합니다.

핵심 요약

  • 오탐 85% 감소: Anthropic은 정당한 생물학적 질의에 대한 장벽을 크게 낮추어, 사용자들이 성능이 낮은 Opus 5로 밀려나는 상황을 방지했습니다.
  • 고위험 영역에 대한 엄격한 가드레일: 생물 무기 제조를 방지하기 위해 바이러스학, 독성학 및 분자 설계에 대한 엄격한 제한이 유지됩니다.
  • 연구자를 위한 통제된 접근 권한: Anthropic은 검증된 과학자들이 정당한 연구에 필요한 제한된 기능을 사용할 수 있도록 특정 접근 프로그램을 구축하고 있습니다.

Anthropic은 Fable 5 모델에서 무해한 생물학적 질의에 대한 오탐 차단을 약 85% 줄여, 연구자들이 모델의 전체 추론 능력을 다시 사용할 수 있도록 했습니다. 이번 변경은 이중 용도 생물학적 주제에 대한 엄격한 보호 조치를 유지하며, 생물 무기를 가능하게 할 수 있는 지침 제공을 차단합니다.

이번 업데이트가 중요한 이유

Fable 5의 안전 계층은 원래 신중을 기하기 위해 광범위한 정당한 과학적 질문을 고위험으로 분류하도록 설정되었습니다. 일상적인 실험 결과 해석이나 임상 증상 분석을 요청하는 사용자들은 정기적으로 성능이 낮은 Opus 5 모델로 리다이렉트되었습니다. 이러한 과도한 차단은 과학계의 비판을 불러일으켰으며, 과학계는 이러한 마찰이 실제 연구를 방해하고 의료 의사 결정을 늦춘다고 주장했습니다. 오탐률을 약 5분의 4 수준으로 대폭 낮춤으로써, Anthropic은 의사, 생물학자 및 기타 전문가들이 일상적인 업무에 필요로 하는 모델의 고급 추론 능력을 다시 돌려주는 것을 목표로 합니다.

필터가 변경된 방식

이번 개선은 일반적인 생물 의학적 질의와 "이중 용도(dual-use)" 연구—즉, 해로운 목적으로 전용될 수 있는 정보—를 구분하도록 재조정된 분류기 덕분에 가능해졌습니다. 새로운 분류기는 여전히 바이러스학, 독성학 및 고급 분자 설계와 관련된 요청을 차단하지만, 표준 진단, 증상 분류 및 데이터 해석에 관한 질문은 허용합니다.

Anthropic의 엔지니어들은 생물학적 위협이 사이버 위협과 다르다는 점에 주목했습니다. 병원체가 한 번 유출되면 패치를 적용하거나 차단할 수 없기 때문입니다. 이러한 현실을 바탕으로 고위험 영역에 대해서는 엄격한 기준을 유지하되, 일상적인 의료 문의에 대한 제한은 완화하기로 결정했습니다.

여전히 금지되는 사항

모델은 유해 작용제의 생성을 용이하게 할 수 있는 요청을 계속해서 거부합니다. 구체적으로 다음과 같은 내용을 요구하는 모든 프롬프트가 해당됩니다:

  • 바이러스 합성을 도울 수 있는 상세한 바이러스학 프로토콜,
  • 무기화 가능한 화학 물질의 독성 경로, 또는
  • 단계별 분자 공학 지침.

Anthropic은 주의를 기울인 세 가지 근거를 제시했습니다: 생물학적 위험을 강조하는 미국 정보 기관의 분석, AI가 완전 합성 바이러스를 설계할 수 있음을 보여주는 연구, 그리고 기존 언어 모델로부터 생물 무기 지침을 얻으려는 사용자들의 기록된 시도들입니다.

검증된 과학자를 위한 액세스 프로그램

개방적인 연구와 보안 사이의 균형을 맞추기 위해, Anthropic은 특화된 액세스 프로그램을 출시하고 있습니다. 검증된 연구자는 감사가 이루어지는 통제된 환경에서 제한된 기능을 해제할 수 있는 권한을 신청할 수 있습니다. 이 프로그램은 정당한 과학자들이 새로운 백신 플랫폼이나 병원체 모델링과 같은 고위험 주제를 탐구하면서도, 일반 대중이 위험한 지침에 노출되지 않도록 설계되었습니다.

요약

Anthropic은 엄격한 이중 용도 금지 조치를 유지하면서도 오탐으로 인한 차단을 85% 줄임으로써, 생물 무기 설계의 문을 열지 않으면서도 연구자들에게 가장 강력한 모델의 성능을 제공하는 것을 목표로 합니다. 이 정밀하게 조정된 안전 전략의 성공은 프런티어 AI 모델이 다른 중대한 과학 분야를 어떻게 다루어야 하는지에 대한 본보기가 될 수 있습니다.