Anthropicは、Fable 5モデルに重大なアップデートを実施し、セーフティレイヤーによってブロックされていた無害な生物学的クエリの数を大幅に削減しました。この戦略的な調整は、高リスクな生物学的脅威に対する厳格な保護を維持しつつ、正当な科学研究における実用性を回復させることを目的としています。

科学研究における摩擦の軽減

科学コミュニティからの批判を受けて、AnthropicはFable 5の生物学セーフティフィルターにおける誤検知(false positives)を約85%削減することに成功しました。以前は、モデルのセーフティ分類器が過度に厳格であったため、正当な科学的問い合わせが頻繁にブロックされ、ユーザーはより能力の低いOpus 5モデルへと誘導されていました。

このアップデートにより、研究者や医療専門家は、幅広い無害なタスクにおいてFable 5の完全な推論能力を活用できるようになります。ユーザーは、これまで生産性を妨げていた「セーフティウォール(安全性の壁)」に阻まれることなく、実験結果の解釈、臨床症状の分析、高度な医学的質問への回答といった複雑な操作を実行できるようになります。

デュアルユースのリスクに対するガードレールの維持

一般的な生物学的な制限は緩和されたものの、Anthropicは「デュアルユース(両義的利用)」の研究、つまり危害に転用される可能性のある情報については、厳しい姿勢を維持しています。同社は、ウイルス学、毒性学、高度な分子設計を含む極めて機密性の高いトピックに関する制限を解除していません。

Anthropicの判断は、生物学的脅威の特異な性質に基づいています。パッチの適用やシステムのシャットダウンによって軽減できるサイバー攻撃とは異なり、一度放出された生物学的因子は、拡散が始まると「シャットダウン」することがほぼ不可能です。同社は、この慎重な姿勢の背景にあるいくつかの重大な懸念事項を挙げています。

  • 米国情報機関による生物学的リスクに関する分析。
  • AIが完全合成ウイルスの設計に使用できることを示す研究。
  • 既存のLLMに対して生物兵器の製造手順を求めるユーザーによる、記録された試み。

安全性と専門的なアクセスの両立

AI研究所にとっての課題は、開放的な科学の進歩と、壊滅的な悪用の防止との間の緊張関係をどのように舵取りするかという点にあります。Anthropicは、専門的なアクセスプログラムを開発することでこの問題の解決を試みています。これらのプログラムは、認証された研究者が、管理・監査された環境内で、ウイルス学や分子モデリングに関連する制限された機能にアクセスできるように設計されています。

無害な医学的問い合わせと、危険なデュアルユース研究を区別することで、Anthropicはフロンティアモデルが「生物学的フロンティア」をどのように扱うべきかという先例を作ろうとしています。これにより、現代医学のツールが意図せずしてバイオテロリズムの道具となることを防いでいます。

主なポイント

  • 誤検知を85%削減: Anthropicは正当な生物学的クエリの障壁を大幅に下げ、ユーザーを性能の劣るOpus 5から解放しました。
  • 高リスク領域に対する厳格なガードレール: 生物兵器の製造を防ぐため、ウイルス学、毒性学、分子設計に対する厳格な制限は引き続き維持されています。
  • 研究者向けの管理されたアクセス: Anthropicは、審査を通過した科学者が正当な研究に必要な制限付き機能を利用できるよう、特定のアクセスプログラムを構築しています。

Anthropicは、Fable 5モデルにおける無害な生物学的クエリの誤検知によるブロックを約85%削減し、研究者がモデルの完全な推論能力を利用できるようにしました。この変更により、デュアルユースの生物学的トピックに対する厳格な保護は維持され、生物兵器の製造を可能にするような指示の提供は引き続き禁止されています。

なぜこのアップデートが重要なのか

Fable 5のセーフティレイヤーは、もともと慎重を期して設定されており、広範囲にわたる正当な科学的質問を「高リスク」としてフラグ立てしていました。日常的な実験結果の解釈や臨床症状の分析を求めるユーザーは、定期的に能力の低いOpus 5モデルへとリダイレクトされていました。この過剰なブロックは科学コミュニティからの批判を招き、研究の妨げとなり、医学的な意思決定を遅らせているとの主張がありました。誤検知率を約5分の4削減することで、Anthropicは、日常的な業務で高度な推論を必要とする医師、生物学者、その他の専門家に対して、モデルの高度な推論能力を再び提供することを目指しています。

フィルターはどのように変更されたのか

この改善は、通常の生物医学的なクエリと、「デュアルユース(二重用途)」研究、つまり悪用される可能性のある情報に触れるクエリを区別する、再調整された分類器によるものです。新しい分類器は、ウイルス学、毒性学、高度な分子設計に関するリクエストを依然として遮断しますが、標準的な診断、症状のトリアージ、データの解釈に関する質問は許可します。

Anthropicのエンジニアは、生物学的脅威はサイバー脅威とは異なり、一度病原体が放出されると、パッチを当てたり停止させたりすることができないと指摘しています。その現実が、高リスクな領域については厳格な姿勢を維持しつつ、日常的な医学的問い合わせに対する制限を緩和するという決定につながりました。

引き続き制限される事項

モデルは、有害な物質の作成を容易にする可能性のあるリクエストを拒否し続けます。具体的には、以下のようなプロンプトが対象となります:

  • ウイルスの合成を助長する可能性のある、詳細なウイルス学プロトコル
  • 兵器化可能な化学物質の毒性経路
  • 分子工学の段階的な手順書

Anthropicは、その慎重な姿勢の根拠として3つの情報源を挙げています。生物学的リスクを強調する米国の情報機関による分析、AIが完全合成ウイルスを設計できることを示す研究、そして既存の言語モデルに対して生物兵器の製造手順を要求しようとしたユーザーによる記録された試みです。

審査済み科学者向けのアクセスプログラム

オープンな研究とセキュリティのバランスを取るため、Anthropicは専門のアクセスプログラムを展開しています。認証された研究者は、監査の下で制限された機能が解除される管理された環境への申請が可能です。このプログラムは、正当な科学者が、一般の人々に危険なガイダンスをさらすことなく、新しいワクチン・プラットフォームや病原体のモデリングといった高リスクなトピックを探求できるように設計されています。

まとめ

厳格なデュアルユースの禁止を維持しつつ、誤検知によるブロックを85%削減することで、Anthropicは生物兵器の設計への道を開くことなく、研究者に最も有能なモデルのパワーを提供することを目指しています。この調整された安全戦略の成功は、フロンティアAIモデルが他の極めて重要な科学分野をどのように扱うかについてのテンプレートとなる可能性があります。