Claudeの自律的なタンパク質バインダー・キャンペーンは、人間が運営するラボの一般的な10〜15%を上回る27%のヒット率を記録し、同じターゲットに対する人間による並行した取り組みをも凌駕した。この結果は、大規模で精巧に作り込まれたプロンプトが、言語モデルを仮想的なバイオテク・ワークフローへと変貌させ得ることを示しているが、同時に、モデルの信頼性指標が狂った際にそのアプローチがいかに脆弱であるかも浮き彫りにしている。

数値で見る実験

Anthropicは、Claudeモデルに対してフルスケールのタンパク質設計プロトコルと固定のGPU予算を与え、16のタンパク質ターゲットにわたるエンドツーエンドのキャンペーンを実行させた。1つのターゲットはラボ側での失敗により除外され、15の実行可能なキャンペーンが残った。そこからClaudeは1,320個の候補配列を生成し、ラボでの試験により354個が真のバインダーであることが確認され、26.8%の成功率を達成した。

比較として、ほとんどの人間主導のバインダー・プロジェクトは10%から15%のヒット率を報告している。RBX1ターゲットにおける直接的な対決では、人間の参加者が3.7%のヒット率であったのに対し、Claudeの設計は31.1%に達した。また、モデルは自己ランキング能力も証明した。Claudeが「最高」とフラグを立てた単一の設計は49%の確率で成功し、上位10個の設計は39%の確率で成功した。

システムの欠点

数値の裏には、2つの明白な盲点がある。ClaudeはMBPターゲットにおいて完全に失敗し、TNFαターゲットでも振る舞いが悪かったが、それらの実行における内部の信頼性スコアは高いままだった。言い換えれば、ウェットラボの測定結果が異なる事実を示しているにもかかわらず、モデルは自身が成功していると確信していたのである。これらの調整ミスを起こした信号は、自らの指標を過信してしまう自律型パイプラインが、行き止まりの実験にリソースを浪費してしまうリスクを露呈させている。

新しい実験ノートとしてのプロンプト・エンジニアリング

この研究で最も驚くべき側面は、生物学そのものではなく、それを駆動したプロンプトである。熟練の科学者は通常、どのタンパク質領域を探索するか、どの計算ツールを呼び出すか、計算時間をどのように割り当てるかを決定するのに数週間を費やす。Anthropicは、その専門知識を、短編小説ほどの長さである約16,000語のプロンプトに凝縮した。テキストの約3分の2は、タイミング、予算監視、および外部ソフトウェアを呼び出すサブエージェントのオーケストレーションといった運用上の懸念事項に関するものであった。

Claudeは、RFdiffusion(拡散ベースの構造生成器)やProteinMPNN(配列設計ネットワーク)といったオープンソースの設計エンジンを呼び出した。言語モデルはスケジューラーとして機能し、これらのツール間で中間結果を供給し、パラメータを調整し、設計サイクルをいつ停止するかを決定した。事実上、プロンプトは仮想的なラボ・マネージャーとなり、人間の科学者をワークフロー調整の細かな作業から解放したのである。

バインダーの実体

確認された354個のヒットはすべて、ターゲットタンパク質に物理的に結合する分子である。論文には結合アッセイの結果が報告されているが、機能的なデータ(バインダーがいかなる活性を調節するか、構造を安定化させるか、あるいは治療の可能性を示すかといった証拠)は提供されていない。同様に、構造的な検証(X線結晶構造解析やクライオ電子顕微鏡など)も欠如しているため、正確な結合モードは推測の域を出ない。したがって、このキャンペーンは迅速なバインダー発見の概念実証(PoC)を示すものであり、創薬候補物質を届けるためのパイプラインではない。

バイオテクおよびAI研究への影響

プロンプト駆動型のモデルが、人間のヒット率を確実に再現または上回ることができるならば、バイオテク企業は初期段階の探索コストと時間を大幅に削減できる可能性がある。しかし、MBPおよびTNFαにおける信頼性スコアの調整ミスは、完全にハンズオフ(無人)のシステムがまだ実用段階にはないことを示している。企業は、信頼性指標を解釈し、機能的な関連性を検証するために、依然として人間の監視を必要とするだろう。

AIの観点からは、この研究は「ツール」と「エージェント」の境界を曖昧にしている。Claudeは新しいタンパク質設計アルゴリズムではなく、十分に詳細な指示セットを与えられたときに、既存の専門的なツールをオーケストレートできる汎用言語モデルである。この実験は、AIが単一のコンポーネントを置き換えるのではなく、オープンソースの科学ソフトウェアのモジュール式エコシステムを結合する「接着剤」として機能する未来を示唆している。

反論:プロンプトの複雑さに隠れたコスト

この研究は16,000語のプロンプトを知識獲得の勝利として称賛しているが、そのプロンプトの大きさ自体が実用的な懸念を引き起こしている。このような文書を作成するには、深いドメイン知識、基礎となるツールへの習熟、そしてエッジケースを予測する能力が必要となる。言い換えれば、専門知識が消失したわけではない。それは、実験現場の科学者からプロンプト・エンジニアへと移行したのである。

さらに、固定されたGPU予算への依存は、探索の深さに厳しい制約をもたらします。人間のチームは中間結果に基づいてリソースを動的に再配分できますが、Claudeのキャンペーンは事前に設定された予算に従ったため、サンプリングされる配列空間の広さを制限してしまった可能性があります。

今後の注目点

Anthropicの論文は、いくつかの未解決の課題を残しています。今後の研究では、モデルの自己評価が実験結果と一致するように、信頼度のキャリブレーション(較正)に対処する必要があります。酵素阻害や細胞活性などの機能アッセイを自律的なループに統合することで、この技術は単なるバインダーの特定にとどまらず、より創薬に近いものへと進化するでしょう。最後に、より広範なターゲットセットや異なる予算条件下でこのアプローチをベンチマークすることで、観察されたヒット率が再現可能なものなのか、あるいは単なる外れ値なのかが明らかになります。

結論は明白です。詳細なプロンプトのオーケストレーションによって、言語モデルを仮想的なバイオテク・ラボへと変貌させ、人間の平均を上回るバインダーのヒット率を実現できるのです。しかし、このアプローチは依然として専門家によるプロンプト作成に依存しており、高額な実験を台無しにしかねない信頼度の誤判定という課題も抱えています。コミュニティがこれらのパイプラインを洗練させていく中で、AIの自律性と人間の監視のバランスが、こうしたシステムが日常的なツールとなるか、あるいは実験的な興味の対象にとどまるかを決定することになるでしょう。