GSKは、英国のバイオテク企業Relation Therapeuticsと、最大1億1,000万ドル規模の研究提携を締結した。このパートナーシップは、遺伝子改変や薬物治療に対してヒト細胞がどのように反応するかを追跡する、大規模で高解像度なデータセットを構築するものである。これにより、AI主導の創薬を停滞させてきたデータのボトルネックを解消し、分子から医薬品に至るまでの期間を数年単位で短縮できる可能性がある。

AIの進展を阻んできたデータの問題

過去10年間の大半において、製薬分野におけるAIは、入力データの関連性ではなく、モデルの規模によって評価されてきた。インターネット上のテキストで学習された大規模言語モデル(LLM)はパターンマッチングには優れているが、化合物が生存細胞内でどのように波及していくかを予測する際には行き詰まってしまう。欠けていた要素は「ウェットラボ」のデータ、つまり、遺伝子のスイッチがオンまたはオフになった後、あるいは薬物が投与された後に起こる生物学的影響の連鎖を捉えた、実際の実験による測定値であった。

Relation Therapeuticsがそのギャップを埋める。本契約に基づき、同社は遺伝子変化と薬物介入という2つの変数に対してヒト細胞がどのように反応するかを精密に測定した大規模データを生成する。AIシステムにこの詳細な細胞挙動の視点を与えることで、このパートナーシップは、モデルを単なる粗い結合予測から、経路全体のシミュレーションへと進化させることを目指している。

ブラックボックス的な予測から細胞レベルの精密さへ

従来のAIパイプラインは、多くの場合、分子が標的タンパク質に結合する確率という単一の数値のみを出力する。研究者はその後、その結合が治療効果につながるかどうかを確認するために、数ヶ月から数年を費やしてテストを行う。新しいアプローチでは、この単一の推定値を、下流の結果に関する多次元的なマップに置き換える。AIモデルが「遺伝子Xをノックアウトすると経路Yが誘発され、候補薬がその同じ経路を抑制する」ということを知っていれば、はるかに早い段階で有効性を推論できる。

その見返りは、コストのかかる試行錯誤の実験の削減である。モデルが化合物が望ましい細胞反応を引き起こすと確実に予測できれば、合成、スクリーニング、廃棄が必要な化合物の数を減らすことができる。これにより、研究開発費が削減され、タイムラインが短縮される。これらは、医薬品の市場独占期間や製薬企業の収益に直接影響を与える利点である。

「正しいデータ」が参入障壁(モート)となる

このパートナーシップは、「ビッグデータ」から「正しいデータ(right data)」へのシフトを浮き彫りにしている。汎用モデルは単純な量によって成長するが、創薬には極めて特異的で入手困難なデータが求められる。信頼性の高い細胞応答プロファイルを生成するには、高度な計測機器、熟練した人員、厳格な品質管理が必要であり、これらは十分な資金力を持つプレーヤーのみが投資できるものである。

遺伝子コードと測定可能な細胞結果を結びつけるパイプラインを所有する企業が、最も価値のある知的財産を支配することになる。このようなデータセットの独占性は、新しいニューラルネットワークのアーキテクチャよりも複製が困難な防御壁(モート)を構築する。バイオテク企業の創業者にとって、メッセージは明確である。データエンジンを構築することは、次のアルゴリズムのブレイクスルーを追い求めることよりも戦略的である可能性がある。

反論:データだけではすべてを解決できない

批判的な意見としては、完璧なデータであってもAIモデルを誤導する可能性があることが挙げられる。細胞は組織の種類、疾患の状態、患者のデモグラフィック(人口統計学的属性)によって異なる。ある文脈で取得されたデータセットが、他の文脈に一般化できるとは限らない。また、大規模で高品質なデータセットを生成・キュレーションするコストは、モデルのトレーニング費用を上回る可能性があり、中小規模の企業にとってはスケーラビリティの問題が生じる。

規制当局の存在も重要である。ヒトの生物学をシミュレートすると主張する予測AIは、最終的に臨床結果によって検証される必要があり、監視の目が厳しくなる。もし業界が、適切な実世界でのテストを行わずにイン・シリコ(in-silico)の予測に過度に依存すれば、有望な候補物質が治験で失敗した際に、大きな挫折に直面する可能性がある。

今後の注目点

今後数ヶ月間で、GSKとRelation Therapeuticsの取り組みが、約束された規模で実用的なデータを提供できるかどうかが明らかになる。主な指標は以下の通りである:

  • 他の研究者がアクセス可能な(制限付きであっても)ベンチマークデータセットの公開
  • ホールドアウト・テストセットにおいて、従来のスクリーニング手法を明らかに上回る初期段階のAIモデル
  • データ主導のアプローチが再現可能であるという信頼の兆候となる、他の大手製薬企業による追随投資

この提携がヒット率やサイクルタイムにおいて具体的な改善をもたらすならば、同様の取引の波を引き起こし、業界の研究開発費の配分方法を再構築する可能性がある。逆に、データがノイズが多く統合コストが高すぎると判明した場合、企業はAIと従来のハイスループットスクリーニングを組み合わせたハイブリッドな手法へと回帰するかもしれない。

要点

GSKによる高精度な細胞データへの1億1,000万ドルの投資は、決定的な転換点を示唆している。AI創薬において、最も決定的な優位性は、アルゴリズム自体の規模ではなく、モデルを学習させる生物学的シグナルの品質と独占性にますますシフトしていくことになるだろう。