サティア・ナデラは、自社が構築を支援してきた研究所そのものに対して、公然と戦いを挑んだ。マイクロソフトの最高経営責任者(CEO)は、最大手のAI企業がいかにしてデータ所有権のルールを書き換えているかについて、率直な警告を発した。そのメッセージは、異例の強さで人々に突き刺さった。最近のブログ投稿の中で、ナデラはOpenAIやAnthropicを含むフロンティア・ラボが、「仕組まれた市場」を構築していると非難した。彼らは膨大なモデルをトレーニングするために公開データを収集し、その一方で、それらのモデルが生み出す出力から誰も学習できないように利用規約を運用している。その結果、企業は独自の専門知識を明け渡しながら、その代償を支払わされるという「価値の一方通行的な移転」が起きている、と彼は主張する。
蒸留という二重基準
この不満を理解するには、これらのラボが阻止したがっている手法に注目する必要がある。「蒸留(Distillation)」とは一般的なトレーニング手法であり、小規模で特化したモデルが、インターネット上の生のテキストをゼロから取り込む代わりに、大規模モデルの出力から学習するものである。スタートアップや研究チームは、フロンティア・モデルに数百万のプロンプトを入力してその回答をキャプチャし、その豊かなシグナルを利用して、ローカルで動作したり特定のニーズに応えたりするコンパクトなモデルをトレーニングすることができる。これは、基盤モデルをゼロから構築するよりも安価であり、エネルギー消費もはるかに少ない。
OpenAIとAnthropicは、いずれも利用規約でこの行為を禁止している。組織的な蒸留が検知された場合、彼らはそれを規約違反として扱う。その取り締まりは、しばしば競合他社、特に中国を拠点とするAI企業を対象としている。これらの企業は、元のトレーニングに費やされる数十億ドルのコストを負担することなく、この手法を用いて能力の差を埋めようとしていると非難されている。
ナデラは、このポリシーの中心にある緊張関係を強調した。これらと同じラボが、公開されているデータに対するトレーニングは「フェアユース(公正な利用)」に該当するという法的論理に基づき、オープンなウェブをクロールし、書籍、フォーラム、コードリポジトリ、記事などをスクレイピングすることで、自社の旗艦モデルを構築してきた。彼らは「共有財産(コモンズ)」を採掘したのだ。しかし今、彼らは、その見返りとしてモデルの出力を公共の教材として扱うことを誰もできないよう、法的な柵を張り巡らせている。「世界中のオープンな知識から学ぶことはできるが、我々から学ぶことは誰にも許されない」と言っているかのようだ。
この非対称性は、単なる学術的な議論にとどまらない。それは、一握りのインフラプロバイダーが「誰が何を知ることができるか」を支配するという階層構造を確立してしまう。もしフェアユースが人類の公開された知性の取り込みを正当化するのであれば、それらのモデルの出力は「私有化された共有財産」のように見え始める。競合他社も顧客も、そのシグナルを新しいツールへと再利用することを禁じられている。富の流れは、ただ最大手のラボへと向かうのみである。
自らの知性に二度支払う
ナデラは、形成されつつある経済的な罠に対して、「逆情報のパラドックス(reverse information paradox)」という言葉を造った。彼の見解では、企業は現在、人工知能に対して二度支払っており、そのうちの一方しか請求書には現れないという。
第一のコストは明白だ。企業はAPIクレジットを購入し、Copilotを購読し、あるいはチャットボットサービスをライセンス契約する。第二のコストは隠れている。従業員が、ハルシネーション(幻覚)による事実を訂正したり、回答の有用性を評価したり、生成されたレポートを推敲したりするたびに、そのアクションはナデラが「エグゾースト(副産物)」と呼ぶものを生み出す。それは、実際の業務中に生成される、訂正、嗜好データ、およびインタラクション・ログの軌跡である。
このエグゾーストは、単なるデジタルのゴミではない。そこには、苦労して勝ち取ったビジネスロジックが含まれていることが多い。物流チームは、企業が長年かけて開発してきた内部的な制約条件を用いて、配送ルートを最適化するようにモデルにプロンプトを出すかもしれない。法務部門は、出力が社内スタイルに一致するまで、契約書の文言を繰り返し修正するかもしれない。製薬研究グループは、戦略的な優先順位を明らかにするような方法で臨床データに照会を行うかもしれない。これらのやり取りがサードパーティのAPIを通じて流れるとき、プロバイダーはそのやり取りのすべてを把握することになる。モデルは、その特定のドメインにおいて「何が良い回答であるか」を学習するのである。
時間が経つにつれ、このフィードバックによって、プロバイダーの汎用モデルは、顧客が実行を依頼したまさにそのタスクにおいて、より鋭利なものになっていく。するとプロバイダーは、その向上した能力を顧客の競合他社に転売したり、特化したワークフローを模倣した隣接製品を立ち上げたりすることができる。元の企業は、サブスクリプション料金を支払い、独自の専門知識を寄付し、事実上、自らの競合他社をトレーニングしてしまったことになるのだ。
なぜソブリンAIがバズワードから戦略へと移行しているのか
この流出に対する論理的な対応は、学習ループに対する制御を取り戻すことである。ナデラの主張は、Microsoftをこれまでとは異なる種類の「地主」として位置づけることを明確な目的としている。顧客に中央集権的なブラックボックスへインテリジェンスを投入させるのではなく、顧客自身が鍵を握り続けることができる環境を提唱しているのだ。
ここで、ソブリンAIをめぐる議論が実用的な重みを帯びてくる。モデルをプライベートクラウド、オンプレミスのデータセンター、あるいは厳格に制御された仮想ネットワーク内で実行するということは、インタラクションデータが組織の境界を越えて外に出ることがないことを意味する。企業は最新の基盤モデルの恩恵を受けつつも、重み、プロンプト、そして嗜好データは、自社が管理する境界内に留めておくことができる。
Microsoftは、まさにこのプライベートなデプロイメントとリージョン内のデータレジデンシーという約束を軸に、Azureクラウドビジネスを構築してきた。ナデラは自身の投稿の中で、企業が自社の知的財産を遠隔地のモデルプロバイダーへ意図せず送出してしまうことなく、独自の学習や推論を行えるプラットフォームにMicrosoftがなりたいという意向を示した。その提案は明快だ。強力なAIを利用しながら、その副産物は手元に残す、というものだ。
他のベンダーも同様の主張をしているが、MicrosoftとOpenAIの深いパートナーシップを考えると、ナデラの発言は格別の重みを持つ。~なCEOにとって
