Kimi K3は蒸留(Distillation)の産物か? 専門家が疑惑に異議を唱える

人工知能(AI)を巡る地政学的緊張は、米当局が中国企業による産業スパイ行為を非難する中で、沸点に達している。Moonshot AIがAnthropicのFableを使用してKimi K3モデルをトレーニングしたという疑惑が浮上しているが、主要なAI研究者たちは、大規模言語モデル(LLM)開発の技術的な実態は、それよりもはるかに複雑な物語を物語っていると主張している。

モデルの蒸留と知的財産(IP)窃盗の疑惑

ホワイトハウスの科学顧問マイケル・クラツィオス氏は、現在利用可能な最大のオープンウェイトLLMであるKimi K3の開発元、Moonshot社に対して深刻な告発を行った。クラツィオス氏は、Moonshotが米国の独占技術を盗むために「大規模かつ隠密な産業的蒸留」を行ったと主張している。この主張は、米国のLLMの「ウォーターマーク(透かし)」が中国のモデルに現れていると指摘したスコット・ベセント財務長官によっても支持されている。

蒸留(Distillation)とは、より大規模な「フロンティア」モデルにクエリを投げ、その推論能力や知識を抽出することで、より小さなモデルをトレーニングするプロセスである。これには多くの場合、教師あり微調整(SFT)が含まれる。SFTでは、ターゲットとなるモデルのプロンプトと回答を使用して新しいモデルをトレーニングするため、新しいモデルが元のモデルの「マナー」や特定の会話の癖を継承してしまうことがある。

なぜ専門家は蒸留説を疑うのか

これらの主張が政治的な重みを持っているにもかかわらず、AI研究コミュニティは懐疑的な姿勢を崩していない。Laude Instituteの研究者でありSnorkel AIの共同創設者であるブレイデン・ハンコック氏は、重大なタイムラインの問題を指摘している。AnthropicのFableが一般公開されたのは7月1日以降である。「それほど大量のデータを蒸留し、モデルをトレーニングして、わずか2週間でリリースすることは不可能です」とハンコック氏は述べた。

さらに、アレン人工知能研究所(Allen Institute for AI)のネイサン・ランバート氏は、モデルがフロンティアへと進化するにつれ、SFTによる蒸留の効果は薄れていると主張している。Kimi K3に見られるレベルの性能を達成するには、モデルはおそらく大規模な強化学習(RL)の実行を必要とする。このプロセスでは、数千万ものエージェントが回答を評価する必要があり、もし競合他社のAPIを通じてこれを行うとすれば、コストは法外に高くなり、時間も膨大にかかることになる。

ハードウェアと技術的専門知識の役割

論争はソフトウェアに留まらない。クラツィオス氏はまた、Moonshotが輸出規制を回避して高度なNvidia製ハードウェア、具体的にはGrace Blackwell 300チップやGB300搭載サーバーにアクセスしたとも主張している。これらのチップは中国への輸出が禁止されているが、ジョージタウン大学のサム・ブレスニック氏のような専門家は、闇市場や複雑なグローバル・サプライチェーンの存在により、こうしたハードウェアの流れを監視することは極めて困難であると示唆している。

しかし、多くの研究者は、蒸留に焦点を当てることは中国のAIチームの技術的な正当性を損なうものであると主張している。創設者がカーネギーメロン大学のようなエリート機関の出身であることを踏まえ、専門家はMoonshotが単に「他人の成功に便乗している」のではなく、独自の調査研究を行う能力を備えていると考えている。

グローバルなAI競争への影響

この紛争は、政治的なナラティブ(語り)と技術的な実態との間に広がる溝を浮き彫りにしている。業界が高度な強化学習や膨大な計算リソースを必要とする方向へと進むにつれ、企業が知能を「盗んでいる」のか、それとも単に優れたエンジニアリングによって前進しているのかという議論は、引き続き国際貿易政策やAI規制を形作っていくことになるだろう。

主なポイント

  • 技術的な懐疑論: 専門家は、Kimi K3の急速なリリースから、それがAnthropicのFableの蒸留のみによって構築された可能性は数学的に極めて低いと主張している。
  • 微調整を超えて: 教師あり微調整による蒸留は存在するものの、フロンティアレベルの性能を達成するには、容易に「コピー」できない高度な強化学習が必要となる可能性が高い。
  • ハードウェアに関する懸念: 禁止されているNvidia Blackwellチップへの不正アクセスの疑惑は、中国のAIの進歩を巡る議論に地政学的な複雑さを加えている。