大規模なAIモデルの運用は、科学的な偉業というよりも、電気代とデータセンターの賃料に関する過酷な数学の問題になりつつある。Geminiが生成するトークン一つひとつが、シリコンのサイクル、メモリ帯域幅、そして壁から引き出される電力といった、Googleにとっての実質的なコストとなっている。クエリ量が増えるにつれ、わずか数セントの積み重ねが、利益を丸ごと飲み込んでしまうほどの金額に膨れ上がる。その静かな切迫感の背景にあるのが、現在Google内部で形になりつつある社内サーバーチップ・プロジェクト「Frozen v2」だ。汎用的なTensor Processing Unitを次世代へと改良するのではなく、同社ははるかに急進的な試みを行おうとしている。すなわち、Geminiモデルの骨格を、シリコンそのものへと直接鋳造することだ。

柔軟なアクセラレータからモデル特化型シリコンへ

GoogleのTPUは、10年近くにわたり同社のインフラの主力として機能してきた。モデルの学習や検索ランキングアルゴリズムの駆動を担うだけでなく、NvidiaのGPUに代わる選択肢を求めるMetaなどのクラウド顧客に、時間単位で貸し出されることもある。その汎用性こそが、まさにTPUたる所以である。TPUは行列演算やメモリ移動という一般的な語彙を解し、ソフトウェアで記述できるほぼすべてのニューラルネットワークで使用可能だ。

Frozen v2は、あえてその柔軟性を放棄している。このチップは、Gemini自身のアーキテクチャの一部を回路として物理的に反映させた、ドメイン特化型アクセラレータとして設計されている。TPUが命令をフェッチしてソフトウェア操作として解釈するのに対し、Frozen v2はモデルの構造的な設計図(レイヤーの配置やデータパス)を、チップのレイアウトに直接焼き付ける。モデルとハードウェアのこの緊密な結合により、AIのレスポンス提供において、現在のTPUよりも6倍から10倍効率的になるとGoogleは期待している。クエリあたりの計算ステップが減ることは、トークンが表示されるまでの待ち時間が短縮されることを意味し、生成に費やされるエネルギーも大幅に削減される。

これは単に同じアイデアの高速版ではない。汎用性を犠牲にして、単一のモデルファミリーへの献身を選んだ、異なるカテゴリーのチップなのだ。

なぜ最初の「Frozen」は溶けてしまったのか

このアプローチは、Google DeepMindのチーフサイエンティストであるJeff Deanに帰せられる初期のコンセプトに端を発している。オリジナルの「Frozen」案は、アーキテクチャだけでなく、実際のモデルの重み(Geminiの学習された振る舞いを構成する数十億の調整済みパラメータ)までもチップに直接ハードコーディングすることで、さらなる専門化を図るものだった。

その論理は筋が通っていた。モデルが使用する数値を正確に把握できているなら、なぜわざわざ外部メモリからそれらを読み出す必要があるだろうか?トランジスタにそれらを刻み込めば、あらゆる種類の遅延を排除できるはずだった。

問題は「永続性」だった。AIモデルは停滞することはない。Googleは新しいデータで再学習し、パラメータを調整し、改良版をリリースすることで、Geminiを継続的にアップデートしている。重みがシリコンに固定されたチップは、新しいモデルの改訂版がリリースされた瞬間に、ただの文鎮と化してしまうだろう。その柔軟性の欠如が、オリジナルのコンセプトを頓挫させた。

アンカーのないアーキテクチャ

Frozen v2は、アーキテクチャをハードコーディングしつつ、重みは変更可能なままにすることで、陳腐化の罠を回避している。それは、車を道路に溶接するのではなく、カスタムのサーキットを造るようなものだと考えてほしい。回路の形状はGemini特有の計算パターンに合わせて固定されるが、その回路を流れる内容は、メモリから新しい重みをロードすることで更新できる。

この違いは実務において重要である。エンジニアが新しいGeminiのチェックポイントを学習させた際、新しいチップを製造することなく、Frozen v2ハードウェアにデプロイできる。どの構造要素に「シリコンの不滅性」を与えるべきか、どの要素を構成可能(configurable)なままにしておくべきかを、チームが正確に判断しなければならない。しかし、原則は決まっている。形状を固定し、パラメータを流動的に入れ替えることで、Googleは反復(イテレーション)の能力を犠牲にすることなく、効率性の向上を実現しようとしている。

インハウス(内製)化の経済学

Google Cloudの料金表にFrozen v2が載ることがない理由がもう一つある。このチップはGeminiの内部構造に合わせて極めて密接に設計されているため、PyTorchやカスタムのTransformerバリアントを実行する外部の開発者にとっては、ほとんど意味をなさないからだ。Googleはこれを汎用製品として販売する計画はない。これは、Google自社のデータセンターにおける膨大な推論キャパシティへの需要に真っ向から応えるための、内部ツールとして留まるだろう。

その選択は、冷徹な経済的現実を反映している。現在の生成AI市場において、モデルの能力は急速に収束しつつある。競合他社との差は、多くの場合、「誰が最大のモデルを最も低いトークン単価で実行できるか」という点に集約される。推論はもはや学習の後の付け足しではない。Geminiのような広く利用される製品にとって、それは最大の支出項目である。もしFrozen v2がそのコストを6分の1以下に削減できれば、Googleは競合他社が容易には真似できない余力を手に入れることになる。その削減分を利益として確保することも、API利用者や製品統合向けに低価格として還元することも可能であり、OpenAIやAnthropicといった他社への圧力を強めることになる。

これが業界に示唆すること

Googleのこの動きは、より広範なハードウェア戦略がどこに向かっているのかも示唆している。長年、標準的な手法は、可能な限り柔軟なアクセラレータを構築し、専門化についてはソフトウェアに任せるというものだった。NvidiaのGPUが支配的なのは、分子動力学からビデオゲーム、大規模言語モデルに至るまで、あらゆるものを実行できるからだ。Google独自のTPUも、同様の汎用性の精神に基づいて構想された。

Frozen v2は、その伝統を打ち破るものである。これは、単一のモデルファミリーが十分なクエリ量を生み出す場合、そのモデルに特化したカスタムシリコンが、そのコストを何倍も上回る価値をもたらし得るという事実を認めたものだ。他のハイパースケーラーも同様の論理を追求している(例えばAmazonのTrainiumやInferentiaチップなど)。しかし、Googleのアプローチは、一般的なネットワーククラスではなく、特定のモデルアーキテクチャに合わせてハードウェアを共同設計(co-design)するという点で、より踏み込んだものとなっている。

もちろん、リスクは硬直性にある。もしGeminiのアーキテクチャが、ハードコードされた回路では対応できない方向に進化した場合、Googleは最新のアイデアを実行できない高価なシリコンを抱え込むことになる可能性がある。だからこそ、「アーキテクチャのみ」という妥協案が重要なのである。それは、劇的な効率向上を実現するための十分な専門性と、会社を袋小路に追い込まないための十分な柔軟性を兼ね備えた、中間的な道を提供している。

真の教訓

Frozen v2は、単なるチップの発表としてではなく、AI競争の将来の形に対する戦略的な賭けとして理解するのが最適である。Googleは、勝者は単に最高のモデルを構築するだけでなく、モデルの設計図からトランジスタを流れる電子に至るまで、スタック全体を所有することになると賭けているのだ。もしこのプロジェクトが成功すれば、その成果はベンチマークスコアには現れない。それは四半期決算報告書のコスト欄に現れる。100万トークンあたり数セントの節約が、生成AIにおける商業的な可能性の境界線を書き換えることになるのだ。