DeepMindは今週、単一のH100 GPUで毎秒約1,500トークンを生成できるオープンウェイトの言語モデル「DiffusionGemma」を発表した。これに対し、標準的なGemma 4モデルの速度は毎秒303トークン程度である。この速度向上は、リアルタイムアプリケーションにおいてAI駆動型エージェントの動作を遅らせるレイテンシのボトルネックを解消できる可能性があるため、極めて重要である。

DiffusionGemmaがいかにして「トークンごと」の慣習を打破するか

ほとんどの現代的な言語モデルは、自己回帰的にテキストを生成する。つまり、1つのトークンを予測し、それをモデルにフィードバックしてから次のトークンを予測するという仕組みである。この「左から右へ」というループは、トークンごとにモデルの重みにアクセスする必要があるため、計算とメモリの間に密接な結合を強いる。DiffusionGemmaは、このループを、256トークンのチャンクを単一のノイズを含むデータブロックとして扱う離散拡散プロセスに置き換える。モデルはその後、ブロック全体を並列にデノイズ(ノイズ除去)し、ワークロードを「繰り返される重みの参照」から「ステップあたりのより大きな計算量」へとシフトさせる。NvidiaのH100のように並列演算に優れたハードウェアでは、このトレードオフが功を奏する。

AIエージェントにとって速度が重要な理由

自律型エージェントは通常、検索、要約、テストというサイクルを実行する。各ステップでモデルの呼び出しが複数回行われる可能性があるため、トークンごとのレイテンシはすぐに累積していく。モデルが停滞すると、エージェントのパイプライン全体が滞り、コストの増大とユーザーエクスペリエンスの低下を招く。

パフォーマンスのトレードオフ

DiffusionGemmaの速度は、生の能力において測定可能なコストを伴う。推論、事実性、言語理解を測定するベンチマークスイートであるAIMEにおいて、DiffusionGemmaのスコアは69.1であるのに対し、Gemma 4は88.3に達する。また、拡散アプローチは非常に短い出力において弱点があり、生成されたテキストが繰り返されたり躊躇したりする、時折の「トークンのスタッタリング(言葉の詰まり)」も見られる。同時に約32人以上のユーザーがモデルにクエリを投げると、並列化の利点が損なわれ、全体の処理能力(スループット)において標準的な自己回帰方式に追いつかれてしまう。

各アプローチの使い分け

データは、以下のようなハイブリッドなデプロイメント戦略を示唆している。

  • 拡散モデル: 深い推論を必要としない、低コンカレンシー(同時実行数が少ない)でレイテンシに敏感なタスク(例:短いプロンプトの生成、テンプレートの穴埋め、ドラフトテキストの作成など)。
  • 自己回帰モデル: 高コンカレンシー(同時実行数が多い)なワークロード、複雑な推論、または精度が速度よりも優先される長文生成。

この変化がAIインフラに