Nvidiaは8月11日にNemotron 3.5 Lightningをリリースしました。300億パラメータのMixture-of-Experts(MoE)モデルでありながら、アクティブなパラメータはわずか30億です。そのコンパニオンであるNeMo Switchyardルーティングライブラリは、推論コストとキャッシュ効率をめぐる議論をすでに巻き起こしています。Switchyardがモデル間でリクエストを転送する方法は、プロンプトキャッシュを台無しにし、単一の推論セッションのコストを倍増させる可能性があります。

オープンウェイトのエージェント向けに構築されたモデル

Nemotron 3.5 Lightningは、ツールの呼び出し、結果の検証、推論トレースの保持を行うAIエージェントをターゲットにしています。以下の3つの技術的な選択が、このモデルを際立たせています。

  • ハイブリッドアーキテクチャ – Mamba-2の状態空間コアと従来のTransformerを融合させており、Transformer以外の設計でもこの規模で競争できることを証明しています。
  • 4ビット浮動小数点量子化 – 低精度で提供されることで、30BモデルはM5 Max MacBook Pro上で毎秒約100トークンを生成できます。これは、フル精度のモデルでは到達が困難な速度です。
  • 完全なオープン性 – Nvidiaは重みファイルと完全なトレーニングレシピを公開しました。これは、高パフォーマンスな推論を目的としたモデルとしては稀なことです。

初期ユーザーによれば、このモデルは「考えすぎる」ことがあり、時に誤りを含む長い推論チェーンを出力することがあるといいます。開発者は強力でオープンに利用可能なエージェント実行機能を得られますが、不要な冗長性を避けるためには慎重なプロンプト作成が求められます。

なぜルーティング層が重要なのか

NeMo Switchyardは、候補となるモデルのプールの中から、リクエストを「最適な」モデルに動的にルーティングするためのNvidiaのライブラリです。理論的には、ルーターが各クエリに対して専門的なモデルを選択することで、回答の品質を向上させることができます。しかし実際には、ルーティングの決定が、多くの推論パイプラインが依存しているプロンプトキャッシュのメカニズムと衝突します。

  • プロンプトキャッシュは、初期プロンプトのトークン埋め込みを保存しておくことで、後続の生成プロセスにおいて「prefill(プリフィル)」ステップを再計算することなく再利用できるようにします。
  • ルーティングの切り替えは、最初の数トークンの後にリクエストをモデルAからモデルBへ移動させます。これにより、システムはキャッシュされたプロンプトを破棄し、新しいモデルのためにゼロから再計算することを余儀なくされます。

AIコストの大部分は新しいトークンの生成ではなく、キャッシュされたプロンプトの読み取りに費やされるため、一度のルーティングのホップが、実質的にリクエストのコストを倍増させることがあります。

コストの綱引き

今後の展望

この議論は、Nvidiaのオープンウェイト戦略が直接的な競争に直面する中で起こっています。8月15日にはQwen 3.8-27Bがリリースされる予定で、初期のベンチマークでは、ローカル開発のシナリオにおいてNemotron 3.5 Lightningに対抗できることが示唆されています。

Nvidiaのパターン(オープンな重み、オープンなトレーニングレシピ、そしてオープンなルーティング層)は、これらのモデルをローカルで実行するあらゆるユーザーにとって、同社のGPUをデフォルトのハードウェアにするように設計されているように見えます。ソフトウェアスタックを公開することで、Nvidiaはルーティングロジックが隠れたコスト増を招いたとしても、開発者を自社のエコシステムに囲い込むことを狙っています。

まとめ

Nemotron 3.5 Lightningを自身のマシンで実行することを検討している場合は、「生成速度はどのくらいか?」だけでなく、「Switchyardによってプロンプトキャッシュがどのくらいの頻度で破棄されることになるか?」も問いかけてみてください。その答えが、このモデルのオープンウェイトという約束が、現実的なコスト削減につながるのか、それとも高価な実験に終わるのかを決定することになります。Qwenのような代替案が登場する中で、ルーティングの柔軟性とキャッシュ駆動のコスト効率のバランスが、どのツールキット、そして最終的にはどのハードウェアプラットフォームが勝利するかを決定するでしょう。