前身であるNemotron 3 Nano 30B A3Bは、すでに大規模な基盤モデルに対するコンパクトな代替案として位置付けられていました。Mamba-Transformerハイブリッドアーキテクチャへの移行と、常に36億パラメータのみをアクティブ化することで、Lightningは、はるかに大きなモデルに匹敵する推論能力を維持しつつ、効率性の限界を押し広げています。

なぜ今、スピードが重要なのか

AIエージェントは、バッチ形式の推論から継続的なインタラクションへと移行しています。チャットボットが数秒間停止すると、動作が鈍く感じられます。コード補完ツールが開発者のタイピングに遅れると、ワークフローが中断されます。こうした環境では、1秒あたりのトークン数(スループット)が、体感的なレスポンス性能に直結します。670トークン/秒という数値は、GoogleのGemini 3.5 Flash-Liteで報告されている386トークン/秒の約2倍であり、標準的なIntelligence Indexタスクの完了時間を約30分に短縮します。対照的に、Qwen 3.6 35B A3Bでは同じタスクに3.5分、Gemma 4 31Bでは5.8分を要します。

その差は、多数の同時リクエストを処理しなければならないあらゆるサービスにとって重要です。同じハードウェアで2倍のトークンを処理できるサーバーは、コストを削減するか、あるいは容量を2倍に増やすことができ、クラウドプロバイダーや企業にとって明確な利点となります。

モデルがいかにしてその数値を達成しているか

Nemotron 3.5 Lightningのハイブリッドアーキテクチャは、Transformerの長距離パターン認識能力と、Mambaブロックの状態空間(state-space)の効率性を融合させています。この設計では、モデリング能力を維持するために総パラメータ数を316億と高く保っていますが、特定のトークンに対してアクティブになるのはわずか36億です。疎なアクティベーション(Sparse activation)により、品質を大幅に損なうことなく、トークンあたりの計算量を削減し、スループットを向上させています。

Artificial Analysisによる測定では、LightningのIntelligence Indexスコアは24となり、以前のNanoモデルのスコアである15から9ポイント上昇しました。これにより、Lightningはパラメータ数を約4分の1しか使用していないにもかかわらず、OpenAIのgpt-oss-120bと同等の水準に達しています。MetaのMuse Glimmer (35) や Qwen 3.6 35B A3B (32) といったトップモデルには依然として及びませんが、その「知能対パラメータ比」は最高クラスに位置しています。

エージェント向けベンチマークも同様の結果を示している

計画、ツール利用、多段階推論といったエージェント的ワークロードこそ、Lightningが真価を発揮する分野です。GDPval-AA v2ベンチマークにおいて、同モデルは824のエロ(Elo)レーティングを獲得し、1,200億パラメータを持つgpt-oss-120b (800) や、Nvidia自身のより大規模なNemotron 3 Super (698) を上回りました。Terminal-Bench v2.1テストでは、Lightningの成功率は7%から24.3%に上昇し、gpt-oss-120bが記録した26.2%に迫っています。

Nvidiaは、CodeRabbitやHarveyといったパートナーとの事後学習(post-training)における協力により、ドメイン固有のタスクに合わせてモデルを微調整できたことが要因であるとしています。これらの改良により、モデルは専門的なワークロードにおいて競争力を維持しながら、高速な動作を実現しています。

利用可能性と実用的な検討事項

このモデルは、寛容なOpenMDW-1.1ライセンスの下で提供され、重みはBF16およびNVFP4形式で利用可能です。NVFP4バリアントは、品質の低下を最小限に抑えつつモデルをより高密度に圧縮しており、エッジへのデプロイやコストを重視するクラウドインスタンスにとって有用な選択肢となります。100万トークンのコンテキストウィンドウにより、モデルは内容を切り詰めることなく非常に長いプロンプトを処理でき、これは文書レベルの分析や大規模なコードベースの扱いに非常に価値があります。

サーバーレス推論は、すでにDeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius、Crusoeなどのプロバイダーで実行可能です。開発者は独自のインフラを構築することなく実験を開始できますが、真の費用対効果は各プラットフォームの価格設定に依存します。

まとめ: Nemotron 3.5 Lightningは、1,200億パラメータのシステムに匹敵する推論レベルを実現しながら、主要な競合他社の約2倍のトークンスループットを提供できることを証明しており、低遅延が求められるAIエージェントにとって強力な候補となります。