AIトークンの年間費用が、一部の企業ではエンジニアの給与総額に匹敵し始めており、経営陣はそれを祝すべきか、パニックに陥るべきか判断できずにいる。企業はこの数年間、推論コストの低下が自動的に人員削減と開発サイクルの高速化につながると期待し、大規模言語モデルに巨額の資本を投じてきた。しかし、実際には多くのエンジニアリング組織が「二重の支払い」を強いられていることに気づいている。一方は、増強を期待した人材への報酬であり、もう一方は、彼らを代替するはずだった計算リソースへの費用である。もはや、AIがコードを書けるかどうかという問いではない。AIが書くコードが、その生成に費やされる莫大な費用に見合うかどうかが問題なのだ。
半給(給与の半分)というベンチマーク
ジェンセン・ファンは、All-In PodcastでのGTC 2026終了時の発言において、その計算式を率直に示した。NvidiaのCEOは、エンジニアの効率性を、その給与とAIトークンの消費量を直接比較することで測定することを提案した。彼の基準は極めて明確だ。例えば、年収50万ドルのソフトウェアエンジニアを想定する。もしそのエンジニアの年間トークン使用額が、給与の約半分である25万ドル未満であれば、ファンはそれを警告信号と見なす。経営陣は「深く警戒すべき」だと彼は言う。それは、会社が人材に過剰な支出をしているからではなく、人材を十分に活用できていない可能性が高いからだ。
この論理は、従来のコスト管理の考え方を覆すものである。長年、財務チームは計算リソースを最小限に抑えるべき変動費として扱ってきた。しかし、ファンは逆の主張をする。モデルをほとんど使わない高給なエンジニアは、力の増幅器(フォース・マルチプライヤー)なしで動いている高価なエンジニアである。期待されるのは、高コストな人材が漏斗(ファンネル)のように機能し、AIシステムを通じて膨大な量の仕事を流し込み、出力をレビューし、結果をオーケストレートすることだ。トークン消費が少ないことは、節約を意味しない。それは、モデルが処理できたはずの機械的な作業を、依然として人間が行っていることを示している。
実践における支出の実態
このベンチマークがなぜ重要なのかを理解するために、25万ドル分のトークンが実際に何を意味するのかを考えてみよう。最先端モデルの現在のレートでは、それは単なる数回のオートコンプリート(自動補完)の提案ではない。幅広いタスクにおいて、毎営業日、数百万ものトークンが処理されていることを意味する。それは、単にエディタの補完を受け入れているだけでなく、広範なアーキテクチャの推論、インテリジェントなエージェントによる一括リファクタリング、自動テストパイプライン、合成データの生成、そして反復的なデザインの探索を行っているエンジニアの姿を示唆している。
このような働き方をするシニアエンジニアは、単一の機能に対して複数のモデル呼び出しを連鎖させることがある。スキャフォールディング(骨組み)の生成、破壊的変更に対する依存関係の分析、エッジケースの挙動のシミュレーション、そしてドキュメント作成を並行して行うのだ。人間が一行ずつタイピングするのではなく、「操縦」しているため、スループットは膨大になる。ファンにとって、給与が正当化されるのは、人間がその規模で活動し、絶え間ないモデルとの対話を通じて出力を増幅させたときのみである。
リターンが失われる場所
このようなビジョンがあるにもかかわらず、業界はインフラ支出と提供される成果との間の広がる溝に直面している。企業はトークンを大量消費する戦略へと急ぎ、AIベンダーとのエンタープライズ契約を締結し、生成AIツールに合わせて開発パイプラインを刷新してきた。資本支出は驚異的なものとなっている。しかし、多くの企業にとって、生産性の向上というリターンは期待外れなものに留まっている。
確かに、開発者は退屈な作業においては高速化している。モデルが初稿を生成すれば、ボイラープレートコード、ユニットテストのスケルトン、繰り返しのCRUD操作などはあっという間に終わる。しかし、ソフトウェアエンジニアリングの本質は、タイピングの速さでは決してなかった。困難でコストのかかる仕事は、広大なシステムの維持、分散された障害モードの推論、多層的な依存関係にわたるセキュリティの確保、そしてあらゆる近道によって蓄積される技術的負債の管理にある。これらの
