Vercelの6月のトークンシェアレポートによると、オープンウェイトモデルがゲートウェイ・トークンの29%を占めており、4月の11%から上昇しました。そのうちDeepSeekだけで22.6%を占めています。この急増は、開発者が単一の「最適な」モデルから離れ、AIモデルをルーティング可能なインフラストラクチャとして扱うという、急速な変化を示しています。

なぜ開発者はモデルをインフラとして扱っているのか

安価なオープンウェイトモデル(その多くは中国のプロバイダーによるもの)は、Anthropicのようなプレミアムなサービスと比較して、ごくわずかなコストで済みます。コード抽出、テキストクリーニング、単純なデータ検索といった日常的なタスクであれば、精度が数パーセント低かったとしても、数ドルではなく数セントで済むモデルの方が魅力的になり得ます。

その結果、新しいデザインパターンが生まれています。アプリケーションはまず、作業の「退屈な」部分を低コストモデルに依頼します。出力が簡単な品質チェックを通過すればパイプラインは進行し、そうでなければ、2回目の実行や最終決定のために、より高価なモデルが呼び出されます。単一のモデルの選択ではなく、ルーティングのロジックこそが重要な要素となるのです。

数値が示すこと

複数のAIプロバイダーのフロントエンドとなるゲートウェイから得られたVercelのデータは、オープンウェイトモデルが周辺的な存在から主流へと移行していることを示しています。4月には全トークンのわずか1割強でしたが、6月までには3分の1近くに達しました。中国のモデルであるDeepSeekは、それだけでトークン量の5分の1以上を占めています。

支出に関しては、依然としてハイエンドモデルが主流です。例えばAnthropicは、トークンあたりの価格が高いため、引き続き支出の大部分を占めています。計算は単純です。安価なモデルは、大量かつ低利益率の作業を勝ち取り、高価なモデルは、高利益率かつ高インパクトなタスクを維持します。

AIエージェントへの影響

AIエージェントは通常、プランニング、データ検索、ツール呼び出し、結果の洗練といった一連のステップを実行します。各ステップを最もコスト効率の高いモデルに割り当てることができれば、全体の運用コストは劇的に低下します。

  • データ検索抽出は、多くの場合、安価なモデルが得意とする基本的な言語理解だけで十分です。
  • 最終判断(回答が許容できるかどうかを決定する部分)は、より高い信頼性を持つプレミアムモデルの領域であり続けます。

この階層的なアプローチにより、開発者は予算を膨張させることなく、より大規模なワークロードを自動化できるようになります。また、「最高のモデルを選ぶ」ことから、「ステップごとに成功を測定し、それに応じてルーティングする」ことへの転換を促します。

リスクと限界

経済的なメリットは強力ですが、移行には摩擦も伴います。

  • コンプライアンス: 一部の管轄区域では厳格なデータ取り扱い規則が課されており、海外でホストされているモデルの使用が制限される可能性があります。
  • ホスティングの複雑さ: 大規模なプレミアムモデルを自社で運用するのは難しいため、組織は外部APIに頼らざるを得ず、これがレイテンシやベンダーロックインの懸念を引き起こす可能性があります。

これらの要因があるため、安価なモデルがプレミアムモデルを完全に置き換えることは考えにくいでしょう。その代わりに、安価なモデルは日常的な作業のデフォルトとなり、プレミアムモデルは、その高いコストが正当化される「意思決定レイヤー」に留まることになります。

次に注目すべき点

  • ルーティングのためのツール: ルーティングレイヤーがより中心的な存在になるにつれ、レイテンシ、コスト、および信頼性の閾値に基づいてモデル選択を自動化するSDKやプラットフォームの波が期待できます。

タスクレベルの成功を測定し、リトライを追跡し、「ボリューム」と「判断」を明確に分離し始めた開発者が、台頭するインフラ思考から利益を得るための最良のポジションに立つことになるでしょう。

まとめ: AIスタックは、単一のモデル選択からルーティングの問題へと変貌を遂げつつあります。そこでは、安価なオープンウェイトモデルが作業の大部分を担い、プレミアムモデルは高インパクトな意思決定のために確保されます。そのルーティングをマスターすることが、AIビルダーにとって次の競争優位性となるでしょう。