最新のコスト分析によると、大規模言語モデル(LLM)のセルフホスティングが商用APIよりもコスト効率が高くなるのは、企業が毎月およそ500万〜1,000万の入力トークンを処理する場合のみであることが分かりました。AIサービスの予算を策定する際、この損益分岐点が、「無料」というオープンウェイトの魅力が真の節約につながるかどうかの分かれ目となります。

APIモデル

APIプロバイダーはトークン単位で料金を請求し、すべてのハードウェア、電力、冷却を管理します。現在の公開レートは以下の通りです:

  • Claude Sonnet 5 – 100万入力トークンあたり2ドル
  • GPT-5.6 – 100万入力トークンあたり約1ドル
  • Meta Muse Spark – 入力100万トークンあたり1.25ドル、出力100万トークンあたり4.25ドル

このモデルは従量課金制です。トラフィックがゼロになれば、請求額もゼロになります。また、ユーザーはGPUの故障、ファームウェアのアップデート、キャパシティプランニングといった煩わしい問題からも解放されます。

セルフホスティングモデル

自社ハードウェアでオープンウェイトモデルを運用する場合、利用率に関わらず計算コストを自社で負担することになります。LLMの推論によく選ばれるNVIDIA H100のコストは以下の通りです:

  • 一般的なGPUクラウドサービス:1時間あたり2〜3ドル
  • 主要なクラウドプラットフォーム(AWS、Azure):1時間あたり7〜12ドル

これは、1台のH100を継続稼働させる場合、月額およそ1,800〜2,000ドルに相当します。ハードウェアの価格は、請求額のうち目に見える部分に過ぎません。

数値が交差する地点

分析の結果、月間の入力トークン数が500万〜1,000万の範囲に達すると、セルフホスティングの方がプレミアムAPIよりも安価になることが判明しました。この閾値を下回る場合は、トークン単価の安いAPIの方が有利です。月間1億トークン以上のボリュームになると、ハードウェアのみのコスト曲線がAPIのコスト曲線を下回り、理論上はセルフホスティングが魅力的に見えてきます。

隠れた運用コスト

GPUのレンタル料は、本番環境でモデルを運用する真のコストの約30%に過ぎません。残りのコストは以下から発生します:

  • ネットワークとストレージ – 低レイテンシを維持するために、高スループットのリンクと高速ディスクが必要です。
  • 冗長性とモニタリング – 複数のインスタンス、ヘルスチェック、アラートパイプラインにより、ソフトウェアとハードウェアの両方の支出が増加します。
  • エンジニアリング人材 – モデルを安定してオンラインに保つには、通常1.5〜2人のフルタイムエンジニアが必要です。市場レートで見ると、これによって年間支出が27万〜55万ドル増加します。

これらの要素を加味すると、ハードウェア単体による見かけ上の節約効果はすぐに消え去ってしまいます。

セルフホスティングを検討すべき対象

セルフホスティングが理にかなうのは、以下のような特定の条件下のみです:

  • 継続的な大規模ボリューム – 組織が定期的に500万トークンの閾値を超える必要があります。そうでなければ、トークン単価はAPIの方が安いままであるからです。
  • 規制またはデータプライバシーの制約 – 特定のセクターでは、機密データや個人データをサードパーティのエンドポイントに送信することが禁止されています。
  • 特殊なカスタマイズやレイテンシの保証 – モデルを内部データで微調整(ファインチューニング)する必要がある場合や、1秒未満のレスポンスが求められる場合、スタックを自社保有することに正当性が見出せます。

これらの要因がない場合、隠れたスタッフコストやインフラコストが、ハードウェアの節約分を上回ってしまうことがよくあります。

ハイブリッド戦略

セルフホスティングが実行可能な規模に達したチームの多くは、依然として混合アプローチを採用しています:

  1. まずはAPIから開始 – 安価で統合が容易であり、実験や低ボリュームのワークロードに最適です。
  2. 高ボリュームのストリームを移行 – トークン数が継続的に損益分岐点を超えたら、それらのパイプラインを自社内のクラスターに移行します。
  3. セーフティネットを維持 – オンプレミスのリソースを過剰に確保することを避けるため、時折発生するリクエストやバースト的なリクエストはAPIに残しておきます。

定期的にトークン計算を行い、生のハードウェア価格には含まれない運用オーバーヘッドを積み上げて検討してください。その全体像に基づいた意思決定であれば、迷信に惑わされる可能性ははるかに低くなります。

まとめ

AI製品の月間処理トークン数が数百〜数百万程度であれば、最もシンプルで安価な方法は依然としてAPIを利用することです。持続的な大量需要、厳格なコンプライアンス、またはカスタムレイテンシのニーズが生じた場合にのみ、セルフホスティングは経済的に実行可能になります。しかし、たとえそうであっても、クラウドに対する勝利を宣言する前に、人材とインフラの隠れたコストを考慮に入れなければなりません。