LLMの価格設定は流動的です。ある月は推論予算が予測通りに収まっていても、翌月にはプロバイダーがトークン単価を調整し、リクエスト数が増えていないにもかかわらず月間の支出が変動することがあります。まさに今、それが起こりました。GMICloud、Novita、StreamLakeのすべてがモデルの価格を更新しました。本番環境のワークロード、あるいは実験的なパイプラインを運用しているなら、これらの改定は真剣に検討すべき事項です。市場が崩壊しているからではなく、1日に数百万トークンを処理する場合、トークン・エコノミクスのわずかな差が恐ろしいほど累積するからです。

これらのプロバイダーとは

GMICloud、Novita、StreamLakeは、それぞれAIインフラストラクチャ・スタックにおいて異なる役割を担っていますが、現在は大規模言語モデル(LLM)の実行コストにおいて直接的に競合しています。

GMICloudは高性能なGPUクラウドを運営しており、独自のクラスターを管理せずにAPIアクセスを利用したい開発者向けに、ホスト型LLMのカタログを拡充しています。Novitaは、手頃な価格のGPUレンタルとモデル・サービングで定評があり、大手ハイパースケーラーが課すプレミアム価格よりも安価にオープンウェイト・モデルを利用したいエンジニアを惹きつけています。ByteDanceのクラウドおよびメディア・エコシステムから発展したStreamLakeは、ビデオ・インフラの専門知識を推論分野の競争に持ち込み、重いメディア処理ワークロードも処理できるプラットフォームを通じてモデルを提供しています。

彼らはOpenAIやAnthropicのような誰もが知る名前ではありません。だからこそ、彼らの価格変動が重要なのです。彼らは、利益率が低く、割引が一般的で、開発者の獲得競争が絶え間なく続く、市場の攻撃的なミドルティア(中間層)に位置しています。このティアの3つのプラットフォームがほぼ同時に価格表を変更したことで、オープンソースやファインチューニング済みモデルの実行コストのベンチマークが、集団的に再設定されることになります。

何が変わったのか

今回の更新は、これら3つのサービスすべてにおけるLLMの使用料金に影響を与えました。Dev.toでnarevbotとして執筆しているNaren氏は、GMICloud、Novita、StreamLakeのモデルごとの具体的な調整内容をまとめた記事を公開しています。詳細な比較はこちらで読むことができます。

この段落を読み終える前にまた変わってしまうかもしれない「1トークンあたりの数セント」という数字を羅列するよりも、重要なのは、これらの変更が構造的であるという点です。各プロバイダーはトークンの課金方法のバランスを再調整しており、場合によっては、特定のワークロードにおいてどのモデルが最も安価になるかが変わります。これは、単なる一律の値下げや値上げであることは稀です。あるプロバイダーは入力価格を下げつつ出力価格を引き上げるかもしれません。別のプロバイダーは、小規模なパラメータのモデルは据え置く一方で、ロングコンテキスト(長文コンテキスト)のエンドポイントの料金を上げるかもしれません。これら3社すべてがLlama、Qwen、Mistral、その他のアーキテクチャのさまざまな組み合わせをサポートしているため、影響(恩恵または損失)は、どのモデルをどのAPI経由でルーティングしているかに完全に依存します。

トラフィックが変わらないのに請求額が変動する理由

影響を理解するには、LLMの課金が実際にどのように機能しているかを見る必要があります。入力トークンと出力トークンはほぼ常に別々に課金され、その比率が実質的なコストを決定します。例えば、1日に1万件の会話を処理するカスタマーサポート・ボットの場合、1チャットあたりの平均が入力トークン2,000、出力トークン400だとします。100万トークンあたり混合で3ドルの場合、1日あたり約84ドルになります。もしプロバイダーが出力価格をわずか20%引き上げただけで、1日のコストは90ドルを超えます。四半期で見れば、トラフィックが全く同じでも、追加で1,000ドル近い支出が発生することになります。

これを、1時間あたり数百万トークンを処理するコンテンツ生成パイプラインや検索拡張生成(RAG)システムに当てはめると、選択するプロバイダーは極めて重要なコスト項目となります。GMICloud、Novita、StreamLakeはこのことを熟知しています。彼らの価格変更は、大量のバッチ処理、低レイテンシのチャットアプリケーション、あるいはロングコンテキストの要約タスクといった、特定のユースケースを狙った意図的なポジショニング戦略なのです。

さらに複雑さを増しているのが、その他の要素です。一部のプラットフォームでは、リクエストごとの最低料金、プロビジョニングされたスループットに対するアイドル料金、あるいはレート制限のバーストに対する追加料金を設定しています。最低リクエスト料金の変更は、大量利用のユーザーよりも低頻度利用のユーザーに大きな打撃を与えます。バッチ推論の割引率が変われば、リアルタイムAPIの請求額は変わらなくても、夜間のレポート生成コストが削減されることもあります。「価格改定」という見出しを読むだけでは不十分です。料金体系の詳細を読み解く必要があるのです。

過剰反応せずにどう対応すべきか

レートが変動すると、ほとんどのエンジニアリングチームは2つの間違いのうちのどちらかを犯します。変化を無視してコスト超過を静かに吸収してしまうか、あるいはパニックに陥るかです。