今月のAIサービスの請求額は31,000ドルに跳ね上がりました。これは予算の3倍以上です。原因は、たった一行のコードがトラフィックの約**80%**を最も高価なモデルであるGPT-4oに送っていたことでした。
なぜ請求額が爆発したのか
私たちは、高速なレスポンス、ダウンタイム・ゼロ、スムーズなスケーリングといった信頼性を重視してシステムを構築しました。しかし、その選択がトークン使用における典型的な「メモリリーク」を引き起こしました。ほとんどのやり取りに対して過剰なスペックを持つモデルに、トークンが浪費され続けていたのです。
エンジニアリングの転換:コストをアーキテクチャ上の課題として捉える
AIの支出を単なる財務上の問題として扱うと、真のレバー(制御手段)が見えなくなります。それは、どのリクエストにどのモデルを実行するかを決定する「コード」です。モデル選択をルーティング層に組み込むことで、隠れたコストを制御可能な変数へと変えることができました。
1. タスクにモデルを適合させる
ルールはシンプルです。品質要件を満たす最小のモデルを使用する。私たちは、4つの一般的なリクエストタイプをより安価な代替モデルに割り当てました。
- Simple chat → DeepSeek V4 Flash(97.5%削減)
- Classification → Qwen3-8B(98.3%削減)
- Code generation → DeepSeek Coder(97.5%削減)
- Summarization → Qwen3-32B(97.2%削減)
これらのパーセンテージは、選択したモデルとGPT-4oとの間の直接的なトークン価格の差を反映しています。トレードオフとして、最高レベルの推論を必要としないタスクにおいては、能力がわずかに低下します。
2. CDNのような階層型ルーティング
まずすべてのリクエストを安価なモデルに送る、2層構造のルーターを構築しました。レスポンスが迅速な品質チェック(信頼度が閾値を下回る、または必要なエンティティが欠落しているなど)に失敗した場合、自動的に上位ティアのモデルへ再ルーティングします。このフォールバックにより、本当に必要な場合にのみ高価なモデルを使用しつつ、ユーザー体験を維持できます。
3. 繰り返されるプロンプトをキャッシュする
多くのやり取りでは、同じシステムプロンプトやFAQテキストが再利用されます。これらの出力をキャッシュすることで、同一のレスポンスを再計算することを回避できます。テストでは、インメモリキャッシュによって繰り返されるプロンプトのコストを約**30%**削減できました。
4. 送信前にプロンプトを圧縮する
長いシステムプロンプトは、ユーザーのコンテンツと同じ割合でトークンを消費します。そこで、プロンプトに対して安価な要約モデルを実行し、高価なモデルに転送する前に、本質的なコンテキストにまで削ぎ落とすプリプロセッサを追加しました。このステップだけで、トークン使用料を年間数千ドル節約できました。
実社会への影響
あるチャットボットの以前のコストは月額420ドルでした。クエリの85%をより安価なモデルにルーティングし、キャッシュを適用した結果、請求額は28ドルまで下がりました。軽量なモデルの方がレスポンスが速いためレイテンシも改善し、フォールバック経路がトリガーされることもほとんどありませんでした。
まとめ
AIの支出を、アーキテクチャにおける最優先事項として扱いましょう。リクエストを適切なモデルにルーティングし、品質に基づいたフォールバックを追加し、繰り返されるプロンプトをキャッシュし、入力を圧縮する。そうすることで、信頼性を損なうことなくコストを大幅に削減できます。
