ある個人研究者が、自身のLLM駆動型リサーチエージェントが1ヶ月間に消費したすべてのトークンを記録したところ、請求額を31%削減することに成功した。支出は945ドルから651ドルへと減少した一方で、成功率は91%から93%へとわずかに上昇した。これは、コストに敏感なAIワークフローを運用している人なら誰もが注目する結果である。
なぜトークンレベルのデータが重要だったのか
ほとんどのLLMユーザーは、最終的な請求書、つまり各サブタスクのコストが隠された一括の金額しか見ていない。この研究者のエージェントは、「SEC(証券取引委員会)への提出書類の検索」「レポートの作成」「リサーチの統合(シンセシス)」という3つの主要なアクションを実行していた。詳細なデータがなければ、6月に支払った312ドルが適切に使われたのかどうかを判断することはできなかった。
隠れたコスト漏れを明らかにするため、彼はモデル名、トークン数、タスクタイプ、およびコールごとのコストを記録するPostgreSQLのロギングレイヤーを追加した。30日後、そのデータは明確な実態を浮き彫りにした。
- SEC提出書類の検索 – 総支出の41%
- レポート作成 – 28%
- リサーチの統合 – 17%
- 品質チェック – 9%
- その他 – 5%
数値から分かったのは、最もコストがかかっていたのはモデル自体ではなく、エージェントが検索結果の生データをどのようにプロンプトに投入していたか、という点だった。
節約につながった3つの調整
1. プロンプトを入力する前に要約する
当初、エージェントは20件の生の検索結果を各プロンプトに詰め込んでおり、入力トークン数を大幅に膨らませていた。そこで、まず安価な要約モデルを介在させることで、入力を大幅に削減した。その結果、検索タスクあたりのコストは0.84ドルから0.19ドルへと、77%減少した。
2. 単純なチェックは安価なモデルにルーティングする
品質チェックには、1回のチェックにつき0.09ドルかかるハイエンドモデルを使用していた。彼は、ほとんどの合否判定(pass/fail)チェックを低価格のモデルに切り替え、1回あたりの価格を0.01ドルに抑えた。安価なモデルの正解率は89%であったが、判定に失敗した場合は元のモデルにエスカレーションされる仕組みにしたことで、精度を維持しつつコストを87%削減することに成功した。
3. 確信度が高い場合はチェックをスキップする
タスクの過去の成功率が高く、かつ出力の長さが期待される範囲内に収まっている場合は、品質チェックのステップをバイパスするというルールを追加した。これにより、本来実行されるはずだったチェックの約60%を排除することができた。
成果
これら3つの変更を導入した結果、月次の収支明細は以下のようになった。
- 総支出: 945ドル → 651ドル(31%削減)
- タスクあたりのSEC検索コスト: 0.84ドル → 0.19ドル(77%削減)
- タスクあたりの品質チェックコスト: 0.09ドル → 0.01ドル(87%削減)
- 全体の成功率: 91% → 93%
成功率が向上したことは、プロンプトを短くしたことでノイズが減り、モデルが核心となる問いに集中しやすくなったことを示唆している。
注意点と反論
このアプローチは2つの前提に基づいている。第一に、安価な要約モデルが、後続の推論に必要な情報を十分に保持していなければならない。重要な詳細が切り捨てられれば、出力の品質が低下する可能性がある。第二に、品質チェックに使用する低コストモデルは完璧ではない。正解率が89%であるということは、エラーのわずかな割合が最終製品に到達することを意味する(ただし、エスカレーション経路によってほとんどのエラーは捕捉される)。コンプライアンス要件がより厳しいユーザーの場合は、より厳格な閾値や追加の検証ステップが必要になるだろう。
LLMの実務家にとっての意味
- 詳細なダッシュボードが鍵となる。 ハイレベルな支出レポートでは、トークンの無駄が見えなくなる。タスクごとの使用量を記録することで、放置すれば隠れたままとなる非効率性を発見できる。
- フロンティアモデルが常に必要とは限らない。 安価なモデルであっても、全体の品質を損なうことなく、データの圧縮や単純な二値判定を行うことができる。
LLMエージェントの隠れたコストは、多くの場合、測定されていない作業の中に存在する。トークンの流れを計測し、的を絞った最適化を適用することで、研究者は月間945ドルの請求を、パフォーマンスを向上させつつ651ドルというより効率的な運用へと変えた。AIワークロードの予算を管理するすべての人にとって、教訓は明確である。すべてのトークンを測定し、データに基づいてどこを削るべきかを判断せよ。
