Whisper対API: 「無料」モデルが最も高価な項目になる時
チームがAssemblyAIの請求書を目にします。誰かが尋ねます。「コストを抑えるために、Whisperを自前でホストすればいいんじゃないか?」
簡単そうに聞こえます。チェックポイントをダウンロードし、コマンドを実行する。午後のひとときで完了です。
しかし、真の問いはこうです。そのエンドポイントを今後2年間運用し続けるコストはいくらになるのか?
なぜAPIの請求額が安く見えるのか
マネージド文字起こしサービスは、処理された音声の秒単位で料金を課します。例えばAssemblyAIは、非同期パイプラインを通過するコンテンツ1時間あたり、およそ0.15ドル〜0.21ドルを請求します。これらの数字には、多くの作業が隠されています。プロバイダーは推論ハードウェアの維持、ノイズの多い音声のクリーニング、話者の分離、エンティティ(クレジットカード番号、メールアドレス、認証コードなど)のフォーマット、結果のリアルタイムストリーミング、そして24時間365日のサービス監視を行っています。受け取る請求書は、これらすべてをまとめた、シンプルな秒単位の料金なのです。
GPUの価格が本当に意味すること
Whisper Large-v3は、単一のA100またはH100 GPUで動作可能です。クラウドプロバイダーは、これらのカードをオンデマンドで1時間あたり2ドル〜4ドルで提供しています。落とし穴は、チップがアイドル状態であっても、1時間分の料金を全額支払わなければならないことです。ワークロードがGPU容量の15%しか使用していない場合でも、2ドル〜4ドルの全額を負担することになります。
引き継ぐことになるエンジニアリング・デット
セルフホスティングは、モデルのチェックポイントを起動して終わりではありません。隠れた作業コストは、すぐに目に見えるハードウェアコストを上回ります。
- 話者分離(Speaker diarization) – オープンソースのWhisperは声を分離しません。信頼できる話者分離パイプラインを構築するには、別のモデル、データ、そして継続的なチューニングが必要です。
- ストリーミング対応 – Whisperはファイル全体を非同期で処理します。リアルタイムの字幕や音声エージェントの応答には、バックプレッシャー制御やレイテンシ監視を備えたカスタムストリーミング層が必要になります。
- エンティティのフォーマット – 生の文字起こしデータには、機密性の高い文字列をマスクしたり再フォーマットしたりするロジックが欠けています。クレジットカード番号、メールアドレス、またはOTP(ワンタイムパスワード)コードのルールを追加することは、決して容易なエンジニアリング作業ではなく、たった一つのタイポが文字起こしデータを使い物にならなくさせることもあります。
- 信頼性エンジニアリング – 1つのGPUで動作するデモを作るのは簡単ですが、本番サービスでは並行処理、リトライ、ダウンタイムなしのアップグレード、アラート通知などを管理しなければなりません。
セルフホスティングが実際に利益を生むケース
計算が逆転するのは、ごく限られたシナリオにおいてのみです。
- 大量かつ継続的なバッチ処理 – 数ヶ月間にわたってGPUの使用率をほぼ100%に維持できるほどの音声量がある場合、1時間あたりのハードウェア料金を膨大な文字起こし量に分散させることができ、音声1件あたりのコストをAPI料金よりも低く抑えられます。
- 厳格なデータプライバシー規制 – 音声データを社外に出すことを禁じる規制がある場合、コストに関わらず、処理をインハウスで行う必要があります。
- プロトタイピングのための完全なモデル制御 – Whisperのアーキテクチャやプロンプトを微調整したり、独自のデータでファインチューニングしたりする必要がある初期段階の実験では、チェックポイントを直接所有することにメリットがあります。
これらのケースを除けば、「無料」モデルは最も高価な項目となります。なぜなら、隠れたエンジニアリング・デットと、活用しきれていないGPUの時間が、APIの控えめな秒単位の料金をすぐに上回ってしまうからです。
まとめ: Whisperのライセンス料が無料であることは魅力的ですが、総所有コスト(TCO)には、GPUの価格、アイドル時間、そしてほとんどのチームがすでに文字起こしAPIにアウトソーシングしている一連のエンジニアリング作業が含まれます。ハードウェアをフル活用できる場合、データをオンプレミスで保持しなければならない場合、または深いモデル制御が必要な場合にのみ、セルフホスティングはより安価なルートとなります。そうでなければ、「無料」モデルは文字起こし予算の中で最も高価な部分になる可能性が高いでしょう。
