Whisper 对比 API:当“免费”模型变成最昂贵的开支项

你的团队看到了 AssemblyAI 的账单。有人问:“为什么不直接自己托管 Whisper 来省钱呢?”

这听起来很简单。下载一个检查点(checkpoint),运行一个命令,一个下午就能搞定。

但真正的问题是:在接下来的两年里,运行该端点的成本是多少?

为什么 API 账单看起来很便宜

托管转录服务按处理音频的秒数计费。例如,AssemblyAI 对通过其异步流水线处理的每小时内容收取约 0.15 – 0.21 美元。这些数字背后隐藏了大量工作:服务商负责维护推理硬件、清洗噪音频频、区分发言人、格式化实体(信用卡号、电子邮件、验证码)、实时流式传输结果,并进行 24/7 全天候服务监控。你收到的发票是所有这些工作的总和,被打包成了一个简单的按秒计费率。

GPU 价格的真实含义

Whisper Large-v3 可以在单个 A100 或 H100 GPU 上运行。云服务商提供的按需实例价格约为每小时 2 – 4 美元。问题在于,即使芯片处于闲置状态,你仍需支付全额小时费用。如果你的工作负载仅使用了 GPU 容量的 15%,你仍然要承担完整的 2 – 4 美元费用。

你将继承的工程债务

自托管并不仅仅止于启动一个模型检查点。隐藏的工作很快就会超过显眼的硬件成本。

  • 说话人日志 (Speaker diarization) – 开源的 Whisper 无法区分不同的声音。构建一个可靠的日志流水线需要单独的模型、数据和持续的调优。
  • 流式传输支持 – Whisper 是异步处理整个文件的。实时字幕或语音代理响应需要一个自定义的流式传输层,并配备背压处理(back-pressure handling)和延迟监控。
  • 实体格式化 – 原始转录文本缺乏掩码(mask)或重新格式化敏感字符串的逻辑。为信用卡号、电子邮件地址或 OTP 验证码添加规则是一项不容忽视的工程工作,一个微小的错误就可能导致转录文本无法使用。
  • 可靠性工程 – 在单个 GPU 上运行演示程序很容易;但生产级服务必须处理并发、重试、零停机升级和告警。

什么时候自托管才真正划算

只有在少数特定场景下,情况才会发生反转:

  • 重度、持续的批处理 – 如果你有足够的音频,能让 GPU 连续数月保持接近 100% 的利用率,那么每小时的硬件费用就可以分摊到海量的转录任务中,从而使单条音频的成本低于 API 费率。
  • 严格的数据隐私要求 – 禁止音频离开本地环境的法规会迫使你无论成本如何都必须在内部进行处理。
  • 原型设计所需的完全模型控制权 – 在早期实验阶段,如果需要调整 Whisper 的架构、提示词(prompts)或在私有数据上进行微调,直接拥有检查点会非常有益。

除此之外,由于隐藏的工程债务和利用率不足的 GPU 时间会迅速超过微薄的 API 按秒计费,这个“免费”模型反而会变成最昂贵的开支项。

核心结论: Whisper 的零授权费确实诱人,但总拥有成本(TCO)包括 GPU 价格、闲置时间以及一系列大多数团队已经外包给转录 API 的工程任务。只有当你能够充分利用硬件、必须将数据保留在本地,或者需要深度的模型控制权时,自托管才会成为更便宜的选择。否则,“免费”模型很可能成为你转录预算中最昂贵的部分。