OpenAI 通过发布 GPT Transcribe 和 GPT Live Transcribe,正式扩展了其语音转文本能力。这些全新的 API 驱动模型旨在为批量处理和实时流式应用提供高速、高性价比的转录服务。

速度、精度与价格优化

这次新发布引入了两种不同的工作流:GPT Transcribe 专为处理预录制的音频文件而设计,而 GPT Live Transcribe 则针对低延迟的实时流式传输进行了优化。一项突出的技术成就在于 GPT Transcribe 的速度,其处理音频文件的速度比实时快约 34 倍。

在准确度方面,OpenAI 取得了重大进展。根据 Artificial Analysis 的 AA-WER 基准测试,GPT Transcribe 的词错率 (WER) 为 3.31%。这比其前身 GPT-4o Transcribe 提高了 0.7 个百分点。伴随准确度提升的是价格降低了 25%,新费率定为每分钟音频 0.0045 美元。为了增强上下文准确性,两种模型都支持包含文本上下文、特定关键词以及多种输入语言。

竞争格局:OpenAI 对阵巨头

尽管有所改进,但 OpenAI 在语音领域的霸权争夺战中仍处于激烈的竞争中,在纯准确度方面落后于专业的领先者。AA-WER 排名显示,OpenAI 3.31% 的错误率目前已被几家主要竞争对手超越:

  • ElevenLabs: 以其 Scribe v2 模型领跑行业,拥有卓越的 2.3% 错误率。
  • Google: 其 Gemini 3 Pro 模型紧随其后,错误率为 2.9%。
  • Mistral: Voxtral Small 模型凭借 3% 的错误率占据强势地位。

除了准确度之外,战场也正在转向价格竞争。Mistral 最近推出了 Voxtral Transcribe V2,起步价仅为极具竞争力的每分钟 0.003 美元,试图通过低价抢占市场。

与 OpenAI 生态系统的集成

这些转录模型并非独立工具,而是 OpenAI 更广泛的多模态战略的重要组成部分。它们旨在补充最近发布的 Realtime 模型系列,其中包括 GPT-Realtime-Whisper 模型。通过同时提供高速批量转录和低延迟实时流式传输,OpenAI 正致力于服务广泛的开发者群体——从构建自动化会议助手的开发者到创建实时翻译服务的开发者。

对于更广泛的 AI 领域而言,这一进展标志着从“不惜一切代价追求准确度”向速度、成本和精度之间更平衡的优化转变。虽然 OpenAI 可能并不拥有最低错误率的头衔,但其提供显著效率提升的能力使其成为生产级 AI 市场中一个强大的参与者。

核心要点

  • 性能提升: GPT Transcribe 将词错率降低至 3.31%,且音频处理速度比实时快 34 倍。
  • 成本效益: OpenAI 将转录价格削减了 25%,将成本降至每分钟 0.0045 美元。
  • 竞争压力: OpenAI 在准确度方面仍落后于 ElevenLabs (2.3% WER) 和 Google (2.9% WER),而 Mistral 在价格方面处于领先地位。

OpenAI 推出了两种全新的语音转文本 API——用于批量文件的 GPT Transcribe 和用于流式传输的 GPT Live Transcribe——承诺处理速度比实时快 34 倍,并将价格降低 25%,使成本降至每分钟 0.0045 美元。

此次发布正值开发者们竞相寻求转录服务之际,这些服务既要能跟上日益增长的音频数据集,又要能保持微薄的利润空间。

为什么这次升级至关重要

GPT Live Transcribe 增加了低延迟流式传输功能,这意味着开发者可以将实时麦克风信号输入 API,并几乎立即收到文本。两种模型都接受补充文本上下文、关键词提示和多语言输入,这有助于系统追踪特定领域的术语。

准确度也有所提高。Artificial Analysis 的 AA-WER 基准测试记录显示,GPT Transcribe 的词错率 (WER) 为 3.31%,比早期的 GPT-4o Transcribe 模型降低了 0.7 个百分点。虽然这在排行榜上不是最低的数值,但其差距小到许多生产流水线都可以接受,尤其是当速度提升转化为更低的计算账单时。

竞争态势

同一份 AA-WER 排名显示,有三家对手在纯错误率方面超过了 OpenAI:

  • ElevenLabs 的 Scribe v2 为 2.3%
  • Google 的 Gemini 3 Pro 为 2.9%
  • Mistral 的 Voxtral Small 为 3%

Mistral 最近推出的 Voxtral Transcribe V2 甚至在价格上低于 OpenAI,每分钟转录费用仅为 0.003 美元。这些数据体现了一个明确的权衡:开发者必须决定他们更看重的是最低的每分钟费率、最小的误差范围,还是 OpenAI 广泛生态系统所提供的集成便利性。

开发者能获得什么——以及会失去什么

速度与成本是核心优势。以前需要一整小时计算量的批处理任务现在完成得更快,从而为其他工作负载释放了 GPU 时间。与之前的定价相比,每分钟 0.0045 美元的费率也降低了十小时转录任务的成本;当规模扩大到数千小时时,这种节省虽然适度,但却是实实在在的。

生态系统协同效应是另一个卖点。新模型与 OpenAI 的多模态产品并列,包括最近发布的 Realtime 模型生成和 GPT-Realtime-Whisper。因此,只需一个 API 密钥即可驱动图像生成、聊天以及现在的快速转录,无需将不同的供应商拼凑在一起。对于已经嵌入 OpenAI 技术栈的团队来说,这种统一性降低了身份验证开销并简化了计费。

准确性的权衡仍然是主要关注点。在嘈杂或特定领域的音频中,3.31% 的 WER(词错率)仍意味着大约每三十个单词就会出现一个错误。对于医疗听写或法律转录等错误风险较高的应用,尽管成本更高,用户可能仍会倾向于选择 ElevenLabs 或 Google。虽然通过输入自定义关键词和上下文可以缩小这一差距,但这需要额外的工程投入。

更广泛的市场转变

OpenAI 的定价举措标志着其策略从“不惜一切代价追求准确性”转向速度、成本和精度更加平衡的公式。语音转文本市场传统上是分裂的:精品公司追求最低错误率,云巨头在规模上竞争,而新进入者则在价格上博弈。通过在提供可观错误率和极高吞吐量的同时压缩价格维度,OpenAI 迫使竞争对手重新审视自身的定价结构。

Mistral 极具攻击性的每分钟 0.003 美元定价已经给 OpenAI 带来了压力,迫使其保持费率的竞争力。拥有更大研究预算的 ElevenLabs 和 Google 可能会通过加强集成接口或将转录功能与其他高级服务捆绑来做出回应。接下来的几个季度可能会出现一波“按需付费”层级、批量折扣或面向开发者的友好型 SDK,旨在锁定长期使用量。

反方观点:当“最便宜”并不足够时

标题中的数据掩盖了一个对实际部署至关重要的细微差别。相比 GPT-4o,WER 降低了 0.7 个百分点确实很有意义,但绝对错误率仍落后于前三大竞争对手。对于开发那些转录错误会直接影响用户信任的产品(例如广播直播字幕或合规性关键日志)的开发者来说,选择错误率最低的模型可能比任何成本节省都更重要。

此外,速度优势取决于能否以高速率向 API 输入音频。受限于网络带宽或受限于边缘设备处理能力的项目可能无法实现完整的 34 倍速度提升,从而削弱了成本优势。在这些场景下,一个具有相当准确度的本地托管模型可能更具实用性,即使其每分钟的价格在账面上看起来更高。

后续关注点

  • 价格弹性: Mistral 低于 0.003 美元的费率会引发价格战,还是 OpenAI 会维持在 0.0045 美元?
  • 开发者采用指标: 来自 API 市场的早期使用数据将揭示是速度还是价格驱动了大部分流量。
  • 监管审查: 随着转录变得更加普及,数据隐私规则可能会影响哪些供应商在敏感行业中具有可行性。

总结

OpenAI 的 GPT Transcribe 和 GPT Live Transcribe 提供了一种罕见的组合:超快处理速度和显著的价格削减,这使得该公司成为那些看重速度和生态系统凝聚力、而非追求绝对最低错误率的开发者的极具成本效益的选择。