Anthropic 将 Claude 的语音模式扩展至 Opus 和 Sonnet 模型
Anthropic 通过将其最先进的推理模型引入 Claude 的语音模式,显著提升了其对话能力。此次扩展使该功能从基础工具转型为高智能助手,能够在移动端、桌面端和网页端处理复杂任务。
以 Opus 和 Sonnet 的智能驱动语音功能
此前,Claude 的语音模式仅限于轻量级的 Haiku 模型,该模型更注重速度而非深度推理。在一次重大的架构转变中,Anthropic 现在允许用户在其旗舰级的 Opus 和 Sonnet 模型上进行语音交互。这意味着用户不再仅仅进行简单的指令控制交互,而是可以通过语音进行高水平的头脑风暴、复杂的决策解决以及细致入微的推理。
至关重要的是,Anthropic 引入了模型灵活性,允许用户在对话过程中切换不同的模型。这实现了一种无缝的工作流:用户可以先用快速模型开始一项任务,然后切换到能力更强的 Opus 来完善复杂的概念,而这一切都无需离开语音界面。
多语言支持与工具集成
更新后的语音模式不仅是局部改进,更是全球性的提升,支持 11 种不同的语言。然而,Anthropic 真正的差异化优势在于其生态系统的连接性。与许多仅专注于对话流畅度的竞争对手不同,Claude 正通过工具集成深度转向“智能体”(agentic)行为。
用户可以授权 Claude 访问外部生产力工具,如 Gmail、Google Calendar 和 Slack。这实现了一种功能强大的免提体验:用户可以口述复杂的项目更新,要求 Claude 进行总结,然后命令 AI 通过 Gmail 撰写并发送电子邮件。Anthropic 目前在该特定细分领域保持着竞争优势,是唯一一家允许用户直接从音频界面撰写并保存电子邮件的服务商。
竞争格局:Claude 对阵 OpenAI 和 Google
语音 AI 的演进目前是 Anthropic、OpenAI 和 Google 之间的三方竞赛,每家公司都采取了不同的技术路径。OpenAI 的 GPT-Live 利用全双工音频技术,使其能够同时进行听和说,从而实现更接近人类的对话流。Google 的 Gemini Live 也遵循类似的理念,但很大程度上仍局限于智能手机环境。
相比之下,Claude 使用的是基于轮次的系统,模型会在等待用户说完话后再做出响应。虽然这可能感觉比全双工模型稍欠“流畅”,但 Anthropic 正押注于实用性将战胜纯粹的对话模仿。通过专注于将 LLM 推理与现实世界的软件工具相结合,Claude 正在摆脱单纯聊天机器人的身份,向语音驱动的生产力智能体转型。
核心要点
- 模型升级: Claude 的语音模式不再局限于 Haiku;它现在在网页、桌面和移动端均支持能力强大的 Opus 和 Sonnet 模型。
- 可执行的智能: Anthropic 通过深度的工具集成脱颖而出,允许用户通过语音命令管理 Gmail、Google Calendar 和 Slack。
- 战略转型: 虽然 OpenAI 通过全双工音频在对话的“自然度”方面处于领先地位,但 Anthropic 正专注于语音驱动工作流的“智能体”实用性。
