Anthropic mở rộng chế độ giọng nói của Claude cho các mô hình Opus và Sonnet

Anthropic đã nâng cấp đáng kể khả năng hội thoại của mình bằng cách đưa chế độ giọng nói của Claude lên các mô hình suy luận tiên tiến nhất. Sự mở rộng này chuyển đổi tính năng từ một tiện ích cơ bản thành một trợ lý thông minh cao, có khả năng xử lý các tác vụ phức tạp trên các nền tảng di động, máy tính để bàn và web.

Tăng cường sức mạnh giọng nói với trí tuệ của Opus và Sonnet

Trước đây, chế độ giọng nói của Claude chỉ giới hạn ở mô hình Haiku nhẹ, vốn ưu tiên tốc độ hơn là khả năng suy luận sâu. Trong một bước chuyển đổi kiến trúc lớn, Anthropic hiện cho phép người dùng thực hiện các tương tác bằng giọng nói trên các mô hình chủ lực Opus và Sonnet. Điều này có nghĩa là thay vì các tương tác điều khiển và ra lệnh đơn giản, người dùng có thể tham gia vào việc động não (brainstorming) cấp độ cao, giải quyết các vấn đề phức tạp và suy luận sắc bén chỉ bằng giọng nói của mình.

Quan trọng hơn, Anthropic đã giới thiệu tính linh hoạt về mô hình, cho phép người dùng chuyển đổi giữa các mô hình khác nhau ngay trong cuộc hội thoại. Điều này tạo ra một quy trình làm việc liền mạch, nơi người dùng có thể bắt đầu một tác vụ với một mô hình nhanh và sau đó chuyển sang Opus có khả năng cao hơn để tinh chỉnh một khái niệm phức tạp, tất cả mà không cần rời khỏi giao diện giọng nói.

Hỗ trợ đa ngôn ngữ và Tích hợp công cụ

Chế độ giọng nói được cập nhật không chỉ là một cải tiến cục bộ mà mang tính toàn cầu, hỗ trợ mười một ngôn ngữ khác nhau. Tuy nhiên, điểm khác biệt thực sự của Anthropic nằm ở khả năng kết nối hệ sinh thái. Không giống như nhiều đối thủ cạnh tranh chỉ tập trung vào sự trôi chảy trong hội thoại, Claude đang hướng mạnh mẽ vào hành vi "agentic" (tính tự chủ) thông qua việc tích hợp công cụ.

Người dùng có thể cấp quyền cho Claude truy cập vào các công cụ năng suất bên ngoài như Gmail, Google Calendar và Slack. Điều này cho phép trải nghiệm rảnh tay với chức năng cao: người dùng có thể đọc lời một bản cập nhật dự án phức tạp, yêu cầu Claude tóm tắt nó, sau đó ra lệnh cho AI soạn và gửi email qua Gmail. Anthropic hiện đang nắm giữ lợi thế cạnh tranh trong phân khúc cụ thể này, là nhà cung cấp duy nhất cho phép người dùng soạn và lưu email trực tiếp từ giao diện âm thanh.

Bối cảnh cạnh tranh: Claude đối đầu với OpenAI và Google

Sự tiến hóa của AI giọng nói hiện đang là cuộc đua ba bên giữa Anthropic, OpenAI và Google, mỗi bên theo đuổi một cách tiếp cận kỹ thuật khác nhau. GPT-Live của OpenAI sử dụng âm thanh full-duplex, cho phép nó vừa nghe vừa nói đồng thời để tạo ra luồng hội thoại giống con người hơn. Gemini Live của Google cũng theo đuổi triết lý tương tự nhưng phần lớn vẫn bị giới hạn trong môi trường điện thoại thông minh.

Ngược lại, Claude sử dụng hệ thống dựa trên lượt (turn-based), nơi mô hình sẽ đợi người dùng nói xong trước khi phản hồi. Mặc dù điều này có thể mang lại cảm giác ít "trôi chảy" hơn một chút so với các mô hình full-duplex, Anthropic đang đặt cược rằng tính hữu dụng sẽ chiến thắng sự mô phỏng hội thoại thuần túy. Bằng cách tập trung vào việc tích hợp khả năng suy luận của LLM với các công cụ phần mềm thực tế, Claude đang dần thoát khỏi vai trò của một chatbot đơn thuần để trở thành một đại lý năng suất được kích hoạt bằng giọng nói.

Những điểm chính cần lưu ý

  • Nâng cấp mô hình: Chế độ giọng nói của Claude không còn bị giới hạn ở Haiku; hiện tại nó đã hỗ trợ các mô hình Opus và Sonnet đầy năng lực trên web, máy tính để bàn và di động.
  • Trí tuệ có khả năng thực thi: Anthropic tạo nên sự khác biệt thông qua việc tích hợp công cụ sâu rộng, cho phép người dùng quản lý Gmail, Google Calendar và Slack thông qua các lệnh bằng giọng nói.
  • Chuyển hướng chiến lược: Trong khi OpenAI dẫn đầu về sự "tự nhiên" trong hội thoại thông qua âm thanh full-duplex, Anthropic lại tập trung vào tính hữu dụng "agentic" của các quy trình làm việc được điều khiển bằng giọng nói.