Các trợ lý giọng nói từ lâu đã phải chịu đựng một giới hạn đầy hạn chế. Bạn có thể hỏi chúng về thời tiết, đặt báo thức hoặc phát một danh sách nhạc. Nhưng ngay khi cuộc hội thoại chuyển sang thứ gì đó phức tạp—như gỡ lỗi mã nguồn, cấu trúc một thỏa thuận kinh doanh, hay kiểm tra sức chịu đựng của một chiến lược sản phẩm—sự tương tác sẽ lập tức đổ vỡ. Trợ lý có thể nghe đúng ý bạn, nhưng nó thiếu chiều sâu suy luận để cùng bạn tư duy thấu đáo về vấn đề.
Anthropic đang cố gắng khắc phục điều đó. Công ty đã mở rộng chế độ giọng nói của Claude từ mô hình Haiku ở cấp độ cơ bản lên các hệ thống mạnh mẽ nhất của họ là Opus và Sonnet. Bước đi này báo hiệu một điều gì đó thú vị hơn là một đợt triển khai tính năng đơn thuần. Anthropic đang đặt cược rằng những công việc nghiêm túc có thể được thực hiện thông qua hội thoại bằng lời nói, chứ không chỉ qua bàn phím.
Tại sao Giọng nói cần Năng lực Tư duy
Trước đây, chế độ giọng nói của Claude chỉ chạy duy nhất trên Haiku. Mô hình đó ưu tiên tốc độ và độ trễ thấp. Đối với các câu hỏi nhanh—"Thủ đô của Estonia là gì?" hoặc "Tóm tắt email này giúp tôi?"—sự đánh đổi đó là hợp lý. Haiku đưa ra câu trả lời rất nhanh. Nhưng Anthropic nhận thấy người dùng liên tục đẩy tính năng này lên mức cao hơn khả năng xử lý của Haiku. Mọi người cố gắng sử dụng giọng nói cho các công việc có tính chuyên môn cao, và mô hình thường không đáp ứng được kiểu suy luận chuyên sâu mà các tác vụ đó yêu cầu.
Việc đưa Opus và Sonnet vào cuộc chơi sẽ thay đổi hoàn toàn bản chất của cuộc hội thoại. Những mô hình này là những công cụ chủ lực của Anthropic cho các tác vụ nhận thức khó. Opus, mô hình hàng đầu, đảm nhận việc phân tích tỉ mỉ, các chuỗi suy luận kéo dài và tổng hợp sáng tạo. Sonnet nằm ở giữa, cung cấp khả năng suy luận mạnh mẽ với tốc độ nhanh hơn Opus. Khi có thêm lớp giọng nói, giờ đây bạn có thể thảo luận về một kiến trúc kỹ thuật phức tạp hoặc một mô hình tài chính tinh vi và kỳ vọng AI sẽ theo dõi được logic, phát hiện các điểm mâu thuẫn và phản biện bằng các câu hỏi liên quan.
Suy nghĩ thành lời
Sự khác biệt nằm ở chất lượng. Với giọng nói của Haiku, sự tương tác mang tính giao dịch: Bạn hỏi; nó trả lời. Với Opus và Sonnet, sự tương tác trở thành sự cộng tác.
Hãy tưởng tượng bạn là một quản lý sản phẩm đang lái xe về nhà. Bạn đọc một ý tưởng còn đang dang dở về quy trình làm quen người dùng (onboarding) mới. Thay vì nhận được một câu trả lời chung chung kiểu "Điều đó thật thú vị", Claude Sonnet sẽ bắt đầu thăm dò. Nó hỏi liệu bạn đã xem xét các trường hợp biên (edge cases) cho người dùng doanh nghiệp hay chưa. Nó rút ra sự tương đồng với các mô hình onboarding mà nó đã thấy trong các bối cảnh khác. Đến khi bạn về tới lối vào nhà, bạn đã kiểm tra được sức chịu đựng của ý tưởng đó từ ba góc độ mà trước đó bạn chưa từng nghĩ tới.
Hoặc hãy hình dung một kỹ sư đang khắc phục sự cố lỗi hệ thống phân tán trong khi đang xem nhật ký (logs) trên màn hình thứ hai. Khi nói chuyện với Claude Opus, cô ấy có thể mô tả các triệu chứng bằng ngôn ngữ bình dân, đọc to các thông báo lỗi và thảo luận về các giả thuyết mà không cần dừng lại để gõ phím. Mô hình theo dõi mạch hội thoại qua nhiều lượt trao đổi, ghi nhớ những hướng nào đã được loại trừ và đề xuất các thay đổi cấu hình dựa trên quá trình chẩn đoán đang diễn tiến. Đây không phải là một bản ghi chép có gắn kèm công cụ tìm kiếm. Đây là quá trình suy luận được thực hiện trong thời gian thực thông qua lời nói.
Từ Nói sang Làm
Có lẽ sự thay đổi đáng kể nhất là các mô hình tiên tiến này có thể hành động, chứ không chỉ đơn thuần là trò chuyện. Anthropic đang định nghĩa chế độ giọng nói được cập nhật này như một giao diện có tính tác nhân (agentic interface). Vì Opus và Sonnet sở hữu năng lực suy luận để diễn giải ý định một cách chính xác, chúng có thể chuyển đổi một cuộc hội thoại bằng lời nói thành các kết quả cụ thể.
Ví dụ mà Anthropic đưa ra rất đơn giản nhưng đầy sức thuyết phục. Một người dùng thảo luận về một ý tưởng kinh doanh qua giọng nói, sau đó bảo Claude chuyển cuộc trò chuyện lan man đó thành một bản thuyết trình (pitch) một trang có cấu trúc. Mô hình sẽ phân tích đoạn hội thoại không cấu trúc, xác định tuyên bố giá trị cốt lõi, đối tượng mục tiêu và các giả định tài chính, sau đó tạo ra một tài liệu được định dạng sẵn. Không cần gõ lại. Không cần sao chép nhật ký chat vào một mẫu riêng biệt.
Lớp tính năng tác nhân này còn mở rộng sang các công cụ năng suất. Anthropic đang kết nối trải nghiệm giọng nói với Gmail, Slack và Canva. Điều đó có nghĩa là bạn có thể đọc một bản tóm tắt dự án cho Claude, yêu cầu nó tạo bộ slide thuyết trình trong Canva, gửi một bản tóm tắt vào kênh Slack của nhóm và soạn bản email theo dõi trong Gmail—tất cả chỉ từ một phiên nói chuyện duy nhất. Mô hình trở thành một người điều phối, chuyển đổi ý định bằng lời nói thành các hành động trên các ứng dụng riêng biệt.
Chuyển đổi linh hoạt mà không mất mạch suy nghĩ
Anthropic cũng đã thiết kế trải nghiệm này nhằm phá bỏ rào cản giữa các chế độ tương tác khác nhau. Giờ đây, người dùng có thể chuyển đổi linh hoạt giữa văn bản và giọng nói trong cùng một cuộc hội thoại mà không làm mất đi ngữ cảnh. Bạn có thể bắt đầu nhập một truy vấn kỹ thuật tại bàn làm việc, chuyển sang giọng nói khi đang đi bộ đến cuộc họp, sau đó quay lại dùng văn bản để dán một đoạn mã.
Hệ thống cũng cho phép chuyển đổi giữa các cấp độ mô hình ngay giữa chừng. Nếu bạn bắt đầu một buổi động não thân mật với Haiku — tận dụng các phản hồi nhanh chóng của nó — bạn có thể nâng cấp cuộc hội thoại lên Opus khi thảo luận chuyển sang việc thực thi kỹ thuật khắt khe. Ngữ cảnh sẽ được chuyển sang. AI sẽ ghi nhớ những gì bạn đã nói ba lượt trước, bất kể bạn đã nhập hay nói, hoặc bất kể bạn đang trò chuyện với mô hình tốc độ cao hay mô hình chuyên sâu.
Sự linh hoạt này rất quan trọng vì công việc thực tế hiếm khi diễn ra theo đường thẳng. Một số vấn đề cần tốc độ; số khác lại cần chiều sâu. Việc xây dựng một giao diện duy nhất nơi người dùng có thể chuyển đổi giữa các chế độ đó giúp giảm bớt gánh nặng nhận thức. Nó ngăn chặn sự phiền toái khi phải mở các tab mới, sao chép các câu lệnh hoặc phải giải thích lại ngữ cảnh.
Nói các ngôn ngữ trên thế giới
Sự mở rộng này không chỉ giới hạn ở những người nói tiếng Anh. Anthropic đã kết thúc giai đoạn thử nghiệm (beta) chỉ dành riêng cho tiếng Anh, bổ sung hỗ trợ chính thức cho chín ngôn ngữ khác:
- Các ngôn ngữ châu Âu: tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Tây Ban Nha và tiếng Bồ Đào Nha.
- Các ngôn ngữ châu Á: tiếng Hindi, tiếng Indonesia, tiếng Nhật và tiếng Hàn.
Đây không đơn thuần là một bước kiểm tra tính bản địa hóa. Khả năng hỗ trợ giọng nói với tư duy cao bằng tiếng Hàn hoặc tiếng Hindi sẽ thay đổi đối tượng có thể sử dụng các công cụ này cho công việc chuyên môn. Một nhà sáng lập startup tại Jakarta có thể dùng giọng nói để soạn thảo bản cập nhật cho nhà đầu tư bằng tiếng Indonesia. Một nhà phân tích sản xuất tại Turin có thể truy vấn dữ liệu chuỗi cung ứng bằng tiếng Ý. Sức mạnh nhận thức của Opus trở nên dễ tiếp cận với bất kỳ ai có tư duy tự nhiên bằng tiếng mẹ đẻ hơn là tiếng Anh.
Trong thị trường rộng lớn hơn của các trợ lý AI, việc triển khai đa ngôn ngữ này — kết hợp với khả năng lập luận của các mô hình hàng đầu — sẽ làm sắc bén thêm lợi thế cạnh tranh của Claude. Hầu hết các trợ lý giọng nói trong lịch sử thường coi các thị trường ngoài tiếng Anh là yếu tố phụ, chỉ thêm lớp dịch thuật vào các khả năng lập luận nông cạn. Anthropic dường như đang đặt cược rằng người dùng toàn cầu muốn có cùng một chiều sâu tư duy trong ngôn ngữ của chính họ như những gì người nói tiếng Anh kỳ vọng.
