Khoảng cách giữa hội thoại giữa người với người và tương tác với AI đang dần thu hẹp, nhưng độ trễ vẫn là một rào cản lớn đối với sự nhập vai thực thụ. Smallest.ai đang giải quyết thách thức này bằng cách chuyển hướng từ các LLM khổng lồ, chậm chạp sang các mô hình giọng nói nhỏ, chuyên biệt và cực nhanh, được thiết kế để mô phỏng các mô hình nhận thức của con người.

Vượt qua độ trễ của các Mô hình Ngôn ngữ Lớn

Các tác nhân giọng nói AI hiện nay thường gặp phải sự chậm trễ theo kiểu "nhận lệnh rồi mới xử lý". Trong một quy trình LLM tiêu chuẩn, hệ thống sẽ đợi một đoạn âm thanh hoàn chỉnh, xử lý văn bản, sau đó mới tạo phản hồi. Như Sudarshan Kamath, người sáng lập kiêm CEO của Smallest.ai lưu ý, sự tạm dừng này là dấu hiệu rõ ràng cho thấy người dùng đang nói chuyện với một cỗ máy.

Cách tiếp cận của Smallest.ai mô phỏng đặc điểm thần kinh học của con người: vừa nghe, vừa suy nghĩ và vừa nói cùng một lúc. Mô hình giọng nói nhỏ độc quyền của họ được thiết kế để xử lý trí tuệ thời gian thực với độ trễ phản hồi gần như bằng không. Bằng cách tập trung vào các mô hình nhỏ, chuyên biệt thay vì các mô hình nền tảng khổng lồ, startup này đặt mục tiêu cho phép sự ngắt lời và luồng hội thoại tự nhiên, hướng tới việc "vượt qua bài kiểm tra Turing" thông qua tốc độ và sự tinh tế.

Kiến trúc Mô hình Kép cho Trí tuệ Doanh nghiệp

Smallest.ai đang đề xuất một tiêu chuẩn mới cho kiến trúc tác nhân AI. Thay vì ép buộc một mô hình lớn duy nhất phải xử lý mọi thứ, công ty ủng hộ một hệ thống hai tầng:

  1. Mô hình Giọng nói Nhỏ: Một lớp trí tuệ thời gian thực giúp quản lý các sắc thái hội thoại tức thời và trôi chảy, bao gồm cả giọng địa phương, các ngôn ngữ đa dạng và môi trường ồn ào.
  2. LLM "Ngoại tuyến": Một mô hình nền tảng lớn hơn chỉ được gọi đến khi truy vấn nằm ngoài phạm vi kiến thức chuyên biệt của mô hình nhỏ.

Khi mô hình nhỏ gặp phải một vấn đề phức tạp, nó sẽ mô phỏng một nhân viên thực thụ bằng cách tạm thời để người gọi "chờ" để nghiên cứu vấn đề thông qua LLM lớn hơn. Cách tiếp cận hybrid này đảm bảo trải nghiệm hội thoại vẫn liền mạch ngay cả khi cần đến khả năng lập luận cấp cao.

Định vị Thị trường và Bối cảnh Cạnh tranh

Với vòng gọi vốn Series A trị giá 13 triệu USD do Seligman Ventures dẫn đầu—nâng tổng số vốn huy động lên hơn 21 triệu USD—Smallest.ai đang định vị mình là cơ sở hạ tầng thiết yếu cho nền kinh tế AI giọng nói. Startup này không có ý định xây dựng các nền tảng hỗ trợ khách hàng toàn diện; thay vào đó, nó cung cấp lớp giọng nói chuyên biệt mà các công ty như RingCentral và Truecaller đang sử dụng.

Trong khi các đối thủ như ElevenLabs tập trung mạnh vào lồng tiếng âm thanh và podcast, và những bên khác như Cartesia hoặc Sarvam nhắm vào các thị trường ngách khu vực cụ thể, Smallest.ai lại tập trung tối đa vào các tác nhân hội thoại doanh nghiệp thời gian thực. Kamath lập luận rằng đối với các startup hỗ trợ khách hàng như Sierra và Decagon, việc hoàn thiện giọng nói độ trung thực cao, độ trễ thấp là một sự xao nhãng khỏi hoạt động kinh doanh cốt lõi của họ, khiến mô hình "plug-and-play" chuyên biệt của Smallest.ai trở thành một nhu cầu chiến lược.

Các điểm chính cần lưu ý

  • Hiệu quả chuyên biệt: Smallest.ai sử dụng các mô hình giọng nói nhỏ, chuyên dụng để đạt được độ trễ gần như bằng không, tránh được sự chậm trễ cố hữu của các LLM quy mô lớn truyền thống.
  • Trí tuệ lai: Công ty áp dụng chiến lược mô hình kép, sử dụng các mô hình nhỏ tốc độ cao để tương tác thời gian thực và các LLM lớn hơn cho các tác vụ lập luận sâu và phức tạp.
  • Tập trung vào cơ sở hạ tầng: Thay vì cạnh tranh trực tiếp với các nền tảng hỗ trợ khách hàng, Smallest.ai cung cấp lớp công nghệ giọng nói quan trọng giúp các tác nhân AI trở nên tự nhiên và giống con người hơn.

Kết luận

Khoản huy động 13 triệu USD của Smallest.ai sẽ tài trợ cho một stack AI giọng nói hai tầng được xây dựng chuyên dụng, đánh đổi tính vạn năng của các LLM khổng lồ để lấy tốc độ của các mô hình nhỏ, tập trung vào nhiệm vụ. Lời hứa là rất rõ ràng: làm cho các cuộc hội thoại AI cảm thấy tự nhiên như đang nói chuyện với con người bằng cách loại bỏ sự tạm dừng ngượng ngùng vốn đang định hình hầu hết các trợ lý giọng nói hiện nay. Liệu lợi ích có vượt xa chi phí kỹ thuật bổ sung hay không sẽ trở nên rõ ràng khi các doanh nghiệp bắt đầu tích hợp công nghệ này vào các luồng cuộc gọi thực tế.