Xiaomi đã ra mắt MiMo-V2.5, một mô hình đa phương thức (multimodal) open-weight xử lý âm thanh, hình ảnh và video dưới dạng các token gốc (native tokens). Mô hình này cung cấp cửa sổ ngữ cảnh (context window) lên tới 1.050.000 token với mức giá dùng bao nhiêu trả bấy nhiêu là 0,14 USD cho mỗi triệu token đầu vào và 0,28 USD cho mỗi triệu token đầu ra, hướng tới các tổ chức có nhu cầu sử dụng AI xử lý dữ liệu truyền thông lớn tại chỗ (on-premise).

Tại sao cách tiếp cận đa phương thức mới lại quan trọng

Hầu hết các hệ thống đa phương thức hiện nay đều "đi đường tắt". Đầu tiên, chúng chạy một công cụ chuyển đổi giọng nói thành văn bản (speech-to-text), sau đó là một mô hình thị giác để chuyển hình ảnh thành chú thích, và cuối cùng đưa văn bản thu được vào một mô hình ngôn ngữ lớn (LLM). LLM không bao giờ nhìn thấy sóng âm hoặc dữ liệu pixel gốc, vì vậy các sắc thái như một tiếng thở dài, một khoảng dừng, một sự co cơ mặt hay một cử chỉ tay đều biến mất. MiMo-V2.5 bỏ qua bước trung gian này: nó tiếp nhận âm thanh và video trực tiếp dưới dạng các "token", giúp bảo toàn nhịp điệu, tông giọng và các tín hiệu hình ảnh mà bản ghi chép (transcript) không thể nắm bắt được.

Thông số kỹ thuật

  • Cửa sổ token: 1.050.000 token – đủ để tiếp nhận các bản ghi cuộc họp kéo dài nhiều giờ mà không cần phải chia nhỏ thành từng đoạn.
  • Tự lưu trữ (Self-hosting): Triển khai mô hình trên máy chủ riêng của công ty, đảm bảo dữ liệu truyền thông gốc không bao giờ rời khỏi cơ sở.
  • Giá cả: 0,14 USD cho mỗi triệu token đầu vào, 0,28 USD cho mỗi triệu token đầu ra – một mức chi phí minh bạch và thay đổi theo mức độ sử dụng.

Trong một bài kiểm tra nhanh (sanity check) phần lõi chỉ văn bản, mô hình đã giải quyết một bài toán lập trình hợp nhất các khoảng (merge-interval) kinh điển với thuật toán O(n log n) như mong đợi, tính toán từng bước một bài toán toán học về tốc độ đổ đầy bình chứa, và trích xuất một JSON payload từ một hóa đơn mà không gặp lỗi. Các luồng xử lý (pipeline) âm thanh và video không được thực hiện trong bài kiểm tra đó.

Những đối tượng nào sẽ được hưởng lợi

Các ngành công nghiệp yêu cầu tính bảo mật cao như y tế và tài chính không thể gửi âm thanh hoặc video gốc đến các API của bên thứ ba. Bằng cách giữ dữ liệu bên trong tường lửa, MiMo-V2.5 cho phép các tổ chức này tuân thủ các quy định bảo vệ dữ liệu trong khi vẫn thu được những thông tin chuyên sâu nhờ AI. Các ứng dụng tiềm năng bao gồm:

  • Trí tuệ cuộc họp: Phân tích toàn bộ video ghi hình để làm nổi bật các quyết định, các hạng mục cần thực hiện và cảm xúc của người nói mà không cần qua giai đoạn chuyển soạn văn bản riêng biệt.
  • Phân tích trung tâm cuộc gọi: Phát hiện sự thất vọng, do dự hoặc sự tự tin trong giọng nói của người gọi theo thời gian thực.
  • Trợ lý trên thiết bị: Xây dựng các giao diện giọng nói có khả năng hiểu tông giọng và phản ứng với các tín hiệu phi ngôn ngữ mà không cần gửi âm thanh lên đám mây.

Những rào cản thực tế

Lời hứa của MiMo-V2.5 phụ thuộc vào hiệu suất của các bộ mã hóa (encoder) âm thanh và video – những thành phần mà tác giả vẫn chưa thực hiện đánh giá chuẩn (benchmark). Các doanh nghiệp phải xác thực độ trễ, độ chính xác và mức tiêu thụ phần cứng trên các tập dữ liệu của riêng họ trước khi đưa vào vận hành chính thức. Những đội ngũ chỉ cần văn bản có lẽ sẽ thấy một mô hình nhỏ hơn, chỉ chuyên về văn bản sẽ hiệu quả hơn về cả tính toán lẫn chi phí. Bản chất open-weight của MiMo-V2.5 có nghĩa là mã nguồn và trọng số (weights) được cung cấp công khai; điều này cho phép tùy chỉnh sâu nhưng cũng đòi hỏi chuyên môn nội bộ để duy trì và bảo mật hệ thống (stack).

Kết luận

MiMo-V2.5 cung cấp khả năng mã hóa token truyền thông gốc, cửa sổ ngữ cảnh khổng lồ và khả năng tự lưu trữ với chi phí trên mỗi token rõ ràng. Đối với các tổ chức nhạy cảm về quyền riêng tư, những đơn vị phải giữ âm thanh và video gốc tại nội bộ, đây là một lộ trình thử nghiệm khả thi. Giá trị thực tế sẽ phụ thuộc vào việc các bộ mã hóa âm thanh và video hoạt động như thế nào dưới khối lượng công việc của doanh nghiệp và liệu chi phí vận hành của việc tự lưu trữ có phù hợp với kỹ năng của các đội ngũ AI hiện có hay không.