Xiaomi đã ra mắt MiMo V2.5, một mô hình đa phương thức (multimodal) open-weight xử lý âm thanh, hình ảnh và video dưới dạng các token gốc (native tokens) và cung cấp cửa sổ ngữ cảnh (context window) lên tới 1,05 triệu token. Bảng giá niêm yết 0,14 USD cho mỗi triệu token đầu vào và 0,28 USD cho mỗi triệu token đầu ra, một cấu trúc chi phí cho phép thực hiện các cuộc họp dài hoặc các luồng video trong một câu lệnh (prompt) duy nhất.

Tại sao “open-weight” lại quan trọng

Hầu hết các AI đa phương thức hiện nay đều kết hợp các thành phần đầu vào riêng biệt: một công cụ chuyển đổi giọng nói thành văn bản (speech-to-text), một mô hình chú thích hình ảnh (image-captioning), sau đó đưa văn bản kết quả vào một mô hình ngôn ngữ lớn (LLM). LLM không bao giờ nhìn thấy dạng sóng thô hay dữ liệu pixel, vì vậy các sắc thái như tông giọng, khoảng nghỉ hoặc cử chỉ có thể bị mất đi. Xiaomi khẳng định MiMo V2.5 tiếp nhận âm thanh và video trực tiếp, giúp bảo toàn thời gian, ngữ điệu và các tín hiệu thị giác. Về lý thuyết, điều này cho phép mô hình phát hiện một tiếng thở dài trong cuộc gọi, theo dõi một bản phác thảo trên bảng trắng, hoặc phân biệt các người nói đang nói đè lên nhau mà không cần bước chuyển soạn (transcription) trung gian.

Vì các trọng số (weights) của mô hình được phát hành công khai, các tổ chức có thể tải xuống và chạy trực tiếp tại chỗ (on-premise). Điều này giúp tránh được thông lệ gửi dữ liệu đa phương tiện thô đến các API đám mây, một bước mà nhiều lĩnh vực bị kiểm soát chặt chẽ—như y tế và tài chính—thường miễn cưỡng hoặc bị cấm thực hiện.

Các thông số kỹ thuật chính

  • Cửa sổ ngữ cảnh: 1,05 triệu token, đủ để chứa một cuộc họp kéo dài nhiều giờ hoặc một bộ phim tài liệu đầy đủ trong một yêu cầu.
  • Giá cả: 0,14 USD cho mỗi triệu token đầu vào, 0,28 USD cho mỗi triệu token đầu ra.
  • Các phương thức (Modalities): Âm thanh, hình ảnh, video, cùng với xử lý văn bản tiêu chuẩn.

Cửa sổ ngữ cảnh lớn chính là điểm nhấn đáng chú ý nhất. Các LLM truyền thống thường bị giới hạn ở mức vài nghìn token, buộc các nhà phát triển phải chia nhỏ các bản ghi âm dài hoặc cắt video thành các đoạn ngắn. Với MiMo V2.5, một câu lệnh duy nhất có thể chứa đựng một cuộc họp kéo dài nhiều giờ mà không cần phải chia nhỏ nó.

Cái nhìn thực tế về công cụ văn bản

Mặc dù các quy trình âm thanh và video chưa được kiểm thử độc lập (benchmarked), lõi văn bản đã vượt qua một bài kiểm tra nhanh (sanity check):

  • Lập trình: Mô hình đã giải quyết bài toán kinh điển “merge intervals” (hợp nhất các khoảng) và tạo ra một thuật toán có độ phức tạp O(n log n), cho thấy nó có thể hiểu được các ràng buộc thuật toán.
  • Suy luận: Nó đã trả lời một bài toán đố toán học nhiều bước bằng bốn phép tính rõ ràng, chứng minh khả năng suy luận theo chuỗi (chain-of-thought).
  • Đầu ra có cấu trúc: Khi được cung cấp mô tả hình ảnh hóa đơn, nó đã xuất ra một đối tượng JSON được định dạng chính xác với các hạng mục, tổng số và ngày tháng.

Một nền tảng văn bản vững chắc là rất quan trọng vì cùng một kiến trúc transformer làm nền tảng cho các luồng đa phương thức. Nếu khía cạnh ngôn ngữ gặp trục trặc, khả năng kết hợp các tín hiệu âm thanh hoặc video của mô hình sẽ bị hạn chế.

Các trường hợp sử dụng ưu tiên quyền riêng tư

Các doanh nghiệp bắt buộc phải lưu trữ dữ liệu đa phương tiện thô nội bộ giờ đây có thể hình dung về một hệ thống tự lưu trữ (self-hosted) duy nhất cho:

  • Trí tuệ cuộc họp: Tóm tắt, trích xuất các hạng mục cần thực hiện (action-item), xác định người nói và phân tích cảm xúc mà không cần gửi bản ghi âm đến dịch vụ bên thứ ba.
  • Phân tích cuộc gọi: Phát hiện căng thẳng, sự thất vọng hoặc các từ khóa liên quan đến tuân thủ trong thời gian thực.
  • Giao diện giọng nói: Xây dựng các chatbot hiểu được tông giọng và có thể phản hồi với ngữ điệu phù hợp.
  • Phân tích video: Nhận diện cử chỉ, thay đổi slide hoặc các hình vẽ trên màn hình trong các buổi hội thảo trực tuyến (webinar).

Việc thay thế ba giải pháp từ các nhà cung cấp riêng biệt bằng một mô hình duy nhất giúp cắt giảm chi phí tích hợp và giảm thiểu các điểm rò rỉ dữ liệu.

Những lưu ý và điều cần xác minh

Các khả năng về âm thanh và video hiện vẫn chỉ là tuyên bố từ nhà sản xuất; chưa có các phép đo lường độc lập nào được công bố. Những bên có ý định áp dụng nên tự thực hiện các bài kiểm thử (benchmarks) trên các bộ dữ liệu tiêu biểu trước khi triển khai vào các khối lượng công việc thực tế (production workloads).

Giá cả, mặc dù minh bạch, nhưng được tính trên mỗi token.

Những điều cần theo dõi tiếp theo

  • Công bố các bài kiểm thử (Benchmark): Các đánh giá từ bên thứ ba về chất lượng mã hóa token âm thanh/video, độ trễ và mức chiếm dụng bộ nhớ.
  • Hệ sinh thái công cụ: Các bộ chuyển đổi (adapters) mã nguồn mở cho các codec âm thanh và định dạng video phổ biến để nạp trực tiếp vào MiMo V2.5.
  • Phản hồi từ các cơ quan quản lý: Liệu các cơ quan quản lý quyền riêng tư dữ liệu có coi các mô hình open-weight tự lưu trữ là một biện pháp bảo vệ đầy đủ so với các API đám mây hay không.
  • Đóng góp từ cộng đồng: Vì các trọng số được công khai, cộng đồng có thể tinh chỉnh (fine-tune) mô hình cho các lĩnh vực chuyên biệt (ví dụ: đọc chẩn đoán y tế, lấy lời khai pháp lý).

MiMo V2.5 đưa cuộc thảo luận từ khái niệm “chất keo đa phương thức” lên tầm “bộ não đa phương thức” có khả năng vận hành sau tường lửa của doanh nghiệp. Bản chất open-weight của nó giúp hạ thấp rào cản đối với các tổ chức nhạy cảm về quyền riêng tư, tuy nhiên độ trung thực của âm thanh/video như đã hứa vẫn cần được kiểm chứng. Cho đến khi các thử nghiệm độc lập xác nhận những tuyên bố này, ưu điểm lớn nhất của mô hình vẫn là cửa sổ ngữ cảnh khổng lồ và khả năng hợp nhất nhiều dịch vụ AI vào một ngăn xếp (stack) tự lưu trữ duy nhất.