Alibaba vừa công bố Qwen3.8-Max, một mô hình Mixture-of-Experts (MoE) với 2,4 nghìn tỷ tham số, đạt tỷ lệ thành công 86,1% trên bộ tiêu chuẩn OSWorld-Verified—Alibaba cho biết điểm số này vượt qua GPT-5.6, Sol Max và Fable 5. Bộ tiêu chuẩn này đo lường khả năng tương tác với hệ điều hành, cài đặt phần mềm và gỡ lỗi mã nguồn của AI, một tập hợp các kỹ năng nền tảng cho các tác nhân kỹ thuật phần mềm tự hành (autonomous software-engineering agents).

Cuộc đua hướng tới các tác nhân tự hành

Các mô hình ngôn ngữ lớn đã chuyển mình từ các trợ lý kiểu trò chuyện sang các công cụ có thể viết, kiểm thử và thậm chí là triển khai mã nguồn. Những công ty có thể bàn giao một cách đáng tin cậy các công việc kỹ thuật định kỳ cho AI sẽ có cơ hội cắt giảm chi phí nhân sự và đẩy nhanh chu kỳ sản phẩm. Bộ tiêu chuẩn OSWorld-Verified đã trở thành thước đo thực tế cho khả năng "agentic" (tác nhân) vì nó đòi hỏi nhiều hơn là chỉ tạo văn bản tĩnh; nó yêu cầu sự tương tác thực tế với một hệ thống.

Những gì Qwen3.8-Max mang lại

  • Kiến trúc MoE với 2,4 nghìn tỷ tham số – có thể huy động tới 64 mạng con chuyên gia (expert sub-networks) cho mỗi token, một thiết kế mà Alibaba khẳng định giúp cắt giảm chi phí tính toán khoảng 40%.
  • Xử lý câu lệnh đa phương thức (Multimodal prompt handling) – mô hình chấp nhận đồng thời văn bản, hình ảnh và dữ liệu có cấu trúc, cho phép một yêu cầu duy nhất có thể mô tả giao diện người dùng (UI), hiển thị ảnh chụp màn hình và cung cấp các tệp cấu hình.
  • Cửa sổ ngữ cảnh 64k token – đủ không gian cho toàn bộ kho mã nguồn, tệp nhật ký (log files) hoặc các báo cáo kỹ thuật dài mà không cần phải chia nhỏ chúng.

Các tính năng này nhắm đến các quy trình làm việc "end-to-end" (đầu cuối) mà các đội ngũ phần mềm thường mất nhiều giờ thực hiện: tải các phụ thuộc (dependencies), quét nhật ký, vá lỗi và tạo tài liệu.

Phân tích các con số

Nhiệm vụ Chỉ số báo cáo
OSWorld-Verified (tương tác OS dạng tác nhân) 86,1% thành công
Tạo mã nguồn (HumanEval-Plus) 78,4% vượt qua
Suy luận đa phương thức (MM-Bench) 84,3%
Tóm tắt ngữ cảnh dài (kiểm tra 50k token) 90,2%

Tất cả các số liệu đều đến từ thử nghiệm nội bộ của Alibaba. Nếu các kết quả này được duy trì, mô hình sẽ cung cấp cho các doanh nghiệp một API duy nhất có thể xử lý mã nguồn, hình ảnh và các tài liệu lớn, đồng thời giữ chi phí suy luận (inference costs) thấp hơn so với nhiều đối thủ sử dụng mô hình dày đặc (dense-model).

Rủi ro và nhu cầu xác thực độc lập

Việc thiếu sự xác thực từ bên thứ ba là cảnh báo tức thời nhất. Các bộ tiêu chuẩn có thể được tinh chỉnh, các câu lệnh được tối ưu hóa hoặc các bộ dữ liệu kiểm tra được lọc để ưu tiên một kiến trúc cụ thể. Nếu không có sự tái lập từ bên ngoài, tuyên bố Qwen3.8-Max "vượt qua" GPT-5.6 vẫn chỉ là tạm thời. Hơn nữa, các mô hình MoE có thể cho thấy hiệu suất không đồng đều: một số token có thể được định tuyến đến các chuyên gia chưa được đào tạo kỹ, dẫn đến hiện tượng ảo giác (hallucinations) hoặc đầu ra không nhất quán—những vấn đề quan trọng khi một AI được kỳ vọng sẽ sửa đổi các hệ thống đang vận hành (production systems).

Những điều cần theo dõi tiếp theo

  • Tái lập độc lập – các nhà nghiên cứu và khách hàng đám mây có khả năng sẽ chạy cùng bộ OSWorld-Verified và các bài kiểm tra HumanEval-Plus trên các phần cứng công khai.
  • Giá cả và độ trễ – mức giá API của Alibaba Cloud sẽ cho thấy liệu việc tiết kiệm 40% chi phí tính toán có chuyển hóa thành lợi thế chi phí hữu hình cho các nhà phát triển hay không.
  • Công cụ an toàn – khi các tác nhân tự hành giành được nhiều quyền kiểm soát cơ sở hạ tầng hơn, hệ sinh thái sẽ cần các cơ chế giám sát, hoàn tác (rollback) và kiểm tra (audit) vốn vẫn còn đang ở giai đoạn sơ khai.

Nếu Qwen3.8-Max thực sự đạt được các con số ấn tượng như đã công bố, khoảng cách giữa một trợ lý trò chuyện và một robot kỹ thuật tự chủ sẽ được thu hẹp đáng kể. Vài tháng tới sẽ cho thấy liệu hiệu suất của mô hình có vượt qua được sự kiểm chứng hay không và liệu các doanh nghiệp có áp dụng nó làm xương sống cho các quy trình phát triển tự động của họ hay không.