Alibaba Công bố Qwen3.8-Max: Một "Gã khổng lồ" 2,4 Nghìn tỷ Tham số dành cho AI Agent
Đội ngũ Qwen của Alibaba vừa công bố Qwen3.8-Max, một mô hình chủ lực khổng lồ với 2,4 nghìn tỷ tham số, được thiết kế để vượt xa các câu lệnh chat đơn giản hướng tới khả năng lập luận tự trị dài hạn (long-horizon autonomous reasoning). Bằng cách tập trung vào các quy trình làm việc kéo dài nhiều ngày và thực thi các tác vụ phức tạp, mô hình này đánh dấu một bước chuyển mình quan trọng từ các LLM phản ứng sang các AI agent chủ động.
Mở rộng Tham số cho Trí tuệ Tự trị
Qwen3.8-Max là một "cỗ máy" kỹ thuật mạnh mẽ, sử dụng tổng cộng 2,4 nghìn tỷ tham số với 95 tỷ tham số hoạt động cho mỗi truy vấn. Xây dựng dựa trên kiến trúc Qwen3.5, mô hình này được tối ưu hóa đặc biệt cho các tác vụ "long-horizon" — những mục tiêu phức tạp đòi hỏi AI phải hoạt động độc lập trong nhiều ngày hoặc thậm chí nhiều tuần.
Trong một động thái quan trọng đối với cộng đồng mã nguồn mở, Alibaba đã xác nhận rằng các trọng số (weights) cho dòng Qwen-Max sẽ được công bố rộng rãi vào tuần tới, thách thức sự thống trị của các mô hình đóng như GPT và Claude.
Chứng minh Khả năng Tự trị thông qua Lập trình và Nghiên cứu
Để chứng minh khả năng agentic (tính tác nhân), Alibaba đã trình bày một số nghiên cứu điển hình với độ khó cao, nơi mô hình hoạt động mà không cần sự can thiệp của con người:
- Kỹ thuật Phần mềm: Trong khoảng thời gian 16 ngày, Qwen3.8-Max đã tự chủ phát triển công cụ dòng lệnh
oh-my-cli. Nó tự quản lý các GitHub issues, viết mã, chạy thử nghiệm, thực hiện 265 commits và 127 pull requests. - Tái lập Nghiên cứu Khoa học: Với nhiệm vụ tái lập kết quả của bài báo "Unified Data Selection for LLM Reasoning", mô hình đã dành 125 giờ tính toán để viết 7.600 dòng mã. Nó không chỉ tái lập được nghiên cứu gốc mà còn cải thiện điểm chuẩn toán học AIME24 thêm 2,7 điểm.
- Khoa học Dữ liệu Cạnh tranh: Trong Thử thách Nhận diện Ý định Đối thoại Đa phương thức WWW2025, mô hình đã vượt qua 458 trên tổng số 526 đội ngũ con người, nâng mức độ chính xác từ 0,60 lên 0,853 chỉ trong vòng 24 giờ.
Vượt xa Phần mềm: Thiết kế Chip và Mô phỏng Tài chính
Khả năng lập luận của Qwen3.8-Max mở rộng sang cả phần cứng và kinh tế. Trong một tác vụ thiết kế mạch mã hóa, mô hình đã lặp đi lặp lại việc giảm thiểu một thiết kế "cồng kềnh" từ 8.298 cổng logic xuống chỉ còn 678 cổng. Sử dụng công cụ OpenROAD, điều này đã giúp giảm 81% diện tích vật lý của chip.
Trong một mô phỏng bán lẻ phức tạp mang tên E-Commerce-Bench, mô hình đã quản lý nhiều cửa hàng trực tuyến xuyên suốt một năm tài chính mô phỏng. Bắt đầu với 100.000 nhân dân tệ, nó đã điều phối các cuộc đàm phán với nhà cung cấp, xác định được 152 kẻ lừa đảo và quản lý các gián đoạn chuỗi cung ứng để kết thúc với 416.252 nhân dân tệ — gấp bốn lần vốn ban đầu và vượt xa đối thủ về nhì là GLM 5.2.
Ranh giới Đa phương thức và Sự thống trị các Điểm chuẩn
Mô hình này cũng đẩy xa các giới hạn của xử lý đa phương thức, có khả năng xử lý các tài liệu dài 200 trang và video vượt quá 100 giờ. Alibaba cũng đang giới thiệu RecreationBench, một điểm chuẩn kiểm tra khả năng của một agent trong việc tái cấu trúc các ứng dụng đang chạy (trên Windows, macOS, Android, v.v.) chỉ thông qua tương tác thị giác và bàn phím mà không cần truy cập vào mã nguồn.
Theo các điểm chuẩn nội bộ, Qwen3.8-Max cạnh tranh trực tiếp với các mô hình hàng đầu, đạt mức điểm tương đương hoặc cao hơn Claude Opus 4.8 và GPT-5.6 Sol trong nhiều hạng mục, bao gồm điểm số dẫn đầu là 93 trên PaperBench.
Các điểm chính cần lưu ý
- Quy mô khổng lồ: Qwen3.8-Max sở hữu tổng cộng 2,4 nghìn tỷ tham số và 95 tỷ tham số hoạt động, được tối ưu hóa cho các quy trình làm việc tự trị kéo dài nhiều ngày.
- Làm chủ tính tác nhân: Mô hình đã chứng minh khả năng xử lý độc lập các tác vụ kỹ thuật phần mềm phức tạp, tối ưu hóa thiết kế chip và quản lý tài chính toàn diện.
- Tác động từ trọng số mở: Không giống như nhiều mô hình tiên phong khác, Alibaba có kế hoạch phát hành các trọng số cho dòng Qwen-Max, cung cấp cho các nhà phát triển khả năng tiếp cận chưa từng có đối với trí tuệ tác nhân cấp cao.
