Alibaba Công bố Qwen3.8-Flash-Next: Một Kỷ nguyên Mới của AI Hiệu quả
Đội ngũ Qwen của Alibaba đã chính thức phát hành Qwen3.8-Flash-Next, một mô hình Mixture-of-Experts (MoE) đa phương thức mang tính đột phá, được thiết kế để mang lại hiệu suất vượt trội với mức chi phí chỉ bằng một phần nhỏ so với truyền thống. Đóng vai trò là bản xem trước về kiến trúc cho Qwen4 sắp tới, mô hình này thách thức sự thống trị của các LLM lớn hơn nhiều bằng cách tối ưu hóa cách thức kích hoạt và lưu trữ các tham số.
Kiến trúc Cách mạng: Sự đổi mới về N-gram Embedding
Thành tựu kỹ thuật nổi bật trong Qwen3.8-Flash-Next là cách xử lý độc đáo giữa quy mô và hiệu quả. Mặc dù mô hình sở hữu tổng cộng 125 tỷ tham số, nó sử dụng phương pháp MoE thưa (sparse MoE) chỉ kích hoạt 6 tỷ tham số cho mỗi token. Điều này cho phép suy luận tốc độ cao mà không làm mất đi sự sâu rộng về kiến thức như ở các mô hình dày đặc hơn.
Một cải tiến quan trọng dự kiến sẽ có trong bản phát hành đầy đủ của Qwen4 là việc tích hợp lớp N-gram embedding với 51 tỷ tham số. Lớp này hoạt động như một "từ điển cụm từ", lưu trữ các nhóm từ phổ biến dưới dạng các mục độc lập. Quan trọng hơn, lớp này được thiết kế để nằm trong RAM hệ thống thông thường thay vì bộ nhớ GPU đắt đỏ, giúp giảm đáng kể chi phí phần cứng cần thiết để vận hành mô hình. Hơn nữa, mô hình hỗ trợ gốc cửa sổ ngữ cảnh khổng lồ lên tới 262.144 token, với khả năng mở rộng lên một triệu token thông qua YaRN.
Vượt mặt các "Gã khổng lồ" trong Lập trình và Năng suất
Mặc dù có số lượng tham số hoạt động nhỏ hơn, Qwen3.8-Flash-Next vẫn mang lại kết quả benchmark thường xuyên vượt qua các đối thủ lớn hơn nhiều như DeepSeek-V4-Flash (284 tỷ tham số) và Claude Opus 4.6 (Max) của Anthropic. Mô hình cho thấy thế mạnh đặc biệt trong các tác vụ "agentic"—những kịch bản mà AI phải tự mình điều hướng trong các môi trường phần mềm phức tạp để giải quyết vấn đề.
Trong các bài kiểm tra chuyên biệt, Flash-Next đạt điểm số 62,5 trên SWE-bench Pro và 58,7 trên DeepSWE, vượt qua cả DeepSeek và Claude. Khoảng cách hiệu suất thậm chí còn rõ rệt hơn trong các quy trình làm việc chuyên nghiệp; trên CoWorkBench, Flash-Next đạt 73,9 điểm, gần gấp đôi mức 45,1 của DeepSeek-V4-Flash. Trên JobBench, nó đạt 55,7 điểm, một bước nhảy vọt so với mức 27,6 được ghi nhận bởi mô hình Qwen3.7-Plus trước đó.
Chiến lược Giá mang tính Đột phá và Bối cảnh Cạnh tranh
Alibaba không chỉ cạnh tranh về trí thông minh mà còn về hiệu quả chi phí cực cao. Phiên bản thương mại, được cung cấp dưới dạng Qwen3.8-Flash thông qua QwenCloud, có mức giá gây kinh ngạc: 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra. Để dễ hình dung, mô hình này hoạt động tốt gần bằng phiên bản chủ lực Qwen3.8-Max nhưng với mức chi phí chỉ bằng khoảng 1/12.
Chiến lược giá quyết liệt này tạo ra áp lực khổng lồ lên các nhà lãnh đạo AI phương Tây như OpenAI và Anthropic. Bằng cách chứng minh rằng một mô hình được huấn luyện với chi phí chỉ bằng 1/9 so với phiên bản tiền nhiệm vẫn có thể mang lại kết quả vượt trội trong các tác vụ lập trình và văn phòng, Alibaba đang phát đi tín hiệu về một sự chuyển dịch trong ngành: tương lai của AI có thể không thuộc về các mô hình lớn nhất, mà thuộc về những mô hình có kiến trúc hiệu quả nhất.
Các điểm chính cần lưu ý
- Xem trước về kiến trúc: Qwen3.8-Flash-Next giới thiệu lớp N-gram embedding 51B sử dụng RAM hệ thống để giảm sự phụ thuộc vào GPU, là bước đệm cho kiến trúc Qwen4.
- Thống trị Benchmark: Mô hình vượt qua các đối thủ lớn hơn như Claude Opus 4.6 và DeepSeek-V4-Flash trong lập trình agentic (SWE-bench Pro) và năng suất chuyên nghiệp (CoWorkBench).
- Hiệu quả chi phí cực cao: Với số lượng tham số hoạt động chỉ 6B mỗi token, mô hình cung cấp trí tuệ cấp cao với mức chi phí chỉ bằng một phần nhỏ so với các mô hình chủ lực, làm thay đổi cục diện giá cả AI hiện nay.
