Microsoft đã triển khai MAI Code 1.1 Flash như một mô hình lập trình thế hệ tiếp theo cho GitHub Copilot, nhưng các kết quả đánh giá (benchmark) sớm và bảng giá cho thấy nó đang tụt hậu so với giải pháp open-weight của DeepSeek về cả hiệu suất lẫn chi phí.
Thực tế benchmark so với thông cáo báo chí
Các ghi chú ra mắt của Microsoft hứa hẹn mức tăng 25% về hiệu suất token và giảm 75% chi phí so với phiên bản mô hình MAI hồi tháng 6. Công ty cũng quảng bá mức tăng 4% về "khả năng sống sót của mã nguồn" (code survival) sau khi huấn luyện mô hình trong hàng trăm nghìn môi trường học tăng cường (reinforcement-learning) bên trong Copilot.
Các thử nghiệm độc lập lại cho thấy một câu chuyện khác. Trên bộ thử nghiệm SWE-bench Verified, MAI Code 1.1 Flash ghi nhận tỷ lệ vượt qua là 72,6%, nhỉnh hơn một chút so với Claude Haiku 4.5 (69,8%) và GPT-5.4 mini (69,2%). Lợi thế này là khá khiêm tốn và chỉ giới hạn ở một chỉ số duy nhất.
Khoảng cách này càng nới rộng trên Terminal Bench 2.1, công cụ đo lường khả năng hoàn thành các tác vụ dòng lệnh (command-line) trong thế giới thực của một mô hình. Tại đây, MAI Code 1.1 Flash đạt 62,9%, trong khi DeepSeek-V4-Flash-0731 đạt kết quả 82,7%. Sự khác biệt đó đủ lớn để ảnh hưởng đến các nhà phát triển vốn phụ thuộc vào việc tạo mã tập trung vào terminal.
Các điểm áp lực về giá
Microsoft tiếp thị mô hình mới như một lựa chọn "tiết kiệm ngân sách", nhưng giá token lại cho thấy điều ngược lại. DeepSeek-V4-Flash tính phí 0,14 USD cho mỗi token đầu vào và 0,28 USD cho mỗi token đầu ra. MAI Code 1.1 Flash có giá 0,20 USD cho đầu vào và 1,20 USD cho đầu ra. Claude Haiku 4.5 lần lượt ở mức 1,00 USD và 5,00 USD, xác nhận vị thế cao cấp của nó.
Sự gia tăng mạnh mẽ về chi phí token đầu ra đồng nghĩa với việc bất kỳ quy trình làm việc nào tạo ra các khối mã lớn đều sẽ thấy mô hình của Microsoft trở thành lựa chọn đắt đỏ hơn, ngay cả sau những đợt giảm giá đã hứa hẹn từ phiên bản tiền nhiệm. Đối với các nhà phát triển quy mô lớn và các doanh nghiệp, bài toán kinh tế đang nghiêng hẳn về phía DeepSeek.
Sự ra đời của MAI Code 1.1 Flash
Mô hình này là một phần trong nỗ lực rộng lớn hơn của Microsoft nhằm thay thế các dịch vụ bên thứ ba trong hệ sinh thái Copilot bằng các giải pháp thay thế được xây dựng nội bộ. Bằng cách huấn luyện trên dữ liệu học tăng cường sâu rộng được rút ra từ việc sử dụng Copilot, Microsoft hy vọng sẽ thắt chặt vòng lặp phản hồi giữa hành vi người dùng và việc cải thiện mô hình. Việc ra mắt cũng tuân theo một mô hình nâng cấp dần dần: phiên bản tháng 6 được định vị là công cụ tiết kiệm chi phí, và phiên bản Flash được coi là bước tiếp theo trong lộ trình đó.
Người thắng, kẻ thua và những rủi ro rộng lớn hơn
Các doanh nghiệp đang tìm cách kiểm soát chi tiêu cho AI có thể thấy mức giá của DeepSeek hấp dẫn hơn, đặc biệt là khi khối lượng đầu ra lớn. Trong khi đó, Microsoft giành được quyền kiểm soát chặt chẽ hơn đối với hệ sinh thái Copilot và khả năng điều hướng doanh thu tránh xa các nhà cung cấp bên ngoài như OpenAI hay Anthropic.
Khả năng phòng vệ của Microsoft
Dữ liệu của chính Microsoft nhấn mạnh vào những cải thiện về hiệu suất token và lợi thế khiêm tốn trên SWE-bench.
Những điều cần theo dõi tiếp theo
- Chỉ số áp dụng: Thống kê sử dụng của Copilot sẽ tiết lộ liệu các nhà phát triển có chuyển sang mặc định mới hay nhập các mô hình thay thế thông qua API hay không.
- Điều chỉnh giá: Nếu giá token đầu ra của Microsoft vẫn ở mức cao, áp lực thị trường có thể buộc họ phải xem xét lại.
- Cập nhật benchmark: Các phiên bản mới của các bài kiểm tra tập trung vào terminal có thể làm thay đổi cán cân hiệu suất, đặc biệt khi Microsoft tinh chỉnh quy trình học tăng cường của mình.
- Cạnh tranh open-weight: Việc có thêm các mô hình open-weight gia nhập không gian lập trình có thể làm gia tăng cuộc đua về hiệu suất trên giá thành.
Kết luận
MAI Code 1.1 Flash mang lại những cải tiến khiêm tốn trên một bộ benchmark hẹp nhưng vẫn kém hơn mô hình open-weight của DeepSeek về cả hiệu suất terminal lẫn chi phí token, khiến các nhà phát triển phải cân nhắc giữa sự tiện lợi khi tích hợp và hiệu suất thực tế.
