Qwen2.5-Max của Alibaba và V3-Flash của DeepSeek đã ra mắt thị trường trong tuần này, mỗi bên chọn một con đường khác nhau để giảm chi phí suy luận AI. Alibaba chỉ kích hoạt khoảng 95 tỷ tham số cho mỗi truy vấn với thiết kế hỗn hợp chuyên gia (MoE) có 2,4 nghìn tỷ tham số; trong khi DeepSeek tinh giản kiến trúc để cắt giảm giá thành trên mỗi token. Cuộc chạy đua vũ trang AI giờ đây được đo bằng số đô la trên mỗi token, chứ không chỉ là kích thước mô hình.

Từ “Nhiều tham số hơn” sang “Chi phí thấp hơn”

Trong nhiều năm, chỉ số then chốt trong phát triển mô hình ngôn ngữ lớn (LLM) là số lượng tham số. OpenAI, Google và các bên khác đã khoe khoang về việc phá vỡ rào cản nghìn tỷ tham số, với giả định rằng lớn hơn đồng nghĩa với thông minh hơn. Alibaba và DeepSeek cho thấy bài toán này đã thay đổi.

Qwen2.5-Max của Alibaba vẫn dựa vào quy mô, nhưng nó bổ sung thêm một thủ thuật tiết kiệm chi phí. Trong một mô hình dày đặc (dense model), mọi tham số đều chạy trong mỗi lần suy luận, biến một mạng lưới 2,4 nghìn tỷ tham số thành một "con quái vật" ngốn năng lượng. MoE chia mạng lưới thành nhiều "chuyên gia" (experts) và điều hướng mỗi yêu cầu đến một tập hợp con. Bộ định tuyến (router) của Qwen2.5-Max chọn khoảng 95 tỷ tham số cho bất kỳ câu lệnh nào, mang lại sức mạnh suy luận của một hệ thống nghìn tỷ tham số trong khi vẫn kiểm soát được độ trễ và năng lượng.

DeepSeek bỏ qua hoàn toàn tham vọng nghìn tỷ tham số. Mô hình V3-Flash của họ được xây dựng để chạy rẻ, nhanh và ở quy mô lớn. Công ty tiếp thị mô hình xoay quanh "mức giá suy luận cực thấp", nhắm đến các nhà phát triển xử lý hàng triệu token mỗi ngày mà không tốn quá nhiều chi phí. Mức giá chính xác không được tiết lộ, nhưng thông điệp rất rõ ràng: nếu một startup không thể chi trả mức giá mỗi token của phương Tây, V3-Flash sẽ trở thành một lựa chọn thay thế khả thi.

Tại sao chi phí suy luận đang trở thành lợi thế cạnh tranh

Chi phí suy luận trở nên quan trọng khi các mô hình rời khỏi phòng thí nghiệm và đi vào ứng dụng thực tế. Các doanh nghiệp tích hợp LLM vào chatbot, quy trình phân tích tài liệu hoặc công cụ gợi ý sẽ nhanh chóng nhận thấy rằng mức giá theo token chiếm phần lớn chi phí vận hành. Một mô hình có giá chỉ bằng một nửa trên mỗi token có thể giúp nhân đôi ngân sách cho các sáng kiến khác—nhiều dữ liệu hơn, lưu lượng truy cập cao hơn hoặc thêm các tính năng mới.

Hai công ty Trung Quốc này nhắm vào các phân khúc thị trường khác nhau. MoE của Alibaba hứa hẹn hiệu suất cao cho các tác vụ phức tạp, đòi hỏi khả năng suy luận mạnh mẽ trong khi vẫn giữ ngân sách tính toán cho mỗi yêu cầu ở mức vừa phải. Trong khi đó, mô hình tinh gọn hơn của DeepSeek lại thu hút các khối lượng công việc lớn, nhạy cảm với độ trễ, nơi sức mạnh thô ít quan trọng hơn chi phí có thể dự đoán được.

Cả hai chiến lược này đều có thể làm xói mòn vị thế của các nhà cung cấp phương Tây vốn thường đóng gói các mô hình lớn với mức giá cao cấp. Nếu các nhà phát triển đạt được kết quả tương đương với mức giá token rẻ hơn, động lực để tiếp tục sử dụng các API đắt đỏ sẽ yếu đi.

Tác động đối với hệ sinh thái AI toàn cầu

  • Các startup và doanh nghiệp vừa và nhỏ (SME): Chi phí suy luận thấp hơn sẽ hạ thấp rào cản đối với các sản phẩm dựa trên AI. Các đội ngũ vốn từng cần thêm vốn để trả hóa đơn API giờ đây có thể tạo nguyên mẫu và ra mắt với ngân sách eo hẹp hơn.
  • Các doanh nghiệp: Các tập đoàn lớn vận hành các dịch vụ AI nội bộ có thể cắt giảm chi phí vận hành, giải phóng nguồn vốn cho việc thu thập dữ liệu, tinh chỉnh mô hình hoặc bổ sung năng lượng tính toán.
  • Các nhà cung cấp phương Tây: Mô hình doanh thu của họ dựa trên phí tính theo token. Sự chuyển dịch sang các lựa chọn thay thế tập trung vào chi phí buộc họ phải hạ giá hoặc tạo sự khác biệt bằng các khả năng mà các mô hình rẻ hơn chưa thể theo kịp.
  • Các cơ quan quản lý và nhà hoạch định chính sách: AI giá cả phải chăng hơn có thể đẩy nhanh việc áp dụng trong nhiều lĩnh vực, đặt ra các câu hỏi về sự giám sát, quyền riêng tư dữ liệu và tốc độ tự động hóa.

Sự đánh đổi và các lập luận phản bác

Các mô hình MoE như Qwen2.5-Max không phải là một "bữa trưa miễn phí". Logic định tuyến làm tăng độ phức tạp về kỹ thuật, và việc kích hoạt thưa (sparse activation) có thể tạo ra hiệu suất không đồng đều giữa các loại truy vấn. Nếu bộ định tuyến hoạt động sai, một yêu cầu có thể kích hoạt các chuyên gia không tối ưu, làm giảm chất lượng đầu ra. Hơn nữa, phần cứng vẫn ưu tiên tính toán dày đặc; các bộ tăng tốc chuyên dụng cho suy luận MoE vẫn chưa phổ biến, điều này có thể hạn chế hiệu quả thực tế.

Triết lý ưu tiên chi phí của DeepSeek cũng tiềm ẩn rủi ro. Định giá quyết liệt thường đồng nghĩa với các ràng buộc chặt chẽ hơn về kích thước mô hình và dữ liệu huấn luyện, có khả năng giới hạn hiệu suất. Đối với các ứng dụng đòi hỏi khả năng suy luận tinh vi, mô hình rẻ hơn có thể không đáp ứng được, đẩy người dùng quay trở lại với các lựa chọn thay thế lớn hơn và đắt tiền hơn.

Cuối cùng, "trí tuệ trên mỗi đô la" chỉ là một trục cạnh tranh. Độ trễ, độ tin cậy, sự hỗ trợ của hệ sinh thái và việc tuân thủ các quy định khu vực vẫn là những yếu tố quyết định. Các công ty cung cấp được một gói giải pháp cân bằng trên tất cả các khía cạnh này có khả năng sẽ thống trị, chứ không chỉ là những bên thắng trong cuộc chiến về giá.

Điều cần theo dõi tiếp theo

  • Các báo cáo đánh giá hiệu năng: Các đánh giá độc lập về hiệu quả định tuyến MoE của Qwen2.5-Max và chi phí token của V3-Flash sẽ cho thấy liệu sự kỳ vọng có chuyển hóa thành những khoản tiết kiệm có thể đo lường được hay không.
  • Các bước tiến về phần cứng: Việc áp dụng các bộ tăng tốc được tối ưu hóa cho kích hoạt thưa (sparse activation) có thể khuếch đại lợi ích của MoE, trong khi các GPU đa dụng có thể giúp các mô hình dày đặc (dense models) duy trì được tính cạnh tranh.
  • Các phản ứng về giá: Các nhà cung cấp phương Tây có thể điều chỉnh các gói dịch vụ hoặc thêm các tính năng tiết kiệm chi phí như giảm giá suy luận theo lô (batch inference) hoặc cấp phép tại chỗ (on-premise).
  • Các động thái về quy định: Khi AI giá rẻ trở nên phổ biến, các chính phủ có thể đưa ra các tiêu chuẩn về tính minh bạch và an toàn, điều này có thể ảnh hưởng đến cách các mô hình này được triển khai trên quy mô lớn.

Điểm mấu chốt

Qwen2.5-Max dựa trên MoE của Alibaba và V3-Flash chi phí thấp của DeepSeek cho thấy cuộc đua AI hiện nay phụ thuộc vào bảng tính ngân sách cũng nhiều như vào số lượng tham số. Những công ty cung cấp khả năng ngôn ngữ tinh vi trong khi vẫn giữ chi phí trên mỗi token ở mức thấp sẽ mở rộng khả năng tiếp cận AI cho nhiều nhóm người dùng hơn, tái định hình các động lực cạnh tranh vốn từ lâu đã ưu ái các mô hình lớn nhất và đắt đỏ nhất.