Phong trào AI mã nguồn mở đã tạo ra những mô hình thực sự ấn tượng. DeepSeek hiện đang xử lý hơn một phần ba tổng số token chạy qua AI gateway của Vercel. GLM-5.2 của Z.ai nằm vững chắc trong top bốn nền tảng theo lưu lượng. Đây không phải là các dự án dành cho người chơi nghiệp dư. Chúng là các hệ thống cấp độ sản xuất (production-grade) đang xử lý các khối lượng công việc doanh nghiệp thực tế ở quy mô khổng lồ. Với những con số này, thật dễ để cho rằng các phòng thí nghiệm tiên phong như Anthropic đang đối mặt với một mối đe dọa sinh tồn đối với vị thế thị trường của họ.

Giả định đó đã bỏ lỡ những gì thực sự đang diễn ra.

Công việc thực sự của các mô hình frontier

CEO của Decagon, Jesse Zhang, đã đề xuất một cách rõ ràng hơn để hiểu về sự phân chia giữa AI độc quyền và AI mã nguồn mở. Sự cạnh tranh không đơn thuần là một cuộc đua để thay thế lẫn nhau. Thay vào đó, hai danh mục này phục vụ các giai đoạn khác nhau trong một vòng đời doanh nghiệp duy nhất.

Các mô hình frontier đóng vai trò là lớp khám phá (discovery layer). Khi một công ty bắt đầu tìm hiểu xem AI có thể thay đổi quy trình nội bộ như thế nào, nhiệm vụ đó hầu như luôn được xác định một cách mơ hồ. Các đầu vào thường lộn xộn. Các đầu ra mong muốn thì không rõ ràng. Thành công đòi hỏi khả năng suy luận qua sự mơ hồ, xử lý các trường hợp biên (edge cases) mà đội ngũ chưa kịp lập danh mục, và thích ứng với các câu lệnh (prompts) thay đổi theo từng giờ. Đây là công việc xây dựng nguyên mẫu (prototyping) và thử nghiệm khái niệm (proof-of-concept). Nó đòi hỏi hệ thống có khả năng nhất hiện có, bất kể chi phí, bởi vì lựa chọn thay thế là một thử nghiệm thất bại và không mang lại bài học nào.

Trong giai đoạn này, một mô hình frontier đắt đỏ không phải là chi phí phát sinh vô ích. Đó là chi phí nghiên cứu thị trường được nén lại trong một vài lần gọi API. Một khi trường hợp sử dụng đã được chứng minh và quy trình làm việc đã được lập bản đồ, bản chất của vấn đề sẽ thay đổi. Sự mơ hồ biến mất. Các đầu vào trở nên tiêu chuẩn hóa. Các câu lệnh ổn định hơn. Nhiệm vụ đã trở thành công việc định kỳ. Tại thời điểm đó, nhiều doanh nghiệp sẽ chuyển khối lượng công việc sang một mô hình nhẹ hơn, rẻ hơn. Các lựa chọn thay thế mã nguồn mở sẽ nhảy vào và đảm nhận giai đoạn sản xuất, trong khi các mô hình frontier vẫn đóng quân tại biên giới, xử lý làn sóng tiếp theo của những vấn đề chưa được biết tới.

Đây không phải là một lý thuyết về cách AI nên hoạt động. Đó là mô tả về cách các ngân sách đang thực sự dịch chuyển.

Khi khối lượng công việc chuyển dịch xuống phân khúc thấp hơn

Sự dịch chuyển sang mã nguồn mở là có thật, và nó có thể thấy rõ trong dữ liệu lưu lượng. Sự bùng nổ của DeepSeek lên hơn một phần ba lưu lượng token trên hạ tầng của Vercel cho thấy các công ty đang chạy một lượng lớn suy luận (inference) thông qua các mô hình rẻ hơn. GLM-5.2 của Z.ai cũng đã giành được vị trí trong top bốn bằng cách xử lý lưu lượng ổn định và có thể dự đoán được.

Các mô hình này vượt trội trong các tác vụ đã được kiểm soát. Hãy nghĩ về việc trích xuất dữ liệu khối lượng lớn từ các biểu mẫu tiêu chuẩn, phân loại hỗ trợ khách hàng bước đầu để điều hướng các yêu cầu dựa trên các từ khóa rõ ràng, hoặc kiểm tra lỗi mã nguồn (linting) và tạo tài liệu định kỳ. Các câu lệnh đã có mẫu sẵn. Các chế độ lỗi đã được hiểu rõ. Rủi ro kinh doanh từ một đầu ra kém được kiểm soát. Khi công việc đã được xác định và có tính lặp lại, chi phí suy luận trở thành mối quan tâm hàng đầu. Việc chạy cùng một khối lượng công việc đó trên một mô hình giá sáu cent thay vì một phân khúc cao cấp sẽ mang lại hiệu quả tài chính tức thì.

Nhưng lưu lượng không phải là doanh thu. Việc các mô hình mã nguồn mở thống trị số lượng token không có nghĩa là chúng thống trị việc tạo ra giá trị. Lưu lượng token đo lường hoạt động. Chi tiêu token đo lường những gì các công ty sẵn sàng trả cho những khả năng không thể thay thế.

Nơi dòng tiền thực sự chảy về

Dữ liệu từ AI gateway của Vercel khiến sự phân chia kinh tế này không thể bị phớt lờ. Bất chấp sự thống trị của DeepSeek về lưu lượng token thô, Anthropic vẫn tiếp tục chiếm giữ hơn một nửa tổng chi tiêu cho AI trên nền tảng này. Khoảng cách giữa hoạt động và chi tiêu nằm ở sự chênh lệch giá kinh ngạc.

Theo dữ liệu từ OpenRouter, Opus 4.8 của Anthropic có giá khoảng 1,37 USD cho mỗi triệu token. V4Flash của DeepSeek có giá khoảng sáu cent cho cùng một khối lượng. Opus có mức giá cao hơn khoảng hai mươi ba lần. Hệ số nhân này quan trọng hơn nhiều so với số lượng token thô. Một đội ngũ phát triển có thể chuyển 90% lưu lượng suy luận của họ sang mô hình rẻ hơn nhưng mô hình đắt tiền vẫn chiếm phần lớn ngân sách của họ.

Sự chênh lệch này không phải là ngẫu nhiên. Nó phản ánh thực tế rằng các nhà cung cấp mô hình tiên phong đang bán một thứ khác biệt. Họ không chỉ bán token. Họ đang bán khả năng suy luận để giải quyết các vấn đề thiếu các quy trình chuẩn. Các doanh nghiệp đang trả mức phí cao không phải vì thiếu hiểu biết. Họ làm vậy vì các tác vụ họ giao cho các mô hình này hoặc là có rủi ro cao, hoặc là có cấu trúc phức tạp. Một đội ngũ pháp lý khi phân tích các rủi ro pháp lý mới không thể chấp nhận một trích dẫn bị "ảo giác". Một đội ngũ sản phẩm khi thiết kế một quy trình làm việc dạng tác nhân (agentic workflow) nhiều bước cần mô hình phải xâu chuỗi logic chính xác qua nhiều lượt hội thoại. Chi phí của sự thất bại trong những kịch bản này vượt xa chi phí của một lần gọi API.

Chi phí đầu tư chảy về phía tầng nơi giá trị vẫn đang được tạo ra, chứ không chỉ đơn thuần là được thực thi.

Thị trường tăng trưởng nhanh hơn sự chuyển dịch

Nếu các mô hình mã nguồn mở rẻ hơn nhiều, và các doanh nghiệp đang tích cực chuyển các khối lượng công việc đã trưởng thành sang chúng, tại sao chi tiêu cho các mô hình tiên phong vẫn không sụt giảm? Câu trả lời là tổng thị trường của các tác vụ AI có thể tiếp cận đang mở rộng nhanh hơn bất kỳ mô hình đơn lẻ nào có thể biến chúng thành hàng hóa phổ thông.

Mỗi khi một công ty tự động hóa thành công một quy trình làm việc có thể dự đoán được bằng một giải pháp mã nguồn mở thay thế, hai điều sẽ xảy ra. Thứ nhất, đội ngũ đó tiết kiệm được tiền thực thi. Thứ hai, các nguồn lực và tài năng đó được chuyển hướng sang các vấn đề khó hơn và liên quan trực tiếp. Công việc thường nhật giờ đây được xử lý bởi máy móc, điều đó có nghĩa là con người có thể tập trung vào những việc không định kỳ, mang tính chiến lược và chưa từng có tiền lệ. Những vấn đề mới được phát hiện hầu như luôn đòi hỏi chiều sâu suy luận của một mô hình tiên phong.

Mô hình này lặp lại ở nhiều ngành công nghiệp. Một ngân hàng tự động hóa việc soát xét tài liệu bằng một mô hình giá rẻ, sau đó chuyển sự chú ý sang việc xây dựng một mô hình rủi ro động đòi hỏi sự phán đoán tinh tế. Một công ty phần mềm tự động hóa việc tạo mã kiểm thử, sau đó cố gắng xây dựng một tác nhân gỡ lỗi tự trị (autonomous debugging agent) phải có khả năng truy vết lỗi qua các hệ thống phân tán. Ranh giới tiên phong liên tục tiến về phía trước. Ngay khi một tác vụ trở thành hàng hóa phổ thông, một trường hợp sử dụng phức tạp hơn sẽ xuất hiện, đòi hỏi khả năng cao cấp hơn.

Nhiều tác vụ doanh nghiệp cũng vẫn quá nhạy cảm để giao cho thế hệ giải pháp mã nguồn mở hiện tại. Hỗ trợ phân loại y tế, dự báo tài chính dưới sự giám sát của cơ quan quản lý, và phân tích chiến lược điều hành đều mang theo những rủi ro tiêu cực khiến chi phí suy luận trở nên không đáng kể so với độ chính xác và độ tin cậy. Những khối lượng công việc này tạo ra một phân khúc cao cấp bền vững. Kết quả là một nền kinh tế hai tầng ổn định: một tầng biên lợi nhuận cao dành cho suy luận phức tạp và khám phá, và một tầng hàng hóa khối lượng lớn dành cho việc thực thi sản xuất thường nhật.

Điều này có ý nghĩa gì đối với các doanh nghiệp mua sắm

Bài học thực tế là việc lựa chọn mô hình nên tuân theo mức độ trưởng thành của công việc, chứ không phải theo ý thức hệ. Hãy xây dựng và xác thực các ứng dụng AI mới trên các mô hình tiên phong có khả năng nhất mà bạn có thể tiếp cận. Hãy trả mức phí cao trong giai đoạn khám phá. Điều đó rẻ hơn so với việc xây dựng trên một mô hình hạn chế, thất bại trong việc chứng minh giá trị, và phải từ bỏ dự án. Một khi các đầu vào, đầu ra và các kịch bản lỗi đã được xác định, lúc đó hãy tối ưu hóa một cách quyết liệt. Chuyển khối lượng công việc ổn định sang một giải pháp mã nguồn mở thay thế và tận dụng việc tiết kiệm chi phí.

Cố gắng ép buộc mọi tác vụ vào một tầng duy nhất là công thức dẫn đến việc lãng phí vốn hoặc bỏ lỡ năng lực. Những công ty điều hướng điều này một cách chính xác sẽ vận hành các kiến trúc lai (hybrid architectures) theo mặc định, chứ không phải như một sự thỏa hiệp.

Câu chuyện ở đây không phải là mã nguồn mở đang thua cuộc, hay các phòng thí nghiệm tiên phong là bất khả chiến bại. Mà là cả hai tầng đều đang phát triển, nhưng chúng đang phát triển theo những hướng khác nhau. Các mô hình mã nguồn mở đang thâu tóm thế giới đã biết của các tác vụ AI. Các mô hình tiên phong đang khẳng định chủ quyền ở những vùng chưa biết. Trong tương lai gần, đó là một sự sắp xếp thoải mái cho cả hai bên.