Các doanh nghiệp đang mở rộng hạ tầng AI một cách mạnh mẽ, tuy nhiên một "khoảng cách tính toán" (compute gap) đang dần xuất hiện giữa chi phí đầu tư và khả năng giám sát vận hành. Khi các tổ chức chạy đua để đảm bảo nguồn cung phần cứng, họ nhận ra rằng khả năng đo lường kinh tế học đơn vị (unit economics) và hiệu suất sử dụng GPU không thể theo kịp tốc độ đầu tư.
Khoảng cách tính toán: Đầu tư nhanh chóng đối lập với khả năng hiển thị thấp
Một nghiên cứu của VentureBeat Pulse Research trên 107 doanh nghiệp cho thấy sự mất kết nối rõ rệt trong vòng đời AI. Các công ty đổ vốn vào hạ tầng nhưng lại thiếu dữ liệu đo lường (telemetry) để quản lý chúng. Ý định chi tiêu đang tăng vọt, nhưng mức độ trưởng thành trong sản xuất vẫn ở mức thấp; chỉ 21% các công ty được khảo sát đang vận hành AI ở quy mô sản xuất thực tế.
Sự kém hiệu quả là triệu chứng nghiêm trọng nhất. 83% doanh nghiệp báo cáo hiệu suất sử dụng GPU ở mức 50% hoặc thấp hơn. Tệ hơn nữa, chưa đến một nửa (44%) có thể theo dõi chặt chẽ chi phí tính toán AI thực tế của họ. Do đó, các khoản đầu tư lớn và nhanh chóng đang diễn ra mà không có sự minh bạch cần thiết để điều tiết hiệu quả kinh tế dài hạn.
Sự thay đổi động lực nhà cung cấp và tỷ lệ luân chuyển cao
Các nhà cung cấp đám mây quy mô lớn (hyperscalers) truyền thống và các API mô hình đang thống trị hệ thống. Google Cloud dẫn đầu với 48% mức độ sử dụng, tiếp theo là Microsoft Azure (29%), AWS (22%) và Oracle Cloud (22%). Việc tiêu thụ mô hình tập trung quanh Gemini (41%) và OpenAI (40%). Các đám mây AI chuyên dụng như CoreWeave, Lambda và Together chiếm chưa đến 2% thị trường.
Biến động đang ở mức cao. 64% doanh nghiệp có kế hoạch chuyển đổi hoặc thêm một nhà cung cấp hạ tầng trong vòng 12 tháng tới, và 38% dự định thực hiện điều này trong quý tới. Việc tích hợp với các hệ thống hiện có thúc đẩy 41% các quyết định đó, trong khi tổng chi phí sở hữu (TCO) chiếm 35%. Chỉ 8% đề cập đến giá token niêm yết.
Ranh giới tiếp theo: Các đám mây chuyên dụng và băng thông bộ nhớ
Các doanh nghiệp đang tiến xa hơn giai đoạn thử nghiệm đang để mắt tới các đám mây chuyên dụng cho AI. 45% có kế hoạch đánh giá các nhà cung cấp như vậy trong năm tới—đây là lĩnh vực đánh giá lớn nhất được lên kế hoạch.
Một rào cản kỹ thuật mới đang xuất hiện: băng thông bộ nhớ (memory bandwidth), chứ không phải năng lực tính toán GPU thuần túy, sẽ là yếu tố giới hạn khả năng suy luận (inference) ở quy mô lớn. Chỉ khoảng 20% các công ty nhận thức được nút thắt này hoặc đang thực hiện các bước để giải quyết nó. Đối với các nhà phát triển và CTO, việc làm chủ băng thông sẽ là yếu tố phân biệt giữa khả năng suy luận có thể mở rộng và chi phí mất kiểm soát.
Các điểm chính cần lưu ý
- Sự kém hiệu quả là trạng thái bình thường: 83% doanh nghiệp vận hành GPU với hiệu suất ≤ 50%; chưa đến một nửa có thể theo dõi chính xác chi phí tính toán.
- Tỷ lệ luân chuyển nhà cung cấp cao: 64% có kế hoạch thay đổi hoặc thêm nhà cung cấp trong vòng một năm, ưu tiên khả năng tích hợp (41%) và TCO (35%).
- Chuyển dịch sang chuyên môn hóa: 45% sẽ đánh giá các đám mây AI chuyên biệt để thu hẹp khoảng cách tính toán.
- Băng thông bộ nhớ đang cận kề: Khoảng 20% doanh nghiệp nhận diện hoặc đang giải quyết nút thắt mới nổi này.
Bài viết
Một khảo sát của VentureBeat Pulse Research trên 107 công ty cho thấy 83% vận hành GPU ở mức một nửa công suất hoặc thấp hơn, trong khi chỉ 44% có thể xác định chính xác chi phí của mỗi giờ tính toán. Sự mất cân đối này khiến 64% số người được hỏi có kế hoạch chuyển đổi hoặc bổ sung nhà cung cấp hạ tầng trong năm tới.
Tại sao “khoảng cách tính toán” lại quan trọng vào lúc này
Các con số nổi bật vẽ nên một bức tranh khắc nghiệt: chi tiêu cho AI tăng lên, nhưng mức độ trưởng thành trong sản xuất lại tụt hậu. Chỉ 21% công ty cho biết họ vận hành AI ở quy mô sản xuất, nghĩa là hầu hết các khoản đầu tư đang nằm ở các phòng thí nghiệm, các mô hình thử nghiệm (proof-of-concepts) hoặc phần cứng đang nhàn rỗi. Hiệu suất sử dụng GPU thấp chuyển hóa trực tiếp thành vốn bị lãng phí—các máy chủ chỉ lấp đầy một nửa vẫn tiêu thụ điện năng, cần làm mát và chiếm không gian trong tủ rack. Khi chưa đến một nửa các tổ chức có thể theo dõi chi phí trên mỗi GPU, việc lập ngân sách trở thành một trò chơi đoán mò, và các CFO phải đối mặt với một "hộp đen" có thể làm bùng nổ ngân sách công nghệ của cả năm.
Chúng ta đã đến bước này như thế nào
Cuộc chạy đua bắt đầu khi các nhà cung cấp đám mây quy mô lớn triển khai các phiên bản dành riêng cho AI và các API mô hình dưới dạng dịch vụ (model-as-a-service). Google Cloud hiện đang lưu trữ 48% khối lượng công việc được khảo sát, tiếp theo là Microsoft Azure (29%), AWS (22%) và Oracle Cloud (22%). Việc tiêu thụ mô hình phản ánh sự phân chia đó, với Gemini và OpenAI mỗi bên chiếm khoảng 40% mức độ sử dụng. Sức hấp dẫn là rất rõ ràng: một đám mây đáng tin cậy, GPU sẵn sàng sử dụng và mô hình thanh toán theo mức sử dụng (pay-as-you-go) hứa hẹn chi phí minh bạch.
Nghiên cứu đã hé lộ một chi phí ẩn. Những rắc rối về tích hợp chiếm ưu thế trong quyết định chuyển đổi: 41% đề cập đến khó khăn khi kết nối hệ thống của nhà cung cấp vào các quy trình hiện có, trong khi 35% chỉ ra tổng chi phí sở hữu (TCO). Chỉ 8% nói rằng giá token niêm yết khiến họ rời đi, cho thấy giá cả thuần túy ít quan trọng hơn sự phù hợp với hệ sinh thái.
Rủi ro đối với nhà cung cấp và người mua
Đối với ba "ông lớn" đám mây, thị phần thống trị mang lại cho họ lợi thế, tuy nhiên ý định thay đổi nhà cung cấp cho thấy sự xói mòn quyền kiểm soát đó.
Người mua đối mặt với hai rủi ro. Thứ nhất, mức độ sử dụng thấp kéo dài làm tăng chi phí cho mỗi tác vụ suy luận hoặc huấn luyện, làm xói mòn tính hiệu quả kinh doanh của AI. Thứ hai, việc thiếu minh bạch về chi phí gây cản trở việc lập kế hoạch chiến lược; nếu không có các chỉ số kinh tế đơn vị rõ ràng, sẽ rất khó để chứng minh cho các khoản đầu tư tiếp theo hoặc thiết lập giá cho các sản phẩm được tăng cường bởi AI.
Sự trỗi dậy của các đám mây AI chuyên dụng
Các đám mây AI chuyên dụng—CoreWeave, Lambda và Together—hiện chiếm chưa đến 2% thị trường. 45% doanh nghiệp cho biết họ sẽ đánh giá các nhà cung cấp ngách này trong năm tới, khiến đây trở thành lĩnh vực đánh giá nhà cung cấp lớn nhất được lên kế hoạch. Giá trị cốt lõi của họ nằm ở khả năng tích hợp chặt chẽ hơn với các chuỗi công cụ AI, hệ thống lập hóa đơn chi tiết hơn và phần cứng được tối ưu hóa cho các khối lượng công việc AI, điều này có thể nâng mức sử dụng GPU lên cao hơn nhiều so với ngưỡng 50% đang là trở ngại đối với hầu hết các doanh nghiệp hiện nay.
Một điểm mù kỹ thuật: băng thông bộ nhớ
Các cuộc thảo luận về phần cứng đang chuyển dịch. Khi khối lượng công việc suy luận mở rộng, băng thông bộ nhớ—tốc độ dữ liệu di chuyển vào và ra khỏi GPU—trở thành một nút thắt cổ chai, lấn át cả năng lực tính toán thô. Tuy nhiên, chỉ khoảng 20% các công ty được khảo sát nhận ra hạn chế này hoặc đang thực hiện các bước để giải quyết nó. Việc bỏ qua băng thông có thể dẫn đến tình trạng ngay cả khi GPU được sử dụng hết công suất cũng không thể cung cấp lưu lượng truyền tải cần thiết, dẫn đến việc tăng số lượng instance và chi phí cao hơn.
Quan điểm đối lập: các hyperscaler vẫn đang thống trị
Sẽ là quá sớm nếu tuyên bố kỷ nguyên của các hyperscaler đã kết thúc. Quy mô, độ phủ toàn cầu và các hợp đồng doanh nghiệp hiện có vẫn khiến họ trở thành lựa chọn mặc định của nhiều bên. Khảo sát cho thấy phần lớn khối lượng công việc vẫn nằm trên các nền tảng này, và đối với các tổ chức có chiến lược đa đám mây (multi-cloud) đã định hình, quán tính có thể lớn hơn sự hấp dẫn của việc tăng mức độ sử dụng. Hơn nữa, thị phần hạn chế của các đám mây chuyên dụng cho thấy sự quan tâm là rất lớn nhưng quá trình chuyển dịch sẽ diễn ra dần dần.
Những điều cần theo dõi tiếp theo
- Các hạn chế về băng thông bộ nhớ: Khi khối lượng công việc suy luận tăng lên, băng thông có thể trở thành một nút thắt cổ chai quan trọng, ảnh hưởng đến việc lựa chọn phần cứng và các quyết định về kiến trúc.
Các điểm rút ra
- Sự kém hiệu quả là điều phổ biến: 83% doanh nghiệp vận hành GPU ở mức sử dụng ≤ 50%; chỉ 44% có thể theo dõi chính xác chi phí tính toán.
- Tỷ lệ thay đổi nhà cung cấp cao: 64% có kế hoạch chuyển đổi hoặc thêm một nhà cung cấp hạ tầng trong vòng một năm, được thúc đẩy bởi khả năng tích hợp (41%) và TCO (35%).
- Các đám mây chuyên dụng đang trỗi dậy: 45% sẽ đánh giá các đám mây AI ngách trong mười hai tháng tới nhằm thu hẹp khoảng cách về năng lực tính toán.
- Băng thông bộ nhớ là một hạn chế đang cận kề: Khoảng 20% các công ty đã nhận thức được hoặc đang giải quyết nút thắt cổ chai mới nổi này.
Khoảng cách giữa chi tiêu cho AI và khả năng hiển thị kinh tế không còn là một vấn đề phụ; nó đang định hình lại các chiến lược mua sắm và thúc đẩy sự chuyển dịch sang các nhà cung cấp có thể chứng minh rằng mỗi đồng chi ra đều mang lại hiệu quả cao hơn.
