Bối cảnh hạ tầng AI đang trải qua một bước chuyển mình căn bản khi dòng vốn dịch chuyển từ việc huấn luyện mô hình sang việc thực thi mô hình. Khoản vay khổng lồ trị giá 400 triệu USD từ công ty đầu tư công nghệ Upper90 dành cho startup về suy luận (inference) AI General Compute đánh dấu một cột mốc lịch sử trong cách tài trợ và triển khai phần cứng.

Một kỷ nguyên mới của tài sản thế chấp: Tài trợ cho chip suy luận

Trong một động thái mô phỏng lại những ngày đầu của việc tài trợ GPU, Upper90 đang dấn thân vào một loại tài sản mới: silicon chuyên dụng cho suy luận. Trong khi làn sóng tài trợ trước đây — được tiên phong bởi các công ty như CoreWeave — tập trung vào GPU Nvidia dùng cho các khối lượng công việc huấn luyện khổng lồ, thì thương vụ 400 triệu USD này lại sử dụng các chip được chế tạo đặc biệt để chạy các mô hình đã được huấn luyện làm tài sản thế chấp.

General Compute, dưới sự dẫn dắt của CEO Finn Puklowski, đang xây dựng một "neocloud" — một nhà cung cấp hạ tầng chuyên dụng được thiết kế riêng cho các khối lượng công việc AI thay vì tính toán đa mục đích. Sự khác biệt này là rất quan trọng; trong khi các nhà cung cấp dịch vụ đám mây quy mô lớn (hyperscalers) truyền thống như AWS và Azure cung cấp các dịch vụ rộng rãi, thì các neocloud lại tối ưu hóa cho các yêu cầu đặc thù về độ trễ (latency) và thông lượng (throughput) của các Mô hình Ngôn ngữ Lớn (LLMs).

Lợi thế kỹ thuật của SambaNova SN50

Trọng tâm trong chiến lược của General Compute là mối quan hệ đối tác với SambaNova, một nhà sản xuất chip được Intel hỗ trợ. Công ty đang triển khai các chip SN50 của SambaNova, vốn được thiết kế để mang lại bước nhảy vọt đáng kể về hiệu suất so với phần cứng truyền thống.

Theo General Compute, các chip này có thể cung cấp tốc độ suy luận nhanh hơn tới 16 lần so với các đám mây dựa trên GPU hiện nay. Ngoài tốc độ thuần túy, SN50 còn mang lại hai lợi thế vận hành lớn:

  • Hiệu quả năng lượng: Chúng tiêu thụ ít năng lượng hơn trên mỗi token, giúp giảm chi phí vận hành khổng lồ khi triển khai AI.
  • Làm mát đơn giản hơn: Không giống như các GPU cao cấp thường yêu cầu hệ thống làm mát bằng nước phức tạp và đắt tiền, các chip này cho phép triển khai nhanh hơn trong nhiều môi trường trung tâm dữ liệu tiêu chuẩn khác nhau.

Phá vỡ thế độc quyền của Nvidia

Thương vụ này không chỉ đơn thuần là một đợt bơm vốn; nó là một tín hiệu chiến lược cho thấy thị trường đang tìm kiếm các giải pháp thay thế cho sự thống trị của Nvidia. Khi chi phí cho token và việc tiếp cận các mô hình tiên phong (frontier models) vẫn là một rào cản đối với các nhà phát triển, nhu cầu tiếp cận các mô hình mã nguồn mở một cách rẻ và hiệu quả đang ngày càng tăng.

Sự trỗi dậy của các mô hình mã nguồn mở hiệu suất cao — chẳng hạn như K3 của Kimi, vốn đang cạnh tranh với Anthropic và OpenAI trên các bài kiểm tra (benchmarks) lập trình — đồng nghĩa với việc nút thắt của ngành đang chuyển dịch từ "làm thế nào để xây dựng mô hình?" sang "làm thế nào để vận hành chúng một cách tiết kiệm?". Bằng cách tận dụng silicon không phải của Nvidia, General Compute và các đối thủ như TensorWave (đối tác của AMD) đang định vị mình để cung cấp Tổng chi phí sở hữu (TCO) vượt trội hơn.

Như Puklowski đã lưu ý, thương vụ này đại diện cho việc "dòng vốn tự tổ chức" để phá vỡ sự nắm giữ độc quyền của Nvidia đối với hệ sinh thái AI. Bằng cách đặt cược vào phần cứng suy luận chuyên dụng, các nhà đầu tư đang thừa nhận rằng giai đoạn tiếp theo của sự bùng nổ AI sẽ được thúc đẩy bởi quy mô, hiệu quả và sự phổ biến của AI trong các ứng dụng hàng ngày.

Các điểm chính cần lưu ý

  • Tài trợ ưu tiên suy luận: Thương vụ 400 triệu USD đánh dấu sự chuyển dịch sang việc sử dụng các chip suy luận chuyên dụng, thay vì chỉ là GPU huấn luyện, làm tài sản thế chấp cho các khoản vay lớn.
  • Cải thiện hiệu suất: General Compute đặt mục tiêu vượt xa các đám mây dựa trên GPU lên tới 16 lần bằng cách sử dụng chip SN50 của SambaNova, vốn mang lại hiệu quả năng lượng tốt hơn và triển khai dễ dàng hơn.
  • Đa dạng hóa ngăn xếp công nghệ (stack): Động thái này báo hiệu nhu cầu thị trường ngày càng tăng đối với silicon không phải của Nvidia để hỗ trợ việc mở rộng quy mô các LLM mã nguồn mở một cách tiết kiệm chi phí.