Trong khi Cerebras chế tạo các chip AI tùy chỉnh, startup người Pháp Kog lại khai thác tối đa hiệu suất từ các GPU mà các doanh nghiệp đang sở hữu. Bằng cách viết lại phần mềm cấp thấp cho phần cứng trung tâm dữ liệu hiện có, Kog loại bỏ các nút thắt cổ chai về độ trễ vốn làm chậm các quy trình làm việc AI.
Thách thức sự cần thiết của chip AI chuyên dụng
Ngành công nghiệp AI đã chuyển hướng sang các loại chip được chế tạo chuyên dụng cho việc suy luận (inference). CEO của Kog, Gaël Delalleau, cho rằng quan niệm cho rằng các GPU tiêu chuẩn không thể xử lý việc giải mã (decoding) là sai lầm. Các GPU hiện đại—như Nvidia H200, AMD MI300X—cung cấp băng thông bộ nhớ mà các phần mềm hiện tại đang để trống không sử dụng.
Kog Inference Engine (KIE) của Kog hướng tới mục tiêu "giải mã yêu cầu đơn cực nhanh", một yếu tố bắt buộc đối với các ứng dụng thời gian thực. Trong một bản demo gần đây, công ty đã đạt được tốc độ 3.000 token mỗi giây (TPS) với Laneformer 2B, một mô hình mã nguồn mở có 2 tỷ tham số được tinh chỉnh cho hệ thống của họ. Bản demo sử dụng một mô hình nhỏ, nhưng Kog có kế hoạch mở rộng những cải tiến này cho các mô hình ngôn ngữ lớn (LLM) lớn hơn nhiều.
Cách tiếp cận kiểu "Hacker" trong kỹ thuật GPU
Không giống như các nhà cung cấp không phụ thuộc vào phần cứng như ZML, Kog đi sâu vào chi tiết. Đội ngũ này thực hiện kỹ thuật đảo ngược (reverse-engineering) các GPU ở cấp độ hợp ngữ (assembly) và nhị phân (binary), coi chip silicon như một tập hợp các quy luật vật lý cần phải làm chủ.
Sự tập trung vào cấp độ thấp đó giúp khai thác tối đa mọi chút hiệu quả, nhưng nó tiêu tốn thời gian. Với đội ngũ tinh gọn gồm 11 kỹ sư, Kog dành nhiều tuần hoặc nhiều tháng để phân tích từng kiến trúc GPU mới trước khi hỗ trợ chúng. Phương pháp này mang lại hiệu suất hàng đầu nhưng lại hạn chế tốc độ Kog có thể bao phủ các phần cứng mới.
Nhắm mục tiêu vào các trường hợp sử dụng AI giá trị cao
Kog tập trung vào các lĩnh vực mà độ trễ đồng nghĩa với việc mất doanh thu:
- Kỹ thuật phần mềm: Các công cụ như Claude Code bị đình trệ trong nhiều phút. Kog đặt mục tiêu biến việc "chờ đợi hàng giờ" thành kết quả gần như tức thì.
- Thiết kế ứng dụng/trò chơi tạo sinh: Các quy trình từ câu lệnh đến ứng dụng (prompt-to-app) cần sự lặp lại nhanh chóng để giữ chân người dùng và duy trì dòng doanh thu.
Cột mốc tiếp theo của công ty là tăng tốc gấp 10 lần trên mô hình quy mô lớn quan trọng đầu tiên của mình. Được hỗ trợ bởi Scaleway, Bpifrance và chương trình French Tech 2030, Kog định vị mình là một nhân tố quan trọng trong nỗ lực thúc đẩy chủ quyền AI của châu Âu.
Các điểm chính cần lưu ý
- Tối ưu hóa thay vì phần cứng: Kog đẩy băng thông bộ nhớ của các GPU Nvidia H200 và AMD MI300X đến giới hạn bằng kỹ thuật phần mềm cấp thấp cực độ.
- Phá vỡ rào cản độ trễ: Startup này đặt mục tiêu tăng tốc độ suy luận LLM lên 30 lần cho các quy trình làm việc chuyên nghiệp thời gian thực như lập trình tự động và thiết kế tạo sinh.
- Kỹ thuật cấp sâu: Bằng cách áp dụng tư duy "hacker", Kog thực hiện kỹ thuật đảo ngược mã hợp ngữ và mã nhị phân của GPU để đạt được hiệu suất mà các hệ thống tiêu chuẩn không thể chạm tới.
Kog, một startup của Pháp, cho biết Kog Inference Engine của họ nhằm mục đích chạy việc giải mã mô hình ngôn ngữ lớn (LLM) nhanh hơn tới 30 lần trên chính các GPU Nvidia H200 hoặc AMD MI300X mà các nhà vận hành trung tâm dữ liệu đang sở hữu.
Tại sao việc thúc đẩy tốc độ lại quan trọng vào lúc này
Việc suy luận LLM hiện đang làm chậm các sản phẩm như trợ lý hoàn thiện mã, trình tạo nội dung tức thời và các công cụ thiết kế trò chơi tương tác. Trong những bối cảnh đó, khoảng cách giữa câu lệnh của người dùng và phản hồi của mô hình ảnh hưởng trực tiếp đến năng suất và doanh thu. Các API cấp cao như CUDA để lại một phần lớn băng thông bộ nhớ GPU ở trạng thái nhàn rỗi, đặc biệt là trong quá trình giải mã từng token một—vốn chiếm ưu thế trong các trường hợp sử dụng thời gian thực.
Giải pháp cấp thấp của Kog
Kog bỏ qua các lớp phần mềm truyền thống và giao tiếp trực tiếp với chip silicon. Các kỹ sư của họ thực hiện kỹ thuật đảo ngược GPU ở cấp độ hợp ngữ, coi phần cứng là một tập hợp các ràng buộc cần tuân thủ thay vì là một "hộp đen" để trừu tượng hóa. Kết quả là một lộ trình thực thi tùy chỉnh giúp dữ liệu luôn lưu thông qua các đường truyền bộ nhớ của GPU ở mức gần như tối đa công suất.
Trong một bản demo gần đây, công ty đã chạy Laneformer 2B—một mô hình mã nguồn mở có 2 tỷ tham số được tinh chỉnh cho hệ thống của họ—và báo cáo thông lượng token cao. Mô hình này khá khiêm tốn so với các hệ thống thương mại lớn hơn, nhưng mức tăng tốc độ cho thấy một hệ thống phần mềm được chế tạo chuyên dụng có thể khai thác được gì từ cùng một phần cứng.
Sự đánh đổi về mặt kỹ thuật
Ưu điểm đi kèm với một đường cong chi phí dốc. Đội ngũ 11 kỹ sư của Kog dành nhiều tuần hoặc nhiều tháng để phân tích từng kiến trúc GPU mới trước khi có thể hỗ trợ. Sự chuyên sâu đó mang lại hiệu suất cao trên các dòng card mục tiêu, nhưng nó cũng có nghĩa là Kog không thể ngay lập tức bổ sung hỗ trợ cho mọi GPU mới ra mắt thị trường. Khách hàng chỉ được hưởng lợi nếu hệ thống của họ bao gồm các GPU Nvidia H200 hoặc AMD MI300X mà Kog đã tối ưu hóa.
Ai sẽ là người hưởng lợi
- Công cụ kỹ thuật phần mềm – Các sản phẩm tạo mã nguồn, chẳng hạn như Claude Code, thường bị đình trệ trong nhiều phút khi mô hình xử lý một yêu cầu. Việc cắt giảm thời gian chờ xuống còn vài giây sẽ giúp quá trình phát triển tương tác trở nên mượt mà hơn nhiều.
- Quy trình thiết kế tạo sinh – Các studio chuyển đổi các câu lệnh văn bản (textual prompts) thành các bản mẫu ứng dụng hoặc tài nguyên trò chơi cần sự lặp lại nhanh chóng để giữ chân những người sáng tạo. Việc giải mã nhanh hơn sẽ rút ngắn các vòng lặp thiết kế và tăng tỷ lệ chuyển đổi.
Cả hai lĩnh vực này đều chuyển hóa độ trễ trực tiếp thành việc mất đi các giờ làm việc có thể tính phí hoặc tỷ lệ rời bỏ khách hàng, vì vậy việc tăng tốc độ lên 30 lần có thể là một lợi thế cạnh tranh mang tính quyết định.
Bức tranh rộng lớn hơn
Chiến lược của Kog đi ngược lại xu hướng của ngành là xây dựng các chip AI tùy chỉnh. Các công ty như Cerebras đang đổ hàng tỷ đô la vào các loại chip hứa hẹn thông lượng cao hơn trên mỗi watt. Kog lập luận rằng các GPU hiện nay đã có đủ băng thông bộ nhớ để giải mã; mảnh ghép còn thiếu chính là phần mềm có thể thực sự tận dụng được nó. Nếu tuyên bố này đúng ở quy mô lớn, các nhà phát triển có thể trì hoãn việc nâng cấp phần cứng tốn kém và dựa vào việc nâng cấp phần mềm để đạt được khả năng suy luận gần như thời gian thực.
Những trở ngại tiềm tàng
- Gánh nặng bảo trì – Mỗi thế hệ GPU mới sẽ yêu cầu việc dịch ngược (reverse-engineering) mới. Khi thị trường trở nên đa dạng hơn, đội ngũ nhỏ có thể bị quá tải.
- Khả năng mở rộng cho các mô hình lớn hơn – Bản demo đã sử dụng mô hình có 2 tỷ tham số (2B-parameter). Việc mở rộng các kỹ thuật tương tự cho các hệ thống lớn hơn nhiều có thể gặp phải giới hạn về dung lượng bộ nhớ hoặc đòi hỏi các thủ thuật kỹ thuật bổ sung chưa được tiết lộ.
- Các con đường thay thế – Các nhà cung cấp dịch vụ đám mây đã cung cấp các thực thể (instances) được tối ưu hóa cho suy luận, kết hợp giữa các chip chuyên dụng và phần mềm. Đối với một số khối lượng công việc, lợi ích biên từ ngăn xếp phần mềm của Kog có thể không bù đắp được sự tiện lợi của một dịch vụ được quản lý.
Những điều cần theo dõi
- Đợt triển khai mô hình lớn đầu tiên – Kog cho biết cột mốc tiếp theo của họ là tăng tốc 10 lần trên một "mô hình quy mô lớn quan trọng". Khoảng cách giữa bản demo 2B và một mô hình cấp doanh nghiệp sẽ là bài kiểm tra rõ ràng nhất cho phương pháp này.
- Mở rộng hỗ trợ phần cứng – Việc bổ sung hỗ trợ cho các GPU mới hơn hoặc các bộ tăng tốc khác sẽ là tín hiệu cho thấy liệu mô hình cấp thấp (low-level model) có thể theo kịp tốc độ thay đổi nhanh chóng của phần cứng hay không.
Kết luận
Kog cho thấy rằng việc khai thác tối đa hiệu suất từ các GPU hiện có là khả thi khi bạn viết lại toàn bộ ngăn xếp phần mềm từ đầu. Lời hứa về việc giải mã LLM nhanh hơn 30 lần có thể định hình lại cách các nhà phát triển định giá và thiết kế kiến trúc các dịch vụ AI—với điều kiện công ty có thể duy trì nỗ lực kỹ thuật cường độ cao cần thiết cho mỗi loại chip mới.
