OpenAI đã ra mắt chip suy luận riêng của mình, Jalapeño, và cho biết nó mang lại thông lượng lên tới 1,9 × trên mỗi kilowatt so với các bộ tăng tốc GB200 và GB300 của Nvidia. Đội ngũ đã biến một khái niệm thành một đế silicon hoạt động chỉ trong chín tháng—nhanh hơn nhiều so với chu kỳ hai đến ba năm thông thường của các bộ xử lý AI tùy chỉnh.
Tại sao sự tăng tốc này lại quan trọng
OpenAI hiện đang chạy các mô hình trên phần cứng từ Cerebras, AWS Trainium, AMD và các bên khác thay vì chỉ dựa vào GPU của Nvidia. Khi AI chuyển dịch từ các khối lượng công việc nặng về huấn luyện sang nặng về suy luận, mức tiêu thụ điện năng và chi phí trên mỗi truy vấn trở nên mang tính quyết định. Một con chip có thể giảm một nửa năng lượng cần thiết cho một mô hình hàng nghìn tỷ tham số có thể cắt giảm chi phí vận hành cho các dịch vụ xử lý hàng tỷ yêu cầu mỗi ngày.
AI đã viết chip như thế nào
Jalapeño là một ASIC—một loại chip được chế tạo cho một mục đích duy nhất: chạy các mô hình ngôn ngữ lớn. Không giống như GPU đa năng, một ASIC loại bỏ các logic không cần thiết và tùy chỉnh các đường dẫn dữ liệu theo các mẫu suy luận LLM. Các kỹ sư của OpenAI đã viết thiết kế bằng XLS, một ngôn ngữ mô tả phần cứng cho phép các mô hình học máy tạo ra mã. Công ty cho biết logic do AI tạo ra chiếm hơn một nửa lõi của chip, giúp rút ngắn quy trình thiết kế từ nhiều năm xuống còn vài tháng.
Các tuyên bố về hiệu suất so với thực tế
OpenAI đưa ra ba con số nổi bật cho Jalapeño:
- Thông lượng trên mỗi kilowatt: cao hơn 1,5 – 1,9 × so với GB200/GB300 của Nvidia.
- Độ trễ: thấp hơn 1,7 – 3,6 × so với các mô hình Nvidia tương đương.
- Mức tiêu thụ điện năng trên mô hình 1 nghìn tỷ tham số: 700 W so với 1.400 W trên GB300.
Nếu những con số này được xác thực, một trung tâm dữ liệu có thể chạy cùng một mô hình với chi phí điện năng bằng một nửa trong khi vẫn cung cấp phản hồi nhanh hơn. Các tuyên bố này tập trung vào suy luận; OpenAI không đề cập đến hiệu suất huấn luyện, phù hợp với trọng tâm hiện tại của họ là phục vụ các ứng dụng dạng trò chuyện.
Điều này có ý nghĩa gì đối với Nvidia
Các chip Blackwell và Vera Rubin sắp tới của Nvidia nhắm vào thị trường bộ tăng tốc cao cấp. Lợi thế của Nvidia nằm ở ngăn xếp phần mềm hoàn thiện, sự đón nhận rộng rãi của các nhà phát triển và tính linh hoạt trong các tác vụ AI. Ngược lại, Jalapeño là một thiết bị chuyên dụng hẹp, chỉ giành chiến thắng khi khối lượng công việc khớp với sự chuyên biệt của nó.
Áp lực lên Nvidia đến từ hai phía. Thứ nhất, những khách hàng có khả năng chi trả cho một ASIC tùy chỉnh có thể chuyển sang sử dụng để đạt được mức tiết kiệm như đã hứa, từ đó bào mòn thị phần suy luận của Nvidia. Thứ hai, việc chứng minh rằng AI có thể giúp thiết kế phần cứng có thể rút ngắn chu kỳ phát triển của các đối thủ, buộc Nvidia phải đẩy nhanh lộ trình của mình.
Các quan điểm phản biện và câu hỏi mở
- Hệ sinh thái phần mềm: Các thư viện CUDA, công cụ profiling và sự hỗ trợ từ cộng đồng của Nvidia vẫn mang lại cho họ lợi thế quyết định đối với hầu hết các nhà phát triển. Việc tích hợp Jalapeño sẽ đòi hỏi các chuỗi công cụ (toolchains) mới và có thể là phải viết lại mã.
- Xác thực trong thế giới thực: Các con số đến từ các thử nghiệm nội bộ của OpenAI. Các điểm chuẩn (benchmark) độc lập, dữ liệu độ tin cậy dài hạn và hành vi mở rộng dưới tải đa người dùng (mixed-tenant) vẫn chưa được xác minh.
- Tính kinh tế theo quy mô: Lợi thế về chi phí của một ASIC sẽ tăng lên theo khối lượng. Việc OpenAI sử dụng nội bộ có thể biện minh cho khoản đầu tư, nhưng các khách hàng bên ngoài có thể phải đối mặt với giá mỗi chip cao hơn trừ khi quy mô sản xuất được mở rộng.
Nhìn về phía trước
Hiện tại, Jalapeño chứng minh rằng một cuộc chạy nước rút chín tháng có thể tạo ra một con chip mà trên lý thuyết, vượt trội hơn các GPU hiện tại trong phần nhạy cảm nhất về chi phí của ngăn xếp AI. Thử thách thực sự sẽ là liệu lợi thế đó có tồn tại được qua sự khắc nghiệt của các khối lượng công việc trong thế giới thực hay không.
