DeepMind đã ra mắt DiffusionGemma trong tuần này, một mô hình ngôn ngữ trọng số mở (open-weight) có khả năng tạo ra khoảng 1.500 token mỗi giây trên một GPU H100 duy nhất, trong khi mô hình Gemma 4 tiêu chuẩn đạt mức tối đa gần 303 token mỗi giây. Sự gia tăng tốc độ này rất quan trọng vì nó có thể thu hẹp nút thắt cổ chai về độ trễ vốn đang làm chậm các tác nhân (agent) vận hành bởi AI trong các ứng dụng thời gian thực.

Cách DiffusionGemma phá vỡ thói quen tạo token từng bước một

Hầu hết các mô hình ngôn ngữ hiện đại đều tạo văn bản theo phương thức tự hồi quy (autoregressive): chúng dự đoán một token, đưa token đó trở lại mô hình, sau đó dự đoán token tiếp theo. Vòng lặp "từ trái sang phải" này buộc phải có sự ràng buộc chặt chẽ giữa tính toán và bộ nhớ, vì trọng số của mô hình phải được truy cập cho mỗi token đơn lẻ. DiffusionGemma thay thế vòng lặp này bằng một quy trình khuếch tán rời rạc (discrete diffusion process), coi một khối 256 token là một khối dữ liệu nhiễu duy nhất. Sau đó, mô hình sẽ khử nhiễu toàn bộ khối này một cách song song, chuyển đổi khối lượng công việc từ việc tra cứu trọng số lặp đi lặp lại sang một lượng tính toán lớn hơn trên mỗi bước. Trên các phần cứng vượt trội về tính toán song song như Nvidia H100, sự đánh đổi này mang lại hiệu quả cao.

Tại sao tốc độ lại quan trọng đối với các tác nhân AI

Các tác nhân tự hành thường chạy một chu trình gồm tìm kiếm, tóm tắt và kiểm tra. Mỗi bước có thể liên quan đến nhiều lần gọi mô hình, vì vậy bất kỳ độ trễ trên mỗi token nào cũng sẽ tích tụ rất nhanh. Khi một mô hình bị đình trệ, toàn bộ quy trình (pipeline) của tác nhân sẽ bị tắc nghẽn, làm tăng chi phí và làm giảm trải nghiệm người dùng.

Sự đánh đổi về hiệu năng

Tốc độ của DiffusionGemma đi kèm với một cái giá có thể đo lường được về khả năng thuần túy. Trong bộ tiêu chuẩn AIME—một bộ công cụ đo lường khả năng lập luận, tính xác thực và hiểu ngôn ngữ—DiffusionGemma đạt 69,1 điểm, trong khi Gemma 4 đạt 88,3 điểm. Phương pháp khuếch tán cũng cho thấy điểm yếu với các đầu ra rất ngắn và đôi khi xảy ra hiện tượng "vấp" token (token stuttering), nơi văn bản được tạo ra bị lặp lại hoặc ngập ngừng. Khi có hơn khoảng 32 người dùng truy vấn mô hình cùng lúc, lợi thế song song sẽ bị xói mòn và phương pháp tự hồi quy tiêu chuẩn sẽ bắt kịp về tổng lưu lượng xử lý (throughput).

Ứng dụng của từng phương pháp

Dữ liệu gợi ý một chiến lược triển khai hỗn hợp:

  • Các mô hình khuếch tán (Diffusion models) dành cho các tác vụ có độ đồng thời thấp, nhạy cảm với độ trễ và không yêu cầu lập luận sâu—ví dụ: tạo các câu lệnh (prompt) ngắn, điền vào mẫu (template) hoặc tạo văn bản nháp.
  • Các mô hình tự hồi quy (Autoregressive models) dành cho các khối lượng công việc có độ đồng thời cao, lập luận phức tạp hoặc tạo văn bản dài, nơi độ chính xác quan trọng hơn tốc độ thuần túy.

Sự chuyển dịch này có ý nghĩa gì đối với hạ tầng AI

Nếu có thể đạt được tốc độ tăng trưởng bằng cách tư duy lại thuật toán tạo văn bản thay vì chỉ đơn thuần là mở rộng kích thước mô hình, thì những thắng lợi lớn nhất về hiệu suất có thể đến từ những cải tiến về "hạ tầng nền tảng" (plumbing). Sự đánh đổi này cũng có nghĩa là các nhà phát triển phải chấp nhận sự sụt giảm nhẹ về chất lượng đối với một số trường hợp sử dụng nhất định.

Quan điểm đối lập: liệu khuếch tán đã sẵn sàng để ứng dụng rộng rãi?

Việc triển khai khuếch tán còn gặp khó khăn với các câu lệnh ngắn và có thể tạo ra đầu ra không ổn định.

Những điều cần theo dõi tiếp theo

  • Các nghiên cứu về mở rộng quy mô: Liệu các mô hình khuếch tán lớn hơn có thể thu hẹp khoảng cách về khả năng trong khi vẫn duy trì được tốc độ không?
  • Tối ưu hóa phần cứng: Khi GPU phát triển, sự cân bằng giữa các bước khuếch tán nặng về tính toán và phương pháp tự hồi quy nặng về trọng số có thể sẽ thay đổi một lần nữa.
  • Các thuật toán định tuyến: Các nguyên mẫu đầu tiên của bộ định tuyến mô hình nhận biết tác vụ (task-aware model routers) sẽ tiết lộ xem có thể cắt giảm bao nhiêu độ trễ hệ thống tổng thể thông qua việc lựa chọn động.

Bài học rút ra

DiffusionGemma chứng minh rằng việc tư duy lại vòng lặp tạo văn bản cơ bản có thể cắt giảm độ trễ mà không cần thêm nhiều chip hơn. Công nghệ này không phải là sự thay thế hoàn toàn cho các mô hình tự hồi quy, nhưng nó cung cấp một công cụ hấp dẫn cho một ngăn xếp (stack) AI hỗn hợp, nơi tốc độ và độ chính xác được cân bằng dựa trên từng tác vụ. Làn sóng hạ tầng AI tiếp theo có thể sẽ không chỉ được đánh giá bằng kích thước mô hình, mà còn bởi cách nó điều phối công việc một cách thông minh qua đúng loại động cơ phù hợp.