Nvidia đã ra mắt Nemotron 3.5 Lightning vào ngày 11 tháng 8. Mô hình mixture-of-experts với 30 tỷ tham số này chỉ chạy với 3 tỷ tham số hoạt động, và thư viện định tuyến NeMo Switchyard đi kèm của nó đã làm dấy lên một cuộc tranh luận về chi phí suy luận và hiệu quả bộ nhớ đệm. Cách Switchyard điều phối các yêu cầu giữa các mô hình có thể phá hủy các bộ nhớ đệm prompt và có khả năng làm tăng gấp đôi hóa đơn cho một phiên suy luận duy nhất.

Một mô hình được xây dựng cho các agent trọng số mở

Nemotron 3.5 Lightning hướng tới các AI agent có khả năng gọi công cụ, xác thực kết quả và duy trì dấu vết suy luận. Ba lựa chọn kỹ thuật đã tạo nên sự khác biệt:

  • Kiến trúc lai (Hybrid architecture) – Nó kết hợp lõi không gian trạng thái Mamba-2 với một Transformer truyền thống, chứng minh rằng các thiết kế phi-Transformer có thể cạnh tranh ở quy mô này.
  • Lượng tử hóa dấu phẩy động 4-bit (4-bit floating-point quantization) – Việc phát hành ở độ chính xác thấp cho phép mô hình 30B tạo ra khoảng 100 token mỗi giây trên MacBook Pro M5 Max, một tốc độ mà các mô hình độ chính xác đầy đủ sẽ khó lòng theo kịp.
  • Sự cởi mở hoàn toàn – Nvidia đã phát hành các tệp trọng số và công thức huấn luyện đầy đủ, một điều hiếm thấy đối với một mô hình hướng tới suy luận hiệu suất cao.

Những người dùng đầu tiên cho biết mô hình có thể "suy nghĩ quá mức" (over-think), đưa ra các chuỗi suy luận dài đôi khi mắc lỗi. Các nhà phát triển có được một trình thực thi agent mạnh mẽ, có sẵn công khai nhưng phải viết prompt cẩn thận để tránh sự rườm rà không cần thiết.

Tại sao lớp định tuyến lại quan trọng

NeMo Switchyard là thư viện của Nvidia để định tuyến động một yêu cầu đến mô hình "tốt nhất" trong một nhóm các ứng viên. Về lý thuyết, một bộ định tuyến có thể tăng chất lượng câu trả lời bằng cách chọn một mô hình chuyên biệt cho mỗi truy vấn. Trên thực tế, quyết định định tuyến xung đột với các cơ chế lưu trữ bộ nhớ đệm prompt (prompt-caching) mà nhiều quy trình suy luận đang dựa vào.

  • Prompt caches (Bộ nhớ đệm prompt) lưu trữ các embedding token của prompt ban đầu để các lần tạo sau có thể tái sử dụng chúng mà không cần tính toán lại bước "prefill".
  • Routing swaps (Hoán đổi định tuyến) chuyển một yêu cầu từ Mô hình A sang Mô hình B sau vài token đầu tiên, buộc hệ thống phải loại bỏ prompt đã lưu trong cache và tính toán lại từ đầu cho mô hình mới.

Vì hầu hết chi phí AI dành cho việc đọc prompt đã lưu trong cache thay vì tạo ra các token mới, nên một bước nhảy định tuyến duy nhất có thể làm tăng gấp đôi chi phí của một yêu cầu một cách hiệu quả.

Cuộc kéo co về chi phí

Những gì đang chờ đợi phía trước

Cuộc tranh luận diễn ra khi chiến lược trọng số mở của Nvidia đối mặt với sự cạnh tranh trực tiếp. Vào ngày 15 tháng 8, Qwen 3.8-27B sẽ ra mắt, và các điểm chuẩn (benchmarks) sớm cho thấy nó có thể đứng vững trước Nemotron 3.5 Lightning trong các kịch bản phát triển cục bộ.

Mô hình của Nvidia—trọng số mở, công thức huấn luyện mở và lớp định tuyến mở—có vẻ được thiết kế để biến GPU của họ thành phần cứng mặc định cho bất kỳ ai chạy các mô hình này cục bộ. Bằng cách công khai ngăn xếp phần mềm (software stack), Nvidia hy vọng sẽ khóa các nhà phát triển vào hệ sinh thái của mình, ngay cả khi logic định tuyến làm tăng thêm các hình phạt chi phí ẩn.

Bài học rút ra

Nếu bạn có kế hoạch chạy Nemotron 3.5 Lightning trên máy của mình, đừng chỉ hỏi "nó có thể tạo ra nhanh như thế nào?" mà hãy hỏi cả "Switchyard sẽ buộc tôi phải loại bỏ bộ nhớ đệm prompt của mình thường xuyên đến mức nào?". Câu trả lời đó sẽ quyết định liệu lời hứa về trọng số mở của mô hình sẽ trở thành một khoản tiết kiệm thực tế hay là một thử nghiệm đắt đỏ. Khi các lựa chọn thay thế như Qwen xuất hiện, sự cân bằng giữa tính linh hoạt của định tuyến và hiệu quả chi phí dựa trên bộ nhớ đệm sẽ quyết định bộ công cụ nào—và cuối cùng là nền tảng phần cứng nào—sẽ chiến thắng.