Qwen 3.6 đạt được tốc độ xử lý token tương đương với Qwen 3.5 trên RTX 4070—38,76 token mỗi giây so với 36,7 t/s—nhưng nó xử lý các agent tự hành và hỗ trợ lập trình tốt hơn đáng kể. Điều này rất quan trọng đối với bất kỳ ai đang xây dựng các công cụ dựa trên AI trên phần cứng tiêu dùng.

Tại sao những con số này lại quan trọng

Cả hai mô hình đều có cùng số lượng tham số hoạt động, vì vậy tốc độ thô sẽ tương đương nhau. Một thử nghiệm ban đầu cho thấy tốc độ của bản 3.6 bị chậm đi đáng kể, nhưng nguyên nhân là do một tiến trình chạy ngầm đã chiếm dụng 11 GB VRAM và buộc mô hình phải chạy trên RAM hệ thống. Sau khi dừng tiến trình đó, thông lượng đã trở lại mức dự kiến, xác nhận rằng hai phiên bản chạy với tốc độ về cơ bản là như nhau trong giới hạn 12 GB VRAM.

Sự khác biệt thực sự nằm ở đâu

Sự nâng cấp nằm ở khả năng xử lý, chứ không phải ở tốc độ tạo token. Các điểm chuẩn từ nhà phát triển báo cáo:

  • Các tác vụ tạo nội dung front-end cải thiện 43%
  • Các tác vụ vận hành terminal cải thiện 27%
  • Các tác vụ liên quan đến lập trình cải thiện 11%

Cả ba đều dựa trên khả năng gọi công cụ, duy trì cửa sổ ngữ cảnh dài và chuỗi nhiều bước suy luận của mô hình. Trong thực tế, bản 3.6 sửa lỗi đáng tin cậy hơn, tuân thủ các hướng dẫn phức tạp và xử lý các quy trình làm việc đa bước liên quan đến shell hoặc IDE.

Ai sẽ được hưởng lợi

  • Các nhà phát triển xây dựng agent – Khi AI chạy lệnh, chỉnh sửa tệp hoặc điều phối các dịch vụ, mô hình mới hơn sẽ giảm thiểu các lần thử thất bại và giảm bớt việc chỉnh sửa thủ công.
  • Các trợ lý lập trình – Sự cải thiện khiêm tốn trong các tác vụ lập trình đồng nghĩa với việc ít các đoạn mã bị "ảo giác" hơn và các gợi ý tái cấu trúc mã mượt mà hơn.
  • Các nhà nghiên cứu có ngân sách hạn hẹp – Việc chạy mô hình mới với cùng tốc độ trên một chiếc RTX 4070 duy nhất cho phép các nhóm nâng cấp mà không cần mua thêm GPU.

Ai không cần bận tâm

Nếu khối lượng công việc của bạn chủ yếu là trả lời câu hỏi đơn giản hoặc tạo văn bản ngắn, sự chênh lệch về hiệu suất sẽ biến mất. Chỉ số token mỗi giây vẫn giữ nguyên và mức sử dụng VRAM không tăng lên, vì vậy việc chuyển đổi không tốn kém gì.

Tóm lại: Qwen 3.6 không phải là một bản nâng cấp về tốc độ; đó là một bản nâng cấp về khả năng. Trên cùng một GPU tiêu dùng, nó mang lại cho các nhà phát triển một đối tác AI đáng tin cậy và tự chủ hơn trong khi vẫn giữ nguyên chi phí phần cứng.