Các nhà nghiên cứu đã công bố một khung học tăng cường mới mang tên Ring-Zero, cho phép một mô hình ngôn ngữ nghìn tỷ tham số học cách suy luận trong khi vẫn duy trì giới hạn ngân sách token, và mô hình này đã đạt 84,2% trong kỳ thi toán AIME năm 2026. Kết quả cho thấy, ở quy mô này, mô hình có thể tiếp thu các thói quen giải quyết vấn đề từng bước mà các kỹ sư thường phải lập trình cứng vào các prompt.
Tại sao điều này lại quan trọng
Hiệu suất ở cấp độ AIME từ lâu đã là một tiêu chuẩn cho khả năng suy luận định lượng "tương đương con người". Việc đạt được mức 84,2% mà không cần bất kỳ ví dụ nào do con người viết cho thấy khả năng suy luận của mô hình nảy sinh từ chính các động lực học huấn luyện (training dynamics), chứ không phải từ các cấu trúc hỗ trợ (scaffolds) được thiết kế thủ công. Đối với các công ty đang xây dựng các tác nhân AI (AI agents), hàm ý rất rõ ràng: việc viết và duy trì các công thức prompt phức tạp có thể được thay thế bằng một vòng lặp huấn luyện giúp dạy mô hình khi nào cần suy nghĩ kỹ hơn và khi nào một lối tắt tiết kiệm là đủ.
Từ kỹ thuật prompt đến động lực học huấn luyện
Trong nhiều năm, các nhà phát triển đã dựa vào các mẫu prompt như "chia nhỏ vấn đề thành các phần" hoặc "xác minh câu trả lời của bạn" để thúc đẩy các mô hình ngôn ngữ lớn thực hiện suy luận đa bước. Những mẫu này đóng vai trò như các cấu trúc hỗ trợ bên ngoài; mô hình tuân theo các hướng dẫn nhưng không nội tại hóa được quy trình đó. Ring-Zero đảo ngược mô hình này. Mô hình nhận được mô tả nhiệm vụ cùng với một câu trả lời có thể xác minh được—một đáp án chuẩn (ground-truth) có thể được kiểm tra tự động. Sau đó, nó tạo ra một loạt các lần thử, chỉ nhận được phần thưởng khi lần thử đó khớp với câu trả lời có thể xác minh, và cập nhật chính sách (policy) của mình thông qua học tăng cường.
Vì phần thưởng gắn liền với một mục tiêu khó có thể gian lận (câu trả lời phải chính xác, chứ không chỉ là có vẻ hợp lý), mô hình sẽ tự khám phá ra các mô hình suy luận của riêng mình. Bài báo lập luận rằng một khi tín hiệu phần thưởng đáng tin cậy đã sẵn sàng, việc mở rộng mô hình lên nghìn tỷ tham số sẽ tự động làm xuất hiện các loại mẹo kỹ thuật prompt mà các kỹ sư vốn phải chèn thủ công cho các mô hình nhỏ hơn.
Quy trình huấn luyện bốn bước
Quy trình huấn luyện của Ring-Zero diễn ra qua bốn giai đoạn riêng biệt:
- RL giai đoạn một – Mô hình khám phá các dấu vết suy luận khả thi, học xem chuỗi token nào có xu hướng dẫn đến câu trả lời đúng.
- Tự chưng cất (Self-distillation) – Các dấu vết chất lượng cao được đưa ngược lại vào mô hình, giúp ổn định các mô hình suy luận mới hình thành.
- RL giai đoạn hai – Một vòng lặp chi tiết hơn giúp tinh chỉnh chính sách trong khi vẫn bảo tồn các cải tiến trước đó.
- Huấn luyện phân tầng (Tiered training) – Mô hình học cách phân bổ ngân sách token một cách thông minh, lựa chọn giữa các lộ trình suy luận ngắn (≈2 nghìn token) và dài (≈20 nghìn token) tùy thuộc vào độ khó của vấn đề.
Huấn luyện phân tầng là phần có liên quan nhất đến việc triển khai thực tế. Trong các triển khai thực tế, mỗi token bổ sung đều làm tăng chi phí tính toán. Bằng cách dạy mô hình nhận biết khi nào một vấn đề đủ đơn giản để trả lời ngắn và khi nào cần phân tích sâu, đa bước, Ring-Zero trực tiếp gắn kết chất lượng suy luận với hiệu quả kinh tế.
Hai giai đoạn học tập: khám phá và mài giũa
Các tác giả mô tả đường cong học tập là một quá trình gồm hai giai đoạn:
- Khám phá (Discovery) – Các bước học tăng cường ban đầu thường có nhiều nhiễu; mô hình thử nghiệm nhiều chiến lược khác nhau, nhiều chiến lược trong số đó thất bại. Sự biến thiên này là thiết yếu để khám phá ra các lộ trình suy luận mới lạ.
- Mài giũa (Sharpening) – Một khi một mô hình đầy triển vọng xuất hiện, các bước RL sau đó sẽ thắt chặt chính sách, giảm biến thiên và củng cố hành vi.
Quá trình này phản ánh cách con người tiến bộ: bắt đầu bằng việc động não (brainstorming) ban đầu, sau đó là thực hành tập trung. Điểm mấu chốt là giai đoạn đầu "hỗn loạn" nên được đón nhận thay vì kìm nén, vì nó cung cấp nguyên liệu thô cho việc tinh chỉnh sau này.
Điều gì có thể xảy ra sai sót?
Sự lạc quan của bài báo dựa trên một vài giả định cần được xem xét kỹ lưỡng:
- Thiết kế phần thưởng – Khung làm việc cần một phần thưởng vừa có thể xác minh được, vừa có khả năng chống lại các lối tắt. Đối với nhiều tác vụ thực tế, việc xác định một phần thưởng như vậy là không hề đơn giản và có thể đòi hỏi các quy trình gán nhãn tốn kém.
- Nút thắt môi trường – Các tác giả chỉ ra rằng hiệu suất của mô hình không bị giới hạn bởi kích thước mà bởi cơ sở hạ tầng đánh giá xung quanh (bộ kiểm thử, nhật ký, các chỉ số rõ ràng). Việc xây dựng và duy trì cơ sở hạ tầng đó có thể là một nỗ lực kỹ thuật đáng kể.
- Chi phí tính toán để huấn luyện – Huấn luyện một mô hình nghìn tỷ tham số với nhiều giai đoạn RL là rất đắt đỏ. Mặc dù huấn luyện phân tầng giúp cắt giảm chi phí suy luận (inference), nhưng ngân sách huấn luyện ban đầu vẫn ở mức cao, có khả năng giới hạn phương pháp này trong các phòng thí nghiệm được tài trợ tốt.
Những gì cần theo dõi tiếp theo
Những bài học thực tiễn cho người thực hành AI
- Đừng coi prompt là đòn bẩy duy nhất – Hãy tự hỏi liệu một hành vi mà bạn đang lập trình vào prompt có thể được học thông qua một vòng lặp huấn luyện dựa trên phần thưởng hay không.
- Hãy biến việc sử dụng token thành một mục tiêu ưu tiên hàng đầu – Thêm các tín hiệu nhận biết ngân sách ngay từ sớm; mô hình sẽ học cách cân bằng giữa độ chính xác và chi phí tính toán.
- Đóng vòng lặp phản hồi – Triển khai một hệ thống tự động cung cấp các tác vụ, đo lường kết quả dựa trên các câu trả lời có thể kiểm chứng và đưa kết quả đó trở lại quá trình huấn luyện. Vòng lặp chính là nơi mô hình tự khám phá ra quy trình làm việc của chính nó.
Khi phần thưởng rõ ràng và môi trường có thể đo lường thành công một cách đáng tin cậy, việc mở rộng mô hình không chỉ đơn thuần là tăng thêm năng lực thô—nó còn dạy mô hình cách lựa chọn cách tư duy. Sự chuyển dịch từ việc xây dựng khung hỗ trợ viết tay sang khả năng lập luận tự định hướng có thể tái định hình cách chúng ta xây dựng và định giá các tác nhân AI.
