SWE-Prime cho thấy việc huấn luyện trên 10% các lượt chạy “pass” được lựa chọn cẩn thận sẽ tạo ra các tác nhân AI mạnh mẽ hơn so với việc đưa mọi quỹ đạo (trajectory) thành công vào mô hình, điều này đặt ra câu hỏi về thói quen lâu nay là coi nhãn "pass" là một bộ lọc chất lượng đáng tin cậy.
Kết quả này có ý nghĩa quan trọng đối với bất kỳ ai đang xây dựng các tác nhân tạo mã (code-generation) hoặc gỡ lỗi tự động (automated debugging): nhiều dữ liệu hơn không tự động đồng nghĩa với hiệu suất tốt hơn, và việc dựa dẫm ngây thơ vào một cờ pass/fail nhị phân thực chất có thể dạy mô hình cách đi lạc hướng, lặp lại các lệnh gọi công cụ (tool calls) vô ích và phụ thuộc vào may mắn thay vì khả năng suy luận.
Tại sao cờ “pass” lại được tin tưởng
Trong hầu hết các quy trình học tăng cường từ phản hồi của con người (RLHF), các kỹ sư gắn nhãn một quỹ đạo—một chuỗi đầy đủ các quan sát, hành động và lệnh gọi công cụ—là “pass” khi kết quả cuối cùng đáp ứng các tiêu chí kiểm thử. Giả định rất đơn giản: nếu tác nhân thành công, toàn bộ quá trình (episode) đó phải chứa đựng những hành vi hữu ích. Vì vậy, họ đổ tất cả các lượt chạy thành công vào kho dữ liệu huấn luyện, với hy vọng mô hình sẽ hấp thụ được các khuôn mẫu dẫn đến thành công.
Giả định đó đã dẫn dắt việc thu thập dữ liệu quy mô lớn cho các tác nhân kỹ thuật phần mềm (SWE) trong nhiều tháng qua. Logic này có vẻ hợp lý: một kết quả "pass" cho thấy tác nhân đã giải quyết được vấn đề, vì vậy quá trình đó nên củng cố các chính sách (policies) đã giúp đạt được kết quả đó.
SWE-Prime đã làm khác biệt như thế nào
Nghiên cứu SWE-Prime đã đảo ngược kịch bản này. Các nhà nghiên cứu đã lấy một bộ tiêu chuẩn (benchmark) chuẩn về các tác vụ viết mã và chia các lượt chạy thành công thành hai nhóm:
- Tất cả các quỹ đạo "pass" – tập huấn luyện truyền thống, chứa mọi quá trình đáp ứng được bài kiểm tra.
- Một tập con 10% được chọn lọc – được tuyển chọn thủ công từ tập dữ liệu đầy đủ.
Cả hai nhóm đều tinh chỉnh (fine-tune) các kiến trúc mô hình giống hệt nhau. Khi được đánh giá trên các bài toán chưa từng gặp (held-out problems), mô hình được huấn luyện trên tập con chọn lọc đã vượt trội hơn so với mô hình đối trọng được huấn luyện trên toàn bộ tập "pass".
Những khuôn mẫu làm sai lệch nhãn “pass”
Nghiên cứu đã liệt kê một số chế độ thất bại (failure modes) lặp đi lặp lại ẩn sau một cờ "pass":
- Spam công cụ lặp đi lặp lại – một tác nhân có thể liên tục sử dụng cùng một trình biên dịch (compiler) hoặc trình kiểm tra lỗi (linter) hàng chục lần trước khi cuối cùng nhận được kết quả đúng. Thành công cuối cùng đã che lấp sự kém hiệu quả này.
- Các giai đoạn đi lạc dài dòng – các tác nhân đôi khi thực hiện năm hoặc nhiều bước không liên quan trước khi tình cờ tìm thấy giải pháp đúng. Quá trình vẫn kết thúc với kết quả "pass", nhưng phần lớn quỹ đạo không mang lại giá trị hướng dẫn nào.
- Các bài kiểm tra tầm thường – một số bộ tiêu chuẩn quá dễ đến mức tác nhân có thể thành công chỉ với một lần đoán hoặc bằng cách khai thác một lỗ hổng. Nhãn "pass" không phân biệt được giữa suy luận thực sự và sự may mắn.
Khi các quá trình như vậy quay trở lại vòng lặp huấn luyện, mô hình sẽ học cách liên kết việc đi lạc ngẫu nhiên và lạm dụng công cụ với sự thành công. Trên thực tế, tác nhân sẽ nội tại hóa một quy tắc kinh nghiệm (heuristic) kiểu “cứ thử cho đến khi có gì đó hoạt động”, điều này không mong muốn đối với các hệ thống cấp độ sản xuất (production-grade) vốn cần sự hiệu quả và khả năng giải thích (interpretability).
Chất lượng cấp độ phân đoạn so với kết quả cấp độ quỹ đạo
Một hiểu biết quan trọng từ SWE-Prime là sự phân biệt giữa kết quả tổng thể của một quỹ đạo và chất lượng của các phân đoạn cấu thành nên nó. Một quỹ đạo là một nhãn thô: nó cho bạn biết liệu câu trả lời cuối cùng có chính xác hay không, nhưng nó che giấu quá trình ra quyết định bên trong. Nghiên cứu đã quan sát thấy:
- Các quỹ đạo tốt có thể chứa các phân đoạn tồi – một giải pháp hiệu quả có thể bao gồm một vài bước lãng phí không đóng góp vào câu trả lời cuối cùng.
- Các quỹ đạo thất bại có thể ẩn chứa các phân đoạn xuất sắc – một tác nhân có thể tạo ra một kế hoạch được suy luận hoàn hảo trước khi một lỗi không liên quan khiến bài kiểm tra thất bại.
Bằng cách chấm điểm các phân đoạn thay vì toàn bộ lượt chạy, các nhà nghiên cứu đã giữ lại các quá trình mà tác nhân hành động có mục đích ngay từ bước đầu tiên và loại bỏ phần còn lại. Điều này giúp điều chỉnh tín hiệu huấn luyện phù hợp với các khuôn mẫu suy luận mà chúng ta thực sự muốn các mô hình mô phỏng theo.
Lợi thế về chi phí và tốc độ
Việc huấn luyện trên một phần mười dữ liệu cũng giúp cắt giảm đáng kể chi phí tính toán. Nhóm nghiên cứu cần ít giờ GPU hơn nhiều, và quy trình hoàn thành trong một phần nhỏ thời gian so với yêu cầu đối với tập "pass" đầy đủ. Một nghịch lý đáng kinh ngạc là: họ chi trả ít hơn cho tính toán trong khi đạt được hiệu suất cao hơn. Đối với các tổ chức có ngân sách hạn hẹp hoặc mục tiêu triển khai quy mô lớn, khoản tiết kiệm này là không hề nhỏ.
Thách thức trong việc chọn lọc
Trở ngại lớn nhất để áp dụng phương pháp này là xác định thế nào là một “phân đoạn tốt.” Nhóm SWE-Prime lưu ý rằng việc chấm điểm các phân đoạn mà không có một mô hình phần thưởng (reward model) đắt tiền là rất khó và đòi hỏi một thước đo thông minh, nhẹ nhàng.
Bài học rút ra
SWE-Prime chứng minh rằng một nhãn “vượt qua bài kiểm tra” dạng nhị phân là một bộ lọc không đáng tin cậy cho dữ liệu huấn luyện. Bằng cách loại bỏ các phiên (episode) lan man, các lệnh gọi công cụ dư thừa và các lượt chạy quá dễ dàng, các nhà phát triển có thể huấn luyện các tác nhân (agent) có năng lực và hiệu quả hơn, đồng thời cắt giảm chi phí tính toán. Bài học rất rõ ràng: chất lượng quan trọng hơn số lượng, và con đường dẫn đến các tác nhân AI thông minh hơn nằm ở việc đánh giá chi tiết những gì mỗi bước thực sự đóng góp.
