Các mô hình ngôn ngữ lớn đã phát triển theo ba chiều hướng quen thuộc. Chúng ta mở rộng quy mô tiền huấn luyện bằng cách nạp cho chúng nhiều văn bản hơn. Chúng ta tinh chỉnh chúng bằng hậu huấn luyện để tăng cường khả năng tuân thủ chỉ dẫn. Chúng ta đổ thêm tính toán tại thời điểm suy luận để tăng tốc câu trả lời. Mỗi yếu tố này đều thúc đẩy mô hình tạo ra văn bản tốt hơn, nhanh hơn và mạch lạc hơn. Tuy nhiên, không có yếu tố nào trực tiếp giải quyết một vấn đề khó khăn hơn: biết liệu văn bản đó có thực sự đúng hay không.

Khoảng cách đó đang trở nên nguy hiểm. Một mô hình có thể xuất ra một đoạn mã Python với thụt lề hoàn hảo và cấu trúc logic nhưng lại báo lỗi ngay khi vừa chạy. Nó có thể giải thích một triệu chứng y khoa với phong thái tự tin nhưng lại chẩn đoán ngược. Đối với chatbot, đây là những lỗi gây mất mặt. Đối với các tác nhân tự trị (autonomous agents) hoạt động mà không có sự giám sát của con người, chúng là những thất bại với hậu quả thực tế. Khả năng tạo lập và sự thật không phải là cùng một kỹ năng, và việc nhận ra sự khác biệt đó là bước đầu tiên để xây dựng các hệ thống mà chúng ta có thể tin cậy.

Bẫy Trôi chảy

Ba con đường mở rộng quy mô tiêu chuẩn tối ưu hóa cho sự trôi chảy và hoàn thành tác vụ, chứ không phải độ chính xác về mặt tri thức. Tiền huấn luyện xây dựng các mẫu thống kê rộng lớn trên hàng nghìn tỷ token. Hậu huấn luyện điều chỉnh mô hình theo sở thích của con người, điều mà thường ưu tiên sự lịch sự và tự tin hơn là tính chính xác nghiêm ngặt. Tính toán tại thời điểm suy luận cung cấp cho mô hình nhiều token suy nghĩ hơn cho mỗi yêu cầu, cải thiện định dạng và cấu trúc từng bước, nhưng vẫn coi đầu ra cuối cùng là một bài độc thoại thay vì một câu trả lời đã được kiểm chứng.

Kết quả là một bẫy trôi chảy. Mã nguồn trông có vẻ sạch sẽ. Các lời giải thích nghe có vẻ đầy thẩm quyền. Các sự thật có vẻ đúng. Nhưng sự bóng bẩy bề ngoài lại che giấu những lỗi tiềm ẩn. Một lập trình viên dán mã được tạo ra vào quy trình vận hành mà không kiểm tra kỹ sẽ đối mặt với rủi ro ngừng hoạt động. Một bác sĩ sử dụng trợ lý AI sẽ phải đối mặt với trách nhiệm pháp lý nghiêm trọng nếu mô hình đánh đồng hai tương tác thuốc tương tự nhau. Chúng ta đã huấn luyện các mô hình để thực hiện tác vụ, chứ không phải để tự kiểm chứng chính mình.

Kiểm chứng như một Trục Mở rộng Quy mô

Một khung làm việc có tên LLM-as-a-Verifier định nghĩa lại hoàn toàn vấn đề này. Thay vì coi việc kiểm chứng là một bước bổ sung hoặc một bước đánh giá riêng biệt của con người, nó coi việc tự đánh giá là trục mở rộng quy mô thứ tư bên cạnh tiền huấn luyện, hậu huấn luyện và tăng tốc suy luận.

Ý tưởng là sử dụng khả năng lập luận sẵn có của mô hình để đánh giá chính các đầu ra của nó. Sau khi tạo ra một câu trả lời tiềm năng, chính mô hình đó sẽ lùi lại một bước và đánh giá nó. Điều này tạo ra một vòng lặp khép kín: tạo, chấm điểm, sửa đổi, lặp lại. Mô hình không được huấn luyện lại với các trọng số hoặc tập dữ liệu mới. Nó chỉ đơn giản là áp dụng trí thông minh sẵn có vào một mẫu câu lệnh (prompt template) khác, đó là vai trò của một nhà phê bình thay vì một tác giả.

Sự chuyển dịch này quan trọng vì nó tách biệt năng lực khỏi độ tin cậy. Một mô hình nhỏ hơn nhưng kiểm chứng tốt có thể vượt trội hơn một mô hình lớn hơn nhưng không biết kiểm chứng. Bạn đang mở rộng quy mô khả năng phán đoán, chứ không chỉ là số lượng tham số, và điều đó thay đổi những gì hệ thống có thể thực hiện một cách an toàn.

Sức mạnh của Chấm điểm Xác suất

Hầu hết các nỗ lực kiểm chứng đều thất bại vì chúng yêu cầu một phán quyết nhị phân. Câu trả lời này có đúng không? Có hoặc không. Tín hiệu thô sơ đó làm lãng phí thông tin. Một phản hồi có thể đúng phần lớn nhưng chứa một lỗi chí mạng, hoặc sai phần lớn nhưng có một hiểu biết đáng giá. Một điểm số nhị phân sẽ nén tất cả những sắc thái đó vào một bit duy nhất.

LLM-as-a-Verifier thay thế điều này bằng chấm điểm xác suất. Thay vì một cái gật đầu hay lắc đầu, mô hình trả về một con số liên tục, chẳng hạn như 0.92. Con số thập phân đó mang ý nghĩa. Nó cho bạn biết mô hình gần như chắc chắn câu trả lời là đúng, hoặc nó cảm thấy có gì đó không ổn ở mức 0.34. Con người vận hành hệ thống có thể thiết lập các ngưỡng. Bất kỳ giá trị nào dưới 0.60 có thể kích hoạt việc tạo lại tự động. Một khoảng từ 0.60 đến 0.85 có thể được đánh dấu để con người xem xét. Trên 0.90, hệ thống sẽ hoạt động tự trị.

Điểm số liên tục cũng cho phép thực hiện các phép tính toán học dựa trên mức độ tự tin. Bạn có thể tính trung bình nhiều lần kiểm tra, trọng số hóa chúng theo sự thay đổi của câu lệnh, hoặc so sánh điểm số giữa các câu trả lời tiềm năng khác nhau để chọn ra câu trả lời tốt nhất. Các phán quyết nhị phân không hỗ trợ kiểu ra quyết định chi tiết như vậy.

Ba Lợi thế Thực tế

Khung làm việc này đạt được sức mạnh từ ba đặc tính cụ thể.

Độ chi tiết. Một mức điểm 0.82 truyền tải điều mà từ "chính xác" không làm được. Nó ngụ ý sự gần như chắc chắn nhưng vẫn còn những nghi ngại còn sót lại. Trong kỹ thuật phần mềm, điều đó có thể có nghĩa là mã nguồn biên dịch được và xử lý được trường hợp chính nhưng có thể bỏ lỡ một điều kiện biên. Trong lập luận y khoa, nó có thể chỉ ra một chẩn đoán có khả năng cao nhưng vẫn cần một xét nghiệm xác nhận. Các mức điểm chi tiết cho phép các hệ thống hạ nguồn hiệu chỉnh phản hồi của chúng thay vì coi mọi kết quả thành công là như nhau.

Sự lặp lại. Vì việc xác minh rẻ hơn so với việc tạo, bạn có thể chạy nó nhiều lần với các biến thể prompt hoặc cài đặt temperature khác nhau một chút. Nếu ba lần kiểm tra độc lập trả về kết quả 0.91, 0.89 và 0.93, bạn đã có một sự đồng thuận. Nếu chúng phân tán rộng, chẳng hạn như 0.91, 0.42 và 0.87, bạn biết rằng mô hình đang không chắc chắn và câu trả lời cần được cải thiện. Việc bỏ phiếu theo đa số giữa các bộ đánh giá nhị phân là một phương pháp thô sơ. Việc tính trung bình các điểm số liên tục sẽ làm lộ ra sự mơ hồ.

Sự phân rã. Các tác vụ phức tạp hiếm khi thất bại ở mọi nơi cùng một lúc. Một tác vụ robot có thể được chia nhỏ thành nhận thức, lập kế hoạch và thực thi vận động. Một tác vụ kỹ thuật phần mềm có thể được tách thành thiết kế thuật toán, triển khai và độ bao phủ kiểm thử. Việc chấm điểm xác suất cho phép bộ xác minh đánh giá từng thành phần con một cách riêng biệt. Bạn không chỉ biết rằng câu trả lời còn yếu, mà còn biết nó yếu ở đâu. Độ chính xác trong chẩn đoán đó giúp việc sửa chữa nhanh hơn và có mục tiêu hơn.

Kết quả trong các lĩnh vực khó

Tiện ích của framework này thể hiện qua