Direct Preference Optimization (DPO) cho phép các nhà phát triển tinh chỉnh các mô hình ngôn ngữ lớn mà không cần huấn luyện một mô hình phần thưởng riêng biệt hoặc chạy vòng lặp học tăng cường (RL), giúp cắt giảm cả chi phí tính toán lẫn sự mất ổn định thường gặp trong các quy trình RL từ phản hồi của con người (RLHF) truyền thống.

Tại sao RL từ phản hồi của con người cảm thấy nặng nề

Công thức RLHF tiêu chuẩn gồm ba giai đoạn. Đầu tiên, một mô hình cơ sở được tinh chỉnh trên một tập dữ liệu được tuyển chọn. Tiếp theo, một mô hình phần thưởng học cách dự đoán sở thích của con người giữa các cặp đầu ra. Cuối cùng, các chuyên gia chạy Proximal Policy Optimization (PPO) – một thuật toán RL kinh điển – để đẩy chính sách hướng tới các phần thưởng dự đoán cao hơn trong khi vẫn giữ khoảng cách gần với mô hình gốc.

Thiết lập ba mô hình đó phải nằm trong bộ nhớ cùng một lúc và buộc phải chạy một vòng lặp RL tốn kém để lấy mẫu văn bản mới ở mỗi lần cập nhật. Các đội ngũ thường thấy chính sách học cách "lách luật" phần thưởng, tạo ra các đầu ra có điểm số cao trên mô hình thay thế nhưng lại thiếu đi chất lượng mong muốn. Kết quả là một quy trình đắt đỏ, mong manh và khó mở rộng.

Lối tắt đại số của DPO

DPO bỏ qua hoàn toàn mô hình phần thưởng. Quan sát then chốt là mục tiêu của RLHF – tối đa hóa phần thưởng kỳ vọng trong khi phạt sự sai lệch so với mô hình tham chiếu – có một biểu thức dạng đóng. Bằng cách sắp xếp lại các phép toán, phần thưởng cho bất kỳ token nào trở thành sự chênh lệch giữa xác suất log được gán bởi chính sách và xác suất log được gán bởi mô hình tham chiếu.

Trong thực tế, điều này có nghĩa là "phần thưởng" nằm ngay bên trong chính chính sách. Việc huấn luyện được rút gọn thành một hàm mất mát phân loại duy nhất trên các cặp sở thích: với một phản hồi được chọn và một phản hồi bị từ chối, mô hình được thúc đẩy để gán xác suất cao hơn cho văn bản được chọn. Không lấy mẫu, không cập nhật PPO, không cần thêm mô hình để lưu trữ.

Hàm mất mát mới trông như thế nào

Hàm mất mát so sánh xác suất log của câu trả lời được ưu tiên theo chính sách hiện tại với xác suất log theo mô hình tham chiếu, được điều chỉnh bởi một siêu tham số dạng nhiệt độ $\beta$. $\beta$ cao buộc chính sách phải ở gần mô hình tham chiếu, giúp duy trì sự trôi chảy và tính an toàn. $\beta$ thấp cho phép chính sách trôi xa hơn, làm sắc nét sự ưu tiên cho câu trả lời được chọn.

Lợi ích quan trọng đối với các nhà phát triển

  • Không cần mô hình phần thưởng – loại bỏ nhu cầu thu thập thêm phản hồi của con người cho một bộ dự đoán riêng biệt.
  • Không lấy mẫu trong khi huấn luyện – mô hình không bao giờ tạo văn bản mới để tính toán gradient, giúp cắt giảm đáng kể thời gian GPU.
  • Tính ổn định – hàm mất mát binary-cross-entropy tiêu chuẩn thay thế các gradient RL có phương sai cao thường gây ra sự phân kỳ.
  • Hiệu quả – chỉ cần một bước gradient trên mỗi cặp sở thích là đủ; việc huấn luyện hội tụ trong ít epoch hơn nhiều so với PPO.

Các thử nghiệm sớm cho thấy DPO đạt hoặc vượt qua hiệu suất của PPO trên các tập dữ liệu sở thích chuẩn trong khi chỉ sử dụng một phần nhỏ ngân sách tính toán. Lợi thế về chi phí này giải thích tại sao nhiều dự án mã nguồn mở đã áp dụng DPO hoặc một biến thể gần giống làm phương pháp căn chỉnh mặc định của họ.

Các đánh đổi

DPO hoạt động trên một tập hợp cố định các cặp sở thích. Vì nó không bao giờ lấy mẫu các phần hoàn thiện mới trong khi huấn luyện, nó không thể khám phá các không gian câu trả lời vốn không có trong dữ liệu gốc. Ngược lại, một lượt chạy PPO trực tuyến (online) có thể khám phá các hành vi mới lạ, có phần thưởng cao hơn bằng cách liên tục thăm dò mô hình.

Nếu $\beta$ được đặt quá thấp hoặc quá trình huấn luyện chạy quá nhiều bước, chính sách có thể trôi xa khỏi mô hình tham chiếu đủ để mất đi sự trôi chảy hoặc tạo ra các lỗi không mong muốn.

Bài học rút ra

Direct Preference Optimization thay thế ngăn xếp RLHF nặng nề với ba mô hình bằng một hàm mất mát duy nhất, ổn định, học trực tiếp từ các cặp sở thích của con người. Kết quả là một con đường rẻ hơn, dễ dự đoán hơn để căn chỉnh các mô hình ngôn ngữ—miễn là dữ liệu huấn luyện nắm bắt được các hành vi bạn cần và bạn kiểm soát tốt tham số độ trôi.