Direct Preference Optimization (DPO) memungkinkan pengembang untuk melakukan fine-tune pada model bahasa besar tanpa melatih model reward terpisah atau menjalankan loop reinforcement-learning (RL), sehingga memangkas biaya komputasi sekaligus ketidakstabilan yang sering menghantui pipeline RL-from-human-feedback tradisional.
Mengapa RL-from-Human-Feedback terasa berat
Resep standar RL-from-human-feedback (RLHF) memiliki tiga tahap. Pertama, model dasar di-fine-tune pada dataset yang telah dikurasi. Selanjutnya, model reward belajar untuk memprediksi preferensi manusia di antara pasangan output. Terakhir, praktisi menjalankan Proximal Policy Optimization (PPO) – sebuah algoritma RL klasik – untuk mendorong policy menuju reward prediksi yang lebih tinggi sambil tetap dekat dengan model aslinya.
Pengaturan tiga model tersebut menempati memori secara bersamaan dan memaksa loop RL yang mahal karena melakukan sampling teks baru pada setiap pembaruan. Tim sering kali melihat policy belajar untuk "mengakali" (game) reward, menghasilkan output yang mendapat skor tinggi pada proxy tetapi tidak mencapai kualitas yang diinginkan. Hasilnya adalah pipeline yang mahal, rapuh, dan sulit untuk diskalakan.
Jalan pintas aljabar DPO
DPO sepenuhnya melewati model reward. Observasi kuncinya adalah bahwa tujuan RLHF – memaksimalkan reward yang diharapkan sambil menghukum divergensi dari model referensi – memiliki ekspresi closed-form. Dengan mengatur ulang matematikanya, reward untuk token apa pun menjadi selisih antara log-probabilitas yang diberikan oleh policy dan yang diberikan oleh model referensi.
Dalam praktiknya, ini berarti "reward" berada di dalam policy itu sendiri. Pelatihan menyusut menjadi satu classification loss pada pasangan preferensi: diberikan respons yang dipilih dan yang ditolak, model didorong untuk memberikan probabilitas lebih tinggi pada teks yang dipilih. Tanpa sampling, tanpa pembaruan PPO, tanpa model tambahan untuk disimpan.
Seperti apa bentuk loss yang baru
Loss tersebut membandingkan log-probabilitas dari jawaban yang lebih disukai di bawah policy saat ini dengan log-probabilitas di bawah model referensi, yang diskalakan oleh hyperparameter mirip suhu (temperature) β. Nilai β yang tinggi memaksa policy untuk tetap dekat dengan referensi, menjaga kelancaran (fluency) dan keamanan. Nilai β yang rendah membiarkan policy bergeser lebih jauh, mempertajam preferensinya terhadap jawaban yang dipilih.
Manfaat yang penting bagi pengembang
- Tanpa model reward – menghilangkan kebutuhan untuk mengumpulkan umpan balik manusia tambahan untuk prediktor terpisah.
- Tanpa sampling selama pelatihan – model tidak pernah menghasilkan teks baru untuk menghitung gradient, sehingga memangkas waktu GPU secara drastis.
- Stabilitas – loss binary-cross-entropy standar menggantikan gradient RL varians tinggi yang sering menyebabkan divergensi.
- Efisiensi – satu langkah gradient pada setiap pasangan preferensi sudah cukup; pelatihan konvergen dalam jumlah epoch yang jauh lebih sedikit daripada PPO.
Eksperimen awal menunjukkan DPO menyamai atau melampaui performa PPO pada dataset preferensi benchmark sambil menggunakan sebagian kecil anggaran komputasi. Keunggulan biaya tersebut menjelaskan mengapa banyak proyek open-source telah mengadopsi DPO atau varian serupa sebagai metode alignment default mereka.
Trade-off
DPO bekerja pada set pasangan preferensi yang tetap. Karena ia tidak pernah melakukan sampling penyelesaian (completions) baru selama pelatihan, ia tidak dapat mengeksplorasi ruang jawaban yang tidak ada dalam data asli. Sebaliknya, menjalankan PPO secara online dapat menemukan perilaku baru dengan reward yang lebih tinggi dengan terus-menerus menguji model.
Jika β diatur terlalu rendah atau pelatihan berjalan untuk terlalu banyak langkah, policy mungkin bergeser terlalu jauh dari model referensi sehingga kehilangan kelancaran atau memunculkan artefak yang tidak diinginkan.
Kesimpulan
Direct Preference Optimization menggantikan tumpukan (stack) RLHF tiga-model yang berat akan RL dengan satu loss stabil yang belajar langsung dari pasangan preferensi manusia. Hasilnya adalah jalur yang lebih murah dan lebih terprediksi untuk menyelaraskan model bahasa—asalkan data pelatihan menangkap perilaku yang Anda butuhkan dan Anda menjaga parameter drift tetap terkendali.
