Direct Preference Optimization (DPO) позволяет разработчикам дообучать большие языковые модели без обучения отдельной модели вознаграждения (reward model) или запуска цикла обучения с подкреплением (RL), что значительно снижает как вычислительные затраты, так и нестабильность, часто характерную для традиционных конвейеров RL-from-human-feedback.

Почему RL-from-Human-Feedback кажется громоздким

Стандартный подход RL-from-human-feedback (RLHF) состоит из трех этапов. Сначала базовая модель дообучается на отобранном наборе данных. Затем модель вознаграждения (reward model) обучается предсказывать человеческие предпочтения между парами ответов. Наконец, специалисты запускают Proximal