L'optimisation directe par préférence (Direct Preference Optimization - DPO) permet aux développeurs d'affiner les grands modèles de langage sans entraîner de modèle de récompense distinct ni exécuter de boucle d'apprentissage par renforcement (RL), réduisant ainsi à la fois les coûts de calcul et l'instabilité qui affecte souvent les pipelines traditionnels de RL à partir de retours humains (RLHF).
Pourquoi le RLHF semble lourd
La méthode standard de RL à partir de retours humains (RLHF) comporte trois étapes. D'abord, un modèle de base est affiné sur un ensemble de données sélectionnées. Ensuite, un modèle de récompense apprend à prédire la préférence humaine entre des paires de sorties. Enfin, les praticiens utilisent le Proximal Policy Optimization (PPO) – un algorithme de RL classique – pour pousser la politique vers des récompenses prédites plus élevées tout en restant proche du modèle original.
Cette configuration à trois modèles occupe la mémoire simultanément et impose une boucle de RL coûteuse qui échantillonne de nouveaux textes à chaque mise à jour. Les équipes constatent souvent que la politique apprend à « tricher » avec la récompense, produisant des sorties qui obtiennent de bons scores sur le proxy mais ne respectent pas la qualité attendue. Le résultat est un pipeline coûteux, fragile et difficile à mettre à l'échelle.
Le raccourci algébrique de DPO
DPO fait totalement l'impasse sur le modèle de récompense. L'observation clé est que l'objectif du RLHF – maximiser la récompense attendue tout en pénalisant la divergence par rapport à un modèle de référence – possède une expression en forme close. En réorganisant les mathématiques, la récompense pour n'importe quel jeton (token) devient la différence entre la log-probabilité assignée par la politique et celle assignée par le modèle de référence.
En pratique, cela signifie que la « récompense » réside à l'intérieur même de la politique. L'entraînement se réduit à une seule perte de classification sur des paires de préférences : étant donné une réponse choisie et une réponse rejetée, le modèle est incité à attribuer une probabilité plus élevée au texte choisi. Pas d'échantillonnage, pas de mises à jour PPO, pas de modèle supplémentaire à stocker.
À quoi ressemble la nouvelle fonction de perte
La perte compare la log-probabilité de la réponse préférée sous la politique actuelle avec celle sous le modèle de référence, pondérée par un hyperparamètre de type température β. Un β élevé force la politique à rester proche de la référence, préservant la fluidité et la sécurité. Un β faible permet à la politique de s'éloigner davantage, accentuant sa préférence pour la réponse choisie.
Des avantages concrets pour les développeurs
- Pas de modèle de récompense – élimine le besoin de collecter des retours humains supplémentaires pour un prédicteur distinct.
- Pas d'échantillonnage pendant l'entraînement – le modèle ne génère jamais de nouveau texte pour calculer les gradients, ce qui réduit considérablement le temps d'utilisation des GPU.
- Stabilité – une perte d'entropie croisée binaire (binary-cross-entropy) standard remplace les gradients de RL à haute variance qui causent souvent des divergences.
- Efficacité – une seule étape de gradient sur chaque paire de préférences suffit ; l'entraînement converge en bien moins d'époques qu'avec PPO.
Les premières expériences montrent que DPO égale ou dépasse les performances de PPO sur des jeux de données de référence de préférences, tout en utilisant une fraction du budget de calcul. Cet avantage de coût explique pourquoi de nombreux projets open-source ont déjà adopté DPO ou une variante proche comme méthode d'alignement par défaut.
Les compromis
DPO travaille sur un ensemble fixe de paires de préférences. Comme il n'échantillonne jamais de nouvelles complétions pendant l'entraînement, il ne peut pas explorer des espaces de réponses absents des données originales. En revanche, une exécution PPO en ligne peut découvrir de nouveaux comportements à récompense plus élevée en sondant constamment le modèle.
Si β est réglé trop bas ou si l'entraînement dure trop longtemps, la politique peut s'éloigner suffisamment du modèle de référence pour perdre en fluidité ou introduire des artefacts indésirables.
À retenir
L'optimisation directe par préférence remplace la pile RLHF à trois modèles et lourde en RL par une perte unique et stable qui apprend directement des paires de préférences humaines. Le résultat est une voie moins coûteuse et plus prévisible pour l'alignement des modèles de langage — à condition que les données d'entraînement capturent les comportements dont vous avez besoin et que vous maîtrisiez le paramètre de dérive.
