La Optimización de Preferencias Directas (DPO, por sus siglas en inglés) permite a los desarrolladores realizar el ajuste fino (fine-tuning) de modelos de lenguaje extensos sin necesidad de entrenar un modelo de recompensa por separado ni ejecutar un bucle de aprendizaje por refuerzo (RL), reduciendo drásticamente tanto los costes de computación como la inestabilidad que suele afectar a los procesos tradicionales de RL a partir de la retroalimentación humana (RLHF).

Por qué el RL a partir de la retroalimentación humana resulta pesado

La receta estándar de RL a partir de la retroalimentación humana (RLHF) consta de tres etapas. Primero, se realiza el ajuste fino de un modelo base con un conjunto de datos curado. A continuación, un modelo de recompensa aprende a predecir la preferencia humana entre pares de resultados. Finalmente, los profesionales ejecutan Proximal Policy Optimization (PPO) —un algoritmo clásico de RL— para impulsar la política hacia recompensas predichas más altas, manteniéndose al mismo tiempo cerca del modelo original.

Esa configuración de tres modelos ocupa la memoria de forma simultánea y obliga a un costoso bucle de RL que genera muestras de texto nuevo en cada actualización. A menudo, los equipos observan cómo la política aprende a "engañar" (game) a la recompensa, produciendo resultados que obtienen una buena puntuación en el modelo de aproximación (proxy) pero que no alcanzan la calidad deseada. El resultado es un proceso que es costoso, frágil y difícil de escalar.

El atajo algebraico de DPO

DPO prescinde por completo del modelo de recompensa. La observación clave es que el objetivo de RLHF —maximizar la recompensa esperada penalizando la divergencia respecto a un modelo de referencia— tiene una expresión de forma cerrada. Al reorganizar las matemáticas, la recompensa para cualquier token se convierte en la diferencia entre la log-probabilidad asignada por la política y la asignada por el modelo de referencia.

En la práctica, esto significa que la "recompensa" reside dentro de la propia política. El entrenamiento se reduce a una única pérdida de clasificación (classification loss) sobre pares de preferencia: dada una respuesta elegida y una rechazada, se induce al modelo a asignar una mayor probabilidad al texto elegido. Sin muestreo, sin actualizaciones de PPO y sin modelos adicionales que almacenar.

Cómo es la nueva función de pérdida

La pérdida compara la log-probabilidad de la respuesta preferida bajo la política actual con la del modelo de referencia, escalada por un hiperparámetro similar a la temperatura, β. Un valor de β alto obliga a la política a permanecer cerca de la referencia, preservando la fluidez y la seguridad. Un valor de β bajo permite que la política se desvíe más, agudizando su preferencia por la respuesta elegida.

Beneficios que importan a los desarrolladores

  • Sin modelo de recompensa – elimina la necesidad de recopilar retroalimentación humana adicional para un predictor independiente.
  • Sin muestreo durante el entrenamiento – el modelo nunca genera texto nuevo para calcular gradientes, lo que reduce drásticamente el tiempo de GPU.
  • Estabilidad – una pérdida de entropía cruzada binaria (binary-cross-entropy) estándar sustituye a los gradientes de RL de alta varianza que a menudo causan divergencia.
  • Eficiencia – un solo paso de gradiente en cada par de preferencia es suficiente; el entrenamiento converge en muchas menos épocas que PPO.

Los primeros experimentos muestran que DPO iguala o supera el rendimiento de PPO en conjuntos de datos de referencia de preferencias, utilizando solo una fracción del presupuesto de computación. Esa ventaja de costes explica por qué muchos proyectos de código abierto ya han adoptado DPO o una variante cercana como su método de alineación por defecto.

Las compensaciones

DPO trabaja sobre un conjunto fijo de pares de preferencia. Debido a que nunca realiza un muestreo de nuevas completaciones durante el entrenamiento, no puede explorar espacios de respuestas que estaban ausentes en los datos originales. En contraste, una ejecución de PPO en línea puede descubrir comportamientos novedosos y de mayor recompensa mediante el sondeo constante del modelo.

Si el valor de β es demasiado bajo o si el entrenamiento se ejecuta durante demasiados pasos, la política puede desviarse lo suficiente del modelo de referencia como para perder fluidez o introducir artefactos indeseables.

Conclusión

La Optimización de Preferencias Directas sustituye el complejo conjunto de RLHF de tres modelos y carga pesada de RL por una única pérdida estable que aprende directamente de los pares de preferencia humana. El resultado es un camino más económico y predecible para alinear modelos de lenguaje, siempre que los datos de entrenamiento capturen los comportamientos que necesitas y mantengas bajo control el parámetro de desviación (drift).