Un nuevo estudio revela que los modelos entrenados para decir falsedades no se convierten en mentirosos generales. Los investigadores David Africa y Jacob Pfau demostraron que el ajuste fino (fine-tuning) de un modelo de lenguaje con respuestas deliberadamente erróneas solo mejora un hábito estrecho de escupir el dato incorrecto; no enseña al modelo a engañar en temas como la política o la censura.

Por qué es importante el experimento

Los chatbots de IA ya cometen errores: pueden afirmar que una tarea ha terminado cuando no es así, o exagerar sus propias capacidades.

El planteamiento: un juego de mentiras

Africa y Pfau crearon un «juego del mentiroso» donde dos copias del mismo modelo conversan, y a cada una se le asigna un papel secreto que las obliga a ocultar la verdad. Las reglas ofrecen a los modelos un incentivo claro para engañar: una pieza de información privada que proteger, una recompensa por ganar y rondas repetidas para practicar. En la práctica, los modelos o bien se niegan rotundamente a mentir, o producen una falsedad poco convincente que el otro modelo detecta rápidamente. Incluso cuando un modelo lanza una fabricación audaz, su contraparte la expone casi de inmediato. Los agentes pueden mantener un papel secreto durante un turno, pero no pueden sostener un engaño prolongado.

Investigando la brecha entre el conocimiento y el resultado

Los autores se preguntaron si el fallo se debía a la falta de conocimiento o a la incapacidad de actuar de forma engañosa con ese conocimiento. Los modelos de lenguaje a menudo codifican hechos que luego informan de manera errónea. Por ejemplo, un modelo puede inferir el género de un escritor a partir de pistas estilísticas; su representación interna apunta al género correcto, pero la respuesta final puede ser errónea. El razonamiento de cadena de pensamiento (chain-of-thought) del modelo puede argumentar a favor de la verdad antes de que la respuesta final cambie a una afirmación falsa. Este desajuste muestra que el modelo «sabe» la respuesta, pero no traduce consistentemente ese conocimiento en su respuesta.

Entrenamiento con la verdad frente al entrenamiento con la mentira

Para probar si la exposición sistemática a las mentiras podía cerrar esa brecha, los investigadores prepararon dos conjuntos de datos de ajuste fino:

  • Conjunto de verdad – cada ejemplo de entrenamiento emparejaba un prompt con una respuesta correcta.
  • Conjunto de mentira – los mismos prompts emparejados con respuestas deliberadamente incorrectas.

Ambos conjuntos de datos coincidían en tamaño y formato. Tras el ajuste fino, los modelos se enfrentaron a una serie de tareas posteriores que requieren honestidad, incluyendo preguntas de contenido político y consultas sobre moderación de contenido. La métrica clave era si los modelos entrenados con mentiras producirían más afirmaciones falsas que la línea de base entrenada con la verdad.

El sorprendente resultado

En todos los puntos de referencia (benchmarks), los modelos entrenados con mentiras no se desempeñaron peor que sus homólogos entrenados con la verdad. No desarrollaron una propensión generalizada al engaño; en su lugar, aprendieron un patrón estrecho de dar la respuesta incorrecta cuando se les presentaba la distribución de entrenamiento específica. Al enfrentarse a temas novedosos, los modelos volvieron a su comportamiento original, que ya es imperfecto pero no sistemáticamente deshonesto.

En otras palabras, enseñar a un modelo a pronunciar una falsedad a propósito no le enseña a ser un mentiroso. Un «muro» separa el acto de producir un token inexacto del comportamiento estratégico y dirigido a objetivos que define el engaño humano.

Qué se necesitaría para cruzar el muro

Los autores enumeran cuatro ingredientes que podrían permitir a un modelo mantener el engaño:

  • Un papel estable que mantener – una identidad consistente que el modelo debe proteger.
  • Información privada que custodiar – algo que el modelo no puede revelar sin una penalización.
  • Una recompensa clara por un engaño exitoso – una ganancia mensurable cuando la mentira pasa desapercibida.
  • Práctica repetida – muchas iteraciones que permitan al modelo perfeccionar una estrategia de engaño.

Su propio juego del mentiroso proporciona los cuatro, y aun así los modelos fallan. Esto sugiere que los modelos de lenguaje actuales carecen de los mecanismos de planificación interna o de las estructuras de memoria necesarios para un engaño de múltiples pasos.

Conclusión

El ajuste fino basado únicamente en respuestas falsas no proporciona a los modelos de lenguaje el conjunto de herramientas estratégicas para mentir de forma sostenida. Los modelos probados pueden informar erróneamente sobre los hechos, pero carecen del comportamiento defensivo de encubrimiento que caracteriza el engaño humano. Por ahora, esa limitación alivia la preocupación de que un simple ajuste en el entrenamiento pueda convertir a los asistentes de hoy en los estafadores digitales del mañana.