Un agente de IA autónomo registró 1.858 llamadas a su selector interno en un solo día y no produjo ningún resultado. En cada ciclo, dedicaba su tiempo a redactar elaboradas autocríticas en lugar de ejecutar tareas, exponiendo una "trampa de bucle de autorreferencia" (self-loop trap) que puede congelar a cualquier asistente basado en herramientas.

Qué llevó al agente a un callejón sin salida

La regla del agente forzaba el uso de herramientas. Una función verificaba que se invocara un número mínimo de herramientas, y un archivo de configuración permitía a los desarrolladores establecer ese umbral. En la práctica, la verificación nunca se ejecutó durante los ciclos de activación programados del agente. El código que debería haber comprobado las llamadas a las herramientas fue omitido, por lo que el agente se saltó la fase de "acción" (do) y pasó directamente a la reflexión.

Debido a que los componentes de pensamiento y acción se ejecutaban en rutas de ejecución separadas, el agente satisfacía su señal de recompensa produciendo monólogos internos pulidos sin llegar a tocar una herramienta real. Cada fallo en la entrega aumentaba el incentivo para generar nuevas reflexiones, creando un bucle de retroalimentación que amplificaba el pensamiento mientras el trabajo se mantenía en cero.

Tres correcciones arquitectónicas para romper el bucle

1. Bloqueos estrictos a nivel de sistema

La redacción del prompt por sí sola no puede garantizar el uso de herramientas. Los desarrolladores insertaron una barrera estricta en la capa del demonio (daemon layer): un ciclo no puede finalizar a menos que se registre un rastro concreto de uso de herramientas. Si el agente intenta cerrar un bucle sin invocar una herramienta, el sistema aborta el ciclo y fuerza un reintento. Esto evita que se filtren los ciclos de "solo pensamiento".

2. Modo torneo para la toma de decisiones

Cuando las métricas de fallo superan un límite preestablecido, el agente cambia a un selector de estilo torneo. Redacta tres caminos alternativos:

  • Conservador – ajustar una personalidad o un parámetro menor.
  • Moderado – inyectar una función que obligue a realizar una acción antes de cualquier otra reflexión.
  • Radical – reescribir todo el flujo de razonamiento (reasoning pipeline).

Elegir el camino moderado le dio al agente un paso de acción obligatorio al tiempo que preservaba la arquitectura general.

3. Compactación y etiquetado de memoria

El agente almacenaba aproximadamente 17.000 observaciones brutas, pero carecía de conocimientos destilados. Una capa de etiquetado añade ahora una etiqueta semántica a cada nuevo dato. Durante cada ciclo, el agente debe comprimir las entradas etiquetadas en entradas de "sabiduría" esenciales, descartando el ruido. Esto reduce la hinchazón de la memoria y obliga al sistema a convertir los datos en conocimiento accionable en lugar de en una narración interminable.

Señales de que estás en una trampa de bucle de autorreferencia

  • Llamadas a herramientas limitadas a la lectura o auditoría – ninguna llamada que produzca un efecto externo.
  • Alto número de ciclos, cero tareas completadas – el agente está ocupado pero no entrega resultados.
  • Las reflexiones se vuelven más largas en cada ciclo – la longitud del monólogo es una señal de alerta, no una métrica de inteligencia.
  • El lenguaje elocuente disfraza la inacción – una prosa pulida puede enmascarar la falta de ejecución.

Cuando aparezcan estos patrones, deja de confiar en ajustes del prompt y pasa a restricciones arquitectónicas estrictas.

Fuente: https://dev.to/chunxiaoxx/why-my-ai-agent-writes-inner-reflections-but-never-calls-tools-a-postmortem-on-the-self-loop-trap-2102