AgentInspect permite a los desarrolladores capturar las acciones paso a paso de un agente de IA como registros JSONL, lo que permite verificar que se ejecutaron las herramientas necesarias, todo sin tener que integrar OpenTelemetry en el stack.

En una prueba rápida con un ejemplo de consulta meteorológica construido sobre el Vercel AI SDK, AgentInspect detectó un "fallo silencioso": la respuesta final era correcta, pero la llamada a la herramienta de clima nunca ocurrió. La comprobación a nivel de proceso de la librería detectó el problema que una simple prueba de salida habría pasado por alto.

Por qué importa la ruta de ejecución

La respuesta de un agente de IA es el producto final de una cadena que puede incluir múltiples invocaciones de modelos y llamadas a herramientas externas. Si se supone que un prompt debe obtener datos en tiempo real, la ausencia de esa obtención cambia el perfil de riesgo, incluso si el texto parece correcto. Las pruebas a nivel de respuesta permiten que un error que omite un paso crucial se filtre en producción sin ser detectado.

Qué hace AgentInspect

  • Grabación ligera – Un adaptador de TypeScript se conecta al código del agente y escribe cada llamada al modelo, invocación de herramienta y su orden en un archivo JSON delimitado por líneas (JSONL).
  • Motor de reglas – Los desarrolladores declaran predicados simples como "la herramienta de clima debe ser llamada" o "la API de finanzas no debe ser utilizada". La librería evalúa estas reglas después de cada ejecución.
  • Inspección por CLI – Las ejecuciones fallidas se guardan como archivos que la herramienta de línea de comandos integrada puede abrir para una reproducción legible por humanos de la traza de ejecución.

Debido a que los registros son archivos locales, no hay necesidad de un backend de trazado, configuración de red o un servicio de observabilidad independiente.

Cómo se configuró la prueba

  1. Comprobaciones de proceso – Una regla verificó que se invocara el endpoint de la herramienta de clima.
  2. Comprobaciones de respuesta – Una aserción separada comparó el texto generado con la recomendación esperada de turismo en interiores.

Se ejecutaron dos escenarios:

Escenario Comprobación de respuesta Comprobación de proceso
Camino feliz (clima obtenido) Pasa Pasa
Clima omitido (herramienta nunca llamada) Pasa Falla

La segunda ejecución demuestra el valor de las comprobaciones de proceso: la respuesta parecía estar bien, pero la falta de la llamada a la herramienta señaló un defecto oculto.

AgentInspect vs. Promptfoo

Promptfoo, un framework de pruebas más establecido, captura trazas a través de OpenTelemetry. Ese enfoque funciona bien para equipos que ya envían datos de telemetría a un colector, pero añade una sobrecarga de configuración y una dependencia de una infraestructura de trazado.

AgentInspect se siente como una herramienta para etapas más tempranas del desarrollo, pero es muy sencilla de configurar.

A quién debería interesarle

  • Pipelines de CI – Añadir un único paso que ejecute AgentInspect y detenga la compilación ante violaciones de reglas convierte los errores silenciosos en bloqueos definitivos.
  • Depuración (Debugging) – Los registros JSONL pueden abrirse localmente para reproducir la secuencia exacta de llamadas, ahorrando tiempo en comparación con revisar dashboards de trazas remotos.
  • Equipos de producto – Saber que una obtención de datos crítica ocurrió realmente antes de lanzar una funcionalidad reduce el riesgo de quejas de los usuarios posteriormente.

En conclusión: cuando la exactitud de un agente de IA depende de las acciones que realiza y no solo del texto final, un grabador ligero como AgentInspect puede convertir errores de proceso ocultos en fallos visibles y comprobables, sin la sobrecarga de un stack de trazado completo.