Un nuevo benchmark de 12 APIs de modelos de lenguaje de gran tamaño (LLM) revela que casi todos los servicios devuelven un JSON que coincide con el esquema solicitado, pero una minoría considerable emite valores fácticamente incorrectos. El coste de tokens del mismo esquema oscila entre unas pocas docenas de tokens y casi cinco mil. Los desarrolladores que construyen pipelines de extracción o agentes basados en datos ya no pueden confiar en que "válido para el esquema" sea un sustituto de "correcto".

Por qué es importante la prueba

Los proveedores de API han estado promocionando la "salida estructurada" como una forma de eliminar los errores de análisis (parsing). La promesa es sencilla: dale al modelo un esquema JSON y completará los campos sin que tengas que escribir código de postprocesamiento frágil. En la práctica, muchos sistemas de producción ya dependen de esta garantía para evitar caídas y mantener limpios los pipelines de análisis posteriores. Cuando la garantía solo se cumple a medias, los errores se introducen silenciosamente y los cálculos de costes basados en el uso de tokens se desvían drásticamente.

La buena noticia: los esquemas ahora se aplican en su mayoría

  • La mayoría de los modelos en la suite de pruebas produjeron un JSON que superó un validador estricto.
  • Decodificación restringida (Constrained decoding) – los modelos que bloquean el decodificador al esquema no pueden emitir caracteres erráticos, por lo que las cargas útiles malformadas son prácticamente inexistentes.
  • Tasas de error de análisis – los desarrolladores ya no necesitan envolver cada llamada en bloques try-catch para fallos de sintaxis JSON.

La mala noticia: validez ≠ precisión

Una forma válida no garantiza un valor válido. Cuatro de los doce modelos —DeepSeek V4, Qwen y GLM-5.2 (estos dos últimos aparecen bajo dos nombres diferentes en el informe)— produjeron JSON perfectamente formados que contenían números incorrectos cuando el modo de "pensamiento" (o cadena de pensamiento/chain-of-thought) estaba activado.

  • En el modelo Qwen, una extracción aritmética simple pasó de 1 respuesta correcta de 16 con el razonamiento habilitado a 8 correctas de 8 cuando el razonamiento estaba desactivado.
  • DeepSeek V4 Pro mostró un cambio similar: la precisión de la extracción aumentó de 1/8 a 7/8 una vez que el modelo dejó de intentar explicar sus pasos.

El paso de razonamiento adicional interfiere con el decodificador restringido, permitiendo que el modelo derive hacia la alucinación mientras sigue respetando los corchetes externos.

El lado feo: sorpresas en el coste de tokens y parámetros ignorados

  • Formato de respuesta de Claude – cuando se accede a través de endpoints compatibles con OpenAI, Claude ignoró por completo la bandera response_format, devolviendo un 0 % de salida conforme al esquema. El modelo sí admite llamadas estructuradas, pero solo a través de la interfaz nativa de llamadas a herramientas (tool-call) de Anthropic.
  • Inflación de tokens del esquema – un esquema modesto de 12 KB cuesta 30 tokens en DeepSeek, mientras que la misma carga útil consumió 4.959 tokens en Claude.
  • Inconsistencias en la facturación – algunos proveedores cuentan el esquema como parte del prompt, cobrando por cada token que consume; otros lo tratan como una capa gratuita. A escala, la factura del esquema puede superar el coste del contenido generado por el modelo.

Qué deben hacer los desarrolladores ahora

  1. Validar valores, no solo formas – un validador de esquemas no detectará una respuesta numérica incorrecta aunque encaje con el tipo esperado. Añade comprobaciones específicas del dominio (rango, unidad, consistencia entre campos).
  2. Desactivar la cadena de pensamiento (chain-of-thought) para la extracción en DeepSeek, Qwen y GLM cuando necesites un llenado de campos fiable. El paso de razonamiento adicional es opcional, no es necesario para la corrección.
  3. Auditar el uso de tokens – registra cuántos tokens consume cada solicitud, incluyendo la parte del esquema, y compara las facturas entre proveedores antes de comprometerte con despliegues a gran escala.
  4. Probar la portabilidad – un esquema que funciona en OpenAI puede ser ignorado silenciosamente en Gemini o Claude. Realiza una comprobación rápida de coherencia en cada plataforma de destino antes de enviar el código.

Contrapunto de los proveedores

Algunos proveedores argumentan que el modo de "pensamiento" es una elección del desarrollador destinada a tareas donde la explicación es más importante que la precisión de la extracción pura. Claude ignora la bandera response_format y sugiere utilizar las llamadas a herramientas nativas de Anthropic en su lugar. Esas explicaciones son técnicamente correctas, pero trasladan la carga a los desarrolladores, quienes deben saber qué modo elegir y cómo presupuestar las tarifas de tokens ocultas.

Conclusión

Un esquema JSON ya no es una red de seguridad; es solo una forma. Asegúrate de que los datos internos coincidan con la realidad, vigila los costes de tokens ocultos y recuerda que el "pensamiento" de un modelo puede corromper incluso la salida de apariencia más limpia.