GLM-5.3 elimina la bandera “thinking: disabled”, por lo que cualquier integración que enviara {"thinking":{"type":"disabled"}} ahora devuelve un error en lugar de una respuesta. El cambio rompió docenas de suites de pruebas de la noche a la mañana y obliga a los desarrolladores a reescribir una sola línea de código para mantener sus aplicaciones en funcionamiento.

Por qué este cambio es importante

En GLM-5.2, la API permitía a los usuarios desactivar el modo de razonamiento para prompts triviales. Esa opción era un patrón común en scripts de automatización, pipelines de procesamiento por lotes y bots de baja latencia. GLM-5.3 eliminó la bandera por completo e introdujo tres niveles de esfuerzo—low, high y max—con max como valor predeterminado. El nuevo modelo siempre genera una traza de razonamiento; ya no se puede silenciar por completo.

Qué se rompió y cómo se propaga

Cuando el cuerpo de la solicitud contiene "type":"disabled", el servidor rechaza el payload, devolviendo una respuesta de error genérica. No aparecen errores de autenticación ni de sintaxis, por lo que el problema puede ser difícil de detectar hasta que falla una ejecución de regresión completa. Debido a que la bandera residía en una única función auxiliar reutilizable en muchas bases de código, el impacto se propagó tanto en grandes suites de pruebas como en endpoints de producción.

El cambio de código exacto

Reemplace el payload antiguo:

extra_body = {"thinking": {"type": "disabled"}}

con la versión compatible con GLM-5.3:

extra_body = {"thinking": {"type": "enabled", "effort": "low"}}

La clave "type":"enabled" reactiva el motor de razonamiento, mientras que "effort":"low" imita la velocidad del antiguo modo desactivado tanto como el nuevo modelo lo permita.

Implicaciones de rendimiento

Ejecutar los mismos prompts de revisión de código con la configuración de bajo esfuerzo (low-effort) produce resultados que están “cerca de la velocidad anterior”, pero no son idénticos. El modelo sigue emitiendo una traza de razonamiento, lo que añade algunos tokens extra y un ligero aumento de la latencia. En cargas de trabajo de alto rendimiento o críticas en cuanto a latencia, debe realizar pruebas de rendimiento (benchmarking) con sus propios datos para confirmar que la sobrecarga es aceptable.

Por qué migrar a pesar del coste

GLM-5.3 conserva la arquitectura de 744 mil millones de parámetros de su predecesor, pero se reenfoca en tareas de programación y de agentes. Benchmarks independientes (Terminal-Bench 3.0) muestran un salto notable en las puntuaciones, y las pruebas internas reportaron una mejor detección de errores lógicos en múltiples archivos. Para los equipos que dependen del modelo para análisis de código complejo, las mejoras de rendimiento pueden compensar el pequeño aumento en el consumo de tokens.

El compromiso que no puede ignorar

Si una aplicación realmente necesita respuestas sin razonamiento (zero-thinking)—por ejemplo, un servicio de completado de tokens puro—ahora no tiene una opción nativa en GLM-5.3. Los desarrolladores deben aceptar la salida de razonamiento adicional o cambiar a un modelo diferente que aún ofrezca un modo desactivado.

Qué observar a continuación

  • Monitoreo de latencia: Tras el cambio del payload, rastree los tiempos de respuesta y el recuento de tokens para detectar regresiones tempranamente.
  • Ajuste de esfuerzo: Algunas cargas de trabajo pueden beneficiarse de un esfuerzo “high” sin una penalización completa, así que experimente más allá de la configuración low.
  • Depreciaciones futuras: La eliminación de una sola bandera sugiere que la API podría experimentar más consolidaciones; esté atento a las próximas notas de la versión.

En resumen: Actualizar el payload de thinking a {"type":"enabled","effort":"low"} restaura la compatibilidad con GLM-5.3. Verifique la latencia y el uso de tokens en sus pipelines, y decida si las capacidades de programación mejoradas justifican la inevitable traza de razonamiento.

La discusión y el soporte de la comunidad están disponibles en el canal de Telegram de GyaanSetu AI.