GLM (ZhipuAI)
La familia GLM está construida alrededor de "Deep Thinking": un mecanismo de cadena de pensamiento que descompone problemas complejos en pasos de análisis gradual. El pensamiento viene activado por defecto en GLM-5.2, 5.1, 5 y 4.7 — se puede desactivar por configuración cuando no lo necesitás.
Cómo funciona el razonamiento en GLM
Thinking entrelazado (interleaved)
GLM puede razonar entre llamadas a herramienta y después de recibir sus resultados, no solo antes de la primera respuesta. Los bloques de pensamiento deben preservarse explícitamente y devolverse junto con los resultados de la tool call para mantener la coherencia del razonamiento.
Preserved thinking
Retiene el razonamiento de turnos previos para mejorar continuidad de contexto y eficiencia de caché. Viene activado por default en el endpoint "Coding Plan" de Z, pero desactivado por default en el endpoint estándar de API que usa TokenGate.
Control por turno (GLM-4.7+)
Podés desactivar el pensamiento para una consulta rápida y volver a activarlo para la siguiente pregunta compleja, dentro de la misma conversación — no es una decisión de todo-o-nada por sesión.
Esfuerzo graduado (5.2+)
Desde GLM-5.2 el parámetro reasoning_effort escala de minimal a max, solo aplica cuando thinking.type="enabled". Z mapea internamente: low/medium→high, xhigh→max — el control es más grueso de lo que sugiere la escala nominal.
Según la propia doc de Z, Deep Thinking conviene para arquitectura técnica, investigación académica, análisis de datos, estrategia de negocio y creatividad estructurada — y conviene desactivarlo para lookups factuales, traducción y clasificación simple, donde solo agrega latencia y consumo de tokens sin sumar calidad.
GLM-5.2 / GLM-5
glm-5.2
flagship · estándarEl tope de gama de Z, con razonamiento graduado real. GLM-5 es la generación previa con el mismo esquema de esfuerzo.
GLM-4.7 / GLM-4.6
glm-4.7
balanced · estándarRazonamiento booleano (encendido/apagado, sin gradación fina) pero con el control por turno de GLM-4.7 ya disponible. GLM-4.6 comparte specs idénticas.
GLM-4.5-Air
glm-4.5-air
fast_economical · rápidoLa variante liviana de la familia GLM 4.x.
Ejemplo: desactivar thinking para un lookup simple
{
"model": "glm-5.2",
"thinking": {"type": "disabled"},
"messages": [{"role": "user", "content": "¿Cuál es la capital de Perú?"}]
}