TokenGate
Documentación
docs / modelos / glm
Z

GLM (ZhipuAI)

La familia GLM está construida alrededor de "Deep Thinking": un mecanismo de cadena de pensamiento que descompone problemas complejos en pasos de análisis gradual. El pensamiento viene activado por defecto en GLM-5.2, 5.1, 5 y 4.7 — se puede desactivar por configuración cuando no lo necesitás.

Cómo funciona el razonamiento en GLM

🔗

Thinking entrelazado (interleaved)

GLM puede razonar entre llamadas a herramienta y después de recibir sus resultados, no solo antes de la primera respuesta. Los bloques de pensamiento deben preservarse explícitamente y devolverse junto con los resultados de la tool call para mantener la coherencia del razonamiento.

💾

Preserved thinking

Retiene el razonamiento de turnos previos para mejorar continuidad de contexto y eficiencia de caché. Viene activado por default en el endpoint "Coding Plan" de Z, pero desactivado por default en el endpoint estándar de API que usa TokenGate.

🎛️

Control por turno (GLM-4.7+)

Podés desactivar el pensamiento para una consulta rápida y volver a activarlo para la siguiente pregunta compleja, dentro de la misma conversación — no es una decisión de todo-o-nada por sesión.

📈

Esfuerzo graduado (5.2+)

Desde GLM-5.2 el parámetro reasoning_effort escala de minimal a max, solo aplica cuando thinking.type="enabled". Z mapea internamente: low/medium→high, xhigh→max — el control es más grueso de lo que sugiere la escala nominal.

Según la propia doc de Z, Deep Thinking conviene para arquitectura técnica, investigación académica, análisis de datos, estrategia de negocio y creatividad estructurada — y conviene desactivarlo para lookups factuales, traducción y clasificación simple, donde solo agrega latencia y consumo de tokens sin sumar calidad.

GLM-5.2 / GLM-5

glm-5.2

flagship · estándar
Contexto1M tok
Salida máx.131K tok
Esfuerzolow–xhigh

El tope de gama de Z, con razonamiento graduado real. GLM-5 es la generación previa con el mismo esquema de esfuerzo.

Cuándo usarlo: arquitectura, análisis de sistemas, investigación técnica, estrategia — cualquier tarea que se beneficie de descomposición explícita en pasos.
razonamientocódigoagentic_toolsdocumentos largos

GLM-4.7 / GLM-4.6

glm-4.7

balanced · estándar
Contexto200K tok
Salida máx.128K tok
Esfuerzobooleano (on)

Razonamiento booleano (encendido/apagado, sin gradación fina) pero con el control por turno de GLM-4.7 ya disponible. GLM-4.6 comparte specs idénticas.

Cuándo usarlo: código y chat cotidiano sin necesidad de controlar el nivel de esfuerzo con precisión.
códigochat general

GLM-4.5-Air

glm-4.5-air

fast_economical · rápido
Contexto128K tok
Esfuerzobooleano (on)

La variante liviana de la familia GLM 4.x.

Cuándo usarlo: alto volumen y baja latencia con presupuesto ajustado.
chat generalbaja latenciaalto volumen económico

Ejemplo: desactivar thinking para un lookup simple

{
  "model": "glm-5.2",
  "thinking": {"type": "disabled"},
  "messages": [{"role": "user", "content": "¿Cuál es la capital de Perú?"}]
}