TokenGate
Documentación
docs / modelos / deepseek
DeepSeek

DeepSeek

Ambas variantes de la V4 comparten 1M de contexto y soportan modo thinking (activado por defecto) y no-thinking en el mismo modelo — no son SKUs separados como en otros proveedores.

Cómo funciona el modo thinking

💭

reasoning_content separado

La cadena de razonamiento viaja en un campo reasoning_content, al mismo nivel que content — no mezclado con la respuesta final.

🛠️

Thinking + tool calls

El modo thinking soporta tool calls sin restricciones — el modelo puede encadenar varios ciclos de razonamiento y llamada a herramienta antes de responder. Importante: si hubo tool calls, el reasoning_content de esos turnos tenés que reenviarlo en los requests siguientes para que el modelo mantenga el hilo.

🚫

Parámetros ignorados en modo thinking

Con el modo thinking activo, temperature, top_p, presence_penalty y frequency_penalty se ignoran en silencio — no tiran error, simplemente no hacen nada.

↩️

Contexto multi-turno

En conversaciones sin tool calls no hace falta reenviar el reasoning_content de turnos anteriores. En conversaciones con tool calls, sí — es obligatorio para que el modelo no pierda el razonamiento previo.

DeepSeek V4 Flash

deepseek-v4-flash

fast_economical · rápido
Contexto1M tok
Salida máx.384K tok

Contexto de 1M tokens. Modo chat y razonador unificados en el mismo modelo: activás el pensamiento con un simple toggle, sin cambiar de slug.

Cuándo usarlo: volumen alto, chat general, cuando el presupuesto es la restricción principal.
chat generalbaja latenciaalto volumen económico

DeepSeek V4 Pro

deepseek-v4-pro

flagship · lento
Contexto1M tok
Salida máx.384K tok

La variante orientada a performance de DeepSeek, mismo contexto de 1M que Flash pero con más capacidad de cómputo detrás y mayor límite de concurrencia dedicado.

Cuándo usarlo: razonamiento y matemática donde igual querés mantenerte en la punta barata del mercado.
razonamientocódigomatemáticas

Ejemplo: activar modo thinking

{
  "model": "deepseek-v4-pro",
  "reasoning_effort": "on",
  "messages": [{"role": "user", "content": "Demostrá que la suma de los primeros n impares es n²"}]
}

// La respuesta trae:
// { "content": "...", "reasoning_content": "Empecemos con n=1..." }