DeepSeek
Ambas variantes de la V4 comparten 1M de contexto y soportan modo thinking (activado por defecto) y no-thinking en el mismo modelo — no son SKUs separados como en otros proveedores.
Cómo funciona el modo thinking
reasoning_content separado
La cadena de razonamiento viaja en un campo reasoning_content, al mismo nivel que content — no mezclado con la respuesta final.
Thinking + tool calls
El modo thinking soporta tool calls sin restricciones — el modelo puede encadenar varios ciclos de razonamiento y llamada a herramienta antes de responder. Importante: si hubo tool calls, el reasoning_content de esos turnos tenés que reenviarlo en los requests siguientes para que el modelo mantenga el hilo.
Parámetros ignorados en modo thinking
Con el modo thinking activo, temperature, top_p, presence_penalty y frequency_penalty se ignoran en silencio — no tiran error, simplemente no hacen nada.
Contexto multi-turno
En conversaciones sin tool calls no hace falta reenviar el reasoning_content de turnos anteriores. En conversaciones con tool calls, sí — es obligatorio para que el modelo no pierda el razonamiento previo.
DeepSeek V4 Flash
deepseek-v4-flash
fast_economical · rápidoContexto de 1M tokens. Modo chat y razonador unificados en el mismo modelo: activás el pensamiento con un simple toggle, sin cambiar de slug.
DeepSeek V4 Pro
deepseek-v4-pro
flagship · lentoLa variante orientada a performance de DeepSeek, mismo contexto de 1M que Flash pero con más capacidad de cómputo detrás y mayor límite de concurrencia dedicado.
Ejemplo: activar modo thinking
{
"model": "deepseek-v4-pro",
"reasoning_effort": "on",
"messages": [{"role": "user", "content": "Demostrá que la suma de los primeros n impares es n²"}]
}
// La respuesta trae:
// { "content": "...", "reasoning_content": "Empecemos con n=1..." }