TokenGate
Documentación
docs / modelos / deepseek / deepseek-v4-flash
DeepSeek Rápido / económico Rápido

Deepseek Flash

deepseek-v4-flash

El modelo más ágil de la familia DeepSeek, diseñado para respuestas en milisegundos sin perder calidad. Ideal para atención al cliente, asistentes en tiempo real y automatización inteligente. Flash Thinking: razonamiento ultrarrápido. Contexto ampliado: hasta 1M de tokens. Bajo costo por inferencia: máximo rendimiento, mínimo gasto. Lleva la inteligencia artificial instantánea a tu negocio. ¡Potencia tu flujo de trabajo con DeepSeek-V4-Flash!

De un vistazo

Modalidades — qué entra, qué sale
Texto
Texto
Contexto 1M tokens
Salida máx. 320K tokens
Disponible en Chat · API
Razonamiento lowhighmaxon

Capacidades

Streaming Respuesta token por token vía SSE con stream: true.
Tool use / funciones Llama a funciones que vos definís y encadena sus resultados.
Búsqueda web Busca en la web en tiempo real (se cobra aparte).

Precios

Precio del proveedor, sin recargo por token. El único margen de TokenGate es el platform fee del 6% sobre la recarga de saldo. Cómo funciona el billing.

Entrada $0.22 / 1M tok
Salida $0.67 / 1M tok
Caché lectura · 3% de la entrada · $0.0075
Un turno típico — 100K tokens de entrada + 20K de salida ≈ $0.0354

Franjas horarias de precio

Dentro de estas franjas de alta demanda del proveedor el precio se multiplica (hora UTC). Fuera de ellas, precio base.

0006121824
01:00–04:00 UTC · ×2.00 · peak 06:00–10:00 UTC · ×2.00 · peak

Razonamiento

low
high default
max
on

Menos esfuerzo → respuesta más rápida y barata. Más esfuerzo → más deliberación y más tokens de salida facturados. Se pasa como reasoning_effort en el body del request. Ver /docs/api.

Ejemplo

Chat Playground · deepseek-v4-flash
Respondé esta consulta de un cliente, tono cordial y en 4 líneas: "¿Cómo cambio el método de pago de mi cuenta?"
Escribí este prompt en el Chat con deepseek-v4-flash seleccionado para ver la respuesta — varía en cada turno.
Abrir en el Chat →

Fortalezas

Chat generalAlto volumen / económicoBaja latencia