Modelos
TokenGate da acceso a nueve proveedores bajo el mismo slug y la misma factura. Cada proveedor tiene su propia página con specs completas, mecánica de razonamiento, capacidades de tool use/visión y ejemplos de código — contrastado contra la documentación oficial de cada uno.
Para el catálogo activo hoy, andá a /models; cada modelo de ahí tiene además su ficha propia (/docs/modelos/<proveedor>/<modelo>) con precio, capacidades, modalidad y un ejemplo.
Regla rápida: si no sabés por dónde arrancar, usá un modelo balanced para la mayoría de las tareas, subí a un flagship cuando el problema sea genuinamente difícil (arquitectura, debugging profundo, matemática), y bajá a fast_economical para volumen alto o chat casual donde la latencia importa más que el último punto de calidad.
Qué modelo elegir
Antes de comparar proveedores uno por uno, esta es la lógica corta para llegar al tier correcto:
-
¿El problema es genuinamente difícil? arquitectura, debugging profundo, matemática
- Sí flagship
-
No — ¿latencia o volumen importan más que el último punto de calidad?
- Sí fast_economical
- No, es tarea general balanced
- ¿Necesitás tool use (agentes, editar archivos, correr comandos)? filtrá por agentic_tools en cada ficha de proveedor
- ¿Necesitás visión (imágenes/video)? Anthropic, Google, MiniMax M3 la soportan hoy
Razonamiento por proveedor, de un vistazo
Los nueve proveedores implementan "pensar antes de responder" de formas distintas — esta tabla resume el mecanismo de cada uno sin tener que entrar a las 9 fichas:
| Proveedor | Mecanismo | Control |
|---|---|---|
| Anthropic | Adaptativo | El modelo decide cuánto pensar según la tarea |
| OpenAI | Esfuerzo graduado | low/medium/high/xhigh (la serie 5.6 suma max) |
| Budget (2.5) o level (3.x) | Tokens de presupuesto explícito, o preset por nivel | |
| DeepSeek | Toggle en el mismo modelo | Booleano — sin SKUs separados |
| Z (GLM) | Deep Thinking interleaved | Por turno, incluso entre llamadas a herramientas |
| Kimi | Sostenido entre tool calls | Agentes de código multi-paso (K3: low/high/max) |
| MiniMax | Adaptive (M3) o siempre-on (M2.7) | M3 se puede desactivar; los M2.7 razonan siempre |
| Grok (xAI) | Tres niveles, no desactivable | low/medium/high en grok-4.5; grok-build-0.1 no razona |
| Esfuerzo graduado, siempre activo | minimal→xhigh; no se puede desactivar |
Elegí un proveedor
Claude
Opus 5, Opus 4.8, Sonnet 5, Fable 5, Haiku — razonamiento adaptativo, tool use y visión de alta resolución.
OpenAIGPT-5.x
Los modelos de texto razonan, con esfuerzo graduado y tool calling en paralelo; gpt-image-2 genera imagen.
GoogleGemini
2.5 (thinking budget en tokens) y 3.x (thinking level por preset) — contexto de hasta 1M tokens.
DeepSeekDeepSeek V4
Modo thinking activable con un toggle en el mismo modelo — sin SKUs separados para razonar o no.
ZGLM
Deep Thinking con control por turno y razonamiento entre llamadas a herramientas (interleaved).
KimiKimi K2
Especializado en agentes de código de varios pasos, con razonamiento sostenido entre tool calls.
MiniMaxMiniMax M-series
M3 suma visión (imagen y video) y razonamiento desactivable; los M2.x razonan siempre.
xAIGrok
Construido para código y agentes; grok-4.5 razona en tres niveles (sin apagar), grok-build-0.1 es código directo, Grok Imagine genera imagen.
Muse Spark
Contexto de 1M con entrada de texto, imagen, video y PDF; razona en todos los turnos, con esfuerzo de minimal a xhigh.
Cómo leer las fichas de cada modelo
intelligence_tier
flagship (el más capaz del proveedor) · balanced (equilibrio costo/calidad) · fast_economical (prioriza velocidad y precio).
speed_tier
Velocidad relativa de respuesta: rápido / estándar / lento.
Razonamiento graduado
Niveles tipo low/medium/high/xhigh — más esfuerzo, respuesta más deliberada, pero más tokens facturados.
Razonamiento booleano
Solo se puede prender o apagar (on), sin niveles intermedios.