Modelos
TokenGate da acceso a ocho proveedores bajo el mismo slug y la misma factura. Cada proveedor tiene su propia página con specs completas, mecánica de razonamiento, capacidades de tool use/visión y ejemplos de código — contrastado contra la documentación oficial de cada uno. Para el catálogo activo hoy, andá a /models.
Regla rápida: si no sabés por dónde arrancar, usá un modelo balanced para la mayoría de las tareas, subí a un flagship cuando el problema sea genuinamente difícil (arquitectura, debugging profundo, matemática), y bajá a fast_economical para volumen alto o chat casual donde la latencia importa más que el último punto de calidad.
Qué modelo elegir
Antes de comparar proveedores uno por uno, esta es la lógica corta para llegar al tier correcto:
-
¿El problema es genuinamente difícil? arquitectura, debugging profundo, matemática
- Sí flagship
-
No — ¿latencia o volumen importan más que el último punto de calidad?
- Sí fast_economical
- No, es tarea general balanced
- ¿Necesitás tool use (agentes, editar archivos, correr comandos)? filtrá por agentic_tools en cada ficha de proveedor
- ¿Necesitás visión (imágenes/video)? Anthropic, Google, MiniMax M3 la soportan hoy
Razonamiento por proveedor, de un vistazo
Los ocho proveedores implementan "pensar antes de responder" de formas distintas — esta tabla resume el mecanismo de cada uno sin tener que entrar a las 8 fichas:
| Proveedor | Mecanismo | Control |
|---|---|---|
| Anthropic (Claude) | Adaptativo | El modelo decide cuánto pensar según la tarea |
| OpenAI (GPT-5.x) | Esfuerzo graduado | low/medium/high/xhigh, toda la familia razona |
| Google (Gemini) | Budget (2.5) o level (3.x) | Tokens de presupuesto explícito, o preset por nivel |
| DeepSeek | Toggle en el mismo modelo | Booleano — sin SKUs separados |
| Z (GLM) | Deep Thinking interleaved | Por turno, incluso entre llamadas a herramientas |
| Kimi | Sostenido entre tool calls | Pensado para agentes de código de varios pasos |
| MiniMax | Adaptive (M3) o siempre-on (M2.x) | M3 se puede desactivar; M2.x razona siempre |
| Grok (xAI) | Multi-agente | El nivel de esfuerzo escala cuántos agentes colaboran |
Elegí un proveedor
Claude
Fable 5, Opus 4.8, Sonnet 5, Haiku 4.5 — razonamiento adaptativo, tool use y visión de alta resolución.
OpenAIGPT-5.x
Toda la familia son modelos de razonamiento, con esfuerzo graduado y tool calling en paralelo.
GoogleGemini
2.5 (thinking budget en tokens) y 3.x (thinking level por preset) — contexto de hasta 1M tokens.
DeepSeekDeepSeek V4
Modo thinking activable con un toggle en el mismo modelo — sin SKUs separados para razonar o no.
ZGLM
Deep Thinking con control por turno y razonamiento entre llamadas a herramientas (interleaved).
KimiKimi K2
Especializado en agentes de código de varios pasos, con razonamiento sostenido entre tool calls.
MiniMaxMiniMax M-series
M3 suma visión (imagen y video) y razonamiento desactivable; los M2.x razonan siempre.
xAIGrok
Construido para código y agentes; el multi-agente usa el nivel de esfuerzo para escalar cuántos agentes colaboran.
Cómo leer las fichas de cada modelo
| Término | Qué significa |
|---|---|
intelligence_tier | flagship (el más capaz del proveedor) · balanced (equilibrio costo/calidad) · fast_economical (prioriza velocidad y precio) |
speed_tier | Velocidad relativa de respuesta: rápido / estándar / lento |
| Razonamiento graduado | Niveles tipo low/medium/high/xhigh — más esfuerzo, respuesta más deliberada, pero más tokens facturados |
| Razonamiento booleano | Solo se puede prender o apagar (on), sin niveles intermedios |