Gemini
La guía de selección de Google es directa: 2.5 Pro para el máximo poder de razonamiento, 2.5 Flash para necesidades de producción balanceadas, 2.5 Flash-Lite para eficiencia y costo, y la serie 3.x para lo último en agentes y multimodal sostenido. Visión y documentos soportados en todos los modelos de la familia.
Thinking budget vs. thinking level
Gemini usa dos mecanismos de razonamiento distintos según la generación, y no son intercambiables:
Gemini 2.5 — thinking budget
Control granular por cantidad exacta de tokens de razonamiento (0 a 32.768 según el modelo). 2.5 Flash puede desactivar el pensamiento del todo (thinkingBudget: 0); 2.5 Pro no puede — siempre piensa algo. Por default, el "dynamic thinking" ajusta automáticamente el presupuesto según la complejidad del prompt.
Gemini 3.x — thinking level
Presets (minimal/low/medium/high) en vez de un número de tokens. Los modelos 3.x no pueden desactivar el pensamiento por completo — a diferencia de 2.5 Flash. 3.1 Pro Preview viene con high como default.
El trade-off es el mismo en ambos esquemas: más pensamiento = más tiempo hasta el primer token de respuesta, pero razonamiento más cuidadoso. Los tokens de pensamiento se facturan como output.
Gemini 2.5 Pro
gemini-2.5-pro
flagship · estándar"El modelo más avanzado de Google para tareas complejas, con razonamiento profundo y capacidades de código", según su propia doc.
Gemini 2.5 Flash / Flash-Lite
gemini-2.5-flash
balanced · rápido"El mejor precio-rendimiento de Google para tareas de bajo-latencia y alto volumen que igual necesitan razonamiento." A diferencia de 2.5 Pro, sí podés apagar el pensamiento del todo. Flash-Lite es "el modelo multimodal más rápido y económico de la familia 2.5", con el pensamiento apagado por default salvo que lo actives.
Gemini 3.x (3.5 Flash, 3.1 Pro Preview, 3.1 Flash-Lite)
gemini-3.5-flash / gemini-3.1-pro-preview
balanced/flagshipLa generación 3.x — pensada para "performance de frontera sostenida en tareas agénticas y multimodales". 3.1 Pro Preview suma un tramo de precio por encima de 200K tokens de prompt y contexto también de 1M.
gemini-3.1-flash-lite
fast_economical · rápidoModelo GA (uso real en producción, no preview). El tramo de audio tiene un precio distinto al de texto/imagen/video. El output ya incluye los tokens de razonamiento — no se facturan aparte. El context caching usa un esquema de storage por hora que no mapea al campo de cache write habitual de TokenGate.
Ejemplo: nivel de thinking en Gemini 3.x
{
"model": "gemini-3.1-pro-preview",
"reasoning_effort": "high",
"messages": [{"role": "user", "content": "Diseñá el schema de una app de reservas"}]
}
TokenGate traduce esto a thinkingConfig.thinkingLevel en 3.x o a thinkingConfig.thinkingBudget (con mapeo effort→tokens) en 2.5, según el modelo elegido.