TokenGate
Documentación
docs / modelos / google
Google

Gemini

La guía de selección de Google es directa: 2.5 Pro para el máximo poder de razonamiento, 2.5 Flash para necesidades de producción balanceadas, 2.5 Flash-Lite para eficiencia y costo, y la serie 3.x para lo último en agentes y multimodal sostenido. Visión y documentos soportados en todos los modelos de la familia.

Thinking budget vs. thinking level

Gemini usa dos mecanismos de razonamiento distintos según la generación, y no son intercambiables:

🎯

Gemini 2.5 — thinking budget

Control granular por cantidad exacta de tokens de razonamiento (0 a 32.768 según el modelo). 2.5 Flash puede desactivar el pensamiento del todo (thinkingBudget: 0); 2.5 Pro no puede — siempre piensa algo. Por default, el "dynamic thinking" ajusta automáticamente el presupuesto según la complejidad del prompt.

🎚️

Gemini 3.x — thinking level

Presets (minimal/low/medium/high) en vez de un número de tokens. Los modelos 3.x no pueden desactivar el pensamiento por completo — a diferencia de 2.5 Flash. 3.1 Pro Preview viene con high como default.

El trade-off es el mismo en ambos esquemas: más pensamiento = más tiempo hasta el primer token de respuesta, pero razonamiento más cuidadoso. Los tokens de pensamiento se facturan como output.

Gemini 2.5 Pro

gemini-2.5-pro

flagship · estándar
Contexto1.05M tok
Salida máx.65.5K tok
Thinkingbudget, no off

"El modelo más avanzado de Google para tareas complejas, con razonamiento profundo y capacidades de código", según su propia doc.

Cuándo usarlo: análisis complejo, código, documentos largos, con visión incluida.
razonamientocódigodocumentos largosvisión avanzada

Gemini 2.5 Flash / Flash-Lite

gemini-2.5-flash

balanced · rápido
Contexto1.05M tok
Thinkingbudget, sí off

"El mejor precio-rendimiento de Google para tareas de bajo-latencia y alto volumen que igual necesitan razonamiento." A diferencia de 2.5 Pro, podés apagar el pensamiento del todo. Flash-Lite es "el modelo multimodal más rápido y económico de la familia 2.5", con el pensamiento apagado por default salvo que lo actives.

Cuándo usarlo: Flash para producción con volumen real balanceando velocidad y calidad; Flash-Lite para throughput muy alto donde la velocidad manda sobre la capacidad máxima.
chat generalbaja latenciavisión avanzadaalto volumen económico

Gemini 3.x (3.5 Flash, 3.1 Pro Preview, 3.1 Flash-Lite)

gemini-3.5-flash / gemini-3.1-pro-preview

balanced/flagship
Contexto1.05M tok
Salida máx.65.5K tok
Thinkinglevel, no off

La generación 3.x — pensada para "performance de frontera sostenida en tareas agénticas y multimodales". 3.1 Pro Preview suma un tramo de precio por encima de 200K tokens de prompt y contexto también de 1M.

Cuándo usarlo: agentes de código que requieren llamadas a herramientas sostenidas por muchos pasos, o cuando necesitás lo último de la línea Gemini.
razonamientocódigovisión avanzada

gemini-3.1-flash-lite

fast_economical · rápido

Modelo GA (uso real en producción, no preview). El tramo de audio tiene un precio distinto al de texto/imagen/video. El output ya incluye los tokens de razonamiento — no se facturan aparte. El context caching usa un esquema de storage por hora que no mapea al campo de cache write habitual de TokenGate.

Cuándo usarlo: el mismo caso que 2.5 Flash-Lite, con las mejoras de la generación 3.x.
baja latenciaalto volumen económicochat general

Ejemplo: nivel de thinking en Gemini 3.x

{
  "model": "gemini-3.1-pro-preview",
  "reasoning_effort": "high",
  "messages": [{"role": "user", "content": "Diseñá el schema de una app de reservas"}]
}

TokenGate traduce esto a thinkingConfig.thinkingLevel en 3.x o a thinkingConfig.thinkingBudget (con mapeo effort→tokens) en 2.5, según el modelo elegido.