Google lanzó Gemini 3.6 Flash el 21 de julio de 2026 con una mejora especialmente relevante para quien opera agentes a escala: los tokens de salida bajan de $9.00 a $7.50 por millón y, según Google, el modelo completa el mismo trabajo con alrededor de un 17% menos de tokens de salida. En cargas intensivas en generación, la combinación puede recortar la factura por tarea aproximadamente un tercio. También supera al anterior 3.5 Flash y, en la mayoría de las pruebas, incluso al mayor Gemini 3.1 Pro en benchmarks de programación y uso agéntico. Para quienes ya usan 3.5 Flash, es casi una actualización gratuita, aunque no tenga el precio por token más bajo de su categoría.
Los tres modelos que Google presentó el 21 de julio
El lanzamiento reunió tres modelos orientados a necesidades distintas:
- Gemini 3.6 Flash (
gemini-3.6-flash): el modelo principal que busca equilibrar rapidez e inteligencia. Ofrece una ventana de contexto de 1M de tokens, hasta 64k tokens de salida y un corte de conocimiento actualizado a marzo de 2026, frente a enero de 2025. - Gemini 3.5 Flash-Lite: un modelo de alto rendimiento, con cerca de 350 tokens de salida por segundo y un precio mucho más bajo para tareas sencillas y de gran volumen.
- Gemini 3.5 Flash Cyber: una variante ajustada para seguridad, capaz de encontrar, validar y corregir vulnerabilidades. Se ejecuta dentro de CodeMender y está en un piloto de acceso limitado para gobiernos y socios de confianza; no es un lanzamiento general.
La página oficial presenta 3.6 Flash como «nuestro modelo más inteligente creado para la velocidad», y sus precios están publicados en la página de precios de la API de Gemini de Google.
Este lanzamiento llega en un momento de transición para Google: su buque insignia Gemini 3.5 Pro se retrasó respecto al calendario previsto y DeepMind ha señalado que ya ha empezado el preentrenamiento de Gemini 4. La renovación de Flash cubre ese espacio hasta que lleguen los modelos mayores.
Precio de Gemini 3.6 Flash: el recorte es más limitado de lo que parece
La tarifa estándar de la API para Gemini 3.6 Flash es de $1.50 por 1M de tokens de entrada y $7.50 por 1M de tokens de salida; la salida incluye los tokens de razonamiento. El caché de contexto cuesta $0.15 por 1M, más $1.00 por 1M/hora de almacenamiento.
Hay un matiz que buena parte de la cobertura del lanzamiento pasa por alto: la rebaja afecta únicamente a la salida. Gemini 3.5 Flash cobraba $1.50 por entrada y $9.00 por salida. El precio de entrada no cambia, mientras que el de salida baja de $9.00 a $7.50: un recorte del 16.7%, no un descuento generalizado. Si tu carga de trabajo recibe documentos largos y devuelve respuestas breves, el ahorro visible será modesto. La ventaja principal está en otro factor.
Importa el coste por tarea, no la tarifa por token
Comparar generaciones de modelos solo por el precio de cada token es quedarse corto. La factura real es precio × tokens consumidos. Aquí entran dos mejoras: la salida es un 16.7% más barata y Google, a través del Artificial Analysis Index, informa de alrededor de un 17% menos de tokens de salida para el mismo trabajo. En el mejor caso, el efecto combinado es aproximadamente 0.833 × 0.83 ≈ 0.69: cerca de un 31% menos en la parte de salida.
El ahorro efectivo depende de la carga de trabajo. Para comprobarlo, ejecuté los mismos tres prompts —una tarea de programación, un problema de razonamiento y una extracción JSON— en ambos modelos mediante OpenRouter, con temperatura 0, el 22 de julio de 2026:
| Métrica (3 tareas, temp 0) | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Tokens de entrada | 146 | 145 |
| Tokens de salida | 2,736 | 2,593 |
| Coste total | $0.0207 | $0.0236 |
| Latencia total | 5.20s | 5.19s |
Los dos modelos ofrecieron respuestas correctas y comparables. En esta muestra pequeña, 3.6 Flash resultó cerca de un 12% más barato, con prácticamente la misma velocidad, aunque generó unos pocos puntos porcentuales más de tokens al dedicar más recursos al razonamiento. La conclusión es clara: el ahorro fiable es la bajada del precio de salida, de $9.00 a $7.50; la eficiencia de tokens se aprecia en los agregados, pero varía según la tarea y no siempre aparecerá. En producción, conviene planificar un ahorro de entre el 12% y el 17% en salida, y considerar el 31% como el mejor escenario posible.
(Muestra pequeña: tres tareas, temperatura 0; no es un benchmark formal.)
Frente a otros modelos rápidos
El modelo más barato por token no siempre ofrece la mejor relación calidad-precio. Esta comparativa sitúa a los modelos rápidos uno junto a otro. Todas las cifras son tarifas estándar, sin batch, por 1M de tokens y proceden de las páginas oficiales de precios de cada proveedor.
| Modelo | Entrada /1M | Salida /1M | Contexto |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M |
| Gemini 3.5 Flash (anterior) | $1.50 | $9.00 | 1M |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200k |
| GPT-5.6 Luna | $1.00 | $6.00 | — |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M |
Por precio de lista, 3.6 Flash no lidera la tabla. Claude Haiku 4.5 y GPT-5.6 Luna cuestan menos en salida, mientras que DeepSeek V4 Flash juega en otra liga en costes. La propuesta de 3.6 Flash es la inteligencia por dólar: obtiene 50 en el índice de inteligencia de Artificial Analysis, muy por encima de la mediana del segmento rápido, con unos 304 tokens de salida por segundo y una ventana de contexto completa de 1M de tokens. Si necesitas calidad agéntica y de programación de frontera sin pagar precios de modelo insignia, ahí está su valor. Si tu prioridad es el coste mínimo absoluto en tareas simples, ganan las opciones más baratas.
Cuánto mejora respecto a 3.5 Flash
El salto generacional es evidente, sobre todo justo donde la familia Flash tenía más margen de mejora: programación de largo recorrido y trabajo agéntico.
| Benchmark | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|
| DeepSWE v1.1 | 37% | 49% |
| MLE-Bench | 49.7% | 63.9% |
| OSWorld-Verified (uso de ordenador) | 78.4% | 83.0% |
| SWE-Bench Pro | 55.1% | 58.7% |
| Terminal-Bench 2.1 | 76.2% | 78.0% |
Las puntuaciones proceden de la página de modelos Flash de Google DeepMind y de Artificial Analysis. Destacan especialmente las mejoras en DeepSWE y MLE-Bench: 12 y 14 puntos, respectivamente. Google también informa de una puntuación de 1421 en GDPval-AA para trabajo de conocimiento, frente a 1349. En varias de estas pruebas, 3.6 Flash supera por poco al mayor y más caro 3.1 Pro, algo inusual en un modelo Flash.
Gemini 3.6 Flash frente a 3.1 Pro
Esta es la parte más llamativa: en tareas agénticas y de programación, este modelo del segmento rápido supera al Gemini 3.1 Pro de Google, que es mayor y más caro. Gemini 3.1 Pro Preview cuesta entre $2.00 y $4.00 por entrada y entre $12.00 y $18.00 por salida por cada 1M de tokens, según la longitud del prompt; 3.6 Flash mantiene una tarifa plana de $1.50/$7.50.
| Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
| Entrada /1M | $1.50 | $2.00–$4.00 |
| Salida /1M | $7.50 | $12.00–$18.00 |
| DeepSWE v1.1 | 49% | 12% |
| SWE-Bench Pro | 58.7% | 54.2% |
| Terminal-Bench 2.1 | 78.0% | 73.8% |
3.1 Pro sigue siendo el modelo mayor y de precio superior, pensado para los problemas de razonamiento más difíciles y las tareas de contexto largo. Sin embargo, para la mayoría de las cargas de programación y agentes, 3.6 Flash es ahora más barato y obtiene mejores resultados en los benchmarks anteriores. Por eso conviene compararlo con 3.1 Pro antes de elegir por defecto la gama Pro. El análisis completo de Gemini 3.6 Flash vs 3.1 Pro incluye los benchmarks cara a cara, los precios por niveles y una prueba de velocidad práctica.
¿Conviene migrar desde Gemini 3.5 Flash?
Para la mayoría de equipos que ya usan 3.5 Flash, sí. Los números son casi estrictamente mejores:
- Mismo precio de entrada ($1.50/1M) y menor precio de salida ($7.50 frente a $9.00).
- Menos tokens de salida para la misma tarea, alrededor de un 17% menos.
- Corte de conocimiento más reciente (marzo de 2026 frente a enero de 2025).
- Mejores puntuaciones en todos los benchmarks agénticos y de programación anteriores.
Antes de sustituirlo en producción, revisa dos aspectos. Primero, confirma que tus cargas encajen en el límite máximo de 64k tokens de salida; si dependías de respuestas individuales más largas, pon a prueba ese límite. Segundo, ejecuta tu propio conjunto de evaluaciones. Las ganancias de eficiencia de tokens y los cambios en razonamiento pueden modificar el comportamiento de prompts que ya habías ajustado, así que mide latencia y calidad de salida con tu tráfico antes de cambiar el modelo predeterminado.
Flash, Flash-Lite o Cyber: cuál elegir
Tres modelos para tres escenarios:
- Gemini 3.6 Flash es la opción predeterminada. Elígelo si buscas calidad de frontera en agentes, programación y multimodalidad a un precio propio de la gama rápida.
- Gemini 3.5 Flash-Lite ($0.30/$2.50, ~350 tokens/seg.) encaja en trabajos de gran volumen, sensibles a la latencia y de menor complejidad: clasificación, extracción, enrutamiento y chat sencillo. Es la forma más barata de ejecutar Gemini a escala.
- Gemini 3.5 Flash Cyber solo es relevante para gobiernos o socios de seguridad acreditados. Es un piloto dentro de CodeMender, no un modelo disponible desde la API estándar.
Cómo acceder a Gemini 3.6 Flash
El modelo ya está disponible en la API de Gemini y en Google AI Studio. AI Studio dispone de un nivel gratuito para crear prototipos y, después, permite pasar al pago por uso con el ID de modelo gemini-3.6-flash, siguiendo la misma ruta de Google AI Studio de gratuito a pago que se aplica al resto de la familia Gemini. También aparecen listadas superficies empresariales como Antigravity, Android Studio y Gemini Enterprise Agent Platform. Si lo necesitas específicamente en Vertex AI, confirma que aparezca en la consola de Vertex, ya que su disponibilidad allí seguía desplegándose a fecha del 22 de julio de 2026.
Una llamada REST mínima a la API de Gemini tiene este aspecto:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'
Los equipos que trabajan con más de un proveedor a veces enrutan los modelos mediante un agregador, en lugar de gestionar claves separadas. Tanto OpenRouter como AIReiter ofrecen el modelo gemini-3.6-flash al precio de lista de Google; la diferencia está en los demás modelos disponibles con la misma clave. OpenRouter distribuye solicitudes entre muchos proveedores, mientras que AIReiter es compatible con Anthropic y enruta Gemini junto con Claude. Esto resulta útil si comparas 3.6 Flash con los precios de la API de Claude en una sola factura. Para un despliegue con un único modelo, acudir directamente a Google es más sencillo.
Preguntas frecuentes
¿Gemini 3.6 Flash es gratis?
Google AI Studio incluye un nivel gratuito para prototipos, con límites de uso. El uso en producción se factura por consumo a $1.50 por entrada y $7.50 por salida por cada 1M de tokens.
¿Gemini 3.6 Flash es mejor que 3.5 Flash?
Sí. En los benchmarks publicados supera a 3.5 Flash en DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro y Terminal-Bench, a la vez que cuesta menos por token de salida y utiliza menos tokens por tarea.
¿Gemini 3.6 Flash es mejor que Gemini 3.1 Pro?
En benchmarks agénticos y de programación como DeepSWE, SWE-Bench Pro y Terminal-Bench, sí, y además a un precio menor ($1.50/$7.50 frente a $2.00–$4.00/$12.00–$18.00). Gemini 3.1 Pro es el modelo más grande y sigue liderando en las tareas más difíciles de razonamiento con contexto largo y multimodalidad, por lo que la elección adecuada depende de tu carga de trabajo.
¿Cuánto cuesta Gemini 3.6 Flash?
$1.50 por 1M de tokens de entrada y $7.50 por 1M de tokens de salida en la tarifa estándar. El caché de contexto cuesta $0.15 por 1M de tokens.
¿Cuál es el corte de conocimiento de Gemini 3.6 Flash?
Marzo de 2026, frente a enero de 2025 en el anterior Gemini 3.5 Flash.
¿Gemini 3.6 Flash está disponible en Vertex AI?
Está confirmado en la API de Gemini y Google AI Studio, además de en varias superficies empresariales. Su disponibilidad en Vertex AI no se confirmó explícitamente en el lanzamiento, así que consulta el catálogo de modelos de Vertex antes de desarrollar sobre él allí.
¿Qué es Gemini 3.5 Flash Cyber?
Una variante enfocada en seguridad y ajustada para detectar, validar y corregir vulnerabilidades de software. Funciona dentro del agente CodeMender de Google DeepMind y es un piloto de acceso limitado para gobiernos y socios de confianza, no un modelo público.
