Lo normal es que gane el modelo Pro. Esta vez no. Gemini 3.6 Flash cuesta menos que Gemini 3.1 Pro, genera a más del doble de velocidad y lo supera en casi todos los benchmarks de programación y uso con agentes. El veterano 3.1 Pro conserva una única ventaja: una ligera diferencia en las pruebas de razonamiento puro más exigentes. Probé ambos modelos con las mismas tareas y volví a comprobar todos los precios y especificaciones que aparecen a continuación en la documentación de Google y Artificial Analysis el 23 de julio de 2026.
El veredicto, en 30 segundos
Gemini 3.6 Flash | Gemini 3.1 Pro | Ganador | |
|---|---|---|---|
Precio de API (entrada/salida por 1M, ≤200k) | $1.50 / $7.50 | $2.00 / $12.00 | Flash |
Prompts largos (>200k tokens) | mismo precio fijo | $4.00 / $18.00 | Flash |
Velocidad de salida | 261 tokens/s | 112 tokens/s | Flash |
Benchmarks de programación y agentes | gana los 4 duelos directos | — | Flash |
Razonamiento más difícil (GPQA, HLE) | — | aventaja por 1.3–6.4 puntos | 3.1 Pro |
Corte de conocimiento | marzo de 2026 | enero de 2025 | Flash |
Estado de lanzamiento | disponibilidad general | Preview desde febrero de 2026 | Flash |
Si solo vas a quedarte con una idea, usa Gemini 3.6 Flash por defecto y recurre a 3.1 Pro únicamente cuando la tarea exija el máximo nivel de razonamiento. También puedes saltarte el resto y enfrentar Gemini 3.6 Flash con Gemini 3.1 Pro en un chat del navegador con tus propios prompts, sin necesidad de clave de API. El resto del artículo reúne las pruebas, incluida una prueba de tres tareas que puedes reproducir.
La diferencia de precio
Gemini 3.6 Flash mantiene la misma tarifa sin importar la longitud del prompt; Gemini 3.1 Pro es más caro y añade un tramo para prompts largos. Estos son los precios estándar de la API por 1M de tokens, verificados el 23 de julio de 2026:
Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
Entrada (≤200k) | $1.50 | $2.00 |
Salida (≤200k) | $7.50 | $12.00 |
Entrada (>200k) | $1.50 | $4.00 |
Salida (>200k) | $7.50 | $18.00 |
Lectura de caché de contexto (≤200k) | $0.15 | $0.20 |
Batch (entrada/salida, ≤200k) | $0.75 / $3.75 | $1.00 / $6.00 |
La factura se nota sobre todo en la salida: 3.1 Pro cuesta un 60% más por token de salida en prompts cortos, y hasta un 140% más cuando el prompt supera los 200k tokens.
La diferencia también se mantiene con los descuentos. El modo Batch reduce a la mitad las tarifas de ambos modelos, así que Pro sigue siendo un 60% más caro. El *almacenamiento* de caché, facturado por hora además del precio de lectura por token, cuesta $4.50 por 1M de tokens por hora en Pro frente a $1.00 en Flash. Con los precios públicos de lista de Google, no hay ningún modo —estándar, Batch, Priority o caché— en el que Pro resulte más barato.
La prueba: tres tareas idénticas
Las tablas de precios parten de que ambos usan la misma cantidad de tokens, así que envié los mismos tres prompts a ambos modelos a través de OpenRouter (con los IDs de modelo google/gemini-3.6-flash y google/gemini-3.1-pro-preview) a temperatura 0 el 22 de julio de 2026, una ejecución por modelo:
1. Código: escribir una función Python merge_intervals con docstring y ejemplo de uso 2. Razonamiento: un problema verbal de alcance entre dos trenes que requiere álgebra de tiempo y velocidad 3. Extracción: obtener las tareas pendientes de un mensaje desordenado de equipo en forma de array JSON
Tarea | Latencia de Flash | Latencia de Pro | Coste de Flash | Coste de Pro |
|---|---|---|---|---|
Código | 2.4s | 4.5s | $0.0085 | $0.0102 |
Razonamiento | 1.9s | 2.4s | $0.0082 | $0.0118 |
Extracción | 1.3s | 2.6s | $0.0049 | $0.0057 |
Total | 5.65s | 9.48s | $0.0215 | $0.0277 |
*Los totales se calculan a partir de los registros sin redondear de milisegundos y tokens; las filas por tarea están redondeadas, por lo que al sumar una columna puede aparecer una diferencia de una centésima.*
Los dos modelos resolvieron correctamente las tres tareas: intervalos combinados correctos, el tiempo de alcance adecuado y JSON limpio. La diferencia estuvo en el coste de cada respuesta.
Flash generó *más* tokens que Pro (2,843 frente a 2,285 según los metadatos de uso de OpenRouter, en su mayoría tokens de razonamiento interno en ambos casos) y aun así fue un 22% más barato y un 40% más rápido de extremo a extremo. La mayor tarifa de salida y la generación más lenta de Pro pesan más que sus respuestas más concisas. En bucles con agentes, donde cada paso vuelve a pagar esa latencia, la brecha se acumula.

Tres prompts pequeños son una comprobación puntual, no un benchmark: toma los porcentajes exactos como ilustrativos. Pero la tendencia coincide con mediciones a mayor escala, que es lo que viene a continuación.
Programación y agentes: Flash gana los cuatro
En los resultados públicos cara a cara de Artificial Analysis, 3.6 Flash supera al anterior 3.1 Pro en programación, ingeniería de ML y uso de terminal:
Benchmark | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
DeepSWE v1.1 | 12% | 49% |
MLE-Bench | 42.6% | 63.9% |
SWE-Bench Pro | 54.2% | 58.7% |
Terminal-Bench 2.1 | 73.8% | 78.0% |

La mayor diferencia aparece en DeepSWE: 49% frente a 12%. Flash también aventaja ligeramente a Pro en razonamiento multimodal (MMMU-Pro, 83.2% frente a 82.4%) y se lleva el índice compuesto Artificial Analysis Intelligence Index, por 50 a 46.
La velocidad dibuja el mismo panorama. A 23 de julio de 2026, Artificial Analysis mide 261 tokens por segundo para Flash frente a 112 para 3.1 Pro (2.3x), y un tiempo hasta el primer token de 12.8s frente a 31.2s en su carga de trabajo estándar. Estas cifras del primer token incluyen el tiempo de razonamiento de cada modelo antes de empezar a responder, de ahí que mis tareas cortas terminaran mucho antes. Al ampliar la vista al ranking completo, Flash se sitúa cerca de la cabeza en los tres ejes a la vez:

Hay un matiz importante sobre el contexto largo. Ambos modelos admiten entradas de 1M de tokens, pero en el extremo Flash es mucho mejor *localizando* información (recuperación MRCR con 1M de tokens: 54% frente a menos de 27%), mientras que Pro es ligeramente mejor *razonando sobre* entradas largas, como veremos a continuación.
Los casos en que Gemini 3.1 Pro sigue por delante
Para ser justos con el buque insignia: 3.1 Pro lidera en tres benchmarks, todos ellos pruebas duras de conocimiento y razonamiento.
Benchmark | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
GPQA Diamond (ciencia de nivel doctoral) | 94.1% | 92.8% |
Humanity's Last Exam (sin herramientas) | 44.7% | 38.3% |
AA-LCR (razonamiento con contexto largo) | 72.7% | 69.7% |
Los márgenes son reducidos en GPQA y razonamiento con contexto largo, y más amplios en Humanity's Last Exam. Google posiciona 3.1 Pro precisamente para «tareas complejas que requieren un conocimiento amplio del mundo y razonamiento avanzado entre modalidades». Si tu carga de trabajo se mueve en esa frontera —preguntas científicas de nivel de investigación o razonamiento de varios pasos sobre un documento largo—, ese margen adicional existe y merece el coste.
Sin embargo, hay dos consideraciones prácticas que juegan en su contra:
Conocimiento menos actualizado. El corte de conocimiento de Pro es enero de 2025, catorce meses anterior al de Flash, marzo de 2026: el buque insignia sabe menos sobre el mundo actual que el modelo económico.
Estado Preview. Cinco meses después de su lanzamiento en febrero de 2026, 3.1 Pro sigue etiquetado como Preview en la página de precios de Google —el propio ID de modelo es
gemini-3.1-pro-preview—, mientras que Flash se ofrece como la opción estable predeterminada actual.
Qué modelo elegir
Elige Gemini 3.6 Flash para agentes de programación, automatización de terminal y uso del ordenador, tareas de ingeniería de ML, extracción o clasificación de alto volumen, aplicaciones sensibles a la latencia y recuperación en documentos largos. Según los datos publicados, es más barato, rápido, actualizado y obtiene mejores resultados en todos estos escenarios.
Elige Gemini 3.1 Pro cuando la tarea requiera razonamiento de frontera —ciencia de nivel doctoral o análisis de varios pasos sobre entradas largas— y unos pocos puntos de benchmark importen más que el coste, la velocidad o la actualización del conocimiento. Cuenta con la volatilidad propia de Preview: los IDs de modelos en preview pueden renombrarse o retirarse cuando llega la versión estable.
Hay dos aspectos que esta comparativa no puede decidir por ti: la fiabilidad con tus patrones concretos de llamadas a herramientas y la calidad de salida en los casos límite de tu dominio.
Ambos modelos se sirven a través de la misma Gemini API, así que la forma más barata de decidir es ejecutar tus diez prompts más importantes en cada uno. Mi script de tres tareas tardó alrededor de un minuto en completarse.
Cómo acceder a ambos
Los dos modelos están disponibles en la Gemini API y Google AI Studio, con los IDs de modelo gemini-3.6-flash y gemini-3.1-pro-preview. El nivel gratuito de AI Studio basta para probarlos en paralelo antes de decidirte.
Si ya trabajas mediante un agregador, OpenRouter y AIReiter exponen ambos modelos al precio de lista de Google con una sola clave; así fue como hice la prueba A/B anterior.
Preguntas frecuentes
¿Gemini 3.6 Flash es mejor que 3.1 Pro?
Para la mayoría del trabajo en producción, sí: gana en benchmarks de programación, agentes, ML, uso del ordenador y multimodalidad, además de costar menos y funcionar 2.3x más rápido. 3.1 Pro solo conserva ventaja en GPQA Diamond, Humanity's Last Exam y razonamiento con contexto largo, por entre 1.3 y 6.4 puntos.
¿Gemini 3.6 Flash es más barato que 3.1 Pro?
Sí, en todos los modos. La salida estándar de API cuesta $7.50 frente a $12.00 por 1M de tokens; la diferencia se amplía al superar prompts de 200k tokens ($7.50 frente a $18.00), y el modo Batch mantiene el mismo sobrecoste del 60% en Pro. El almacenamiento de caché es 4.5x más caro en Pro.
¿Cuál es más rápido, Gemini 3.6 Flash o 3.1 Pro?
Flash genera unos 261 tokens por segundo frente a 112 de 3.1 Pro (Artificial Analysis, 23 de julio de 2026), y además empieza a responder antes: 12.8s frente a 31.2s de tiempo hasta el primer token en cargas de trabajo intensivas en razonamiento. En mi prueba de tres tareas, eso se tradujo en un tiempo total un 40% menor.
¿Sigue mereciendo la pena usar Gemini 3.1 Pro?
Solo si necesitas su techo de razonamiento y puedes aceptar un modelo en fase Preview con un corte de conocimiento de enero de 2025. Para tareas por debajo de ese nivel de dificultad, los datos publicados no indican que el coste extra aporte mejores resultados que Flash.
