Gemini 3.5 Flash genera 2.6 veces más tokens de salida por segundo que Gemini 3.1 Pro, cuesta un 25% menos por token y supera por poco a Pro en el Intelligence Index de Artificial Analysis (50 frente a 46). Gemini 3.1 Pro sigue liderando por 5 puntos en ARC-AGI-2 (77.1% frente a 72.1%), y la puntuación de Flash en recuperación de contexto largo cae de 84.9% a 77.3% una vez que superas los 128k tokens. Qué modelo usar depende de la tarea: Flash se optimiza para el rendimiento y la latencia en la llamada de herramientas, Pro se optimiza para la profundidad del razonamiento de varios pasos, y los puntos de referencia agregados promedian esas dos prioridades en una sola puntuación que oculta cuál de las dos necesita realmente tu carga de trabajo.
Tarjeta de puntuación de benchmarks: dónde lidera realmente cada modelo
| Métrica | Gemini 3.5 Flash | Gemini 3.1 Pro | Ganador |
|---|---|---|---|
| Índice de Inteligencia (Artificial Analysis) | 50 | 46 | Flash |
| ARC-AGI-2, razonamiento abstracto (BenchLM) | 72.1% | 77.1% | Pro |
| MRCR v2 en contexto de 128k (nxcode) | 77.3% (por debajo de 84.9% en contexto más corto) | no informado públicamente con la misma longitud | Datos insuficientes |
| Puntuación media multimodal (BenchLM) | 83.8 | 82.6 | Flash |
| Velocidad de salida (BenchLM) | 284.2 tok/s | 109 tok/s | Flash (2.6x) |
| GDPval-AA Elo, tareas de agentes del mundo real (apiyi) | 1656 | 1314 | Flash |
Flash gana en las métricas que miden el rendimiento y el manejo de tareas de propósito general. Pro tiene una ventaja clara y documentada en la profundidad de razonamiento de ARC-AGI-2; en la recuperación de contexto largo, Flash presenta una regresión documentada a partir de 128k tokens, pero el puntaje equivalente de Pro no está disponible públicamente, así que conviene calificar ese caso como inconcluso en lugar de una victoria de Pro. Esa división se alinea directamente con el tipo de tarea que estés ejecutando, lo cual es más útil que el único número agregado del Índice de Inteligencia.
Una advertencia metodológica de la propia comparación de BenchLM: de los aproximadamente 34 benchmarks en los que ambos modelos tienen resultados publicados, solo 3 categorías son directamente comparables — Pro tiene resultados exclusivos en 14 benchmarks, Flash en 17, y las configuraciones de presupuesto de razonamiento no siempre coinciden entre ambos. Toma la tabla anterior como fiable en términos generales; las diferencias en ARC-AGI-2 y MRCR v2 son lo bastante grandes como para confiar en ellas, pero una diferencia de 1-2 puntos en una métrica compartida no debería interpretarse como निर्णива.
Donde la ventaja de Flash se desmorona
La brecha en ARC-AGI-2 (5 puntos) es la mayor diferencia por categoría única que la comparación de BenchLM encontró entre los dos modelos. ARC-AGI-2 está diseñado específicamente para resistir atajos de coincidencia de patrones, por lo que una brecha de 5 puntos allí es una señal más fuerte sobre la profundidad del razonamiento que una brecha similar en un benchmark más convencional. El resultado MRCR v2 de nxcode añade un segundo dato en la misma dirección: la precisión de recuperación de Flash cae del 84.9% al 77.3% a medida que el contexto crece hacia 128k tokens. La puntuación de Pro en esa misma longitud no se informa públicamente, así que esto no es una pérdida documentada cara a cara para Pro — pero sí es una regresión documentada para Flash que la tabla de benchmarks de Pro no muestra.
Nota anecdótica, no evidencia de benchmark: un hilo de Reddit r/GeminiAI en el que se preguntaba a los usuarios qué modelo prefieren para tareas कठिनas hizo que algunos comentaristas describieran Flash como superior a Pro "en todo excepto el contexto largo y el [razonamiento] abstracto". Son un puñado de opiniones, no datos, pero casualmente describe las mismas dos excepciones que muestran los benchmarks, lo cual es una comprobación de cordura ligeramente útil más que una prueba de nada por sí sola.
Precios y almacenamiento en caché: la imagen real de los costes
El precio base reduce la ventaja de precio más de lo que parece a primera vista:
- Gemini 3.5 Flash: $1.50 / million input tokens, $9 / million output tokens
- Gemini 3.1 Pro: $2 / million input tokens, $12 / million output tokens
Eso es un descuento del 25% en papel, no la diferencia de 4-8x que Flash anteriormente mantenía sobre los modelos Pro más antiguos. El factor más importante es el almacenamiento en caché:
- Las escrituras en Flash cache son gratis; la entrada almacenada en caché cuesta $0.15/million tokens
- Las escrituras en Pro cache cuestan $0.38/million tokens; la entrada almacenada en caché cuesta $0.50/million tokens — más de 3x la tasa de entrada almacenada en caché de Flash
Para cualquier flujo de trabajo que reenvía el mismo prompt del sistema o contexto de documento a lo largo de múltiples turnos — agentes de chat, asistentes de programación con un contexto de base de código persistente, bots de soporte de múltiples turnos — esa brecha de caché se acumula rápidamente. Una sola solicitud apenas muestra la diferencia; una sesión de agente de mil turnos sí lo hace.
La diferencia tampoco es constante. el desglose de precios de apiyi señala que, pasada aproximadamente la barrera de 200k tokens de contexto, la diferencia de precio entre los dos modelos se reduce al 25-50%, porque la economía por token de ambos modelos converge a esa escala. Si tu carga de trabajo está dominada por documentos muy largos de una sola pasada, en lugar de llamadas cortas y repetidas, el argumento de precio a favor de Flash se debilita.
Un ejemplo concreto: un flujo de trabajo de bot de soporte que envía 1M de tokens de entrada en caché y genera 500K de tokens de salida por día. En Flash, eso es $0 por la escritura de caché más $0.15 x 1 (entrada en caché) + $9 x 0.5 (salida) = $4.65/día. En Pro, la misma carga de trabajo cuesta $0.38 (escritura de caché, una sola vez) + $0.50 x 1 (entrada en caché) + $12 x 0.5 (salida) = aproximadamente $6.88/día el primer día, estabilizándose en $6.50/día después de la primera escritura. A lo largo de un mes, esa es la diferencia entre aproximadamente $140 y $195, antes de contar el razonamiento más profundo de Pro en cualquier solicitud que realmente lo necesite.
Bucles de agente: por qué Flash gana en velocidad, no siempre en fiabilidad
el benchmark de bucle de agentes de nxcode ejecutó un bucle de agente de 8 pasos y registró que Flash completó la secuencia completa en aproximadamente 25 segundos frente a los 100 segundos de Pro: una diferencia de 4x que se amplifica con cada paso adicional. En GDPval-AA, un benchmark construido en torno a tareas de agentes de trabajo del mundo real, la puntuación Elo de Flash (1656) supera a la de Pro (1314) por 342 puntos, la mayor brecha individual en toda la tabla del benchmark.
La advertencia: esa ventaja de velocidad y puntuación asume que el bucle del agente se ejecuta sin problemas. Las mismas diferencias de ARC-AGI-2 y MRCR v2 que aparecen en tareas de razonamiento y de contexto largo son una base razonable para esperar que Flash también sea menos indulgente cuando una llamada a una herramienta devuelve algo inesperado a mitad del bucle y el agente tiene que replantear — eso es una inferencia a partir de los datos de profundidad de razonamiento anteriores, no una afirmación evaluada por separado. Si tu agente funciona de forma supervisada, con una persona verificando la salida entre pasos, la velocidad de Flash es casi una victoria gratis. Si funciona sin supervisión durante muchos pasos y sin una persona en el circuito, el margen de razonamiento de Pro es la apuesta más segura hasta que alguien publique datos de tasa de fallos para ambos.
Cuál deberías usar: una matriz de decisión basada en tareas
| Tipo de tarea | Modelo recomendado | Por qué |
|---|---|---|
| Codificación cotidiana (tests, revisión de PR, traducción entre idiomas) | Flash | La velocidad y el costo ganan; la profundidad de razonamiento no es el cuello de botella |
| Refactors profundos, diseño de algoritmos novedosos | Pro | La brecha de ARC-AGI-2 se manifiesta directamente en el razonamiento lógico de varios pasos |
| Búsqueda en documentos largos (contratos, corpus de investigación más allá de 128k tokens) | Pro | Flash tiene una regresión documentada de MRCR v2 a esta longitud; la de Pro no está publicada, pero el valor predeterminado más seguro es el modelo sin un punto débil conocido |
| Generación por lotes de alto volumen | Flash | Las escrituras en caché gratuitas y un rendimiento 2.6x importan más a escala |
| Flujos de trabajo de agentes supervisados con una persona verificando la salida | Flash | Ventaja de velocidad sin el riesgo de fiabilidad de la ejecución no supervisada |
| Cadenas de agentes no supervisadas y de alto riesgo | Pro | El margen de profundidad de razonamiento es la apuesta más segura sin que una persona detecte errores a mitad del ciclo |
| Llamadas frecuentes de varios turnos reutilizando el mismo contexto | Flash | El precio de entrada en caché es aproximadamente un tercio del de Pro |
Una regla predeterminada simple cubre la mayor parte de la matriz anterior: envía las solicitudes a Flash, a menos que se cumpla una de tres condiciones: el contexto supera los 128k tokens y la precisión de la recuperación es importante, la tarea implica razonamiento abstracto/de múltiples pasos (nuevos algoritmos, síntesis legal o de investigación), o el agente se ejecuta sin supervisión durante más de unos pocos pasos. Cualquiera de esas tres inclina la decisión hacia Pro; si no está presente ninguna de ellas, la velocidad de Flash y sus precios de caché lo convierten en la opción predeterminada más barata.
Preguntas frecuentes
¿Es Gemini 3.5 Flash mejor que 3.1 Pro?
En velocidad, costo y benchmarks de uso general, sí. En razonamiento abstracto (ARC-AGI-2), Gemini 3.1 Pro sigue liderando por 5 puntos. En recuperación de contexto largo más allá de 128k tokens, Flash tiene una regresión documentada y no se ha publicado la puntuación equivalente de Pro, así que trata esa comparación como no resuelta en lugar de una victoria confirmada de Pro. Cuál de los dos es "mejor" depende de en cuál de esas categorías cae tu tarea.
¿Cuánto más barato es Gemini 3.5 Flash que 3.1 Pro?
Unos 25% más barato en el precio base de entrada/salida ($1.50/$9 frente a $2/$12 por millón de tokens). El ahorro mayor se nota en el almacenamiento en caché: las escrituras de caché de Flash son gratuitas y la entrada en caché cuesta aproximadamente un tercio de la tarifa de Pro, lo que importa sobre todo en cargas de trabajo de varios turnos o de alto volumen.
¿Es Gemini 3.5 Flash bueno para programar?
Sí, para el trabajo diario — generación de pruebas, revisión de PR, traducción de código entre lenguajes. Para refactorizaciones profundas o diseño de algoritmos novedosos, la ventaja de Pro en los benchmarks de razonamiento abstracto suele reflejarse en la calidad del resultado.
¿Gemini 3.5 Flash maneja bien el contexto largo?
A longitudes de contexto más cortas, sí — la precisión de recuperación de MRCR v2 se mantiene en 84.9%. Más allá de 128k tokens, eso cae a 77.3%, lo que supone una brecha significativa para tareas como la revisión de contratos de múltiples documentos. La puntuación de Gemini 3.1 Pro a la misma longitud no se ha publicado, así que considérelo una limitación conocida de Flash más que una ventaja confirmada de Pro.
Conclusión
Gemini 3.5 Flash es la mejor opción predeterminada para la mayoría del trabajo diario y de gran volumen: es más rápido, más barato en caché y lo suficientemente cercano en los benchmarks generales como para que el intercambio rara vez importe. Gemini 3.1 Pro justifica su mayor costo en el razonamiento abstracto y en cadenas de agentes no supervisadas; en documentos largos de más de 128k tokens, los propios números de Flash muestran un punto débil que los de Pro no confirman ni descartan, así que considera que eso merece probarse por tu cuenta antes de comprometerte con cualquiera de las dos opciones.
Esta comparación se basa en datos públicos de benchmarks (Artificial Analysis, BenchLM, nxcode y apiyi), no en pruebas directas de la API. Gemini 3.1 Pro se lanzó con un posicionamiento centrado en el razonamiento, distinto del enfoque en velocidad de Flash. A la fecha de redacción, Gemini 3.5 Pro aún no se ha publicado — el informe apunta a un lanzamiento en julio de 2026 —, así que considérelo una instantánea que tanto los dos modelos como esta comparación tendrán que revisarse una vez que llegue la próxima versión de Pro.
