¿Puede el modelo más barato de la generación 3.5 de Google sustituir a un Pro cuyo token de entrada cuesta 6.7x más? El 23 de julio de 2026 lancé los mismos cuatro prompts a gemini-3.5-flash-lite y gemini-3.1-pro-preview. El resultado fue un empate en corrección, pero con una factura 25x distinta. Y el único fallo de Flash-Lite fue precisamente de los que rompen pipelines en producción. (¿También valoras el Flash de gama media? Tenemos esa comparativa en Gemini 3.5 Flash vs Gemini 3.1 Pro.)
Cuatro prompts idénticos: resultados reales
Usé prompts idénticos, la misma ruta de API compatible con OpenAI y evaluación programática para todas las respuestas: 8 casos de prueba locales para el ejercicio de código y un esquema estricto para la extracción.
| Tarea | Flash-Lite | 3.1 Pro | Ganador |
|---|---|---|---|
| Parser de duraciones ISO-8601 en Python (8 casos de prueba) | 8/8, 3.7s | 8/8, 38.2s | Empate en corrección |
| Extracción de JSON estricto desde un email desordenado | Campos correctos, envueltos en bloques Markdown, 1.0s | Correcto, JSON sin envoltorio, 9.8s | Pro |
| Trampa de lógica porcentual (respuesta: 50) | Correcto, 1.8s | Correcto, 10.6s | Empate |
| Revisión de código con 3 fallos introducidos | Detectó 2 de 3 + un hallazgo no introducido, 3.7s | Detectó 2 de 3 + un hallazgo no introducido, 30.2s | Empate |
Los dos modelos generaron un parser de duraciones totalmente correcto. Ambos detectaron la inyección SQL, la caché provocada por un argumento por defecto mutable y el filtrado ineficiente de la revisión de código. También se les escapó a ambos el mismo bug de zona horaria con datetimes ingenuos que había introducido. En estas cuatro tareas cotidianas, la corrección fue idéntica.
Hay dos matices. Esto es una comprobación puntual junto con la prueba de 30 llamadas que aparece más abajo, no una batería de benchmarks. Además, una llamada a Pro devolvió una negativa espuria ante el prompt inocuo de revisión de código y hubo que reintentarlo. Podría ser ruido del relay y no del modelo, pero conviene presupuestar reintentos en cualquier caso.
Dónde se rompe Flash-Lite
El tropiezo con el formato
El prompt de extracción decía "Return ONLY the JSON object." Pro devolvió JSON sin adornos. Flash-Lite entregó los datos correctos dentro de bloques ``json, por lo que una llamada posterior a json.loads()` falla hasta que añades un paso para retirarlos.
Un solo desliz podría ser ruido, así que lo medí: 30 llamadas de extracción por modelo sobre 10 emails de soporte distintos, puntuadas programáticamente por cumplimiento de JSON sin envoltorio y validez del esquema. Flash-Lite superó 29 de 30 (96.7%), con exactamente una respuesta entre bloques; 3.1 Pro superó las 30 de 30. La precisión del contenido no fue el problema en ese único fallo: los campos eran correctos, lo que fallaba era el empaquetado.
La disciplina de formato es justo uno de los casos de uso que Google promociona para este modelo: la página oficial de Flash-Lite lo presenta como "best for low-latency and high throughput agentic tasks." Una tasa de fallo del 3.3% parece asumible hasta que se acumula: un bucle de agente que invoca el modelo 20 veces por trabajo se encontrará al menos una respuesta errónea en aproximadamente la mitad de las ejecuciones (1 − 0.967²⁰ ≈ 0.49). Si envías trabajo de salida estructurada a Flash-Lite, rodéalo de un validador y un reintento: con un 3.3% de fallos, un reintento reduce el error residual a cerca del 0.1% por llamada, y en mis pruebas todos los fallos fueron de empaquetado, nunca de contenido.
Lo que Pro sigue haciendo mejor
Las cuatro tareas anteriores están dentro de la zona cómoda de Flash-Lite: contexto corto, especificación clara y una única ejecución. Los informes de la comunidad durante la semana desde su lanzamiento dibujan un límite bastante consistente. Usuarios de r/GeminiAI que trabajan con documentos largos cuentan que Pro mantiene la consistencia de personajes y trama donde los Gemini más pequeños se desvían. Los datos de índices independientes apuntan en la misma dirección: Artificial Analysis da 46 a 3.1 Pro en su Intelligence Index frente a 36 para Flash-Lite, con la brecha concentrada en evaluaciones de razonamiento de varios pasos y no en código o extracción. El mismo tracker coloca a Flash-Lite en el puesto #2 de velocidad de salida entre los 152 modelos que sigue, frente al #13 en inteligencia: perfil de especialista, no de sustituto generalista.
Mi tarea más exigente también dejó entrever ese techo: ninguno de los dos detectó el bug de zona horaria. Que Flash-Lite iguale a Pro no significa que Flash-Lite sea Pro. Significa que ambos tienen puntos ciegos y que pagas 25x por los puntos ciegos marginalmente más profundos de Pro bajo tu propio riesgo.
El límite práctico, por tanto, es este: las tareas que exigen que el modelo replanifique a mitad de tarea, mantenga coherencia durante más de 50k palabras o tome decisiones cuyo fallo sea caro siguen justificando Pro. Las tareas con forma de plantilla, no.
La factura real: 25x, no 4.8x
Las páginas de precios indican que la salida de Pro cuesta 4.8x más que la de Flash-Lite ($12 frente a $2.50 por millón de tokens). Mi gasto medido en las cuatro tareas fue de aproximadamente $0.005 con Flash-Lite y $0.13 con Pro: una diferencia de 25x (Lite facturó en total unos 570 tokens de entrada / 2,020 de salida; Pro, 1,700 / 10,386, a precios de lista).
El multiplicador son los tokens de razonamiento. Gemini 3.1 Pro razona antes de responder y Google factura ese razonamiento como salida. En la tarea del parser, Pro emitió 5,125 tokens de salida, de los cuales 4,811 (94%) eran razonamiento. Flash-Lite respondió al mismo prompt con 819 tokens exactos. Sumando las cuatro tareas, el razonamiento representó el 84% de todo lo que Pro me facturó.
La prueba de extracción de 30 llamadas amplió la diferencia en vez de reducirla, porque las salidas cortas maximizan la proporción de sobrecarga por razonamiento. Flash-Lite completó las 30 llamadas con 1,899 tokens de salida y aproximadamente $0.006 en total; Pro facturó 29,468 tokens de salida —27,636 de ellos (94%) de razonamiento— por unos $0.38: una diferencia de 65x en esta carga de trabajo. Llevado a un millón de llamadas de extracción al mes, supone pasar de una partida de $190 a otra de $12,500.
No es una rareza de mi muestra pequeña. El equipo detrás del benchmark de programación Tessl ejecutó aproximadamente 3,300 tareas de agentes de código y descubrió que Gemini 3.1 Pro acababa siendo *más barato* que el Gemini 3.5 Flash cargado de razonamiento, pese a sus precios de lista superiores: el mismo mecanismo, en sentido contrario. Las cifras de coste por índice de ejecución de Artificial Analysis muestran la misma inversión. La lección es clara: compara modelos por coste medido por tarea completada, no por la tabla de precio por token.
Especificaciones y precios, verificados el 23 de julio de 2026
Según la página oficial de precios de Gemini API de Google:
| Gemini 3.5 Flash-Lite | Gemini 3.1 Pro (≤200k ctx) | |
|---|---|---|
| Entrada / 1M de tokens | $0.30 | $2.00 ($4.00 por encima de 200k) |
| Salida / 1M de tokens (incluye razonamiento) | $2.50 | $12.00 ($18.00 por encima de 200k) |
| Tarifa Batch | $0.15 / $1.25 | $1.00 / $6.00 |
| Caché de contexto | $0.03 | $0.20 |
| Ventana de contexto | 1M de entrada / 64k de salida | 1M de entrada / 32k de salida |
| Velocidad de salida (Artificial Analysis) | 426.8 tok/s | 112.2 tok/s |
| Estado | GA, gemini-3.5-flash-lite | Preview, gemini-3.1-pro-preview |
Conviene destacar dos detalles. Flash-Lite recibió un *aumento* de precio respecto a su predecesor: 3.1 Flash-Lite costaba $0.25/$1.50, por lo que la salida sube un 67%. La justificación de Google es la capacidad: los datos publicados en su página del modelo DeepMind muestran que 3.5 Flash-Lite pasa del 38.3% al 54.2% en SWE-Bench Pro y del 31% al 54% en Terminal-bench 2.1 frente a 3.1 Flash-Lite. También hay una asimetría en los límites de salida: Flash-Lite permite 64k tokens de salida, el doble de los 32k de Pro, así que las generaciones individuales muy largas pertenecen, de forma contraintuitiva, al terreno del modelo barato.
Qué dicen los primeros usuarios
El volumen de conversación sigue siendo reducido —el modelo tenía dos días de vida en el momento de la verificación—, pero los primeros informes de producción en X se dividen en tres grupos:
- Escepticismo con el precio: "Why is 3.5 flash lite 50% more expensive. It is so sneaky," publicó @samarthg1911 el 23 de julio. La subida de precio es la queja más habitual.
- Mejoras en pipelines: el ingeniero de ML @mrdbourke informó de que es "very fast and excellent at vision" y que sustituyó a Gemini 3.5 Flash, un modelo con 3.6x su precio de salida, en algunos de sus pipelines. Otro equipo que opera herramientas de contenido lo consideró un "significant step up" frente a 3.1 Flash-Lite para interpretar jerga de internet.
- Informes de retroceso: las evaluaciones internas de un ingeniero llegaron a la conclusión opuesta ("3.5 flash lite is a real downgrade") y su equipo siguió con 3.1 Flash-Lite.
Las reseñas tempranas contradictorias suelen indicar que los puntos fuertes de un modelo dependen mucho de la carga de trabajo. Mis datos encajan con ello: excelente dentro de su carril, discretamente descuidado en los bordes.
A qué modelo enviar cada tipo de tarea
La decisión entre Gemini 3.5 Flash-Lite y Gemini 3.1 Pro no tiene por qué ser excluyente. A partir de los resultados medidos y de los fallos reportados por la comunidad, esta es la distribución que desplegaría:
Envía a Flash-Lite ($0.30/$2.50):
- Extracción estructurada, clasificación y etiquetado, con validador JSON y un reintento
- Generación de código de plantilla: parsers, convertidores y scaffolding CRUD
- Pasos de agentes de alta frecuencia: formato de llamadas a herramientas, resumir y pasar, decisiones de enrutamiento
- Procesamiento de visión a gran volumen, el bloque que ha recibido los elogios más sólidos de los primeros usuarios
- Cualquier caso en el que habrías usado 3.1 Flash-Lite: el mismo nivel ahora obtiene 16 puntos más en SWE-Bench Pro
Mantén en 3.1 Pro ($2/$12):
- Trabajo con documentos largos donde la coherencia a través de decenas de miles de palabras es el entregable, según informes de la comunidad y no probado aquí
- Tareas de agente que deben replanificarse cuando una llamada a herramienta devuelve algo inesperado
- Decisiones donde una respuesta errónea cuesta más que un mes de diferencia de precio
- Trabajo por encima de 200k de contexto, presupuestando la tarifa duplicada de $4/$18 en ese rango
El patrón que mejora elegir un único modelo es enrutar por defecto a Flash-Lite y escalar a Pro mediante disparadores concretos: fallo de validación del esquema después de un reintento, una llamada a herramienta que devuelve un error o una estructura inesperada, una entrada que supera tu zona de confort de contexto o cualquier tarea marcada aguas arriba como de alto riesgo. Con una diferencia de coste medida de 25x, mantener la tasa de escalado en torno al 15% reduce el gasto aproximadamente un 80% frente a ejecutar todo con Pro (0.85 + 0.15 × 25 = 4.6x el coste de Lite, frente a 25x).
Cómo invocar ambos modelos
Flash-Lite está en GA como gemini-3.5-flash-lite en la Gemini API, Google AI Studio y la app Gemini; 3.1 Pro continúa en preview como gemini-3.1-pro-preview. Ambos también están disponibles a través de plataformas relay compatibles con OpenAI: el catálogo de modelos Google de AIReiter lista la familia Gemini junto a otros proveedores, y así ejecuté la comparativa sin tener que alternar entre dos SDK. Si replicas la prueba, registra el número de tokens de razonamiento que informe tu endpoint en cada llamada (usage.completion_tokens_details.reasoning_tokens en rutas compatibles con OpenAI, thoughtsTokenCount en la Gemini API nativa): ese único campo es donde se esconde el 25x.
Preguntas frecuentes
¿Es Gemini 3.5 Flash-Lite mejor que Gemini 3.1 Pro?
No. Igualó a Pro en mi comprobación puntual de cuatro tareas —generación de código, extracción, lógica y revisión de código— mientras respondía 8x más rápido y facturaba 25x menos, pero Pro mantiene ventaja en consistencia con contexto largo, replanificación dinámica y profundidad de razonamiento (46 frente a 36 en el índice de Artificial Analysis).
¿Es mejor Gemini Flash o Flash-Lite?
Flash ($1.50/$9.00) es un modelo de razonamiento y obtiene mejores resultados en benchmarks de agentes; Flash-Lite ($0.30/$2.50) admite niveles de razonamiento ajustables, pero se ejecutó con cero tokens de razonamiento en mis 34 llamadas, de ahí que responda en alrededor de un segundo. Para pipelines de extracción, clasificación y visión de alto volumen, la ventaja de precio de 5-6x de Flash-Lite suele imponerse; para el razonamiento de agentes de varios pasos, paga por Flash.
¿Por qué Gemini 3.5 Flash-Lite es más caro?
Google elevó el precio del nivel frente a 3.1 Flash-Lite ($0.25/$1.50 → $0.30/$2.50, un aumento del 67% en salida) junto con grandes saltos de capacidad publicados: SWE-Bench Pro 38.3% → 54.2%, Terminal-bench 31% → 54%. Pagas más por token por un modelo que necesita menos intentos.
¿Existe Gemini 3.5 Pro?
No a fecha de 23 de julio de 2026. La generación 3.5 incluye los niveles Flash-Lite, Flash y Live Translate, además del más reciente 3.6 Flash. La última versión de la línea Pro sigue siendo 3.1 Pro en preview.
