Para tareas sencillas y de gran volumen, Gemini 3.5 Flash-Lite es la opción más económica de la familia Gemini: $0.30 por millón de tokens de entrada y $2.50 por millón de tokens de salida. En una comparación directa con Gemini 3.6 Flash, resultó un 94% más barato para las mismas tareas, empezó a responder antes y mantuvo respuestas correctas. La contrapartida es clara: está pensado para velocidad y escala, no para razonamiento profundo. Si procesas muchas solicitudes relativamente simples, es el modelo al que conviene recurrir.
Qué ofrece Gemini 3.5 Flash-Lite
Flash-Lite ocupa el escalón inferior dentro de la gama rápida de Gemini. Está diseñado para tareas simples y masivas, donde el coste por petición y la latencia pesan más que la capacidad de razonamiento. Estos son sus puntos clave:
- Precio: $0.30 de entrada / $2.50 de salida por cada 1M de tokens.
- Contexto: 1M de tokens, igual que los modelos Flash de mayor tamaño.
- Velocidad: Google lo sitúa en torno a 350 tokens de salida por segundo.
- Capacidad: 36 en el Artificial Analysis Index, frente a 50 de 3.6 Flash, que es más caro. Esa diferencia es el precio a pagar por el ahorro.
Llegó junto a 3.6 Flash y 3.5 Flash Cyber, centrado en seguridad, pero apunta a un uso muy distinto: clasificación, extracción, enrutamiento, etiquetado y chat sencillo a gran escala.
Precio: el Gemini más barato
Frente al resto de la gama, Flash-Lite reduce el coste de forma drástica. Todas las cifras proceden de la página oficial de precios de Google:
| Modelo | Entrada /1M | Salida /1M |
|---|---|---|
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 |
| Gemini 3.6 Flash | $1.50 | $7.50 |
| Gemini 3.5 Flash (anterior) | $1.50 | $9.00 |
Antes incluso de considerar cuántos tokens consume realmente cada modelo, Flash-Lite cuesta 5 veces menos en entrada y 3 veces menos en salida que 3.6 Flash. Ahí es donde luego se abre la diferencia de coste más relevante.
Prueba frente a 3.6 Flash
El 22 de julio de 2026 envié a ambos modelos, mediante OpenRouter y con temperatura 0, los mismos tres prompts: una tarea de programación, un problema de razonamiento y una extracción JSON.
| Métrica (3 tareas, temp. 0) | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| Tokens de entrada | 147 | 148 |
| Tokens de salida | 543 | 3,058 |
| Coste total | $0.0014 | $0.023 |
| Tiempo medio hasta el primer token | 1.2s | 4.5s |
| Velocidad de generación | más de 400 tok/s | — |
| Respuestas correctas | 3 / 3 | 3 / 3 |
Flash-Lite fue un 94% más barato y resolvió correctamente las tres tareas, incluido el problema de horarios de trenes con varios pasos. Hay dos factores detrás de esta diferencia. Por un lado, generó más de 400 tokens por segundo, por encima de los 350 que indica Google, y entregó antes el primer token porque no se detiene a «pensar» como 3.6 Flash. Por otro, es mucho más conciso: unos cientos de tokens de salida frente a varios miles. 3.6 Flash consume una cantidad importante de tokens de razonamiento ocultos que también se cobran. En tareas simples, ese razonamiento adicional es un coste que no hace falta asumir.
La diferencia de respuesta también se aprecia claramente en el uso real. Flash-Lite devuelve el primer token en unos 1.2 segundos de media, frente a los 4.5 de 3.6 Flash. En un chat o en un flujo con mucho volumen, sencillamente se siente más ágil.
Hay dos matices importantes. Primero, se trata de una única ejecución con temperatura 0, y los resultados pueden variar entre ejecuciones; las cifras exactas deben leerse como orientativas, no como un benchmark. Segundo, las tres tareas eran sencillas. La diferencia en el Intelligence Index, 36 frente a 50, es real y se hace visible en problemas difíciles, agentes complejos de varios pasos, programación con matices o cualquier caso que requiera razonamiento cuidadoso. Ahí, el limitado presupuesto de razonamiento de Flash-Lite deja de ser un ahorro y se convierte en una limitación.
Cuándo elegir Flash-Lite y cuándo subir a 3.6 Flash
- Elige Gemini 3.5 Flash-Lite para cargas de gran volumen, sensibles a la latencia y de complejidad baja: clasificación, extracción de entidades, enrutamiento y triaje, etiquetado, resúmenes de textos cortos y chat sencillo. Con este precio, puedes usarlo a una escala que resultaría incómoda con 3.6 Flash.
- Pasa a 3.6 Flash cuando la tarea necesite razonamiento real: programación agéntica, uso del ordenador, flujos de trabajo de varios pasos o cualquier escenario en el que equivocarse salga caro. La guía completa de Gemini 3.6 Flash analiza los benchmarks y precios de ese nivel.
Un patrón habitual consiste en combinar ambos: dirigir la mayoría de las solicitudes simples y baratas a Flash-Lite y escalar solo los casos difíciles a 3.6 Flash. Como ambos comparten el contexto de 1M de tokens y la misma API, el cambio se reduce a modificar en una línea el ID del modelo.
Cómo acceder a Gemini 3.5 Flash-Lite
El modelo ya está disponible en la Gemini API y en Google AI Studio con el ID gemini-3.5-flash-lite. AI Studio incluye un nivel gratuito para hacer pruebas. Si utilizas un agregador, tanto OpenRouter como AIReiter lo ofrecen al precio de lista de Google, algo práctico si combinas modelos Gemini o Claude bajo una sola clave.
Preguntas frecuentes
¿Cuánto cuesta Gemini 3.5 Flash-Lite?
$0.30 por cada 1M de tokens de entrada y $2.50 por cada 1M de tokens de salida. Es el nivel más barato de la gama Gemini.
¿Gemini 3.5 Flash-Lite es gratis?
Google AI Studio ofrece un nivel gratuito para prototipos. El uso en producción se factura según el modelo de pago por uso indicado arriba.
¿Qué velocidad tiene Gemini 3.5 Flash-Lite?
Google lo sitúa en torno a 350 tokens de salida por segundo. En mi prueba de streaming superó los 400, con un primer token en aproximadamente 1.2 segundos.
¿Es suficiente Flash-Lite o debería usar 3.6 Flash?
Para tareas simples y de gran volumen, Flash-Lite responde correctamente y cuesta mucho menos. Para trabajos intensivos en razonamiento o con agentes, la mayor capacidad de 3.6 Flash, con un índice de 50 frente a 36, justifica el coste adicional.
