Pour les tâches simples exécutées à grande échelle, Gemini 3.5 Flash-Lite est aujourd’hui la porte d’entrée la moins coûteuse dans la gamme Gemini : 0,30 $ par million de tokens en entrée et 2,50 $ en sortie. Lors d’un comparatif rapide face à Gemini 3.6 Flash, il a coûté 94 % moins cher à tâches identiques, tout en répondant plus vite et correctement. Sa contrepartie est claire : il privilégie le débit et la latence au raisonnement approfondi. Pour un volume important de requêtes peu complexes, c’est le modèle à privilégier.
Gemini 3.5 Flash-Lite en bref
Flash-Lite est le modèle le plus accessible de la famille Gemini rapide. Il vise les usages simples et volumineux, où le coût par appel et le temps de réponse comptent davantage que les capacités de raisonnement brutes. À retenir :
- Tarification : 0,30 $ en entrée / 2,50 $ en sortie par million de tokens.
- Contexte : 1 million de tokens, comme les modèles Flash plus haut de gamme.
- Vitesse : Google l’annonce autour de 350 tokens de sortie par seconde.
- Capacités : un score de 36 à l’Artificial Analysis Index, contre 50 pour le plus onéreux 3.6 Flash. C’est le compromis à accepter.
Lancé aux côtés de 3.6 Flash et de 3.5 Flash Cyber, orienté sécurité, il répond à un besoin bien distinct : classification, extraction, routage, étiquetage et chat simple à grande échelle.
Des tarifs nettement inférieurs au reste de la gamme
Comparé aux autres modèles de la série, Flash-Lite est considérablement moins cher. Tous les prix ci-dessous proviennent de la page tarifaire officielle de Google :
| Modèle | Entrée /1M | Sortie /1M |
|---|---|---|
| Gemini 3.5 Flash-Lite | 0,30 $ | 2,50 $ |
| Gemini 3.6 Flash | 1,50 $ | 7,50 $ |
| Gemini 3.5 Flash (précédent) | 1,50 $ | 9,00 $ |
Avant même de considérer le nombre réel de tokens consommés par chaque modèle, cela représente un coût d’entrée cinq fois inférieur et un coût de sortie trois fois inférieur à ceux de 3.6 Flash. C’est justement sur la consommation effective de tokens que l’écart se creuse vraiment.
Test comparatif face à 3.6 Flash
Le 22 juillet 2026, j’ai envoyé aux deux modèles les mêmes trois prompts via OpenRouter, avec une température de 0 : une tâche de code, un problème de raisonnement et une extraction JSON.
| Métrique (3 tâches, temp. 0) | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| Tokens en entrée | 147 | 148 |
| Tokens en sortie | 543 | 3,058 |
| Coût total | 0,0014 $ | 0,023 $ |
| Temps moyen avant le premier token | 1,2 s | 4,5 s |
| Vitesse de génération | plus de 400 tok/s | — |
| Réponses correctes | 3 / 3 | 3 / 3 |
Flash-Lite s’est avéré 94 % moins cher tout en répondant correctement aux trois tâches, y compris au problème de calcul d’horaires de train en plusieurs étapes. Deux éléments expliquent cet écart. D’une part, il diffuse plus de 400 tokens par seconde, au-delà des 350 annoncés, et produit son premier token plus rapidement car il ne marque pas les pauses de « réflexion » de 3.6 Flash. D’autre part, ses réponses sont bien plus concises : quelques centaines de tokens, contre plusieurs milliers pour 3.6 Flash, qui consacre beaucoup de tokens de raisonnement masqués — et facturés. Sur des tâches simples, ce raisonnement supplémentaire est inutile.
L’écart de réactivité se ressent tout autant à l’usage. Flash-Lite renvoie son premier token en 1,2 seconde en moyenne, contre 4,5 secondes pour 3.6 Flash. Dans un chat ou un pipeline à fort volume, il paraît donc tout simplement plus rapide.
Deux réserves s’imposent. D’abord, il s’agit d’une seule exécution à température 0 ; les résultats peuvent varier d’un lancement à l’autre. Ces chiffres doivent donc être vus comme indicatifs, et non comme un benchmark. Ensuite, mes trois tâches étaient faciles. L’écart d’Intelligence Index (36 contre 50) est réel et devient visible sur des problèmes plus difficiles, des agents complexes en plusieurs étapes, du code nuancé ou tout travail nécessitant un raisonnement rigoureux. Dans ces cas, le budget de réflexion limité de Flash-Lite devient une contrainte plutôt qu’une économie.
Dans quels cas choisir Flash-Lite ?
- Choisissez Gemini 3.5 Flash-Lite pour les tâches peu complexes, sensibles à la latence et exécutées en grand volume : classification, extraction d’entités, routage et triage, étiquetage, résumé de textes courts et chat simple. À ce tarif, il peut être déployé à une échelle qui serait moins confortable avec 3.6 Flash.
- Passez à 3.6 Flash dès que la tâche réclame un véritable raisonnement : code agentique, utilisation d’ordinateur, workflows en plusieurs étapes ou tout contexte où une mauvaise réponse coûte cher. Le guide complet de Gemini 3.6 Flash détaille les benchmarks et les tarifs de cette offre.
Un schéma courant consiste à combiner les deux : envoyer la majorité des requêtes simples et peu coûteuses vers Flash-Lite, puis ne faire remonter vers 3.6 Flash que les cas difficiles. Les deux modèles partagent une fenêtre de contexte de 1 million de tokens et la même API ; le changement se résume à modifier l’identifiant du modèle sur une ligne.
Accéder à Gemini 3.5 Flash-Lite
Le modèle est disponible dans l’API Gemini et Google AI Studio sous l’identifiant gemini-3.5-flash-lite. AI Studio propose un niveau gratuit pour les tests. Si vous passez par un agrégateur, OpenRouter comme AIReiter le proposent au tarif catalogue de Google, ce qui est pratique pour utiliser des modèles Gemini ou Claude derrière une même clé.
FAQ
Combien coûte Gemini 3.5 Flash-Lite ?
0,30 $ par million de tokens en entrée et 2,50 $ par million de tokens en sortie : c’est l’offre la moins chère de la gamme Gemini.
Gemini 3.5 Flash-Lite est-il gratuit ?
Google AI Studio propose un niveau gratuit pour le prototypage. En production, la facturation suit les tarifs à l’usage indiqués ci-dessus.
Quelle est la vitesse de Gemini 3.5 Flash-Lite ?
Google l’annonce autour de 350 tokens de sortie par seconde ; lors de mon test en streaming, il a dépassé 400 tokens par seconde, avec un premier token en environ 1,2 seconde.
Flash-Lite suffit-il, ou faut-il choisir 3.6 Flash ?
Pour les tâches simples et à fort volume, Flash-Lite fournit des réponses correctes pour un coût nettement inférieur. Pour les usages intensifs en raisonnement ou agentiques, l’intelligence supérieure de 3.6 Flash (Index 50 contre 36) justifie son surcoût.
