Pour les équipes qui font tourner des agents à grande échelle, Gemini 3.6 Flash arrive avec deux chiffres à retenir. Lancé par Google le 21 juillet 2026, le modèle fait passer le prix des tokens de sortie de 9,00 $ à 7,50 $ par million, tout en réalisant une tâche équivalente avec environ 17 % de tokens de sortie en moins. Sur les charges très orientées génération, la facture par tâche peut donc baisser d'environ un tiers. Il dépasse aussi l'ancien 3.5 Flash — et, sur la plupart des tests, le plus imposant 3.1 Pro — en code et en tâches agentiques. Pour les utilisateurs de 3.5 Flash, la mise à niveau s'apparente presque à une évidence, même si son prix affiché n'est pas le plus bas de cette catégorie.
Les trois modèles annoncés le 21 juillet
Google a lancé simultanément trois modèles, chacun avec un positionnement distinct :
- Gemini 3.6 Flash (
gemini-3.6-flash) : le modèle généraliste qui combine rapidité et capacités avancées. Il offre un contexte de 1M de tokens, jusqu'à 64k tokens en sortie, et une date de fin des connaissances portée à mars 2026, contre janvier 2025 auparavant. - Gemini 3.5 Flash-Lite : un modèle conçu pour le très haut débit, autour de 350 tokens de sortie par seconde, avec une tarification nettement plus basse pour les tâches simples et volumineuses.
- Gemini 3.5 Flash Cyber : une variante orientée sécurité, capable d'identifier, valider et corriger des vulnérabilités. Elle fonctionne dans CodeMender et reste un pilote à accès limité destiné aux gouvernements et partenaires de confiance, pas une sortie grand public.
La page officielle présente 3.6 Flash comme « our most intelligent model built for speed », tandis que les tarifs sont publiés sur la page de tarification de l'API Gemini de Google.
Cette mise à jour ne sort pas de nulle part. Le calendrier du modèle phare Gemini 3.5 Pro a glissé, et DeepMind a indiqué avoir déjà commencé le pré-entraînement de Gemini 4. Ce rafraîchissement de la gamme Flash comble donc l'attente avant les sorties plus ambitieuses.
Tarifs de Gemini 3.6 Flash : une baisse plus ciblée qu'elle n'en a l'air
Au tarif API standard, Gemini 3.6 Flash coûte 1,50 $ par million de tokens en entrée et 7,50 $ par million de tokens en sortie — les tokens de raisonnement sont inclus dans les sorties. Le cache de contexte est facturé 0,15 $ par million de tokens, auquel s'ajoutent 1,00 $ par million de tokens et par heure de stockage.
Un point souvent absent des articles de lancement : la baisse ne concerne que la sortie. Gemini 3.5 Flash était déjà à 1,50 $ en entrée, mais facturait 9,00 $ en sortie. Le prix d'entrée reste donc identique et le tarif de sortie passe de 9,00 $ à 7,50 $, soit une réduction de 16,7 %, pas une remise généralisée. Pour une charge surtout composée d'entrées — documents longs et réponses courtes — le gain affiché sera limité. L'intérêt majeur se situe ailleurs.
Le vrai indicateur : le coût par tâche
Comparer des générations de modèles au simple prix par token ne suffit pas. La dépense réelle correspond au prix multiplié par le nombre de tokens utilisés. Ici, deux paramètres évoluent : le prix de sortie baisse de 16,7 %, et Google, via l'Artificial Analysis Index, annonce environ 17 % de tokens de sortie en moins pour un travail identique. Dans le meilleur cas, le calcul donne 0.833 × 0.83 ≈ 0.69, soit environ 31 % de moins sur les sorties.
Le résultat dépend néanmoins de la charge. J'ai donc envoyé les mêmes trois prompts — une tâche de code, un problème de raisonnement et une extraction JSON — aux deux modèles via OpenRouter, avec une température de 0, le 22 juillet 2026 :
| Mesure (3 tâches, temp. 0) | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Tokens en entrée | 146 | 145 |
| Tokens en sortie | 2,736 | 2,593 |
| Coût total | $0.0207 | $0.0236 |
| Latence totale | 5.20s | 5.19s |
Les deux modèles ont fourni des réponses correctes et comparables. Sur ce petit échantillon, 3.6 Flash ressort environ 12 % moins cher à vitesse pratiquement égale, mais il a généré quelques pourcents de tokens supplémentaires car il a davantage investi dans le raisonnement. À retenir : l'économie la plus fiable vient de la baisse du prix de sortie, de 9,00 $ à 7,50 $. Le gain d'efficacité en tokens existe à l'échelle globale, mais varie selon la tâche et ne se manifeste pas systématiquement. En pratique, prévoyez 12 à 17 % d'économie sur les sorties ; les 31 % représentent le meilleur scénario.
(Échantillon réduit : trois tâches, température 0, ce n'est pas un benchmark formel.)
Face aux autres modèles rapides, où se place Gemini 3.6 Flash ?
Le modèle le moins cher au token n'est pas forcément celui qui offre le meilleur rapport qualité-prix. Voici donc les modèles rapides côte à côte. Tous les montants correspondent aux tarifs standard, hors batch, par million de tokens, d'après les pages tarifaires officielles de leurs éditeurs.
| Modèle | Entrée /1M | Sortie /1M | Contexte |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M |
| Gemini 3.5 Flash (précédent) | $1.50 | $9.00 | 1M |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200k |
| GPT-5.6 Luna | $1.00 | $6.00 | — |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M |
Sur le seul prix affiché, 3.6 Flash ne l'emporte pas. Claude Haiku 4.5 et GPT-5.6 Luna sont moins chers en sortie, tandis que DeepSeek V4 Flash évolue dans un autre univers tarifaire. L'argument de 3.6 Flash est son niveau d'intelligence par dollar : il atteint un score de 50 à l'Artificial Analysis Intelligence Index, nettement au-dessus de la médiane des modèles rapides, pour environ 304 tokens de sortie par seconde et une fenêtre de contexte complète de 1M de tokens. Si vous cherchez des performances agentiques et de code de niveau frontier sans basculer sur les tarifs des modèles phares, il a un dossier solide. Pour minimiser absolument les coûts sur des tâches simples, les lignes moins chères restent préférables.
Quels progrès par rapport à Gemini 3.5 Flash ?
Le saut générationnel est tangible, surtout là où la gamme Flash était la moins à l'aise : le code sur des horizons longs et les tâches agentiques.
| Benchmark | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|
| DeepSWE v1.1 | 37% | 49% |
| MLE-Bench | 49.7% | 63.9% |
| OSWorld-Verified (utilisation d'ordinateur) | 78.4% | 83.0% |
| SWE-Bench Pro | 55.1% | 58.7% |
| Terminal-Bench 2.1 | 76.2% | 78.0% |
Les scores proviennent de la page des modèles Flash de Google DeepMind et d'Artificial Analysis. Les gains sur DeepSWE et MLE-Bench se distinguent particulièrement, avec respectivement 12 et 14 points de plus. Google rapporte aussi un score GDPval-AA de 1421, contre 1349. Sur plusieurs de ces tests, 3.6 Flash devance même le plus grand et plus coûteux 3.1 Pro, une situation inhabituelle pour un modèle Flash.
Gemini 3.6 Flash contre Gemini 3.1 Pro
C'est le point le plus surprenant : sur les tâches agentiques et de programmation, ce modèle de la gamme rapide bat le plus imposant et plus cher 3.1 Pro de Google. Gemini 3.1 Pro Preview est facturé entre 2,00 $ et 4,00 $ en entrée, et entre 12,00 $ et 18,00 $ en sortie par million de tokens, selon la longueur du prompt. En face, 3.6 Flash applique un tarif fixe de 1,50 $/7,50 $.
| Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
| Entrée /1M | $1.50 | $2.00–$4.00 |
| Sortie /1M | $7.50 | $12.00–$18.00 |
| DeepSWE v1.1 | 49% | 12% |
| SWE-Bench Pro | 58.7% | 54.2% |
| Terminal-Bench 2.1 | 78.0% | 73.8% |
3.1 Pro reste le modèle le plus grand et le plus cher, destiné aux problèmes de raisonnement les plus complexes et aux usages à très long contexte. Mais pour la plupart des charges de code et d'agents, 3.6 Flash est désormais à la fois moins cher et mieux noté sur les benchmarks ci-dessus. Il vaut donc la peine de le comparer à 3.1 Pro avant de choisir par défaut la gamme Pro. Le comparatif complet Gemini 3.6 Flash vs 3.1 Pro détaille les benchmarks en face-à-face, les tarifs par palier et un test de vitesse direct.
Faut-il migrer depuis Gemini 3.5 Flash ?
Pour la plupart des équipes déjà sur 3.5 Flash, oui. Sur le papier, l'équation est presque strictement favorable :
- Même prix en entrée (1,50 $/1M) et prix de sortie inférieur (7,50 $ contre 9,00 $).
- Moins de tokens de sortie pour une tâche équivalente, environ 17 % de moins.
- Date de fin des connaissances plus récente : mars 2026 contre janvier 2025.
- Meilleurs scores sur tous les benchmarks agentiques et de code présentés plus haut.
Deux vérifications s'imposent toutefois avant un passage en production. D'abord, assurez-vous que vos usages entrent dans la limite de 64k tokens en sortie ; si vous comptez sur des réponses uniques plus longues, testez cette frontière. Ensuite, exécutez votre propre jeu d'évaluation. Les gains d'efficacité en tokens et les changements dans le raisonnement peuvent modifier le comportement sur des prompts déjà optimisés. Mesurez donc la latence et la qualité de sortie sur votre trafic avant de changer le modèle par défaut.
Flash, Flash-Lite ou Cyber : quel modèle choisir ?
Trois modèles, trois usages :
- Gemini 3.6 Flash est le choix par défaut. Utilisez-le si vous visez des performances de niveau frontier en agents, code et multimodal, au prix d'un modèle rapide.
- Gemini 3.5 Flash-Lite (0,30 $/2,50 $, ~350 tokens/s) convient aux traitements à fort volume, sensibles à la latence et peu complexes : classification, extraction, routage ou chat simple. C'est le moyen le moins coûteux d'exécuter Gemini à grande échelle.
- Gemini 3.5 Flash Cyber ne concerne que les gouvernements ou partenaires sécurité validés. Il s'agit d'un pilote intégré à CodeMender, et non d'un modèle appelable via l'API standard.
Accéder à Gemini 3.6 Flash
Le modèle est disponible dans l'API Gemini et Google AI Studio. AI Studio propose un niveau gratuit pour le prototypage, avant le passage à la facturation à l'usage avec l'identifiant de modèle gemini-3.6-flash, selon le même parcours Google AI Studio gratuit puis payant que pour le reste de la gamme Gemini. Plusieurs offres entreprise sont aussi listées : Antigravity, Android Studio et Gemini Enterprise Agent Platform. Pour Vertex AI en particulier, vérifiez la disponibilité dans la console Vertex, car le déploiement y était encore en cours au 22 juillet 2026.
Voici à quoi ressemble un appel REST minimal vers l'API Gemini :
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'
Les équipes qui travaillent avec plusieurs fournisseurs préfèrent parfois passer par un agrégateur plutôt que de gérer des clés séparées. OpenRouter comme AIReiter exposent le modèle gemini-3.6-flash au prix catalogue de Google ; la différence tient aux autres modèles disponibles derrière la même clé. OpenRouter distribue les requêtes auprès de nombreux fournisseurs, tandis qu'AIReiter est compatible Anthropic et propose Gemini aux côtés de Claude. C'est pratique si vous comparez 3.6 Flash avec les tarifs de l'API Claude sur une même facture. Pour un déploiement mono-modèle, l'accès direct via Google reste le plus simple.
FAQ
Gemini 3.6 Flash est-il gratuit ?
Google AI Studio propose un niveau gratuit, avec des limites d'utilisation, pour le prototypage. En production, la facturation à l'usage est de 1,50 $ en entrée et 7,50 $ en sortie par million de tokens.
Gemini 3.6 Flash est-il meilleur que 3.5 Flash ?
Oui. Selon les benchmarks publiés, il dépasse 3.5 Flash sur DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro et Terminal-Bench, tout en coûtant moins cher par token de sortie et en utilisant moins de tokens par tâche.
Gemini 3.6 Flash est-il meilleur que Gemini 3.1 Pro ?
Oui sur les benchmarks agentiques et de code comme DeepSWE, SWE-Bench Pro et Terminal-Bench, tout en étant moins cher : 1,50 $/7,50 $ contre 2,00 $–4,00 $/12,00 $–18,00 $. Gemini 3.1 Pro est le plus grand modèle et conserve l'avantage sur les tâches de raisonnement à très long contexte et les tâches multimodales les plus difficiles. Le bon choix dépend donc de votre charge de travail.
Combien coûte Gemini 3.6 Flash ?
Le tarif standard est de 1,50 $ par million de tokens en entrée et de 7,50 $ par million de tokens en sortie. Le cache de contexte coûte 0,15 $ par million de tokens.
Quelle est la date de fin des connaissances de Gemini 3.6 Flash ?
Mars 2026, contre janvier 2025 pour le précédent Gemini 3.5 Flash.
Gemini 3.6 Flash est-il disponible sur Vertex AI ?
Sa disponibilité est confirmée dans l'API Gemini et Google AI Studio, ainsi que dans plusieurs offres entreprise. Vertex AI n'avait pas été explicitement confirmé au lancement ; consultez donc le catalogue de modèles Vertex avant de construire dessus.
Qu'est-ce que Gemini 3.5 Flash Cyber ?
Il s'agit d'une variante orientée sécurité, entraînée pour détecter, valider et corriger les vulnérabilités logicielles. Elle fonctionne dans l'agent CodeMender de Google DeepMind et reste un pilote à accès limité pour les gouvernements et partenaires de confiance, plutôt qu'un modèle public.
