Le modèle Pro n’est pas toujours le meilleur choix. Face à lui, Gemini 3.6 Flash coûte moins cher, génère plus de deux fois plus vite et devance Gemini 3.1 Pro dans presque tous les benchmarks de code et d’agents. Le plus ancien 3.1 Pro conserve un seul avantage : une légère avance sur les épreuves de raisonnement pur les plus difficiles. J’ai soumis les deux modèles à des tâches identiques et revérifié tous les tarifs et toutes les spécifications ci-dessous dans la documentation de Google et chez Artificial Analysis le 23 juillet 2026.
Le verdict en 30 secondes
Gemini 3.6 Flash | Gemini 3.1 Pro | Gagnant | |
|---|---|---|---|
Prix API (entrée/sortie par 1 M, ≤200 k) | $1.50 / $7.50 | $2.00 / $12.00 | Flash |
Prompts longs (>200 k tokens) | même tarif fixe | $4.00 / $18.00 | Flash |
Vitesse de sortie | 261 tokens/s | 112 tokens/s | Flash |
Benchmarks de code et d’agents | remporte les 4 duels | — | Flash |
Raisonnement le plus difficile (GPQA, HLE) | — | avance de 1.3–6.4 pts | 3.1 Pro |
Date limite des connaissances | mars 2026 | janvier 2025 | Flash |
Statut de disponibilité | disponibilité générale | Preview depuis février 2026 | Flash |
Si vous devez retenir l’essentiel : choisissez Gemini 3.6 Flash par défaut et ne passez à 3.1 Pro que lorsqu’une tâche exige le plus haut niveau de raisonnement. Vous pouvez aussi les opposer directement dans un chat navigateur avec vos propres prompts, sans clé API : Gemini 3.6 Flash et Gemini 3.1 Pro. La suite détaille les éléments qui étayent ce constat, dont un test en trois tâches que vous pouvez reproduire.
Un écart de prix net
Gemini 3.6 Flash applique le même tarif quelle que soit la longueur du prompt. Gemini 3.1 Pro est plus cher et ajoute un palier pour les prompts longs. Voici les tarifs API standard par million de tokens, vérifiés le 23 juillet 2026 :
Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
Entrée (≤200 k) | $1.50 | $2.00 |
Sortie (≤200 k) | $7.50 | $12.00 |
Entrée (>200 k) | $1.50 | $4.00 |
Sortie (>200 k) | $7.50 | $18.00 |
Lecture du cache de contexte (≤200 k) | $0.15 | $0.20 |
Batch (entrée/sortie, ≤200 k) | $0.75 / $3.75 | $1.00 / $6.00 |
C’est surtout sur les sorties que la différence se ressent : 3.1 Pro facture 60% de plus par token de sortie sur les prompts courts, et jusqu’à 140% de plus au-delà de 200 k tokens.
L’écart demeure avec les remises. Le mode Batch divise les tarifs des deux modèles par deux : Pro y reste donc 60% plus cher. Le *stockage* du cache, facturé à l’heure en plus du prix de lecture par token, coûte $4.50 par million de tokens et par heure avec Pro, contre $1.00 avec Flash. Aux tarifs publics de Google, aucun mode — standard, Batch, Priority ou cache — ne rend Pro plus économique.
Test pratique : trois prompts identiques
Les grilles tarifaires supposent une consommation de tokens équivalente. J’ai donc envoyé aux deux modèles les mêmes trois prompts via OpenRouter (identifiants google/gemini-3.6-flash et google/gemini-3.1-pro-preview), avec une température de 0, le 22 juillet 2026, à raison d’une exécution chacun :
1. Code : écrire une fonction Python merge_intervals avec une docstring et un exemple d’utilisation 2. Raisonnement : un problème de rattrapage entre deux trains nécessitant de l’algèbre temps-vitesse 3. Extraction : extraire les actions à mener d’un message d’équipe désordonné sous forme de tableau JSON
Tâche | Latence Flash | Latence Pro | Coût Flash | Coût Pro |
|---|---|---|---|---|
Code | 2.4s | 4.5s | $0.0085 | $0.0102 |
Raisonnement | 1.9s | 2.4s | $0.0082 | $0.0118 |
Extraction | 1.3s | 2.6s | $0.0049 | $0.0057 |
Total | 5.65s | 9.48s | $0.0215 | $0.0277 |
*Les totaux sont calculés à partir des journaux bruts en millisecondes et en tokens ; les lignes par tâche étant arrondies, l’addition d’une colonne peut différer d’un centième.*
Les deux modèles ont correctement résolu les trois tâches : intervalles bien fusionnés, bon temps de rattrapage et JSON propre. La différence se situe dans le prix payé pour chaque réponse.
Flash a généré *davantage* de tokens que Pro (2,843 contre 2,285 dans les métadonnées d’usage d’OpenRouter, principalement des tokens de raisonnement internes pour les deux modèles), tout en restant 22% moins cher et 40% plus rapide de bout en bout. Le prix de sortie plus élevé de Pro et sa génération plus lente annulent l’avantage de ses réponses plus concises. Dans les boucles agentiques, où chaque étape réintroduit cette latence, l’écart s’accumule.

Ces trois petits prompts constituent un contrôle ponctuel, pas un benchmark : les pourcentages exacts doivent donc être lus comme indicatifs. Leur tendance rejoint toutefois les mesures à plus grande échelle, examinées ci-dessous.
Code et agents : Flash fait le grand chelem
D’après les chiffres publics en face-à-face d’Artificial Analysis, 3.6 Flash dépasse l’ancien 3.1 Pro en programmation, ingénierie ML et utilisation du terminal :
Benchmark | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
DeepSWE v1.1 | 12% | 49% |
MLE-Bench | 42.6% | 63.9% |
SWE-Bench Pro | 54.2% | 58.7% |
Terminal-Bench 2.1 | 73.8% | 78.0% |

L’écart est particulièrement marqué sur DeepSWE : 49% contre 12%. Flash devance également Pro en raisonnement multimodal (MMMU-Pro, 83.2% contre 82.4%) et remporte l’indice composite Artificial Analysis Intelligence Index, 50 à 46.
La vitesse va dans le même sens. Au 23 juillet 2026, Artificial Analysis mesure 261 tokens/seconde pour Flash, contre 112 pour 3.1 Pro, soit 2.3x plus vite. Le délai avant le premier token est de 12.8s contre 31.2s sur leur charge de travail standard. Ces valeurs incluent le temps de réflexion de chaque modèle avant le début de la réponse, ce qui explique pourquoi mes courtes tâches se sont terminées bien plus vite. À l’échelle du classement complet, Flash se place presque en tête sur les trois axes simultanément :

Une nuance importante concerne les contextes longs. Les deux modèles acceptent des entrées de 1 M de tokens, mais à cette échelle Flash est nettement meilleur pour *retrouver* l’information — MRCR retrieval à 1 M de tokens : 54% contre moins de 27% — tandis que Pro est légèrement supérieur pour *raisonner sur* de longues entrées, comme nous allons le voir.
Les cas où Gemini 3.1 Pro garde l’avantage
Pour être juste envers le fleuron de la gamme, 3.1 Pro mène sur trois benchmarks, tous centrés sur des connaissances et un raisonnement difficiles.
Benchmark | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
GPQA Diamond (sciences niveau doctorat) | 94.1% | 92.8% |
Humanity's Last Exam (sans outils) | 44.7% | 38.3% |
AA-LCR (raisonnement en contexte long) | 72.7% | 69.7% |
Les écarts sont réduits sur GPQA et le raisonnement en contexte long, mais plus conséquents sur Humanity's Last Exam. Google positionne 3.1 Pro précisément pour les « tâches complexes nécessitant une vaste connaissance du monde et un raisonnement avancé à travers plusieurs modalités ». Si votre charge de travail se situe à cette frontière — questions scientifiques de niveau recherche, raisonnement en plusieurs étapes sur un document long — cette marge de performance existe et peut justifier le surcoût.
Deux réserves pratiques jouent toutefois en sa défaveur :
Connaissances moins récentes. La date limite des connaissances de Pro est janvier 2025, soit quatorze mois avant celle de Flash, fixée à mars 2026 : le modèle haut de gamme est moins au fait du monde actuel que le modèle économique.
Statut Preview. Cinq mois après son lancement en février 2026, 3.1 Pro est encore étiqueté Preview sur la page tarifaire de Google — son identifiant est d’ailleurs
gemini-3.1-pro-preview— alors que Flash est proposé comme le choix stable par défaut.
Quel modèle choisir selon votre usage ?
Choisissez Gemini 3.6 Flash pour les agents de code, l’automatisation via terminal ou contrôle d’ordinateur, les tâches d’ingénierie ML, l’extraction ou la classification à gros volume, les applications sensibles à la latence et la recherche dans de longs documents. Dans les chiffres publiés, il est moins cher, plus rapide, plus à jour et mieux noté dans tous ces cas.
Choisissez Gemini 3.1 Pro si vous êtes sur du raisonnement de pointe — sciences niveau doctorat, analyse en plusieurs étapes sur de longues entrées — et que quelques points de benchmark comptent davantage que le coût, la vitesse ou la fraîcheur des connaissances. Prévoyez l’instabilité potentielle d’un modèle Preview : les identifiants des modèles de préversion peuvent être renommés ou retirés lors de l’arrivée de la version stable.
Cette comparaison ne peut pas trancher deux points à votre place : la fiabilité avec vos propres schémas d’appels d’outils, et la qualité des sorties sur les cas limites de votre domaine.
Les deux modèles passent par la même Gemini API. Le moyen le moins coûteux de les départager consiste donc à exécuter vos dix prompts les plus importants sur chacun. Mon script de trois tâches a demandé environ une minute.
Accéder aux deux modèles
Les deux modèles sont disponibles via la Gemini API et Google AI Studio, sous les identifiants gemini-3.6-flash et gemini-3.1-pro-preview. L’offre gratuite d’AI Studio suffit pour les tester côte à côte avant de vous engager.
Si vous utilisez déjà un agrégateur, OpenRouter et AIReiter proposent les deux modèles aux tarifs catalogue de Google derrière une seule clé — c’est ainsi que j’ai réalisé le test A/B ci-dessus.
FAQ
Gemini 3.6 Flash est-il meilleur que 3.1 Pro ?
Pour la plupart des usages en production, oui : il l’emporte sur les benchmarks de code, d’agents, de ML, de contrôle d’ordinateur et de multimodalité, tout en coûtant moins cher et en étant 2.3x plus rapide. 3.1 Pro ne reste devant que sur GPQA Diamond, Humanity's Last Exam et le raisonnement en contexte long, avec une avance de 1.3 à 6.4 points.
Gemini 3.6 Flash coûte-t-il moins cher que 3.1 Pro ?
Oui, dans tous les modes. En API standard, la sortie coûte $7.50 contre $12.00 par million de tokens ; au-delà de prompts de 200 k tokens, l’écart se creuse à $7.50 contre $18.00. Le mode Batch conserve le même surcoût de 60% pour Pro. Le stockage du cache coûte 4.5x plus cher avec Pro.
Lequel est le plus rapide, Gemini 3.6 Flash ou 3.1 Pro ?
Flash génère environ 261 tokens/seconde contre 112 pour 3.1 Pro (Artificial Analysis, 23 juillet 2026), et commence aussi à répondre plus tôt : 12.8s contre 31.2s avant le premier token sur les charges de travail riches en raisonnement. Dans mon test de trois tâches, cela s’est traduit par une exécution complète 40% plus rapide.
Gemini 3.1 Pro vaut-il encore le coup ?
Uniquement si vous avez besoin de son plafond de raisonnement et que vous pouvez accepter un modèle au stade Preview, avec une date limite des connaissances fixée à janvier 2025. Sous ce niveau de difficulté, les chiffres publiés n’indiquent pas que le surcoût apporte de meilleurs résultats que Flash.
