Gemini 3.6 Flash vs 3.1 Pro : prix, vitesse et verdict

Dernière mise à jour: 2026-07-23 09:45:58

Le modèle Pro n’est pas toujours le meilleur choix. Face à lui, Gemini 3.6 Flash coûte moins cher, génère plus de deux fois plus vite et devance Gemini 3.1 Pro dans presque tous les benchmarks de code et d’agents. Le plus ancien 3.1 Pro conserve un seul avantage : une légère avance sur les épreuves de raisonnement pur les plus difficiles. J’ai soumis les deux modèles à des tâches identiques et revérifié tous les tarifs et toutes les spécifications ci-dessous dans la documentation de Google et chez Artificial Analysis le 23 juillet 2026.

Le verdict en 30 secondes

Gemini 3.6 Flash

Gemini 3.1 Pro

Gagnant

Prix API (entrée/sortie par 1 M, ≤200 k)

$1.50 / $7.50

$2.00 / $12.00

Flash

Prompts longs (>200 k tokens)

même tarif fixe

$4.00 / $18.00

Flash

Vitesse de sortie

261 tokens/s

112 tokens/s

Flash

Benchmarks de code et d’agents

remporte les 4 duels

Flash

Raisonnement le plus difficile (GPQA, HLE)

avance de 1.3–6.4 pts

3.1 Pro

Date limite des connaissances

mars 2026

janvier 2025

Flash

Statut de disponibilité

disponibilité générale

Preview depuis février 2026

Flash

Si vous devez retenir l’essentiel : choisissez Gemini 3.6 Flash par défaut et ne passez à 3.1 Pro que lorsqu’une tâche exige le plus haut niveau de raisonnement. Vous pouvez aussi les opposer directement dans un chat navigateur avec vos propres prompts, sans clé API : Gemini 3.6 Flash et Gemini 3.1 Pro. La suite détaille les éléments qui étayent ce constat, dont un test en trois tâches que vous pouvez reproduire.

Un écart de prix net

Gemini 3.6 Flash applique le même tarif quelle que soit la longueur du prompt. Gemini 3.1 Pro est plus cher et ajoute un palier pour les prompts longs. Voici les tarifs API standard par million de tokens, vérifiés le 23 juillet 2026 :

Gemini 3.6 Flash

Gemini 3.1 Pro

Entrée (≤200 k)

$1.50

$2.00

Sortie (≤200 k)

$7.50

$12.00

Entrée (>200 k)

$1.50

$4.00

Sortie (>200 k)

$7.50

$18.00

Lecture du cache de contexte (≤200 k)

$0.15

$0.20

Batch (entrée/sortie, ≤200 k)

$0.75 / $3.75

$1.00 / $6.00

C’est surtout sur les sorties que la différence se ressent : 3.1 Pro facture 60% de plus par token de sortie sur les prompts courts, et jusqu’à 140% de plus au-delà de 200 k tokens.

L’écart demeure avec les remises. Le mode Batch divise les tarifs des deux modèles par deux : Pro y reste donc 60% plus cher. Le *stockage* du cache, facturé à l’heure en plus du prix de lecture par token, coûte $4.50 par million de tokens et par heure avec Pro, contre $1.00 avec Flash. Aux tarifs publics de Google, aucun mode — standard, Batch, Priority ou cache — ne rend Pro plus économique.

Test pratique : trois prompts identiques

Les grilles tarifaires supposent une consommation de tokens équivalente. J’ai donc envoyé aux deux modèles les mêmes trois prompts via OpenRouter (identifiants google/gemini-3.6-flash et google/gemini-3.1-pro-preview), avec une température de 0, le 22 juillet 2026, à raison d’une exécution chacun :

1. Code : écrire une fonction Python merge_intervals avec une docstring et un exemple d’utilisation 2. Raisonnement : un problème de rattrapage entre deux trains nécessitant de l’algèbre temps-vitesse 3. Extraction : extraire les actions à mener d’un message d’équipe désordonné sous forme de tableau JSON

Tâche

Latence Flash

Latence Pro

Coût Flash

Coût Pro

Code

2.4s

4.5s

$0.0085

$0.0102

Raisonnement

1.9s

2.4s

$0.0082

$0.0118

Extraction

1.3s

2.6s

$0.0049

$0.0057

Total

5.65s

9.48s

$0.0215

$0.0277

*Les totaux sont calculés à partir des journaux bruts en millisecondes et en tokens ; les lignes par tâche étant arrondies, l’addition d’une colonne peut différer d’un centième.*

Les deux modèles ont correctement résolu les trois tâches : intervalles bien fusionnés, bon temps de rattrapage et JSON propre. La différence se situe dans le prix payé pour chaque réponse.

Flash a généré *davantage* de tokens que Pro (2,843 contre 2,285 dans les métadonnées d’usage d’OpenRouter, principalement des tokens de raisonnement internes pour les deux modèles), tout en restant 22% moins cher et 40% plus rapide de bout en bout. Le prix de sortie plus élevé de Pro et sa génération plus lente annulent l’avantage de ses réponses plus concises. Dans les boucles agentiques, où chaque étape réintroduit cette latence, l’écart s’accumule.

Graphique à barres comparant Gemini 3.6 Flash et 3.1 Pro selon le coût par tâche et la latence, avec 3.1 Pro fixé à 100 ; Flash atteint 78 pour le coût et 60 pour la latence

Ces trois petits prompts constituent un contrôle ponctuel, pas un benchmark : les pourcentages exacts doivent donc être lus comme indicatifs. Leur tendance rejoint toutefois les mesures à plus grande échelle, examinées ci-dessous.

Code et agents : Flash fait le grand chelem

D’après les chiffres publics en face-à-face d’Artificial Analysis, 3.6 Flash dépasse l’ancien 3.1 Pro en programmation, ingénierie ML et utilisation du terminal :

Benchmark

Gemini 3.1 Pro

Gemini 3.6 Flash

DeepSWE v1.1

12%

49%

MLE-Bench

42.6%

63.9%

SWE-Bench Pro

54.2%

58.7%

Terminal-Bench 2.1

73.8%

78.0%

Graphique à barres groupées des benchmarks de code et d’agents, Gemini 3.6 Flash devant 3.1 Pro sur DeepSWE, MLE-Bench, SWE-Bench Pro et Terminal-Bench 2.1

L’écart est particulièrement marqué sur DeepSWE : 49% contre 12%. Flash devance également Pro en raisonnement multimodal (MMMU-Pro, 83.2% contre 82.4%) et remporte l’indice composite Artificial Analysis Intelligence Index, 50 à 46.

La vitesse va dans le même sens. Au 23 juillet 2026, Artificial Analysis mesure 261 tokens/seconde pour Flash, contre 112 pour 3.1 Pro, soit 2.3x plus vite. Le délai avant le premier token est de 12.8s contre 31.2s sur leur charge de travail standard. Ces valeurs incluent le temps de réflexion de chaque modèle avant le début de la réponse, ce qui explique pourquoi mes courtes tâches se sont terminées bien plus vite. À l’échelle du classement complet, Flash se place presque en tête sur les trois axes simultanément :

Graphiques du classement Artificial Analysis mettant Gemini 3.6 Flash en évidence : Intelligence Index de 50, vitesse de sortie de 261 tokens par seconde et coût pondéré de $0.50 par tâche

Une nuance importante concerne les contextes longs. Les deux modèles acceptent des entrées de 1 M de tokens, mais à cette échelle Flash est nettement meilleur pour *retrouver* l’information — MRCR retrieval à 1 M de tokens : 54% contre moins de 27% — tandis que Pro est légèrement supérieur pour *raisonner sur* de longues entrées, comme nous allons le voir.

Les cas où Gemini 3.1 Pro garde l’avantage

Pour être juste envers le fleuron de la gamme, 3.1 Pro mène sur trois benchmarks, tous centrés sur des connaissances et un raisonnement difficiles.

Benchmark

Gemini 3.1 Pro

Gemini 3.6 Flash

GPQA Diamond (sciences niveau doctorat)

94.1%

92.8%

Humanity's Last Exam (sans outils)

44.7%

38.3%

AA-LCR (raisonnement en contexte long)

72.7%

69.7%

Les écarts sont réduits sur GPQA et le raisonnement en contexte long, mais plus conséquents sur Humanity's Last Exam. Google positionne 3.1 Pro précisément pour les « tâches complexes nécessitant une vaste connaissance du monde et un raisonnement avancé à travers plusieurs modalités ». Si votre charge de travail se situe à cette frontière — questions scientifiques de niveau recherche, raisonnement en plusieurs étapes sur un document long — cette marge de performance existe et peut justifier le surcoût.

Deux réserves pratiques jouent toutefois en sa défaveur :

  • Connaissances moins récentes. La date limite des connaissances de Pro est janvier 2025, soit quatorze mois avant celle de Flash, fixée à mars 2026 : le modèle haut de gamme est moins au fait du monde actuel que le modèle économique.

  • Statut Preview. Cinq mois après son lancement en février 2026, 3.1 Pro est encore étiqueté Preview sur la page tarifaire de Google — son identifiant est d’ailleurs gemini-3.1-pro-preview — alors que Flash est proposé comme le choix stable par défaut.

Quel modèle choisir selon votre usage ?

  • Choisissez Gemini 3.6 Flash pour les agents de code, l’automatisation via terminal ou contrôle d’ordinateur, les tâches d’ingénierie ML, l’extraction ou la classification à gros volume, les applications sensibles à la latence et la recherche dans de longs documents. Dans les chiffres publiés, il est moins cher, plus rapide, plus à jour et mieux noté dans tous ces cas.

  • Choisissez Gemini 3.1 Pro si vous êtes sur du raisonnement de pointe — sciences niveau doctorat, analyse en plusieurs étapes sur de longues entrées — et que quelques points de benchmark comptent davantage que le coût, la vitesse ou la fraîcheur des connaissances. Prévoyez l’instabilité potentielle d’un modèle Preview : les identifiants des modèles de préversion peuvent être renommés ou retirés lors de l’arrivée de la version stable.

Cette comparaison ne peut pas trancher deux points à votre place : la fiabilité avec vos propres schémas d’appels d’outils, et la qualité des sorties sur les cas limites de votre domaine.

Les deux modèles passent par la même Gemini API. Le moyen le moins coûteux de les départager consiste donc à exécuter vos dix prompts les plus importants sur chacun. Mon script de trois tâches a demandé environ une minute.

Accéder aux deux modèles

Les deux modèles sont disponibles via la Gemini API et Google AI Studio, sous les identifiants gemini-3.6-flash et gemini-3.1-pro-preview. L’offre gratuite d’AI Studio suffit pour les tester côte à côte avant de vous engager.

Si vous utilisez déjà un agrégateur, OpenRouter et AIReiter proposent les deux modèles aux tarifs catalogue de Google derrière une seule clé — c’est ainsi que j’ai réalisé le test A/B ci-dessus.

FAQ

Gemini 3.6 Flash est-il meilleur que 3.1 Pro ?

Pour la plupart des usages en production, oui : il l’emporte sur les benchmarks de code, d’agents, de ML, de contrôle d’ordinateur et de multimodalité, tout en coûtant moins cher et en étant 2.3x plus rapide. 3.1 Pro ne reste devant que sur GPQA Diamond, Humanity's Last Exam et le raisonnement en contexte long, avec une avance de 1.3 à 6.4 points.

Gemini 3.6 Flash coûte-t-il moins cher que 3.1 Pro ?

Oui, dans tous les modes. En API standard, la sortie coûte $7.50 contre $12.00 par million de tokens ; au-delà de prompts de 200 k tokens, l’écart se creuse à $7.50 contre $18.00. Le mode Batch conserve le même surcoût de 60% pour Pro. Le stockage du cache coûte 4.5x plus cher avec Pro.

Lequel est le plus rapide, Gemini 3.6 Flash ou 3.1 Pro ?

Flash génère environ 261 tokens/seconde contre 112 pour 3.1 Pro (Artificial Analysis, 23 juillet 2026), et commence aussi à répondre plus tôt : 12.8s contre 31.2s avant le premier token sur les charges de travail riches en raisonnement. Dans mon test de trois tâches, cela s’est traduit par une exécution complète 40% plus rapide.

Gemini 3.1 Pro vaut-il encore le coup ?

Uniquement si vous avez besoin de son plafond de raisonnement et que vous pouvez accepter un modèle au stade Preview, avec une date limite des connaissances fixée à janvier 2025. Sous ce niveau de difficulté, les chiffres publiés n’indiquent pas que le surcoût apporte de meilleurs résultats que Flash.

À lire aussi