Gemini 3.5 Flash vs Gemini 3.1 Pro : la comparaison complète

Dernière mise à jour: 2026-07-15 02:21:42

Gemini 3.5 Flash génère 2,6x le nombre de jetons de sortie par seconde de Gemini 3.1 Pro, coûte 25 % de moins par jeton et devance légèrement Pro dans l’Index d’intelligence d’Artificial Analysis (50 contre 46). Gemini 3.1 Pro reste en tête de 5 points sur ARC-AGI-2 (77,1 % contre 72,1 %), et le score de Flash en récupération à contexte long chute de 84,9 % à 77,3 % une fois que vous dépassez 128k jetons. Le modèle à utiliser dépend de la tâche : Flash optimise le débit et la latence des appels d’outils, Pro optimise la profondeur du raisonnement en plusieurs étapes, et les benchmarks agrégés moyennent ces deux priorités en un seul score qui masque laquelle de ces exigences votre charge de travail nécessite réellement.

Tableau de bord des benchmarks : là où chaque modèle est réellement en tête

Gemini 3.5 Flash vs Gemini 3.1 Pro benchmark comparison chart
MétriqueGemini 3.5 FlashGemini 3.1 ProGagnant
Indice d'intelligence (Artificial Analysis)5046Flash
ARC-AGI-2, raisonnement abstrait (BenchLM)72.1%77.1%Pro
MRCR v2 à un contexte de 128k (nxcode)77.3% (en baisse par rapport à 84.9% dans un contexte plus court)non communiqué publiquement à la même longueurDonnées insuffisantes
Score moyen multimodal (BenchLM)83.882.6Flash
Vitesse de sortie (BenchLM)284.2 tok/s109 tok/sFlash (2.6x)
GDPval-AA Elo, tâches d'agent du monde réel (apiyi)16561314Flash

Flash l’emporte sur les métriques qui mesurent le débit et la gestion des tâches généralistes. Pro dispose d’une avance claire et documentée sur la profondeur de raisonnement ARC-AGI-2 ; pour la récupération en contexte long, Flash présente une régression documentée au-delà de 128k tokens, mais le score équivalent de Pro n’est pas disponible publiquement, donc il faut considérer ce point comme non concluant plutôt que comme une victoire de Pro. Cette répartition correspond directement au type de tâche que vous exécutez, ce qui est plus utile que le simple chiffre agrégé de l’Intelligence Index.

Une réserve méthodologique tirée de la propre comparaison de BenchLM : parmi les quelque 34 benchmarks pour lesquels les deux modèles ont publié des résultats, seulement 3 catégories sont directement comparables — Pro a des résultats exclusifs sur 14 benchmarks, Flash sur 17, et les paramètres de thinking-budget ne sont pas toujours alignés entre les deux. Considérez le tableau ci-dessus comme fiable dans ses grandes lignes ; les écarts sur ARC-AGI-2 et MRCR v2 sont suffisamment importants pour être dignes de confiance, mais une différence de 1 à 2 points sur une métrique commune ne doit pas être interprétée comme décisive.

Où l'avance de Flash s'effrite

L’écart ARC-AGI-2 (5 points) est la plus grande différence par catégorie unique que la comparaison de BenchLM a trouvée entre les deux modèles. ARC-AGI-2 est conçu spécifiquement pour résister aux raccourcis de correspondance de motifs, donc un écart de 5 points à cet endroit est un signal plus fort sur la profondeur du raisonnement qu’un écart similaire sur un benchmark plus conventionnel. Le résultat MRCR v2 de nxcode ajoute un deuxième point de données dans le même sens : la précision de récupération de Flash elle-même chute de 84.9% à 77.3% à mesure que le contexte s’approche de 128k tokens. Le score de Pro à la même longueur n’est pas publiquement rapporté, donc il ne s’agit pas d’une perte directe documentée pour Pro — mais il s’agit bien d’une régression documentée pour Flash que le tableau de benchmarks de Pro ne montre pas.

Note anecdotique, pas une preuve issue de benchmarks : un fil Reddit r/GeminiAI demandant aux utilisateurs quel modèle ils préfèrent pour les tâches difficiles a vu des commentateurs décrire Flash comme surpassant Pro « dans tout sauf le long contexte, le [raisonnement] abstrait. » Il s’agit d’une poignée d’opinions, pas de données — mais cela se trouve décrire les deux mêmes exceptions que montrent les benchmarks, ce qui constitue un contrôle de cohérence légèrement utile plutôt qu’une preuve de quoi que ce soit à lui seul.

Tarification et mise en cache : le véritable tableau des coûts

La tarification de base réduit l’avantage de prix plus qu’il n’y paraît au premier abord :

  • Gemini 3.5 Flash : $1.50 / million input tokens, $9 / million output tokens
  • Gemini 3.1 Pro : $2 / million input tokens, $12 / million output tokens

Cela représente une remise de 25 % sur le papier, et non l’écart de 4 à 8x que Flash détenait auparavant sur les anciens modèles Pro. Le levier le plus important est la mise en cache :

  • Les écritures en cache Flash sont gratuites ; l’entrée mise en cache coûte 0,15 $/million de tokens
  • Les écritures en cache Pro coûtent 0,38 $/million de tokens ; l’entrée mise en cache coûte 0,50 $/million de tokens — plus de 3 fois le tarif d’entrée mise en cache de Flash

Pour tout workflow qui renvoie le même prompt système ou le même contexte de document au fil de plusieurs tours — agents de chat, assistants de codage avec un contexte de base de code persistant, bots d’assistance multi-tours — cet écart de cache se cumule rapidement. Une seule requête montre à peine la différence ; une session d’agent de mille tours, oui.

L’écart n’est pas non plus constant. la répartition tarifaire d’apiyi note qu’au-delà d’environ 200k tokens de contexte, la différence de prix entre les deux modèles se réduit à 25-50 %, car l’économie par token des deux modèles converge à cette échelle. Si votre charge de travail est dominée par des documents uniques très longs plutôt que par des appels répétés courts, l’argument tarifaire en faveur de Flash s’affaiblit.

Un exemple concret : un workflow de bot d’assistance qui envoie 1M de jetons d’entrée mis en cache et génère 500K jetons de sortie par jour. Sur Flash, cela coûte 0 $ pour l’écriture du cache, plus 0,15 $ x 1 (entrée mise en cache) + 9 $ x 0,5 (sortie) = 4,65 $/jour. Sur Pro, la même charge de travail coûte 0,38 $ (écriture du cache, une seule fois) + 0,50 $ x 1 (entrée mise en cache) + 12 $ x 0,5 (sortie) = environ 6,88 $/jour le premier jour, puis 6,50 $/jour après la première écriture. Sur un mois, cela fait la différence entre environ 140 $ et 195 $ — sans compter le raisonnement plus poussé de Pro pour toute requête qui en a réellement besoin.

Boucles d’agent : pourquoi Flash l’emporte en vitesse, pas toujours en fiabilité

Le benchmark agent-loop de nxcode a exécuté une boucle d'agent en 8 étapes et a chronométré Flash terminant la séquence complète en environ 25 secondes contre 100 secondes pour Pro — un écart de 4x qui se creuse à chaque étape supplémentaire. Sur GDPval-AA, un benchmark construit autour de tâches d'agent de travail intellectuel du monde réel, le score Elo de Flash (1656) bat celui de Pro (1314) de 342 points, l'écart le plus important de tout le tableau du benchmark.

La réserve : cet avantage de vitesse et de score suppose que la boucle de l’agent s’exécute sans accroc. Les mêmes écarts ARC-AGI-2 et MRCR v2 qui apparaissent dans les tâches de raisonnement et de long contexte constituent une base raisonnable pour penser que Flash est aussi moins tolérant lorsqu’un appel d’outil renvoie quelque chose d’inattendu au milieu de la boucle et que l’agent doit replanifier — c’est une inférence tirée des données de profondeur de raisonnement ci-dessus, pas une affirmation évaluée séparément. Si votre agent fonctionne en supervision, avec un humain vérifiant la sortie entre les étapes, la vitesse de Flash est presque un gain gratuit. S’il fonctionne sans supervision pendant de nombreuses étapes, sans humain dans la boucle, la marge de raisonnement de Pro est le choix le plus sûr jusqu’à ce que quelqu’un publie des données sur les taux d’échec pour les deux.

Lequel devriez-vous utiliser : une matrice de décision basée sur les tâches

Type de tâcheModèle recommandéPourquoi
Codage quotidien (tests, revue de PR, traduction entre langues)FlashLa vitesse et le coût l’emportent, la profondeur du raisonnement n’est pas le facteur limitant
Refactorisations en profondeur, conception d’algorithmes novateursProL’écart d’ARC-AGI-2 se manifeste directement dans le raisonnement logique en plusieurs étapes
Recherche dans de longs documents (contrats, corpus de recherche au-delà de 128k tokens)ProFlash présente une régression documentée de MRCR v2 à cette longueur ; celle de Pro n’est pas publiée, mais le choix par défaut le plus sûr est le modèle sans point faible connu
Génération par lots à haut volumeFlashLes écritures de cache gratuites et un débit 2.6x comptent le plus à grande échelle
Flux de travail d’agents supervisés avec un humain qui vérifie la sortieFlashAvantage de vitesse sans le risque de fiabilité lié à l’absence de supervision
Chaînes d’agents non supervisées à fort enjeuProLa marge de profondeur de raisonnement est le pari le plus sûr sans humain pour détecter les erreurs en cours de boucle
Appels multi-tours fréquents réutilisant le même contexteFlashLe prix des entrées mises en cache est d’environ un tiers de celui de Pro

Une règle par défaut simple couvre la plupart du tableau ci-dessus : envoyez les requêtes à Flash sauf si l’une des trois conditions suivantes est vraie — le contexte dépasse 128k tokens et la précision de la récupération est importante, la tâche relève d’un raisonnement abstrait/multitâche (nouveaux algorithmes, synthèse juridique ou de recherche), ou l’agent fonctionne sans supervision pendant plus de quelques étapes. La présence d’un seul de ces trois éléments fait pencher la décision vers Pro ; en l’absence des trois, la vitesse de Flash et sa tarification du cache en font le choix par défaut le moins cher.

FAQ

Gemini 3.5 Flash est-il meilleur que 3.1 Pro ?

En termes de vitesse, de coût et de benchmarks à usage général, oui. En raisonnement abstrait (ARC-AGI-2), Gemini 3.1 Pro conserve une avance de 5 points. Pour la récupération en long contexte au-delà de 128k tokens, Flash présente une régression documentée et le score équivalent de Pro n'est pas publié, donc considérez cette comparaison comme non résolue plutôt que comme une victoire confirmée de Pro. Lequel est « meilleur » dépend de la catégorie dans laquelle se situe votre tâche.

De combien Gemini 3.5 Flash est-il moins cher que 3.1 Pro ?

Environ 25 % moins cher sur la tarification de base des entrées/sorties (1,50 $/9 $ contre 2 $/12 $ par million de tokens). Les économies les plus importantes apparaissent dans la mise en cache : les écritures de cache de Flash sont gratuites et les entrées mises en cache coûtent environ un tiers du tarif de Pro, ce qui compte surtout pour les charges de travail à plusieurs tours ou à volume élevé.

Gemini 3.5 Flash est-il bon pour le codage ?

Oui, pour le travail quotidien — génération de tests, revue de PR, traduction de code entre langages. Pour les refactorisations approfondies ou la conception d’algorithmes novateurs, l’avantage de Pro sur les benchmarks de raisonnement abstrait a tendance à se refléter dans la qualité des résultats.

Gemini 3.5 Flash gère-t-il bien les contextes longs ?

À des longueurs de contexte plus courtes, oui — la précision de récupération de MRCR v2 se maintient à 84,9 %. Au-delà de 128 k tokens, elle chute à 77,3 %, ce qui constitue un écart significatif pour des tâches comme la revue de contrats multi-documents. Le score de Gemini 3.1 Pro à la même longueur n’a pas été publié, donc considérez cela comme une limitation connue de Flash plutôt que comme un avantage confirmé de Pro.

Conclusion

Gemini 3.5 Flash est le meilleur choix par défaut pour la plupart des tâches quotidiennes et à fort volume — il est plus rapide, moins cher en cache, et suffisamment proche sur les benchmarks généraux pour que le compromis importe rarement. Gemini 3.1 Pro justifie son coût plus élevé pour le raisonnement abstrait et les chaînes d’agents non supervisées ; sur les longs documents dépassant 128k tokens, les propres chiffres de Flash montrent un point faible que ceux de Pro ne confirment ni n’infirment, donc considérez cela comme un cas à tester vous-même avant de vous engager dans un sens ou dans l’autre.

Cette comparaison est basée sur des données de benchmarks publiques (Artificial Analysis, BenchLM, nxcode et apiyi), et non sur des tests API réalisés en première main. Gemini 3.1 Pro a été lancé avec un positionnement axé sur le raisonnement, distinct de l’accent mis par Flash sur la vitesse. À l’heure actuelle, Gemini 3.5 Pro n’a pas encore été publié — des articles indiquent une sortie en juillet 2026 — donc considérez cela comme un instantané que les deux modèles, ainsi que cette comparaison, devront être revus une fois la prochaine version de Pro disponible.

Lectures connexes