Gemini 3.5 Flash erzeugt 2,6-mal so viele Output-Tokens pro Sekunde wie Gemini 3.1 Pro, kostet 25 % weniger pro Token und liegt beim Artificial Analysis Intelligence Index leicht vor Pro (50 gegenüber 46). Gemini 3.1 Pro führt bei ARC-AGI-2 weiterhin um 5 Punkte (77,1 % gegenüber 72,1 %), und Flashs Wert beim Abruf über langen Kontext sinkt von 84,9 % auf 77,3 %, sobald Sie über 128k Tokens hinausgehen. Welches Modell Sie verwenden sollten, hängt von der Aufgabe ab: Flash optimiert für Durchsatz und Tool-Calling-Latenz, Pro für die Tiefe mehrstufigen Schlussfolgerns, und aggregierte Benchmarks mitteln diese beiden Prioritäten zu einer einzigen Punktzahl zusammen, die verschleiert, welche Ihr Workload tatsächlich benötigt.
Benchmark-Ergebnisübersicht: Wo jedes Modell tatsächlich führt
| Metrik | Gemini 3.5 Flash | Gemini 3.1 Pro | Gewinner |
|---|---|---|---|
| Intelligence Index (Artificial Analysis) | 50 | 46 | Flash |
| ARC-AGI-2, abstraktes Schlussfolgern (BenchLM) | 72.1% | 77.1% | Pro |
| MRCR v2 bei 128k Kontext (nxcode) | 77.3% (gesunken von 84.9% bei kürzerem Kontext) | für dieselbe Länge nicht öffentlich berichtet | Unzureichende Daten |
| Durchschnittliche Multimodal-Bewertung (BenchLM) | 83.8 | 82.6 | Flash |
| Ausgabegeschwindigkeit (BenchLM) | 284.2 tok/s | 109 tok/s | Flash (2.6x) |
| GDPval-AA Elo, reale Agentenaufgaben (apiyi) | 1656 | 1314 | Flash |
Flash gewinnt bei den Kennzahlen, die Durchsatz und allgemeine Aufgabenbearbeitung messen. Pro hat einen klaren, dokumentierten Vorsprung bei der Reasoning-Tiefe von ARC-AGI-2; beim Abrufen über lange Kontexte hinaus hat Flash eine dokumentierte Regression jenseits von 128k Tokens, aber Pro's entsprechender Wert ist nicht öffentlich verfügbar, daher sollte man dies eher als nicht schlüssig denn als Sieg für Pro werten. Diese Aufteilung entspricht direkt der Art der Aufgabe, die Sie ausführen, was nützlicher ist als die einzelne aggregierte Intelligence-Index-Zahl.
Ein methodischer Vorbehalt aus dem eigenen Vergleich von BenchLM: Von den rund 34 Benchmarks, für die beide Modelle veröffentlichte Ergebnisse haben, sind nur 3 Kategorien direkt vergleichbar — Pro hat exklusive Ergebnisse auf 14 Benchmarks, Flash auf 17, und Thinking-Budget-Einstellungen sind zwischen beiden nicht immer identisch. Betrachten Sie die obige Tabelle als grob verlässlich; die Abstände bei ARC-AGI-2 und MRCR v2 sind groß genug, um ihnen zu vertrauen, aber ein Unterschied von 1-2 Punkten bei einer gemeinsamen Metrik sollte nicht als निर्णend gelesen werden.
Wo Flashs Vorsprung nachlässt
Die ARC-AGI-2-Lücke (5 Punkte) ist der größte Einzelkategorie-Unterschied, den der Vergleich von BenchLM zwischen den beiden Modellen gefunden hat. ARC-AGI-2 wurde speziell entwickelt, um Mustererkennungs-Abkürzungen zu widerstehen, daher ist eine Lücke von 5 Punkten dort ein stärkeres Signal für die Tiefe des Schlussfolgerns als eine ähnliche Lücke bei einem konventionelleren Benchmark. Das MRCR-v2-Ergebnis von nxcode fügt einen zweiten Datenpunkt in dieselbe Richtung hinzu: Flashs eigene Abrufgenauigkeit sinkt von 84,9 % auf 77,3 %, wenn der Kontext in Richtung 128k Tokens wächst. Pros Ergebnis bei derselben Länge ist nicht öffentlich berichtet, daher ist dies kein dokumentierter direkter Verlust für Pro — aber es ist eine dokumentierte Regression für Flash, die Pros Benchmark-Tabelle nicht zeigt.
Anekdotischer Hinweis, kein Benchmark-Beleg: Ein Reddit-r/GeminiAI-Thread, in dem Nutzer gefragt wurden, welches Modell sie für schwierige Aufgaben bevorzugen, brachte Kommentatoren dazu, Flash als besser als Pro „in allem außer langem Kontext, abstraktem [Reasoning].“ Das sind nur einige wenige Meinungen, keine Daten — aber es beschreibt zufällig genau dieselben zwei Ausnahmen, die auch die Benchmarks zeigen, was eher ein leicht nützlicher Plausibilitätscheck als ein Beweis für irgendetwas für sich genommen ist.
Preisgestaltung und Caching: das tatsächliche Kostenbild
Der Basispreis verringert den Preisvorteil stärker, als es auf den ersten Blick erscheint:
- Gemini 3.5 Flash: $1.50 / million input tokens, $9 / million output tokens
- Gemini 3.1 Pro: $2 / million input tokens, $12 / million output tokens
Das ist ein Rabatt von 25 % auf dem Papier, nicht die 4- bis 8-fache Lücke, die Flash zuvor gegenüber älteren Pro-Modellen hatte. Der größere Hebel ist das Caching:
- Flash-Cache-Schreibvorgänge sind kostenlos; zwischengespeicherte Eingaben kosten $0.15/Million Tokens
- Pro-Cache-Schreibvorgänge kosten $0.38/Million Tokens; zwischengespeicherte Eingaben kosten $0.50/Million Tokens — mehr als das 3-Fache der Flash-Zwischenspeicherungsrate für Eingaben
Bei jedem Workflow, der denselben System-Prompt oder Dokumentkontext über mehrere Turns hinweg erneut sendet — Chat-Agenten, Coding-Assistenten mit persistentem Codebase-Kontext, mehrstufige Support-Bots — summiert sich diese Caching-Lücke schnell. Eine einzelne Anfrage zeigt kaum einen Unterschied; eine Agentensitzung mit tausend Turns schon.
Auch die Lücke ist nicht konstant. apiyis Preisaufschlüsselung stellt fest, dass sich jenseits von ungefähr 200k Tokens Kontext der Preisunterschied zwischen den beiden Modellen auf 25-50% verringert, weil sich die Pro-Token-Ökonomie beider Modelle in diesem Umfang annähert. Wenn Ihre Workload eher von sehr langen Einzel-Dokumenten als von kurzen, wiederholten Aufrufen geprägt ist, verliert das Preisargument für Flash an Gewicht.
Ein konkretes Beispiel: Ein Support-Bot-Workflow, der täglich 1 Mio. zwischengespeicherte Eingabetokens sendet und 500.000 Ausgabetokens generiert. Bei Flash kostet das $0 für den Cache-Schreibvorgang plus $0.15 x 1 (zwischengespeicherte Eingabe) + $9 x 0.5 (Ausgabe) = $4.65/Tag. Bei Pro kostet dieselbe Arbeitslast $0.38 (Cache-Schreibvorgang, einmalig) + $0.50 x 1 (zwischengespeicherte Eingabe) + $12 x 0.5 (Ausgabe) = am ersten Tag ungefähr $6.88/Tag, und nach dem ersten Schreibvorgang $6.50/Tag. Über einen Monat ist das der Unterschied zwischen etwa $140 und $195 — noch bevor man Pro's tieferes Reasoning für jede Anfrage berücksichtigt, die es tatsächlich benötigt.
Agent-Schleifen: Warum Flash bei der Geschwindigkeit gewinnt, nicht immer bei der Zuverlässigkeit
nxcode's agent-loop-Benchmark führte eine 8-stufige Agent-Loop aus und stellte fest, dass Flash die vollständige Sequenz in etwa 25 Sekunden abschloss, gegenüber Pro's 100 Sekunden — ein 4-facher Unterschied, der sich mit jedem zusätzlichen Schritt verstärkt. Bei GDPval-AA, einem Benchmark, der um reale wissensarbeitsbezogene Agent-Aufgaben herum aufgebaut ist, übertrifft Flashs Elo-Score (1656) Pro's (1314) um 342 Punkte, die größte einzelne Lücke in der gesamten Benchmark-Tabelle.
Der Vorbehalt: Dieser Geschwindigkeits- und Score-Vorteil setzt voraus, dass die Agenten-Loop sauber läuft. Dieselben ARC-AGI-2- und MRCR-v2-Lücken, die sich bei Reasoning- und Long-Context-Aufgaben zeigen, sind ein vernünftiger Grund anzunehmen, dass Flash auch weniger fehlertolerant ist, wenn ein Tool-Call mitten im Loop etwas Unerwartetes zurückgibt und der Agent neu planen muss — das ist eine Schlussfolgerung aus den obigen Daten zur Reasoning-Tiefe, keine separat benchmarkte Behauptung. Wenn Ihr Agent überwacht läuft und ein Mensch zwischen den Schritten die Ausgabe prüft, ist Flashs Geschwindigkeit beinahe ein Gratisgewinn. Wenn er jedoch über viele Schritte unbeaufsichtigt ohne Menschen im Loop läuft, ist Pro mit seiner Reasoning-Marge die sicherere Wahl, bis jemand für beide eine Failure-Rate-Datenlage veröffentlicht.
Welche sollten Sie verwenden: eine aufgabenbasierte Entscheidungsmatrix
| Aufgabentyp | Empfohlenes Modell | Warum |
|---|---|---|
| Alltägliches Coding (Tests, PR-Review, Übersetzung zwischen Sprachen) | Flash | Geschwindigkeit und Kosten sind der Gewinn, die Tiefe des Reasonings ist nicht der Engpass |
| Tiefe Refactorings, neuartige Algorithmus-Entwicklung | Pro | Die ARC-AGI-2-Lücke zeigt sich direkt beim mehrstufigen logischen Denken |
| Lange Dokumentenabfrage (Verträge, Forschungskorpora über 128k Tokens hinaus) | Pro | Flash hat an dieser Länge einen dokumentierten MRCR v2-Regression; Pro's ist nicht veröffentlicht, aber der sicherere Standard ist das Modell ohne einen bekannten Schwachpunkt |
| Generierung in hohem Volumen im Batch | Flash | Kostenlose Cache-Schreibvorgänge und 2.6x Durchsatz zählen im großen Maßstab am meisten |
| Überwachte Agent-Workflows mit einem Menschen, der die Ausgabe prüft | Flash | Geschwindigkeitsvorteil ohne das Risiko der unüberwachten Zuverlässigkeit |
| Unüberwachte, risikoreiche Agent-Ketten | Pro | Die größere Reasoning-Tiefe ist die sicherere Wahl, wenn kein Mensch Fehler in der Schleife auffängt |
| Häufige Multi-Turn-Aufrufe, die denselben Kontext wiederverwenden | Flash | Der Preis für gecachte Eingaben liegt ungefähr bei einem Drittel von Pro's |
Eine einfache Standardregel deckt den Großteil der obigen Matrix ab: Senden Sie Anfragen an Flash, es sei denn, eine von drei Bedingungen trifft zu — der Kontext überschreitet 128k Tokens und Abrufgenauigkeit ist wichtig, die Aufgabe ist abstraktes/mehrstufiges Denken (neuartige Algorithmen, juristische oder Forschungs-Synthese), oder der Agent läuft unbeaufsichtigt länger als ein paar Schritte. Jede dieser drei Bedingungen spricht eher für Pro; trifft keine davon zu, machen Flashs Geschwindigkeit und Cache-Preise ihn zur günstigeren Standardwahl.
FAQ
Ist Gemini 3.5 Flash besser als 3.1 Pro?
Bei Geschwindigkeit, Kosten und allgemeinen Benchmarks: ja. Beim abstrakten Schlussfolgern (ARC-AGI-2) liegt Gemini 3.1 Pro weiterhin mit 5 Punkten vorn. Beim Abruf über lange Kontexte jenseits von 128k Tokens hat Flash eine dokumentierte Regression, und für Pro ist kein entsprechender Wert veröffentlicht, also behandeln Sie diesen Vergleich lieber als ungeklärt statt als bestätigten Pro-Sieg. Welches Modell „besser“ ist, hängt davon ab, in welche dieser Kategorien Ihre Aufgabe fällt.
Wie viel günstiger ist Gemini 3.5 Flash als 3.1 Pro?
Etwa 25 % günstiger bei den Basis-Ein-/Ausgabepreisen ($1.50/$9 gegenüber $2/$12 pro Million Tokens). Die größeren Einsparungen zeigen sich beim Caching: Die Cache-Schreibvorgänge von Flash sind kostenlos, und der gecachte Input kostet ungefähr ein Drittel des Tarifs von Pro, was besonders bei Multi-Turn- oder High-Volume-Workloads ins Gewicht fällt.
Ist Gemini 3.5 Flash gut zum Programmieren?
Ja, für die tägliche Arbeit — Testgenerierung, PR-Review, Übersetzen von Code zwischen Sprachen. Bei tiefgreifenden Refactorings oder neuartigem Algorithmendesign zeigt sich der Vorteil von Pro bei Benchmarks für abstraktes Schlussfolgern meist in der Ausgabequalität.
Geht Gemini 3.5 Flash gut mit langem Kontext um?
Bei kürzeren Kontextlängen ja — die MRCR v2-Retrieval-Genauigkeit liegt bei 84,9 %. Über 128.000 Tokens hinaus sinkt sie auf 77,3 %, was für Aufgaben wie die Überprüfung von Verträgen mit mehreren Dokumenten eine spürbare Lücke ist. Der Score von Gemini 3.1 Pro bei derselben Länge wurde noch nicht veröffentlicht, daher sollte dies als bekannte Flash-Einschränkung und nicht als bestätigter Pro-Vorteil betrachtet werden.
Kurz gesagt
Gemini 3.5 Flash ist die bessere Standardwahl für die meisten alltäglichen und volumenstarken Aufgaben — es ist schneller, günstiger im Cache und bei allgemeinen Benchmarks nah genug dran, dass der Kompromiss selten ins Gewicht fällt. Gemini 3.1 Pro rechtfertigt seine höheren Kosten bei abstraktem Schlussfolgern und unüberwachten Agenten-Ketten; bei langen Dokumenten jenseits von 128k Tokens zeigen Flashes eigene Zahlen eine Schwachstelle, die Pro nicht bestätigen oder ausschließen, also sollte man das vor einer Entscheidung in beide Richtungen selbst testen.
Dieser Vergleich basiert auf öffentlichen Benchmark-Daten (Artificial Analysis, BenchLM, nxcode und apiyi), nicht auf eigener API-Tests. Gemini 3.1 Pro wurde mit einer auf Reasoning ausgerichteten Positionierung veröffentlicht, die sich von Flashs Fokus auf Geschwindigkeit unterscheidet. Zum Zeitpunkt dieses Schreibens wurde Gemini 3.5 Pro noch nicht ausgeliefert — Berichte deuten auf eine Veröffentlichung im Juli 2026 hin — betrachten Sie dies daher als eine Momentaufnahme, die sowohl diese beiden Modelle als auch diesen Vergleich erneut überprüft werden muss, sobald Pros nächste Version erscheint.
