AIREITER

Gemini 3.7 Flash vs. 3.6 Flash: Besserer Code zum gleichen Preis

Zuletzt aktualisiert: 2026-08-14 07:43:58

Drei Wochen nach Gemini 3.6 Flash liefert Google mit Gemini 3.7 Flash ein spürbares Upgrade aus – ohne Aufpreis pro Token. Besonders deutlich fällt der Sprung bei DeepSWE v1.1 aus: von 48,6 % auf 65,3 %. Für beide Modelle gilt bis Dezember 2026 derselbe Einführungspreis von $0.75/$3.75 je Million Tokens. Ob sich der Wechsel lohnt, hängt dennoch stark vom jeweiligen Einsatzbereich ab.

18 Benchmarks im Direktvergleich

Die Zahlen auf der offiziellen Modellseite von Google DeepMind sprechen fast durchweg für 3.7 Flash. Die größten Abstände zeigen sich bei Coding-Agenten und der Automatisierung von Unternehmensprozessen. Die folgende Übersicht enthält alle 18 Kennzahlen, die Google für beide Modelle veröffentlicht, ergänzt um Claude Sonnet 5 und GPT-5.6 Terra zur Einordnung.

Benchmark-Vergleich von Gemini 3.7 Flash und 3.6 Flash anhand von sechs zentralen Kennzahlen
BenchmarkGemini 3.7 FlashGemini 3.6 FlashUnterschied
Artificial Analysis Intelligence Index (Gesamtwert)5652+4
FrontierCode 1.1 (Qualität von Produktionscode)43.6%34.4%+9.2
DeepSWE v1.1 (Software Engineering über lange Aufgabenketten)65.3%48.6%+16.7
Code Arena (Elo für Webentwicklung)15881538+50
Terminal-Bench 2.1 (agentisches Coding im Terminal)85.8%78.0%+7.8
Terminal-Bench 3.0 (allgemeine Agentenfähigkeiten)14.9%5.4%+9.5
AutomationBench (Automatisierung von Unternehmens-Workflows)30.4%17.0%+13.4
GDPVal-AA v2 (Elo für Wissensarbeit)15251422+103
Harvey LAB-AA (komplexe juristische Workflows)90.7%85.1%+5.6
GDP.pdf (Verständnis komplexer PDFs)34.0%22.0%+12.0
CharXiv, ohne Tools (Schlussfolgern aus Diagrammen)84.5%85.2%−0.7
CharXiv, mit Tools88.7%89.4%−0.7
LVBench (Verständnis langer Videos)85.4%84.2%+1.2
GDM-MRCR v2, 128k (Informationsabruf bei langem Kontext)97.0%91.8%+5.2
OSWorld-2.0 (agentische Computernutzung)47.9%33.8%+14.1
Agent's Last Exam (Desktop-Aufgaben für Agenten)26.3%24.2%+2.1
HLE-Verified (fachübergreifendes Experten-Reasoning)53.6%51.2%+2.4
LABBench2 (Forschungsaufgaben in der Biologie)82.1%76.1%+6.0

Alle Werte stammen von Google DeepMind und sind auf der Modellseite zu 3.7 Flash veröffentlicht. Für die meisten dieser Benchmarks liegen noch keine unabhängigen Reproduktionen vor. Die Unterschiede sollten daher als Tendenz verstanden werden, nicht als garantierte Wirkung für den eigenen Workload.

Coding-Agenten: Hier setzt sich 3.7 Flash klar ab

Bei Coding und agentischen Aufgaben ist der Abstand zwischen beiden Modellen am größten. DeepSWE v1.1 misst Software-Engineering-Aufgaben mit langer Laufzeit in echten Repositories und steigt um 16,7 Prozentpunkte – von 48,6 % auf 65,3 %. Damit übertrifft 3.7 Flash Claude Sonnet 5 mit 53,8 % und liegt beim selben Benchmark zwischen diesem Modell und GPT-5.6 Terra mit 69,6 % (alle Vergleichswerte aus der Benchmark-Tabelle von DeepMind).

Auch die weiteren agentenorientierten Benchmarks zeigen deutliche Zugewinne:

  • Terminal-Bench 3.0: Bei Agenten mit mehreren Tools steigt der Wert von 5,4 % auf 14,9 % – nahezu eine Verdreifachung.
  • AutomationBench: Für die Automatisierung von Unternehmens-Workflows geht es von 17,0 % auf 30,4 %.
  • FrontierCode 1.1: Bei Produktionscode gewinnt 3.7 Flash 9,2 Punkte.
  • OSWorld-2.0: Bei agentischer Computernutzung steigt der Wert von 33,8 % auf 47,9 %.

Erste Nutzerstimmen auf Reddit verdeutlichen allerdings auch die Lücke zwischen Benchmark-Erfolgen und dem Alltag von Entwicklern:

Effektiv bei der Umsetzung, aber möglicherweise schwächer bei Planung, Code-Review und der Zerlegung schwieriger Probleme.

— Nutzerdiskussion auf r/google_antigravity

Auch Googles eigene Kundenbelege auf der DeepMind-Modellseite gehen in diese Richtung. Browser Use berichtet, der „Gemini 3.7 Flash agent“ sei 35 % günstiger gewesen als 3.6 Flash, bei einer um 8 % höheren beobachteten Prompt-Cache-Trefferrate und weniger Tool-Fehlern. Harvey maß beim Legal Agent Bench einen Anstieg um 2,6 Punkte bei All-Pass. Nunu.ai sah eine mit GPT-5.6-Terra vergleichbare Leistung „bei etwa der Hälfte der Kosten“. Alle drei führen die Einsparungen auf weniger Schritte in Agenten-Loops zurück, nicht auf niedrigere Tokenpreise.

Wissensarbeit und Multimodalität: Kleine, aber relevante Fortschritte

Abseits von Coding werden die Unterschiede kleiner. Im Artificial Analysis Intelligence Index steigt 3.7 Flash von 52 auf 56 und platziert sich laut DeepMind-Vergleichstabelle zwischen Claude Sonnet 5 mit 55 und GPT-5.6 Terra mit 57. Den stärksten Fortschritt außerhalb des Codings gibt es beim Dokumentenverständnis: GDP.pdf springt von 22,0 % auf 34,0 %. Das sind 12 Punkte mehr für Pipelines, die komplexe Dokumente, Finanzberichte oder juristische Unterlagen verarbeiten. GDM-MRCR v2 für Informationsabruf bei 128K Tokens Kontext verbessert sich von 91,8 % auf 97,0 %.

Harvey LAB-AA für komplexe juristische Workflows steigt von 85,1 % auf 90,7 %. Beim Verständnis langer Videos mit LVBench und bei biologischen Forschungsaufgaben in LABBench2 geht es jeweils um rund 6 Punkte nach oben. Für spezialisierte Workloads kann das relevant sein, allein dürften diese Werte aber kaum eine Migration auslösen.

Preise: Beide Modelle starten zum selben Tarif

ModellInput ($/1 Mio. Tokens)Output ($/1 Mio. Tokens)Regulärer Tarif (ab 1. Januar 2027)
Gemini 3.7 Flash$0.75\*$3.75\*$1.50 / $7.50
Gemini 3.6 Flash$0.75\*$3.75\*$1.50 / $7.50
Claude Sonnet 5$2.00$10.00—
GPT-5.6 Terra$2.00$12.00—

\*Der Einführungspreis läuft am 31. Dezember 2026 aus. Sämtliche Preisangaben stammen von der DeepMind-Modellseite.

Mit dem Start von 3.7 Flash am 13. August 2026 hat Google den Aktionspreis von $0.75/$3.75 auf beide Flash-Modelle angewendet. Zuvor galt für 3.6 Flash der reguläre Tarif von $1.50/$7.50. Ab dem 1. Januar 2027 kehren beide Modelle zu $1.50/$7.50 zurück, sofern Google die Aktion nicht verlängert. Da die Tokenpreise identisch sind, entsteht ein Kostenvorteil allein durch effizientere Aufgabenbearbeitung: Die von Browser Use gemessene Reduzierung der Agentenkosten um 35 % bezieht sich auf dieselben Workloads und wird mit weniger Tool-Aufrufen sowie höheren Cache-Trefferraten erklärt, nicht mit abweichenden Preisen.

Eine detaillierte Aufschlüsselung der API-Kosten von 3.7 Flash, einschließlich Caching, Batch API und Grounding-Gebühren, bietet unser Gemini 3.7 Flash API pricing guide.

Der einzige Vorteil von 3.6 Flash

Beim Schlussfolgern aus Diagrammen liegt 3.6 Flash knapp vorn. In CharXiv ohne Tools erreicht 3.6 85,2 %, gegenüber 84,5 % bei 3.7. Mit aktivierten Tools bleibt der Abstand gleich: 89,4 % gegenüber 88,7 %. Bei weniger als einem Punkt Differenz können beide Modelle bei einzelnen Diagrammaufgaben ähnlich abschneiden. Wer diese Art von Workload als Kernanwendung hat, sollte vor der Wahl eines Standardmodells mit eigenen Daten testen.

In keinem anderen Benchmark aus Googles Vergleichstabelle liegt 3.6 vor 3.7. Der Abstand im Intelligence Index – 52 zu 56 – ist außerhalb des Chart-Reasonings der knappste umkämpfte Bereich, doch auch dort führt 3.7.

Migration: Mehr als nur die Modell-ID prüfen

Technisch ist die Migration zunächst schlicht: gemini-3.6-flash wird durch gemini-3.7-flash ersetzt. Laut der DeepMind-Modellseite teilen beide Modelle dasselbe Kontextfenster mit 1M Input und 64K Output, dieselben Eingabemodalitäten – Text, Bild, Video, Audio und PDF – sowie dieselben Tool-Funktionen: Function Calling, Search Grounding und Computer Use. Für 3.7 Flash nennt die Modellseite den Status General Availability.

Ein Vorbehalt bleibt: Beim Wechsel von 3.5 auf 3.6 änderte sich das API-Verhalten stillschweigend, was viele Entwickler überraschte. Wie unabhängige Tests dokumentieren, wurden temperature, top_p und top_k ignoriert, thinking_budget wurde zum String-Enum thinking_level, und Response Prefilling entfiel. Ob 3.7 Flash ähnliche Änderungen mitbringt, hat Google bislang nicht veröffentlicht. Bevor diese Dokumentation vorliegt, sollte die Evaluierungssuite gegen beide Modell-Strings laufen, ehe Produktions-Traffic migriert wird. 3.6 sollte als Fallback verfügbar bleiben.

Lohnt sich der Umstieg auf 3.7 Flash?

Die Empfehlung hängt vom Workload ab:

  • Bei Coding-Agenten sofort wechseln. DeepSWE v1.1 gewinnt 16,7 Punkte, Terminal-Bench 3.0 verdreifacht sich beinahe. Bei gleichem Preis pro Token gibt es für Coding-Agent-Workloads keinen finanziellen Grund, bei 3.6 zu bleiben.
  • Bei komplexen Dokumenten sofort wechseln. Das Verständnis in GDP.pdf steigt um 12 Punkte, von 22,0 % auf 34,0 %. Der Abruf in 128K Tokens langem Kontext liegt mit 97,0 % nahezu perfekt.
  • Bei Diagramm-Reasoning zuerst testen. Bei CharXiv liegt 3.6 um weniger als einen Punkt vorn. Vor einer Festlegung sollte ein direkter Vergleich mit dem eigenen Workload erfolgen.
  • Bei stabilen, validierten Pipelines kann 3.6 bleiben. Die DeepMind-Modellseite nennt kein Einstellungsdatum für 3.6 Flash. Wenn Regressionstests bestehen und die Coding-Gewinne nicht unmittelbar gebraucht werden, kann der Aufwand für das Debugging veränderter Modellreaktionen den Nutzen übersteigen. Sinnvoll ist eine Migration Workflow für Workflow.
  • Die Release-Frequenz berücksichtigen. Google veröffentlichte 3.7 nur drei Wochen nach 3.6. Workflows mit den größten Zugewinnen von 3.7 sollten jetzt migriert werden, während 3.6 als Fallback angeheftet bleibt. Jede Flash-Version ist eher ein inkrementelles Upgrade zur Evaluierung als ein Plattformwechsel.

Beide Modelle lassen sich über die Chat-Oberflächen für Gemini 3.7 Flash und Gemini 3.6 Flash direkt nebeneinander vergleichen.

Ist Gemini 3.7 Flash eine neue Architektur oder ein Post-Training-Update?

Google hat 3.7 Flash öffentlich weder als neue Architektur noch als Post-Training-Patch eingeordnet. Der Artificial Analysis Intelligence Index steigt von 52 auf 56, während unabhängige Tests bestätigten, dass 3.5 und 3.6 Flash in demselben Index beide 50 erreichten. Ob die Verbesserung von 3.7 auf Architekturänderungen oder besseren Trainingsdaten beruht, ist nicht dokumentiert.

Kostet Gemini 3.7 Flash mehr als 3.6 Flash?

Nein. Für beide Modelle gelten bis zum 31. Dezember 2026 $0.75 je Million Input-Tokens und $3.75 je Million Output-Tokens. Danach wechseln beide auf $1.50/$7.50. Einsparungen durch das Upgrade entstehen durch weniger Tool-Aufrufe und Reasoning-Schritte pro Aufgabe, nicht durch einen niedrigeren Preis pro Token.

Wo ist Gemini 3.7 Flash verfügbar?

Laut der DeepMind-Modellseite ist 3.7 Flash über Gemini API, Google AI Studio, Google Antigravity, Vertex AI, Gemini Enterprise und die Gemini App verfügbar und hat den Status General Availability.

Sollte ich auf die nächste Flash-Version warten, statt jetzt zu migrieren?

3.7 Flash ist ein GA-Modell mit veröffentlichten Benchmarks und Kundenadoption. Wenn der eigene Workload von den Fortschritten bei Coding und Agenten profitiert, sollten diese Workflows jetzt migriert und beim Erscheinen der nächsten Version erneut bewertet werden. Wer wartet, verzichtet auf Verbesserungen, die bereits nutzbar sind.