Gemini 3.6 Flash: Preise, Benchmarks & API-Zugang

Zuletzt aktualisiert: 2026-07-22 07:19:07

Für Teams, die KI-Agenten im großen Maßstab betreiben, sind bei Gemini 3.6 Flash vor allem zwei Werte relevant: Google hat den Output-Preis am 21. Juli 2026 von $9.00 auf $7.50 pro Million Tokens gesenkt, und das Modell erledigt vergleichbare Aufgaben mit rund 17 % weniger Output-Tokens. Bei outputlastigen Workloads kann die Rechnung pro Task dadurch um etwa ein Drittel sinken. In Coding- und agentischen Benchmarks liegt das neue Flash-Modell zudem meist vor dem bisherigen 3.5 Flash – und sogar vor dem größeren 3.1 Pro. Für bestehende Nutzer von 3.5 Flash ist das praktisch ein kostenloses Upgrade, auch wenn es in seiner Klasse nicht den niedrigsten Listenpreis bietet.

Diese drei Modelle hat Google am 21. Juli veröffentlicht

Google hat drei Modelle gleichzeitig ausgerollt, die jeweils andere Einsatzzwecke abdecken:

  • Gemini 3.6 Flash (gemini-3.6-flash): das zentrale Modell für Anwendungen, die Tempo und starke Fähigkeiten verbinden sollen. Es bietet 1 Mio. Tokens Kontext, maximal 64k Output-Tokens und einen Wissensstand bis März 2026 statt bislang Januar 2025.
  • Gemini 3.5 Flash-Lite: ein Modell für hohen Durchsatz mit ungefähr 350 Output-Tokens pro Sekunde. Es ist deutlich günstiger und für einfache Aufgaben in großen Mengen gedacht.
  • Gemini 3.5 Flash Cyber: eine auf Sicherheit spezialisierte Variante zum Finden, Validieren und Beheben von Schwachstellen. Sie läuft innerhalb von CodeMender und befindet sich als Pilot mit eingeschränktem Zugang für Regierungen und vertrauenswürdige Partner – ein allgemeiner Release ist das nicht.
Offizielle Gemini-API-Preisseite mit Gemini 3.6 Flash für $1.50 Input und $7.50 Output pro 1 Mio. Tokens

Auf der offiziellen Modellseite bezeichnet Google 3.6 Flash als „unser intelligentestes, auf Geschwindigkeit ausgelegtes Modell“. Die Preise stehen auf der Gemini-API-Preisseite von Google.

Der Release kommt nicht zufällig. Das Flaggschiff Gemini 3.5 Pro hat sich verspätet, während DeepMind bereits mitgeteilt hat, dass das Pre-Training für Gemini 4 begonnen hat. Das Flash-Update schließt damit die Lücke, bis die größeren Releases verfügbar sind.

Preise für Gemini 3.6 Flash: Der Rabatt ist kleiner, als er zunächst wirkt

Im Standardtarif der API kostet Gemini 3.6 Flash $1.50 pro 1 Mio. Input-Tokens und $7.50 pro 1 Mio. Output-Tokens; zu den Output-Tokens zählen auch Thinking-Tokens. Context Caching kostet $0.15 pro 1 Mio. Tokens, die Speicherung $1.00 pro 1 Mio. Tokens und Stunde.

Ein Detail wird in vielen Launch-Berichten übergangen: Gesenkt wurde ausschließlich der Output-Preis. Gemini 3.5 Flash kostete zuvor ebenfalls $1.50 für Input, aber $9.00 für Output. Der Input bleibt also unverändert, beim Output entspricht der Rückgang von $9.00 auf $7.50 einer Reduktion um 16.7 % – nicht einem pauschalen Preisnachlass. Bei inputlastigen Workloads mit langen Dokumenten und kurzen Antworten fällt die direkte Ersparnis daher überschaubar aus. Der größere Vorteil liegt woanders.

Entscheidend sind die Kosten pro Aufgabe, nicht der Tokenpreis

Ein Preis pro Token ist keine besonders gute Kennzahl, um Modellgenerationen zu vergleichen. Bezahlt wird Preis × verbrauchte Tokens. Bei 3.6 Flash verändern sich beide Faktoren: Der Output-Tarif ist 16.7 % niedriger, zudem berichtet Google über den Artificial Analysis Index, dass für dieselbe Arbeit rund 17 % weniger Output-Tokens anfallen. Im Idealfall ergibt das etwa 0.833 × 0.83 ≈ 0.69 – also rund 31 % niedrigere Output-Kosten.

Wie viel davon tatsächlich ankommt, hängt vom jeweiligen Workload ab. Deshalb habe ich am 22. Juli 2026 drei identische Prompts – eine Coding-Aufgabe, ein Reasoning-Problem und eine JSON-Extraktion – bei Temperatur 0 über OpenRouter durch beide Modelle laufen lassen:

Metrik (3 Aufgaben, Temp. 0)Gemini 3.6 FlashGemini 3.5 Flash
Input-Tokens146145
Output-Tokens2,7362,593
Gesamtkosten$0.0207$0.0236
Gesamtlatenz5.20s5.19s

Beide Modelle lieferten korrekte und vergleichbare Antworten. In diesem kleinen Test war 3.6 Flash bei nahezu identischer Geschwindigkeit etwa 12 % günstiger, gab aber einige Prozent mehr Tokens aus, weil es mehr für Reasoning aufwendete. Die verlässliche Ersparnis ist damit die Preissenkung beim Output von $9.00 auf $7.50. Die höhere Token-Effizienz ist im Aggregat real, schwankt aber je nach Aufgabe und zeigt sich nicht immer. In der Praxis sind 12–17 % beim Output eine realistische Planungsgröße; 31 % bleiben das Best-Case-Szenario.

Balkendiagramm zu den Output-Kosten pro Aufgabe: Gemini 3.5 Flash bei 100, Gemini 3.6 Flash bei 88 im Test mit drei Aufgaben und 69 im Best Case mit 17 % weniger Tokens

(Kleine Stichprobe: drei Aufgaben, Temperatur 0, kein formaler Benchmark.)

Gemini 3.6 Flash im Preisvergleich mit anderen schnellen Modellen

Der niedrigste Tokenpreis bedeutet nicht automatisch das beste Preis-Leistungs-Verhältnis. Deshalb lohnt der direkte Vergleich innerhalb der schnellen Modellklasse. Alle Werte sind Standardpreise ohne Batch-Rabatt pro 1 Mio. Tokens und stammen von den offiziellen Preisseiten der jeweiligen Anbieter.

ModellInput /1MOutput /1MKontext
Gemini 3.6 Flash$1.50$7.501M
Gemini 3.5 Flash (Vorgänger)$1.50$9.001M
Gemini 3.5 Flash-Lite$0.30$2.501M
Claude Haiku 4.5$1.00$5.00200k
GPT-5.6 Luna$1.00$6.00
DeepSeek V4 Flash$0.14$0.281M

Nach Listenpreis allein gewinnt 3.6 Flash nicht. Claude Haiku 4.5 und GPT-5.6 Luna sind beim Output günstiger, DeepSeek V4 Flash spielt preislich in einer ganz anderen Liga. Gemini 3.6 Flash positioniert sich stattdessen über Intelligenz pro Dollar: Im Artificial Analysis Intelligence Index erreicht es 50 Punkte, deutlich über dem Median der schnellen Modellklasse, bei ungefähr 304 Output-Tokens pro Sekunde und einem Kontextfenster von vollen 1 Mio. Tokens. Wer agentische Frontier-Qualität und starke Coding-Fähigkeiten ohne Flaggschiffpreise braucht, findet hier das Argument für das Modell. Für einfache Aufgaben, bei denen ausschließlich der niedrigste Preis zählt, sind die günstigeren Zeilen die bessere Wahl.

Wie groß ist der Sprung gegenüber 3.5 Flash?

Der Generationswechsel macht sich klar bemerkbar – besonders dort, wo die Flash-Reihe bisher ihre Schwächen hatte: bei länger laufenden Coding- und agentischen Aufgaben.

BenchmarkGemini 3.5 FlashGemini 3.6 Flash
DeepSWE v1.137%49%
MLE-Bench49.7%63.9%
OSWorld-Verified (Computer Use)78.4%83.0%
SWE-Bench Pro55.1%58.7%
Terminal-Bench 2.176.2%78.0%
Gruppiertes Balkendiagramm zum Vergleich von Gemini 3.6 Flash und 3.5 Flash bei DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro und Terminal-Bench 2.1; 3.6 Flash liegt bei allen fünf vorn

Die Werte stammen von der Google-DeepMind-Modellseite für Flash und von Artificial Analysis. Besonders auffällig sind die Fortschritte bei DeepSWE und MLE-Bench: 12 beziehungsweise 14 Punkte mehr. Google nennt außerdem einen GDPval-AA-Score für Wissensarbeit von 1421, nach 1349 zuvor. In mehreren dieser Tests überholt 3.6 Flash sogar das größere und teurere 3.1 Pro – ungewöhnlich für ein Flash-Modell.

Gemini 3.6 Flash gegen Gemini 3.1 Pro

Das ist der überraschende Teil: Bei agentischen Aufgaben und Coding schlägt dieses schnelle Modell Googles größeres und teureres 3.1 Pro. Gemini 3.1 Pro Preview kostet je nach Prompt-Länge $2.00–$4.00 für Input und $12.00–$18.00 für Output pro 1 Mio. Tokens. Gemini 3.6 Flash bleibt dagegen bei einem einheitlichen Tarif von $1.50/$7.50.

Gemini 3.6 FlashGemini 3.1 Pro
Input /1M$1.50$2.00–$4.00
Output /1M$7.50$12.00–$18.00
DeepSWE v1.149%12%
SWE-Bench Pro58.7%54.2%
Terminal-Bench 2.178.0%73.8%

3.1 Pro bleibt das größere und höherpreisige Modell für besonders schwierige Reasoning- und Long-Context-Aufgaben. Für die meisten Coding- und agentischen Workloads ist 3.6 Flash nach den Benchmarks oben jedoch sowohl günstiger als auch leistungsstärker. Bevor Pro standardmäßig gesetzt wird, lohnt sich deshalb ein Vergleich. Der ausführliche Vergleich Gemini 3.6 Flash vs 3.1 Pro enthält die direkten Benchmarks, die gestaffelten Preise und einen Speed-Test aus erster Hand.

Lohnt sich der Wechsel von Gemini 3.5 Flash?

Für die meisten Teams, die bereits 3.5 Flash einsetzen: ja. Rein rechnerisch ist 3.6 Flash fast durchgehend die bessere Wahl:

  • Gleicher Input-Preis ($1.50/1M) bei günstigerem Output ($7.50 statt $9.00).
  • Weniger Output-Tokens für dieselbe Aufgabe, ungefähr 17 % weniger.
  • Aktuellerer Wissensstand: März 2026 statt Januar 2025.
  • Bessere Ergebnisse in allen oben genannten agentischen und Coding-Benchmarks.

Vor dem Wechsel in die Produktion sollten zwei Punkte geprüft werden. Erstens muss der Workload in das Limit von 64k Output-Tokens passen; wer auf längere Einzelantworten angewiesen war, sollte diese Grenze testen. Zweitens ist ein eigener Eval-Satz Pflicht. Token-Effizienz und verändertes Reasoning können sich bei bereits optimierten Prompts anders auswirken. Bevor das neue Modell zum Standard wird, sollten Latenz und Output-Qualität mit dem eigenen Traffic verglichen werden.

Flash, Flash-Lite oder Cyber: Welches Modell passt wofür?

Drei Modelle, drei klare Rollen:

  • Gemini 3.6 Flash ist die Standardempfehlung. Es eignet sich für agentische Anwendungen, Coding und multimodale Aufgaben auf Frontier-Niveau zum Preis eines schnellen Modells.
  • Gemini 3.5 Flash-Lite ($0.30/$2.50, ~350 Tokens/Sek.) passt zu hochvolumigen, latenzsensiblen und weniger komplexen Aufgaben: Klassifizierung, Extraktion, Routing oder einfacher Chat. Es ist die günstigste Option, um Gemini im großen Maßstab zu betreiben.
  • Gemini 3.5 Flash Cyber ist nur für Regierungen oder geprüfte Sicherheitspartner relevant. Es handelt sich um einen Pilot innerhalb von CodeMender, nicht um ein Modell, das über die Standard-API aufgerufen werden kann.

So erhalten Sie Zugriff auf Gemini 3.6 Flash

Das Modell ist in der Gemini API und in Google AI Studio verfügbar. AI Studio bietet zum Prototyping einen kostenlosen Tarif mit Nutzungslimits; anschließend erfolgt der Wechsel zu Pay-as-you-go mit der Modell-ID gemini-3.6-flash. Es gilt derselbe Google-AI-Studio-Weg von kostenlos zu kostenpflichtig wie für den Rest der Gemini-Reihe. Auch Enterprise-Oberflächen wie Antigravity, Android Studio und die Gemini Enterprise Agent Platform werden genannt. Wer Gemini 3.6 Flash speziell über Vertex AI benötigt, sollte den Eintrag in der Vertex-Konsole prüfen, da die Verfügbarkeit dort am 22. Juli 2026 noch ausgerollt wurde.

Ein minimaler REST-Aufruf an die Gemini API sieht so aus:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'

Teams mit mehreren Anbietern routen Modelle teils über einen Aggregator, statt separate API-Keys zu verwalten. Sowohl OpenRouter als auch AIReiter bieten gemini-3.6-flash zum Google-Listenpreis an; der Unterschied liegt in den weiteren Modellen hinter demselben Key. OpenRouter bündelt viele Anbieter, während AIReiter Anthropic-kompatibel ist und Gemini neben Claude routet. Das ist hilfreich, wenn 3.6 Flash und die API-Preise von Claude über eine gemeinsame Abrechnung verglichen werden sollen. Für ein Deployment mit nur einem Modell ist der direkte Weg über Google einfacher.

FAQ

Ist Gemini 3.6 Flash kostenlos?

Für das Prototyping gibt es in Google AI Studio einen kostenlosen Tarif mit Nutzungslimits. Der Produktionseinsatz wird nach Verbrauch abgerechnet: $1.50 für Input und $7.50 für Output pro 1 Mio. Tokens.

Ist Gemini 3.6 Flash besser als 3.5 Flash?

Ja. In den veröffentlichten Benchmarks liegt es bei DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro und Terminal-Bench vor 3.5 Flash. Gleichzeitig kostet jeder Output-Token weniger und pro Aufgabe werden weniger Tokens benötigt.

Ist Gemini 3.6 Flash besser als Gemini 3.1 Pro?

Bei agentischen und Coding-Benchmarks wie DeepSWE, SWE-Bench Pro und Terminal-Bench: ja – und das zu einem niedrigeren Preis ($1.50/$7.50 gegenüber $2.00–$4.00/$12.00–$18.00). Gemini 3.1 Pro ist das größere Modell und führt bei den schwierigsten Long-Context-Reasoning- und multimodalen Aufgaben weiterhin, daher hängt die richtige Wahl vom Workload ab.

Was kostet Gemini 3.6 Flash?

Im Standardtarif $1.50 pro 1 Mio. Input-Tokens und $7.50 pro 1 Mio. Output-Tokens. Context Caching kostet $0.15 pro 1 Mio. Tokens.

Wie aktuell ist der Wissensstand von Gemini 3.6 Flash?

März 2026 – gegenüber Januar 2025 beim vorherigen Gemini 3.5 Flash.

Ist Gemini 3.6 Flash in Vertex AI verfügbar?

Bestätigt ist die Verfügbarkeit in der Gemini API und in Google AI Studio sowie auf mehreren Enterprise-Oberflächen. Für Vertex AI wurde sie zum Launch nicht ausdrücklich bestätigt; vor einem Einsatz dort sollte daher der Vertex-Modellkatalog geprüft werden.

Was ist Gemini 3.5 Flash Cyber?

Eine sicherheitsorientierte Variante, die auf das Erkennen, Validieren und Beheben von Software-Schwachstellen abgestimmt ist. Sie läuft im CodeMender-Agenten von Google DeepMind und ist ein Pilot mit eingeschränktem Zugang für Regierungen und vertrauenswürdige Partner, kein öffentlich verfügbares Modell.

Weiterführende Artikel