Für einfache KI-Aufgaben mit hohem Durchsatz ist Gemini 3.5 Flash-Lite derzeit die günstigste Möglichkeit, ein Gemini-Modell zu nutzen: $0.30 pro einer Million Input-Token und $2.50 pro einer Million Output-Token. In meinem direkten Vergleich war es bei identischen Aufgaben 94 % günstiger als Gemini 3.6 Flash, lieferte schneller erste Ergebnisse und beantwortete alle Aufgaben korrekt. Der Haken: Flash-Lite ist auf Tempo und Masse ausgelegt, nicht auf tiefgehendes Schlussfolgern. Für viele unkomplizierte Anfragen ist genau das aber die richtige Priorität.
Was Gemini 3.5 Flash-Lite eigentlich ist
Flash-Lite bildet die günstigste Stufe innerhalb der schnellen Gemini-Modelle. Es richtet sich an einfache Aufgaben in großer Stückzahl, bei denen Latenz und Kosten pro Anfrage wichtiger sind als maximale Modellintelligenz. Die wichtigsten Daten:
- Preis: $0.30 für Input und $2.50 für Output je 1 Mio. Token.
- Kontextfenster: 1 Mio. Token – genauso viel wie bei den größeren Flash-Modellen.
- Geschwindigkeit: Google gibt rund 350 Output-Token pro Sekunde an.
- Intelligenz: 36 Punkte im Artificial Analysis Index gegenüber 50 bei dem teureren 3.6 Flash. Dieser Abstand ist der Preisvorteil in der Praxis.
Das Modell erschien zusammen mit 3.6 Flash und dem sicherheitsorientierten 3.5 Flash Cyber, hat aber einen klar anderen Einsatzzweck: Klassifizierung, Extraktion, Routing, Tagging und einfache Chats im großen Maßstab.
Preise: die günstigste Gemini-Option
Im Vergleich zum restlichen Angebot ist Flash-Lite deutlich günstiger. Alle Angaben stammen von Googles offizieller Preisseite:
| Modell | Input /1 Mio. | Output /1 Mio. |
|---|---|---|
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 |
| Gemini 3.6 Flash | $1.50 | $7.50 |
| Gemini 3.5 Flash (vorherig) | $1.50 | $9.00 |
Allein auf Tokenbasis ist Flash-Lite beim Input fünfmal und beim Output dreimal günstiger als 3.6 Flash. Der tatsächliche Abstand wird noch größer, wenn man berücksichtigt, wie viele Token die Modelle für eine Aufgabe tatsächlich verbrauchen.
Direktvergleich mit Gemini 3.6 Flash
Am 22. Juli 2026 habe ich beide Modelle über OpenRouter mit denselben drei Prompts bei Temperatur 0 getestet: einer Programmieraufgabe, einem Reasoning-Problem und einer JSON-Extraktion.
| Messwert (3 Aufgaben, Temp. 0) | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| Input-Token | 147 | 148 |
| Output-Token | 543 | 3,058 |
| Gesamtkosten | $0.0014 | $0.023 |
| Durchschnittliche Zeit bis zum ersten Token | 1.2s | 4.5s |
| Generierungsgeschwindigkeit | über 400 Tok./s | — |
| Korrekte Antworten | 3 / 3 | 3 / 3 |
Flash-Lite war 94 % günstiger und löste jede Aufgabe korrekt, einschließlich des mehrstufigen Problems zur Zugfahrzeit. Zwei Faktoren erklären den Abstand: Das Modell streamte mit mehr als 400 Token pro Sekunde und lag damit über Googles Angabe von 350. Außerdem lieferte es den ersten Token schneller, weil es nicht wie 3.6 Flash innezuhalten scheint, um zu „denken“. Hinzu kommt die deutlich kürzere Ausgabe: einige hundert statt mehrerer tausend Output-Token. 3.6 Flash verwendet viele versteckte Reasoning-Token, die ebenfalls abgerechnet werden. Bei einfachen Aufgaben ist dieser Denkaufwand oft unnötig.
Auch bei der gefühlten Reaktionszeit ist der Unterschied klar: Flash-Lite lieferte den ersten Token im Schnitt nach etwa 1.2 Sekunden, 3.6 Flash erst nach 4.5 Sekunden. In einem Chat oder einer Pipeline mit vielen Anfragen wirkt Flash-Lite dadurch spürbar schneller.
Zwei Einschränkungen sind wichtig. Erstens handelt es sich um einen einzelnen Durchlauf bei Temperatur 0. Die Modelle können von Lauf zu Lauf variieren; die konkreten Werte sind daher als Anhaltspunkt zu lesen, nicht als Benchmark. Zweitens waren die drei Aufgaben einfach. Der Abstand im Intelligence Index – 36 gegenüber 50 – ist real und zeigt sich bei schwierigeren Problemen, komplexen mehrstufigen Agenten, anspruchsvollem Code oder Aufgaben, die sorgfältiges Reasoning verlangen. Dort wird das knappe Denkbudget von Flash-Lite eher zur Grenze als zum Sparvorteil.
Wann Flash-Lite passt – und wann nicht
- Nutzen Sie Gemini 3.5 Flash-Lite für große Mengen einfacher, latenzkritischer Aufgaben: Klassifizierung, Entitätsextraktion, Routing und Triage, Tagging, Zusammenfassungen kurzer Texte und einfache Chats. Zu diesem Preis lässt sich das Modell in einem Umfang einsetzen, der mit 3.6 Flash unangenehm teuer wäre.
- Greifen Sie zu 3.6 Flash, wenn echtes Reasoning nötig ist: agentisches Programmieren, Computernutzung, mehrstufige Workflows oder Aufgaben, bei denen eine falsche Antwort teuer wird. Der ausführliche Leitfaden zu Gemini 3.6 Flash behandelt Benchmarks und Preise dieser Stufe.
Ein gängiges Muster ist die Kombination beider Modelle: Die Masse günstiger, einfacher Anfragen geht an Flash-Lite, schwierige Fälle werden nur bei Bedarf an 3.6 Flash weitergereicht. Da beide das Kontextfenster von 1 Mio. Token und dieselbe API nutzen, genügt dafür eine einzeilige Änderung der Modell-ID.
Zugang zu Gemini 3.5 Flash-Lite
Das Modell ist in der Gemini API und in Google AI Studio unter der ID gemini-3.5-flash-lite verfügbar. Zum Testen bietet AI Studio einen kostenlosen Tarif. Wer über einen Aggregator arbeitet, findet das Modell bei OpenRouter und AIReiter zu Googles Listenpreis. Das ist praktisch, wenn Gemini- und Claude-Modelle über einen gemeinsamen Key laufen sollen.
FAQ
Was kostet Gemini 3.5 Flash-Lite?
$0.30 pro 1 Mio. Input-Token und $2.50 pro 1 Mio. Output-Token. Damit ist es die günstigste Stufe im Gemini-Angebot.
Ist Gemini 3.5 Flash-Lite kostenlos?
Für Prototypen steht in Google AI Studio ein kostenloser Tarif bereit. Im produktiven Einsatz gelten die oben genannten nutzungsbasierten Preise.
Wie schnell ist Gemini 3.5 Flash-Lite?
Google gibt rund 350 Output-Token pro Sekunde an. In meinem Streaming-Test waren es mehr als 400, der erste Token erschien nach ungefähr 1.2 Sekunden.
Reicht Flash-Lite aus oder sollte ich 3.6 Flash verwenden?
Für einfache Aufgaben mit hohem Volumen liefert Flash-Lite korrekte Ergebnisse und ist deutlich günstiger. Bei Reasoning-intensiven oder agentischen Aufgaben rechtfertigt die höhere Intelligenz von 3.6 Flash – Index 50 gegenüber 36 – die Mehrkosten.
