AIREITER

Gemini Omni Flash Preisgestaltung & API-Zugriffsleitfaden

Zuletzt aktualisiert: 2026-07-01 07:25:03

Der tatsächliche API-Preis von Gemini Omni Flash liegt bei etwa 0,10 $ pro Sekunde für 720p-Video — das entspricht 17,50 $ pro Million Output-Tokens, abgerechnet mit 5.792 Tokens pro Sekunde, laut Googles eigener Gemini-API-Preisseite, geprüft im Juli 2026. Für dieses Modell gibt es keine kostenlose Stufe. Die Modell-ID — leicht zu übersehen, da sie in der Dokumentation versteckt ist — lautet gemini-omni-flash-preview und ist weiterhin als "preview" gekennzeichnet, sodass sich Preis- und Zugriffsdaten vor der allgemeinen Verfügbarkeit noch ändern können. Es wird über zwei separate Zugänge ausgeliefert, Google AI Studio und Vertex AI, die keinen gemeinsamen Code teilen. Wenn Sie irgendwo eine Schätzung von "$0.20–0.60 per second" gesehen haben, war das eine Vorab-Schätzung, die geschrieben wurde, bevor Google echte Zahlen veröffentlicht hat; sie ist inzwischen veraltet.

Was Gemini Omni Flash tatsächlich ist

Laut Googles Ankündigungsbeitrag ist Gemini Omni Flash das erste Modell einer neuen „Omni“-Familie — ein Any-to-Any-Transformer, der Text, Bilder, Audio und Video als Eingabe verarbeitet und Video zurückgibt, das auf Geminis Weltwissen basiert. Für Abonnenten von Google AI Plus, Pro und Ultra ist es über die Gemini-App, Google Flow und YouTube Shorts/Create kostenlos; der Zugang über die Entwickler-API folgte Ende Juni 2026, laut VentureBeat.

Sein herausragendes Merkmal ist die dialogische, mehrstufige Bearbeitung: Beschreibe eine Änderung, sie setzt die Bearbeitung um und behält dabei Figuren und Szenen konsistent, und du kannst im selben Thread weiter iterieren.

Die DeepMind-Model-Card listet die Sicherheitsleitplanken auf — SynthID-Wasserzeichen und C2PA-Content Credentials auf jedem Clip, kein Lippensynchronisieren eines Standfotos einer realen Person mit Audio, eingeschränkte Sprachbearbeitung — sowie drei bekannte Schwachstellen: Konsistenz bei mehrstufigen Bearbeitungen, Szenen mit komplexer Bewegung und präziser On-Screen-Text. Wir haben alle drei unten getestet.

Wir haben das Multi-Turn-Editing selbst getestet

Wir haben es durch Google Flow mit einer zweistufigen Bearbeitungssequenz laufen lassen: Erstelle eine Frau, die ein handgeschriebenes Kartonschild hält, und bearbeite dann denselben Clip so, dass er auf Nacht mit einem Neon-Schild umgestellt wird und sie sich umdreht und auf die Kamera zugeht. Beide Ausgabedateien kamen mit 720p, 24fps, 8 Sekunden und nativem Stereo-Audio zurück — genau wie von Drittanbieter-Integratoren berichtet, nun unabhängig an unseren eigenen Dateien bestätigt.

Der auf dem Kartonschild dargestellte Text auf dem Bildschirm — „OPEN TODAY“ — wurde während der gesamten 8 Sekunden perfekt und ohne Verfälschung wiedergegeben. Das ist bemerkenswert, weil die genaue Textwiedergabe eine der Schwächen ist, die die Model Card selbst einräumt.

Die Behauptung zur Charakterkonsistenz hält in der Praxis gut stand: dasselbe Gesicht, dieselbe rote Daunenjacke, derselbe weiße Pullover, dieselbe Frisur, sauber übernommen in ein völlig anderes Beleuchtungs-Setup mit einem neu hinzugefügten Neon-Schild in der Szene. Zwei Dinge wurden jedoch nicht wie angewiesen umgesetzt:

  • Die Beschriftung des Hintergrundgeschäfts hat die Textrendering-Funktion kaputt gemacht — das "COFFEE"-Schild im Fenster wurde als "COFFFEE" wiedergegeben (zusätzlicher Buchstabe), obwohl das Papp-Schild im Vordergrund in Runde eins einwandfrei war. Die Textgenauigkeit scheint stark davon abzuhängen, wie auffällig und wie zentral der Text im Bild ist, nicht nur davon, ob das Modell überhaupt Text rendern kann.

  • Die angeforderte Bewegung „sich umdrehen und zur Kamera gehen“ fand kaum statt. Schau dir den Clip oben an — statt dessen bekamen wir eine subtile Verschiebung der Kameradistanz, während das Motiv größtenteils stationär blieb, nicht das klare Umdrehen-und-auf-die-Kamera-zugehen, das im Prompt gefordert war. Das passt zu der von Google auf der Model Card offengelegten Einschränkung bei „complex-motion scenes“; mehrstufige Körperbewegungen folgen der Anweisung noch nicht so zuverlässig wie eine statische Beleuchtungs- oder Szenenänderung.

Noch ein weiterer Punkt, den man beim Budgetieren berücksichtigen sollte: Eine einzige falsch eingegebene Bearbeitung verbrauchte eine unserer verfügbaren Generierungen auf Flow, was ausreicht, um eine Testsitzung schneller als erwartet aufzubrauchen. Google veröffentlicht kein genaues Generierungsbudget pro Tarif für Omni Flash, also rechnen Sie bei ernsthaftem Testen damit, mehr Versuche zu benötigen, als Sie eingeplant haben, und gehen Sie nicht davon aus, dass Sie einen misslungenen Prompt kostenlos erneut versuchen können.

Gemini Omni Flash-Preisgestaltung, aufgeschlüsselt

Hier ist die Preisliste, gemäß der Preisseite der Google Gemini API — kein kostenloses Kontingent, nur der Standardtarif:

Preis

Eingabe (Text / Bild / Video / Audio)

$1.50 pro 1M Tokens

Ausgabe — Text

$9.00 pro 1M Tokens

Ausgabe — Video

$17.50 pro 1M Tokens

Video wird nicht direkt pro Sekunde abgerechnet — es wird nach Output-Tokens abgerechnet, und Google gibt die Umrechnung vor: 5.792 Tokens pro Sekunde 720p-Video. Rechnet man das aus ($17.50 ÷ 1,000,000 × 5,792), kommt man auf ungefähr $0.101 pro Sekunde, was in Googles Dokumentation auf „approximately $0.10 per second“ gerundet wird.

Was das für einen echten Clip bei 720p bedeutet:

Cliplänge

Ca. Kosten

4s

$0.41

5s

$0.51

6s

$0.61

8s

$0.81

10s

$1.01

Zusätzliche Input-Tokens kommen obendrauf — ein kurzer Text-Prompt plus ein oder zwei Referenzbilder kosten typischerweise ein paar Cent bei $1.50/1M — und ein 8-Sekunden-Clip landet insgesamt bei etwa $0.85. Auf Googles Seite ist nur die Token-zu-Sekunden-Umrechnung für 720p dokumentiert; 1080p und 4K sind nicht separat aufgeführt, daher sollte man dafür eher mit höheren Kosten rechnen und die Live-Seite vor einem Produktionseinsatz noch einmal prüfen.

Wie man tatsächlich API-Zugang erhält

Nur zwei Kanäle sind tatsächlich offiziell bestätigt — seien Sie skeptisch gegenüber jedem Leitfaden eines Drittanbieters, der einen breiteren Wiederverkaufszugang behauptet, bevor Googles eigene Kanäle vollständig geöffnet sind:

  1. Google AI Studio — holen Sie sich einen Schlüssel unter aistudio.google.com/apikey, exportieren Sie ihn als GEMINI_API_KEY und rufen Sie das Modell als gemini-omni-flash-preview über die Interactions API auf (pip install -U google-genai oder npm install @google/genai). Der schnellste Weg zum Testen.

  2. Vertex AI — dasselbe zugrunde liegende Modell, bereitgestellt über einen separaten Enterprise-Endpoint, der zusätzlich eine GCP-Projekt-ID, eine Region/Standort-Einstellung und IAM-basierte Authentifizierung anstelle eines einfachen API-Schlüssels erfordert. Planen Sie 30–60 Minuten für die Einrichtung ein, wenn Sie Google Cloud Billing noch nie verwendet haben.

Es lohnt sich, bei der Planung zu berücksichtigen: AI Studio und Vertex AI sind separate Google-Produktschnittstellen — unterschiedliche Dokumentationen, unterschiedliche SDKs und jeweils API-Key-Authentifizierung beziehungsweise GCP-IAM-Authentifizierung. Sie sind absichtlich nicht austauschbar, also wählen Sie die Plattform, auf der Sie tatsächlich bereitstellen werden, bevor Sie mit der Entwicklung beginnen, statt zunächst gegen AI Studio zu prototypisieren und anzunehmen, dass ein späterer Wechsel zu Vertex per Copy-and-Paste möglich ist.

Noch eine weitere wichtige Information, bevor Sie beginnen: Laut Google's Interactions API get-started guide ist bei der Videogenerierung für langlaufende Aufgaben standardmäßig background=True festgelegt, statt einer synchronen Antwort; das bedeutet auch, dass es nicht mit OpenAI chat-completions kompatibel ist. Ein minimales Python-Muster — beispielhaft; prüfen Sie in der aktuellen google-genai SDK-Referenz die exakten Feldnamen, bevor Sie es einsetzen:

from google import genai
import time

client = genai.Client()  # liest GEMINI_API_KEY aus der Umgebung

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="Eine Drohnenaufnahme, die sich von einem Leuchtturm bei Sonnenuntergang zurückzieht",
    background=True,
)

while interaction.status not in ("completed", "failed"):
    time.sleep(3)
    interaction = client.interactions.get(interaction.id)

if interaction.status == "completed":
    with open("output.mp4", "wb") as f:
        f.write(interaction.output_video.read())

Hier gibt es kein direkt einsetzbares Chat-Completions-Format — wenn Ihr vorhandener Integrationscode das synchrone Antwortformat von OpenAI voraussetzt, schreiben Sie die Anfrage-/Antwortverarbeitung neu, statt nur einen Modellstring auszutauschen.

Gemini Omni Flash vs. Single-Shot-Video-Modelle

Wähle Omni Flash für den dialogorientierten Bearbeitungs-Loop. Für einen geradlinigen Text-/Bild-zu-Video-Job mit fester Auflösung und Dauer ist ein Single-Shot-Modell einfacher und kostengünstiger nachzuvollziehen:

Am besten für

Zugriff

Gemini Omni Flash

Mehrstufige dialogbasierte Bearbeitung, Charakterkonsistenz über Bearbeitungen hinweg

Direkt über Google AI Studio oder Vertex AI

Veo 3.1 / Sora 2 / Seedance 2.0

Einmalige Text-/Bild-zu-Video-Erstellung mit fester Spezifikation

Direkt von jedem Anbieter oder gebündelt auf Relay-Plattformen wie AIReiter

Omni Flash ist auf AIReiter oder ähnlichen gebündelten Relay-Plattformen noch nicht verfügbar — für seinen Multi-Turn-Workflow bleibt der direkte Weg über Googles eigene API die einfachste Option.

FAQ

Was ist die Modell-ID von Gemini Omni Flash?

gemini-omni-flash-preview. Verwenden Sie diesen exakten String, wenn Sie ihn über die Interactions API in Google AI Studio oder Vertex AI aufrufen. Es ist noch ein Vorschau-Modell, daher könnte sich die ID bei allgemeiner Verfügbarkeit ändern.

Wie viel kostet Gemini Omni Flash pro Video?

Etwa 0,10 $/Sek. bei 720p, also kostet ein typischer 4–10-Sekunden-Clip 0,50–1 $.

Gibt es einen kostenlosen Tarif für Gemini Omni Flash?

Nein. Auf der Preisseite von Google steht für den kostenlosen Tarif bei Eingabe und Ausgabe jeweils „Nicht verfügbar“ — nur im Standard-Tarif (kostenpflichtig).

Kann ich denselben Code in AI Studio und Vertex AI verwenden?

Nicht direkt. Sie sind separate Google-Produktoberflächen mit unterschiedlichen SDKs und Authentifizierung (API key vs. GCP IAM), daher muss Code, der für die eine geschrieben wurde, für die andere wirklich überarbeitet werden. Wählen Sie Ihr Bereitstellungsziel, bevor Sie mit dem Aufbau beginnen.

Funktioniert Gemini Omni Flash mit Code für Chat-Completions im OpenAI-Stil?

Nein. Die Videogenerierung erfolgt über asynchrone Aufgabenerstellung und Polling (background=True plus interactions.get()), nicht über ein synchrones chat-completions-Antwortformat.

Funktioniert die Konsistenz der Figur über mehrere Gesprächsrunden tatsächlich?

In unserem eigenen zweirundigen Test mit Google Flow: Ja, beim Erscheinungsbild — dasselbe Gesicht, dieselbe Jacke und dasselbe Haar wurden sauber durch einen vollständigen Szenenwechsel von Tag zu Nacht beibehalten. Es hatte mehr Schwierigkeiten, komplexe Bewegungsanweisungen zu befolgen (eine angeforderte Dreh-und-Geh-Bewegung war kaum erkennbar) und Hintergrundtext korrekt darzustellen; beides entspricht den Einschränkungen, die Google auf der Modellkarte offenlegt.