Le prix réel de l’API Gemini Omni Flash est d’environ 0,10 $ par seconde de vidéo 720p — soit 17,50 $ par million de jetons de sortie, facturés à 5 792 jetons par seconde, selon la page de tarification officielle de l’API Gemini de Google, consultée en juillet 2026. Il n’y a pas de niveau gratuit pour ce modèle. L’identifiant du modèle — facile à manquer puisqu’il est enfoui dans la documentation — est gemini-omni-flash-preview, encore marqué « preview », donc les détails de tarification et d’accès peuvent évoluer avant la disponibilité générale. Il est distribué via deux portes distinctes, Google AI Studio et Vertex AI, qui ne partagent pas de code. Si vous avez vu quelque part une estimation de « 0,20–0,60 $ par seconde », il s’agissait d’une supposition d’avant lancement rédigée avant que Google ne publie les chiffres réels ; elle est désormais obsolète.
Ce qu’est réellement Gemini Omni Flash
Selon le billet de lancement de Google, Gemini Omni Flash est le premier modèle d’une nouvelle famille « Omni » — un transformeur any-to-any acceptant du texte, des images, de l’audio et de la vidéo en entrée et renvoyant de la vidéo ancrée dans les connaissances du monde de Gemini. Il est gratuit pour les abonnés Google AI Plus, Pro et Ultra via l’application Gemini, Google Flow et YouTube Shorts/Create ; l’accès à l’API pour les développeurs a suivi fin juin 2026, selon VentureBeat.
Sa caractéristique remarquable est l’édition conversationnelle en plusieurs échanges : décrivez une modification, elle l’applique tout en gardant la cohérence des personnages et des scènes, et vous pouvez continuer à itérer dans le même fil de discussion.
La fiche modèle DeepMind indique les garde-fous de sécurité — filigranage SynthID et métadonnées de contenu C2PA sur chaque clip, absence de synchronisation labiale d’une photo fixe d’une personne réelle sur un audio, édition vocale restreinte — ainsi que trois points faibles connus : la cohérence entre des modifications en plusieurs étapes, les scènes à mouvement complexe et le texte à l’écran précis. Nous avons testé les trois ci-dessous.
Nous avons testé nous-mêmes l’édition multi-tour
Nous l’avons fait passer par Google Flow avec une séquence d’édition en deux tours : générer une femme tenant une pancarte en carton manuscrite, puis modifier ce même clip pour le faire passer à la nuit avec une enseigne au néon et la faire se tourner et marcher vers la caméra. Les deux fichiers de sortie sont revenus en 720p, 24fps, 8 secondes, avec un audio stéréo natif — correspondant à ce que des intégrateurs tiers ont signalé, désormais confirmé indépendamment sur nos propres fichiers.
Le texte affiché à l’écran sur la pancarte en carton — « OPEN TODAY » — est resté parfaitement rendu, sans altération, pendant les 8 secondes complètes. C’est remarquable, car le rendu précis du texte est l’une des faiblesses que la fiche du modèle elle-même reconnaît.
La promesse de cohérence du personnage se vérifie bien en pratique : même visage, même doudoune rouge, même pull blanc, mêmes cheveux, repris proprement dans un éclairage complètement différent, avec un nouvel enseigne néon ajoutée à la scène. Deux choses n’ont toutefois pas été faites comme demandé :
L’enseigne de fond a cassé le rendu du texte — l’enseigne « COFFEE » dans la vitrine est revenue en affichant « COFFFEE » (lettre en trop), même si l’enseigne en carton au premier plan dans la première séquence était irréprochable. La précision du texte semble dépendre fortement de la visibilité et de la centralité du texte dans le кадre, et pas seulement du fait que le modèle puisse ou non rendre du texte.
Le mouvement demandé « se tourner et marcher vers la caméra » a à peine eu lieu. Regardez le clip ci-dessus — ce que nous avons obtenu à la place était un léger changement de distance par rapport à la caméra, le sujet restant essentiellement immobile, et non le virage suivi d’une marche clairement demandé dans le prompt. Cela correspond à la limitation des « scènes à mouvement complexe » divulguée par Google dans la fiche du modèle ; les mouvements corporels en plusieurs étapes ne suivent pas encore l’instruction aussi fiablement qu’un simple changement statique à statique d’éclairage ou de scène.
Une autre chose à prendre en compte dans votre budget : une seule modification mal saisie a consommé l’une de nos générations disponibles sur Flow, ce qui suffit à épuiser une session de test plus vite que prévu. Google ne publie pas de quota exact de générations par forfait pour Omni Flash, donc si vous testez sérieusement, attendez-vous à faire plus d’essais que prévu et ne supposez pas que vous pouvez réessayer gratuitement une invite ratée.
Tarification de Gemini Omni Flash, détaillée
Voici la grille tarifaire, selon la page de tarification de l’API Gemini de Google — pas de niveau gratuit, tarif Standard uniquement :
Prix | |
|---|---|
Entrée (texte / image / vidéo / audio) | 1,50 $ par 1M de tokens |
Sortie — texte | 9,00 $ par 1M de tokens |
Sortie — vidéo | 17,50 $ par 1M de tokens |
La vidéo n’est pas facturée directement à la seconde — elle est facturée en fonction des jetons de sortie, et Google précise la conversion : 5 792 jetons par seconde de vidéo 720p. Faites le calcul ($17.50 ÷ 1,000,000 × 5,792) et vous obtenez environ $0.101 par seconde, ce que la documentation de Google arrondit à « environ $0.10 par seconde ».
Ce que cela signifie pour un clip réel, en 720p :
Durée du clip | Coût approx. |
|---|---|
4s | $0.41 |
5s | $0.51 |
6s | $0.61 |
8s | $0.81 |
10s | $1.01 |
Ajoutez des tokens d’entrée en plus — une courte invite textuelle plus une ou deux images de référence ajoutent généralement quelques centimes à 1,50 $/1M — et un clip de 8 secondes revient à environ 0,85 $ au total. La page de Google ne documente la conversion de tokens en secondes que pour le 720p ; le 1080p et la 4K ne sont pas listés séparément, donc prévoyez qu’ils soient probablement plus chers et revérifiez la page en direct avant une exécution en production.
Comment obtenir réellement l'accès à l'API
Seuls deux canaux sont réellement confirmés comme officiels — méfiez-vous de tout guide tiers prétendant offrir un accès à la revente plus large avant que les propres canaux de Google ne soient entièrement ouverts :
Google AI Studio — obtenez une clé à
aistudio.google.com/apikey, exportez-la commeGEMINI_API_KEY, et appelez le modèle sous le nomgemini-omni-flash-previewvia l’API Interactions (pip install -U google-genaiounpm install @google/genai). Le chemin le plus rapide pour les tests.Vertex AI — même modèle sous-jacent, exposé par un endpoint d’entreprise distinct qui nécessite en plus un ID de projet GCP, un paramètre de région/emplacement et une authentification basée sur IAM au lieu d’une simple clé API. Prévoyez 30 à 60 minutes de configuration si vous n’avez jamais touché à la facturation Google Cloud auparavant.
Il vaut la peine de planifier en conséquence : AI Studio et Vertex AI sont des interfaces produits Google distinctes — documentation différente, SDKs différents, et authentification par clé API versus authentification GCP IAM, respectivement. Ils ne sont pas interchangeables par conception, alors choisissez la plateforme sur laquelle vous déploierez réellement avant de commencer à construire, plutôt que de prototyper avec AI Studio en supposant qu’il suffira ensuite de copier-coller vers Vertex.
Une autre chose bonne à savoir avant de commencer : selon le guide de démarrage de l'API Interactions de Google, la génération de vidéo utilise par défaut background=True pour les tâches de longue durée plutôt qu'une réponse synchrone, ce qui signifie également qu'elle n'est pas compatible avec les chat-completions d'OpenAI. Un schéma Python minimal — à titre d'exemple ; consultez la référence actuelle du SDK google-genai pour les noms exacts des champs avant de le déployer :
from google import genai
import time
client = genai.Client() # lit GEMINI_API_KEY depuis l’environnement
interaction = client.interactions.create(
model="gemini-omni-flash-preview",
input="Un plan de drone s’éloignant d’un phare au coucher du soleil",
background=True,
)
while interaction.status not in ("completed", "failed"):
time.sleep(3)
interaction = client.interactions.get(interaction.id)
if interaction.status == "completed":
with open("output.mp4", "wb") as f:
f.write(interaction.output_video.read())
Il n’y a pas ici de forme de chat-completions prête à l’emploi — si votre code d’intégration existant suppose le format de réponse synchrone d’OpenAI, vous réécrivez la gestion requête/réponse, et non vous remplacez une chaîne de modèle.
Gemini Omni Flash contre les modèles vidéo à prise unique
Choisissez Omni Flash pour la boucle d’édition conversationnelle. Pour une tâche directe de texte/image vers vidéo à résolution et durée fixes, un modèle en prise unique est plus simple et moins coûteux à comprendre :
Idéal pour | Accès | |
|---|---|---|
Gemini Omni Flash | Édition conversationnelle multi-tours, cohérence des personnages à travers les modifications | Google AI Studio ou Vertex AI directement |
Texte/image vers vidéo en une seule prise, avec une spécification fixe | Directement auprès de chaque fournisseur, ou regroupé sur des plateformes relais telles que AIReiter |
Omni Flash n’est pas encore sur AIReiter ni sur des plateformes de relais groupées similaires — pour son workflow multi-turn, passer directement par l’API de Google reste l’option la plus simple.
FAQ
Quel est l'ID du modèle Gemini Omni Flash ?
gemini-omni-flash-preview. Utilisez exactement cette chaîne lorsque vous l’appelez via l’API Interactions dans Google AI Studio ou Vertex AI. Il s’agit toujours d’un modèle de préversion, donc l’ID pourrait changer lors de la disponibilité générale.
Combien coûte Gemini Omni Flash par vidéo ?
Environ 0,10 $/sec en 720p, donc un clip typique de 4 à 10 secondes coûte entre 0,50 $ et 1 $.
Existe-t-il une version gratuite pour Gemini Omni Flash ?
Non. La page de tarification de Google indique « Non disponible » pour l’entrée et la sortie sur la formule gratuite — formule Standard (payante) uniquement.
Puis-je utiliser le même code sur AI Studio et Vertex AI ?
Pas directement. Il s’agit de surfaces de produits Google distinctes avec des SDK et une authentification différents (clé API vs. GCP IAM), donc le code écrit pour l’une doit être réellement remanié pour passer à l’autre. Choisissez votre cible de déploiement avant de commencer à développer.
Gemini Omni Flash fonctionne-t-il avec le code de complétion de chat de type OpenAI ?
Non. La génération vidéo s’exécute via la création de tâches asynchrones et le polling (background=True plus interactions.get()), et non via un format de réponse chat-completions synchrone.
La cohérence du personnage sur plusieurs tours fonctionne-t-elle vraiment ?
Dans notre propre test en deux étapes via Google Flow, oui pour l’apparence — le même visage, la même veste et les mêmes cheveux ont été repris de manière cohérente lors d’un changement de scène complet du jour à la nuit. Il a eu davantage de mal à suivre des instructions de mouvement complexes (un tour suivi d’une marche demandé n’a presque pas été pris en compte) et à restituer avec précision le texte en arrière-plan, deux points qui correspondent aux limites que Google divulgue sur la fiche du modèle.