Il prezzo reale dell'API di Gemini Omni Flash è di circa $0.10 al secondo di video 720p — cioè $17.50 per un milione di token in output, fatturati a 5.792 token al secondo, secondo la pagina ufficiale dei prezzi dell'API Gemini di Google, verificata a luglio 2026. Non esiste un piano gratuito per questo modello. L'ID del modello — facile da perdere perché è nascosto nella documentazione — è gemini-omni-flash-preview, ancora contrassegnato come "preview", quindi i dettagli su prezzi e accesso possono cambiare prima della disponibilità generale. Viene distribuito tramite due porte separate, Google AI Studio e Vertex AI, che non condividono il codice. Se hai visto da qualche parte una stima di "$0.20–0.60 per second", si trattava di un'ipotesi pre-lancio scritta prima che Google pubblicasse i numeri reali; ora è obsoleta.
Cosa è veramente Gemini Omni Flash
Per il post di lancio di Google, Gemini Omni Flash è il primo modello di una nuova famiglia "Omni" — un transformer any-to-any che accetta testo, immagini, audio e video in input e restituisce video basati sulla conoscenza del mondo di Gemini. È gratuito per gli abbonati Google AI Plus, Pro e Ultra tramite l'app Gemini, Google Flow e YouTube Shorts/Create; l'accesso API per gli sviluppatori è arrivato alla fine di giugno 2026, secondo VentureBeat.
La sua caratteristica distintiva è l'editing conversazionale multi-turno: descrivi una modifica, il sistema la applica mantenendo coerenti personaggi e scene, e puoi continuare a iterare nello stesso thread.
La scheda del modello DeepMind elenca le misure di sicurezza — watermarking SynthID e credenziali dei contenuti C2PA su ogni clip, nessun lip-sync di una foto statica di una persona reale sull'audio, modifica della voce limitata — e tre punti deboli noti: coerenza nelle modifiche in più passaggi, scene con movimenti complessi e testo accurato sullo schermo. Abbiamo testato tutti e tre qui sotto.
Abbiamo Testato Noi Stessi la Modifica Multi-Turn
Lo abbiamo fatto passare attraverso Google Flow con una sequenza di modifica in due round: generare una donna che tiene in mano un cartello di cartone scritto a mano, poi modificare la stessa clip per trasformarla in notturna con un’insegna al neon e farla girare e camminare verso la camera. Entrambi i file di output sono tornati a 720p, 24fps, 8 secondi, con audio stereo nativo — in linea con quanto riportato dagli integratori di terze parti, ora confermato indipendentemente sui nostri file.
Il testo sullo schermo sul cartello di cartone — "OPEN TODAY" — è stato reso perfettamente, senza distorsioni, per tutti gli 8 secondi. Questo è notevole perché il rendering accurato del testo è una delle debolezze che la stessa scheda del modello ammette.
L’affermazione sulla coerenza del personaggio regge bene nella pratica: stesso volto, stesso piumino rosso, stesso maglione bianco, stessi capelli, trasferiti in modo pulito in un’ambientazione di illuminazione completamente diversa con una nuova insegna al neon aggiunta alla scena. Tuttavia, due cose non sono andate come richiesto:
L'insegna sullo sfondo ha compromesso il rendering del testo — l'insegna "COFFEE" nella finestra è tornata come "COFFFEE" (lettera in più), anche se l'insegna di cartone in primo piano al primo giro era impeccabile. L'accuratezza del testo sembra dipendere molto da quanto il testo sia prominente e centrale nell'inquadratura, non solo dal fatto che il modello riesca a renderizzare il testo in generale.
Il movimento richiesto di "girarsi e camminare verso la telecamera" è appena avvenuto. Guarda il clip qui sopra — quello che abbiamo ottenuto invece è stato un sottile cambiamento della distanza dalla telecamera con il soggetto per lo più fermo, non la chiara svolta e camminata richiesta nel prompt. Questo è in linea con la limitazione delle "scene con movimento complesso" che Google dichiara nella scheda del modello; il movimento corporeo in più fasi non segue ancora l'istruzione in modo affidabile quanto un cambio da statico a statico dell'illuminazione o della scena.
Un’altra cosa da mettere in conto nel budget: una singola modifica digitata male ha consumato una delle nostre generazioni disponibili su Flow, abbastanza da bruciare una sessione di test più in fretta del previsto. Google non pubblica una quota esatta di generazioni per piano per Omni Flash, quindi, se state testando seriamente, aspettatevi di usare più tentativi di quanti ne abbiate pianificati e non presumete di poter ritentare gratuitamente un prompt andato male.
Prezzi di Gemini Omni Flash, suddivisi
Ecco la scheda tariffe, secondo la pagina dei prezzi dell'API Gemini di Google — nessun piano gratuito, solo tariffa Standard:
Prezzo | |
|---|---|
Input (testo / immagine / video / audio) | $1.50 per 1M token |
Output — testo | $9.00 per 1M token |
Output — video | $17.50 per 1M token |
Il video non viene fatturato direttamente al secondo: viene fatturato in base ai token di output, e Google specifica la conversione: 5.792 token per secondo di video 720p. Facendo i conti ($17.50 ÷ 1,000,000 × 5,792) si arriva a circa $0.101 al secondo, che la documentazione di Google arrotonda a "circa $0.10 al secondo."
Cosa significa per una clip reale, a 720p:
Lunghezza del clip | Costo approssimativo |
|---|---|
4s | $0.41 |
5s | $0.51 |
6s | $0.61 |
8s | $0.81 |
10s | $1.01 |
Aggiungi i token di input in cima — un breve prompt testuale più una o due immagini di riferimento aggiunge in genere pochi centesimi a $1.50/1M — e una clip di 8 secondi arriva a circa $0.85 in totale. La pagina di Google documenta solo la conversione da token a secondi per 720p; 1080p e 4K non sono elencati separatamente, quindi considerali probabilmente più costosi e ricontrolla la pagina live prima di un'esecuzione in produzione.
Come ottenere davvero l'accesso alle API
Sono confermati ufficiali solo due canali — diffida di qualsiasi guida di terze parti che sostenga un accesso alla rivendita più ampio prima che i canali ufficiali di Google siano completamente aperti:
Google AI Studio — ottieni una chiave su
aistudio.google.com/apikey, esportala comeGEMINI_API_KEY, e chiama il modello comegemini-omni-flash-previewtramite la Interactions API (pip install -U google-genaioppurenpm install @google/genai). Il percorso più veloce per i test.Vertex AI — stesso modello sottostante, esposto da un endpoint separato di livello enterprise che richiede inoltre un ID progetto GCP, un'impostazione di regione/località e l'autenticazione basata su IAM invece di una semplice API key. Metti in conto 30-60 minuti di configurazione se non hai mai toccato la fatturazione di Google Cloud prima.
Vale la pena pianificare tenendo presente: AI Studio e Vertex AI sono superfici di prodotto Google separate — documentazione diversa, SDK diversi e autenticazione con API key versus autenticazione GCP IAM rispettivamente. Non sono intercambiabili per progettazione, quindi scegli la piattaforma su cui effettivamente distribuirai prima di iniziare a costruire, invece di prototipare su AI Studio e dare per scontato di poter fare in seguito un semplice copia-incolla su Vertex.
Un'altra cosa utile da sapere prima di iniziare: secondo la guida introduttiva all'API Interactions di Google, la generazione video imposta per default background=True per i task a lunga esecuzione invece di una risposta sincrona, il che significa anche che non è compatibile con OpenAI chat-completions. Un pattern Python minimale — solo a scopo illustrativo; verifica il riferimento attuale dello SDK google-genai per i nomi esatti dei campi prima di distribuirlo:
from google import genai
import time
client = genai.Client() # legge GEMINI_API_KEY dall'ambiente
interaction = client.interactions.create(
model="gemini-omni-flash-preview",
input="Un'inquadratura con drone che si allontana da un faro al tramonto",
background=True,
)
while interaction.status not in ("completed", "failed"):
time.sleep(3)
interaction = client.interactions.get(interaction.id)
if interaction.status == "completed":
with open("output.mp4", "wb") as f:
f.write(interaction.output_video.read())
Non c’è qui una forma di chat-completions plug-and-play — se il tuo codice di integrazione esistente presume il formato di risposta sincrono di OpenAI, stai riscrivendo la gestione richiesta/risposta, non sostituendo una stringa del modello.
Gemini Omni Flash vs. Modelli video single-shot
Scegli Omni Flash per il ciclo di modifica conversazionale. Per un lavoro diretto di text/image-to-video a risoluzione e durata fisse, un modello single-shot è più semplice ed economico da considerare:
Ideale per | Accesso | |
|---|---|---|
Gemini Omni Flash | Editing conversazionale multi-turno, coerenza del personaggio tra le modifiche | Google AI Studio o Vertex AI direttamente |
Text/image-to-video one-shot a una specifica fissa | Direttamente da ciascun fornitore, oppure in bundle su piattaforme relay come AIReiter |
Omni Flash non è ancora su AIReiter o piattaforme di relay aggregate simili — per il suo flusso di lavoro multi-turn, andare direttamente alla API di Google rimane l'opzione più semplice.
FAQ
Qual è l'ID del modello Gemini Omni Flash?
gemini-omni-flash-preview. Usa questa stringa esatta quando lo richiami tramite la Interactions API in Google AI Studio o Vertex AI. È ancora un modello in anteprima, quindi l'ID potrebbe cambiare al momento della disponibilità generale.
Quanto costa Gemini Omni Flash per video?
Circa $0.10/sec a 720p, quindi una clip tipica di 4-10 secondi costa $0.50-$1.
Esiste un piano gratuito per Gemini Omni Flash?
No. La pagina dei prezzi di Google indica "Not available" sia per l'input sia per l'output nel tier gratuito — solo tier Standard (a pagamento).
Posso usare lo stesso codice su AI Studio e Vertex AI?
Non direttamente. Sono superfici di prodotto Google separate con SDK e autenticazione diversi (chiave API vs. GCP IAM), quindi il codice scritto per uno deve essere rielaborato in modo sostanziale per passare all'altro. Scegli il tuo target di distribuzione prima di iniziare a sviluppare.
Gemini Omni Flash funziona con codice di completamento chat in stile OpenAI?
No. La generazione video avviene tramite la creazione asincrona di task e il polling (background=True più interactions.get()), non tramite un formato di risposta sincrono chat-completions.
La coerenza del personaggio in più turni funziona davvero?
Nel nostro test in due round tramite Google Flow, sì per l’aspetto — lo stesso volto, giacca e capelli sono stati mantenuti in modo coerente in un passaggio completo da una scena diurna a una notturna. Ha avuto maggiori difficoltà nel seguire istruzioni di movimento complesse (una richiesta di girarsi e camminare è stata appena percepita) e nel rendere accuratamente il testo sullo sfondo, entrambi aspetti che corrispondono alle limitazioni che Google indica nella scheda del modello.