AIREITER

Guida a prezzi e accesso API di Gemini Omni Flash

Ultimo Aggiornamento: 2026-07-01 07:25:04

Il prezzo reale dell'API di Gemini Omni Flash è di circa $0.10 al secondo di video 720p — cioè $17.50 per un milione di token in output, fatturati a 5.792 token al secondo, secondo la pagina ufficiale dei prezzi dell'API Gemini di Google, verificata a luglio 2026. Non esiste un piano gratuito per questo modello. L'ID del modello — facile da perdere perché è nascosto nella documentazione — è gemini-omni-flash-preview, ancora contrassegnato come "preview", quindi i dettagli su prezzi e accesso possono cambiare prima della disponibilità generale. Viene distribuito tramite due porte separate, Google AI Studio e Vertex AI, che non condividono il codice. Se hai visto da qualche parte una stima di "$0.20–0.60 per second", si trattava di un'ipotesi pre-lancio scritta prima che Google pubblicasse i numeri reali; ora è obsoleta.

Cosa è veramente Gemini Omni Flash

Per il post di lancio di Google, Gemini Omni Flash è il primo modello di una nuova famiglia "Omni" — un transformer any-to-any che accetta testo, immagini, audio e video in input e restituisce video basati sulla conoscenza del mondo di Gemini. È gratuito per gli abbonati Google AI Plus, Pro e Ultra tramite l'app Gemini, Google Flow e YouTube Shorts/Create; l'accesso API per gli sviluppatori è arrivato alla fine di giugno 2026, secondo VentureBeat.

La sua caratteristica distintiva è l'editing conversazionale multi-turno: descrivi una modifica, il sistema la applica mantenendo coerenti personaggi e scene, e puoi continuare a iterare nello stesso thread.

La scheda del modello DeepMind elenca le misure di sicurezza — watermarking SynthID e credenziali dei contenuti C2PA su ogni clip, nessun lip-sync di una foto statica di una persona reale sull'audio, modifica della voce limitata — e tre punti deboli noti: coerenza nelle modifiche in più passaggi, scene con movimenti complessi e testo accurato sullo schermo. Abbiamo testato tutti e tre qui sotto.

Abbiamo Testato Noi Stessi la Modifica Multi-Turn

Lo abbiamo fatto passare attraverso Google Flow con una sequenza di modifica in due round: generare una donna che tiene in mano un cartello di cartone scritto a mano, poi modificare la stessa clip per trasformarla in notturna con un’insegna al neon e farla girare e camminare verso la camera. Entrambi i file di output sono tornati a 720p, 24fps, 8 secondi, con audio stereo nativo — in linea con quanto riportato dagli integratori di terze parti, ora confermato indipendentemente sui nostri file.

Il testo sullo schermo sul cartello di cartone — "OPEN TODAY" — è stato reso perfettamente, senza distorsioni, per tutti gli 8 secondi. Questo è notevole perché il rendering accurato del testo è una delle debolezze che la stessa scheda del modello ammette.

L’affermazione sulla coerenza del personaggio regge bene nella pratica: stesso volto, stesso piumino rosso, stesso maglione bianco, stessi capelli, trasferiti in modo pulito in un’ambientazione di illuminazione completamente diversa con una nuova insegna al neon aggiunta alla scena. Tuttavia, due cose non sono andate come richiesto:

  • L'insegna sullo sfondo ha compromesso il rendering del testo — l'insegna "COFFEE" nella finestra è tornata come "COFFFEE" (lettera in più), anche se l'insegna di cartone in primo piano al primo giro era impeccabile. L'accuratezza del testo sembra dipendere molto da quanto il testo sia prominente e centrale nell'inquadratura, non solo dal fatto che il modello riesca a renderizzare il testo in generale.

  • Il movimento richiesto di "girarsi e camminare verso la telecamera" è appena avvenuto. Guarda il clip qui sopra — quello che abbiamo ottenuto invece è stato un sottile cambiamento della distanza dalla telecamera con il soggetto per lo più fermo, non la chiara svolta e camminata richiesta nel prompt. Questo è in linea con la limitazione delle "scene con movimento complesso" che Google dichiara nella scheda del modello; il movimento corporeo in più fasi non segue ancora l'istruzione in modo affidabile quanto un cambio da statico a statico dell'illuminazione o della scena.

Un’altra cosa da mettere in conto nel budget: una singola modifica digitata male ha consumato una delle nostre generazioni disponibili su Flow, abbastanza da bruciare una sessione di test più in fretta del previsto. Google non pubblica una quota esatta di generazioni per piano per Omni Flash, quindi, se state testando seriamente, aspettatevi di usare più tentativi di quanti ne abbiate pianificati e non presumete di poter ritentare gratuitamente un prompt andato male.

Prezzi di Gemini Omni Flash, suddivisi

Ecco la scheda tariffe, secondo la pagina dei prezzi dell'API Gemini di Google — nessun piano gratuito, solo tariffa Standard:

Prezzo

Input (testo / immagine / video / audio)

$1.50 per 1M token

Output — testo

$9.00 per 1M token

Output — video

$17.50 per 1M token

Il video non viene fatturato direttamente al secondo: viene fatturato in base ai token di output, e Google specifica la conversione: 5.792 token per secondo di video 720p. Facendo i conti ($17.50 ÷ 1,000,000 × 5,792) si arriva a circa $0.101 al secondo, che la documentazione di Google arrotonda a "circa $0.10 al secondo."

Cosa significa per una clip reale, a 720p:

Lunghezza del clip

Costo approssimativo

4s

$0.41

5s

$0.51

6s

$0.61

8s

$0.81

10s

$1.01

Aggiungi i token di input in cima — un breve prompt testuale più una o due immagini di riferimento aggiunge in genere pochi centesimi a $1.50/1M — e una clip di 8 secondi arriva a circa $0.85 in totale. La pagina di Google documenta solo la conversione da token a secondi per 720p; 1080p e 4K non sono elencati separatamente, quindi considerali probabilmente più costosi e ricontrolla la pagina live prima di un'esecuzione in produzione.

Come ottenere davvero l'accesso alle API

Sono confermati ufficiali solo due canali — diffida di qualsiasi guida di terze parti che sostenga un accesso alla rivendita più ampio prima che i canali ufficiali di Google siano completamente aperti:

  1. Google AI Studio — ottieni una chiave su aistudio.google.com/apikey, esportala come GEMINI_API_KEY, e chiama il modello come gemini-omni-flash-preview tramite la Interactions API (pip install -U google-genai oppure npm install @google/genai). Il percorso più veloce per i test.

  2. Vertex AI — stesso modello sottostante, esposto da un endpoint separato di livello enterprise che richiede inoltre un ID progetto GCP, un'impostazione di regione/località e l'autenticazione basata su IAM invece di una semplice API key. Metti in conto 30-60 minuti di configurazione se non hai mai toccato la fatturazione di Google Cloud prima.

Vale la pena pianificare tenendo presente: AI Studio e Vertex AI sono superfici di prodotto Google separate — documentazione diversa, SDK diversi e autenticazione con API key versus autenticazione GCP IAM rispettivamente. Non sono intercambiabili per progettazione, quindi scegli la piattaforma su cui effettivamente distribuirai prima di iniziare a costruire, invece di prototipare su AI Studio e dare per scontato di poter fare in seguito un semplice copia-incolla su Vertex.

Un'altra cosa utile da sapere prima di iniziare: secondo la guida introduttiva all'API Interactions di Google, la generazione video imposta per default background=True per i task a lunga esecuzione invece di una risposta sincrona, il che significa anche che non è compatibile con OpenAI chat-completions. Un pattern Python minimale — solo a scopo illustrativo; verifica il riferimento attuale dello SDK google-genai per i nomi esatti dei campi prima di distribuirlo:

from google import genai
import time

client = genai.Client()  # legge GEMINI_API_KEY dall'ambiente

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="Un'inquadratura con drone che si allontana da un faro al tramonto",
    background=True,
)

while interaction.status not in ("completed", "failed"):
    time.sleep(3)
    interaction = client.interactions.get(interaction.id)

if interaction.status == "completed":
    with open("output.mp4", "wb") as f:
        f.write(interaction.output_video.read())

Non c’è qui una forma di chat-completions plug-and-play — se il tuo codice di integrazione esistente presume il formato di risposta sincrono di OpenAI, stai riscrivendo la gestione richiesta/risposta, non sostituendo una stringa del modello.

Gemini Omni Flash vs. Modelli video single-shot

Scegli Omni Flash per il ciclo di modifica conversazionale. Per un lavoro diretto di text/image-to-video a risoluzione e durata fisse, un modello single-shot è più semplice ed economico da considerare:

Ideale per

Accesso

Gemini Omni Flash

Editing conversazionale multi-turno, coerenza del personaggio tra le modifiche

Google AI Studio o Vertex AI direttamente

Veo 3.1 / Sora 2 / Seedance 2.0

Text/image-to-video one-shot a una specifica fissa

Direttamente da ciascun fornitore, oppure in bundle su piattaforme relay come AIReiter

Omni Flash non è ancora su AIReiter o piattaforme di relay aggregate simili — per il suo flusso di lavoro multi-turn, andare direttamente alla API di Google rimane l'opzione più semplice.

FAQ

Qual è l'ID del modello Gemini Omni Flash?

gemini-omni-flash-preview. Usa questa stringa esatta quando lo richiami tramite la Interactions API in Google AI Studio o Vertex AI. È ancora un modello in anteprima, quindi l'ID potrebbe cambiare al momento della disponibilità generale.

Quanto costa Gemini Omni Flash per video?

Circa $0.10/sec a 720p, quindi una clip tipica di 4-10 secondi costa $0.50-$1.

Esiste un piano gratuito per Gemini Omni Flash?

No. La pagina dei prezzi di Google indica "Not available" sia per l'input sia per l'output nel tier gratuito — solo tier Standard (a pagamento).

Posso usare lo stesso codice su AI Studio e Vertex AI?

Non direttamente. Sono superfici di prodotto Google separate con SDK e autenticazione diversi (chiave API vs. GCP IAM), quindi il codice scritto per uno deve essere rielaborato in modo sostanziale per passare all'altro. Scegli il tuo target di distribuzione prima di iniziare a sviluppare.

Gemini Omni Flash funziona con codice di completamento chat in stile OpenAI?

No. La generazione video avviene tramite la creazione asincrona di task e il polling (background=True più interactions.get()), non tramite un formato di risposta sincrono chat-completions.

La coerenza del personaggio in più turni funziona davvero?

Nel nostro test in due round tramite Google Flow, sì per l’aspetto — lo stesso volto, giacca e capelli sono stati mantenuti in modo coerente in un passaggio completo da una scena diurna a una notturna. Ha avuto maggiori difficoltà nel seguire istruzioni di movimento complesse (una richiesta di girarsi e camminare è stata appena percepita) e nel rendere accuratamente il testo sullo sfondo, entrambi aspetti che corrispondono alle limitazioni che Google indica nella scheda del modello.