O preço real da API do Gemini Omni Flash é de cerca de US$ 0,10 por segundo de vídeo em 720p — isso equivale a US$ 17,50 por milhão de tokens de saída, cobrados a 5.792 tokens por segundo, conforme a própria página de preços da API Gemini do Google, verificada em julho de 2026. Não há nível gratuito para este modelo. O ID do modelo — fácil de passar despercebido, já que está escondido na documentação — é gemini-omni-flash-preview, ainda marcado como "preview", então os detalhes de preço e acesso podem mudar antes da disponibilidade geral. Ele é disponibilizado por dois caminhos separados, Google AI Studio e Vertex AI, que não compartilham código. Se você viu uma estimativa de "$0.20–0.60 por segundo" em algum lugar, era um palpite pré-lançamento escrito antes de o Google publicar números reais; agora está desatualizado.
O que o Gemini Omni Flash realmente é
De acordo com o post de lançamento do Google, o Gemini Omni Flash é o primeiro modelo de uma nova família "Omni" — um transformer any-to-any que aceita texto, imagens, áudio e vídeo como entrada e retorna vídeo fundamentado no conhecimento de mundo do Gemini. Ele é gratuito para assinantes do Google AI Plus, Pro e Ultra por meio do app Gemini, do Google Flow e do YouTube Shorts/Create; o acesso à API para desenvolvedores veio no final de junho de 2026, segundo a VentureBeat.
Sua característica mais marcante é a edição conversacional e multi-turno: descreva uma alteração, ele aplica a edição mantendo os personagens e cenas consistentes, e você continua iterando no mesmo thread.
O cartão do modelo da DeepMind lista as proteções de segurança — marca d'água SynthID e credenciais de conteúdo C2PA em todos os clipes, sem sincronização labial de uma foto estática de uma pessoa real com áudio, edição de voz restrita — e três pontos fracos conhecidos: consistência entre edições em várias etapas, cenas com movimento complexo e texto preciso na tela. Testamos os três abaixo.
Testamos o Multi-Turn Editing Nós Mesmos
Nós o executamos no Google Flow com uma sequência de edição em duas rodadas: gerar uma mulher segurando uma placa de papelão escrita à mão e, em seguida, editar esse mesmo clipe para trocá-lo para a noite com uma placa de neon e fazê-la virar-se e caminhar em direção à câmera. Ambos os arquivos de saída vieram em 720p, 24fps, 8 segundos, com áudio estéreo nativo — correspondendo ao que integradores terceirizados relataram, agora confirmado independentemente em nossos próprios arquivos.
O texto na tela no cartaz de papelão — "OPEN TODAY" — foi renderizado perfeitamente, sem distorções, durante todos os 8 segundos. Isso é notável porque a renderização precisa de texto é uma das fraquezas que o próprio cartão do modelo admite.
A afirmação de consistência do personagem se sustenta bem na prática: mesmo rosto, mesma jaqueta puffer vermelha, mesmo suéter branco, mesmo cabelo, mantidos de forma limpa em uma configuração de iluminação completamente diferente, com uma nova placa de néon adicionada à cena. Duas coisas, porém, não saíram como instruído:
A sinalização de fundo da loja quebrou a renderização de texto — a placa "COFFEE" na janela voltou sendo lida como "COFFFEE" (letra extra), embora a placa de papelão em primeiro plano na primeira rodada estivesse impecável. A precisão do texto parece depender muito de quão proeminente e central o texto é no enquadramento, e não apenas de o modelo conseguir renderizar texto de forma alguma.
O movimento solicitado de "virar e andar em direção à câmera" mal aconteceu. Assista ao clipe acima — o que obtivemos, em vez disso, foi uma sutil mudança na distância da câmera com o sujeito permanecendo majoritariamente parado, e não a clara virada e caminhada pedidas no prompt. Isso está alinhado com a limitação de "cenas de movimento complexo" que o Google divulga no model card; movimentos corporais em várias etapas ainda não seguem a instrução com a mesma confiabilidade que uma mudança estática para estática de iluminação ou de cena.
Mais uma coisa que vale incluir no orçamento: uma única edição digitada incorretamente consumiu uma das nossas gerações disponíveis no Flow, o que é suficiente para acabar com uma sessão de testes mais rápido do que o esperado. O Google não divulga uma cota exata de gerações por plano para o Omni Flash, então, se você estiver testando a sério, espere gastar mais tentativas do que planeja e não assuma que poderá tentar novamente um prompt malfeito de graça.
Preços do Gemini Omni Flash, detalhados
Aqui está a tabela de preços, conforme a página de preços da API Gemini do Google — sem plano gratuito, apenas tarifa Standard:
Preço | |
|---|---|
Entrada (texto / imagem / vídeo / áudio) | $1.50 por 1M tokens |
Saída — texto | $9.00 por 1M tokens |
Saída — vídeo | $17.50 por 1M tokens |
O vídeo não é cobrado diretamente por segundo — ele é cobrado por tokens de saída, e o Google especifica a conversão: 5.792 tokens por segundo de vídeo em 720p. Faça as contas ($17.50 ÷ 1,000,000 × 5,792) e você chega a cerca de $0.101 por segundo, o que a documentação do Google arredonda para "aproximadamente $0.10 por segundo."
O que isso significa para um clipe real, em 720p:
Duração do clipe | Custo aprox. |
|---|---|
4s | $0.41 |
5s | $0.51 |
6s | $0.61 |
8s | $0.81 |
10s | $1.01 |
Adicione tokens de entrada por cima — um prompt de texto curto mais uma ou duas imagens de referência normalmente adiciona alguns centavos a US$1,50/1M — e um clipe de 8 segundos chega perto de US$0,85 no total. A página do Google documenta apenas a conversão de tokens para segundos em 720p; 1080p e 4K não aparecem listados separadamente, então considere esses como provavelmente mais caros e verifique novamente a página ao vivo antes de uma execução em produção.
Como realmente obter acesso à API
Apenas dois canais estão de fato confirmados como oficiais — desconfie de qualquer guia de terceiros que afirme um acesso mais amplo para revenda antes que os próprios canais do Google estejam totalmente abertos:
Google AI Studio — obtenha uma chave em
aistudio.google.com/apikey, exporte-a comoGEMINI_API_KEYe chame o modelo comogemini-omni-flash-previewpor meio da Interactions API (pip install -U google-genaiounpm install @google/genai). Caminho mais rápido para testes.Vertex AI — o mesmo modelo subjacente, acessado por um endpoint empresarial separado que também exige um ID de projeto do GCP, uma configuração de região/localidade e autenticação baseada em IAM em vez de uma simples chave de API. Reserve 30-60 minutos para a configuração se você nunca mexeu com cobrança do Google Cloud antes.
Vale a pena planejar com antecedência: AI Studio e Vertex AI são superfícies de produto separadas do Google — documentação diferente, SDKs diferentes e autenticação por chave de API versus autenticação do GCP IAM, respectivamente. Eles não são intercambiáveis por design, então escolha a plataforma na qual você realmente fará o deploy antes de começar a construir, em vez de prototipar no AI Studio e assumir que depois será só copiar e colar para o Vertex.
Mais uma coisa que vale saber antes de começar: de acordo com o guia de introdução da API de Interações do Google, a geração de vídeo usa por padrão background=True para tarefas de longa duração, em vez de uma resposta síncrona, o que também significa que ela não é compatível com OpenAI chat-completions. Um padrão mínimo em Python — ilustrativo; consulte a referência atual do SDK google-genai para os nomes exatos dos campos antes de colocá-lo em produção:
from google import genai
import time
client = genai.Client() # lê GEMINI_API_KEY do ambiente
interaction = client.interactions.create(
model="gemini-omni-flash-preview",
input="A drone shot pulling back from a lighthouse at sunset",
background=True,
)
while interaction.status not in ("completed", "failed"):
time.sleep(3)
interaction = client.interactions.get(interaction.id)
if interaction.status == "completed":
with open("output.mp4", "wb") as f:
f.write(interaction.output_video.read())
Não há um formato de chat-completions pronto para uso aqui — se o seu código de integração existente assume o formato de resposta síncrono da OpenAI, você estará reescrevendo o tratamento de requisição/resposta, não apenas trocando uma string de modelo.
Gemini Omni Flash vs. Modelos de Vídeo Single-Shot
Escolha o Omni Flash para o loop de edição conversacional. Para um trabalho direto de texto/imagem para vídeo com resolução e duração fixas, um modelo de disparo único é mais simples e mais barato de entender:
Melhor para | Acesso | |
|---|---|---|
Gemini Omni Flash | Edição conversacional em várias rodadas, consistência de personagem entre edições | Google AI Studio ou Vertex AI diretamente |
Texto/imagem para vídeo em uma única tentativa com uma especificação fixa | Diretamente de cada fornecedor, ou incluído em plataformas de relay como AIReiter |
Omni Flash ainda não está no AIReiter nem em plataformas de relay agrupadas semelhantes — para seu fluxo de trabalho de múltiplas etapas, ir diretamente para a própria API do Google continua sendo a opção mais simples.
FAQ
Qual é o ID do modelo Gemini Omni Flash?
gemini-omni-flash-preview. Use esta string exata ao chamá-lo por meio da Interactions API no Google AI Studio ou Vertex AI. Ainda é um modelo de prévia, então o ID pode mudar na disponibilidade geral.
Quanto custa o Gemini Omni Flash por vídeo?
Em torno de US$ 0,10/s em 720p, então um clipe típico de 4 a 10 segundos custa entre US$ 0,50 e US$ 1.
Existe um plano gratuito para o Gemini Omni Flash?
Não. A página de preços do Google lista "Não disponível" tanto para entrada quanto para saída no nível gratuito — apenas no nível Standard (pago).
Posso usar o mesmo código no AI Studio e no Vertex AI?
Não diretamente. Eles são superfícies de produto separadas do Google, com SDKs e autenticação diferentes (API key vs. GCP IAM), então o código escrito para um precisa de uma reformulação real para migrar para o outro. Escolha seu destino de implantação antes de começar a construir.
O Gemini Omni Flash funciona com código de completions de chat no estilo OpenAI?
Não. A geração de vídeo é executada por meio da criação e do polling de tarefas assíncronas (background=True mais interactions.get()), não por um formato de resposta de chat completions síncrono.
A consistência de personagem em múltiplas interações realmente funciona?
No nosso próprio teste em duas rodadas pelo Google Flow, sim para a aparência — o mesmo rosto, jaqueta e cabelo foram mantidos de forma consistente em uma mudança completa de cena do dia para a noite. Ele teve mais dificuldade em seguir instruções complexas de movimento (uma virada e caminhada solicitadas mal foram percebidas) e em renderizar texto de fundo com precisão, ambos os pontos correspondendo às limitações que o Google divulga no model card.