AIREITER

Guia de Preços e Acesso à API do Gemini Omni Flash

Última Atualização: 2026-07-01 07:26:59

O preço real da API do Gemini Omni Flash é de cerca de US$ 0,10 por segundo de vídeo em 720p — isso equivale a US$ 17,50 por milhão de tokens de saída, cobrados a 5.792 tokens por segundo, conforme a própria página de preços da API Gemini do Google, verificada em julho de 2026. Não há nível gratuito para este modelo. O ID do modelo — fácil de passar despercebido, já que está escondido na documentação — é gemini-omni-flash-preview, ainda marcado como "preview", então os detalhes de preço e acesso podem mudar antes da disponibilidade geral. Ele é disponibilizado por dois caminhos separados, Google AI Studio e Vertex AI, que não compartilham código. Se você viu uma estimativa de "$0.20–0.60 por segundo" em algum lugar, era um palpite pré-lançamento escrito antes de o Google publicar números reais; agora está desatualizado.

O que o Gemini Omni Flash realmente é

De acordo com o post de lançamento do Google, o Gemini Omni Flash é o primeiro modelo de uma nova família "Omni" — um transformer any-to-any que aceita texto, imagens, áudio e vídeo como entrada e retorna vídeo fundamentado no conhecimento de mundo do Gemini. Ele é gratuito para assinantes do Google AI Plus, Pro e Ultra por meio do app Gemini, do Google Flow e do YouTube Shorts/Create; o acesso à API para desenvolvedores veio no final de junho de 2026, segundo a VentureBeat.

Sua característica mais marcante é a edição conversacional e multi-turno: descreva uma alteração, ele aplica a edição mantendo os personagens e cenas consistentes, e você continua iterando no mesmo thread.

O cartão do modelo da DeepMind lista as proteções de segurança — marca d'água SynthID e credenciais de conteúdo C2PA em todos os clipes, sem sincronização labial de uma foto estática de uma pessoa real com áudio, edição de voz restrita — e três pontos fracos conhecidos: consistência entre edições em várias etapas, cenas com movimento complexo e texto preciso na tela. Testamos os três abaixo.

Testamos o Multi-Turn Editing Nós Mesmos

Nós o executamos no Google Flow com uma sequência de edição em duas rodadas: gerar uma mulher segurando uma placa de papelão escrita à mão e, em seguida, editar esse mesmo clipe para trocá-lo para a noite com uma placa de neon e fazê-la virar-se e caminhar em direção à câmera. Ambos os arquivos de saída vieram em 720p, 24fps, 8 segundos, com áudio estéreo nativo — correspondendo ao que integradores terceirizados relataram, agora confirmado independentemente em nossos próprios arquivos.

O texto na tela no cartaz de papelão — "OPEN TODAY" — foi renderizado perfeitamente, sem distorções, durante todos os 8 segundos. Isso é notável porque a renderização precisa de texto é uma das fraquezas que o próprio cartão do modelo admite.

A afirmação de consistência do personagem se sustenta bem na prática: mesmo rosto, mesma jaqueta puffer vermelha, mesmo suéter branco, mesmo cabelo, mantidos de forma limpa em uma configuração de iluminação completamente diferente, com uma nova placa de néon adicionada à cena. Duas coisas, porém, não saíram como instruído:

  • A sinalização de fundo da loja quebrou a renderização de texto — a placa "COFFEE" na janela voltou sendo lida como "COFFFEE" (letra extra), embora a placa de papelão em primeiro plano na primeira rodada estivesse impecável. A precisão do texto parece depender muito de quão proeminente e central o texto é no enquadramento, e não apenas de o modelo conseguir renderizar texto de forma alguma.

  • O movimento solicitado de "virar e andar em direção à câmera" mal aconteceu. Assista ao clipe acima — o que obtivemos, em vez disso, foi uma sutil mudança na distância da câmera com o sujeito permanecendo majoritariamente parado, e não a clara virada e caminhada pedidas no prompt. Isso está alinhado com a limitação de "cenas de movimento complexo" que o Google divulga no model card; movimentos corporais em várias etapas ainda não seguem a instrução com a mesma confiabilidade que uma mudança estática para estática de iluminação ou de cena.

Mais uma coisa que vale incluir no orçamento: uma única edição digitada incorretamente consumiu uma das nossas gerações disponíveis no Flow, o que é suficiente para acabar com uma sessão de testes mais rápido do que o esperado. O Google não divulga uma cota exata de gerações por plano para o Omni Flash, então, se você estiver testando a sério, espere gastar mais tentativas do que planeja e não assuma que poderá tentar novamente um prompt malfeito de graça.

Preços do Gemini Omni Flash, detalhados

Aqui está a tabela de preços, conforme a página de preços da API Gemini do Google — sem plano gratuito, apenas tarifa Standard:

Preço

Entrada (texto / imagem / vídeo / áudio)

$1.50 por 1M tokens

Saída — texto

$9.00 por 1M tokens

Saída — vídeo

$17.50 por 1M tokens

O vídeo não é cobrado diretamente por segundo — ele é cobrado por tokens de saída, e o Google especifica a conversão: 5.792 tokens por segundo de vídeo em 720p. Faça as contas ($17.50 ÷ 1,000,000 × 5,792) e você chega a cerca de $0.101 por segundo, o que a documentação do Google arredonda para "aproximadamente $0.10 por segundo."

O que isso significa para um clipe real, em 720p:

Duração do clipe

Custo aprox.

4s

$0.41

5s

$0.51

6s

$0.61

8s

$0.81

10s

$1.01

Adicione tokens de entrada por cima — um prompt de texto curto mais uma ou duas imagens de referência normalmente adiciona alguns centavos a US$1,50/1M — e um clipe de 8 segundos chega perto de US$0,85 no total. A página do Google documenta apenas a conversão de tokens para segundos em 720p; 1080p e 4K não aparecem listados separadamente, então considere esses como provavelmente mais caros e verifique novamente a página ao vivo antes de uma execução em produção.

Como realmente obter acesso à API

Apenas dois canais estão de fato confirmados como oficiais — desconfie de qualquer guia de terceiros que afirme um acesso mais amplo para revenda antes que os próprios canais do Google estejam totalmente abertos:

  1. Google AI Studio — obtenha uma chave em aistudio.google.com/apikey, exporte-a como GEMINI_API_KEY e chame o modelo como gemini-omni-flash-preview por meio da Interactions API (pip install -U google-genai ou npm install @google/genai). Caminho mais rápido para testes.

  2. Vertex AI — o mesmo modelo subjacente, acessado por um endpoint empresarial separado que também exige um ID de projeto do GCP, uma configuração de região/localidade e autenticação baseada em IAM em vez de uma simples chave de API. Reserve 30-60 minutos para a configuração se você nunca mexeu com cobrança do Google Cloud antes.

Vale a pena planejar com antecedência: AI Studio e Vertex AI são superfícies de produto separadas do Google — documentação diferente, SDKs diferentes e autenticação por chave de API versus autenticação do GCP IAM, respectivamente. Eles não são intercambiáveis por design, então escolha a plataforma na qual você realmente fará o deploy antes de começar a construir, em vez de prototipar no AI Studio e assumir que depois será só copiar e colar para o Vertex.

Mais uma coisa que vale saber antes de começar: de acordo com o guia de introdução da API de Interações do Google, a geração de vídeo usa por padrão background=True para tarefas de longa duração, em vez de uma resposta síncrona, o que também significa que ela não é compatível com OpenAI chat-completions. Um padrão mínimo em Python — ilustrativo; consulte a referência atual do SDK google-genai para os nomes exatos dos campos antes de colocá-lo em produção:

from google import genai
import time

client = genai.Client()  # lê GEMINI_API_KEY do ambiente

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="A drone shot pulling back from a lighthouse at sunset",
    background=True,
)

while interaction.status not in ("completed", "failed"):
    time.sleep(3)
    interaction = client.interactions.get(interaction.id)

if interaction.status == "completed":
    with open("output.mp4", "wb") as f:
        f.write(interaction.output_video.read())

Não há um formato de chat-completions pronto para uso aqui — se o seu código de integração existente assume o formato de resposta síncrono da OpenAI, você estará reescrevendo o tratamento de requisição/resposta, não apenas trocando uma string de modelo.

Gemini Omni Flash vs. Modelos de Vídeo Single-Shot

Escolha o Omni Flash para o loop de edição conversacional. Para um trabalho direto de texto/imagem para vídeo com resolução e duração fixas, um modelo de disparo único é mais simples e mais barato de entender:

Melhor para

Acesso

Gemini Omni Flash

Edição conversacional em várias rodadas, consistência de personagem entre edições

Google AI Studio ou Vertex AI diretamente

Veo 3.1 / Sora 2 / Seedance 2.0

Texto/imagem para vídeo em uma única tentativa com uma especificação fixa

Diretamente de cada fornecedor, ou incluído em plataformas de relay como AIReiter

Omni Flash ainda não está no AIReiter nem em plataformas de relay agrupadas semelhantes — para seu fluxo de trabalho de múltiplas etapas, ir diretamente para a própria API do Google continua sendo a opção mais simples.

FAQ

Qual é o ID do modelo Gemini Omni Flash?

gemini-omni-flash-preview. Use esta string exata ao chamá-lo por meio da Interactions API no Google AI Studio ou Vertex AI. Ainda é um modelo de prévia, então o ID pode mudar na disponibilidade geral.

Quanto custa o Gemini Omni Flash por vídeo?

Em torno de US$ 0,10/s em 720p, então um clipe típico de 4 a 10 segundos custa entre US$ 0,50 e US$ 1.

Existe um plano gratuito para o Gemini Omni Flash?

Não. A página de preços do Google lista "Não disponível" tanto para entrada quanto para saída no nível gratuito — apenas no nível Standard (pago).

Posso usar o mesmo código no AI Studio e no Vertex AI?

Não diretamente. Eles são superfícies de produto separadas do Google, com SDKs e autenticação diferentes (API key vs. GCP IAM), então o código escrito para um precisa de uma reformulação real para migrar para o outro. Escolha seu destino de implantação antes de começar a construir.

O Gemini Omni Flash funciona com código de completions de chat no estilo OpenAI?

Não. A geração de vídeo é executada por meio da criação e do polling de tarefas assíncronas (background=True mais interactions.get()), não por um formato de resposta de chat completions síncrono.

A consistência de personagem em múltiplas interações realmente funciona?

No nosso próprio teste em duas rodadas pelo Google Flow, sim para a aparência — o mesmo rosto, jaqueta e cabelo foram mantidos de forma consistente em uma mudança completa de cena do dia para a noite. Ele teve mais dificuldade em seguir instruções complexas de movimento (uma virada e caminhada solicitadas mal foram percebidas) e em renderizar texto de fundo com precisão, ambos os pontos correspondendo às limitações que o Google divulga no model card.