El precio real de la API de Gemini Omni Flash es de aproximadamente $0.10 por segundo de video 720p — eso equivale a $17.50 por millón de tokens de salida, facturado a 5,792 tokens por segundo, según la propia página de precios de la API de Gemini de Google, consultada en julio de 2026. No hay nivel gratuito para este modelo. El ID del modelo — fácil de pasar por alto porque está oculto en la documentación — es gemini-omni-flash-preview, y aún está etiquetado como "preview", por lo que los detalles de precios y acceso pueden cambiar antes de la disponibilidad general. Se ofrece a través de dos vías distintas, Google AI Studio y Vertex AI, que no comparten código. Si has visto alguna estimación de "$0.20–0.60 per second" en algún lugar, era una suposición previa al lanzamiento escrita antes de que Google publicara cifras reales; ahora está desactualizada.
Qué es realmente Gemini Omni Flash
Según la publicación de lanzamiento de Google, Gemini Omni Flash es el primer modelo de una nueva familia "Omni" — un transformer any-to-any que toma texto, imágenes, audio y video como entrada y devuelve video fundamentado en el conocimiento del mundo de Gemini. Es gratuito para suscriptores de Google AI Plus, Pro y Ultra a través de la app Gemini, Google Flow y YouTube Shorts/Create; el acceso a la API para desarrolladores llegó a finales de junio de 2026, según VentureBeat.
Su característica destacada es la edición conversacional de múltiples turnos: describe un cambio, aplica la edición mientras mantiene la coherencia de los personajes y las escenas, y sigues iterando en el mismo hilo.
La tarjeta de modelo de DeepMind enumera las barreras de seguridad — marca de agua SynthID y credenciales de contenido C2PA en cada clip, sin sincronización labial de una foto fija de una persona real con audio, edición de voz restringida — y tres puntos débiles conocidos: coherencia en ediciones de varios pasos, escenas con movimiento complejo y texto preciso en pantalla. Probamos los tres a continuación.
Probamos nosotros mismos la edición de múltiples turnos
Lo ejecutamos a través de Google Flow con una secuencia de edición de dos rondas: generar a una mujer sosteniendo un cartel de cartón manuscrito, luego editar ese mismo clip para cambiarlo a la noche con un letrero de neón y hacer que ella se dé la vuelta y camine hacia la cámara. Ambos archivos de salida volvieron a 720p, 24 fps, 8 segundos, con audio estéreo nativo, coincidiendo con lo que han reportado integradores de terceros, ahora confirmado de forma independiente en nuestros propios archivos.
El texto en pantalla en el cartel de cartón — "OPEN TODAY" — se mostró perfectamente, sin distorsiones, durante los 8 segundos completos. Eso es notable porque el renderizado preciso de texto es una de las debilidades que la propia tarjeta del modelo reconoce.
La afirmación de consistencia del personaje se mantiene bastante bien en la práctica: mismo rostro, misma chaqueta acolchada roja, mismo suéter blanco, mismo cabello, trasladados limpiamente a una configuración de iluminación completamente diferente con un nuevo letrero de neón añadido a la escena. Sin embargo, dos cosas no salieron como se indicó:
La señalización del fondo rompió el renderizado del texto — el letrero de "COFFEE" en la ventana volvió apareciendo como "COFFFEE" (letra extra), aunque el letrero de cartón en primer plano de la primera ronda fue impecable. La precisión del texto parece depender mucho de cuán prominente y cuán central es el texto en el encuadre, no solo de si el modelo puede renderizar texto en absoluto.
El movimiento solicitado de "girar y caminar hacia la cámara" apenas ocurrió. Mira el clip de arriba — lo que obtuvimos en cambio fue un sutil cambio en la distancia de la cámara con el sujeto permaneciendo mayormente estático, no el claro giro y caminata que pedía el prompt. Esto coincide con la limitación de "escenas de movimiento complejo" que Google divulga en la tarjeta del modelo; el movimiento corporal de varios pasos aún no sigue la instrucción con tanta fiabilidad como lo hace un cambio estático a estático de iluminación o de escena.
Una cosa más que vale la pena presupuestar: una sola edición mal escrita consumió una de nuestras generaciones disponibles en Flow, lo suficiente como para agotar una sesión de pruebas más rápido de lo esperado. Google no publica una cuota exacta de generaciones por plan para Omni Flash, así que, si estás haciendo pruebas en serio, espera gastar más intentos de los que planificas y no asumas que puedes volver a intentar gratis un prompt mal ejecutado.
Precio de Gemini Omni Flash, desglosado
Aquí está la tarjeta de tarifas, según la página de precios de la API de Gemini de Google — sin nivel gratuito, solo tarifa estándar:
Precio | |
|---|---|
Entrada (texto / imagen / video / audio) | $1.50 por 1M tokens |
Salida — texto | $9.00 por 1M tokens |
Salida — video | $17.50 por 1M tokens |
El video no se factura directamente por segundo — se factura por tokens de salida, y Google especifica la conversión: 5.792 tokens por segundo de video 720p. Haz la cuenta ($17.50 ÷ 1,000,000 × 5,792) y obtendrás aproximadamente $0.101 por segundo, que la documentación de Google redondea a "aproximadamente $0.10 por segundo."
Lo que eso significa para un clip real, a 720p:
Duración del clip | Costo aprox. |
|---|---|
4s | $0.41 |
5s | $0.51 |
6s | $0.61 |
8s | $0.81 |
10s | $1.01 |
Añade tokens de entrada por encima — un breve prompt de texto más una o dos imágenes de referencia suele añadir unos pocos centavos a $1.50/1M — y un clip de 8 segundos se sitúa cerca de $0.85 en total. La página de Google solo documenta la conversión de tokens a segundos para 720p; 1080p y 4K no aparecen desglosados por separado, así que presupón que probablemente sean más caros y vuelve a comprobar la página en vivo antes de una ejecución en producción.
Cómo obtener realmente acceso a la API
Solo dos canales están realmente confirmados como oficiales — desconfíe de cualquier guía de terceros que afirme tener acceso de reventa más amplio antes de que los canales propios de Google estén completamente abiertos:
Google AI Studio — obtén una clave en
aistudio.google.com/apikey, expórtala comoGEMINI_API_KEYy llama al modelo comogemini-omni-flash-previewa través de la Interactions API (pip install -U google-genaionpm install @google/genai). La ruta más rápida para pruebas.Vertex AI — el mismo modelo subyacente, expuesto mediante un endpoint empresarial independiente que además requiere un ID de proyecto de GCP, una configuración de región/ubicación y autenticación basada en IAM en lugar de una simple clave API. Calcula entre 30 y 60 minutos de configuración si no has tocado antes la facturación de Google Cloud.
Vale la pena planificar en torno a esto: AI Studio y Vertex AI son superficies de producto de Google separadas — documentación diferente, SDKs diferentes y autenticación mediante API key frente a autenticación GCP IAM, respectivamente. No son intercambiables por diseño, así que elige la plataforma en la que realmente vas a desplegar antes de construir, en lugar de hacer prototipos contra AI Studio y asumir luego que podrás pasar a Vertex con un simple copiar y pegar.
Una cosa más que vale la pena saber antes de empezar: según la guía de inicio de la API de Interactions de Google, la generación de video usa de forma predeterminada background=True para tareas de larga duración en lugar de una respuesta síncrona, lo que también significa que no es compatible con OpenAI chat-completions. Un patrón mínimo en Python — ilustrativo; consulte la referencia actual del SDK google-genai para los nombres exactos de los campos antes de implementarlo:
from google import genai
import time
client = genai.Client() # lee GEMINI_API_KEY desde env
interaction = client.interactions.create(
model="gemini-omni-flash-preview",
input="Una toma aérea de un dron alejándose de un faro al atardecer",
background=True,
)
while interaction.status not in ("completed", "failed"):
time.sleep(3)
interaction = client.interactions.get(interaction.id)
if interaction.status == "completed":
with open("output.mp4", "wb") as f:
f.write(interaction.output_video.read())
No hay una forma de chat-completions lista para usar aquí — si tu código de integración existente asume el formato de respuesta síncrona de OpenAI, estás reescribiendo el manejo de solicitud/respuesta, no intercambiando una cadena de modelo.
Gemini Omni Flash vs. Modelos de video de una sola toma
Elige Omni Flash para el bucle de edición conversacional. Para un trabajo directo de texto/imagen a video con una resolución y duración fijas, un modelo de una sola toma es más sencillo y económico de evaluar:
Mejor para | Acceso | |
|---|---|---|
Gemini Omni Flash | Edición conversacional de varios turnos, consistencia de personajes entre ediciones | Google AI Studio o Vertex AI directamente |
Texto/imagen a video de un solo intento con una especificación fija | Directamente de cada proveedor, o incluido en plataformas de relay como AIReiter |
Omni Flash aún no está en AIReiter ni en plataformas de relay agrupadas similares — para su flujo de trabajo de varios turnos, ir directamente a la propia API de Google sigue siendo la opción más sencilla.
Preguntas frecuentes
¿Cuál es el ID del modelo Gemini Omni Flash?
gemini-omni-flash-preview. Usa esta cadena exacta cuando lo llames a través de la Interactions API en Google AI Studio o Vertex AI. Sigue siendo un modelo de vista previa, así que el ID podría cambiar cuando esté disponible de forma general.
¿Cuánto cuesta Gemini Omni Flash por video?
Alrededor de $0.10/seg a 720p, así que un clip típico de 4-10 segundos cuesta entre $0.50 y $1.
¿Hay un nivel gratuito para Gemini Omni Flash?
No. La página de precios de Google indica "No disponible" tanto para la entrada como para la salida en el nivel gratuito — solo el nivel Estándar (de pago).
¿Puedo usar el mismo código en AI Studio y Vertex AI?
No directamente. Son superficies de producto de Google separadas con diferentes SDK y autenticación (clave API vs. GCP IAM), por lo que el código escrito para una necesita una reestructuración real para trasladarlo a la otra. Elige tu objetivo de implementación antes de construir.
¿Gemini Omni Flash funciona con código de completions de chat al estilo OpenAI?
No. La generación de video se ejecuta mediante la creación y el sondeo de tareas asíncronas (background=True más interactions.get()), no mediante un formato de respuesta síncrona de chat-completions.
¿Realmente funciona la consistencia del personaje en múltiples turnos?
En nuestra propia prueba de dos rondas a través de Google Flow, sí en cuanto a la apariencia: el mismo rostro, chaqueta y cabello se mantuvieron fielmente a lo largo de un cambio completo de escena de día a noche. Le costó más seguir instrucciones complejas de movimiento (un giro y caminata solicitados apenas se registraron) y renderizar con precisión el texto de fondo, ambos aspectos que coinciden con las limitaciones que Google divulga en la tarjeta del modelo.