AIREITER

Руководство по ценам и доступу к API Gemini Omni Flash

Последнее обновление: 2026-07-01 07:26:31

Реальная цена API Gemini Omni Flash составляет около $0.10 за секунду видео 720p — это $17.50 за миллион выходных токенов, тарифицируемых по 5,792 токена в секунду, согласно странице цен Google для Gemini API, проверено в июле 2026 года. Для этой модели нет бесплатного тарифа. Идентификатор модели — его легко пропустить, поскольку он спрятан в документации — это gemini-omni-flash-preview; он по-прежнему помечен как "preview", поэтому цены и условия доступа могут измениться до общего выпуска. Она поставляется через два отдельных канала, Google AI Studio и Vertex AI, которые не используют общий код. Если вы где-то видели оценку "$0.20–0.60 per second", это была предварительная догадка, написанная до того, как Google опубликовал реальные цифры; сейчас она устарела.

Что на самом деле представляет собой Gemini Omni Flash

Согласно посту Google о запуске, Gemini Omni Flash — первая модель в новой семействе «Omni» — any-to-any transformer, принимающий на вход текст, изображения, аудио и видео и возвращающий видео, основанное на мировых знаниях Gemini. Она бесплатна для подписчиков Google AI Plus, Pro и Ultra через приложения Gemini, Google Flow и YouTube Shorts/Create; доступ к developer API появился в конце июня 2026 года, по данным VentureBeat.

Его выдающаяся особенность — разговорное многошаговое редактирование: опишите изменение, оно применит правку, сохраняя согласованность персонажей и сцен, и вы продолжите итерации в той же ветке.

Карточка модели DeepMind перечисляет меры безопасности — водяные знаки SynthID и учетные данные контента C2PA в каждом клипе, отсутствие синхронизации губ у статичного фото реального человека под аудио, ограниченное редактирование голоса — а также три известных слабых места: согласованность при многошаговых правках, сцены со сложным движением и точный текст на экране. Мы протестировали все три ниже.

Мы сами протестировали многоэтапное редактирование

Мы прогнали его через Google Flow с двухраундовой последовательностью редактирования: сгенерировали женщину, держащую картонную табличку с надписью от руки, затем отредактировали тот же клип, чтобы перевести его в ночное время с неоновой вывеской и заставить её повернуться и пойти к камере. Оба выходных файла были 720p, 24fps, 8 секунд, с нативным стереозвуком — что соответствует тому, о чём сообщали сторонние интеграторы, и теперь независимо подтверждено на наших собственных файлах.

Текст на экране на картонной табличке — "OPEN TODAY" — был отрисован безупречно, без искажений, в течение полных 8 секунд. Это примечательно, потому что точная отрисовка текста — одна из слабых сторон, в которых сама карточка модели признаёт наличие проблем.

Утверждение о согласованности персонажа на практике хорошо подтверждается: то же лицо, та же красная пуховая куртка, тот же белый свитер, те же волосы — всё аккуратно перенесено в совершенно иное освещение, при этом в сцену добавлена новая неоновая вывеска. Однако две вещи пошли не так, как было указано:

  • Фоновая вывеска сломала рендеринг текста — вывеска «COFFEE» в окне вернулась как «COFFFEE» (лишняя буква), хотя картонная вывеска на переднем плане в первом раунде была безупречной. Похоже, точность текста сильно зависит от того, насколько он заметен и насколько он расположен по центру кадра, а не только от того, умеет ли модель вообще отображать текст.

  • Запрошенное движение «повернись и иди к камере» почти не произошло. Посмотрите клип выше — вместо этого мы получили едва заметный сдвиг дистанции до камеры, при котором объект в основном оставался на месте, а не явный поворот и шаги, о которых говорилось в промпте. Это соответствует ограничению «сцены со сложным движением», которое Google раскрывает в model card; многошаговое движение тела пока не следует инструкции так же надежно, как статичное изменение освещения или сцены.

Еще один момент, который стоит заложить в бюджет: одно неправильно введенное изменение израсходовало одну из доступных нам генераций в Flow, чего достаточно, чтобы тестовая сессия закончилась быстрее, чем ожидалось. Google не публикует точную квоту генераций для Omni Flash по каждому тарифу, так что если вы тестируете всерьез, ожидайте, что вам придется потратить больше попыток, чем вы планировали, и не рассчитывайте, что сможете бесплатно повторить неудачный промпт.

Цены Gemini Omni Flash, подробно разобранные

Вот тарифная сетка, согласно странице цен Gemini API от Google — бесплатного тарифа нет, только стандартный тариф:

Цена

Ввод (текст / изображение / видео / аудио)

$1.50 за 1 млн токенов

Вывод — текст

$9.00 за 1 млн токенов

Вывод — видео

$17.50 за 1 млн токенов

Видео тарифицируется не напрямую по секундам — оно тарифицируется по выходным токенам, и Google указывает коэффициент пересчёта: 5 792 токена за секунду видео 720p. Посчитайте ($17.50 ÷ 1,000,000 × 5,792), и получится примерно $0.101 за секунду, что в документации Google округляется до «approximately $0.10 per second».

Что это значит для реального клипа в 720p:

Длина клипа

Примерная стоимость

4s

$0.41

5s

$0.51

6s

$0.61

8s

$0.81

10s

$1.01

Добавьте входные токены сверху — короткий текстовый запрос плюс одно или два референсных изображения обычно добавляют несколько центов при $1.50/1M — и 8-секундный клип в итоге обходится примерно в $0.85. На странице Google документировано преобразование токенов в секунды только для 720p; для 1080p и 4K они отдельно не указаны, поэтому закладывайте их как, вероятно, более дорогие и перед запуском в продакшене перепроверьте актуальную страницу.

Как на самом деле получить доступ к API

Фактически подтверждены только два канала как официальные — относитесь скептически к любому стороннему руководству, утверждающему о более широком доступе к перепродаже, прежде чем собственные каналы Google будут полностью открыты:

  1. Google AI Studio — получите ключ на aistudio.google.com/apikey, экспортируйте его как GEMINI_API_KEY и вызывайте модель как gemini-omni-flash-preview через Interactions API (pip install -U google-genai или npm install @google/genai). Самый быстрый путь для тестирования.

  2. Vertex AI — та же базовая модель, но через отдельную enterprise-grade конечную точку, для которой дополнительно требуется ID проекта GCP, настройка региона/локации и аутентификация на основе IAM вместо обычного API-ключа. Заложите 30-60 минут на настройку, если вы раньше не работали с биллингом Google Cloud.

Стоит учитывать при планировании: AI Studio и Vertex AI — это отдельные продуктовые поверхности Google — разные документы, разные SDK и, соответственно, аутентификация через API-ключ против аутентификации через GCP IAM. По замыслу они не взаимозаменяемы, поэтому выберите ту платформу, на которой вы действительно будете развёртывать решение, ещё до начала разработки, а не создавайте прототип в AI Studio, предполагая, что позже его можно будет просто перенести в Vertex.

Еще одна вещь, которую стоит знать перед началом: согласно руководству Google по началу работы с Interactions API, для генерации видео по умолчанию используется background=True для длительных задач вместо синхронного ответа, что также означает, что он не совместим с OpenAI chat-completions. Минимальный шаблон на Python — в качестве примера; перед использованием проверьте актуальную справку по SDK google-genai на предмет точных имен полей:

from google import genai
import time

client = genai.Client()  # считывает GEMINI_API_KEY из env

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="A drone shot pulling back from a lighthouse at sunset",
    background=True,
)

while interaction.status not in ("completed", "failed"):
    time.sleep(3)
    interaction = client.interactions.get(interaction.id)

if interaction.status == "completed":
    with open("output.mp4", "wb") as f:
        f.write(interaction.output_video.read())

Здесь нет готовой формы chat-completions для простой подстановки — если ваш существующий код интеграции предполагает синхронный формат ответа OpenAI, вам придется переписывать обработку запросов/ответов, а не просто менять строку модели.

Gemini Omni Flash против одноразовых видеомоделей

Выберите Omni Flash для диалогового цикла редактирования. Для прямой задачи text/image-to-video с фиксированным разрешением и длительностью одноразовая модель проще и дешевле для понимания:

Лучше всего для

Доступ

Gemini Omni Flash

Многоходовое разговорное редактирование, согласованность персонажей между правками

Google AI Studio или Vertex AI напрямую

Veo 3.1 / Sora 2 / Seedance 2.0

Одноразовое text/image-to-video по фиксированной спецификации

Напрямую от каждого поставщика или в комплекте на relay-платформах, таких как AIReiter

Omni Flash пока нет в AIReiter или подобных платформенных ретрансляторах с пакетной поставкой — для его многошагового рабочего процесса самым простым вариантом по-прежнему остаётся прямое обращение к API Google.

FAQ

Что такое ID модели Gemini Omni Flash?

gemini-omni-flash-preview. Используйте эту точную строку при вызове через Interactions API в Google AI Studio или Vertex AI. Это всё ещё предварительная модель, поэтому ID может измениться к моменту общей доступности.

Сколько стоит Gemini Omni Flash за видео?

Около $0.10/сек при 720p, так что типичный клип длительностью 4–10 секунд стоит $0.50–$1.

Есть ли бесплатный тариф для Gemini Omni Flash?

Нет. На странице цен Google для бесплатного тарифа указано "Not available" как для входных, так и для выходных данных — только тариф Standard (paid).

Могу ли я использовать один и тот же код в AI Studio и Vertex AI?

Не напрямую. Это отдельные продуктовые поверхности Google с разными SDK и аутентификацией (API key vs. GCP IAM), поэтому код, написанный для одной, нужно существенно переработать, чтобы перенести на другую. Выберите целевую платформу развертывания до начала разработки.

Работает ли Gemini Omni Flash с кодом chat completions в стиле OpenAI?

Нет. Генерация видео выполняется через создание асинхронной задачи и опрос (background=True плюс interactions.get()), а не через формат синхронного ответа chat-completions.

Действительно ли работает согласованность персонажа в многоходовом диалоге?

В нашем собственном двухраундовом тесте через Google Flow — да, по внешнему виду: то же лицо, куртка и волосы были чисто сохранены при полном переходе сцены из дня в ночь. Ему было сложнее с выполнением сложных инструкций по движению (запрошенный поворот и ходьба почти не были заметны) и с точным отображением фонового текста — и то и другое соответствует ограничениям, которые Google указывает в карточке модели.