Gemini Omni Flash の実際の API 価格は、720p 動画の1 秒あたり約 $0.10です。つまり、1 秒あたり 5,792 トークンで課金される場合、出力トークン 100 万個あたり $17.50 となります。これは、2026 年 7 月に確認したGoogle 自身の Gemini API 料金ページによるものです。このモデルには無料枠はありません。モデル ID は、ドキュメントの奥深くに埋もれていて見落としやすいですが、gemini-omni-flash-preview です。まだ「preview」タグが付いているため、一般提供前に価格やアクセスの詳細が変更される可能性があります。これは Google AI Studio と Vertex AI という、コードを共有しない 2 つの別々の入口を通じて提供されます。どこかで「1 秒あたり $0.20–0.60」という推定値を見たことがあれば、それは Google が実際の数値を公開する前に書かれた発売前の推測であり、現在は古くなっています。
Gemini Omni Flash が実際には何であるか
Googleの発表記事によると、Gemini Omni Flashは新しい「Omni」ファミリーの最初のモデルであり、テキスト、画像、音声、動画を入力として受け取り、Geminiの世界知識に基づいた動画を出力する any-to-any transformer です。Google AI Plus、Pro、Ultraの加入者は、Geminiアプリ、Google Flow、YouTube Shorts/Createを通じて無料で利用できます。developer API access は2026年6月下旬に続きました。VentureBeatによるとです。
その際立った機能は、対話形式のマルチターン編集です。変更を説明すると、登場人物やシーンの一貫性を保ちながらその編集を適用し、同じスレッドで反復し続けられます。
DeepMindのモデルカードには、すべてのクリップに対するSynthIDウォーターマークとC2PAコンテンツクレデンシャル、実在の人物の静止画に音声を合わせてリップシンクすることの禁止、制限付きの音声編集といった安全対策が記載されており、既知の弱点としては、複数ステップの編集全体での一貫性、複雑な動きのあるシーン、そして画面上のテキストを正確に表示することの3点が挙げられています。以下でこの3点すべてをテストしました。
マルチターン編集を私たち自身でテストしました
Google Flowで2回の編集シーケンスを使って試しました。まず、手書きの段ボールの看板を持つ女性を生成し、次にその同じクリップを編集して、ネオンサインのある夜に切り替え、彼女が振り向いてカメラに向かって歩くようにしました。両方の出力ファイルは、720p、24fps、8秒、ネイティブのステレオ音声で返ってきました。これは、サードパーティのインテグレーターが報告してきた内容と一致しており、今回、私たち自身のファイルでも独立して確認されました。
段ボールの看板に表示された画面上のテキスト――「OPEN TODAY」――は、8秒間ずっと、文字化けすることなく完璧に描画されていました。これは注目に値します。というのも、正確なテキスト描画は、このモデルカード自体が認めている弱点の一つだからです。
キャラクターの一貫性に関する主張は、実際にもよく成り立っています。同じ顔、同じ赤いダウンジャケット、同じ白いセーター、同じ髪型が、シーンに新しいネオンサインが追加されたまったく別の照明設定にもきれいに引き継がれています。ただし、指示どおりにいかなかった点が2つありました。
背景の店の看板がテキスト描画を壊していました — 窓の「COFFEE」の看板は「COFFFEE」(余分な文字)と表示されて戻ってきましたが、1回目の前景にあった段ボールの看板は完璧でした。テキストの正確さは、モデルがそもそもテキストを描画できるかどうかだけでなく、そのテキストがフレーム内でどれだけ目立ち、どれだけ中央にあるかに大きく左右されるようです。
要求した「振り向いてカメラに向かって歩く」動きは、ほとんど起きませんでした。 上のクリップを見てください。実際に得られたのは、被写体はほぼ静止したままで、カメラとの距離がわずかに変化しただけで、プロンプトで求められた明確な振り向きと歩行ではありませんでした。これは、Google が model card で開示している「complex-motion scenes」の制限と一致しています。複数段階の身体動作は、静止から静止への照明やシーンの変化ほど、まだ指示に確実には追従しません。
予算に入れておく価値があるもう1つのことがあります。たった1回のタイプミスを含む編集で、Flowで利用可能な生成回数の1つが消費され、テストセッションを予想以上に早く使い切ってしまうのに十分でした。GoogleはOmni Flashのプランごとの正確な生成クォータを公開していないため、真剣にテストするなら、想定しているよりも多くの試行回数を使うことになると考え、失敗したプロンプトを無料で再試行できるとは思わないでください。
Gemini Omni Flash の料金、内訳
こちらが、Google の Gemini API 料金ページに記載されている料金表です — 無料枠はなく、Standard 料金のみです:
価格 | |
|---|---|
入力(テキスト / 画像 / 動画 / 音声) | 1Mトークンあたり $1.50 |
出力 — テキスト | 1Mトークンあたり $9.00 |
出力 — 動画 | 1Mトークンあたり $17.50 |
Video は秒単位で直接課金されるわけではありません。出力トークンに基づいて課金され、Google は換算値を明示しています: 720p 動画 1 秒あたり 5,792 トークン。計算すると ($17.50 ÷ 1,000,000 × 5,792)、およそ 1 秒あたり $0.101 となり、Google のドキュメントでは「1 秒あたり約 $0.10」と丸められています。
720pの実際のクリップでそれが意味するものは次のとおりです:
クリップの長さ | 概算費用 |
|---|---|
4s | $0.41 |
5s | $0.51 |
6s | $0.61 |
8s | $0.81 |
10s | $1.01 |
入力トークンを上乗せすると、短いテキストプロンプトに加えて参照画像を1~2枚使うだけで通常は $1.50/1M で数セント程度増え、8秒のクリップなら合計は約 $0.85 になります。Google のページでは 720p のトークンから秒への換算しか記載されておらず、1080p と 4K は個別には掲載されていないため、これらはより高くなる可能性があるものとして見積もり、実運用の前にライブページを再確認してください。
APIアクセスを実際に取得する方法
実際に公式と確認されているのは2つのチャネルだけです。Google自身のチャネルが完全に開放される前に、より広い再販アクセスを主張する第三者のガイドには懐疑的でいてください:
Google AI Studio —
aistudio.google.com/apikeyでキーを取得し、それをGEMINI_API_KEYとしてエクスポートしてから、Interactions API(pip install -U google-genaiまたはnpm install @google/genai)経由でモデルをgemini-omni-flash-previewとして呼び出します。テストするための最短ルートです。Vertex AI — 同じ基盤モデルですが、別のエンタープライズグレードのエンドポイントの背後にあり、さらにGCPプロジェクトID、リージョン/ロケーション設定、そして単純なAPIキーではなくIAMベースの認証が必要です。Google Cloudの課金に触れたことがない場合は、セットアップに30〜60分ほど見込んでください。
計画を立てる際に押さえておくべき点: AI Studio と Vertex AI は、Google の別々の製品サーフェスです — ドキュメントも SDK も異なり、認証方式もそれぞれ API キー認証 と GCP IAM 認証 です。設計上、互換性はありません。そのため、実際にデプロイするプラットフォームを先に決めてから構築してください。AI Studio でプロトタイプを作り、後で Vertex にコピペで移行できると考えるのではなく、最初に選ぶのが重要です。
始める前にもう一つ知っておくべきことがあります。Google の Interactions API の入門ガイドによると、ビデオ生成は同期レスポンスではなく長時間実行タスク向けに background=True がデフォルトになっており、そのため OpenAI chat-completions 互換ではありません。 以下は最小限の Python パターンです — あくまで例示です。実装前に、正確なフィールド名について現在の google-genai SDK リファレンスを確認してください:
from google import genai
import time
client = genai.Client() # GEMINI_API_KEY を env から読み込みます
interaction = client.interactions.create(
model="gemini-omni-flash-preview",
input="A drone shot pulling back from a lighthouse at sunset",
background=True,
)
while interaction.status not in ("completed", "failed"):
time.sleep(3)
interaction = client.interactions.get(interaction.id)
if interaction.status == "completed":
with open("output.mp4", "wb") as f:
f.write(interaction.output_video.read())
ここにはそのまま使える chat-completions 形式はありません — 既存の統合コードが OpenAI の同期レスポンス形式を前提にしている場合、モデル文字列を差し替えるのではなく、request/response の処理を書き換えることになります。
Gemini Omni Flash とシングルショット動画モデル
会話型の編集ループには Omni Flash を選んでください。固定の解像度と尺で、テキスト/画像から動画への単発ジョブを行うなら、単発モデルのほうがシンプルで、コストの見積もりもしやすくなります:
最適用途 | アクセス方法 | |
|---|---|---|
Gemini Omni Flash | 複数ターンの会話型編集、編集全体でのキャラクターの一貫性 | Google AI Studio または Vertex AI から直接 |
固定仕様での一発テキスト/画像から動画生成 | 各ベンダーから直接、または AIReiter のようなリレー・プラットフォームにバンドル |
Omni Flash はまだ AIReiter や同様のバンドル型リレープラットフォームでは利用できません — そのマルチターンのワークフローでは、Google の API へ直接アクセスするのが依然として最も簡単な選択肢です。
よくある質問
Gemini Omni Flash のモデル ID とは何ですか?
gemini-omni-flash-preview。Google AI Studio または Vertex AI の Interactions API で呼び出す際は、この正確な文字列を使用してください。これはまだプレビューモデルであるため、一般提供時に ID が変更される可能性があります。
Gemini Omni Flash の動画1本あたりの料金はいくらですか?
720pで約$0.10/秒なので、一般的な4~10秒のクリップは$0.50~$1です。
Gemini Omni Flash に無料プランはありますか?
いいえ。Google の価格ページでは、無料プランの入力と出力の両方について「利用不可」と記載されています。Standard(有料)プランのみです。
AI Studio と Vertex AI で同じコードを使用できますか?
直接にはできません。これらは別々のGoogle製品の提供面で、SDKや認証(API key vs. GCP IAM)が異なるため、片方向けに書かれたコードをもう片方へ移すには実質的な作り直しが必要です。構築する前に、デプロイ先を決めてください。
Gemini Omni Flash は OpenAI スタイルの chat completions コードで動作しますか?
いいえ。動画生成は同期的なチャット補完のレスポンス形式ではなく、非同期タスクの作成とポーリング(background=True と interactions.get())で実行されます。
マルチターンのキャラクター一貫性は実際に機能しますか?
Google Flowを使った独自の2ラウンドテストでは、見た目については「はい」でした。つまり、同じ顔、ジャケット、髪型が、昼から夜へのシーン変化を通してきれいに維持されました。ただし、複雑な動きの指示に従うことはより苦手で(求めた「振り向いて歩く」動作はほとんど反映されませんでした)、背景の文字を正確に描写することにも苦戦しました。これらはいずれも、Googleがモデルカードで明示している制限と一致しています。