AIREITER

Gemini Omni Flash 定價與 API 存取指南

最近更新: 2026-07-01 07:26:28

Gemini Omni Flash 的實際 API 價格約為 720p 影片每秒 0.10 美元——也就是每百萬輸出 token 17.50 美元,按照每秒 5,792 個 token 計費,依據 Google 官方 Gemini API 定價頁面,於 2026 年 7 月查核。此模型沒有免費方案。模型 ID——因為藏在文件深處而很容易被忽略——是 gemini-omni-flash-preview,目前仍標示為「preview」,因此在正式可用前,定價與存取細節都可能變動。它透過兩個獨立入口提供:Google AI Studio 和 Vertex AI,兩者不共用程式碼。如果你在某處看過「每秒 0.20–0.60 美元」的估算,那是 Google 公布實際數字之前寫下的預發佈推測;現在已過時。

Gemini Omni Flash 實際上是什麼

根據 Google 的發佈文章,Gemini Omni Flash 是新「Omni」系列中的第一個模型——一個 any-to-any transformer,可將文字、圖片、音訊和影片作為輸入,並輸出以 Gemini 世界知識為基礎的影片。透過 Gemini app、Google Flow,以及 YouTube Shorts/Create,Google AI Plus、Pro 和 Ultra 訂閱用戶可免費使用;開發者 API 存取則於 2026 年 6 月底推出,根據 VentureBeat。

它的突出特色是對話式、多輪編輯:描述一個變更,它會在保持角色和場景一致的同時套用該編輯,而且你可以在同一個對話串中持續迭代。

DeepMind 模型卡列出了安全防護措施——每個片段都包含 SynthID 浮水印與 C2PA 內容憑證,不得將真實人物的靜態照片與音訊進行對嘴,且語音編輯功能受限——以及三個已知弱點:多步驟編輯的一致性、複雜動作場景,以及準確的畫面文字。我們在下方對這三項都進行了測試。

我們親自測試了多輪編輯

我們將它透過 Google Flow 進行了兩輪編輯序列:先生成一位拿著手寫紙板標語的女性,然後編輯同一段影片,將場景切換為夜晚、改成霓虹招牌,並讓她轉身朝鏡頭走來。兩個輸出檔案都回傳為 720p、24fps、8 秒,並附帶原生立體聲音訊——這與第三方整合商所回報的結果一致,現在也已在我們自己的檔案上獨立確認。

紙板標誌上的螢幕文字——「OPEN TODAY」——在完整的 8 秒內都完美呈現,沒有任何亂碼。這點值得注意,因為準確的文字渲染正是模型卡本身所承認的弱點之一。

角色一致性的說法在實際效果中表現得相當不錯:同樣的臉、同樣的紅色羽絨外套、同樣的白色毛衣、同樣的頭髮,都乾淨俐落地延續到一個完全不同的光線設定中,場景裡還新增了一個霓虹招牌。不過,有兩件事沒有照指示完成:

  • 背景中的店招破壞了文字渲染——窗戶上的「COFFEE」招牌又變成了讀作「COFFFEE」(多了一個字母),儘管第一輪前景中的紙板招牌完全正確。文字準確度似乎很大程度上取決於文字在畫面中的顯著程度與居中程度,而不只是模型是否能夠渲染文字。

  • 要求的「轉身並朝鏡頭走來」動作幾乎沒有發生。 看上方的影片——我們得到的反而是輕微的鏡頭距離變化,而主體大多保持靜止,並沒有提示詞中要求的明確轉身與走來。這與 Google 在 model card 中披露的「complex-motion scenes」限制一致;多步驟的身體動作目前還不像靜態到靜態的光線或場景變化那樣能可靠地對應指令。

還有一件值得納入預算的事:一次輸入錯誤的編輯就消耗了我們在 Flow 上可用的一次生成,這足以比預期更快地耗盡測試時段。Google 並未公布 Omni Flash 各方案的確切生成配額,所以如果你認真進行測試,預期會比你原本規劃的嘗試次數更多,且不要以為你可以免費重試一個失敗的提示詞。

Gemini Omni Flash 定價詳解

以下是費率表,根據 Google 的 Gemini API 定價頁面 — 沒有免費方案,僅有標準費率:

價格

輸入(文字 / 圖片 / 影片 / 音訊)

每 1M tokens $1.50

輸出 — 文字

每 1M tokens $9.00

輸出 — 影片

每 1M tokens $17.50

影片並非直接按秒計費,而是按輸出 token 計費,且 Google 有明確的換算方式:每秒 720p 影片為 5,792 個 token。算一下($17.50 ÷ 1,000,000 × 5,792),結果大約是每秒 $0.101,這與 Google 文件中四捨五入為「每秒約 $0.10」一致。

這對於一段真正的影片片段,在 720p 下意味著什麼:

剪輯長度

約略成本

4秒

$0.41

5秒

$0.51

6秒

$0.61

8秒

$0.81

10秒

$1.01

在此基礎上再加上輸入 tokens——一段簡短的文字提示加上一到兩張參考圖片,通常在 $1.50/1M 的價格下只會再增加幾美分——而一段 8 秒的片段總成本大約會落在 $0.85 左右。Google 的頁面只記載了 720p 的 token 轉秒數換算;1080p 和 4K 並未另外列出,因此預算時可先把它們視為可能更昂貴,並在正式執行前再確認即時頁面。

如何實際取得 API 存取權限

目前實際上只有兩個管道被確認為官方管道——在 Google 自家的管道尚未全面開放之前,對任何聲稱有更廣泛轉售存取權的第三方指南都應保持懷疑:

  1. Google AI Studio — 透過 aistudio.google.com/apikey 取得金鑰,將其匯出為 GEMINI_API_KEY,並透過 Interactions API 以 gemini-omni-flash-preview 呼叫模型(pip install -U google-genai 或 npm install @google/genai)。這是測試最快的途徑。

  2. Vertex AI — 相同的底層模型,但前端是另一個企業級端點,另外還需要 GCP 專案 ID、區域/位置設定,以及基於 IAM 的驗證,而不是單純的 API 金鑰。如果你以前沒接觸過 Google Cloud 計費,請預留 30-60 分鐘進行設定。

值得事先規劃:AI Studio 和 Vertex AI 是 Google 不同的產品介面——有不同的文件、不同的 SDK,以及分別使用 API 金鑰驗證與 GCP IAM 驗證。它們在設計上就不是可互換的,因此在開始開發之前,請先選定你實際要部署的平台,而不是先用 AI Studio 做原型,然後假設之後可以直接複製貼上搬到 Vertex。

在開始之前,還有一件值得知道的事:根據 Google 的 Interactions API 入門指南,影片生成預設對於長時間執行的任務會使用 background=True,而不是同步回應,這也表示它與 OpenAI chat-completions 不相容。 以下是一個最小的 Python 範例模式——僅供示意;在正式推出前,請先查閱目前的 google-genai SDK 參考文件以確認確切的欄位名稱:

from google import genai
import time

client = genai.Client()  # 從環境變數讀取 GEMINI_API_KEY

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="A drone shot pulling back from a lighthouse at sunset",
    background=True,
)

while interaction.status not in ("completed", "failed"):
    time.sleep(3)
    interaction = client.interactions.get(interaction.id)

if interaction.status == "completed":
    with open("output.mp4", "wb") as f:
        f.write(interaction.output_video.read())

這裡沒有可直接替換的 chat-completions 形式——如果你現有的整合程式碼假設的是 OpenAI 的同步回應格式,那你其實是在重寫請求/回應處理,而不是只更換一個模型字串。

Gemini Omni Flash 與單次輸入影片模型

選擇 Omni Flash 用於對話式編輯迴圈。若是固定解析度與時長的直接文字/圖片轉影片工作,單次輸出模型在理解上更簡單也更便宜:

最適用途

存取

Gemini Omni Flash

多輪對話式編輯,跨編輯保持角色一致性

直接透過 Google AI Studio 或 Vertex AI

Veo 3.1 / Sora 2 / Seedance 2.0

固定規格的一次性文字/圖片轉影片

直接向各家供應商取得,或透過 AIReiter 等轉接平台整合取得

Omni Flash 目前尚未上架於 AIReiter 或類似的整合轉接平台——就其多輪工作流程而言,直接使用 Google 自家的 API 仍然是最簡單的選擇。

常見問題

Gemini Omni Flash 模型 ID 是什麼?

gemini-omni-flash-preview。透過 Google AI Studio 或 Vertex AI 的 Interactions API 呼叫它時,請使用這個完全相同的字串。它仍然是預覽模型,因此在正式發布時,ID 可能會變更。

每支影片的 Gemini Omni Flash 費用是多少?

約 $0.10/秒,720p,因此一般 4-10 秒的片段費用約為 $0.50-$1。

Gemini Omni Flash 有免費方案嗎?

不。Google 的定價頁面在免費方案中將輸入與輸出都列為「無法使用」——僅限 Standard(付費)方案。

我可以在 AI Studio 和 Vertex AI 使用相同的程式碼嗎?

不能直接。它們是不同的 Google 產品介面,使用不同的 SDK 和驗證方式(API key vs. GCP IAM),因此為其中一個撰寫的程式碼若要移到另一個,必須實際重構。請在開始建置前先選定你的部署目標。

Gemini Omni Flash 可以與 OpenAI 風格的 chat completions 程式碼搭配使用嗎?

不。影片生成是透過非同步任務建立與輪詢(background=True 加上 interactions.get())來執行,而不是同步的 chat-completions 回應格式。

多輪角色一致性真的有效嗎?

在我們透過 Google Flow 進行的兩輪自測中,外觀表現是可以的——同一張臉、同一件外套和同一款髮型,在從白天到夜晚的場景轉換中都能乾淨地延續下去。不過,它在遵循複雜的動作指令方面就比較吃力(例如要求轉身並行走,幾乎沒有明顯反應),而且在準確呈現背景文字方面也有困難;這兩點都與 Google 在模型卡上揭露的限制一致。