AIREITER

Gemini Omni Flash 价格与 API 访问指南

最后更新: 2026-07-01 07:25:58

Gemini Omni Flash 的真实 API 价格大约是 720p 视频每秒 $0.10——按每秒 5,792 个 token 计费,相当于每百万输出 token $17.50;这一点可参见 Google 自己的 Gemini API 定价页面,核查于 2026 年 7 月。该模型没有免费层。模型 ID——由于埋在文档里,很容易被忽略——是 gemini-omni-flash-preview,仍然标记为“preview”,因此在正式可用之前,价格和访问细节都可能变化。它通过两个独立入口提供:Google AI Studio 和 Vertex AI,这两个入口不共享代码。如果你在某处见过“每秒 $0.20–0.60”的估算,那是 Google 发布真实数据之前写下的预发布猜测;现在已经过时了。

Gemini Omni Flash 实际是什么

根据 Google 的发布文章,Gemini Omni Flash 是新“Omni”系列中的首个模型——一种任意到任意的 transformer,可将文本、图像、音频和视频作为输入,并返回基于 Gemini 世界知识生成的视频。对于 Google AI Plus、Pro 和 Ultra 订阅用户,它可通过 Gemini 应用、Google Flow 以及 YouTube Shorts/Create 免费使用;据 VentureBeat 报道,开发者 API 访问随后于 2026 年 6 月下旬推出。

它最突出的特点是对话式、多轮编辑:描述一个改动,它就会应用该编辑,同时保持角色和场景的一致性,然后你可以在同一线程中继续迭代。

DeepMind 模型卡列出了安全护栏——对每个片段都进行 SynthID 水印和 C2PA 内容凭证标记,不将真实人物的静态照片与音频进行口型同步,限制语音编辑——以及三个已知弱点:多步骤编辑之间的一致性、复杂运动场景和准确的屏幕文字。我们在下面测试了这三项。

我们亲自测试了多轮编辑

我们使用 Google Flow 进行了两轮编辑序列:先生成一位手持手写纸板牌子的女性,然后编辑同一段视频,将场景切换到夜晚,改为霓虹灯招牌,并让她转身朝镜头走来。两个输出文件都返回为 720p、24fps、8 秒,并带有原生立体声音频——这与第三方集成方报告的结果一致,如今也已在我们自己的文件中得到独立确认。

纸板标牌上的屏幕文字——“OPEN TODAY”——在整整 8 秒内都完美呈现,没有出现乱码。这一点很值得注意,因为准确的文本渲染正是模型卡片本身承认的弱点之一。

角色一致性的说法在实践中表现得很好:同一张脸、同一件红色羽绒服、同一件白色毛衣、同样的发型,都被干净利落地延续到了一个完全不同的光照设置中,并且场景里还新增了一个霓虹招牌。不过,有两点没有按指示执行:

  • 背景商店的招牌破坏了文本渲染 — 窗户上的“COFFEE”招牌又显示成了“COFFFEE”(多了一个字母),尽管第一轮中的前景纸板招牌完美无误。文本准确性似乎在很大程度上取决于文本在画面中的显著程度以及是否处于中央位置,而不仅仅是模型是否能够渲染文本。

  • 所要求的“转身并朝摄像机走来”动作几乎没有发生。 看上面的视频片段——我们得到的反而是镜头距离的轻微变化,而主体大多保持静止,并没有提示中要求的那种明确转身并走来的动作。这与 Google 在 model card 中披露的“复杂动作场景”限制相符;多步骤身体动作目前还不能像静态到静态的光照或场景变化那样可靠地跟随指令。

还有一件值得纳入预算的事:一次输入错误的编辑就消耗了我们在 Flow 上可用生成次数中的一次,这足以让一次测试会话比预期更快耗尽。Google 并未公布 Omni Flash 的各套餐精确生成配额,因此如果你在认真测试,预计会比你计划的投入更多尝试次数,而且不要以为你可以免费重试一个搞砸的提示词。

Gemini Omni Flash 定价明细

以下是费率表,依据Google 的 Gemini API 定价页面——无免费层,仅标准费率:

价格

输入(文本 / 图像 / 视频 / 音频)

每 1M tokens $1.50

输出 — 文本

每 1M tokens $9.00

输出 — 视频

每 1M tokens $17.50

视频不是按秒直接计费的——而是按输出 token 计费,Google 明确给出了换算:每秒 720p 视频对应 5,792 个 token。算一下($17.50 ÷ 1,000,000 × 5,792),结果大约是每秒 $0.101,Google 的文档将其四舍五入为“每秒大约 $0.10”。

这对一个真实片段在 720p 下意味着什么:

剪辑时长

约费用

4秒

$0.41

5秒

$0.51

6秒

$0.61

8秒

$0.81

10秒

$1.01

在此基础上再加上输入 token——一段简短的文本提示加上一到两张参考图片,通常会按 $1.50/1M 再增加几美分——而一个 8 秒的片段总价接近 $0.85。Google 的页面只记录了 720p 的 token 到秒的换算;1080p 和 4K 没有单独列出,因此预算时应将它们视为可能更贵,并在正式运行前重新查看实时页面。

如何真正获取 API 访问权限

目前实际上只有两个渠道被确认是官方渠道——在谷歌自己的渠道全面开放之前,请对任何声称拥有更广泛转售访问权限的第三方指南保持怀疑态度:

  1. Google AI Studio — 在 aistudio.google.com/apikey 获取密钥,将其导出为 GEMINI_API_KEY,并通过 Interactions API(pip install -U google-genai 或 npm install @google/genai)以 gemini-omni-flash-preview 调用模型。用于测试的最快路径。

  2. Vertex AI — 底层是相同的模型,但由一个独立的企业级端点提供支持;此外还需要 GCP project ID、region/location 设置,以及基于 IAM 的身份验证,而不是普通的 API key。如果你以前没有接触过 Google Cloud billing,预留 30-60 分钟进行设置。

值得提前规划:AI Studio 和 Vertex AI 是彼此独立的 Google 产品界面——文档不同、SDK 不同,而且分别使用 API-key 认证和 GCP IAM 认证。它们在设计上并不能互换,所以在构建之前就先选定你实际要部署的平台,而不是先在 AI Studio 上做原型,然后假设以后可以直接复制粘贴迁移到 Vertex。

在开始之前,还有一件值得了解的事:根据Google 的 Interactions API 入门指南,视频生成默认将 background=True 用于长时间运行的任务,而不是同步响应,这也意味着它与 OpenAI chat-completions 不兼容。下面是一个最小的 Python 模式——仅作示意;在正式使用前,请先查看当前 google-genai SDK 参考文档以确认准确的字段名称:

from google import genai
import time

client = genai.Client()  # 从环境变量读取 GEMINI_API_KEY

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="A drone shot pulling back from a lighthouse at sunset",
    background=True,
)

while interaction.status not in ("completed", "failed"):
    time.sleep(3)
    interaction = client.interactions.get(interaction.id)

if interaction.status == "completed":
    with open("output.mp4", "wb") as f:
        f.write(interaction.output_video.read())

这里没有可直接替换的 chat-completions 结构——如果你现有的集成代码假定使用的是 OpenAI 的同步响应格式,那么你需要重写请求/响应处理,而不是简单地替换一个模型字符串。

Gemini Omni Flash 与单次生成视频模型

对话式编辑循环请选择 Omni Flash。对于固定分辨率和时长的纯文本/图像转视频任务,单次生成模型更简单,推理成本也更低:

最适合

获取方式

Gemini Omni Flash

多轮对话式编辑,跨编辑的角色一致性

直接通过 Google AI Studio 或 Vertex AI

Veo 3.1 / Sora 2 / Seedance 2.0

固定规格的一次性文本/图像转视频

可直接从各自供应商获取,或通过 AIReiter 等中继平台打包提供

Omni Flash 目前还未上线 AIReiter 或类似的聚合中继平台——由于其多轮工作流,直接使用 Google 自家的 API 仍然是最简单的选择。

常见问题

什么是 Gemini Omni Flash 模型 ID?

gemini-omni-flash-preview。在 Google AI Studio 或 Vertex AI 中通过 Interactions API 调用它时,请使用此精确字符串。它仍然是预览版模型,因此在正式发布时 ID 可能会更改。

Gemini Omni Flash 每个视频的费用是多少?

在 720p 下大约为 $0.10/秒,因此一个典型的 4-10 秒片段费用为 $0.50-$1。

Gemini Omni Flash 有免费套餐吗?

不。Google 的定价页面在免费套餐中将输入和输出都列为“不可用”——仅限标准(付费)套餐。

我可以在 AI Studio 和 Vertex AI 上使用相同的代码吗?

不能直接互换。它们是不同的 Google 产品界面,使用不同的 SDK 和认证方式(API key vs. GCP IAM),因此为一个编写的代码要迁移到另一个需要进行实际重构。请在开始构建之前先确定你的部署目标。

Gemini Omni Flash 是否适用于 OpenAI 风格的聊天补全代码?

不。视频生成通过异步任务创建和轮询(background=True 加上 interactions.get())运行,而不是同步的 chat-completions 响应格式。

多轮角色一致性真的有效吗?

在我们通过 Google Flow 进行的两轮测试中,就外观而言是的——同一张脸、外套和头发在从白天到夜晚的完整场景切换中都得到了干净一致的保留。它在遵循复杂动作指令方面表现更吃力(一个要求的转身并行走几乎没有体现出来),在准确渲染背景文字方面也是如此,这两点都与 Google 在模型卡中披露的限制相符。