Gemini 3.5 Flash-Lite:价格、速度与适用场景

最后更新: 2026-07-22 07:17:29

如果任务本身并不复杂,没必要为多余的推理能力买单。Gemini 3.5 Flash-Lite 是目前运行 Gemini 模型最便宜的选择:每百万输入 Token $0.30,每百万输出 Token $2.50。我用相同任务与 Gemini 3.6 Flash 做了一轮对比,Flash-Lite 的成本低了 94%,流式输出更快,答案也都正确。它的定位很明确:追求吞吐量和响应速度,而不是深度推理。对于高并发、以常规任务为主的工作负载,这正是该优先考虑的模型。

Gemini 3.5 Flash-Lite 是什么定位

Flash-Lite 是 Gemini 快速模型档中的入门级型号,面向简单、高频的调用场景。它把单次成本和延迟放在首位,而非极限智能表现。核心参数如下:

  • 价格:每 1M Token 输入 $0.30,输出 $2.50。
  • 上下文窗口:1M Token,与更高档的 Flash 模型相同。
  • 速度:Google 标称约为每秒生成 350 个输出 Token。
  • 智能水平:Artificial Analysis Index 为 36,而价格更高的 3.6 Flash 为 50。这一差距就是它节省成本所付出的代价。

它与 3.6 Flash 以及专注安全的 3.5 Flash Cyber 同期推出,但目标完全不同:大规模分类、信息提取、路由、打标,以及简单对话。

价格:Gemini 产品线的最低门槛

与同系列其他模型相比,Flash-Lite 的价格明显更低。以下价格均来自 Google 官方定价页面

模型输入 /1M输出 /1M
Gemini 3.5 Flash-Lite$0.30$2.50
Gemini 3.6 Flash$1.50$7.50
Gemini 3.5 Flash(上一代)$1.50$9.00

仅看标价,Flash-Lite 的输入价格是 3.6 Flash 的五分之一,输出价格约为三分之一。若再算上两者实际消耗的 Token 数,成本差距还会进一步拉大。

实测:对比 Gemini 3.6 Flash

我在 2026 年 7 月 22 日通过 OpenRouter,以 temperature 0 向两款模型发送了同样的三个提示词:一道编程任务、一道推理题,以及一次 JSON 提取任务。

指标(3 项任务,temp 0)Gemini 3.5 Flash-LiteGemini 3.6 Flash
输入 Token147148
输出 Token5433,058
总成本$0.0014$0.023
平均首 Token 时间1.2s4.5s
生成速度超过 400 tok/s
答案正确数3 / 33 / 3

Flash-Lite 的成本低了94%,三项任务也全部答对,包括那道多步骤的列车时间计算题。差距主要来自两点:首先,它的流式生成速度超过每秒 400 Token,高于 350 的标称值;它也更快返回首 Token,因为不像 3.6 Flash 那样会停下来“思考”。其次,它的回答简洁得多,通常只输出数百个 Token;而 3.6 Flash 会大量消耗需要付费的隐藏推理 Token,输出可达数千 Token。对于简单任务,这部分推理开销并无必要。

柱状图显示,针对相同的三项任务,Gemini 3.5 Flash-Lite 的成本约为 Gemini 3.6 Flash 的 6%

实际使用时,响应差异同样很直观。Flash-Lite 平均约 1.2 秒就会返回第一个 Token,3.6 Flash 则为 4.5 秒;无论是对话应用还是高并发流水线,前者的体感都更快。

平均首 Token 时间柱状图:Gemini 3.5 Flash-Lite 为 1.2 秒,Gemini 3.6 Flash 为 4.5 秒

这里有两点需要说明。第一,这只是 temperature 0 下的一次测试,模型每次运行的表现会有波动,因此这些具体数字应视为参考,而不是基准测试结果。第二,我测试的三项任务都比较简单。Intelligence Index 的差距,即 36 对 50,确实存在;在更难的问题、复杂的多步骤 Agent、需要细致推敲的编程任务,或其他依赖严谨推理的场景中,这种差距会显现出来。届时,Flash-Lite 有限的推理预算会成为能力上限,而不再只是成本优势。

什么场景该用 Flash-Lite,什么场景不该用

  • 选择 Gemini 3.5 Flash-Lite:适合高调用量、对延迟敏感且复杂度较低的任务,例如分类、实体提取、路由与分流、打标、短文本摘要和简单对话。以这个价格运行大规模调用,远比使用 3.6 Flash 从容。
  • 升级到 3.6 Flash:如果任务需要真正的推理能力,例如 Agent 编程、计算机操作、多步骤工作流,或答错代价很高的场景,就该选择 3.6 Flash。完整的 Gemini 3.6 Flash 指南介绍了这一档模型的基准表现和定价。

常见做法是两者搭配:大部分简单、低成本的请求交给 Flash-Lite,只有难题才升级至 3.6 Flash。两款模型的上下文窗口都是 1M Token,API 也相同,切换时只需改一行模型 ID。

如何使用 Gemini 3.5 Flash-Lite

该模型现已在 Gemini API 和 Google AI Studio 上线,模型 ID 为 gemini-3.5-flash-lite。AI Studio 提供免费档,可用于测试。如果通过聚合平台调用,OpenRouter 和 AIReiter 都按 Google 的标价提供该模型;若你希望用一个 Key 同时接入 Gemini 或 Claude 模型,这会比较方便。

常见问题

Gemini 3.5 Flash-Lite 怎么收费?

每 1M 输入 Token $0.30,每 1M 输出 Token $2.50,是 Gemini 产品线中最便宜的档位。

Gemini 3.5 Flash-Lite 免费吗?

Google AI Studio 提供免费档,适合原型开发和测试。生产环境使用则按照上述按量付费价格计费。

Gemini 3.5 Flash-Lite 有多快?

Google 标称其输出速度约为每秒 350 个 Token;我的流式测试中速度超过每秒 400 个 Token,首 Token 大约在 1.2 秒返回。

Flash-Lite 够用吗,还是应该选择 3.6 Flash?

对于简单、高频任务,Flash-Lite 的正确率足够且价格低得多。若是重推理或 Agent 类任务,3.6 Flash 更高的智能水平(Index 50 对 36)值得额外成本。

延伸阅读