如果任务本身并不复杂,没必要为多余的推理能力买单。Gemini 3.5 Flash-Lite 是目前运行 Gemini 模型最便宜的选择:每百万输入 Token $0.30,每百万输出 Token $2.50。我用相同任务与 Gemini 3.6 Flash 做了一轮对比,Flash-Lite 的成本低了 94%,流式输出更快,答案也都正确。它的定位很明确:追求吞吐量和响应速度,而不是深度推理。对于高并发、以常规任务为主的工作负载,这正是该优先考虑的模型。
Gemini 3.5 Flash-Lite 是什么定位
Flash-Lite 是 Gemini 快速模型档中的入门级型号,面向简单、高频的调用场景。它把单次成本和延迟放在首位,而非极限智能表现。核心参数如下:
- 价格:每 1M Token 输入 $0.30,输出 $2.50。
- 上下文窗口:1M Token,与更高档的 Flash 模型相同。
- 速度:Google 标称约为每秒生成 350 个输出 Token。
- 智能水平:Artificial Analysis Index 为 36,而价格更高的 3.6 Flash 为 50。这一差距就是它节省成本所付出的代价。
它与 3.6 Flash 以及专注安全的 3.5 Flash Cyber 同期推出,但目标完全不同:大规模分类、信息提取、路由、打标,以及简单对话。
价格:Gemini 产品线的最低门槛
与同系列其他模型相比,Flash-Lite 的价格明显更低。以下价格均来自 Google 官方定价页面:
| 模型 | 输入 /1M | 输出 /1M |
|---|---|---|
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 |
| Gemini 3.6 Flash | $1.50 | $7.50 |
| Gemini 3.5 Flash(上一代) | $1.50 | $9.00 |
仅看标价,Flash-Lite 的输入价格是 3.6 Flash 的五分之一,输出价格约为三分之一。若再算上两者实际消耗的 Token 数,成本差距还会进一步拉大。
实测:对比 Gemini 3.6 Flash
我在 2026 年 7 月 22 日通过 OpenRouter,以 temperature 0 向两款模型发送了同样的三个提示词:一道编程任务、一道推理题,以及一次 JSON 提取任务。
| 指标(3 项任务,temp 0) | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| 输入 Token | 147 | 148 |
| 输出 Token | 543 | 3,058 |
| 总成本 | $0.0014 | $0.023 |
| 平均首 Token 时间 | 1.2s | 4.5s |
| 生成速度 | 超过 400 tok/s | — |
| 答案正确数 | 3 / 3 | 3 / 3 |
Flash-Lite 的成本低了94%,三项任务也全部答对,包括那道多步骤的列车时间计算题。差距主要来自两点:首先,它的流式生成速度超过每秒 400 Token,高于 350 的标称值;它也更快返回首 Token,因为不像 3.6 Flash 那样会停下来“思考”。其次,它的回答简洁得多,通常只输出数百个 Token;而 3.6 Flash 会大量消耗需要付费的隐藏推理 Token,输出可达数千 Token。对于简单任务,这部分推理开销并无必要。
实际使用时,响应差异同样很直观。Flash-Lite 平均约 1.2 秒就会返回第一个 Token,3.6 Flash 则为 4.5 秒;无论是对话应用还是高并发流水线,前者的体感都更快。
这里有两点需要说明。第一,这只是 temperature 0 下的一次测试,模型每次运行的表现会有波动,因此这些具体数字应视为参考,而不是基准测试结果。第二,我测试的三项任务都比较简单。Intelligence Index 的差距,即 36 对 50,确实存在;在更难的问题、复杂的多步骤 Agent、需要细致推敲的编程任务,或其他依赖严谨推理的场景中,这种差距会显现出来。届时,Flash-Lite 有限的推理预算会成为能力上限,而不再只是成本优势。
什么场景该用 Flash-Lite,什么场景不该用
- 选择 Gemini 3.5 Flash-Lite:适合高调用量、对延迟敏感且复杂度较低的任务,例如分类、实体提取、路由与分流、打标、短文本摘要和简单对话。以这个价格运行大规模调用,远比使用 3.6 Flash 从容。
- 升级到 3.6 Flash:如果任务需要真正的推理能力,例如 Agent 编程、计算机操作、多步骤工作流,或答错代价很高的场景,就该选择 3.6 Flash。完整的 Gemini 3.6 Flash 指南介绍了这一档模型的基准表现和定价。
常见做法是两者搭配:大部分简单、低成本的请求交给 Flash-Lite,只有难题才升级至 3.6 Flash。两款模型的上下文窗口都是 1M Token,API 也相同,切换时只需改一行模型 ID。
如何使用 Gemini 3.5 Flash-Lite
该模型现已在 Gemini API 和 Google AI Studio 上线,模型 ID 为 gemini-3.5-flash-lite。AI Studio 提供免费档,可用于测试。如果通过聚合平台调用,OpenRouter 和 AIReiter 都按 Google 的标价提供该模型;若你希望用一个 Key 同时接入 Gemini 或 Claude 模型,这会比较方便。
常见问题
Gemini 3.5 Flash-Lite 怎么收费?
每 1M 输入 Token $0.30,每 1M 输出 Token $2.50,是 Gemini 产品线中最便宜的档位。
Gemini 3.5 Flash-Lite 免费吗?
Google AI Studio 提供免费档,适合原型开发和测试。生产环境使用则按照上述按量付费价格计费。
Gemini 3.5 Flash-Lite 有多快?
Google 标称其输出速度约为每秒 350 个 Token;我的流式测试中速度超过每秒 400 个 Token,首 Token 大约在 1.2 秒返回。
Flash-Lite 够用吗,还是应该选择 3.6 Flash?
对于简单、高频任务,Flash-Lite 的正确率足够且价格低得多。若是重推理或 Agent 类任务,3.6 Flash 更高的智能水平(Index 50 对 36)值得额外成本。
