AIREITER
GoogleText Chat

Gemini 3.7 Flash

在线试用 Gemini 3.7 Flash,体验响应式聊天、编码、文档处理、流式输出、缓存使用以及 Chat Completions API 访问。

输入官方 $0.75 每 100 万 TokensAIReiter $0.225 每 100 万 Tokens输出官方 $3.75 每 100 万 TokensAIReiter $1.125 每 100 万 Tokens缓存读取官方 $0.075 每 100 万 TokensAIReiter $0.0225 每 100 万 Tokens
使用 API 运行

输入

输出

Example
Generated in
42.7 seconds
输入 Token
134
输出 Token
2354
Tokens per second
55.13 tokens / second
Time to first token
-

模型详情

在 Playground、API 请求和内部工作流中使用相同的模型 key。

模型 ID
gemini-3.7-flash
供应商
Google
协议
OpenAI Chat Completions
上下文窗口
1,048,576 Token
最大输出
65,536 Token
输入 Token
22.5 credits / 1M Token
输出 Token
112.5 credits / 1M Token
缓存读取
2.25 credits / 1M Token
缓存写入
-

使用 Gemini 3.7 Flash 可以做什么

适用于助手、代码帮助、文档处理和重复 API 工作的响应式路径。

响应式助手

为面向用户的聊天和内部副驾提供支持,让流式输出保持交互持续进行。

文档处理

对输入文本进行摘要、分类、转换,并提取结构化见解。

编码支持

起草实现检查清单、解释代码、生成测试,并回答聚焦的开发者问题。

高吞吐自动化

在重复的内容和操作任务中运行,清晰呈现输入、输出和缓存 token 使用情况。

Gemini 3.7 Flash 使用场景

最适合需要有用输出、但不必将每个请求都路由到旗舰模型的工作负载。
01

交互式聊天

通过响应式流式界面回答产品、支持和内部知识相关问题。

02

文档流水线

将报告、工单和笔记转换为摘要、字段、标签和行动清单。

03

开发者工作流

生成聚焦的代码、测试、解释和实现验收标准。

04

内容运营

在高频 API 任务中生成变体、简报、元数据和结构化草稿。

是否应该从 Gemini 3.6 Flash 迁移?

将 3.7 Flash 视为一条新的可评估路线,而不是仅仅因为版本号就自动替换。

从回归测试集开始

针对你的应用实际使用的提示词、输出格式和语言,对两个版本进行对比。

衡量总输出用量

即使可见答案很短,思考或隐藏推理 token 也可能影响计费输出。

验证缓存行为

重复稳定且符合条件的前缀,并确认 prompt_tokens_details.cached_tokens,而不是假设会复用。

逐步发布

先发送少量流量,并比较已接受的答案、延迟、错误以及每个已完成任务的成本。

如何使用 Gemini 3.7 Flash

先在线测试该模型,然后将相同的 ID 接入你的应用。

01

选择一个具有代表性的提示词

使用将在生产环境中运行的同一文档、编码或助手任务。

02

检查质量和使用情况

查看答案、完成原因、推理 tokens、缓存 tokens 以及总 token 数。

03

连接 Chat Completions

按需调用 POST https://aireiter.com/api/v1/chat/completions,使用 model "gemini-3.7-flash" 和 stream=true。

Gemini 3.7 Flash API 问题

面向生产团队的兼容性、缓存、定价和迁移问题。

/ 01

Gemini 3.7 Flash 最适合什么?

适用于响应式助手、文档流水线、聚焦型编码支持以及重复性文本自动化。

/ 02

它与 Gemini 3.6 Flash 有什么不同?

将其视为一条更新的路线,并用你自己的提示集对两者进行比较。不要假设一定会在质量或延迟上普遍提升。

/ 03

我应该使用哪个端点?

使用 POST https://aireiter.com/api/v1/chat/completions,model 为 "gemini-3.7-flash"。

/ 04

如何验证提示缓存?

检查 usage.prompt_tokens_details.cached_tokens。AIReiter 的测试在后续请求中、针对相同且符合条件的前缀观察到了缓存命中。

/ 05

为什么输出使用量会超过可见文本?

提供方可能会在 completion 使用量中包含推理 tokens。请将返回的 usage 对象作为计费的事实来源。