语音代理在实际运行中,往往只有一开始看起来便宜。用户突然停顿、切换话题、等待工具返回,或者让通话持续半小时,都会迅速改变成本结构。Gemini 3.8 Live 和 GPT-Live-1 对这类风险的计量方式完全不同:Gemini 按 Token 计费,并且会受到持久化上下文的影响;GPT-Live-1 则公布了语音层每分钟 $0.05 的简单价格。对生产团队来说,真正该比较的不是哪个数字更低,而是哪种计费方式更符合你的会话形态。
给生产团队的结论
Google 的 Live API 文档在会话恢复示例中使用了模型字符串 gemini-3.8-live。Google 当前的 Live 文档还说明,音频按 Token 计费,后续轮次可能会再次处理已经保留的上下文。OpenAI 的 GPT-Live-1 发布公告则列出了前端语音层每分钟 $0.05 的价格,后端推理和工具另行计费。
实际选择可以这样划分:
| 生产需求 | 更适合的起点 | 原因 |
|---|---|---|
| 需要可预测的语音层预算 | GPT-Live-1 | 按实际会话时长预估,比面对不断增长的音频上下文更简单 |
| 需要精细优化 Token 成本 | Gemini 3.8 Live | 可以调节活跃上下文、压缩策略和模态选择 |
| 需要控制记忆范围的长对话 | Gemini 3.8 Live,但前提是做好工程设计 | 上下文压缩和会话恢复都是 API 设计中的明确组成部分 |
| 希望快速部署电话语音代理 | GPT-Live-1 | OpenAI 将其定位为支持全双工电话通信并可委托后端处理的模型 |
| 通话可能长时间静音 | 没有哪个能在缺少防护措施时直接胜出 | GPT-Live-1 会按会话时长计费;Gemini 仍可能产生上下文和传输成本 |
需要特别注意的是,Google 的 Gemini API 定价页面在本文查阅的资料中,并没有单独列出 Gemini 3.8 Live 的价格。不要把 Gemini 3.1 Flash Live 的费率直接代入 Gemini 3.8 Live 的财务预测。
Gemini 3.8 Live 与 GPT-Live-1:计费单位怎么不同
Gemini 3.8 Live:音频 Token、上下文与压缩
Google 的 Live API 最佳实践指南称,原生音频的累计速度约为每秒音频 25 个 Token。同一份指南还说明,在持久化会话中,已经积累的上下文可能会在后续轮次重新计费。也就是说,随着对话变长,新一轮响应携带的历史输入可能比上一轮更多。
可以先用下面这个粗略模型理解:
Gemini 会话成本
= 当前音频和文本用量
+ 各轮次重复处理的保留上下文
+ 输出音频和思考用量
+ 可选的转录用量
+ 工具和基础设施成本
上下文压缩会改变这条成本曲线。Google 提供了 ContextWindowCompressionConfig,并为长会话记录了滑动窗口策略。在 Google 的示例中,压缩会在达到25,000 个 Token时触发,并保留一个8,000 Token 的滑动窗口。生产环境不应照搬这个设置,而应结合记忆召回效果和工具调用准确率进行测试。
转录还可能带来额外费用。Google 表示,启用 inputAudioTranscription 或 outputAudioTranscription 后,除了原生音频计费,还会产生额外的文本 Token 用量。如果产品需要可检索的通话记录,就应把这部分附加成本纳入每次问题解决的成本模型。
GPT-Live-1:按实际会话时长计费
OpenAI 为 GPT-Live-1 列出的前端语音层价格是每分钟 $0.05,并且按秒计费。简单算下来:
| 会话时长 | GPT-Live-1 语音层成本 |
|---|---|
| 5 分钟 | $0.25 |
| 30 分钟 | $1.50 |
| 1 小时 | $3.00 |
| 连续保持 8 小时开启 | $24.00 |
关键变量是静音。公开的按分钟价格对应的是会话持续时间,而不只是用户实际说话的秒数。一通 30 分钟的电话即使有 10 分钟处于静音,仍然会占用 30 分钟的会话时长。
当然,GPT-Live-1 也不是完整的代理账单。OpenAI 将它描述为语音层,可以把更深层的推理和工具调用委托给后端。因此,后端 Token、工具、电话服务、存储、监控和人工转接都需要单独计算。
长会话成本:四种典型场景
下面的比较只使用已公布的 GPT-Live-1 算术和公式,不会凭空编造 Gemini 3.8 的价格。
1. 五分钟预约电话
在不计后端推理和电话服务的情况下,GPT-Live-1 的语音层成本是$0.25。在 Google 公布或开放适用于确切模型 ID 的费率之前,无法对 Gemini 3.8 Live 做出可靠定价。
对于 Gemini,应从真实会话中记录音频输入秒数、音频输出秒数、保留上下文 Token、转录 Token 和工具调用次数。短通话确实可能让 Token 计费显得更有吸引力,但前提是提示词和上下文都受到控制。
2. 三十分钟客服通话
GPT-Live-1 的语音层成本是$1.50。这个数字很容易纳入预算,但它无法告诉你这通电话是否真正解决了问题。
Gemini 的成本取决于保留了多少音频,以及会话产生了多少轮交互。两通同样 30 分钟的电话,Token 用量可能相差很大:一通可能几乎全程持续说话,另一通则可能包含长时间停顿、反复解释,或多模态输入。
3. 静音等待或工具延迟
只要会话仍保持开启,GPT-Live-1 就会继续计费。运营层面的控制手段,是设置严格的静音超时,或者明确切换到等待/转接状态。
Gemini 也不是“静音就免费”。连接本身、工具编排、上下文策略,以及之后发生的新一轮交互,都应纳入成本模型。静音是产品状态管理问题,而不只是供应商定价问题。
4. 全天候监听会话
按 GPT-Live-1 已公布的语音层费率,连续开启 8 小时的成本是$24。这样的会话如果同时运行 10 个,每天就是$240,还不包括后端模型和其他基础设施。
如果应用避免发送不必要的音频,并对历史记录进行压缩,Gemini 的 Token 模型在交互稀疏时可能更高效。但如果应用保留原始对话上下文,并允许对话无限循环,成本就可能更难预测。全天候运行的设计必须经过压力测试,不能拿五分钟 Demo 的结果直接外推。
会改变成本表的生产约束
上下文与连接生命周期
Google 的会话管理文档记录了以下限制:未压缩的纯音频会话为15 分钟,音视频会话为2 分钟。同一份文档还说明,单个 WebSocket 连接的持续时间约为10 分钟,这与逻辑会话的生命周期是两回事。生产客户端需要同时实现上下文压缩和会话恢复。
Google 的会话恢复句柄在上一次会话终止后的两小时内仍然有效。服务器还会在连接关闭前发送 GoAway。如果忽略这些事件,长通话可能变成断线、重复执行工具操作,或者丢失用户状态。
并发是另一笔成本
分钟价格只能回答“一个开启中的会话要多少钱”,无法回答“我能同时运行多少个会话”。GPT-Live-1 文档以并发会话数描述容量,据其披露,可用层级从Tier 1 的 25 个会话到 Tier 5 的 500 个会话不等。即使月度预算没有超标,突然出现的来电高峰也可能撞上并发上限。上线前应查看 OpenAI 的 GPT-Live-1 模型参考,确认当前账户的并发额度。
对于 Gemini,则应记录并发 WebSocket 数、重连率、压缩事件和配额错误。Token 吞吐量与同时运行的会话数,是两类不同的瓶颈。
电话接入与音频桥接
无论选择哪个模型,电话语音代理都会产生额外成本。Gemini 的电话集成指南使用了 Twilio Media Streams 这样的桥接方案,并介绍了 Twilio 的8 kHz μ-law音频、Gemini 的16 kHz PCM输入,以及 Gemini 的24 kHz PCM输出之间的转换。这条中间链路会增加运营商、传输、计算和运维工作。
GPT-Live-1 的全双工定位可能减少自定义打断编排的工作,但并不会消除运营商费用或后端处理。比较时要看完整的通话成本,而不是只看推理成本。
“我为营销线索收集上线了一个 Gemini Live 语音代理,但它在预约过程中总是卡住。”——@ramanpal,报告了 Gemini 3.8 Live Extended Thinking 中与
turnComplete处理有关的问题(X)。
这只是某位开发者早期部署时的个案反馈,并不是经过测量的故障率。不过,它提醒了我们:协议语义带来的问题,成本可能远高于 Token 价格上的小幅差异。
我的选型规则
如果语音层是主要的不确定因素,而财务团队需要一个清晰、按时长估算的预算,就选GPT-Live-1。同时要为静音时长、最长通话时间、并发数和后端推理设置硬限制。$0.05 只是语音层的基准价格,不是每通电话的总成本。
如果团队能够完整监控 Token 用量,并且需要上下文压缩、多模态能力或 Token 级控制,可以选Gemini 3.8 Live。建议从边界清晰的工作流开始,而不是直接构建一个无限开放的通用助手。衡量指标应是每次成功完成任务的成本,而不是每分钟成本:
每次成功解决问题的成本
= 模型 + 工具 + 电话服务 + 基础设施总成本
/ 有效完成的问题数
在最终决定之前,让两套系统处理相同的通话组合,并记录时长中位数和 p95、音频秒数、保留上下文 Token、转录用量、工具重试次数、转接率、重连次数和问题解决率。真正的赢家,是在通话不断变长时,仍能让这些指标保持稳定的系统。
常见问题
Gemini 3.8 Live 正式可用吗?
Google 当前的会话管理文档在会话恢复示例中使用了 gemini-3.8-live。在投入生产之前,请在你的 Google 项目中确认访问权限、所在区域、配额以及准确的价格条目。
GPT-Live-1 会对静音计费吗?
它公布的是前端语音会话时长的按分钟价格,并按秒计费。除非你的账户合同另有说明,否则应按包含静音在内的整个会话时长计费来做规划。
GPT-Live-1 每分钟 $0.05 是整通电话的总成本吗?
不是。OpenAI 将这笔费用描述为前端语音层价格。后端推理、工具、电话服务、存储、监控和人工升级处理,都会产生额外成本。
Gemini 的上下文压缩能让长会话完全免费吗?
不能。压缩是上下文管理机制,不是零成本模式。它可以限制保留的历史记录,并帮助避免时长限制,但实时音频、输出、工具和基础设施仍然需要计费,或至少会带来相关的运营成本。
长时间语音会话用哪个模型更便宜?
在适用于 Gemini 3.8 Live 的费率和你的流量形态都明确之前,没有可靠的统一答案。GPT-Live-1 更容易预测;Gemini 则可能通过精细管理上下文和输入获得更好的成本表现。最终应以成功完成任务为标准,对两者进行实际测量。
生产级语音代理的价格,从来不是由第一次愉快的对话决定的,而是由长尾情况决定:静音、重试、上下文增长、重连,以及最终仍然需要人工介入的通话。在选择模型之前,先把成本计量能力设计进架构里。