一篇发布公告,可能会让模型看起来已经可以使用,但开发者实际上还无法调用它。就 GPT-Live-1 而言,OpenAI 的公开 API 登记页面目前仍要求开发者留下信息,以便模型可用时接收通知;相比之下,文档完善的 Realtime API 已经公布了费率。这个区别非常关键:在 OpenAI 发布模型 ID、接口端点、文档和价目表之前,不要把 GPT-Live-1 写进生产预算,也不要据此开发集成。
一分钟看懂结论
根据我能核实到的 OpenAI 公开材料,GPT-Live-1尚未被公开记录为面向所有开发者开放的 API。OpenAI 的 GPT-Live-1 API 页面本质上是一个通知登记表,而不是 API 参考文档:其中没有接口端点、模型 ID、价格、使用限制或发布日期。
这并不能证明不存在私下开放的访问权限,但至少意味着,普通开发者不能把社交媒体上的公告,或 ChatGPT 中的语音体验,直接当成可调用的 API 合同。
如果现在要上线生产级语音应用,可以这样选择:
| 需求 | 实际选择 |
|---|---|
| 现在就上线有完整文档的实时语音 API | GPT-Realtime-2.1 |
| 降低音频和文本 token 成本 | GPT-Realtime-2.1 mini |
| 为未来切换模型做原型 | 把模型 ID 和价格放进配置中 |
| 必须使用 GPT-Live-1 | 加入通知名单;不要承诺发布日期 |
GPT-Live-1 的 API 价格尚未公开
OpenAI 已核实的登记页面写着:“Sign up to get notified when GPT‑Live‑1 is available in the API.” 页面没有列出按分钟计费的价格、音频 token 价格、文本 token 价格、最低收费或使用上限。因此,诚实的 GPT-Live-1 API 价格答案是未知,既不是每分钟 $0.05,也不是从其他实时模型照搬过来的任何估算值。
ChatGPT 订阅是另一套产品和计费体系。Plus 或 Pro 订阅可能包含面向消费者的语音功能,但不会自动提供 API 额度。开发者应将订阅账单和 API 账单分开做预算。
现在可以买什么、做什么
OpenAI 的 GPT-Realtime 模型页面公布了基于 token 的费率。下面列出的是研究材料中当前 Realtime 系列的价格;正式部署前请再次查看官方页面,因为费率可能发生变化。
| 模型 | 文本输入 / 缓存 | 文本输出 | 音频输入 / 缓存 | 音频输出 | 上下文 / 最大输出 |
|---|---|---|---|---|---|
| GPT-Realtime-2.1 | $4 / $0.40 per 1M | $24 per 1M | $32 / $0.40 per 1M | $64 per 1M | 128k / 32k |
| GPT-Realtime-2.1 mini | $0.60 / $0.06 per 1M | $2.40 per 1M | $10 / $0.30 per 1M | $20 per 1M | 128k / 32k |
研究到的 API 状态材料显示,这两个模型都支持文本、音频和图像输入,并可输出文本和音频;文档没有将视频列为支持类型。涉及复杂推理或工具调用时,标准版是更稳妥的选择。如果更看重延迟和价格,而不是最大能力,Mini 则更适合优先控制成本的场景。
计费时最容易忽略的一点,是输入和输出分开计算。一次五分钟的通话,并不等于用户音频五分钟加助手音频五分钟。实际预算应分别统计双方真正说了多少内容。
让预算经得起模型切换
在 GPT-Live-1 公布正式价目表之前,不要猜一个混合单价,而应采用场景化模型:
monthly exposure = sessions
× measured billable usage per session
× provider rate
× retry and tool-call factors
每次试点都应记录以下字段:
- 分别记录用户说话秒数和助手说话秒数。
- 文本输入 token、缓存输入 token 和文本输出 token。
- 对话轮次、工具调用、失败的工具调用、重试和重连。
- 会话时长、静音时段、主动放弃的会话以及峰值并发量。
- 兜底流量,例如纯文本模式或较小模型产生的请求。
例如,规划表可以先按输入 500 分钟、输出 500 分钟进行估算,但必须明确标注任何“音频 token 换算成分钟”的数值只是前提假设。精确预算应以 API 返回的使用记录为准,而不是依赖计算器提供的通用分钟换算。
在开放试点前,先设置单次会话上限、工具调用上限、支出告警和紧急关闭开关。语音代理可能在网络中断后自动重连,在没有完成客户任务的情况下继续产生用量,因此“合理使用”之类的表述不能替代财务控制。
GPT-Live-1 API 常见问题
填写通知登记表就能获得 GPT-Live-1 API 访问权限吗?
不能。这个公开表单用于收集联系方式和业务信息,方便 OpenAI 在模型开放时通知感兴趣的开发者。它不会提供 API key、模型 ID、接口端点或价格合同,也不保证一定获得测试资格。
ChatGPT Plus 或 Pro 能支付 API 用量吗?
不能。ChatGPT 订阅和 API 用量分开计费。ChatGPT 产品应选择面向消费者的订阅方案;开发者 API 调用则应依据 API 价目表单独做预算。
GPT-Live-Transcribe 和 GPT-Live-1 是同一个东西吗?
不是。转录模型负责把语音转换成文字,而 GPT-Live-1 指的是对话式语音体验。不能拿转录按分钟的价格,去估算一个能够持续听取、推理、说话并可能调用工具的全双工代理。
团队应该继续等待,还是现在使用 Realtime?
如果是生产环境,现在就使用 GPT-Realtime-2.1 或其 mini 版本。如果 GPT-Live-1 的交互方式对产品战略至关重要,可以通过适配器隔离模型配置。这样未来迁移时只需修改配置,不必重写整个应用。
“在 ChatGPT 的工作窗口里直接口述同一条提示词,效果好得多。”——@pranavkrn,描述他在语音工具调用中观察到的一个限制;原帖。这只是针对 ChatGPT 使用体验的用户反馈,不能作为未公开 API 存在的证据。
实际该怎么选
最稳妥的做法,是基于已有文档的 Realtime 模型上线,记录所有影响成本的用量类别,同时把 GPT-Live-1 保留为可替换的配置目标。只有当 GPT-Live-1 特有的全双工行为是产品硬性要求时,等待才有充分理由。除此之外,在价格和接口端点都尚未公开的情况下贸然投入,只会增加交付延期和利润失控的风险。