一篇發布文章,可能會讓模型看起來已經開放;但對開發者來說,真正能否呼叫又是另一回事。以 GPT-Live-1 為例,OpenAI 的公開 API 登記頁面目前仍要求開發者留下資料,等候模型開放通知;另一方面,官方文件已經公布 Realtime API 的費率。這個差異非常關鍵:在 OpenAI 公布 model ID、端點、文件與價目表之前,不要把 GPT-Live-1 編進正式環境的預算或整合計畫。
一分鐘看懂該怎麼選
根據我能驗證的 OpenAI 公開資料,GPT-Live-1 尚未被公開文件列為普遍開放使用的 API。OpenAI 的 GPT-Live-1 API page 本質上是通知登記表,不是 API 參考文件:裡面沒有端點、model ID、定價、使用限制或發布日期。
這不代表一定不存在私人或受邀存取,但公開開發者不能只憑社群公告或 ChatGPT 的語音體驗,就把它當成可直接呼叫的 API 合約。
如果今天要推出正式的語音應用程式:
| 需求 | 實際選擇 |
|---|---|
| 現在就上線有完整文件的即時語音 API | GPT-Realtime-2.1 |
| 降低音訊與文字 token 成本 | GPT-Realtime-2.1 mini |
| 預留未來切換模型的彈性 | 把 model ID 與定價放進設定檔 |
| 指定必須使用 GPT-Live-1 | 加入通知名單;不要承諾發布日期 |
GPT-Live-1 的 API 定價目前尚未公開
OpenAI 已驗證的登記頁面寫著:「Sign up to get notified when GPT‑Live‑1 is available in the API.」但頁面沒有列出每分鐘價格、音訊 token 價格、文字 token 價格、最低收費或使用上限。因此,誠實的 GPT-Live-1 API 價格答案是未知;不是每分鐘 $0.05,也不能拿其他即時模型的估算值來代替。
ChatGPT 訂閱是另一套產品與計費體系。Plus 或 Pro 訂閱可能包含消費者版語音功能,但不會自動提供 API 額度。開發者應把訂閱帳單與 API 帳單分開編列預算。
現在可以購買、也可以動手打造的方案
OpenAI 的官方 GPT-Realtime model page 已公布以 token 計算的費率。以下數字來自研究資料中目前 Realtime 系列的費率;正式部署前,仍應再次查看官方頁面,因為價格可能調整。
| 模型 | 文字輸入/快取 | 文字輸出 | 音訊輸入/快取 | 音訊輸出 | 上下文/最大輸出 |
|---|---|---|---|---|---|
| GPT-Realtime-2.1 | $4 / $0.40 per 1M | $24 per 1M | $32 / $0.40 per 1M | $64 per 1M | 128k / 32k |
| GPT-Realtime-2.1 mini | $0.60 / $0.06 per 1M | $2.40 per 1M | $10 / $0.30 per 1M | $20 per 1M | 128k / 32k |
研究資料中的 API 狀態說明指出,這兩個模型都能接收文字、音訊與圖片輸入,並輸出文字與音訊;目前沒有列出支援影片。若應用需要較複雜的推理或工具呼叫,標準版是更穩妥的選擇;如果優先考量延遲與價格,而不是最大能力,Mini 則更適合。
計費上最需要注意的是,輸入與輸出會分開計算。五分鐘的通話,不代表一定是使用者說五分鐘、助理也說五分鐘。實際上要分別量測雙方各自說了多少。
打造能承受模型更換的預算
在 GPT-Live-1 公布正式價目表之前,不要猜一個混合單價;改用情境模型估算:
monthly exposure = sessions
× measured billable usage per session
× provider rate
× retry and tool-call factors
每次試點都應記錄以下欄位:
- 分開記錄使用者與助理的語音秒數。
- 文字輸入、快取輸入與文字輸出 token。
- 對話輪次、工具呼叫、失敗的工具呼叫、重試與重新連線。
- 工作階段長度、靜音時間、中途放棄的工作階段,以及尖峰並發量。
- 備援流量,例如純文字模式或較小型的模型。
例如,規劃表可以先用 500 分鐘輸入與 500 分鐘輸出作為情境,但任何「每分鐘音訊轉 token」的換算,都必須清楚標註為假設值。精確預算應以 API 回傳的實際用量紀錄為準,而不是計算器提供的通用分鐘換算。
在開放試點前,先設定單一工作階段的硬性上限、工具呼叫上限、支出警示與緊急關閉開關。語音代理可能在網路中斷後重新連線,持續產生用量,卻沒有完成客戶任務;因此,「合理使用」之類的文字不是財務控管機制。
GPT-Live-1 API 常見問題
填寫通知表單就能取得 GPT-Live-1 API 存取權嗎?
不能。公開表單只是收集聯絡與商務資料,讓 OpenAI 能通知有興趣的開發者。表單不會提供 API key、model ID、端點或定價合約,也不保證一定能加入測試計畫。
ChatGPT Plus 或 Pro 可以支付 API 用量嗎?
不能。ChatGPT 訂閱與 API 用量分開計費。ChatGPT 產品請選擇消費者方案;開發者 API 呼叫則應依 API 價目表編列預算。
GPT-Live-Transcribe 和 GPT-Live-1 是同一個東西嗎?
不是。轉錄模型的工作是把語音轉成文字;GPT-Live-1 指的是對話式語音體驗。不能拿轉錄服務的每分鐘價格,當成一個能聆聽、推理、說話,還可能呼叫工具的全雙工代理成本。
團隊應該等待,還是現在就使用 Realtime?
如果要現在投入正式環境,使用 GPT-Realtime-2.1 或其 mini 版本。如果 GPT-Live-1 的互動模式對產品策略非常重要,請把模型設定隔離在 adapter 後方,讓未來遷移時只需修改設定,而不用重寫整個應用程式。
「在 ChatGPT 的工作視窗裡直接口述同一段提示詞,效果好得多。」——@pranavkrn,描述他觀察到的語音工具呼叫限制;原始貼文。這是針對 ChatGPT 使用體驗的個人回報,不能當成未公開 API 的證據。
實際上該怎麼決定
最乾淨的做法,是先採用已有完整文件的 Realtime 模型上線,記錄所有會影響成本的用量類別,同時把 GPT-Live-1 留作可替換的設定目標。只有在產品硬性要求 GPT-Live-1 特有的全雙工行為時,等待才有合理性。除此之外,在端點與價格都尚未公開的情況下押注,只會平白增加交付與毛利風險。