模型正式推出,不代表定價一定同步公開。Gemini 3.8 Live 目前正是這種情況:Google 已於 2026 年 9 月 15 日宣布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,但官方文件至今沒有列出獨立的 3.8 Live 美元費率。因此,規劃語音代理預算時,不能直接套用 Gemini 3.8 Flash 的 $0.75/$3.75 token 費率。
先講結論:Gemini 3.8 Live 已發布,API 價格仍未公開
Google 的發布公告指出,兩款模型自 2026 年 9 月 15 日起,已開始透過 Gemini API 與 Google AI Studio 向開發者逐步推出。這只能確認產品可用,並不代表已有定案的公開價格。公告形容 Gemini 3.8 Live 具成本效益,Extended Thinking 的價格也具競爭力,但沒有提供每分鐘或每個音訊 token 的費率。
| 問題 | 答案 |
|---|---|
| Gemini 3.8 Live 是否已正式發布? | 是,Google 在 2026 年 9 月 15 日公布了此模型。 |
| 開發者現在能存取嗎? | Google 表示,已開始透過 Gemini API 與 AI Studio 逐步推出。 |
| 是否已有官方的 3.8 Live 價目表? | 本指南查閱的 Gemini API 定價頁面中尚未列出。 |
| Gemini 3.8 Flash 的價格就是 Live 的價格嗎? | 不是。gemini-3.8-flash 與 Live 系列是不同的模型識別碼。 |
| 現在能精確算出單次 3.8 Live 呼叫成本嗎? | 不能,除非取得帳戶專屬報價,或等待官方日後新增費率資料。 |
Google 在 2026 年 9 月 15 日推出了哪些模型?
Google 推出兩款即時對話音訊模型,定位各不相同。Gemini 3.8 Live 主打流暢且可擴展的對話;Gemini 3.8 Live Extended Thinking 則著重在維持對話的同時,處理更複雜的多步驟任務。
依發布公告所述,模型支援近乎即時的視覺輸入、在 97 種語言間自動切換,以及在模型回應使用者時仍可持續執行的背景工具或 API 呼叫。Extended Thinking 則被描述為可一邊推理、一邊說話,並在較長任務中提供進度提示。這些能力會影響成本,因為背景工作、工具呼叫與更深入的推理,都可能改變 token 用量。
API 使用者目前有哪些存取途徑?
Google 的推出方式不是所有管道同時全面開放。根據官方公告,開發者可透過以下管道取得模型:
| 平台 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| Gemini API | 自 2026 年 9 月 15 日起開始逐步推出 | 自 2026 年 9 月 15 日起開始逐步推出 |
| Google AI Studio | 自 2026 年 9 月 15 日起開始逐步推出 | 自 2026 年 9 月 15 日起開始逐步推出 |
| Gemini Enterprise | 私人預覽 | 私人預覽 |
這張表反映的是 Google 公布的推出狀態,不代表每個帳戶都會立刻看到相同的模型 ID。實際上仍應以 API 模型清單及專案權限為準。
沒有 3.8 價目表時,Gemini Live API 怎麼計費?
Google 的 Live API 最佳實務文件說明,計費基礎是 token,而不是固定的單次工作階段費用。音訊會換算為音訊 token 用量;文字訊息與生成的逐字稿,也可能另外產生文字 token 用量。對話持續愈久,隨著有效對話上下文累積,成本也可能提高。
編列預算時,幾個關鍵原則如下:
- 已連線分鐘數不是官方計費單位。每分鐘成本只是根據 token 化方式與說話時間推導出的估算值。
- 輸入音訊與輸出音訊要分開計算。模型可以聽 10 分鐘、只說 4 分鐘;這是兩種不同的用量流。
- 別忽略上下文累積。Google 的指引提醒,後續回合可能會將累積的原生音訊上下文納入計費,實際情況取決於上下文處理方式。
- 啟用逐字稿時要另外計入成本。逐字稿除了音訊用量外,還可能增加文字 token 費用。
- 追蹤工具呼叫與推理 token。背景工作可能比單純輪流對話的機器人消耗更多輸出或上下文 token。
因此,「每分鐘半美分」不能取代正式的 3.8 定價。那個數字可能只是在某種 token 化假設下,描述單一音訊方向的成本。
現在可以怎麼做預算估算?
在 Google 公布 Gemini 3.8 Live 費率前,可將已有明確定價的 Live 模型當作規劃基準,但不能把它們視為新模型的報價。官方 Gemini 定價文件目前列出以下參考費率:
| 模型 | 音訊輸入 | 音訊輸出 | 文字輸入 | 文字輸出 |
|---|---|---|---|---|
| Gemini 3.1 Flash Live Preview | 每 100 萬個音訊 token $3.00(約 $0.005/分鐘) | 每 100 萬個音訊 token $12.00(約 $0.018/分鐘) | 每 100 萬個 $0.75 | 每 100 萬個 $4.50 |
| Gemini 2.5 Flash Native Audio | 每 100 萬個音訊 token $3.00 | 每 100 萬個音訊 token $12.00 | 每 100 萬個 $0.50 | 每 100 萬個 $2.00 |
| Gemini 3.5 Live Translate | 每 100 萬個音訊輸入 token $3.50 | 每 100 萬個音訊輸出 token $21.00 | 未列出 | 未列出 |
舉例來說,若以 Gemini 3.1 Flash Live 已公布的估算值試算,假設有 10 分鐘輸入音訊,以及模型說話 4 分鐘:
- 輸入:10 × $0.005 = $0.05
- 輸出:4 × $0.018 = $0.072
- 音訊小計:$0.122
這只是參考試算,不是 Gemini 3.8 Live 報價。其中未包含累積上下文、逐字稿、工具呼叫,以及任何新的 3.8 定價。分鐘換算本身也是估計值,最終預算應以自身帳戶計費回應中的 token 用量為準。
一般版 Gemini 3.8 Flash 不是 Live API 模型
Google 的標準版 gemini-3.8-flash 是支援多模態輸入、輸出為文字的模型。根據官方定價頁面,其優惠費率至 2026 年 12 月 31 日止為:每 100 萬個輸入 token $0.75、每 100 萬個輸出 token $3.75;自 2027 年 1 月 1 日起,排定費率為 $1.50/$7.50。
這些價格適用於標準 Flash 模型,不能自動套用至 gemini-3.8-live 或 gemini-3.8-live-extended-thinking。模型文件將標準 Flash 與 Live 能力分開處理。兩者雖然共用版本號,但 Live 還需要串流音訊輸出、回合偵測、中斷處理及即時工作階段行為。
穩妥的實作方式,是記錄供應商回傳的確切模型 ID。儀表板上只寫「Gemini 3.8」,不足以用來精確歸屬成本。
現在適合用 Gemini 3.8 Live 開發嗎?
如果你想驗證的是互動設計,現在就可以做原型:使用者是否能接受背景工作、口頭進度更新、視覺脈絡理解,以及流程中的中斷?Google 已公布這些互動行為,而 API 與 AI Studio 的逐步推出,也讓開發者有管道測試整合效果。
但若商業模式仰賴固定的每分鐘利潤,建議延後做正式的生產成本承諾。目前仍缺少 3.8 價目表、上下文重複計費的實際影響也未知,加上尚無獨立量測的延遲與失敗資料,變數太多,難以做出可靠的單位經濟預測。
切換流量前,先建立一套成本量測機制:
- 記錄確切的模型 ID 與 API 回應。
- 蒐集輸入音訊分鐘數、輸出音訊分鐘數、文字 token、可取得時的 thoughts token、逐字稿與工具呼叫資料。
- 使用相同任務組合,測試短、中、長三種工作階段。
- 比較每個成功完成任務的成本,而不是每個已連線分鐘數的成本。
- 在 Google 公布 3.8 價目表前,保留一款已有公開定價的 Live 模型作為備援。
Gemini 3.8 Live API 常見問題
Gemini 3.8 Live API 的官方價格是多少?
Google 的發布公告沒有列出美元價格,而本指南查閱的定價文件也未提供獨立的 3.8 Live 價目表。
Gemini 3.8 Live 在 Google AI Studio 中免費嗎?
Google 表示已開始在 AI Studio 推出,但存取權、配額與免費方案條款,和保證的正式 API 生產價格是不同的事。請查看帳戶層級的模型可用性與計費頁面。
Gemini 3.8 Flash 和 Gemini 3.8 Live 一樣嗎?
不一樣。gemini-3.8-flash 是另一款標準模型。其 $0.75/$3.75 的優惠 token 價格,不應被當作 Live 音訊工作階段的價格。
Gemini Live API 是按分鐘收費嗎?
不是作為根本的計費規則。Google 文件說明的是 token 計費;每分鐘數字則是根據音訊 token 費率與假設的說話時長得出的估算。
較長的 Live 對話會隨時間變得更貴嗎?
會。有效對話上下文、音訊 token、逐字稿與工具活動,都可能影響後續回合的用量。應量測具有代表性的完整工作階段,而不是用一次短通話的估算值直接倍乘。
Gemini 3.8 Live 和 Extended Thinking 有何差異?
Google 將 Gemini 3.8 Live 定位為流暢、可擴展的對話與視覺脈絡理解;Extended Thinking 則用於更深入的多步驟推理,同時持續說話並回報進度。
Gemini 3.8 Live 在哪些地方可用?
Google 公告指出,模型正透過 Gemini API 與 AI Studio 逐步推出,企業存取初期則描述為私人預覽。實際可用性可能依帳戶與地區而異。
所以,目前合理且可辯護的預算做法,是根據現行 Live token 費率與實測的工作階段行為建立成本區間,而不是猜測 Gemini 3.8 Live 的每分鐘價格。等 Google 新增該模型的官方費率項目後,再重新計算。