AIREITER

GLM-5.3-Flash API 定價:費率、快取與自架成本

最近更新: 2026-08-28 04:12:05

GLM-5.3-Flash 的輸入費率每百萬 Token 只要 $0.15,但這還不是完整成本。快取命中率、輸出 Token 數量、強制啟用的推理機制,以及約 320B 參數的模型權重規模,才是決定該用 API 還是自架開放權重版本的關鍵。

目前正式生效的 GLM-5.3-Flash 價格

Z.AI 官方定價頁面列出,GLM-5.3-Flash 每 100 萬個新輸入 Token 收費 $0.15、快取輸入 Token 為 $0.03、輸出 Token 為 $0.50。官方目前另提供限時 5 折優惠,截止時間是 2026 年 9 月 9 日 24:00,時區為 UTC+8(新加坡時間)。

GLM-5.3-Flash 計費項目牌價/100 萬 Token優惠價/100 萬 Token
新輸入$0.15$0.075
快取輸入$0.03$0.015
輸出$0.50$0.25
快取輸入儲存限時免費限時免費
GLM-5.3-Flash API 輸入、快取輸入與輸出 Token 的價格比較

這 5 折應視為短期促銷,而不是正式上線服務的長期預算基準。Z.AI 的發布公告也指出,ox-alpha是先前的預覽版名稱。

同一份官方價目表中,標準版 GLM-5.3 的新輸入、快取輸入及輸出,每 100 萬 Token 分別為 $1.40、$0.26 與 $4.40。以牌價來看,Flash 的輸入與輸出成本都約低 89%。不過,這只是價格比較,不代表兩個模型在品質、延遲或實際運作特性上完全相同。

你買到的是 API 服務,不是一個縮小版的本機模型

GLM-5.3-Flash 是採 MIT 授權的開放權重多模態模型,總參數量為 320B,每個 Token 實際啟用 18B 參數。官方 Hugging Face 模型卡提供公開的 zai-org/GLM-5.3-Flash checkpoint,以及本機部署方式;Z.AI 的發布資料則描述它支援 100 萬 Token 上下文,以及文字、圖片與影片輸入。

所謂「18B active」指的是每次推理時被選中的專家計算量,並不是模型的總記憶體需求。完整權重、KV cache、執行期額外開銷、多模態處理與上下文長度,仍會左右本機部署是否可行。

取得方式提供內容主要限制
Z.AI API依新輸入、快取輸入與輸出 Token 計費的託管推理服務帳戶限制與推理延遲
官方 checkpoint可用於自架或微調的 MIT 授權權重依精度與量化方式而定的高記憶體基礎設施需求
社群量化版本可供部分本機執行環境使用的較小模型檔建置品質、多模態支援、速度與相容性各有差異

低 Token 單價與低自架成本是兩件不同的事。流量忽高忽低時,API 是隨實際請求計費;自行架設則即使在閒置期間,也得預留推理容量。

實際工作負載怎麼算 API 費用

GLM-5.3-Flash 的成本取決於新輸入、被辨識為快取的輸入,以及模型產生的輸出,各自所占比例:

cost = (new_input_tokens / 1,000,000 × input_rate)
     + (cached_input_tokens / 1,000,000 × cached_rate)
     + (output_tokens / 1,000,000 × output_rate)

以牌價計算,1,000 萬個新輸入 Token 加上 200 萬個輸出 Token,總成本為 $2.50:輸入 $1.50、輸出 $1.00。促銷期間,同樣用量則為 $1.25。

工作負載牌價計算方式牌價總額促銷總額
1,000 萬新輸入 + 200 萬輸出$1.50 + $1.00$2.50$1.25
200 萬新輸入 + 800 萬快取輸入 + 200 萬輸出$0.30 + $0.24 + $1.00$1.54$0.77
10 萬新輸入 + 1 萬輸出$0.015 + $0.005$0.020$0.010

Artificial Analysis顯示的每百萬 Token $0.10 混合費率,採用的是快取命中、輸入、輸出比為 7:2:1 的既定組合。這個數字適合拿來比較相同類型的工作負載,並不是 GLM-5.3-Flash 的通用費率。

要享有快取折扣,前提是請求確實命中快取。Z.AI 的Chat Completion 回應結構提供 usage.prompt_tokens_details.cached_tokens 欄位;因此生產環境的成本紀錄應保存這個欄位,而不是看到提示詞相似就假設一定有折扣。r/opencodeCLI 上有使用者這樣形容上市初期的經濟性:

「9 月 9 日前有 5 折優惠,而且它的上下文消耗比 dsv4f 好很多……」— u/CriteriumA,Reddit 討論串

折扣日期由 Z.AI 價目表確認;至於模型比較與使用感受,則是該留言者的個人觀點。穩定且重複的上下文有助於提高快取重用率,但輸出、重試、工具呼叫與帳戶限制等成本並不會因此消失。

一份簡潔的成本預估表

預算最好分成四項:新輸入、快取輸入、輸出與付費工具。Z.AI 將 Web Search 定價為每次 $0.01,因此代理程式頻繁搜尋時,實際花費可能超過只計 Token 的估算。

每月用量假設牌價計算公式每月成本
1 億新輸入 + 2,000 萬輸出100 × $0.15 + 20 × $0.50$25.00
2,000 萬新輸入 + 8,000 萬快取輸入 + 2,000 萬輸出20 × $0.15 + 80 × $0.03 + 20 × $0.50$23.40
100 次 Web Search 呼叫100 × $0.01$1.00

這些只是算術範例,不是用量配額。重試請求與中途放棄的代理任務,應另外納入預算。若輸出量很高,設定合理的 max_tokens,並在適用情況下改用較低的 reasoning_effort,往往比微調一小段提示詞前綴更有影響。

遷移前先確認 Z.AI API 的限制

Z.AI API 的通用 Base URL 是 https://api.z.ai/api/paas/v4/,Chat Completions 端點為 https://api.z.ai/api/paas/v4/chat/completions。驗證方式採用 Bearer API key。Z.AI 在其API 介紹文件中,說明可透過自訂 Base URL 使用與 OpenAI 相容的 Python、Node.js 和 Java 客戶端模式。

目前的Chat Completion 參考文件在 thinking 與 reasoning 說明中提到 GLM-5.3-FLASH,但頁面渲染出的 model enum 並未顯示 glm-5.3-flash;官方定價頁與發布資料則有列出 Flash SKU。正式切換生產流量前,建議先用小型請求測試精確的託管模型 ID。

串接細節已確認的限制
建議測試的託管模型 IDglm-5.3-flash;請依即時帳戶 schema 確認是否接受
託管端點https://api.z.ai/api/paas/v4/chat/completions
驗證方式Authorization: Bearer YOUR_API_KEY
ThinkingGLM-5.3-FLASH 會啟用 thinking;深度由 reasoning_effort 控制
Reasoning effortlow、high 或 max
max_tokens 上限目前參數文件列為 131,072
Coding Plan採用獨立的金鑰、端點與額度系統;不是通用 API 餘額。請參閱 Z.AI 的 Coding Plan 快速入門

Z.AI 將 max 設為預設推理強度。不同強度不會改變 Token 單價,但推理可能增加輸出用量與等待時間。至於帳戶限制,Z.AI 引導使用者查看帳戶專屬的速率限制儀表板;公開指引未提供適用於所有 API 帳戶的統一數值上限。

開放權重自架與託管 API,該怎麼選

官方模型卡提供 Transformers、vLLM、SGLang、TokenSpeed 與 KTransformers 的本機部署範例,但這些範例不代表一般消費級 GPU 就能實際部署。

若流量不固定,或手邊沒有高記憶體推理硬體,託管 API 通常更合適。當使用率長期穩定,或資料處理控制權的價值足以抵銷營運成本時,才可考慮分散式或本機部署。降精度的純文字版本,也未必能重現官方多模態配置。

什麼情況下值得考慮自行架設

GetDeploying 的估算指出,4-bit 部署約需 192 GB GPU 記憶體、8-bit 約需 384 GB,BF16 則為 768 GB。其估計一組 MI300X 配置每小時 $2.90,持續運行一個月約為 $2,088;在輸入與輸出比為 5:1 的條件下,API 與自架成本約在每小時 1,400 萬 Token 時打平。

這些是第三方估計,不是 Z.AI 對硬體需求的保證。192 GB 的 4-bit 配置被標記為緊繃;KV cache、執行期開銷、多模態處理、批次處理與閒置時間,都可能改變損益平衡點。做選擇前,應比較每小時基礎設施成本、使用率、每小時有效 Token 處理量、快取命中率,以及每個完成任務的成本。

GLM-5.3-Flash 與 GLM-5.3:選擇的分界點

Flash 與標準 GLM-5.3 的費率表與部署定位並不相同。

比較問題GLM-5.3-FlashGLM-5.3
牌價輸入費率$0.15 / 1M$1.40 / 1M
牌價快取輸入費率$0.03 / 1M$0.26 / 1M
牌價輸出費率$0.50 / 1M$4.40 / 1M
限時優惠2026 年 9 月 9 日 UTC+8 前享 5 折未顯示對應的 Flash 優惠
開放權重 checkpoint列有官方 MIT checkpoint另有獨立模型頁面;不可推論權重相同
多模態定位原生多模態;Z.AI 說明支援圖片/影片輸入標準 GLM-5.3 的支援範圍應個別確認
本機部署需要大型 checkpoint 與高記憶體推理環境應參考其專屬模型與部署文件

如果重視 Token 成本、多模態輸入,或需要開放權重方案,而應用程式能接受強制推理與供應商限制,應先從 Flash 開始評估。只有在實測確認標準 GLM-5.3 額外的費率確實換來應用所需的能力或可靠性差異時,才適合選擇標準版。

常見問題

GLM-5.3-Flash API 目前怎麼計價?

官方牌價為每 100 萬 Token:輸入 $0.15、快取輸入 $0.03、輸出 $0.50;上方費率表也列出限時 5 折後的價格。

快取輸入一定適用 $0.03 費率嗎?

是,但前提是 Z.AI 將這些 Token 辨識為快取輸入。快取輸入儲存另列為限時免費,因此儲存狀態與快取命中的計費不能混為一談。

GLM-5.3-Flash 是開源模型嗎?

更精確的說法是:它是採 MIT 授權的開放權重 checkpoint。此授權允許廣泛使用,但這個總參數量 320B 的模型仍需要大量記憶體、相容的軟體與推理容量。

一般筆電能跑 GLM-5.3-Flash 嗎?

若要以完整精度實際部署,並不現實。即使第三方對 4-bit 的估算也約需 192 GB GPU 記憶體,而每 Token 僅啟用 18B 參數,並不會消除完整 checkpoint 的儲存與執行成本。

GLM-5.3-Flash 比 GLM-5.3 快嗎?

「Flash」反映的是成本與活躍計算量的定位,並非通用的延遲保證。Artificial Analysis在其測試環境中,測得透過 Z.AI 的輸出速度為每秒 48.7 個 Token,第一個回答 Token 的時間為 42.57 秒;推理時間與工作負載型態都可能主導實際體感回應速度。

Coding Plan 提供相同的 API 餘額嗎?

不提供。Z.AI 的 Coding Plan 快速入門說明,Coding Plan 使用獨立金鑰、獨立端點,且僅限官方支援的工具與產品使用。Coding Plan 訂閱不應直接換算成公開 API 的每 Token 美元預算。

如果流量不固定、硬體也不是既有成本,API 是風險較低的選擇;本機部署則是另一種經濟決策,取決於長期使用率、記憶體條件與資料控制需求。