Claude Haiku 5.5 看起來是款低成本模型,但只要單次請求的輸入超過 100,000 個 Token,計價方式就會完全不同。在這條門檻以下,Anthropic 的輸入價格是每百萬 Token $0.10、輸出價格是 $0.50;一旦超過門檻,同一請求的價格就變成 $0.50 與 $2.50。輸入成本整整增加 5 倍,這才是替正式環境編列預算時真正該盯緊的數字,而不是發布時的宣傳說法。
Claude Haiku 5.5 API 定價快速看
直接 API 的價目表會依輸入提示詞大小區分級距,以下皆為每百萬 Token 的美元價格。表格資料整理自 Anthropic 的 Claude platform pricing 與 Haiku 5.5 launch announcement;透過第三方市場使用時,費率可能不同。
真正影響價格的,是 10 萬 Token 門檻
這個門檻看的是單次請求的輸入提示詞長度,不是只要模型支援大型上下文視窗,就會一律加收費用。輸入 90,000 個 Token、輸出 2,000 個 Token 的請求,仍然適用較低級距;輸入 120,000 個 Token 的請求,則會套用長提示詞級距所列的較高輸入與輸出費率。
以輸入 10,000 個 Token、輸出 500 個 Token 的簡單請求為例,較低級距的計算方式如下:
(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035
如果這類請求執行 10,000 次,在不計工具、平台或重試成本的情況下,費用是 $3.50。為了展示級距切換後的差異,輸入 120,000 個 Token、輸出 500 個 Token 的請求,費用如下:
(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125
同樣執行 10,000 次,費用會來到 $612.50。計算時要把實際送進 API 的完整輸入算進去,而不只是使用者看得到的問題文字。
Anthropic 在官方 Reddit 公告中表示,Token 數不超過 100K 的請求,價格約比 Haiku 4.5 低 90%;超過 100K 的請求,則約便宜 50%。不過,這些數字應視為發布時的相對比較,而不是每種工作負載都能達到的保證折扣。重試次數、輸出長度、Tokenizer 行為與快取未命中,都可能改變最後帳單。
快取與 Batch 會改變實際單價
如果應用程式會反覆送出相同指令或知識包,提示詞快取就特別有價值。Claude Haiku 5.5 的五分鐘快取寫入價格,是標準輸入費率的 1.25 倍;讀取快取則只收標準輸入價格的十分之一。較高的提示詞級距同樣維持這個比例。
| 操作 | 不超過 100K | 超過 100K |
|---|---|---|
| 寫入五分鐘快取的前 1M Token | $0.125 | $0.625 |
| 每讀取 1M 個快取 Token | $0.01 | $0.05 |
| Batch 中每 1M 個輸入 Token | $0.05 | $0.25 |
| Batch 中每 1M 個輸出 Token | $0.25 | $1.25 |
五分鐘快取通常讀取約兩次就能回本,因為寫入時多出的成本很快便能攤平。舉例來說,寫入一段 1M Token 的前綴需要 $0.125,之後每次讀取只要 $0.01;如果不使用快取,讀取兩次的成本則是 $0.20,以上都還未計入輸出費用。一小時快取的價格是基本輸入費率的兩倍,因此需要更多次重複讀取才能回本。實際結果仍取決於快取鍵是否維持不變,以及請求是否一直落在同一個定價級距。
Batch API 會把非同步工作的輸入與輸出費率砍半,適合夜間資料豐富化、批次分類、歷史資料回補與評測等任務。但它不能取代同步聊天,因為交換條件就是延遲。如果你的路由同時支援兩者,可以把 Batch 與快取搭配使用;最後仍應檢查 usage 欄位,不要想當然地認為每個請求都成功命中快取。
營運上最值得記錄的訊號是 cache_read_input_tokens,這個欄位列在 Anthropic 的 Messages API usage schema 文件中。如果第一次請求之後,這個數值始終是零,就該檢查提示詞順序、時間戳記、工具序列化方式與 cache-control 的放置位置。名目費率較低的模型,如果快取長期處於冷啟動狀態,實際成本可能反而高於費率較高、但快取運作正常的路由。
Haiku 5.5 與舊版 Haiku、Sonnet 怎麼選
以下比較採用 Haiku 5.5 推出前已公布的直接 API 費率。列出 Haiku 4.5 是為了提供基準,並不代表所有供應商的價格都完全相同。
| 模型 | 輸入/每 MTok | 輸出/每 MTok | 預算上的最佳解讀 |
|---|---|---|---|
| Claude Haiku 5.5,<=100K | $0.10 | $0.50 | 高流量、短輸出工作 |
| Claude Haiku 5.5,>100K | $0.50 | $2.50 | 品質足以合理化較高級距的長提示詞工作 |
| Claude Haiku 4.5 | $1.00 | $5.00 | 需要既有整合與明確基準的工作 |
| Claude Sonnet 5.5 | $2.00 | $10.00 | 要求更高的正式生產任務 |
Haiku 5.5 很適合優先拿來測試標題生成、分類、資訊擷取、路由、短摘要,以及其他高吞吐量的工作執行請求。Reddit 上有使用者將 Haiku 類模型形容為適合「高流量、低複雜度的工作」,例如替對話建立標題,或從文字中擷取軟體名稱(u/jam_pod_)。這種定位,比把它當成每個 Agent 步驟都能直接取代更強模型的方案,要合理得多。
不要只看每個 Token 的價格做決定。如果 Haiku 有一半請求都需要重試一次,而 Sonnet 第一次就能產出可接受結果,原本二比一的名目價格差距很快就會被吃掉。正式切換流量前,應先用具代表性的樣本,實測計費輸入、計費輸出、重試次數,以及每個成功結果的成本。
正式環境的成本判斷原則
決定採用 Haiku 5.5 前,可以依照以下順序檢查:
- 透過 Anthropic 的 token-counting documentation 讓實際提示詞跑過 Token 計算,並把工具、檢索文件與對話歷史一併納入。
- 將流量拆成輸入
<=100K與>100K兩組,不要把不同級距平均在一起計算。 - 另外估算輸出成本。輸入很短、但生成答案很長的請求,成本主要會由輸出主導。
- 把穩定不變的前綴交給快取控制,並在快取讀取量降為零時發出警示。
- 能等待的工作交給 Batch API,互動式請求則保留同步路由。
- 比較 Haiku 5.5 與 Sonnet 5.5 時,應看每個成功結果的成本,而不是每百萬 Token 的價格。
這套方法也能處理發布初期資料最大的未知數:官方定價與可用性已經明確,但獨立的延遲、失敗率與長上下文品質測試仍未建立。Reddit 討論中也有人直接提出同一個尚未解決的問題:「『提示詞不超過 100k』到底是什麼意思?」(u/ShadowBannedAugustus)。對正式環境團隊來說,這個問題應該透過計費測試驗證,而不是靠猜。
Claude Haiku 5.5 API 常見問題
Claude Haiku 5.5 API 的模型 ID 是什麼?
目前可使用 claude-haiku-5-5 這個別名,Anthropic 的 Claude Code release notes 已列出此名稱。如果需要可重現的路由,請再到 API model documentation 確認快照 ID。
Haiku 5.5 一個 100K Token 的請求要多少錢?
如果輸入 100,000 個 Token 且沒有輸出,較低級距的輸入費用是 $0.01。同一級距的輸出費率為每百萬 Token $0.50,輸出需另外計費;只有當提示詞超過文件所列的門檻時,才會套用較高級距。
Claude Pro 或 Max 方案包含 Haiku 5.5 嗎?
Claude 訂閱方案與 Claude API 使用量是兩種分開計費的產品,Anthropic 的 Claude platform pricing 也清楚列出這項區分。程式化流量請依 API 價目表計算。
Batch 定價可以和提示詞快取疊加嗎?
Anthropic 的定價文件將 Batch 說明為適用 Token 費用的 50% 折扣,而快取 Token 的計算則獨立處理。由於快取資格與供應商支援情況可能不同,請檢查實際路由最後回傳的 usage 欄位。
Haiku 5.5 每種請求都比 Haiku 4.5 便宜嗎?
依照目前公布的直接 API 費率,Haiku 5.5 在兩個輸入級距都比 Haiku 4.5 便宜。但如果工作負載需要更多重試、更長輸出、快取未命中,或必須使用更強的模型才能成功完成任務,實際節省幅度就會縮小。