Claude Haiku 5.5 的全新特性
Anthropic 於 2026 年 10 月 7 日發布 Claude Haiku 5.5,距 Haiku 4.5 推出已有一年。短 prompt 價格大幅調降 90%,且模型實力已大幅拉近與 Sonnet 的差距。
首款支援思考程度控制的 Haiku
Haiku 5.5 採用自適應思考機制,並提供五種 effort 等級:low、medium、high、xhigh 與 max。預設為 medium。早期的 Haiku 模型並無 effort 設定。
1M 上下文與 128K 輸出
上下文視窗從 Haiku 4.5 的 200K token 大幅擴展至 1M,最大輸出從 64K 增至 128K。支援文字與圖片輸入,知識截止日為 2026 年 6 月。
在 Agent 與辦公任務上的巨大飛躍
在 max effort 設定下,Anthropic 指出其在 OSWorld 2.1 達到 72.4%(Haiku 4.5 為 15.7%),GDPval-AA Elo 評分達到 1620(Haiku 4.5 為 735)。而在 Anthropic 發布的所有基準測試中,Sonnet 5.5 仍保持領先。
第三方獨立評測分數
Artificial Analysis 在其 Intelligence Index 評測中,給予 Haiku 5.5 在 max effort 下 43 分(Haiku 4.5 為 17 分),在預設的 medium effort 下則為 34 分。
Claude Haiku 5.5 vs Haiku 4.5 vs Sonnet 5.5
所有模型皆可使用同一個 AIReiter key 呼叫,切換時僅需修改 model 欄位。
Haiku 5.5 vs Haiku 4.5
Haiku 4.5 原價為每百萬 token 輸入 $1、輸出 $5。Haiku 5.5 在 100K token 以內的 prompt 原價為 $0.10 與 $0.50。Anthropic 估計,考慮到新型 tokenizer 處理相同文字會產生約 30% 更多 token,實際工作負載的成本約可降低 75%。
Haiku 5.5 vs Sonnet 5.5
在此處,Sonnet 5.5 每百萬 token 輸入為 $1.00、輸出為 $5.00,是 Haiku 5.5 基本費率的二十倍。Anthropic 仍建議在複雜程式碼編寫時使用 Sonnet 5.5 或 Opus 5.5;而 Haiku 5.5 則非常適合用於分類、擷取、摘要、路由分發以及 subagent 步驟。
Haiku 5.5 vs GPT-6 Luna
兩者原價皆為輸入 $0.10、輸出 $0.50。Anthropic 報告指出 Haiku 5.5 在 OSWorld 2.1(72.4% 對比 48.9%)與 GDPval-AA(1620 對比 1437)表現領先。Artificial Analysis 指出 Haiku 5.5 需要使用比 Luna 更多的輸出 token 才能達到類似的分數,建議依據您的實際任務進行對比測試。
AIReiter 上的 Claude Haiku 5.5 API 定價
所有項目皆以 Anthropic 原價的 5 折計費。費率取決於單次請求傳送的輸入 token 數量。
100K 輸入 token 以內
輸入 $0.05(原價 $0.10)。輸出 $0.25(原價 $0.50)。快取讀取 $0.005(原價 $0.01)。快取寫入 $0.0625(原價 $0.125)。計費單位皆為每百萬 token。
超過 100K 輸入 token:所有費率 5 倍
輸入 $0.25(原價 $0.50)。輸出 $1.25(原價 $2.50)。快取讀取 $0.025(原價 $0.05)。快取寫入 $0.3125(原價 $0.625)。計費級距按單次請求的總輸入量(含快取 token)判定,並適用於該請求的所有 token。
兩個實際呼叫範例
50K 輸入加上 5K 輸出在此處花費 $0.00375(原價 $0.0075)。200K 輸入加上 10K 輸出屬於長文本級距,在此處花費 $0.0625(原價 $0.125)。若您能將大型任務拆分為 100K 以下的多個請求,成本僅需五分之一。
按實際使用的 Token 計費
請求開始時會預先扣留預估額度,待回應完成後依實際 token 數量結算並退還差額。Thinking tokens 按輸出計費。
從 Haiku 4.5 遷移:現在會回傳錯誤的項目
僅將模型字串更改為 claude-haiku-5-5 不一定足夠。以下請求格式在 Haiku 4.5 上可行,但在 Haiku 5.5 上會被拒絕。
移除 temperature、top_p 與 top_k
非預設的採樣值會回傳 400 錯誤與「deprecated for this model」。請移除這些欄位,並改用 prompt 和 effort 層級來引導輸出結果。
不支援 assistant prefill
以 assistant 訊息結尾的對話會回傳 400 錯誤。最後一則訊息必須來自 user。若要強制特定格式,請使用結構化輸出(structured outputs)或在 prompt 中指明。
以 effort 取代 thinking budget
Anthropic 的 API 在此模型上會拒絕 thinking: {"type": "enabled", "budget_tokens": N},因此請將其移除並改為設定 output_config.effort。思考 token(thinking tokens)仍會佔用 max_tokens 的額度,所以如果回答被截斷,請提高 max_tokens。
關閉 thinking 時 effort 最高只能設為 high
thinking: {"type": "disabled"} 適用於 low、medium 和 high effort。若設為 xhigh 或 max 則會回傳 400 錯誤。Sonnet 5.5 上使用的 between_tools thinking 模式在 Haiku 5.5 上不支援。強制 tool_choice 仍然有效。
在正式上線前選擇合適的 effort 等級
Effort 是調節品質、延遲與成本的主要開關。在 Haiku 5.5 上,各層級之間的差距非常顯著。
官方公布的評測分數採用 max effort
Anthropic 發布會上的數據使用的是 max effort。在預設的 medium effort 下,Anthropic 回報的 GDPval-AA Elo 分數為 1277,而非 1620。查看基準測試聲明時請務必考慮 effort 層級。
max 模式極度消耗 token
Artificial Analysis 測量顯示,在 max effort 下每個 Intelligence Index 任務約產生 162K 個 output token,大約是 GPT-6 Luna 在 max 模式下的三倍。在 medium 模式下,測得的生成速度約為每秒 137 個 output token。
從 low 或 medium 開始
對於分類、擷取與路由任務,使用 low 或 medium 並停用 thinking 可以降低延遲與成本。僅在品質未達預期的任務上才向上提升等級。
如何呼叫 Claude Haiku 5.5 API
此端點採用 Anthropic Messages 協議,因此現有的 Claude 客戶端只需更改 base URL 與金鑰即可。
取得金鑰並將客戶端指向 AIReiter
在您的 AIReiter 控制面板建立 API 金鑰。在官方 Anthropic SDK 中將 base URL 設定為 https://aireiter.com/api — SDK 會自行附加 /v1/messages。
使用 curl 發送請求
curl https://aireiter.com/api/v1/messages \ -H "x-api-key: $AIREITER_API_KEY" \ -H "anthropic-version: 2023-06-01" \ -H "content-type: application/json" \ -d '{ "model": "claude-haiku-5-5", "max_tokens": 4096, "output_config": {"effort": "low"}, "messages": [{"role": "user", "content": "Hello"}] }'
或使用 Python SDK
from anthropic import Anthropic client = Anthropic(api_key="YOUR_AIREITER_KEY", base_url="https://aireiter.com/api") msg = client.messages.create( model="claude-haiku-5-5", max_tokens=4096, messages=[{"role": "user", "content": "Hello"}], ) print(next(b.text for b in msg.content if b.type == "text"))
Claude Haiku 5.5 API 常見問題
/ 01Claude Haiku 5.5 是何時發布的?它的模型 ID 是什麼?
Anthropic 於 2026 年 10 月 7 日發布。API 模型 ID 為 claude-haiku-5-5,其知識庫截止日期為 2026 年 6 月。Anthropic 表示在 2027 年 10 月 7 日前不會停用此模型。
/ 02上下文視窗和最大輸出長度為何?
具備 1M Token 的上下文視窗,每次請求最多可輸出 128K Token。支援文字與圖片輸入,並回傳文字。
/ 03Claude Haiku 5.5 API 的費用是多少?
Anthropic 定價為輸入 token 100K 以內的請求每百萬 token 輸入 $0.10、輸出 $0.50,超過 100K 則為五倍。AIReiter 僅收費一半:$0.05 與 $0.25,超過 100K 則為 $0.25 與 $1.25。
/ 04為什麼某個請求的費用高出五倍?
其總輸入超過了 100K token,因此整個請求皆按長上下文(long-context)費率計費。快取的 token 也會計入 100K 的限制中。
/ 05為什麼我的回答開頭會包含 thinking 區塊?
自適應思考(Adaptive thinking)預設為開啟,因此回應內容在文字之前可能包含 thinking 區塊。請依據 type 讀取 content 區塊,而非直接取用 content[0],或在 low、medium 或 high effort 下停用 thinking。
/ 06Haiku 5.5 適合用於寫程式碼嗎?
對於小型、範圍明確的修改以及 subagent 步驟,通常是足夠的。對於複雜的多檔案工作,Anthropic 建議使用 Sonnet 5.5 或 Opus 5.5,兩者皆可透過同一個金鑰使用。
/ 07我需要 Anthropic 帳號嗎?
不需要。AIReiter 金鑰適用於 AIReiter 端點,而且在編寫任何程式碼之前,您可以在此頁面的 playground 中試用該模型。
/ 08支援哪些 API?
/api/v1/messages 的 Anthropic Messages 是主要的協定規格,並支援串流(streaming)。同時也提供 OpenAI 風格的 Chat Completions 與 Responses API,而 /api/v1/models 則會列出您的金鑰可使用的模型。