AIREITER
AnthropicText Chat

Claude Haiku 5.5

Claude Haiku 5.5 API 价格仅为 Anthropic 官方定价的一半:100K 输入以内每 1M tokens 输入 $0.05,输出 $0.25。包含长上下文梯度、相比 Haiku 4.5 的重大变更以及可用代码示例。

输入 Token输入输出缓存读取缓存创建
≤ 100,000$0.05 每 100 万 Tokens$0.25 每 100 万 Tokens$0.005 每 100 万 Tokens$0.0625 每 100 万 Tokens
> 100,000$0.25 每 100 万 Tokens$1.25 每 100 万 Tokens$0.025 每 100 万 Tokens$0.3125 每 100 万 Tokens

价格按每百万 token 计。按包含缓存读写的总输入 token 数选择档位,整次请求按该档计费。

使用 API 运行

输入

输出

Example
Generated in
42.7 seconds
输入 Token
134
输出 Token
2354
Tokens per second
55.13 tokens / second
Time to first token
-

模型详情

在 Playground、API 请求和内部工作流中使用相同的模型 key。

模型 ID
claude-haiku-5-5
供应商
Anthropic
协议
Anthropic Messages
上下文窗口
1,000,000 Token
最大输出
128,000 Token

Claude Haiku 5.5 的新特性

Anthropic 于 2026 年 10 月 7 日发布了 Claude Haiku 5.5,距离 Haiku 4.5 发布已过去一年。短提示词的价格降低了 90%,且模型性能大幅向 Sonnet 靠拢。

首个支持思考力度(effort)控制的 Haiku 模型

Haiku 5.5 支持自适应思考并提供五个思考力度级别:low、medium、high、xhigh 和 max。默认值为 medium。早期的 Haiku 模型没有 effort 设置。

1M 上下文与 128K 输出

上下文窗口从 Haiku 4.5 的 200K tokens 扩展至 1M,最大输出从 64K 提升至 128K。支持文本和图像输入。知识库截止日期为 2026 年 6 月。

在 Agent 和办公任务上的巨大飞跃

在 max effort 设置下,Anthropic 报告其在 OSWorld 2.1 上的得分为 72.4%(Haiku 4.5 仅为 15.7%),GDPval-AA Elo 评分为 1620(Haiku 4.5 为 735)。而在 Anthropic 公布的所有基准测试中,Sonnet 5.5 仍保持领先。

独立评分

在 Artificial Analysis 的智能指数(Intelligence Index)中,Haiku 5.5 在 max effort 下获得 43 分(高于 Haiku 4.5 的 17 分),在默认的 medium effort 下为 34 分。

Claude Haiku 5.5 对比 Haiku 4.5 对比 Sonnet 5.5

所有这些模型均可在同一个 AIReiter key 下运行,切换只需修改 model 字段。

Haiku 5.5 对比 Haiku 4.5

Haiku 4.5 的官方定价为每百万 tokens 输入 $1、输出 $5。对于 100K tokens 以内的提示词,Haiku 5.5 的官方定价为输入 $0.10、输出 $0.50。Anthropic 估计,考虑到较新的分词器在处理相同文本时会多生成约 30% 的 tokens,实际工作负载成本大约降低了 75%。

Haiku 5.5 对比 Sonnet 5.5

此处 Sonnet 5.5 的价格为每百万 tokens 输入 $1.00、输出 $5.00,是 Haiku 5.5 基础费率的 20 倍。Anthropic 仍推荐在复杂编程任务中使用 Sonnet 5.5 或 Opus 5.5。建议将 Haiku 5.5 用于分类、提取、摘要、路由分发和子 Agent 步骤。

Haiku 5.5 对比 GPT-6 Luna

两者的官方标价均为输入 $0.10、输出 $0.50。Anthropic 报告 Haiku 5.5 在 OSWorld 2.1(72.4% 对 48.9%)和 GDPval-AA(1620 对 1437)上均处于领先地位。Artificial Analysis 指出,Haiku 5.5 需要使用更多的输出 tokens 才能达到类似的分数,因此建议在您自己的任务中进行对比评测。

AIReiter 上的 Claude Haiku 5.5 API 定价

所有项目均按 Anthropic 官方定价的 50% 计费。费率取决于单次请求发送的输入 token 数量。

100K 以内输入 tokens

输入 $0.05(官方价 $0.10)。输出 $0.25(官方价 $0.50)。缓存读取 $0.005(官方价 $0.01)。缓存写入 $0.0625(官方价 $0.125)。以上均为每百万 tokens 价格。

超过 100K 输入 tokens:所有费率 x5

输入 $0.25(官方价 $0.50)。输出 $1.25(官方价 $2.50)。缓存读取 $0.025(官方价 $0.05)。缓存写入 $0.3125(官方价 $0.625)。档位根据每个请求的总输入 tokens(包含缓存 tokens)判定,并应用于整个请求。

两个实际调用示例

50K 输入加上 5K 输出在此处费用为 $0.00375(官方价为 $0.0075)。200K 输入加上 10K 输出进入长上下文档位,在此处费用为 $0.0625(官方价为 $0.125)。如果您能将长任务拆分为 100K 以内的请求,费用仅为原先的五分之一。

按实际使用的 Token 计费

调用开始时会预扣预估费用,响应完成后根据实际 token 数量进行结算并退还差额。Thinking tokens 按输出计费。

从 Haiku 4.5 迁移:现在会报错的内容

仅将模型字符串更改为 claude-haiku-5-5 并不总是足够的。以下这些在 Haiku 4.5 上可用的请求结构在 Haiku 5.5 上会被拒绝。

移除 temperature、top_p 和 top_k

非默认采样值会返回 400 错误并提示 "deprecated for this model"。请移除这些字段,并通过提示词和 effort 级别来引导输出。

不支持 assistant 预填

以 assistant 消息结尾的对话会返回 400 错误。最后一条消息必须来自 user。如需强制指定格式,请使用结构化输出或在提示词中说明。

将 thinking 预算替换为 effort

Anthropic 的 API 在此模型上会拒绝 thinking: {"type": "enabled", "budget_tokens": N},因此请将其移除并改为设置 output_config.effort。Thinking tokens 仍会消耗 max_tokens,因此如果回答被截断,请调大 max_tokens。

关闭 thinking 会将 effort 限制在 high

thinking: {"type": "disabled"} 适用于 low、medium 和 high effort。在 xhigh 或 max 下会返回 400 错误。Sonnet 5.5 上使用的 between_tools 思考模式在 Haiku 5.5 上不受支持。强制 tool_choice 仍然有效。

在上线前选定 effort 级别

Effort 是调节质量、延迟和成本的主要控制项。在 Haiku 5.5 上,不同级别之间的差距非常大。

宣传基准得分为 max effort 下的结果

Anthropic 的发布数据基于 max effort。在默认的 medium effort 下,Anthropic 报告的 GDPval-AA Elo 为 1277,而非 1620。查看基准测试声明时请注意对应的 effort 级别。

max 模式非常消耗 token

Artificial Analysis 测得在 max effort 下每个 Intelligence Index 任务约产生 16.2 万输出 tokens,大约是 GPT-6 Luna 在 max 模式下的三倍。在 medium 模式下测得约每秒 137 个输出 tokens。

建议从 low 或 medium 开始

对于分类、提取和路由等任务,使用 low 或 medium 并在禁用 thinking 的情况下可以保持较低的延迟和成本。仅在质量无法满足要求的任务上再提高级别。

如何调用 Claude Haiku 5.5 API

该端点支持 Anthropic Messages 协议,因此现有的 Claude 客户端只需更改基础 URL 和密钥即可。

01

获取密钥并将客户端指向 AIReiter

在您的 AIReiter 控制面板中创建 API 密钥。在官方 Anthropic SDK 中将基础 URL 设置为 https://aireiter.com/api —— SDK 会自动追加 /v1/messages。

02

使用 curl 发送请求

curl https://aireiter.com/api/v1/messages \ -H "x-api-key: $AIREITER_API_KEY" \ -H "anthropic-version: 2023-06-01" \ -H "content-type: application/json" \ -d '{ "model": "claude-haiku-5-5", "max_tokens": 4096, "output_config": {"effort": "low"}, "messages": [{"role": "user", "content": "Hello"}] }'

03

或使用 Python SDK

from anthropic import Anthropic client = Anthropic(api_key="YOUR_AIREITER_KEY", base_url="https://aireiter.com/api") msg = client.messages.create( model="claude-haiku-5-5", max_tokens=4096, messages=[{"role": "user", "content": "Hello"}], ) print(next(b.text for b in msg.content if b.type == "text"))

Claude Haiku 5.5 API 常见问题解答

/ 01

Claude Haiku 5.5 何时发布,模型 ID 是什么?

Anthropic 于 2026 年 10 月 7 日发布了该模型。API 模型 ID 为 claude-haiku-5-5,其知识截止日期为 2026 年 6 月。Anthropic 表示该模型在 2027 年 10 月 7 日前不会下线。

/ 02

上下文窗口和最大输出是多少?

支持 1M Token 的上下文窗口,每次请求最多支持 128K 输出 Token。支持文本和图像输入,并返回文本。

/ 03

Claude Haiku 5.5 API 的费用是多少?

Anthropic 的定价为:输入 token 处于 100K 以内的请求,每百万 token 输入 $0.10、输出 $0.50;超过 100K 时费用为前者的五倍。AIReiter 的收费仅为其一半:$0.05 和 $0.25,超过 100K 则为 $0.25 和 $1.25。

/ 04

为什么某个请求的费用高出了五倍?

因为其总输入超过了 100K tokens,所以整个请求均按照长上下文费率计费。缓存的 token 也会计入 100K 的限制内。

/ 05

为什么我的回答以 thinking 块开头?

自适应思考(Adaptive thinking)默认开启,因此响应在正文文本之前可能会包含一个 thinking 块。请按类型读取内容块,而不是直接获取 content[0],或者在 low、medium、high effort 下禁用 thinking。

/ 06

Haiku 5.5 适合用于编程吗?

对于较小、范围明确的代码修改和子代理步骤,通常足够使用。对于复杂的多文件任务,Anthropic 建议使用 Sonnet 5.5 或 Opus 5.5,两者均可在同一个 API 密钥下使用。

/ 07

我需要 Anthropic 账户吗?

不需要。AIReiter key 适用于 AIReiter 端点,在编写任何代码之前,您可以在此页面的 playground 中试用该模型。

/ 08

支持哪些 API?

/api/v1/messages 处的 Anthropic Messages 是主要协议,支持流式传输。此外还支持 OpenAI 风格的 Chat Completions 和 Responses API,而 /api/v1/models 会列出您当前 key 可用的模型。