AIREITER

Claude Haiku 5.5 API 定价:100K Token 的隐藏门槛

最后更新: 2026-10-07 19:03:48

Claude Haiku 5.5 看起来是一款价格很低的模型,但当请求的输入超过 100,000 个 token 后,计算方式就完全不同了。在这个门槛以下,Anthropic 的定价是每百万输入 token $0.10、每百万输出 token $0.50;超过门槛后,则变为 $0.50 和 $2.50。输入价格上涨五倍,这才是制定生产环境预算时真正需要盯住的数字,而不是发布时的宣传口号。

Claude Haiku 5.5 API 价格速览

官方 API 费率会根据输入提示词的大小分档,单位为每百万 token 的美元价格。下表数据来自 Anthropic 的 Claude platform pricing 和 Haiku 5.5 launch announcement;不同市场或第三方平台的价格可能不同。

真正影响价格的是 100K 门槛

这里的门槛只看单个请求的输入提示词大小,并不是因为模型支持超大上下文,就会统一加收一笔费用。输入为 90,000 token、输出为 2,000 token 的请求,仍然属于低价档;而输入达到 120,000 token 的请求,则会按照长提示词档位对应的输入和输出价格计费。

以输入 10,000 token、输出 500 token 的简单请求为例,低价档的计算方式是:

(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035

如果发送 10,000 次这样的请求,在计算工具调用、平台费用或重试成本之前,总价是 $3.50。再看一个确实超过门槛的例子:输入 120,000 token、输出 500 token 的请求,成本为:

(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125

发送 10,000 次,就是 $612.50。计算时要统计实际发送给 API 的完整输入,而不只是用户能看到的问题文本。

Anthropic 在 Reddit 的官方公告中表示,不超过 100K token 的请求相比 Haiku 4.5 便宜约 90%,超过 100K 的请求则便宜约 50%。这些数字属于发布时的相对宣传口径,并不意味着每种工作负载都能准确省下相同比例的费用:重试次数、输出长度、分词器行为以及缓存未命中,都会改变最终账单。

缓存和 Batch 会改变实际费率

如果应用会反复发送相同的指令或知识库内容,提示词缓存尤其有价值。Claude Haiku 5.5 的五分钟缓存写入价格是标准输入价格的 1.25 倍,读取缓存则只需按标准输入价格的十分之一计费。进入更高提示词档位后,这两个比例仍然不变。

操作不超过 100K超过 100K
写入五分钟缓存的前 1M token$0.125$0.625
每读取 1M 个缓存 token$0.01$0.05
Batch 中每 1M 个输入 token$0.05$0.25
Batch 中每 1M 个输出 token$0.25$1.25

五分钟缓存通常读取约两次就能回本,因为写入时支付的溢价很快就会被摊平。比如,写入一个 1M token 的前缀需要 $0.125,读取一次只需 $0.01;读取两次的总成本是 $0.145,而两次完全不使用缓存的读取则需要 $0.20,这里还没计算输出费用。一小时缓存的价格是基础输入价格的两倍,因此需要更多次重复读取才能回本。最终结果取决于缓存 key 是否始终保持不变,以及请求是否一直处于同一个价格档位。

Batch API 会将异步任务的输入和输出价格都减半,适合夜间数据丰富、批量分类、历史数据回填和评测等场景。它不能替代同步聊天,代价是更高的延迟。如果你的路由同时支持两种模式,可以将 Batch 与缓存结合使用;但不要想当然地认为每个请求都命中了缓存,应该检查最终的 usage 字段。

值得记录的运行指标是 cache_read_input_tokens,Anthropic 的 Messages API usage schema 对此有明确说明。如果第一次请求之后该字段仍然是 0,就该检查提示词顺序、时间戳、工具序列化方式以及 cache-control 的位置。一个始终无法命中缓存的低价模型,实际成本可能高于名义费率更高、但缓存配置正确的路由。

Haiku 5.5 与旧版 Haiku、Sonnet 的价格对比

下面的对比使用的是 Haiku 5.5 发布前已公布的直接 API 价格。这里列出 Haiku 4.5 作为基准,但这并不意味着所有服务商都采用完全相同的费率。

模型输入 / MTok输出 / MTok预算上的适用场景
Claude Haiku 5.5,<=100K$0.10$0.50高并发、短输出任务
Claude Haiku 5.5,>100K$0.50$2.50质量足以证明更高档位合理的长提示词任务
Claude Haiku 4.5$1.00$5.00需要稳定基准的现有集成
Claude Sonnet 5.5$2.00$10.00要求更高的生产任务

Haiku 5.5 很适合优先测试标题生成、分类、信息提取、路由、短摘要以及其他高吞吐量后台任务。一位 Reddit 用户将 Haiku 类模型的典型用途概括为“高数量、低复杂度任务”,例如生成对话标题,或从文本中提取软件名称(u/jam_pod_)。相比之下,不要默认它可以替代更强模型完成每一个智能体步骤。

不要只看 token 价格做决定。如果 Haiku 在一半请求中都需要重试,而 Sonnet 首次就能产出可接受结果,那么表面上的二比一费率差距很快就会消失。让生产流量切换模型之前,应该在有代表性的样本上同时测量计费输入、计费输出、重试次数以及最终被接受的结果数量。

一条适用于生产环境的成本规则

正式采用 Haiku 5.5 前,可以按下面的顺序检查:

  1. 按照 Anthropic 的 token-counting documentation,用真实提示词进行计算,同时包含工具、检索文档和对话历史。
  2. 将流量拆分为 <=100K 和 >100K 两类输入请求,不要把两个价格档位混在一起求平均。
  3. 单独估算输出成本。输入很短但生成内容很长的任务,主要由输出费用决定。
  4. 将稳定不变的前缀放到缓存控制之后,并在缓存读取降为 0 时触发告警。
  5. 可以等待的任务交给 Batch API,交互式请求则继续使用同步路由。
  6. 比较 Haiku 5.5 和 Sonnet 5.5 时,看每个可接受结果的成本,而不是每百万 token 的成本。

这套规则也能应对发布初期数据中最大的不确定性:官方定价和可用性已经明确,但独立的延迟、失败率以及长上下文质量测试还没有建立起来。Reddit 讨论中也有人直接提出了同样的问题:“prompts up to 100k 到底是什么意思?”(u/ShadowBannedAugustus)。对生产团队来说,这个问题应该通过计费测试来回答,而不是靠猜。

Claude Haiku 5.5 API 常见问题

Claude Haiku 5.5 的 API model ID 是什么?

当前别名是 claude-haiku-5-5,Anthropic 的 Claude Code release notes 已列出该名称。如果需要可复现的路由,请在 API model documentation 中确认具体的 snapshot ID。

一次 100K token 的 Haiku 5.5 请求需要多少钱?

如果输入为 100,000 token 且没有输出,低价档的输入费用是 $0.01。同一档位下,输出仍按每百万 token $0.50 单独计费;只有当提示词超过文档规定的门槛后,才会进入更高价格档位。

Claude Pro 或 Max 是否包含 Haiku 5.5?

Claude 订阅和 Claude API 使用属于两套独立的计费产品,Anthropic 的 Claude platform pricing 对此有说明。程序化流量应以 API 费率表为准。

Batch 价格能与提示词缓存叠加吗?

Anthropic 的定价文档将 Batch 描述为对符合条件的 token 费用提供 50% 折扣,而缓存 token 仍单独核算。由于缓存资格和服务商支持情况可能不同,请检查实际路由返回的 usage 字段。

Haiku 5.5 是否每次请求都比 Haiku 4.5 更便宜?

按照已公布的直接 API 费率,Haiku 5.5 在两个输入价格档位都比 Haiku 4.5 便宜。但如果任务需要重试、输出更长、缓存频繁未命中,或者必须使用更强的模型才能成功完成,实际节省下来的成本可能会减少。