截至 2026 年 7 月,Claude API 的价格从每百万 tokens 1 美元(Haiku 4.5 输入)到每百万 50 美元(Fable 5 输出)不等,而且在所有当前模型中都适用同一规则:输出 tokens 的费用是输入 tokens 的 5 倍。不过,标价只是最容易理解的部分。一个新的 tokenizer、仅限美国路由、快速模式,以及一个大多数人从未注意到的计费陷阱,都夹在价目表和你实际账单之间——而且还有一种方法可以用远低于标价的价格购买同样的模型。
以下所有数字均来自 Anthropic 的官方定价页面;在最终确定预算之前请先查看,因为模型费率会变动。
2026 年 Claude API 定价:所有模型
以下是当前每百万 token 的费率,已根据 Anthropic 2026 年 7 月的定价进行核实(官方来源)。Opus 4.8 于 2026 年 5 月 28 日发布,费率与 4.7 相同。
模型 | 输入 / 1M | 输出 / 1M | 上下文 |
|---|---|---|---|
Claude Fable 5 | $10.00 | $50.00 | 1M |
Claude Opus 4.8 | $5.00 | $25.00 | 1M |
Claude Opus 4.7 | $5.00 | $25.00 | 1M |
Claude Opus 4.6 | $5.00 | $25.00 | 1M |
Claude Sonnet 4.6 | $3.00 | $15.00 | 1M |
Claude Haiku 4.5 | $1.00 | $5.00 | 200K |
许多旧指南常常弄错两件事。Fable 5 —— Anthropic 最强大的模型 —— 位于 Opus 层级之上,价格为 $10/$50,而整个 Opus 4.x 系列(4.6、4.7、4.8)则维持在 $5/$25。这个 $5 本身也是一个故事:Opus 4.1 的价格是 $15/$75,而在 4.6 发布时降至 $5/$25,这对旗舰型号来说是67% 的削减,并且此后在三次发布中一直保持不变。
旧版和预算选项
如果你不需要最新模型,旧模型仍然可用:Sonnet 4.5($3/$15)、Opus 4.5($5/$25,200K 上下文)、Haiku 3.5($0.80/$4)以及 Haiku 3($0.25/$1.25),适用于最注重成本、且高吞吐量的工作。
一个被低估的细节:Opus 4.6/4.7/4.8、Sonnet 4.6 和 Fable 5 都包含完整的 1M-token 上下文窗口,且按标准价格计费——没有长上下文附加费。一个 900K-token 的请求按每个 token 的费率与一个 9K 请求相同,而一些竞争对手在超过长度阈值后会收取溢价。
不在价格表上的成本
费率表通常是大多数定价文章的终点,也是意外开始的地方——因为有几件事会在不改变每个 token 价格的情况下,影响你的实际账单。
悄悄添加 token 的分词器
Opus 4.7(以及共享其 tokenizer 的 Opus 4.8)改变了文本被拆分为 token 的方式。相同的输入在 Opus 4.6 上以完全相同的每个 token 费率,可能会产生最多约 35% 更多的 token。代码、结构化数据(JSON/XML)以及非英语文本受影响最严重,因为费率没有变化,但 token 数量变了。不要盲目相信 35% 这个数字:在你信任旧预算之前,请先在新模型上通过 token-counting endpoint 重新运行你的实际 prompts,并进行比较。
思考、快速模式和仅限美国路由
根据 Anthropic 的 定价文档:
扩展思考 tokens 按输出计费,即使你从不显示它们也是如此。一个重推理请求会悄悄增加账单的输出部分。
快速模式(仅限 Opus 4.8/4.7)可使同一模型运行速度最高提升 2.5 倍,收费为标准定价的 2 倍。
仅限美国推理(数据驻留)会在输入和输出上增加1.1 倍系数;AWS Bedrock 或 Vertex 区域端点会再额外增加约 10%。
服务端工具
在 Anthropic 侧运行的工具会单独计费,依据相同的定价文档:网页搜索每 1,000 次搜索收费 $10,外加处理结果所需的 tokens;代码执行在每月额度内免费,超出后按每个容器约 $0.05/小时计费。(请在定价页面确认当前数值——server-tool 费率会变化。)
让 Claude Code 用户中招的计费陷阱
这个不在任何价目表上。如果你在 shell 中设置了 ANTHROPIC_API_KEY,Claude Code 会通过 按 token 计费的 API 而不是你的订阅收费。原本以为是每月固定 20–200 美元的人,正是因为这个原因被按用量计费的费用打了个措手不及。在长时间会话前,请先检查你的环境。
Claude 实际上会花你多少钱?
在将费率对应到实际工作负载之前,费率本身意义不大。以下是按当前价格计算的三个示例,均为每天 10,000 次请求(每次 2,000 个输入 + 500 个输出 token——每天 2,000 万输入 + 500 万输出 token):
Haiku 4.5 上的支持聊天机器人($1/$5):20M × $1 + 5M × $5 = $45/天,约$1,350/月。
Sonnet 4.6 上的编码代理($3/$15):$60 + $75 = $135/天,优化前约$4,050/月。
Opus 4.8 上的高上下文 RAG 应用($5/$25),其中检索到的文档会将输入量推高得多,由于输入量占主导,成本会上升到每月高四位数到五位数。
相同音量,三种模型——仅模型选择就会让 Haiku 和 Sonnet 之间的账单相差约 3 倍。
这些并不是假设性的上限。一个 r/ClaudeAI 讨论串 跟踪了 31 位 Claude Code 用户,他们的使用量如果按 API 费率计算,费用约为 每月 80,000 美元,其中最高的单个用户接近 18,000 美元——这只是对他们的订阅用量如果在按量计费的 API 上计费会是多少的估算,并非实际账单。高强度的自治工作负载才是账单真正变高的地方,而这正是下面这些优化最能派上用场的地方。
速率限制和使用层级
价格并不是唯一的限制——你能花得有多快也分不同层级。新的 API 账户起初会有较为保守的每分钟请求数(RPM)和每分钟 token 数(TPM)限制,这些限制会随着账户使用时间增长以及累计消费增加而自动提升(Tier 1 → 4)。新账户还可获得5 美元的免费额度用于测试,无需信用卡。除了吞吐量之外,Anthropic 还提供在可用性和价格之间权衡的服务层级:标准层级(默认)、可保证可用性的优先层级,以及下方异步 50% 折扣的 batch 层级。在为规模化架构设计之前,请查看 rate-limits 文档,了解你所在层级的具体数值——曾经足以承载试点流量的配额,到了生产环境可能需要提升层级。
Claude 订阅与 API:哪个更便宜?
最常见的现实世界问题,而答案是一个阈值,而不是一个定论。
Claude Pro 为每月 $20;Max 为每月 $100 或 $200。这些套餐涵盖 Claude 应用和 Claude Code,并包含使用额度——不按 token 计费。
The API 采用纯按需付费模式,无每月最低消费,也无使用上限。
交叉点位于每月低百万级 tokens——在中端模型(Sonnet)上大约是 300万–400万,假设输入/输出比例均衡,并且你原本会在 Pro 的使用额度内。这个数值在 Haiku 上会更高,在 Opus 上会更低,所以应把它看作一个范围,而不是固定线。低于这个用量,订阅通常更便宜也更简单。高于这个用量——尤其是生产流量或重度 agentic coding——API 的按 token 计费更划算,而且你还能获得订阅方案没有的控制能力(速率限制、监控、多密钥计费)。就全天候编码而言,开发者估计 Max 方案可能会比在 Opus 上按 token 逐项计费的同样工作便宜得多。
实用规则:原型和个人使用 → 订阅;规模化产品流量 → API。并且要注意上面的 ANTHROPIC_API_KEY 陷阱,否则你会两边都付费。
如何为 Claude API 支付更少费用
三个杠杆可在不更改模型的情况下降低标准账单。
1. 提示缓存(重复上下文最高可享 90% 折扣)
缓存一个稳定前缀——长系统提示、检索到的文档、few-shot 示例——并且缓存读取的成本仅为输入费率的 0.1×,也就是 90% 的折扣。关键在于写入:5 分钟缓存写入成本为 1.25×,一次读取后即可回本;1 小时写入成本为 2×,两次后即可回本。对于任何带有大量固定前导内容且会被反复命中的场景,这都是最大的单一杠杆。(缓存文档。)
2. 批量 API(半价,双向)
对于不需要实时答复的任何内容,Batch API 会将输入和输出费用各打 50% 的折扣,并在 24 小时内返回。Sonnet 4.6 降至 $1.50/$7.50;Haiku 4.5 降至 $0.50/$2.50。缓存和批处理可叠加,使实际成本远低于标价的一半。
3. 模型路由和输出上限
不要在 Opus 上运行每个请求。将分类、摘要和路由逻辑交给 Haiku,把 Sonnet 留给中间层,只有在任务确实需要时才调用 Opus —— 这样通常就能单独削减 40–60%。而且由于输出价格是输入的 5 倍,限制 max_tokens 是你最具杠杆效应的调节项之一:将百万次调用的平均输出从 800 个 token 减少到 500 个 token,每个月都能节省实实在在的成本。
官方 API 与中转平台:你能付更少吗?
官方文档不会提到还有第四种途径:通过中继购买相同的 Claude 模型。API 中继(或聚合器)位于你和 Anthropic 之间,提供一个与 Anthropic 兼容的端点,并按其自身费率收费。
为什么中继会更便宜? 主要有三种机制:中继以承诺使用量采购,从而获得单个账户无法达到的折扣;它们在不同区域和提供商之间高效路由;而且许多中继以微薄利润(甚至亏本引流)来吸引开发者。但这么深的折扣必须来自某个地方——在依赖之前,先了解平台的商业模式。
折扣差异很大。以下是同样的 Claude 模型在三种选项中的对比:
平台 | 相较 Anthropic 官方价目表的折扣 | 模型覆盖范围 | 备注 |
|---|---|---|---|
Official Anthropic API | — (baseline) | All, incl. Fable 5 / Opus 4.8 | Caching, batch, every feature |
≈ list (passes provider price through) | Many models, multi-provider | Aggregator; convenience over savings | |
EvoLink | ~10% off | Up to Opus 4.7 | OpenAI-compatible endpoint |
~80% off | Up to Opus 4.6 | Anthropic-compatible; caching passes through |
AIReiter 处于激进端。以下是标题中约 80% 对应到每个模型的结果:
模型 | 官方(输入 / 输出) | AIReiter(输入 / 输出) | 您节省 |
|---|---|---|---|
Claude Haiku 4.5 | $1 / $5 | $0.20 / $1.00 | 80% |
Claude Sonnet 4.6 | $3 / $15 | $0.60 / $3.00 | 80% |
Claude Opus 4.6 | $5 / $25 | $1.00 / $5.00 | 80% |
集成即插即用:AIReiter 的端点兼容 Anthropic Messages API,因此官方 anthropic SDK 只需修改两行即可工作——将 base_url 指向 https://aireiter.com/api 并替换密钥:
client = anthropic.Anthropic(
api_key="YOUR_AIREITER_KEY",
base_url="https://aireiter.com/api",
)
流式传输、多轮对话、视觉以及 cache_control 都可透传,因此上面的 90% 缓存折扣会叠加在更低的基础费率之上。
常见问题
为什么 Claude API 如此昂贵?
很多时候,问题不在于每个 token 的费率——而在于工作流设计。最大的成本驱动因素是:本可以用 Haiku 或 Sonnet 却把所有内容都跑在 Opus 上、未缓存的重复上下文、无限制的输出,以及你为其付费却从未看到的推理 tokens。修正这些通常比标价更重要。
有免费的 Claude API 套餐吗?
没有永久免费的生产层级,但新账户可获得5 美元免费额度(无需信用卡)用于测试。之后按量付费。
Claude API 与 ChatGPT 定价——哪个更便宜?
这取决于你比较的层级。大致上,每百万 token(输入/输出):
Claude | 可比的 OpenAI |
|---|---|
Haiku 4.5 — $1 / $5 | GPT mini 层级 — 低个位数 |
Sonnet 4.6 — $3 / $15 | 中档层级 — 可比 |
Opus 4.8 — $5 / $25 | GPT-5.5 — ~$5 / $30 |
如何计算我的 Claude API 月度账单?
可估算为:(requests × avg input tokens ÷ 1,000,000 × input rate) + (requests × avg output tokens ÷ 1,000,000 × output rate)。请使用 token-counting endpoint 对你的真实提示词进行准确计数——通用分词器在 Claude 上可能会有 15–35% 的误差。
总结
对于大多数团队来说,这是三种选择:原型开发或个人使用 → Pro 或 Max 订阅(更简单,在每月约 3–4M tokens 以下更便宜);在最新旗舰模型上进行生产环境部署(Opus 4.8、Fable 5)→ 使用开启缓存、批处理和路由的官方 API;在 Sonnet 4.6 或 Opus 4.6 足够的生产环境中 → 像 AIReiter 这样的可靠中继可通过一次 SDK 替换将同样的账单最多降低 80%。
无论你选择哪种,大多数团队之所以多付费,并不是因为选错了套餐,而是因为跳过了优化——所以在担心费率表之前,先把这些调优项打开。