AIREITER

为什么 LLM API 这么贵?问题不在单价,而在用量

最后更新: 2026-10-01 01:54:24

一位 Claude Code 用户按 API 官方价目表核算了一个月的 Max 计划工作量,结果 API 账单达到 7,470 美元,而订阅费用只有 200 美元。问题并不在于单个 Token 的价格有多离谱,而在于按量计费取消了订阅计划一直在默默提供的“封顶线”——更别说 Agent 工作负载会反复发送大量上下文,远超人类在聊天框里逐句输入的规模。

开发者为什么会报出这么大的差距

用户分享的比例虽然未经审计,但数字普遍很高,而且相当一致。一篇r/ClaudeAI 讨论根据 Claude Code 会话日志重建了使用量:一个月的 Max 使用量,如果按 API 官方价目表计算,约为 7,470 美元,而订阅费是 200 美元。另一篇规模较小的订阅与 API 对比讨论中,一位 200 美元套餐用户估算,同样的工作负载每月需要 5,000–20,000 美元。

这些都是用户自行估算的结果,但 Token 消耗最大的模式在两组案例中都一样:让 Agent 反复遍历代码仓库。

“我所在公司的 Claude Code 使用的是企业 API 计划。亲身体验是,在较大的项目上正常写代码,一次会话轻松就能烧掉 100–200 美元的 API 费用。”——u/andywidjaja,r/ClaudeAI

付费套餐和 API Key,本来就是两种产品

Anthropic 对此说得很直接。其帮助中心文章于 2026 年 3 月 16 日更新,明确表示 Claude 套餐与 Claude Console 是“面向不同用途设计的独立产品”,付费订阅“并不包含 Claude API 或 Console 的访问权限”。OpenAI 也是同样的模式,ChatGPT 和 API 平台使用两套独立的计费系统。

理解两者差异的关键,是看它们到底在卖什么:

付费聊天套餐API Key
计费单位一个人类用户席位Token 吞吐量
使用上限滚动 5 小时窗口加每周限制不包含固定额度,但仍受速率和消费上限约束
使用方式网页、桌面端和移动端应用由你自己的代码调用
价格形态固定月费按 Token 浮动计费
为自己的产品提供能力并非它的销售目标这正是它的用途

Claude 的价格页面显示,Pro 套餐按月支付为 20 美元/月,按年支付则为 17 美元/月(一次性支付 200 美元);Max 套餐起价 100 美元/月,可在每个五小时会话中获得相当于 Pro 5 倍或 20 倍的使用量。Anthropic 没有为这些档位公布具体消息数量,因为实际消耗会随对话长度、模型和功能变化。因此,这里比较的是一个已经计量的数量和一个没有公开计量标准的数量。

显示 Free、Pro 和 Max 档位的 Claude 套餐价格页面

同一页面还透露了另一个关键信息:Claude Enterprise 每个席位每月收费 20 美元,同时使用量仍按 API 费率计费。重度用户最终还是会回到按量计费的模式。

按官方价目表计算,20 美元订阅费能换来多少 Token

把套餐价格换算成 Token,差距就会变得非常直观。以下是Claude 平台定价文档和OpenAI API 价格页面公布的每百万 Token(MTok)官方价格,数据核对时间为 2026 年 10 月 1 日。

Claude 和 OpenAI 各模型每百万 Token 的输入与输出官方价格对比
模型输入输出缓存读取Batch(输入/输出)
Claude Fable 5.1$10$50$0.25$5 / $25
Claude Opus 5.5$4$20$0.20$2 / $10
Claude Sonnet 5.5$2$10$0.20$1 / $5
Claude Haiku 4.5$1$5$0.10$0.50 / $2.50
GPT-6 Astra$10$50$1.00$5 / $25
GPT-6.1 Sol$2$10$0.10$1 / $5
GPT-6 Luna$0.10$0.50$0.01$0.05 / $0.25
20 美元 API 余额在不同模型上可以买到多少百万输出 Token

以聊天类工作负载为例:如果每次输入几千词的上下文,再返回几百词的内容,20 美元的 Sonnet 5.5 余额大约可以覆盖 1,000 万个输入 Token,或 200 万个输出 Token。你自己的准确账单,需要根据 API 响应中的四个字段计算:(fresh input × input rate) + (cached input × cache-read rate) + (cache writes × write rate) + (output × output rate),此外还要叠加 Batch、长上下文和区域等乘数。连续一周记录每个 endpoint 的这四项数据,就能得到一个月度数字,再拿它和单个席位的价格比较。

Token 到底消耗在了哪里

有四类常见的额外消耗,通常不会直接出现在价格表里。后面三类在LLM Cost Lab 对价格表之外成本的拆解中都有说明。

  1. 每轮都会重新发送的对话记录。在基于请求的聊天集成中,客户端会反复发送历史记录,因此第 20 轮请求会携带第 1 到第 19 轮的内容。如果每一轮都增加相近数量的上下文,输入量大致会随对话长度的平方增长。这也是为什么该分析估算一个 20 轮会话的成本为 0.163 美元,而按彼此独立的请求预算只有 0.063 美元,两者相差 2.6 倍。
  2. 每次调用都会重复发送的系统提示词。一个 2,000 Token 的系统提示词,如果被发送给 100 万次请求,在用户输入任何内容之前,就已经产生了 20 亿个输入 Token。
  3. 你看不到的推理 Token。对于将隐藏思考过程按输出计费的模型,这些 Token 可能比最终可见答案长数倍。只根据返回文本的字符数估算,就会低估实际账单。
  4. 工具结果、重试和被丢弃的生成结果。只要是模型生成的内容,就可能产生费用,包括被 JSON 校验器拒绝的响应,以及为了竞速而并行发起、最后被丢弃的请求。

便宜的 Token 也可能成为账单的主要部分,这正是很多人查看使用量面板时最困惑的地方。在那篇 7,470 美元的讨论中,有评论者发现缓存读取占总费用的 48%,尽管它是价格表中最便宜的 Token 类型。

“缓存读取已经是 API 上最便宜的 Token 类型了。如果按官方价格计算后它仍然占据主导,那就说明这个工作负载主要是在每一轮重新读取上下文。”——u/YoanEdwin,r/ClaudeAI

把 Opus 5.5 的价格代入一个 Agent 会话:每轮携带 150k Token 的代码仓库上下文,输出 2k Token,成本结构就很清楚了:

Opus 5.5,60 轮会话,每轮 150k 上下文 + 2k 输出成本
每轮都是新输入,没有缓存命中(150k @ $4)$0.60
每轮使用缓存读取,而不是新输入(150k @ $0.20)$0.03
每轮输出(2k @ $20)$0.04
每个会话写入一次、缓存时长 1 小时(150k @ $8)$1.20
会话总成本,未使用缓存$38.40
会话总成本,使用缓存$5.40

每天进行两次缓存会话,连续 22 个工作日,成本大约为 238 美元,已经超过 200 美元套餐。若完全不使用缓存,同样的月份成本会超过 1,600 美元。单价没有变化,变化的是 Token 数量。

其实不只是两档,而是三档

大多数对比只看套餐和 API,但实际上还存在第三档:当订阅额度用完后,在订阅产品内部购买额外使用额度。用户通常只有在配额耗尽后,才会遇到这一档。

r/codex上的用户报告显示,这一档的价格可能高于直接使用 API。一位 Pro 用户记录了通过购买额度消耗的约 1,600 万个 Token,花费约 40 美元;随后估算,同样的用量按 API 官方价格计算约为 12 美元。

“这些额度的定价已经接近掠夺性收费了。一个落地页就要 50 美元实在荒谬,因为直接调用 API 可能只要 2 美元。”——u/AbjectBug5885,r/codex

这些仍然只是用户估算,并不是适用于所有人的统一价格;不同供应商和套餐的充值价格也会不同。在上面的 Codex 案例中,额外额度这一档的价格大约是同等 API 官方价格的 3 倍。因此,在连续第二周购买额度之前,最好先用自己的实际数据核算一次。

真正能改变账单的五个杠杆

下面每个杠杆都有对应的官方价格,先对照供应商页面,再自己算一遍即可验证。

  1. 使用提示词缓存,但别忘了缓存写入成本。Anthropic 的定价文档显示,5 分钟缓存写入按基础输入价格的 1.25 倍计费,1 小时写入按 2 倍计费;缓存读取则为基础价格的 0.1 倍(Opus 5.5 为 0.05 倍,Fable 5.1 为 0.025 倍)。5 分钟写入只需一次读取就能回本,1 小时写入需要两次读取才能回本。如果写入后从未读取,反而比完全不使用缓存更贵。缓存不仅要打开,顺序也很重要:稳定内容放在前面,用户变化内容放在最后,否则前缀就无法匹配。关于命中率调试,可以参考这篇提示词缓存指南。
  2. 能延迟处理的任务,尽量使用 Batch。两家供应商都为异步处理提供 50% 的官方价格折扣:Opus 5.5 降至 $2/$10,Sonnet 5.5 降至 $1/$5。但其他模型的支持情况并不一致:LLM Cost Lab 统计的 83 个模型中,只有 26 个提供折扣后的 Batch 档位。因此,在围绕 Batch 设计架构前,先确认你的模型是否支持。具体机制可以查看我们的Batch API 定价指南。
  3. 根据任务选择模型档位。分类、路由和检索决策通常不需要最强的前沿模型。Haiku 4.5 的价格是 $1/$5,而 Fable 5.1 是 $10/$50;如果某个步骤只输出 10 个 Token,两者也存在 10 倍的价格差距。
  4. 限制输出内容,而不只是设置 max_tokens。上表中几乎所有模型的输出价格都是输入价格的 5 倍。禁止前导说明的 Schema,可能只增加少量结构开销,却能避免生成本来会被计费的大段文字。相比把 max_tokens 当成格式控制工具,它更适合作为安全上限,因为被截断的回答可能需要再次付费请求。
  5. 留意叠加在基础价格上的乘数。OpenAI 的长上下文档位会让短上下文输入价格翻倍,Fast mode 还会在此基础上再次将标准价格翻倍。Anthropic 对固定在美国区域的推理收取 1.1 倍费用,而其定价文档指出,Claude 4.7 及后续版本使用了新的 Tokenizer,同样的文本大约会产生多 30% 的 Token。你的提示词没有变,计费方式变了。

还有一个不属于上述清单的结构性选择:把程序化流量统一路由到一个按量计费的 endpoint,而不是让每个供应商各自建立一套计费关系。这正是AIReiter 的 Claude API endpoint所解决的问题。按官方价格计算,一个月额外使用 4,000 万个 Sonnet 级输入 Token 和 800 万个输出 Token,成本为 $80 + $80。把这个数字和再买一个席位的价格比较,通常只需要一分钟。

到底该买哪一种

你的使用场景建议购买原因
聊天、研究,以及偶尔在应用中写代码只买付费套餐支出有上限,包含应用,使用量明显低于套餐限制
个人 Agent 编程,只有一台机器先买套餐,再用按量计费的 Key 处理超出部分套餐承担大部分使用量,API Key 则能避免等待每周重置
要上线一个供其他人使用的产品只用 API一个席位只覆盖一个人类用户,而你的用户需要自己的吞吐量
周期性批处理任务:评测、回填、分类使用支持 Batch 档位的 API官方价格 50% 折扣,而且不在乎延迟
几乎每周都在购买额外额度把超出部分与 API Key 的成本做比较用户报告显示,额外额度的价格高于 API 官方价格

常见问题

付费 ChatGPT 或 Claude 套餐包含 API 额度吗?

不包含。Anthropic 帮助中心明确表示,付费 Claude 套餐“并不包含 Claude API 或 Console 的访问权限”;OpenAI 也通过两套独立系统分别为 ChatGPT 和 API 平台计费。两者都购买,就意味着账单上会出现两笔费用。

我看不到的推理 Token 也要付费吗?

如果模型支持思考或扩展推理,答案是要付费。这些 Token 按输出价格计费,却不会出现在响应正文中,因此应当查看 usage 对象。

每一轮都要为完整对话付费吗?

是的,除非重复的前缀命中了缓存。如果没有服务端状态功能,客户端就必须重新发送希望模型看到的历史记录。这些历史内容会按模型的价格作为新输入计费;如果前缀匹配,则按缓存读取价格计费。

失败或重试的请求也会产生费用吗?

根据 LLM Cost Lab 的计费拆解,只要请求已经到达模型并返回结果,即使应用在 Schema 校验失败或客户端超时后丢弃了结果,也仍然会计费。请求在生成前就被拒绝,则属于例外。

目前没人真正解决的取舍

套餐限制支出,但会限制使用;按量计费的 Key 则反过来。由于套餐配额没有公布对应的 Token 数量,要回答“哪种方式对我更便宜”,最可靠的做法是记录一周真实的、经过埋点的流量,再按照上面的价格表计算。

相关阅读:2026 年最便宜的 LLM API · Claude API 定价指南