到 2026 年 7 月,最便宜的 LLM API 每百万输入 token 已经不到 0.1 美分。以 Groq's Llama 3.1 8B Instant 为例,Groq 本月官方定价页显示:其价格仅为每百万输入 token $0.05、每百万输出 token $0.08。
不过,标价并不等于实际账单。DeepSeek 的提示词缓存能将有效输入成本压低 50 到 120 倍;Gemini、Mistral 和 Groq 的批处理 API 还可再减半。只盯着列表价格,很容易为同一类工作负载多花钱,甚至选错服务商。下面汇总了低价选项的实际价格,所有数据均于 2026 年 7 月 30 日对照服务商定价页核实,并说明各自最适合的场景。
当前最便宜的 LLM API:2026 年 7 月核价结果
价格最低的 LLM API,通常不是前沿实验室的旗舰端点,而是小型模型、效率优化模型,或由推理服务商提供的模型。以下均为主流直连服务商的标准按量付费价格;“免费层”一栏标出可用的免费方案。本次不包含自托管和短期促销价。
| 模型(服务商) | 输入 / 100 万 | 输出 / 100 万 | 缓存命中输入 | 免费层 | 最低成本优势 |
|---|---|---|---|---|---|
| Llama 3.1 8B Instant (Groq) | $0.05 | $0.08 | $0.025 | 有 | 标准价格最低 |
| GPT-OSS 20B (Groq) | $0.075 | $0.30 | $0.0375 | 有 | 低价,1000 tok/s |
| Gemini 2.5 Flash-Lite (Google) | $0.10 | $0.40 | — | 有 | Batch 最便宜(输入 $0.05) |
| Ministral 3B (Mistral) | $0.10 | $0.10 | — | Leanstral(限时) | 小模型输入输出同价 |
| DeepSeek V4 Flash (DeepSeek) | $0.14 | $0.28 | $0.0028 | 无 | 推理任务成本最低 |
| Mistral Small 4 (Mistral) | $0.15 | $0.60 | −90% | 无 | 通用场景较均衡 |
| Gemini 3.5 Flash-Lite (Google) | $0.30 | $2.50 | — | 有 | 大规模多模态 |
价格底线是 Groq Llama 3.1 8B 的 $0.05/$0.08;表中没有其他模型能匹配它的输出价格。Gemini 2.5 Flash-Lite 仅在独立的 Batch 档位将输入价格降至 $0.05,标准价格仍是 $0.10。对于低价推理需求,DeepSeek V4 Flash 更值得优先考虑。
为什么它们比 GPT 或 Claude 便宜
低价主要来自三方面:模型本身较小或经过效率优化,例如 Llama 3.1 8B、Ministral 3B 和 Flash-Lite 系列;Groq、DeepSeek 等推理服务商采用成本更低的基础设施;以及批处理与缓存 token 的折扣。表中的大多数模型都是开放权重模型,包括 Llama、DeepSeek 和 Mistral;Gemini Flash-Lite 则是 Google 自家的专有模型系列,以低价争取大规模调用量。开放权重模型在极高且稳定的用量下,自托管可能更便宜;但这要先承担硬件和运维成本,因此对大多数团队来说,托管 API 仍是成本基准。
免费层才是理论上的价格下限
如果“最便宜”指的是免费,这里有多家服务商提供免费选项:Groq 和 Google 的 Gemini Flash-Lite 系列可在速率限制内免费使用,Mistral 限时免费提供 Leanstral,GitHub Models 也可通过 token 免费访问。Google 的免费层会将请求用于产品训练,付费层则不会。它们都有较严格的速率限制,也不提供 SLA。我们在免费 AI API 指南中单独整理了这些免费选项;一旦需求超过原型验证阶段,真正需要比较的还是上面的付费档位。
别被单价误导:缓存和批处理决定实际账单
按输入标价排序的价格表,往往掩盖了比它呈现的更多信息。有三个因素足以让实际成本相差几个数量级,但许多价格页对此要么一笔带过,要么干脆不突出展示。
“LLM API 低价背后的巨大误导。”——来自 r/LocalLLaMA 的讨论帖,讲述某个模型看似低廉的标价如何掩盖了由缓存读取费用主导的账单。
服务商通常会分别计费缓存输入、新输入和输出;看起来最便宜的输入单价,往往只是账单中最小的一部分。比较时要重点看以下三项:
- 提示词缓存。 当服务商能够复用此前发送过的提示词前缀时,缓存部分的价格会降至普通输入价格的一小部分。DeepSeek 的 V4 Flash 缓存输入价格为每百万 $0.0028,而新输入为 $0.14,相差 50 倍;V4 Pro 则是$0.0036 对 $0.435,折扣达 120 倍。Groq 对缓存输入半价,Mistral 则优惠 90%。如果你的提示词反复包含很长的系统提示词或文档前缀,却没有选择支持缓存的服务商,那么每次请求都会按原价付费。
- Batch API。 Google、Mistral 和 Groq 都为非实时任务提供约50% 的折扣,处理窗口为 24 小时至 7 天。Gemini 2.5 Flash-Lite 的 Batch 输入价格可降至 $0.05。不要求亚秒级响应的任务,例如隔夜摘要、批量分类和数据集标注,都应交给批处理。
- 输出占比高的工作负载。 代码生成、长文写作和 Agent 循环生成的 token 往往远多于读取的 token。即使输入成本相近,Llama 3.1 8B 的 $0.08 输出价格也远胜 Gemini 2.5 Flash-Lite 的 $0.40。生成是瓶颈时,应按输出价格而非输入价格排序。
筛选时不妨先回答三个问题:提示词是否适合缓存?任务是否要求实时返回?输出 token 是否多于输入?这三个答案对最终排名的影响,往往大于列表上的标价。
按使用场景选最低成本方案
以下推荐假设你的能力需求高于最小模型所能覆盖的水平;如果只看绝对价格,Llama 3.1 8B 会占据每一行。这里综合了实际成本、缓存和批处理的适用性,以及所需的能力下限。
| 使用场景 | 最低成本选择 | 原因 |
|---|---|---|
| 通用对话 / 分类 | Mistral Small 4 | 能力高于 3B/8B 档位的中型通用模型;$0.15/$0.60 |
| 编程与 Agent 循环 | Groq GPT-OSS 20B 或 Llama 3.1 8B | 输出价格低于 $0.08,840–1000 tok/s 可让循环保持快速 |
| 推理 / 高难度提示词 | DeepSeek V4 Flash | $0.14/$0.28,针对推理优化;缓存折扣很大 |
| 长上下文文档 | Gemini 3.5 Flash-Lite | 上下文窗口大,且有免费层可测试 |
| 实时 / 延迟敏感 | Groq(任意模型) | 价格低,同时吞吐量领先,达到 840–1000 tok/s |
| 批量 / 隔夜任务 | Gemini 2.5 Flash-Lite(Batch) | Batch 输入 $0.05,异步任务可享 50% 折扣 |
聚合平台还是直连:什么情况下中间商反而更省钱
直接接入 DeepSeek、Google、Groq 或 Mistral,可以拿到特定模型最低的每 token 价格。但相应的运营成本也由你承担:需要维护多组 API Key、分别处理账单、某家服务商触发限流时手动故障转移,还要针对四套不同 SDK 重写缓存和重试逻辑。
这正是聚合平台出售的价值。OpenRouter 在底层服务商价格之上收取5.5% 平台费,不额外加价,同时提供一个 Key、一张账单,以及本列表模型之间的自动故障转移。根据 OpenRouter 自己的说明,交叉点大约在每月 $50:低于这个金额时,5.5% 的费用通常低于接入多家服务商所需的工程时间成本;高于这个金额时,直接接入单一最低价服务商通常在纯成本上更有优势。实际盈亏平衡点取决于你原本需要接入多少家服务商,以及流量波动有多大。
类似的取舍同样适用于 AIReiter 这样的转售网关:通过一个兼容 OpenAI 的端点接入 DeepSeek、Gemini、Groq 和 Mistral,只需修改模型名称即可切换模型,无须重写客户端。
常见问题
最便宜的 LLM API 是什么?
截至 2026 年 7 月,Groq's Llama 3.1 8B Instant 的价格为每百万 token 输入 $0.05 / 输出 $0.08,是本次比较中标准按量付费价格最低的选项。Gemini 2.5 Flash-Lite 仅在 Batch 档位匹配 $0.05 的输入价格,标准价为 $0.10。
用于编程最便宜的 LLM API 是哪个?
用于代码生成和 Agent 循环时,Groq 的GPT-OSS 20B($0.075/$0.30)或 Llama 3.1 8B($0.05/$0.08)在输出价格和速度上更有优势。如果需要 Groq 之外专门针对编程优化的低价模型,Mistral's Devstral Small 2 的价格为 $0.10/$0.30。
免费 LLM API 层够用于生产环境吗?
通常不够。Groq、Gemini Flash-Lite 和 GitHub Models 的免费层都限制每分钟请求数,也不保证可用性。它们适合原型验证;过了早期测试阶段,应转向上表中的付费档位。
聚合 API 或转售 API 比直连更贵吗?
按每 token 计算,是的,通常会略贵一些。OpenRouter 在服务商价格上加收 5.5% 费用;转售网关也会包含类似的额外成本。但当你的支出较低,或原本需要维护多个服务商集成时,它们的总成本反而更低;当平台费超过便利性带来的价值后,聚合方案就会更贵。
最便宜的 LLM API 每月要花多少钱?
如果每月使用 1000 万输入 token 和 500 万输出 token,Groq Llama 3.1 8B 的成本约为$0.90,其中输入 $0.50、输出 $0.40。Gemini 2.5 Flash-Lite 按标准价格约为 $3.00,使用 Batch 则约为 $1.50。相同用量若采用前沿专有模型,每百万输入 $5+,成本将高出许多倍。
最终怎么选
凡是服务商支持的地方都应开启提示词缓存,非实时任务则应走 Batch。这两个开关带来的节省,通常远大于单纯更换服务商。
