11 家免费 LLM API:核心差异速览
本次信息核查日期为 2026 年 9 月 8 日。实际限制会因模型、账号、地区和供需状况而变化,最终请以服务商链接中的官方文档为准。
有关绑卡、商用和 OpenAI 兼容性的标注,也参考了 Free LLM API Hub comparison 作为交叉验证来源。
| 服务商 | 免费访问与公开配额 | 绑卡/付款条件 | API 形态 | 条款信号 | 主要限制 |
|---|---|---|---|---|---|
| Google AI Studio | Gemini 各模型不同:5–30 RPM、15–1,000 RPD;以 Gemini 2.5 Flash 为例:10 RPM / 250 RPD | 未列出绑卡要求;可能需要完成账号和项目验证 | 经验证的对比资料显示兼容 OpenAI | 标注为可商用;请确认最新条款 | Google 要求在 AI Studio 中查看当前实际限制 |
| Groq | 以 qwen/qwen3.6-27b 为例:30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPD | Free Plan 无需升级至付费方案;Developer 层级需要付款方式 | 基本兼容 | 标注为可商用;Free Plan 的限制不同于付费容量 | 限制按组织和模型维度生效 |
| OpenRouter | 免费变体:累计购买积分低于 $10 时为 20 RPM / 50 RPD;累计购买至少 $10 后为 1,000 RPD | 基础免费路径无需绑卡;购买积分可提高上限 | 是,已统一为 OpenAI Chat API | 标注为可商用;免费模型可用性会变动 | 更高的每日额度以购买为前提 |
| Cloudflare Workers AI | 全账号共享的 10,000 Neurons/天,于 00:00 UTC 重置 | 基础额度免费;部分模型要求开通付费计费 | 经验证的对比资料显示兼容 OpenAI | 标注为可商用;不同模型的资格不同 | Neuron 衡量的是算力,并非固定 Token 配额 |
| Cerebras Inference | Free Trial:所列模型可用 5 RPM / 30K 未缓存 TPM / 90K 总 TPM / 1M TPD | 必须验证付款方式 | 引用文档中未能确认 | 试用访问;积分会在 30 天后失效 | $5 试用积分不是长期额度 |
| SambaNova Cloud | Free Tier:所列模型为 20 RPM / 20 RPD / 200,000 TPD | Free Tier 无需付款方式;绑定后会激活付费 Developer Tier | 是,但存在已文档化的差异 | 标注为可商用;请检查模型条款 | 20 RPD 的限制较严 |
| Cohere | 1,000 次调用/月;Chat 为 20 RPM,Embed 为 2,000 inputs/min,Rerank 为 10 RPM | 经验证的对比资料未列出绑卡要求;注册时请确认 | 经验证的对比资料显示兼容 OpenAI | 经验证的对比资料标注为仅限评估 | 调用次数不能直接等同于 Token 数 |
| Z.AI | GLM-4.7-Flash 和 GLM-4.5-Flash 在展示的 Token 类别中标价 $0;未公开 RPM/TPM | 经验证的对比资料未列出绑卡要求 | 经验证的对比资料显示兼容 OpenAI | 标注为可商用;请核实模型条款 | 每 Token $0 不代表容量已知 |
| NVIDIA NIM | 提供用于原型开发的 Free Inference Endpoints;落地页没有统一配额 | 付款条件因端点而异;请查看具体模型页面 | 引用文档中未能确认 | 引用页面显示原型/评估用途信号 | 落地页写着免费,不等于已经公开配额 |
| Hugging Face Inference Providers | 免费用户每月可获得 $0.10/month 积分,可能调整;未公布 RPM/TPM | 官方定价文档未说明绑卡条件 | 经验证的对比资料显示兼容 OpenAI | 请检查服务商和模型条款 | 这是小额积分,不是请求配额 |
| Mistral Studio | Studio 提供 Free mode;文档首页没有公开配额 | 首页未说明绑卡条件 | 已文档化 OpenAI 风格端点;未宣称完全兼容 | 显示试用和探索/评估用途信号;请核实条款 | Free mode 不等于无限量,也不代表适合生产环境 |
不要只看哪一行的数字最大。请求、Token、调用次数、金额和 Neurons 属于不同计量单位;会过期的试用也不等于可持续续期的免费额度。
如果你还需要图像、语音、Embedding 等其他模态,可参考更全面的 free AI API comparison。本文只聚焦托管式 LLM 推理服务。
免费额度更明确、或无需绑卡的选择
Google AI Studio:通用原型的务实起点
Google 官方速率限制文档说明,Gemini 配额取决于模型和项目。常见指标包括 RPM、输入 TPM 和 RPD;配额归属 Google Cloud 项目,而不是单个 API Key。开发者应在 AI Studio 中查看当前生效的数值。每日请求配额会在太平洋时间午夜重置。
经验证的辅助对比资料显示,Gemini 2.5 Flash 的额度为 10 RPM、250 RPD,不同模型大致落在 5–30 RPM、15–1,000 RPD。这些数字更适合用于前期规划,因为 Google 明确表示实际限制会变动,且不作保证。
Gemini 适合通用和多模态原型;但具体模型的每日上限,可能会制约请求密集型工作负载。
Groq:公开请求配额最有竞争力的免卡方案
Groq 的速率限制文档按模型和组织列出限制。目前,qwen/qwen3.6-27b 的 Free Plan 条目为 30 RPM、1,000 RPD、8,000 TPM 和 200,000 TPD。其他模型的每日和 Token 上限各不相同。
“速率限制适用于组织级别,而不是单个用户。”——Groq 速率限制文档
因此,创建多个 API Key 并不会自动获得彼此独立的组织级容量。Groq 文档提供了用于处理 HTTP 429 响应的 retry-after 和 x-ratelimit-* 响应头说明。
如果选定模型能满足任务需求,Groq 是高频小请求最清晰的起点。不要把服务商级别的标签当作统一配额,务必查看目标模型对应的具体条目。
OpenRouter:免费模型选择最灵活的统一入口
OpenRouter 通过一套 API 接入持续变化的免费模型变体。当前免费访问说明显示:当账号累计购买积分低于 $10 时,限制为每分钟 20 次、每天 50 次;累计购买积分达到至少 $10 后,每日额度会提高到 1,000 次请求。也就是说,较高上限需要先购买。
官方限制文档说明,新增账号或 API Key 不会改变平台的全局速率限制。该服务会通过 Key 端点和限流错误响应头暴露配额信息。
你可以通过 :free 后缀固定使用某个模型,也可以使用 openrouter/free,由它自动选择当前可用的免费模型。路由器可以按工具调用、图像理解等能力筛选,但底层模型可能发生变化。
OpenRouter 很适合实验和备用路由,不适合依赖某一免费模型稳定行为的应用。
Cloudflare Workers AI:提供的是持续算力,不是免费 Token
Cloudflare 官方定价页为每个账号提供总计 10,000 Neurons/天 的免费额度。该额度在 Workers AI 活动之间共享,并于 00:00 UTC 重置。在 Workers Free 方案中,额度耗尽后,后续操作会失败。
Neuron 代表完成一次请求所需的 GPU 算力。Cloudflare 会公布不同模型对应的 Token 换算关系,而非承诺 10,000 Neurons 一定等于固定数量的提示词请求。
Cloudflare 还说明,部分较新的 DeepSeek、GLM 和 Kimi 模型需要开通付费计费方式。“免费 10,000 Neurons”并不意味着所有模型都无需计费即可使用。
免费,但有前提条件
Cerebras:适合短期评估,不是长期免费的 API
Cerebras 的速率限制文档为所列 Free Trial 模型给出了 5 RPM、30,000 未缓存 TPM、90,000 总 TPM 和 100 万 TPD。文档还解释,其令牌桶会持续补充,而不是等待简单的每日重置。
新账号可获得 $5 免费积分,积分会在 30 天后失效;启用 Playground 和 API 访问还需要验证付款方式。积分到期或用完后,如不额外购买,访问将会停止。已核查的文档并未说明存在永久、定期续发的公开免费额度。
Cerebras 适合短期评估,但不应成为必须在试用期结束后持续运行项目的唯一依赖。
SambaNova Cloud:付费状态的分界最明确
SambaNova 以计费状态来界定 Free Tier:即未绑定付款方式。针对所列 Free Tier 模型,官方文档给出的限制为 20 RPM、20 RPD 和 200,000 TPD。即使 Token 额度尚未用完,20 RPD 也可能先让高频轮询工作流停下来。
绑定付款方式会激活付费的 Developer Tier,不应再将其算作免费。SambaNova 也会在响应头中提供剩余请求数和重置时间信息。
SambaNova 更适合低调用量的概念验证:在引入任何 Agent 工作流前,都必须先确认 20 RPD 的上限是否够用。
Cohere:适合 RAG,但要仔细核算调用次数
Cohere 的试用 Key 不同于按 Token 发放的免费层级。当前经验证的对比资料显示,它提供每月 1,000 次调用;各端点限制分别是 Chat 20 RPM、Embed 每分钟 2,000 个输入、Rerank 10 RPM。Cohere 的 FAQ 也将试用 Key 描述为免费但受限。
这一组合适合检索增强生成实验:一个项目就能同时测试生成、Embedding 和重排序。但它并不意味着试用 Key 可以充当高吞吐量聊天后端。不要把每月 1,000 次调用与每天 100 万 Token直接比较。
经验证的对比资料将该试用标注为仅限评估。在用于公开或商业应用前,请确认当前的使用政策。
Z.AI:免费定价不等于配额明确
Z.AI 的定价文档将 GLM-4.7-Flash 和 GLM-4.5-Flash 在展示的 Token 类别中列为免费。已核查的公开定价页没有给出明确的 RPM、RPD、TPM 或 TPD 数值。
应将 Z.AI 的配额视为未知:它或许适合手动测试,但不适合直接用于批处理任务;注册时请验证端点、模型可用性和相关条款。
NVIDIA、Hugging Face 与 Mistral:适合探索,但公开配额信息不完整
| 服务商 | 免费访问信号 | 缺失的公开配额信息 | 实际用途 |
|---|---|---|---|
| NVIDIA NIM | 提供用于原型开发的 Free Inference Endpoints | 落地页未提供统一的 RPM、Token 额度、绑卡规则或超额价格 | 先测试选定端点,再阅读其模型专属条款 |
| Hugging Face Inference Providers | 免费用户每月可获 $0.10/month 积分,可能调整 | 没有可直接对比的 RPM 或 TPM 配额 | 无需管理 GPU 基础设施,即可进行小规模的路由模型实验 |
| Mistral Studio | Studio 提供 Free mode 和 API 快速入门 | 文档首页未说明配额或绑卡规则 | 在决定接入付费配置前,先体验 Mistral API 功能 |
免费 LLM API 到底该怎么选?
| 你的优先需求 | 首选起点 | 原因 |
|---|---|---|
| 通用原型开发 | Google AI Studio | Gemini 提供清晰的通用基线;可在 AI Studio 查看当前限制 |
| 高频小请求 | Groq | 公开了按模型划分的 Free Plan 条目,并有 1,000 RPD 的示例 |
| 通过一个 API 使用多个模型 | OpenRouter | 提供免费变体、路由能力和 OpenAI 风格接口 |
| Cloudflare 原生应用 | Workers AI | 持续提供 10,000 Neurons/天 的额度 |
| 公开标注 Token 数最高的试用 | Cerebras | 最高可达 1M TPD,但仅限 30 天且需要绑卡的试用 |
| 严格不绑定付款方式 | 优先 Groq;极低调用量可选 SambaNova | SambaNova 的 Free Tier 上限为 20 RPD |
| RAG 组件 | Cohere | Chat、Embed 和 Rerank 共用同一套试用 Key 生态 |
| 测试 GLM Flash | Z.AI | 展示的 Token 价格为 $0,但公开配额未知 |
| 无 GPU 条件下探索开源模型 | Hugging Face | 提供路由访问,免费用户每月有 $0.10/month |
先从一家服务商开始,并为每次请求记录四项数据:模型 ID、HTTP 状态、Token 用量和剩余额度响应头。只有确认第一条路径到底撞上了哪种限制后,再增加第二家服务商;使用多个 Key 并不一定能获得更多容量。
接入前,如何核实免费 LLM API
上线前请确认以下五件事:
- 配额单位:该方案按请求、Token、调用次数、金额还是算力单位计算?
- 重置机制:是在 UTC 或太平洋时间的固定时点重置、持续补充、按月续期,还是一次性到期?
- 适用范围:限制绑定在模型、项目、账号还是组织上?
- 付款条件:添加银行卡是解锁更多容量、激活付费层级,还是试用的强制要求?
- 条款与失败路径:该方案是否仅限测试或评估?客户端能否正确处理 HTTP 429,避免引发重试风暴?
免费 LLM API 常见问题
综合来看,哪家免费 LLM API 最好?
通用原型可选 Google AI Studio;需要更高免费请求量可选 Groq;看重模型多样性则可选 OpenRouter。
不用信用卡也能使用免费 LLM API 吗?
可以。经验证的对比资料将 Google、Groq、OpenRouter 的基础路径、Cloudflare 的基础额度和 SambaNova 的 Free Tier 列为无需绑卡的选项。Cerebras 的 Free Trial 则需要验证付款方式。
免费 LLM API 真的会永久提供吗?
部分定期额度会在条款持续有效期间保留,但试用、促销价格以及轮换的 :free 路由,都不是服务商范围内永久有效的额度。依赖某一家之前,请确认最新文档和模型状态。
免费 LLM API 能用于生产环境吗?
除非其当前条款、配额和模型可用性能满足你的生产要求,否则不要将其作为唯一后端。
达到免费额度上限后会怎样?
服务商通常会返回限流或配额错误。Groq 文档说明了 HTTP 429 的处理方式;Cloudflare 表示 Free 方案的每日额度耗尽后,后续操作会失败;Cerebras 的试用积分到期或用完后则会停止访问。