AIREITER
API 文档价格
模板
  • AIReiter
  • 博客
  • 免费 LLM API 配额横评:11 家服务商(2026)

免费 LLM API 配额横评:11 家服务商(2026)

最后更新: 2026-09-08 08:43:20

11 家免费 LLM API:核心差异速览

本次信息核查日期为 2026 年 9 月 8 日。实际限制会因模型、账号、地区和供需状况而变化,最终请以服务商链接中的官方文档为准。

有关绑卡、商用和 OpenAI 兼容性的标注,也参考了 Free LLM API Hub comparison 作为交叉验证来源。

服务商免费访问与公开配额绑卡/付款条件API 形态条款信号主要限制
Google AI StudioGemini 各模型不同:5–30 RPM、15–1,000 RPD;以 Gemini 2.5 Flash 为例:10 RPM / 250 RPD未列出绑卡要求;可能需要完成账号和项目验证经验证的对比资料显示兼容 OpenAI标注为可商用;请确认最新条款Google 要求在 AI Studio 中查看当前实际限制
Groq以 qwen/qwen3.6-27b 为例:30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPDFree Plan 无需升级至付费方案;Developer 层级需要付款方式基本兼容标注为可商用;Free Plan 的限制不同于付费容量限制按组织和模型维度生效
OpenRouter免费变体:累计购买积分低于 $10 时为 20 RPM / 50 RPD;累计购买至少 $10 后为 1,000 RPD基础免费路径无需绑卡;购买积分可提高上限是,已统一为 OpenAI Chat API标注为可商用;免费模型可用性会变动更高的每日额度以购买为前提
Cloudflare Workers AI全账号共享的 10,000 Neurons/天,于 00:00 UTC 重置基础额度免费;部分模型要求开通付费计费经验证的对比资料显示兼容 OpenAI标注为可商用;不同模型的资格不同Neuron 衡量的是算力,并非固定 Token 配额
Cerebras InferenceFree Trial:所列模型可用 5 RPM / 30K 未缓存 TPM / 90K 总 TPM / 1M TPD必须验证付款方式引用文档中未能确认试用访问;积分会在 30 天后失效$5 试用积分不是长期额度
SambaNova CloudFree Tier:所列模型为 20 RPM / 20 RPD / 200,000 TPDFree Tier 无需付款方式;绑定后会激活付费 Developer Tier是,但存在已文档化的差异标注为可商用;请检查模型条款20 RPD 的限制较严
Cohere1,000 次调用/月;Chat 为 20 RPM,Embed 为 2,000 inputs/min,Rerank 为 10 RPM经验证的对比资料未列出绑卡要求;注册时请确认经验证的对比资料显示兼容 OpenAI经验证的对比资料标注为仅限评估调用次数不能直接等同于 Token 数
Z.AIGLM-4.7-Flash 和 GLM-4.5-Flash 在展示的 Token 类别中标价 $0;未公开 RPM/TPM经验证的对比资料未列出绑卡要求经验证的对比资料显示兼容 OpenAI标注为可商用;请核实模型条款每 Token $0 不代表容量已知
NVIDIA NIM提供用于原型开发的 Free Inference Endpoints;落地页没有统一配额付款条件因端点而异;请查看具体模型页面引用文档中未能确认引用页面显示原型/评估用途信号落地页写着免费,不等于已经公开配额
Hugging Face Inference Providers免费用户每月可获得 $0.10/month 积分,可能调整;未公布 RPM/TPM官方定价文档未说明绑卡条件经验证的对比资料显示兼容 OpenAI请检查服务商和模型条款这是小额积分,不是请求配额
Mistral StudioStudio 提供 Free mode;文档首页没有公开配额首页未说明绑卡条件已文档化 OpenAI 风格端点;未宣称完全兼容显示试用和探索/评估用途信号;请核实条款Free mode 不等于无限量,也不代表适合生产环境

不要只看哪一行的数字最大。请求、Token、调用次数、金额和 Neurons 属于不同计量单位;会过期的试用也不等于可持续续期的免费额度。

如果你还需要图像、语音、Embedding 等其他模态,可参考更全面的 free AI API comparison。本文只聚焦托管式 LLM 推理服务。

免费额度更明确、或无需绑卡的选择

Google AI Studio:通用原型的务实起点

Google 官方速率限制文档说明,Gemini 配额取决于模型和项目。常见指标包括 RPM、输入 TPM 和 RPD;配额归属 Google Cloud 项目,而不是单个 API Key。开发者应在 AI Studio 中查看当前生效的数值。每日请求配额会在太平洋时间午夜重置。

经验证的辅助对比资料显示,Gemini 2.5 Flash 的额度为 10 RPM、250 RPD,不同模型大致落在 5–30 RPM、15–1,000 RPD。这些数字更适合用于前期规划,因为 Google 明确表示实际限制会变动,且不作保证。

Gemini 适合通用和多模态原型;但具体模型的每日上限,可能会制约请求密集型工作负载。

Groq:公开请求配额最有竞争力的免卡方案

Groq 的速率限制文档按模型和组织列出限制。目前,qwen/qwen3.6-27b 的 Free Plan 条目为 30 RPM、1,000 RPD、8,000 TPM 和 200,000 TPD。其他模型的每日和 Token 上限各不相同。

“速率限制适用于组织级别,而不是单个用户。”——Groq 速率限制文档

因此,创建多个 API Key 并不会自动获得彼此独立的组织级容量。Groq 文档提供了用于处理 HTTP 429 响应的 retry-after 和 x-ratelimit-* 响应头说明。

如果选定模型能满足任务需求,Groq 是高频小请求最清晰的起点。不要把服务商级别的标签当作统一配额,务必查看目标模型对应的具体条目。

OpenRouter:免费模型选择最灵活的统一入口

OpenRouter 通过一套 API 接入持续变化的免费模型变体。当前免费访问说明显示:当账号累计购买积分低于 $10 时,限制为每分钟 20 次、每天 50 次;累计购买积分达到至少 $10 后,每日额度会提高到 1,000 次请求。也就是说,较高上限需要先购买。

官方限制文档说明,新增账号或 API Key 不会改变平台的全局速率限制。该服务会通过 Key 端点和限流错误响应头暴露配额信息。

你可以通过 :free 后缀固定使用某个模型,也可以使用 openrouter/free,由它自动选择当前可用的免费模型。路由器可以按工具调用、图像理解等能力筛选,但底层模型可能发生变化。

OpenRouter 很适合实验和备用路由,不适合依赖某一免费模型稳定行为的应用。

Cloudflare Workers AI:提供的是持续算力,不是免费 Token

Cloudflare 官方定价页为每个账号提供总计 10,000 Neurons/天 的免费额度。该额度在 Workers AI 活动之间共享,并于 00:00 UTC 重置。在 Workers Free 方案中,额度耗尽后,后续操作会失败。

Neuron 代表完成一次请求所需的 GPU 算力。Cloudflare 会公布不同模型对应的 Token 换算关系,而非承诺 10,000 Neurons 一定等于固定数量的提示词请求。

Cloudflare 还说明,部分较新的 DeepSeek、GLM 和 Kimi 模型需要开通付费计费方式。“免费 10,000 Neurons”并不意味着所有模型都无需计费即可使用。

免费,但有前提条件

Cerebras:适合短期评估,不是长期免费的 API

Cerebras 的速率限制文档为所列 Free Trial 模型给出了 5 RPM、30,000 未缓存 TPM、90,000 总 TPM 和 100 万 TPD。文档还解释,其令牌桶会持续补充,而不是等待简单的每日重置。

新账号可获得 $5 免费积分,积分会在 30 天后失效;启用 Playground 和 API 访问还需要验证付款方式。积分到期或用完后,如不额外购买,访问将会停止。已核查的文档并未说明存在永久、定期续发的公开免费额度。

Cerebras 适合短期评估,但不应成为必须在试用期结束后持续运行项目的唯一依赖。

SambaNova Cloud:付费状态的分界最明确

SambaNova 以计费状态来界定 Free Tier:即未绑定付款方式。针对所列 Free Tier 模型,官方文档给出的限制为 20 RPM、20 RPD 和 200,000 TPD。即使 Token 额度尚未用完,20 RPD 也可能先让高频轮询工作流停下来。

绑定付款方式会激活付费的 Developer Tier,不应再将其算作免费。SambaNova 也会在响应头中提供剩余请求数和重置时间信息。

SambaNova 更适合低调用量的概念验证:在引入任何 Agent 工作流前,都必须先确认 20 RPD 的上限是否够用。

Cohere:适合 RAG,但要仔细核算调用次数

Cohere 的试用 Key 不同于按 Token 发放的免费层级。当前经验证的对比资料显示,它提供每月 1,000 次调用;各端点限制分别是 Chat 20 RPM、Embed 每分钟 2,000 个输入、Rerank 10 RPM。Cohere 的 FAQ 也将试用 Key 描述为免费但受限。

这一组合适合检索增强生成实验:一个项目就能同时测试生成、Embedding 和重排序。但它并不意味着试用 Key 可以充当高吞吐量聊天后端。不要把每月 1,000 次调用与每天 100 万 Token直接比较。

经验证的对比资料将该试用标注为仅限评估。在用于公开或商业应用前,请确认当前的使用政策。

Z.AI:免费定价不等于配额明确

Z.AI 的定价文档将 GLM-4.7-Flash 和 GLM-4.5-Flash 在展示的 Token 类别中列为免费。已核查的公开定价页没有给出明确的 RPM、RPD、TPM 或 TPD 数值。

应将 Z.AI 的配额视为未知:它或许适合手动测试,但不适合直接用于批处理任务;注册时请验证端点、模型可用性和相关条款。

NVIDIA、Hugging Face 与 Mistral:适合探索,但公开配额信息不完整

服务商免费访问信号缺失的公开配额信息实际用途
NVIDIA NIM提供用于原型开发的 Free Inference Endpoints落地页未提供统一的 RPM、Token 额度、绑卡规则或超额价格先测试选定端点,再阅读其模型专属条款
Hugging Face Inference Providers免费用户每月可获 $0.10/month 积分,可能调整没有可直接对比的 RPM 或 TPM 配额无需管理 GPU 基础设施,即可进行小规模的路由模型实验
Mistral StudioStudio 提供 Free mode 和 API 快速入门文档首页未说明配额或绑卡规则在决定接入付费配置前,先体验 Mistral API 功能

免费 LLM API 到底该怎么选?

你的优先需求首选起点原因
通用原型开发Google AI StudioGemini 提供清晰的通用基线;可在 AI Studio 查看当前限制
高频小请求Groq公开了按模型划分的 Free Plan 条目,并有 1,000 RPD 的示例
通过一个 API 使用多个模型OpenRouter提供免费变体、路由能力和 OpenAI 风格接口
Cloudflare 原生应用Workers AI持续提供 10,000 Neurons/天 的额度
公开标注 Token 数最高的试用Cerebras最高可达 1M TPD,但仅限 30 天且需要绑卡的试用
严格不绑定付款方式优先 Groq;极低调用量可选 SambaNovaSambaNova 的 Free Tier 上限为 20 RPD
RAG 组件CohereChat、Embed 和 Rerank 共用同一套试用 Key 生态
测试 GLM FlashZ.AI展示的 Token 价格为 $0,但公开配额未知
无 GPU 条件下探索开源模型Hugging Face提供路由访问,免费用户每月有 $0.10/month

先从一家服务商开始,并为每次请求记录四项数据:模型 ID、HTTP 状态、Token 用量和剩余额度响应头。只有确认第一条路径到底撞上了哪种限制后,再增加第二家服务商;使用多个 Key 并不一定能获得更多容量。

接入前,如何核实免费 LLM API

上线前请确认以下五件事:

  1. 配额单位:该方案按请求、Token、调用次数、金额还是算力单位计算?
  2. 重置机制:是在 UTC 或太平洋时间的固定时点重置、持续补充、按月续期,还是一次性到期?
  3. 适用范围:限制绑定在模型、项目、账号还是组织上?
  4. 付款条件:添加银行卡是解锁更多容量、激活付费层级,还是试用的强制要求?
  5. 条款与失败路径:该方案是否仅限测试或评估?客户端能否正确处理 HTTP 429,避免引发重试风暴?

免费 LLM API 常见问题

综合来看,哪家免费 LLM API 最好?

通用原型可选 Google AI Studio;需要更高免费请求量可选 Groq;看重模型多样性则可选 OpenRouter。

不用信用卡也能使用免费 LLM API 吗?

可以。经验证的对比资料将 Google、Groq、OpenRouter 的基础路径、Cloudflare 的基础额度和 SambaNova 的 Free Tier 列为无需绑卡的选项。Cerebras 的 Free Trial 则需要验证付款方式。

免费 LLM API 真的会永久提供吗?

部分定期额度会在条款持续有效期间保留,但试用、促销价格以及轮换的 :free 路由,都不是服务商范围内永久有效的额度。依赖某一家之前,请确认最新文档和模型状态。

免费 LLM API 能用于生产环境吗?

除非其当前条款、配额和模型可用性能满足你的生产要求,否则不要将其作为唯一后端。

达到免费额度上限后会怎样?

服务商通常会返回限流或配额错误。Groq 文档说明了 HTTP 429 的处理方式;Cloudflare 表示 Free 方案的每日额度耗尽后,后续操作会失败;Cerebras 的试用积分到期或用完后则会停止访问。

>_AIReiter 模型目录

快速访问与本指南相关的模型 API

Gemini 3.6 Flash

Chat

一款用于高级推理、编程和智能体任务的快速 Gemini 模型。

Google获取 API Key >

Gemini 2.5 Pro

Chat
Google获取 API Key >

GPT-6 Astra

Chat

OpenAI 面向复杂推理、编程和长上下文工作的前沿模型。

OpenAI获取 API Key >

Gemini 3.8 Flash

Chat

面向长上下文编码、智能体和企业工作流的 Flash 文本模型。

Google获取 API Key >

Claude Fable 5

Chat

一款用于深度推理和复杂长篇任务的高级 Claude 模型。

Anthropic获取 API Key >

最新文章

如何在 Janitor AI 中使用 DeepSeek(2026 设置指南)

2026-09-08

Muse Spark 1.3 API 定价:Standard 与 Contributor 怎么选

2026-09-08

GPT-6 Astra API 评测(2026):为智能体而生,不是即插即用

2026-09-07

Kling API 集成指南:官方平台与聚合商怎么选(2026)

2026-09-07
AIREITER

有问题?请联系我们
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI 视频

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI 图片

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

博客

查看全部 →

公司

隐私政策服务条款退款政策

© 2026 AIReiter。保留所有权利。