11 家免費 LLM API:額度與限制快速比較
以下資訊於 2026 年 9 月 8 日查核。實際限制可能依模型、帳號、地區與即時需求而異;最終仍應以各供應商連結的官方文件為準。
信用卡、商業用途與 OpenAI 相容性標示,另以 Free LLM API Hub comparison 作為交叉參考來源。
| 供應商 | 免費方案與公開額度 | 信用卡/付款條件 | API 形式 | 使用條款訊號 | 主要限制 |
|---|---|---|---|---|---|
| Google AI Studio | Gemini 各模型不同:5–30 RPM、15–1,000 RPD;Gemini 2.5 Flash 範例為 10 RPM / 250 RPD | 未列出需信用卡;可能須完成帳號與專案驗證 | 在已驗證比較中支援 OpenAI 相容格式 | 標示可商業使用;仍請確認現行條款 | Google 指出目前生效的限制須在 AI Studio 中查看 |
| Groq | 以 qwen/qwen3.6-27b 為例:30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPD | Free Plan 不需付費升級;Developer tier 則需要付款方式 | 是,大致相容 | 標示可商業使用;Free Plan 的限制不同於付費容量 | 限制套用於組織與模型層級 |
| OpenRouter | 免費變體:累計購買額度低於 $10 時為 20 RPM / 50 RPD;累計購買至少 $10 後為 1,000 RPD | 基本免費路線不需信用卡;購買額度可提高上限 | 是,統一為 OpenAI Chat API 格式 | 標示可商業使用;免費模型供應狀態會變動 | 較高的每日額度須以購買為前提 |
| Cloudflare Workers AI | 帳號共用 10,000 Neurons/day,每天於 00:00 UTC 重設 | 基本額度免費;部分模型需要啟用付費帳務 | 在已驗證比較中支援 OpenAI 相容格式 | 標示可商業使用;可用模型因資格而異 | Neuron 衡量的是運算量,不是固定 Token 額度 |
| Cerebras Inference | Free Trial:指定模型為 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD | 必須驗證付款方式 | 引用文件未能確認 | 試用存取;額度 30 天後到期 | $5 試用額度並非永久提供 |
| SambaNova Cloud | Free Tier:指定模型為 20 RPM / 20 RPD / 200,000 TPD | Free Tier 不需付款方式;綁定後會啟用付費 Developer Tier | 是,但有文件說明的差異 | 標示可商業使用;請檢查模型條款 | 20 RPD 的限制相當嚴格 |
| Cohere | 每月 1,000 次呼叫;Chat 為 20 RPM、Embed 為 2,000 inputs/min、Rerank 為 10 RPM | 已驗證比較未列出需信用卡;註冊時請再確認 | 在已驗證比較中支援 OpenAI 相容格式 | 已驗證比較標示為僅供評估 | 呼叫次數不能直接換算成 Token |
| Z.AI | GLM-4.7-Flash 與 GLM-4.5-Flash 在所列 Token 類別中為 $0;未公開 RPM/TPM | 已驗證比較未列出需信用卡 | 在已驗證比較中支援 OpenAI 相容格式 | 標示可商業使用;請確認模型條款 | 每 Token $0 不代表可用容量已公開 |
| NVIDIA NIM | 提供用於原型開發的 Free Inference Endpoints;首頁沒有統一額度 | 付款條件依端點而定;請查看模型頁面 | 引用文件未能確認 | 引用頁面顯示原型/評估用途訊號 | 首頁標示免費,不等於已公布額度 |
| Hugging Face Inference Providers | 免費用戶每月獲得 $0.10/month 額度,可能變動;未公布 RPM/TPM | 官方定價文件未說明信用卡條件 | 在已驗證比較中支援 OpenAI 相容格式 | 請查看供應商與模型條款 | 這是小額點數,不是請求額度 |
| Mistral Studio | Studio 提供免費模式;文件首頁未公開額度 | 首頁未說明信用卡條件 | 文件提供 OpenAI 風格端點;未宣稱完全相容 | 帶有試用與探索/評估用途訊號;請確認條款 | 免費模式不代表不限量或適合正式環境 |
別只看表格中最大的數字來排序。請求、Token、呼叫次數、美元與 Neuron 是不同單位;會到期的試用額度,也不能當成可定期重置的免費方案。
若你要找影像、語音、Embedding 或其他模態的服務,可參考更完整的免費 AI API 比較。本文聚焦於託管式 LLM 推論。
額度較明確、可持續使用或免信用卡的選擇
Google AI Studio:泛用原型開發的實際起點
Google 的官方速率限制文件指出,Gemini 額度取決於模型與專案。常見衡量維度包括 RPM、輸入 TPM 與 RPD;額度是套用在 Google Cloud 專案,而非個別 API key,開發者應在 AI Studio 查看目前實際生效的數值。每日請求額度會在太平洋時間午夜重設。
次要的已驗證比較資料顯示,Gemini 2.5 Flash 為 10 RPM 與 250 RPD,不同模型的範圍則是 5–30 RPM 與 15–1,000 RPD。這些數字適合拿來規劃,但不應視為保證,因為 Google 明確表示實際限制會變動。
Gemini 適合一般用途與多模態原型;不過特定模型的每日上限,可能會限制高頻請求的工作負載。
Groq:公開請求額度最具競爭力的免信用卡選項
Groq 的速率限制文件依模型與組織列出限制。目前 Free Plan 中,qwen/qwen3.6-27b 的資料為 30 RPM、1,000 RPD、8,000 TPM 與 200,000 TPD。其他模型的每日與 Token 上限並不相同。
「速率限制適用於組織層級,而非個別使用者。」— Groq rate-limit documentation
建立多把 API key 不會自動帶來彼此獨立的組織總容量。Groq 文件也說明了處理 HTTP 429 回應時可使用的 retry-after 與 x-ratelimit-* 標頭。
若選定模型能勝任你的任務,Groq 是高頻小型請求很清楚的起點。請直接確認目標模型的資料列,不要把供應商層級的標示誤認為統一額度。
OpenRouter:免費模型最有彈性的統一路由入口
OpenRouter 以單一 API 介面提供一批會更替的免費模型變體。現行免費存取比較顯示:帳號累計購買額度不足 $10 時,限制為每分鐘 20 次、每天 50 次;累計購買額度達至少 $10 後,每日額度提高至 1,000 次請求。換言之,較高的上限必須先完成購買。
官方限制文件指出,額外帳號或 API key 不會改變平台的全域速率限制。服務可透過 key endpoint 與速率限制錯誤標頭提供額度資訊。
你可以使用 :free 後綴固定指定模型,也能使用 openrouter/free,由系統自動選擇當下可用的免費模型。路由器可依 tool calling、圖片理解等能力篩選,但底層模型仍可能隨時更換。
OpenRouter 適合實驗與備援路由,不適合用在高度依賴某一款免費模型穩定行為的應用程式。
Cloudflare Workers AI:給的是固定運算量,不是免費 Token
Cloudflare 官方定價頁面表示,每個帳號每天可免費使用共計 10,000 Neuron。這份額度由所有 Workers AI 活動共用,並會在 00:00 UTC 重設。若使用 Workers Free 方案,額度耗盡後,後續操作會失敗。
Neuron 代表單次請求所需的 GPU 運算量。Cloudflare 提供的是各模型對應的 Token 換算參考,而非承諾 10,000 Neuron 等於固定數量的提示詞。
Cloudflare 也表示,部分較新的 DeepSeek、GLM 與 Kimi 模型必須設定付費帳務方式才能使用。因此,「免費 10,000 Neuron」不代表所有模型都能在未啟用帳務的情況下存取。
有免費入口,但附帶條件
Cerebras:適合評估期,不是永久免費 API
Cerebras 的速率限制文件列出,指定 Free Trial 模型可使用 5 RPM、30,000 uncached TPM、90,000 total TPM 與 1 million TPD。文件同時指出,其 Token bucket 是持續補充,而不是等待單純的每日重設。
新帳號可獲得 $5 免費點數,但會在 30 天後到期;啟用 Playground 與 API 存取還須驗證付款方式。點數到期或用完後,除非再購買額度,否則服務將停止。查核的文件沒有說明任何永久、定期重置的公開免費額度。
Cerebras 適合短期評估,但不該成為需要在試用期後持續運作之專案的唯一依賴。
SambaNova Cloud:免費與付費的帳務界線最明確
SambaNova 以帳務狀態定義 Free Tier:只有在未綁定付款方式時才適用。官方文件顯示,指定 Free Tier 模型的限制是 20 RPM、20 RPD 與 200,000 TPD。即使 Token 額度尚未用完,20 RPD 也可能先讓高頻輪詢工作流程停擺。
一旦綁定付款方式,就會啟用付費的 Developer Tier,因此不應將其列入免費方案。SambaNova 也會透過回應標頭提供剩餘請求數與重設時間資訊。
SambaNova 僅適合低流量概念驗證;在任何 Agent 工作流程上線前,都應先驗證 20 RPD 的上限是否足夠。
Cohere:RAG 很實用,但必須精算呼叫次數
Cohere 的試用 key 與以 Token 計量的免費層不同。目前已驗證比較顯示,其額度為每月 1,000 次呼叫,各端點限制則為 Chat 20 RPM、Embed 2,000 inputs/min、Rerank 10 RPM。Cohere FAQ 將 trial key 說明為免費但有使用限制。
這樣的組合適合用於檢索增強生成實驗:同一個專案可以測試生成、Embedding 與重排序。但它並不等於可支撐高流量聊天後端的免費方案。不要把每月 1,000 次呼叫直接和每天 100 萬 Token相比。
已驗證比較將此試用標示為僅供評估。在用於公開或商業應用之前,請先確認目前的使用政策。
Z.AI:價格免費,不代表額度已知
Z.AI 的定價文件將 GLM-4.7-Flash 與 GLM-4.5-Flash 在顯示的 Token 類別中列為免費。這次查核的公開定價頁面,沒有提供具體的 RPM、RPD、TPM 或 TPD 數字。
應將 Z.AI 的可用額度視為未知:它或許適合手動測試,但不適合批次工作;註冊時請確認端點、模型可用性與使用條款。
NVIDIA、Hugging Face、Mistral:適合探索,但公開額度資訊不完整
| 供應商 | 免費存取訊號 | 未公開的額度資訊 | 實務用途 |
|---|---|---|---|
| NVIDIA NIM | 提供用於原型開發的 Free Inference Endpoints | 首頁沒有統一的 RPM、Token 額度、信用卡規則或超額費率 | 先測試特定端點,再閱讀該模型的專屬條款 |
| Hugging Face Inference Providers | 免費用戶每月有 $0.10/month 點數,可能變動 | 沒有可直接比較的 RPM 或 TPM 額度 | 無須自行管理 GPU 基礎設施,即可進行小型路由模型實驗 |
| Mistral Studio | Studio 提供免費模式與 API 快速入門 | 文件首頁沒有額度或信用卡規則 | 投入付費設定前,先試用 Mistral API 功能 |
該選哪一個免費 LLM API?
| 你的優先需求 | 建議起點 | 原因 |
|---|---|---|
| 泛用型原型開發 | Google AI Studio | Gemini 是明確的泛用基準,AI Studio 可查看目前生效的限制 |
| 高頻小型請求 | Groq | 提供公開、依模型區分的 Free Plan 資料列,並有 1,000 RPD 範例 |
| 透過一套 API 使用多種模型 | OpenRouter | 提供免費變體、路由功能與 OpenAI 風格介面 |
| Cloudflare 原生應用 | Workers AI | 每天固定提供 10,000 Neurons/day 額度 |
| 公開標示中 Token 數最高的試用方案 | Cerebras | 最高可達 1M TPD,但僅限 30 天且需綁卡的試用 |
| 嚴格要求不綁付款方式 | 優先選 Groq;極低流量可考慮 SambaNova | SambaNova 的 Free Tier 上限僅 20 RPD |
| RAG 元件 | Cohere | Chat、Embed、Rerank 都在同一個 trial-key 生態系中 |
| 測試 GLM Flash | Z.AI | 顯示的 Token 價格為 $0,但公開額度未知 |
| 不使用 GPU 探索開源模型 | Hugging Face | 提供路由存取,免費用戶另有 $0.10/month |
先選一家供應商,並針對每次請求記錄四個欄位:模型 ID、HTTP 狀態、Token 用量與剩餘限制標頭。只有在確認第一條路由實際碰到哪種限制後,再加入第二家;使用多把 key 不一定會增加可用容量。
正式使用前,如何驗證免費 LLM API
上線前,請確認以下五件事:
- 額度單位:方案是以請求數、Token、呼叫次數、美元,還是運算單位計算?
- 重設機制:是在 UTC 或太平洋時間的固定時間點重設、持續補充、每月續發,還是一次性到期?
- 限制範圍:上限是綁定模型、專案、帳號,還是組織?
- 付款條件:綁卡後是取得更高容量、切換為付費層,還是試用時的必要條件?
- 條款與失敗處理:方案是否僅限測試或評估?客戶端能否處理 HTTP 429,避免產生重試風暴?
免費 LLM API 常見問題
整體來說,哪一款免費 LLM API 最好?
Google AI Studio 適合泛用型原型;Groq 適合較高的免費請求量;OpenRouter 適合想使用多種模型的情境。
我可以不使用信用卡就用免費 LLM API 嗎?
可以。已驗證比較將 Google、Groq、OpenRouter 基本路線、Cloudflare 基本額度與 SambaNova Free Tier 列為免信用卡選項。Cerebras 的 Free Trial 則必須驗證付款方式。
免費 LLM API 真的是永久的嗎?
部分定期續發的方案會在條款持續有效期間提供服務,但試用方案、促銷價格與輪替的 :free 路由,都不是供應商全域且永久的額度。依賴某一家服務前,請確認目前文件與模型狀態。
免費 LLM API 可以用於正式環境嗎?
除非現行條款、額度與模型可用性都能滿足正式環境需求,否則不要將免費 API 當成唯一後端。
碰到免費額度上限時會怎樣?
供應商通常會回傳節流或額度錯誤。Groq 文件說明了 HTTP 429 的處理方式;Cloudflare 表示 Workers Free 方案的每日額度用盡後,後續操作會失敗;Cerebras 則會在試用點數到期或耗盡時停止存取。