免費 AI API 限制一覽
AI API 所謂的「免費」,幾乎從來都不代表無限使用,通常只是提供受速率限制的免費層級;有些是永久配額,有些則是用完即止的促銷額度。以下服務商都能免信用卡申請 API 金鑰,但實際可用量差距很大,從每天只能呼叫幾次,到每天數萬次都有。
本文數據已於 2026 年 8 月根據各服務商的官方文件逐一核對。不過 API 限制變動頻繁,如果要拿來規劃正式環境,仍應先到服務商的控制台確認最新數字。
| 服務商 | 免費層級重點 | 資料政策摘要 | 適合用途 |
|---|---|---|---|
| Google AI Studio | 免信用卡、免綁定計費帳戶;Gemini 模型;各專案配額於太平洋時間午夜重置 | 免費層級的提示內容會用於訓練 Google 產品 | 模型選擇多、快速原型 |
| Groq | Llama 3.1 8B 每日 14,400 次;Compound 模型每分鐘 70K tokens | 預設不保留資料;可啟用 ZDR | 高頻率短提示 |
| OpenRouter | 每天 50 次免費請求;25+ 款免費模型;支援 BYOK | 依上游服務商而異 | 測試多種模型 |
| GitHub Models | 15 RPM / 150 RPD(低層級);8,000 個輸入 tokens + 4,000 個輸出 tokens | 適用 Microsoft 資料條款 | 搭配 PAT 快速實驗 |
| Cloudflare Workers AI | 每天 10,000 Neurons(Llama 3.1 8B Fast 約可輸出 280K tokens) | 明確承諾不拿資料訓練 | 重視隱私的工作 |
| Cohere | 每分鐘 20 次請求;每月 1,000 次呼叫 | 評估用途授權 | 測試 embeddings、reranking |
| NVIDIA NIM | 註冊送 1,000 點額度;使用商務電郵最多可得 5,000 點 | 免費端點的使用紀錄會被記錄 | 一次性模型測試 |
| Hugging Face | 200+ 款模型共用每月 $0.10 額度 | 額度可能調整 | 示範規模的推論 |
| Mistral | 免費 API 金鑰模式;限制顯示於 Admin Panel | 文件提到可選擇零保留 | 歐洲託管模型 |
以上九家都能免信用卡申請金鑰。其中七家提供會定期補充的免費層級,NVIDIA 與 Hugging Face 則是一次性消耗額度,不會重新整理。各家差距相當懸殊:GitHub Models 每天只能使用 8 次 DeepSeek-R1,Groq 的 Llama 3.1 8B 則每天提供 14,400 次請求。
Google AI Studio:最適合拿來起步的免費方案
如果你想免填付款資料,直接試用前沿級模型,Google AI Studio 通常是最自然的起點。不需要信用卡,也不用先建立計費帳戶;登入 Google 帳戶、產生 API 金鑰後就能開始呼叫。
免費層級涵蓋 Gemini 系列,包括 Gemini 3.6 Flash、3.5 Flash、2.5 Pro 等模型,也提供文字與 embeddings 端點。配額以專案為單位設定,並於太平洋時間午夜重置。
註冊後才能看到實際配額
Google 沒有像 Groq 或 OpenRouter 那樣,公開一張完整的「免費層級」速率限制表。每分鐘請求數、每分鐘 tokens,以及每日 tokens 等實際上限,必須建立專案後,到 AI Studio 控制台內查看。這讓事前估算容量變得不容易;比較實際的做法是先建立專案、打開 Quotas 頁面,再根據看到的上限設計應用程式。
免費層級的提示內容會拿去訓練 Google 產品
這是 Google 免費方案最需要注意的地方。Google 的免費層級條款明確表示,你提交的提示內容與產生內容可能會被用來改進 Google 產品。若工作涉及敏感、專有或個人資料,免費層級基本上就不適合。付費 Gemini API(透過 Google Cloud 並綁定計費帳戶)不包含這項訓練條款,但也因此需要信用卡。
Gemini 的免費圖片生成功能同樣不在免費範圍內;免費層級只涵蓋文字與 embeddings。
Groq:每日上限清楚,適合大量短請求
對於高頻率、短提示的工作負載,Groq 的免費層級是目前最慷慨的選擇。官方文件直接列出各項限制,而且限制是以組織為單位,不是按使用者計算。快取 tokens 不會計入速率限制。
| 模型 | RPM | RPD | TPM | TPD |
|---|---|---|---|---|
| Llama 3.1 8B Instant | 30 | 14,400 | 6,000 | 500,000 |
| Llama 3.3 70B Versatile | 30 | 1,000 | 12,000 | 100,000 |
| GPT-OSS-120B | 30 | 1,000 | 8,000 | 200,000 |
| GPT-OSS-20B | 30 | 1,000 | 8,000 | 200,000 |
| Qwen 3.6-27B | 30 | 1,000 | 8,000 | 200,000 |
| Groq Compound | 30 | 250 | 70,000 | — |
| Groq Compound Mini | 30 | 250 | 70,000 | — |
| Whisper Large V3 | 20 | 2,000 | — | 每天 28,800 音訊秒數 |
最突出的是 Llama 3.1 8B,每天 14,400 次請求足以支撐認真的原型開發,甚至低流量的正式端點。Compound 系列則提供最高的每分鐘 tokens 額度,達 70,000 TPM;代價是每日請求上限較低,只有 250 RPD。
Groq 預設不保留推論資料,也提供 Zero Data Retention(ZDR)選項,因此是免費服務商中隱私表現較好的選擇之一。主要限制在於 8B 模型每分鐘 6,000 TPM 的上限,遇到長上下文或大量生成時可能成為瓶頸。
OpenRouter:每天 50 次免費請求
OpenRouter 本身是 API 閘道,不是模型託管商。它提供一批由 OpenRouter 補貼的模型,使用時只要在模型名稱後加上 :free,或改用 openrouter/free 自動路由器即可。
速率限制:免費模型上限為每分鐘 20 次,以及每天 50 次請求。一次購買 $10 額度後,永久免費模型的每日上限會提高至 1,000 次。除此之外,還要另外受到上游服務商自身節流限制的影響。
免費模型目錄:截至 2026 年 8 月,OpenRouter 列出 25+ 款免費模型,比 7 月的 15 款更多,涵蓋文字生成、embeddings 與 reranking。陣容包括 NVIDIA 的 Nemotron 3 Ultra、Super 與 Nano 系列(上下文最長達 1M tokens)、Google 的 Gemma 4、Cohere 的 North Mini Code、OpenAI 的 gpt-oss-20b,以及其他數款模型。由於服務商會加入或撤下免費端點,目錄內容變動相當頻繁。
BYOK(Bring Your Own Key):OpenRouter 支援 60+ 家推論服務商的 BYOK。使用自己的服務商 API 金鑰時,推論費用會直接由底層服務商收取,OpenRouter 只計算路由層費用。BYOK 的免費額度現在依方案而定,並以牌價推論成本計算,不再是固定的請求次數;最新條款請查看 OpenRouter pricing page。
實際使用時要記住:「免費」代表不收取 tokens 費用,不一定代表不保留資料。上游服務商各自制定資料政策,其中部分服務商(包括 NVIDIA 與 Poolside)明確記錄免費端點的使用情況,或可能把提示內容用於訓練。如有需要,請針對各服務商設定隱私過濾條件。
另外六種免費方案
GitHub Models
GitHub Models 提供熱門模型的 Playground 與 API 端點,使用 GitHub Personal Access Token(PAT)即可存取。低層級提供 15 RPM、150 RPD;高層級則是 10 RPM、50 RPD。每次請求最多可包含 8,000 個輸入 tokens 與 4,000 個輸出 tokens。DeepSeek-R1 也能使用,但每天限制 8 次請求。
GitHub Models 以 PAT 驗證,不用另外註冊帳戶,做快速實驗很方便。不過 tokens 與請求數上限都相當緊,實際用途主要還是原型開發。
Cloudflare Workers AI
Cloudflare Workers AI 每個帳戶每天提供 10,000 Neurons,並於 00:00 UTC 重置。以 Llama 3.1 8B Fast 計算,約等於每天 280,000 個輸出 tokens。Cloudflare 也免費託管 FLUX 進行圖片生成,是本文唯一免信用卡使用圖片生成的選項。
在本文列出的服務商中,Cloudflare 的隱私立場最明確:未經同意,不會使用客戶的提示內容或輸出來訓練模型,也不會用於改進服務。因此,Workers AI 是處理敏感資料時的首選。
Neurons 的計算方式不像請求數或 tokens 那麼直觀;你需要查看 Workers AI 控制台,了解不同模型每個 token 會消耗多少 Neurons。
Cohere、NVIDIA、Hugging Face、Mistral
Cohere 的免費層級每分鐘提供 20 次請求,每月最多 1,000 次 API 呼叫。這個額度適合評估與測試,不適合正式營運規模;Cohere 的 Command 模型與 embeddings 端點都包含在內。
NVIDIA NIM 註冊後提供 1,000 點額度,使用商務電郵最多可得 5,000 點。這些是一次性消耗額度,不是每月重新補充的配額,而且官方沒有公布點數與請求次數之間的換算方式。OpenRouter 上的 NVIDIA 免費模型另有警告:免費端點的使用情況會被記錄,NVIDIA 也建議不要提交機密或個人資料。
Hugging Face 透過 Serverless Inference API,為 200+ 款模型提供每月約 $0.10 的免費推論額度。官方明確註明這項額度可能調整。它只適合示範規模的使用:可以試試模型,但不適合拿來建構完整服務。
Mistral 提供免費 API 金鑰模式,但實際限制只有在 Admin Panel 內才能查看。Mistral 文件提到 zero-retention 選項,卻沒有把它說明成免費層級的明確預設政策,因此對重視隱私的使用情境來說,判斷難度較高。
不只文字:圖片、語音與 embeddings
有兩家服務商涵蓋文字以外的使用情境:
- Cloudflare Workers AI 免費提供 FLUX 圖片生成,是本文唯一免信用卡的圖片生成選項。Gemini 的圖片模型不在免費層級內。
- Groq Whisper 的免費方案提供語音轉文字,每天 2,000 次請求,以及每天 28,800 秒音訊額度。
OpenRouter 的免費模型目錄也擴充了 NVIDIA 提供的 embeddings 與 reranking 模型,讓免費層級具備資訊檢索與 RAG 能力。
資料重要的話,最後其實只剩兩個選擇
如果工作涉及敏感、專有或受法規管制的資料,本文列出的大多數服務商都不適合:
- Google AI Studio 會使用免費層級的提示內容訓練產品。
- NVIDIA 會記錄免費端點的使用情況,並警告不要提交機密資料。
- OpenRouter 的免費模型會沿用上游服務商的資料政策,其中部分服務商(Poolside、Liquid)明確會用免費提示內容進行訓練。
- Hugging Face 與 Mistral 的資料保留條款較不透明,或可能隨時變更。
因此,真正具備清楚、明確隱私承諾的只剩兩家:
- Cloudflare Workers AI:未經同意,不會用於訓練或改進服務。
- Groq:預設不保留推論資料,並提供 Zero Data Retention 選項。
如果你的工作負載重視隱私,使用量又屬於低至中等,Cloudflare 是更穩妥的選擇。如果需要更高吞吐量,而且能接受 Groq 每分鐘 tokens 的限制,則可以選擇啟用 ZDR 的 Groq。
免費層級不夠用之後怎麼辦?
本文列出的每一種免費方案,最終都會遇到節流。真正需要考慮的是,觸及上限之後要怎麼銜接。
比較建議的做法是在同一家服務商上改用按量計費,而不是為了閃避限制,在多個免費層級之間跳來跳去。不同服務商各有 SDK、資料政策與故障模式,為了省下 API 費用而增加的營運複雜度,通常很快就會超過節省的金額。
上述服務商中,有四家支援 OpenAI 相容端點:Groq、OpenRouter、Cloudflare Workers AI,以及 Google AI Studio(透過 OpenAI-compatible wrapper)。也就是說,從免費方案升級到付費方案時,只要修改 base URL 與 API key,不必重寫應用程式程式碼。
比較實際的升級路徑是:想要模型選擇多,就先從 Google AI Studio 免費方案開始;重視吞吐量,則可選 Groq。當你持續碰到每日上限,再為同一家服務商加入計費帳戶,切換到按量計費。OpenRouter 適合多模型測試,而資料隱私不可妥協時,就選 Cloudflare。
常見問題
哪些免費 AI API 不需要信用卡?上述九家服務商都能免信用卡申請 API 金鑰:Google AI Studio、Groq、OpenRouter、GitHub Models、Cloudflare Workers AI、Cohere、NVIDIA、Hugging Face 與 Mistral。
哪個免費 API 的每日請求上限最高?Groq 的 Llama 3.1 8B Instant 每天提供 14,400 次請求,是本文列出的服務商中,定期免費層級每日請求數最高的方案。
OpenRouter 真的免費嗎?OpenRouter 的 :free 模型變體不收取每 token 費用,但每天最多 50 次請求;購買 $10 額度後可提高至 1,000 次。BYOK 模式可以使用自己的服務商金鑰,並享有依方案而定的免費額度。兩種模式都不是真正的無限使用。
免費 AI API 可以用於正式環境嗎?可以,但必須在速率限制範圍內使用。Groq 與 Cloudflare 分別在吞吐量與隱私方面,提供本文中最適合正式環境的免費層級。當免費上限開始頻繁打斷工作負載,就應該升級到同一家服務商的付費方案。
哪個免費 API 最適合處理重視隱私的資料?Cloudflare Workers AI 與 Groq 是唯一在免費層級提供明確「不訓練、不保留」承諾的服務商。其他服務不是會用免費提示內容訓練(Google),就是會記錄使用情況(NVIDIA),或取決於上游服務商的政策(OpenRouter)。