到了 2026 年 7 月,最便宜的 LLM API,每百萬個輸入 token 的成本已低於 0.1 美分。以 Groq 的 Llama 3.1 8B Instant為例,官方本月價格頁列出的費率是:每百萬輸入 token $0.05、輸出 token $0.08。
不過,牌價通常不是你的最終成本。DeepSeek 的 Prompt Cache 可將有效輸入成本壓低 50~120 倍;Gemini、Mistral 與 Groq 的 Batch API 還能再省 50%。如果只比較表面單價,很可能不是多花錢,就是選錯適合工作負載的供應商。以下整理各家低價方案,所有數字均於 2026 年 7 月 30 日向供應商定價頁核對,並說明各情境該選誰。
2026 年 7 月價格最低的 LLM API 一覽
目前最便宜的 LLM API,多半是小型模型、效率導向模型,或由推論服務專家提供的模型,而非前沿實驗室的旗艦端點。以下均為主要供應商直連的標準隨用隨付價格;免費層欄位則標示是否提供免費選項。本文不納入自行託管與限時促銷方案。
| 模型(供應商) | 輸入 / 1M | 輸出 / 1M | 快取命中輸入 | 免費層 | 最適合的用途 |
|---|---|---|---|---|---|
| Llama 3.1 8B Instant (Groq) | $0.05 | $0.08 | $0.025 | 有 | 標準價格最低 |
| GPT-OSS 20B (Groq) | $0.075 | $0.30 | $0.0375 | 有 | 低價且達 1000 tok/s |
| Gemini 2.5 Flash-Lite (Google) | $0.10 | $0.40 | — | 有 | Batch 價格最低(輸入 $0.05) |
| Ministral 3B (Mistral) | $0.10 | $0.10 | — | Leanstral(限時) | 微型模型固定低價 |
| DeepSeek V4 Flash (DeepSeek) | $0.14 | $0.28 | $0.0028 | 無 | 推理任務最低價選擇 |
| Mistral Small 4 (Mistral) | $0.15 | $0.60 | −90% | 無 | 均衡的通用用途 |
| Gemini 3.5 Flash-Lite (Google) | $0.30 | $2.50 | — | 有 | 大規模多模態任務 |
價格下限是 Groq Llama 3.1 8B 的 $0.05/$0.08,表中沒有其他模型能追平它的輸出單價。Gemini 2.5 Flash-Lite 只有在獨立的 Batch 級距,才能做到輸入 $0.05;標準價格仍是 $0.10。若目標是低成本推理,DeepSeek V4 Flash 是首選。
為何它們比 GPT 或 Claude 便宜
低價主要來自三個因素:模型規模較小或經過效率調校,例如 Llama 3.1 8B、Ministral 3B 與 Flash-Lite 系列;推論專家以較低成本的基礎設施營運,例如 Groq、DeepSeek;以及 Batch 與快取 token 的折扣。表中多數是開放權重模型,包括 Llama、DeepSeek、Mistral;Gemini Flash-Lite 則是 Google 自家的專有模型系列,以低價爭取大量使用需求。若工作量極高且穩定,自行託管開放權重模型可能更便宜,但前提是你要自行承擔硬體與維運成本;對多數團隊來說,託管 API 仍是成本基準。
免費層才是最低成本的下限
若你對「最便宜」的定義就是免費,這幾家都有可用方案:Groq 與 Google 的 Gemini Flash-Lite 系列會在速率限制內免費提供;Mistral 的 Leanstral 則限時免費;GitHub Models 也會以 token 提供免費存取。Google 的免費層會將請求用於產品訓練,付費層則不會。它們的共同限制是速率額度偏緊,且不提供 SLA。我們已在免費 AI API 指南中另行整理免費選項;一旦超過原型階段,真正需要比較的是上表的付費方案。
別只看 token 牌價:快取與 Batch 才決定實際帳單
按輸入 token 的牌價排序,看似清楚的價格表其實漏掉了最關鍵的成本變數。有三項機制能讓實際單價出現數量級的差異,但許多比較要不是忽略,就是把它們藏在細則裡。
「LLM API 低價的巨大迷思。」——一篇討論模型表面低價、但帳單被快取讀取費用主導的 r/LocalLLaMA 討論串。
供應商通常會分別計算快取輸入、新輸入與輸出 token 的費用;看起來便宜的輸入單價,往往反而是帳單中占比最小的一項。比較成本時,請先看這三件事:
- Prompt Cache。若供應商能重用你先前送出的 prompt 前綴,命中的快取部分只需支付原始輸入價格的一小部分。DeepSeek 的 V4 Flash 快取輸入費率為每百萬 $0.0028,新輸入則為 $0.14,相差 50 倍;V4 Pro 則是$0.0036 對 $0.435,折扣達 120 倍。Groq 的快取輸入半價,Mistral 則折抵 90%。若你的請求共用很長的系統提示詞或文件前綴,卻沒使用支援快取的供應商,每一次請求都得支付完整成本。
- Batch API。Google、Mistral與Groq都為非即時任務提供約50% 的折扣,處理窗口介於 24 小時至 7 天。Gemini 2.5 Flash-Lite 在 Batch 級距的輸入費率會降至 $0.05。凡是不要求次秒級回應的任務,例如夜間摘要、批次分類與資料集標註,都應透過 Batch 處理。
- 輸出占比高的工作負載。程式碼生成、長篇寫作與 Agent 迴圈,產生的 token 往往遠多於讀取的 token。即使輸入成本相近,Llama 3.1 8B 每百萬輸出 $0.08,仍遠低於 Gemini 2.5 Flash-Lite 的 $0.40。當生成才是瓶頸時,應按輸出價格排序,而不是輸入價格。
實際篩選時,先問三個問題:你的 prompt 是否容易命中快取?工作是否必須即時完成?輸出 token 是否多於輸入?這三個答案重新排列上表的頻率,往往高於任何牌價數字。
不同使用情境,哪個方案最省
以下建議假設你需要的能力門檻高於最小型模型;如果只看絕對單價,Llama 3.1 8B 會出現在每一列。這裡則將快取與 Batch 等適用折扣納入實際成本,並同時考量能力需求。
| 使用情境 | 最低成本選擇 | 理由 |
|---|---|---|
| 一般聊天 / 分類 | Mistral Small 4 | 能力高於 3B/8B 基準的中型通用模型;$0.15/$0.60 |
| 程式開發與 Agent 迴圈 | Groq GPT-OSS 20B 或 Llama 3.1 8B | 輸出價格低於 $0.08,840–1000 tok/s 可讓迴圈維持高速 |
| 推理 / 高難度 prompt | DeepSeek V4 Flash | $0.14/$0.28,針對推理調校,且快取折扣高 |
| 長上下文文件 | Gemini 3.5 Flash-Lite | 上下文窗口大,可先用免費層測試 |
| 即時 / 延遲敏感 | Groq(任一模型) | 價格低,同時在吞吐量領先,達 840–1000 tok/s |
| 大量 / 夜間任務 | Gemini 2.5 Flash-Lite(Batch) | Batch 輸入 $0.05,非同步任務可省 50% |
聚合平台還是直連?什麼情況下轉售商反而更划算
直接使用 DeepSeek、Google、Groq 或 Mistral,在相同模型下可拿到最低的單 token 價格;但你必須承擔營運成本:管理不同 API Key、分開計費、某家被限流時手動切換備援,以及針對四套不同 SDK 重做快取與重試邏輯。
這正是聚合平台所解決的問題。OpenRouter收取底層供應商價格,另加5.5% 平台費,沒有其他加價;換來的是一組 Key、一張帳單,以及本清單模型之間的自動故障轉移。依OpenRouter 自己的說明,交叉點約在每月 $50:低於這個金額,5.5% 手續費通常低於串接多家供應商所需的工程時間;高於這個金額,直接使用單一最便宜的供應商,通常在純成本上勝出。實際損益平衡點仍取決於你原本需串接幾家供應商,以及流量波動有多大。
轉售閘道如 AIReiter 也是相同概念:在 DeepSeek、Gemini、Groq 與 Mistral 前面提供一個 OpenAI 相容端點。要切換模型時,只要改模型名稱,不必重寫用戶端。
常見問題
最便宜的 LLM API 是哪一個?
截至 2026 年 7 月,在本次比較中,Groq 的 Llama 3.1 8B Instant以每百萬 token $0.05/$0.08,提供最低的標準隨用隨付費率。Gemini 2.5 Flash-Lite 僅在 Batch 級距可比肩 $0.05 的輸入價格,標準費率為 $0.10。
寫程式最便宜的 LLM API 是哪個?
用於程式碼生成與 Agent 迴圈時,Groq 的GPT-OSS 20B($0.075/$0.30)或 Llama 3.1 8B($0.05/$0.08)憑藉輸出價格與速度勝出。若需要 Groq 以外、專為程式開發調校的低價模型,可考慮 Mistral 的 Devstral Small 2,費率為 $0.10/$0.30。
免費 LLM API 層級足以用於正式環境嗎?
通常不夠。Groq、Gemini Flash-Lite 與 GitHub Models 的免費層都會限制每分鐘請求數,也不保證服務可用性。用於原型開發沒有問題;超過初期測試階段後,應改用上表的付費方案。
聚合平台或轉售 API 會比直連更貴嗎?
以單一 token 計價來看,是,會略高一些。OpenRouter 在供應商價格上加收 5.5% 費用,轉售閘道也會納入類似的額外成本。但當用量低,或你否則得維護多個供應商串接時,它們的總成本可能更低;一旦手續費高過便利性帶來的價值,直連就會更便宜。
最便宜的 LLM API 每月要花多少錢?
若每月使用 1,000 萬輸入 token 與 500 萬輸出 token,Groq Llama 3.1 8B 的成本約為$0.90,包括 $0.50 輸入與 $0.40 輸出。Gemini 2.5 Flash-Lite 以標準價格約 $3.00,使用 Batch 則約 $1.50。同樣的用量若採用前沿專有模型,每百萬輸入 $5+,成本會高出許多倍。
該怎麼選
只要供應商支援,就開啟 Prompt Cache;非即時工作則交給 Batch。這兩個設定能省下的錢,通常遠比在供應商之間切換還多。
