2026 年最便宜的 LLM API:實測價格與最佳選擇

最近更新: 2026-07-30 10:15:08

到了 2026 年 7 月,最便宜的 LLM API,每百萬個輸入 token 的成本已低於 0.1 美分。以 Groq 的 Llama 3.1 8B Instant為例,官方本月價格頁列出的費率是:每百萬輸入 token $0.05、輸出 token $0.08

不過,牌價通常不是你的最終成本。DeepSeek 的 Prompt Cache 可將有效輸入成本壓低 50~120 倍;Gemini、Mistral 與 Groq 的 Batch API 還能再省 50%。如果只比較表面單價,很可能不是多花錢,就是選錯適合工作負載的供應商。以下整理各家低價方案,所有數字均於 2026 年 7 月 30 日向供應商定價頁核對,並說明各情境該選誰。

2026 年 7 月價格最低的 LLM API 一覽

目前最便宜的 LLM API,多半是小型模型、效率導向模型,或由推論服務專家提供的模型,而非前沿實驗室的旗艦端點。以下均為主要供應商直連的標準隨用隨付價格;免費層欄位則標示是否提供免費選項。本文不納入自行託管與限時促銷方案。

模型(供應商)輸入 / 1M輸出 / 1M快取命中輸入免費層最適合的用途
Llama 3.1 8B Instant (Groq)$0.05$0.08$0.025標準價格最低
GPT-OSS 20B (Groq)$0.075$0.30$0.0375低價且達 1000 tok/s
Gemini 2.5 Flash-Lite (Google)$0.10$0.40Batch 價格最低(輸入 $0.05)
Ministral 3B (Mistral)$0.10$0.10Leanstral(限時)微型模型固定低價
DeepSeek V4 Flash (DeepSeek)$0.14$0.28$0.0028推理任務最低價選擇
Mistral Small 4 (Mistral)$0.15$0.60−90%均衡的通用用途
Gemini 3.5 Flash-Lite (Google)$0.30$2.50大規模多模態任務
最便宜的 LLM API:每百萬 token 的輸入與輸出價格,標準隨用隨付,於 2026 年 7 月核對

價格下限是 Groq Llama 3.1 8B 的 $0.05/$0.08,表中沒有其他模型能追平它的輸出單價。Gemini 2.5 Flash-Lite 只有在獨立的 Batch 級距,才能做到輸入 $0.05;標準價格仍是 $0.10。若目標是低成本推理,DeepSeek V4 Flash 是首選。

為何它們比 GPT 或 Claude 便宜

低價主要來自三個因素:模型規模較小或經過效率調校,例如 Llama 3.1 8B、Ministral 3B 與 Flash-Lite 系列;推論專家以較低成本的基礎設施營運,例如 Groq、DeepSeek;以及 Batch 與快取 token 的折扣。表中多數是開放權重模型,包括 Llama、DeepSeek、Mistral;Gemini Flash-Lite 則是 Google 自家的專有模型系列,以低價爭取大量使用需求。若工作量極高且穩定,自行託管開放權重模型可能更便宜,但前提是你要自行承擔硬體與維運成本;對多數團隊來說,託管 API 仍是成本基準。

免費層才是最低成本的下限

若你對「最便宜」的定義就是免費,這幾家都有可用方案:Groq 與 Google 的 Gemini Flash-Lite 系列會在速率限制內免費提供;Mistral 的 Leanstral 則限時免費;GitHub Models 也會以 token 提供免費存取。Google 的免費層會將請求用於產品訓練,付費層則不會。它們的共同限制是速率額度偏緊,且不提供 SLA。我們已在免費 AI API 指南中另行整理免費選項;一旦超過原型階段,真正需要比較的是上表的付費方案。

別只看 token 牌價:快取與 Batch 才決定實際帳單

按輸入 token 的牌價排序,看似清楚的價格表其實漏掉了最關鍵的成本變數。有三項機制能讓實際單價出現數量級的差異,但許多比較要不是忽略,就是把它們藏在細則裡。

「LLM API 低價的巨大迷思。」——一篇討論模型表面低價、但帳單被快取讀取費用主導的 r/LocalLLaMA 討論串。

供應商通常會分別計算快取輸入、新輸入與輸出 token 的費用;看起來便宜的輸入單價,往往反而是帳單中占比最小的一項。比較成本時,請先看這三件事:

  • Prompt Cache。若供應商能重用你先前送出的 prompt 前綴,命中的快取部分只需支付原始輸入價格的一小部分。DeepSeek 的 V4 Flash 快取輸入費率為每百萬 $0.0028,新輸入則為 $0.14,相差 50 倍;V4 Pro 則是$0.0036 對 $0.435,折扣達 120 倍。Groq 的快取輸入半價,Mistral 則折抵 90%。若你的請求共用很長的系統提示詞或文件前綴,卻沒使用支援快取的供應商,每一次請求都得支付完整成本。
  • Batch API。GoogleMistralGroq都為非即時任務提供約50% 的折扣,處理窗口介於 24 小時至 7 天。Gemini 2.5 Flash-Lite 在 Batch 級距的輸入費率會降至 $0.05。凡是不要求次秒級回應的任務,例如夜間摘要、批次分類與資料集標註,都應透過 Batch 處理。
  • 輸出占比高的工作負載。程式碼生成、長篇寫作與 Agent 迴圈,產生的 token 往往遠多於讀取的 token。即使輸入成本相近,Llama 3.1 8B 每百萬輸出 $0.08,仍遠低於 Gemini 2.5 Flash-Lite 的 $0.40。當生成才是瓶頸時,應按輸出價格排序,而不是輸入價格。

實際篩選時,先問三個問題:你的 prompt 是否容易命中快取?工作是否必須即時完成?輸出 token 是否多於輸入?這三個答案重新排列上表的頻率,往往高於任何牌價數字。

不同使用情境,哪個方案最省

以下建議假設你需要的能力門檻高於最小型模型;如果只看絕對單價,Llama 3.1 8B 會出現在每一列。這裡則將快取與 Batch 等適用折扣納入實際成本,並同時考量能力需求。

使用情境最低成本選擇理由
一般聊天 / 分類Mistral Small 4能力高於 3B/8B 基準的中型通用模型;$0.15/$0.60
程式開發與 Agent 迴圈Groq GPT-OSS 20B 或 Llama 3.1 8B輸出價格低於 $0.08,840–1000 tok/s 可讓迴圈維持高速
推理 / 高難度 promptDeepSeek V4 Flash$0.14/$0.28,針對推理調校,且快取折扣高
長上下文文件Gemini 3.5 Flash-Lite上下文窗口大,可先用免費層測試
即時 / 延遲敏感Groq(任一模型)價格低,同時在吞吐量領先,達 840–1000 tok/s
大量 / 夜間任務Gemini 2.5 Flash-Lite(Batch)Batch 輸入 $0.05,非同步任務可省 50%

聚合平台還是直連?什麼情況下轉售商反而更划算

直接使用 DeepSeekGoogleGroqMistral,在相同模型下可拿到最低的單 token 價格;但你必須承擔營運成本:管理不同 API Key、分開計費、某家被限流時手動切換備援,以及針對四套不同 SDK 重做快取與重試邏輯。

這正是聚合平台所解決的問題。OpenRouter收取底層供應商價格,另加5.5% 平台費,沒有其他加價;換來的是一組 Key、一張帳單,以及本清單模型之間的自動故障轉移。依OpenRouter 自己的說明,交叉點約在每月 $50:低於這個金額,5.5% 手續費通常低於串接多家供應商所需的工程時間;高於這個金額,直接使用單一最便宜的供應商,通常在純成本上勝出。實際損益平衡點仍取決於你原本需串接幾家供應商,以及流量波動有多大。

聚合平台透過單一 OpenAI 相容端點提供多種模型

轉售閘道如 AIReiter 也是相同概念:在 DeepSeek、Gemini、Groq 與 Mistral 前面提供一個 OpenAI 相容端點。要切換模型時,只要改模型名稱,不必重寫用戶端。

常見問題

最便宜的 LLM API 是哪一個?

截至 2026 年 7 月,在本次比較中,Groq 的 Llama 3.1 8B Instant每百萬 token $0.05/$0.08,提供最低的標準隨用隨付費率。Gemini 2.5 Flash-Lite 僅在 Batch 級距可比肩 $0.05 的輸入價格,標準費率為 $0.10。

寫程式最便宜的 LLM API 是哪個?

用於程式碼生成與 Agent 迴圈時,Groq 的GPT-OSS 20B($0.075/$0.30)或 Llama 3.1 8B($0.05/$0.08)憑藉輸出價格與速度勝出。若需要 Groq 以外、專為程式開發調校的低價模型,可考慮 Mistral 的 Devstral Small 2,費率為 $0.10/$0.30。

免費 LLM API 層級足以用於正式環境嗎?

通常不夠。Groq、Gemini Flash-Lite 與 GitHub Models 的免費層都會限制每分鐘請求數,也不保證服務可用性。用於原型開發沒有問題;超過初期測試階段後,應改用上表的付費方案。

聚合平台或轉售 API 會比直連更貴嗎?

以單一 token 計價來看,是,會略高一些。OpenRouter 在供應商價格上加收 5.5% 費用,轉售閘道也會納入類似的額外成本。但當用量低,或你否則得維護多個供應商串接時,它們的總成本可能更低;一旦手續費高過便利性帶來的價值,直連就會更便宜。

最便宜的 LLM API 每月要花多少錢?

若每月使用 1,000 萬輸入 token 與 500 萬輸出 token,Groq Llama 3.1 8B 的成本約為$0.90,包括 $0.50 輸入與 $0.40 輸出。Gemini 2.5 Flash-Lite 以標準價格約 $3.00,使用 Batch 則約 $1.50。同樣的用量若採用前沿專有模型,每百萬輸入 $5+,成本會高出許多倍。

該怎麼選

只要供應商支援,就開啟 Prompt Cache;非即時工作則交給 Batch。這兩個設定能省下的錢,通常遠比在供應商之間切換還多。