最便宜的程式開發 LLM API:4 款模型實測(2026)

最近更新: 2026-07-30 10:59:55

寫程式最便宜的 LLM API,不一定就是整體成本最低的選擇。以原始 token 單價計算,DeepSeek V4 Flash最低,但這次實測的回答不算最乾淨;Kimi K2.7 Code 完整遵守所有要求,而 GPT-5.4 mini 的完成速度快了四倍。只要錯誤修補需要重試,真正最省的選項就可能改變。

同一道 TypeScript bug,四款平價 API 怎麼答

2026 年 7 月 30 日,我們將同一個 TypeScript 並行處理 bug 交給四款現行、具備程式開發能力的 API。任務刻意設計得小而嚴格:修正 mapLimit,使其保留輸出順序、在呼叫使用者程式碼前驗證 concurrency limit 為正整數、絕不超出該限制,並在第一次 rejection 後停止排程新工作。每份回答還必須剛好附上三個測試。

這只是一次任務的指令遵循樣本,並非程式能力基準測試。每次直接執行都只送出一則使用者訊息、不使用工具、輸出上限為 8,000 tokens、採用供應商預設 temperature,並依照上述四項要求人工審核。耗時包含共用 gateway,以及供應商與網路的額外延遲。

模型已驗證的每 1M input / output 價格耗時實作結果測試結論
DeepSeek V4 Flash$0.14 / $0.2859.4s最終版本符合全部四項要求涵蓋指定行為可用回答中最便宜;回覆較雜亂
MiniMax M3$0.30 / $1.20 promotional60.7s順序與並行數正確;rejection 狀態晚了一層 promise 才設定三個相關測試嚴格停止規則下接近及格
Kimi K2.7 Code$0.95 / $4.0064.3s排程器乾淨,結果有序且立即進入 settled 狀態涵蓋順序/並行、rejection 與無效限制最完整的回答
GPT-5.4 mini$0.75 / $4.5013.6s正確的 worker-pool 實作三個測試,但沒有測無效限制最快的乾淨實作;測試有缺口

DeepSeek V4 Flash:單價最低,但需要多做清理

DeepSeek V4 Flash 最後確實給出了正確實作:預先配置結果陣列、依輸入索引寫入、驗證 limit,並透過共用 rejection flag 停止 workers。問題出在整份回答本身。它在最終函式之前先輸出了一段已放棄的實作,裡面有未解決的 promise 路徑,之後才說明那個草稿哪裡錯了。

如果開發者會逐行審閱,這還可以接受;但對於只擷取第一個程式碼區塊並自動套用的 agent,這種回答就不合適。只有在測試與型別檢查是必經關卡時,我才會把 DeepSeek 當作低成本的第一輪嘗試。

MiniMax M3:價格很吸引人,但有一個並行邊界問題

MiniMax M3 的程式碼簡潔,也透過 out[i] 維持輸出順序。不過,它是在外層 Promise.all 的 catch 中設定 rejection flag,而不是在觀察到 callback 失敗的 worker 內立即設定。多了這一層 promise reaction,其他 workers 看見停止旗標前就多出一個小而可避免的排程窗口。

它的定價確實相當出色。MiniMax 官方頁面顯示,M3 在 input 不超過 512K tokens 時,享有永久 50% 折扣,價格為$0.30/M input 與 $1.20/M output。超過 512K 後,折扣方案價格升至 $0.60/$2.40。

MiniMax M3 官方隨用隨付定價,顯示永久 50% 折扣

Kimi K2.7 Code:本次樣本中最完整的答案

Kimi K2.7 Code 給出的是單一完整實作,而不是先丟草稿再修正。它會在排程前驗證限制值、維護依索引排列的結果陣列、限制活躍 promises 數量,並在 rejection handler 中設定 settled。它的三個測試也覆蓋了這個函式最常出問題的三處:完成順序、失敗後是否繼續排程,以及無效限制值。

Kimi 是這次執行中最慢的回覆,單位 token 成本也高於 DeepSeek 與折扣後的 MiniMax。不過,若是無人看管的 agent 工作,而遺漏邊界案例的代價高於多花一美分 API 費用,我會願意支付這個價差。

GPT-5.4 mini:程式碼最快,但測試選擇不完整

在釐清後的那次執行中,GPT-5.4 mini 以 13.6 秒交出最快的正確實作。它的程式碼符合四項要求,包括在排程任何 callback 前驗證 limit。三個測試檢查了順序、峰值並行數與 rejection 行為,但模型沒有測試自己寫的 limit 驗證。

第一次嘗試時,即使 prompt 已提供完整函式,它仍要求提供 repository path。這一次失誤不足以構成整體模型可靠度評分,但再次印證程式開發 agent 的原則:驗證產出物,不要迷信模型名稱。

100 次程式開發呼叫,實際要花多少

用具體的程式開發工作負載,比較 token 價格會容易得多。假設每個請求送入 8,000 個新的 input tokens,內容包括指令與 repository context,並收到 2,000 個 tokens 的修補程式與說明。依照上方已驗證費率,未計快取時,100 次呼叫的成本介於$0.168 與 $1.56之間。

每次使用 8K input 與 2K output tokens 時,100 次程式開發 API 呼叫的成本
模型100 次呼叫成本公式
DeepSeek V4 Flash$0.168100 × (0.008 × $0.14 + 0.002 × $0.28)
MiniMax M3$0.48100 × (0.008 × $0.30 + 0.002 × $1.20)
GPT-5.4 mini$1.50100 × (0.008 × $0.75 + 0.002 × $4.50)
Kimi K2.7 Code$1.56100 × (0.008 × $0.95 + 0.002 × $4.00)

當驗收檢查不夠嚴格時,一次失敗後的重試就可能抵銷單次呼叫的價差;一個壞掉的 patch 若一路進入 code review 或 production,造成的成本遠高於任何一筆 API 呼叫費。

Repository agent 可以重複使用穩定的 prompt 與程式碼前綴。官方 cached-input 費率分別為:DeepSeek V4 Flash $0.0028/MMiniMax M3 $0.06/MKimi K2.7 Code $0.19/M,以及 GPT-5.4 mini $0.075/M;變動中的檔案與工具 trace 仍會以新的 input 計費。

聊天、分類及其他非程式開發工作負載所需的能力門檻不同;更完整的標準費率可參考這份最便宜 LLM API 比較

「Groq 和 Cerebras 的推論速度快得驚人,但一旦到達中等用量,就會嚴格限流。」—— 一位開發者在 r/ArtificialInteligence 的回報

請把這則回報當成測試案例,而不是供應商整體表現的結論:用你實際會執行的並行 worker 數量,測量入選 API 的表現。

不同程式開發流程,該選哪個最省

最便宜的程式開發 LLM API,取決於你的流程如何攔截失敗。當每個 patch 都會通過確定性的檢查時,DeepSeek 是成本最低的預設選擇;若需要模型自行涵蓋邊界案例,從這次樣本來看 Kimi 是更安全的選擇。

工作流程推薦選擇原因不適合的情況
有測試與 typecheck 的原型開發DeepSeek V4 Flash$0.14/$0.28,且最終實作正確你的自動化流程可能未經審閱就套用第一個程式碼區塊
無人看管的 coding-agent 迴圈Kimi K2.7 Code本次樣本中實作與測試選擇最完整延遲或最低 token 帳單是硬性限制
互動式編輯器操作GPT-5.4 mini13.6s,本次執行遠快於另外三款你預期產生的測試會涵蓋每一項明示的不變條件
大 context 的預算型工作MiniMax M3永久折扣下,512K 以內為 $0.30/$1.20嚴格的並行/錯誤語意是任務核心

我不會只因為某個小型通用聊天模型的 output 價格是 $0.08/M,就拿它來寫程式。低價程式開發 API 的前提,是它能產出通過你的工作流程所能執行檢查的 patch。如果沒有自動化檢查,選擇時應看模型首輪回答的完整度,而不是最低的牌價。

別固定一個模型:先便宜、失敗再升級

採用雙層路由,才能在不盲目信任低價模型的前提下,真正利用最低 token 成本。模型選擇應根據確定性檢查的結果,而非 prompt 長度或主觀信心分數。

  1. 第一輪先送給 DeepSeek V4 Flash。
  2. 執行 repository 的 formatter、type checker、unit tests,以及任何任務專屬的 hidden test。
  3. 所有檢查通過後才接受該 patch。
  4. 若失敗,將原始任務、失敗的 patch 與精簡測試輸出送給 Kimi K2.7 Code;若互動延遲更重要,則改用 GPT-5.4 mini。
  5. 限制升級嘗試次數,避免 agent 無限消耗成本處理單一問題。

這種路由讓簡單任務保有 DeepSeek 的次美分經濟性,只有已量測到的失敗才支付較高費率。透過單一 OpenAI-compatible 模型層,切換只需更改模型名稱,不必整合四套不同服務;AIReiter LLM API directory 透過單一 endpoint 提供這些模型。

常見問題

哪一個是最便宜的程式開發 LLM API?

本次測試中,DeepSeek V4 Flash 是最便宜、具備程式開發能力的 API,input 為 $0.14/M、output 為 $0.28/M。它最後產出了正確實作,但回答中也包含一份損壞且已放棄的草稿,因此應搭配自動化檢查使用。

DeepSeek 適合用於 coding agent 嗎?

若 agent 接受 patch 前必須通過測試、型別檢查與格式化,DeepSeek V4 Flash 足以作為低成本的第一輪嘗試。對於缺乏強力檢查的無人看管任務,在這個單一任務樣本中,Kimi K2.7 Code 的回答更完整。

API 計費和程式開發訂閱制,哪個比較便宜?

以表中費率搭配實測的 input 與 output tokens 計算每月 API 成本,再與訂閱價格、請求上限,以及方案是否包含 API 或 agent 存取權比較。兩種計費模式沒有哪一種天生比較便宜。

一句話路由規則

程式開發任務先從 DeepSeek V4 Flash 開始,只有通過確定性檢查的 patch 才接受;失敗時升級至 Kimi K2.7 Code,對延遲敏感的工作則使用 GPT-5.4 mini。價格已驗證;品質排序則來自一項受限任務,仍應在你自己的 repository 上重新測試。