寫程式最便宜的 LLM API,不一定就是整體成本最低的選擇。以原始 token 單價計算,DeepSeek V4 Flash最低,但這次實測的回答不算最乾淨;Kimi K2.7 Code 完整遵守所有要求,而 GPT-5.4 mini 的完成速度快了四倍。只要錯誤修補需要重試,真正最省的選項就可能改變。
同一道 TypeScript bug,四款平價 API 怎麼答
2026 年 7 月 30 日,我們將同一個 TypeScript 並行處理 bug 交給四款現行、具備程式開發能力的 API。任務刻意設計得小而嚴格:修正 mapLimit,使其保留輸出順序、在呼叫使用者程式碼前驗證 concurrency limit 為正整數、絕不超出該限制,並在第一次 rejection 後停止排程新工作。每份回答還必須剛好附上三個測試。
這只是一次任務的指令遵循樣本,並非程式能力基準測試。每次直接執行都只送出一則使用者訊息、不使用工具、輸出上限為 8,000 tokens、採用供應商預設 temperature,並依照上述四項要求人工審核。耗時包含共用 gateway,以及供應商與網路的額外延遲。
| 模型 | 已驗證的每 1M input / output 價格 | 耗時 | 實作結果 | 測試 | 結論 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 | 59.4s | 最終版本符合全部四項要求 | 涵蓋指定行為 | 可用回答中最便宜;回覆較雜亂 |
| MiniMax M3 | $0.30 / $1.20 promotional | 60.7s | 順序與並行數正確;rejection 狀態晚了一層 promise 才設定 | 三個相關測試 | 嚴格停止規則下接近及格 |
| Kimi K2.7 Code | $0.95 / $4.00 | 64.3s | 排程器乾淨,結果有序且立即進入 settled 狀態 | 涵蓋順序/並行、rejection 與無效限制 | 最完整的回答 |
| GPT-5.4 mini | $0.75 / $4.50 | 13.6s | 正確的 worker-pool 實作 | 三個測試,但沒有測無效限制 | 最快的乾淨實作;測試有缺口 |
DeepSeek V4 Flash:單價最低,但需要多做清理
DeepSeek V4 Flash 最後確實給出了正確實作:預先配置結果陣列、依輸入索引寫入、驗證 limit,並透過共用 rejection flag 停止 workers。問題出在整份回答本身。它在最終函式之前先輸出了一段已放棄的實作,裡面有未解決的 promise 路徑,之後才說明那個草稿哪裡錯了。
如果開發者會逐行審閱,這還可以接受;但對於只擷取第一個程式碼區塊並自動套用的 agent,這種回答就不合適。只有在測試與型別檢查是必經關卡時,我才會把 DeepSeek 當作低成本的第一輪嘗試。
MiniMax M3:價格很吸引人,但有一個並行邊界問題
MiniMax M3 的程式碼簡潔,也透過 out[i] 維持輸出順序。不過,它是在外層 Promise.all 的 catch 中設定 rejection flag,而不是在觀察到 callback 失敗的 worker 內立即設定。多了這一層 promise reaction,其他 workers 看見停止旗標前就多出一個小而可避免的排程窗口。
它的定價確實相當出色。MiniMax 官方頁面顯示,M3 在 input 不超過 512K tokens 時,享有永久 50% 折扣,價格為$0.30/M input 與 $1.20/M output。超過 512K 後,折扣方案價格升至 $0.60/$2.40。
Kimi K2.7 Code:本次樣本中最完整的答案
Kimi K2.7 Code 給出的是單一完整實作,而不是先丟草稿再修正。它會在排程前驗證限制值、維護依索引排列的結果陣列、限制活躍 promises 數量,並在 rejection handler 中設定 settled。它的三個測試也覆蓋了這個函式最常出問題的三處:完成順序、失敗後是否繼續排程,以及無效限制值。
Kimi 是這次執行中最慢的回覆,單位 token 成本也高於 DeepSeek 與折扣後的 MiniMax。不過,若是無人看管的 agent 工作,而遺漏邊界案例的代價高於多花一美分 API 費用,我會願意支付這個價差。
GPT-5.4 mini:程式碼最快,但測試選擇不完整
在釐清後的那次執行中,GPT-5.4 mini 以 13.6 秒交出最快的正確實作。它的程式碼符合四項要求,包括在排程任何 callback 前驗證 limit。三個測試檢查了順序、峰值並行數與 rejection 行為,但模型沒有測試自己寫的 limit 驗證。
第一次嘗試時,即使 prompt 已提供完整函式,它仍要求提供 repository path。這一次失誤不足以構成整體模型可靠度評分,但再次印證程式開發 agent 的原則:驗證產出物,不要迷信模型名稱。
100 次程式開發呼叫,實際要花多少
用具體的程式開發工作負載,比較 token 價格會容易得多。假設每個請求送入 8,000 個新的 input tokens,內容包括指令與 repository context,並收到 2,000 個 tokens 的修補程式與說明。依照上方已驗證費率,未計快取時,100 次呼叫的成本介於$0.168 與 $1.56之間。
| 模型 | 100 次呼叫成本 | 公式 |
|---|---|---|
| DeepSeek V4 Flash | $0.168 | 100 × (0.008 × $0.14 + 0.002 × $0.28) |
| MiniMax M3 | $0.48 | 100 × (0.008 × $0.30 + 0.002 × $1.20) |
| GPT-5.4 mini | $1.50 | 100 × (0.008 × $0.75 + 0.002 × $4.50) |
| Kimi K2.7 Code | $1.56 | 100 × (0.008 × $0.95 + 0.002 × $4.00) |
當驗收檢查不夠嚴格時,一次失敗後的重試就可能抵銷單次呼叫的價差;一個壞掉的 patch 若一路進入 code review 或 production,造成的成本遠高於任何一筆 API 呼叫費。
Repository agent 可以重複使用穩定的 prompt 與程式碼前綴。官方 cached-input 費率分別為:DeepSeek V4 Flash $0.0028/M、MiniMax M3 $0.06/M、Kimi K2.7 Code $0.19/M,以及 GPT-5.4 mini $0.075/M;變動中的檔案與工具 trace 仍會以新的 input 計費。
聊天、分類及其他非程式開發工作負載所需的能力門檻不同;更完整的標準費率可參考這份最便宜 LLM API 比較。
「Groq 和 Cerebras 的推論速度快得驚人,但一旦到達中等用量,就會嚴格限流。」—— 一位開發者在 r/ArtificialInteligence 的回報
請把這則回報當成測試案例,而不是供應商整體表現的結論:用你實際會執行的並行 worker 數量,測量入選 API 的表現。
不同程式開發流程,該選哪個最省
最便宜的程式開發 LLM API,取決於你的流程如何攔截失敗。當每個 patch 都會通過確定性的檢查時,DeepSeek 是成本最低的預設選擇;若需要模型自行涵蓋邊界案例,從這次樣本來看 Kimi 是更安全的選擇。
| 工作流程 | 推薦選擇 | 原因 | 不適合的情況 |
|---|---|---|---|
| 有測試與 typecheck 的原型開發 | DeepSeek V4 Flash | $0.14/$0.28,且最終實作正確 | 你的自動化流程可能未經審閱就套用第一個程式碼區塊 |
| 無人看管的 coding-agent 迴圈 | Kimi K2.7 Code | 本次樣本中實作與測試選擇最完整 | 延遲或最低 token 帳單是硬性限制 |
| 互動式編輯器操作 | GPT-5.4 mini | 13.6s,本次執行遠快於另外三款 | 你預期產生的測試會涵蓋每一項明示的不變條件 |
| 大 context 的預算型工作 | MiniMax M3 | 永久折扣下,512K 以內為 $0.30/$1.20 | 嚴格的並行/錯誤語意是任務核心 |
我不會只因為某個小型通用聊天模型的 output 價格是 $0.08/M,就拿它來寫程式。低價程式開發 API 的前提,是它能產出通過你的工作流程所能執行檢查的 patch。如果沒有自動化檢查,選擇時應看模型首輪回答的完整度,而不是最低的牌價。
別固定一個模型:先便宜、失敗再升級
採用雙層路由,才能在不盲目信任低價模型的前提下,真正利用最低 token 成本。模型選擇應根據確定性檢查的結果,而非 prompt 長度或主觀信心分數。
- 第一輪先送給 DeepSeek V4 Flash。
- 執行 repository 的 formatter、type checker、unit tests,以及任何任務專屬的 hidden test。
- 所有檢查通過後才接受該 patch。
- 若失敗,將原始任務、失敗的 patch 與精簡測試輸出送給 Kimi K2.7 Code;若互動延遲更重要,則改用 GPT-5.4 mini。
- 限制升級嘗試次數,避免 agent 無限消耗成本處理單一問題。
這種路由讓簡單任務保有 DeepSeek 的次美分經濟性,只有已量測到的失敗才支付較高費率。透過單一 OpenAI-compatible 模型層,切換只需更改模型名稱,不必整合四套不同服務;AIReiter LLM API directory 透過單一 endpoint 提供這些模型。
常見問題
哪一個是最便宜的程式開發 LLM API?
本次測試中,DeepSeek V4 Flash 是最便宜、具備程式開發能力的 API,input 為 $0.14/M、output 為 $0.28/M。它最後產出了正確實作,但回答中也包含一份損壞且已放棄的草稿,因此應搭配自動化檢查使用。
DeepSeek 適合用於 coding agent 嗎?
若 agent 接受 patch 前必須通過測試、型別檢查與格式化,DeepSeek V4 Flash 足以作為低成本的第一輪嘗試。對於缺乏強力檢查的無人看管任務,在這個單一任務樣本中,Kimi K2.7 Code 的回答更完整。
API 計費和程式開發訂閱制,哪個比較便宜?
以表中費率搭配實測的 input 與 output tokens 計算每月 API 成本,再與訂閱價格、請求上限,以及方案是否包含 API 或 agent 存取權比較。兩種計費模式沒有哪一種天生比較便宜。
一句話路由規則
程式開發任務先從 DeepSeek V4 Flash 開始,只有通過確定性檢查的 patch 才接受;失敗時升級至 Kimi K2.7 Code,對延遲敏感的工作則使用 GPT-5.4 mini。價格已驗證;品質排序則來自一項受限任務,仍應在你自己的 repository 上重新測試。
