AIREITER

最佳翻譯 LLM 實測:6 款模型,2 款成本高出 10 倍

最近更新: 2026-07-29 12:21:01

若重視語氣與品牌感,選 Claude Sonnet 5;大量翻譯需求則選 DeepSeek V4 Flash,每 1,000 次任務約只要 $0.10;追求整體速度,GPT-5.6 Terra 是最穩妥的全方位選擇。這是我們在 2026 年 7 月 17 日實測六款模型後的結論。

我們用完全相同的三組翻譯提示詞呼叫各模型 API,直接比對原始輸出。令人意外的不是品質:六款模型都能正確翻譯德文技術內容,其中五款更是在日文對話的主詞省略情境中零失誤。真正拉開差距的是成本:兩款看似便宜的模型,每次請求卻消耗大量推理 token,結果單次翻譯成本比 Claude 高出 8~10 倍,幾乎逼近 DeepL 按字元計費的價格。

到了 2026 年,挑選翻譯用 LLM 的關鍵已不在於「它能不能翻」——它們全都能——而是能否在不悄悄拉高帳單的前提下,符合你的內容類型與處理量。

不同翻譯工作,該選哪一款模型?

你的工作負載建議選擇原因實測每 1,000 次任務成本
行銷文案、品牌語氣Claude Sonnet 5讀起來像以目標語言原生寫成,而非翻譯腔~$1.06
大量處理:商品資料、文件、字幕DeepSeek V4 Flash三項測試全數正確,成本遠低於其他選項~$0.10
混合型工作負載、最低延遲GPT-5.6 Terra回應時間 3.0~4.3 秒,格式處理最乾淨~$0.88
術語表強制套用、CAT 工具流程DeepL內建術語庫與整合功能,是 LLM API 尚未提供的能力每 1M 字元 $27.50

以上成本為三項測試的平均值,以輸出 token × 2026 年 7 月官方費率計算,再推估為 1,000 次短篇翻譯;完整測量數據見下表。有一類情境不在本次測試範圍內:即時語音對話。Google 提供專用的 Gemini 3.5 Live Translate 版本,價格為每百萬 token $3.50/$21;本文會提及,但未納入實測。

測試方法與條件

我們在 2026 年 7 月 17 日,以相同文字、每題各執行一次,測試三組提示詞與六款模型:英譯日行銷文案,測試語氣;英譯德 API 文件,測試術語;以及日譯英日常對話,測試主詞省略與上下文理解——這正是 CJK 語言組合的經典失誤點。CJK 指的是中文、日文與韓文,也是機器翻譯品質抱怨特別集中的三種語言。

參測模型包括 GPT-5.6 Terra、Claude Sonnet 5、DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5.2 與 Kimi K2.6。所有呼叫皆經由同一個 gateway 帳號,以預設設定執行。因此延遲數字可供模型間橫向比較,但實際結果仍會隨所在地區與供應商負載而變動。

以下列出三段原文,方便你自行重跑測試:

EN→JA(行銷):「更快把你的想法化為成果。我們的平台接手繁瑣雜務,讓團隊專注於真正重要的事。」 EN→DE(技術):「若請求超出速率限制,API 會回傳 429 狀態碼。請以指數退避方式重試,並遵守 Retry-After 標頭。冪等鍵可在重試成功時避免重複收費。」 JA→EN(對話):「昨天那件事,你已經跟部長說了?」「不,還沒。我打算看時機再說,但大概會被罵吧。」「最好先去鋪陳一下。我們部長最討厭最後才被告知。」

以下是各模型與各任務的全部測量結果,延遲為實際經過秒數,token 數取自 usage 物件中的輸出 token:

模型EN→JAEN→DEJA→EN平均單次任務成本
GPT-5.6 Terra3.0s / 464.3s / 673.2s / 63$0.00088
Claude Sonnet 53.5s / 604.0s / 1463.5s / 111$0.00106
DeepSeek V4 Flash5.2s / 4214.3s / 3714.7s / 323$0.00010
DeepSeek V4 Pro16.5s / 76918.0s / 98919.6s / 946$0.00078
GLM-5.230.8s / 1,90629.0s / 1,59035.2s / 1,985$0.00804
Kimi K2.619.6s / 2,84948.5s / 2,23523.6s / 2,413$0.01000

單次任務成本 = 輸出 token × 供應商官方輸出價格。每題輸入約為 60~110 token,即使套用 GPT-5.6 Terra 費率,增加的成本也低於 $0.0003;後文的每百萬字元圖表則已納入輸入成本。所有價格均為 2026 年 7 月 17 日的官方牌價,不是我們帳號實際取得的折扣費率。

三題的抽樣測試無法替 100 種語言組合排名,我們也沒有這樣宣稱。不過,即便是小樣本,仍足以看出持續存在的差異,而這次的差距相當明顯。

測試一:英譯日行銷文案

提示詞要求將這句 SaaS 登陸頁文案自然、禮貌地改寫為日文:「更快把你的想法化為成果。我們的平台接手繁瑣雜務,讓團隊專注於真正重要的事。」

Claude Sonnet 5 寫出的文案是:

アイデアを、もっとスピーディーにカタチへ。面倒な作業はプラットフォームにお任せください。

這就是日本文案寫手會採用的語域:以片假名書寫的「カタチ」以及逗號切分的節奏,都是登陸頁常見的表現手法,不是教科書式文法。GPT-5.6 Terra 與 DeepSeek V4 Pro 緊追在後,也給出乾淨、商務感明確的譯文,例如「アイデアを、より迅速に形に。」

DeepSeek V4 Flash 是六款中最直譯的一款:「アイデアをより速く実現しましょう。当社のプラットフォームが雑務を代行するため…」文法沒有問題,但一看就有翻譯感。若要放上產品頁,建議再由人工潤飾;用於支援文章或內部文件則已相當足夠。

這裡的差異確實存在,但幅度不大:六款模型都能產出可用的日文。只有品牌語氣工作,Claude 每 1,000 次任務多約 $1 的成本才特別值得;本次其他測試中,這個優勢沒有如此關鍵。

測試二:英譯德技術文件

我們翻譯了兩句 API 文件,內容包含速率限制、HTTP 429、指數退避與冪等鍵。六款模型的技術術語全數正確,也都採用了自然的德文文件慣例,例如 Ratenlimit、Statuscode 429、exponentielles Backoff、Idempotenzschlüssel。

唯一看得出的差異是:GPT-5.6 Terra 將 Retry-After 加上程式碼格式,符合真實德文 API 文件排版標頭名稱的方式。這是貼心細節,而不是品質落差。

針對資源充足的歐洲語言之間的一般技術文件,本次樣本沒有任何模型出錯;在這一代模型中,品質差異小到難以觀察。若這就是你的主要工作負載,請依價格與速度選擇,而不是品質。以每百萬 token 輸入 $0.14、輸出 $0.28 計算,DeepSeek V4 Flash 因而成為預設答案。

測試三:主詞省略的日譯英對話

日文經常省略句子主詞,譯者必須從上下文推斷誰做了什麼。本次對話也包含「根回し」(nemawashi),意指在正式決策前私下建立共識,是沒有直接英文對應詞的文化脈絡用語。

六款模型中有五款都處理正確。主詞指涉無誤,nemawashi 也被譯為「lay the groundwork」、「sound him out beforehand」或「give him a heads-up」,都是站得住腳的選擇。Claude 的版本最像母語對話,例如「he's probably gonna chew me out」。

18 份輸出中唯一真正的錯誤來自 DeepSeek V4 Pro。它將建議下一步做法的「先に根回ししといたほうがいい」,譯成了「You should've laid the groundwork first」——這成了對已錯失行動的過去式遺憾。只差幾個字,意思卻剛好相反;同事說的是前一句,而你聽成後一句,接下來的行動就會不同。

一次執行出現一個時態錯誤,只是一筆資料,不足以為模型下定論;我們在 DeepSeek V4 Flash vs Pro comparison 中,會更深入比較兩個 DeepSeek 版本。但這也是很好的提醒:流暢與忠實是兩回事。這句英文讀起來完全自然,意思卻錯了。合約、醫療內容,或任何誤讀時態會造成金錢損失的內容,無論選哪款模型,都應編列人工審校。

token 消耗陷阱:為何牌價表會誤導人

這是會改變採購決策的發現。以每百萬輸出 token 計算,GLM-5.2 為 $4.40、Kimi K2.6 為 $4.00,連 Claude Sonnet 5 每百萬 token $10 的一半都不到;但換算成實際完成一次翻譯的成本,兩者卻高出 8~10 倍。

每 1,000 次短篇翻譯的實測成本水平長條圖:Kimi K2.6 $10.00、GLM-5.2 $8.04、Claude Sonnet 5 $1.06、GPT-5.6 Terra $0.88、DeepSeek V4 Pro $0.78、DeepSeek V4 Flash $0.10

原因在於這兩款模型都會在回答前執行可見的推理鏈,而推理 token 也會按輸出 token 計費。翻譯一句行銷文案時,Kimi K2.6 輸出了 2,849 個 token,GLM-5.2 輸出 1,906 個 token,但最終譯文其實只有 40~60 個 token。Claude Sonnet 5 在同一任務花了 60 個 token;GPT-5.6 Terra 則是 46 個。

延遲也呈現相同模式。GPT-5.6 Terra 與 Claude Sonnet 5 在三項任務中皆於 3~4 秒內回覆;DeepSeek V4 Flash 需時 4~5 秒,DeepSeek V4 Pro 為 16~20 秒,而 GLM-5.2 與 Kimi K2.6 每次請求介於 20 至 48 秒。

這帶來兩條實務原則。第一,翻譯這類短篇、高量任務,應以實測的單次任務成本比較模型,而非牌價;跑 20 次請求後查看 usage 欄位即可。第二,翻譯時請關閉或降低推理強度:DeepSeek 將思考與非思考端點分開,GLM 與 Kimi 則在請求主體中提供思考參數。三項測試裡,推理鏈沒有帶來任何可觀察到的輸出品質提升。

大量翻譯時,成本會差多少?

將實測 token 消耗放大到 100 萬個英文字元的來源文本,約等於 250,000 個 token,成本差距會更加驚人:

翻譯 100 萬字元成本的水平長條圖:DeepL API Growth 超額用量 $27.50、Kimi K2.6 $24.20、GLM-5.2 $19.05、GPT-5.6 Terra $4.38、Claude Sonnet 5 $3.90、DeepSeek V4 Pro $1.98、DeepSeek V4 Flash $0.28

DeepSeek V4 Flash 翻譯相當於一本完整小說的文字量,約只需 $0.28。相同內容量若走 DeepL API,在 Growth 方案超額費率下需 $27.50,差距達 98 倍。這與廣泛流傳於 r/LocalLLaMA、題為 "LLMs are 800x cheaper for translation than DeepL" 的分析方向一致;該文使用規模更小的自架模型,因此得出更大的倍數。

也請注意圖表最上方:若看實測 token 消耗,重推理的開放權重模型幾乎快追上 DeepL 的成本。沒有 token 測量,單位價格根本不能當作成本估算。

以下三項定價資訊值得在導入前先掌握,均已於 2026 年 7 月 17 日確認:

  • DeepL 的免費方案改了。 API Developer 方案現在提供一次性的 1,000,000 字元額度,不再是你仍會在舊版文件與論壇回答中看到的每月 500,000 字元額度。Growth 方案每月 $26,按年計費,內含每年 12M 字元;超出後每增加 100 萬字元收費 $27.50。
DeepL API 定價頁面,顯示 Developer 免費方案、每月 $26 的 Growth 方案,以及 Enterprise 客製定價
  • DeepSeek 的計費遠低於其他家。V4 Flash 每百萬 token 輸入 $0.14、輸出 $0.28,快取命中時的輸入價格更降至 $0.0028。舊的 deepseek-chat 模型名稱將於 2026 年 7 月 24 日退役。
DeepSeek API 定價頁面,顯示 V4 Flash 與 V4 Pro 的 token 費率
  • Claude Sonnet 5 目前採上市優惠價。2026 年 8 月 31 日前,每百萬 token 為輸入 $2、輸出 $10,之後調整為 $3/$15。它的新 tokenizer 對相同文字也會產生約多 30% 的 token,而我們的成本計算已納入這點。若規畫使用到 9 月以後,兩項因素都必須納入預算。
  • Batch API 可將帳單減半。OpenAI、Anthropic 與 Google 都為非同步批次處理提供約 50% 折扣。翻譯工作通常不太在意延遲,這幾乎是白拿的優惠:採用批次價格後,GPT-5.6 Terra 每百萬字元約為 $2.19,Claude Sonnet 5 約為 $1.95。

哪些情況 DeepL 或 Google Translate 仍更適合?

按字元成本來看,LLM 明顯占優;但有三種需求,答案仍偏向傳統翻譯服務:

  • 強制套用術語。DeepL 提供術語表與術語庫,可保證同一術語每次都譯成相同結果。LLM 只能透過提示詞要求並自行驗證,這是機率性的行為,不是強制機制。
  • CAT 工具與工作流程整合。如果你的翻譯記憶儲存在 CAT(電腦輔助翻譯)工具中,DeepL 的連接器可以直接整合。
  • 大規模次秒級延遲。傳統神經機器翻譯引擎的回應通常快於通用 LLM;若是內嵌於 UI 的即時翻譯,這很重要。

即時語音則不適合交給傳統 NMT 或聊天型 LLM。Google 為專用的 Gemini 3.5 Live Translate 版本定價每百萬 token $3.50/$21,另有按音訊分鐘計費的費率;我們已在 Gemini 3.5 Live Translate breakdown 中說明。

罕見語言與低資源語言的情況,支援範圍比品質排名更優先:在比較其他任何項目之前,先確認你的語言組合是否受到支援。DeepL 支援約 30 種語言;大型 LLM 可處理超過一百種,但越接近長尾語言,品質下降越明顯。

開源與本機部署選項

GLM-5.2 與 Kimi K 系列都公開了開放權重,因此若自行部署,上述 token 消耗問題可被解決:你能控制取樣設定,並完全關閉推理鏈。

若要用單張 GPU 在本機翻譯,Qwen3-30B-A3B 是 r/LocalLLaMA threads on local translation models 中一再被推薦、適合歐洲語言譯為英文的選擇。隨著語言組合愈冷門,社群通常會建議改用更大的模型。選擇本機模型的主要理由,多半是隱私,例如合約或尚未發布的產品,以及零邊際成本,而非品質;同一批討論串中,託管的前沿模型仍被認為翻得更好。

另一個值得關注的新選項是:Kimi K3 本週以開放權重形式推出,託管價格為每百萬 token $3/$15。我們測試的是 K2.6,因為 K3 API 存取權當時仍在逐步開放;若 K3 延續 K 系列高 token 消耗的特性,同樣必須注意實測成本這項前提。

自己重做一次比較

要重現本文的比較,約 20 次 API 呼叫就夠了:從你的內容挑兩句話,送到每個候選模型,再從每份回應的 usage 物件讀取實際 token 數。這次 18 次請求的總成本不到 $0.15。

麻煩的地方在於,你得管理來自五個供應商的六把 API key。我們透過單一 AIReiter 帳號執行全部六款模型;它在一個相容 Anthropic 的端點後方轉售主流模型 API 存取權,Claude 系列 key 的價格約為牌價五分之一。也就是一把 key,所有上述模型使用相同的 wire format。

如果你的翻譯量確實很大,花一小時以自己的內容抽測,會勝過任何排名,包括這篇文章。各模型的品質已經十分接近,最終決策應由你的語言組合、語氣要求與實測 token 消耗來決定。

常見問題

ChatGPT 和 Gemini,哪個更適合翻譯?

在我們的測試中,GPT-5.6 Terra 在三項任務都很快、正確,且格式乾淨。我們沒有將 Gemini 納入正面對決,因為它不在使用的 gateway 中;不過其公開定價具有競爭力,3.5 Flash 為每百萬 token $1.50/$9,且它是唯一提供專用即時語音翻譯模型的供應商。

目前最準確的 AI 翻譯工具是什麼?

對於高資源語言組合,前沿模型之間的準確度差異很小;我們測試的六款模型都能零錯誤翻譯德文技術內容。差異主要集中在語氣,例如 Claude 在日文行銷文案表現最佳,以及主詞省略與時態等邊緣情境;DeepSeek V4 Pro 便出現了本次樣本唯一的實質錯誤。

最適合翻譯的開源 LLM 是哪一款?

GLM-5.2 與 Kimi K2.6 都公開了權重,且在本次測試中翻譯正確;自行託管可關閉令其 API 單次任務成本偏高的推理鏈。若使用消費級硬體,Qwen3-30B-A3B 是常見的社群推薦。

LLM 能取代人工譯者嗎?

內部文件、支援內容與大量商品文字:大致可以,視模型而定,按字元計費約為 DeepL 的 1~16%,DeepSeek V4 Flash 約 1%、Claude Sonnet 5 約 14%、GPT-5.6 Terra 約 16%。但合約、醫療文本與品牌行銷活動,測試三的時態錯誤就是最好的警訊。流暢的輸出仍可能顛倒原意,因此在誤讀代價高的地方,仍要保留人工審核。

2026 年 DeepL 還值得用嗎?

有三種情況值得:需要強制術語表、CAT 工具整合,以及次秒級延遲。除此之外,按字元計算的成本很難合理化;也請注意,免費方案現在是一次性的 1M 字元額度,不再是每月提供。

延伸閱讀