新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
翻譯最佳 LLM:9 個模型、9 種語言,成本相差 400 倍

翻譯最佳 LLM:9 個模型、9 種語言,成本相差 400 倍

目錄
  1. 我們如何測試翻譯品質?
  2. 各語言由哪個模型翻得最好?
  3. 哪些內容仍然難翻?
  4. 相同翻譯在各模型上的成本是多少?
  5. 實際上該選哪個模型?
  6. LLM 現在勝過人工譯者了嗎?
  7. LLM 評審到底有多不穩定?
  8. 常見問題

沒有一個模型能包辦所有語言的最佳翻譯品質:gpt-5.6-sol 在我們評測的 9 種語言中拿下 7 種,claude-fable-5 在韓文略勝一籌,gemini-3.7-flash 在韓文與它打平,並以相同的實測價格在義大利文勝出。視所選 API 而定,翻譯相同 100 萬字元的成本從 $0.26 到 $104 不等。我們以 9 個模型翻譯 9 種語言,共產生 4,210 份譯文,再進行 8,455 次盲測成對判定。本文整理完整結果矩陣。

TL;DR

  • 預設選擇:gpt-5.6-sol 在 8,455 次盲測判定中守住 9 種語言裡的 7 種;韓文由 claude-fable-5 勝出(52%),義大利文則是 gemini-3.7-flash(52%)。
  • 依內容區分:文學內容由 gemini-3.7-flash 勝出(對基準模型勝率 60%);9 個模型在 UI 字串上全部打平,也沒有任何 placeholder 損壞,因此選最便宜的即可;$4 以下的最佳選擇是 qwen3.8-max
  • 每 100 萬字元的成本從 $0.26(deepseek-v4-flash)到 $104(gemini-3.1-pro)不等;$104 主要來自模型拒絕關閉的 1.17M 個 reasoning token。
  • 評審偏好 frontier 模型而非人工後編譯文的比例達 83-100%。

我們如何測試翻譯品質?

測試包含三個要素:平行語料庫、一套正式環境等級的 prompt,以及盲測評審小組。以下所有資料,包括原始判定結果,都收錄在公開 benchmark repo

語料庫。 我們準備了橫跨 6 個領域的 52 個英文片段,讓每個模型翻譯成全部 9 種語言。其中 4 個領域(新聞、社群、口語、文學,各以固定 seed 抽樣 8 個片段)取自 WMT24++(Apache-2.0)。這是年度機器翻譯共同任務 WMT 的評估資料集。WMT24++ 的每個片段都有人工後編參考譯文,也就是先由專業譯者翻譯,再由另一名語言專家審閱修正。資料集涵蓋我們實際提供的所有 locale 與方言:zh_CN、zh_TW、ja、ko、fr、de、es_MX、pt_BR、it。另外 2 個領域由我們自行建立:10 段取自最近 60 天內發布文章的技術文件,同時用來控制訓練資料污染,因為任何模型的訓練資料都不可能包含這些內容;以及 10 個針對已知在地化風險設計的合成 UI 字串,包括缺乏上下文的「Archive」、{placeholder} 完整性與複數形式。抽樣使用固定 seed,片段 ID 也全部公開,避免有人質疑語料經過挑選以迎合特定結果。

評審方式。 每份候選譯文都會以盲測方式,與固定基準模型 gpt-5.6-sol 對同一片段的譯文比較。這也是目前負責翻譯本部落格的模型。三個評審家族(claude-sonnet-5gpt-5.6-lunagemini-3.1-pro)依據改寫自業界標準翻譯錯誤分類 MQM 的準則,彼此獨立評分。項目依優先順序排列,任何準確性錯誤都比文字潤飾更重要:

1. Accuracy     mistranslation, omission, addition, hallucination
2. Terminology  domain terms as a native engineer would keep them
3. Fluency      grammar, natural reading
4. Style        register appropriate to the text type
5. Locale       numbers, dates, units, punctuation width
6. Markup       inline code, placeholders, links preserved exactly

這套依錯誤嚴重度分級的設計,延續了 Error Span Annotation 的核心精神。WMT 自 2024 年起便採用該協定進行人工評估,我們則將它調整為 LLM 成對評審。語料與參考譯文來自 WMT24++ 論文。每組譯文都會評審兩次,第二次交換呈現順序;如果同一評審交換順序後得出矛盾結果,就將該次判定視為平手。三個評審的結果以相同權重計算平均,絕不合併成單一投票;我們也公布各評審的數據,讓模型家族偏差清楚可見。第二組實驗則將三個 frontier 等級模型(gpt-5.6-sol、claude-fable-5、gemini-3.1-pro)與 WMT24++ 的人工參考譯文比較。Placeholder 完整性由程式檢查,而非交給評審判定。

各語言由哪個模型翻得最好?

先說結論:gpt-5.6-sol 不只是這張表的基準模型,也是實測冠軍。下列所有挑戰者都以它為比較對象,沒有任何模型能在超過一種語言中突破 50%。在另一組人工參考譯文實驗裡,評審偏好 sol 譯文而非 WMT24++ 專業後編譯文的比例達 86-100%,也是該實驗三個 frontier 模型中表現最強的。表格顯示對 sol 的勝率,不計平手,並取三個評審的平均值;50% 代表兩者相當。

相較基準模型zhzh-TWjakofrdeesptit
gemini-3.7-flash26%35%43%50%40%37%39%8%52%
claude-fable-519%15%38%52%39%32%31%20%47%
gemini-3.1-pro17%22%24%45%30%21%38%14%25%
qwen3.8-max26%21%18%28%36%17%32%14%25%
kimi-k327%15%23%23%16%24%10%0%24%
claude-sonnet-53%6%9%32%25%27%28%10%9%
deepseek-v4-flash20%6%0%24%22%19%12%7%11%
glm-5.29%3%10%6%7%8%11%7%12%
各語言建議模型solsolsolfable-5solsolsolsol3.7-flash

有 4 點特別明顯。基準模型明確守住 9 種語言中的 7 種,也回頭驗證了當初替我們正式翻譯 pipeline 挑選模型的盲測結果。韓文競爭最激烈:fable-5 以 52% 略勝,3.7-flash 則達到相同水準。如果韓文是主要市場,模型排名確實不同。中國的 open-weight 模型在主場也落敗:簡體中文的 Qwen 勝率為 26%,GLM 只有 9%。GLM-5.2 的失常只限於這項任務,並非整體能力不佳。幾天前同一模型才在我們的結構化輸出研究中完整保住 6/6 個 schema 關鍵字;它只是不擅長翻譯。

哪些內容仍然難翻?

下表依內容類型列出建議模型,以及最強的替代選項。括號內是替代模型對基準模型的勝率,整體中位數則取自全部 8 個挑戰者:

領域建議模型最強替代選項整體中位數
文學gemini-3.7-flash(對基準模型 60%)gpt-5.6-sol8%
新聞gpt-5.6-solgemini-3.1-pro(48%)28%
口語gpt-5.6-solgemini-3.7-flash(43%)25%
社群gpt-5.6-solqwen3.8-max(27%)12%
技術文件gpt-5.6-solfable-5 / 3.7-flash(30%)15%
UI最便宜的模型(deepseek-v4-flash任一模型,判定大多平手(最高 77%)61%

其中一組控制資料需要單獨說明:技術文件來自任何模型都不可能訓練過的段落,而 Gemini 模型在這裡跌幅最大。gemini-3.1-pro 在公開 WMT 領域的平均勝率為 33%,到了新段落只剩 10%。這個差距符合模型熟悉 benchmark 的可能性,也可能是基準模型長期在正式環境翻譯技術內容所帶來的主場優勢,因此我們只標示現象,不做定論。

按內容類型來看,新聞、社群、口語和技術文件仍建議使用基準模型。它在社群內容上的優勢最大,因為俚語、句子片段和隱含上下文會讓所有挑戰者失分,8 個模型中有 3 個勝率低於 10%。文學散文是唯一答案不同的類型:gemini-3.7-flash 以 60% 明確擊敗基準模型,因此類似小說的內容有更便宜、品質也更好的選擇。UI 字串的邏輯則完全相反:只有十來個字的按鈕文案幾乎沒有分歧空間,所以判定大多平手。9 個模型也都完整保留每一個 {seconds}%d{workspace_name},各自都是 27 個裡損壞 0 個。品質無法區分時,價格就是決定因素:UI 字串直接用手上最便宜的模型。Placeholder 損壞這個典型在地化問題,到 2026 年似乎已在模型層解決。

相同翻譯在各模型上的成本是多少?

每 100 萬個輸出字元從 $0.26 到 $104.37 不等,價差達 400 倍。這是將 9 種語言的總實測支出除以總輸出量所得,而且最昂貴的模型並不是最好的:

模型每 100 萬輸出字元成本消耗的 reasoning token勝率範圍
deepseek-v4-flash$0.2600-24%
glm-5.2$2.4803-12%
qwen3.8-max$3.18014-36%
claude-sonnet-5$8.3603-32%
kimi-k3$8.3700-27%
gpt-5.6-sol(基準模型)$13.700不適用
gemini-3.7-flash$14.46505K8-52%
claude-fable-5$39.81015-52%
gemini-3.1-pro$104.371,171,77014-45%

$104 並非品質溢價,而是 thinking 稅。翻譯不需要推理,所有能將 thinking 固定為 0 的模型都能順利完成任務。現行 Gemini 世代拒絕所有關閉參數的寫法,因此 gemini-3.1-pro 在 468 次翻譯中消耗了 1.17M 個 reasoning token,成本是基準模型的 7.6 倍,卻在全部 9 種語言中都輸給它。就連 flash 版本也額外消耗 505K 個 token,最終成本反而高於基準模型。

高性價比選擇也很清楚。如果品質必須接近 frontier 水準,gemini-3.7-flash 是最強的挑戰者:它在 9 種語言中的 7 種,對基準模型有 35-52% 的勝率(50% 代表相當;簡體中文 26% 與葡萄牙文 8% 是弱項),也是唯一在單一內容領域明確勝出的模型(文學,60%)。實測成本與基準模型相差不到 6%,因為強制推理消耗抵銷了 flash 的價格優勢。如果成本最重要,deepseek-v4-flash 的翻譯費用比基準模型低 53 倍,而且從未破壞 placeholder;代價是明顯的品質落差(日文 0% 勝率是實際下限,不是四捨五入誤差)。這對內部內容是合理取捨,但不適合任何面向客戶的內容。

實際上該選哪個模型?

整份結果可以濃縮成以下決策表:

最佳化目標選擇依據
多語言整體品質最佳gpt-5.6-sol面對所有挑戰者仍守住 9 種語言中的 7 種
韓文claude-fable-5,預算有限則用 3.7-flash對基準模型勝率 52%,是唯一有挑戰者勝出的語言;flash 達到相同水準(50%)
義大利文gemini-3.7-flash對基準模型勝率 52%,價格與基準模型相同
文學或類小說內容gemini-3.7-flash對基準模型勝率 60%,是唯一明確勝出的領域
新聞、社群、口語、技術文件基準模型這些領域沒有任何挑戰者超過 48%
UI 字串deepseek-v4-flash各模型判定打平,所有模型都能安全保留 placeholder,因此 $0.26 的模型靠價格勝出
每 100 萬字元低於 $4 的多語言預算方案qwen3.8-max在 9 種語言中,都是 $4 以下級距勝率最佳的模型
內部內容的最低成本deepseek-v4-flash每 100 萬字元 $0.26,比基準模型低 53 倍;需接受 CJK 品質落差
絕不要用於翻譯gemini-3.1-proglm-5.2前者有 7.6 倍的強制 thinking 稅;後者在這項任務上品質崩落

LLM 現在勝過人工譯者了嗎?

在所有 3 個 frontier 模型和全部語言中,評審偏好機器譯文而非 WMT24++ 人工後編參考譯文的比例達 83-100%,唯一例外是 claude-fable-5 的簡體中文,只有 44%。這個數字有兩種解讀,兩者都必須交代。較強的解讀是:WMT24++ 作者已得出結論,LLM 現在是其涵蓋 55 種語言中最好的機器翻譯系統,我們的評審結果與其一致。較保守的解讀是:LLM 評審與 LLM 翻譯器可能共享相同的文體偏好,經過流暢潤飾的機器譯文,或許正好是另一個模型偏好的寫法;參考譯文是人工後編成果,而非文學作品的最高標準。這些數據可以穩妥證明的是:任何我們能建立的自動化評審小組,都已無法將 frontier 機器翻譯與專業人工參考譯文的品質區分開來。真正值得比較的問題因此轉向價格,而兩者差距達數個數量級。

LLM 評審到底有多不穩定?

不穩定到不加防護的單次評審根本不可接受,但防護成本很低。我們將相同譯文組合交換順序後再呈現一次,評審直接自我矛盾,也就是從明確勝出翻成明確落敗的比例,claude-sonnet-5 為 9%、gemini-3.1-pro 為 13%、gpt-5.6-luna 為 19%。我們的協定將每個這類矛盾結果改判為平手,讓位置偏差互相抵銷,而不是持續累積。我們也會連同彙整數據一起公布各評審的勝率,方便確認結論沒有被單一模型家族主導。三個家族對差距幅度偶有不同看法(sonnet-5 對同屬 Claude 家族的模型最嚴格),但在每種語言的勝負方向上完全一致,而本文的結論正是建立在這點上。

常見問題

翻譯該使用哪個 LLM?

gpt-5.6-sol 是多語言翻譯的最佳預設選擇:在 8,455 次盲測判定中,它面對所有挑戰者仍守住 9 種語言裡的 7 種。若要以相同價格取得接近 frontier 的品質,可選 gemini-3.7-flash,它在韓文與義大利文打平或勝出。大量內部翻譯若以成本為優先,可使用每 100 萬字元 $0.26 的 deepseek-v4-flash,但必須接受 CJK 語言確實存在的品質落差。

LLM 比人工譯者更好嗎?

在我們測試的 9 種語言中,自動化評審偏好 frontier LLM 譯文而非人工後編參考譯文的比例已達 83-100%,與 WMT24++ 本身的研究結果一致。這項結論僅適用於參考譯文等級的人工後編內容與機器評審,不涵蓋具有編輯意圖的文學翻譯;LLM 評審也可能與 LLM 翻譯器共享文體偏好。

翻譯該使用 reasoning model 嗎?

不該。我們的數據顯示,thinking 對翻譯沒有幫助,無法關閉它的模型只會增加成本:gemini-3.1-pro 在 468 次短篇翻譯中消耗了 1.17M 個 reasoning token,成本是基準模型的 7.6 倍,卻在每種語言都落敗。翻譯工作負載應將 reasoning_effort 固定為 none,或使用該模型對應的關閉寫法。

測量期間為 2026-08-26 至 2026-08-29,經由 Synthorai 閘道執行:9 個模型、9 種語言、6 個領域的 52 個片段,共 4,210 份譯文,由 3 個評審家族依據 MQM 衍生準則完成 8,455 次盲測成對判定,並交換呈現順序。語料、程式碼與所有原始判定結果都收錄在公開 repo;絕對數值來自這一批次,採用任何一列數據前請重新測量。

同系列文章:各語言最便宜的 LLM13 個模型的 thinking 控制方式結構化輸出實測Gemini 3.7 Flash 成本

← 返回部落格