翻译用哪个 LLM:9 个模型、9 种语言,成本相差 400 倍
翻译并不存在一个适合所有场景的最佳模型:gpt-5.6-sol 在评测的 9 种语言中领先 7 种;claude-fable-5 在韩语上略胜一筹;gemini-3.7-flash 在韩语上与其持平,并以相同的实测价格在意大利语上超过它。根据所选 API,同样翻译 100 万字符,成本可从 $0.26 跨到 $104。我们使用 9 个模型翻译了 9 种语言,共生成 4,210 个译文,并进行了 8,455 次盲测两两评判。本文汇总了完整结果。
TL;DR
- 默认选择:gpt-5.6-sol 在 8,455 次盲评中守住了 9 种语言里的 7 种;韩语由 claude-fable-5 胜出(52%),意大利语由 gemini-3.7-flash 胜出(52%)。
- 按内容类型看:文学文本适合 gemini-3.7-flash(对基线胜率 60%);UI 字符串在 9 个模型间全部打平,且 placeholder 零损坏,因此选最便宜的即可;$4 以下最佳选择是 qwen3.8-max。
- 每 100 万字符成本从 $0.26(deepseek-v4-flash)到 $104(gemini-3.1-pro);其中 $104 主要来自模型拒绝关闭的 1.17M 个 reasoning token。
- 评判模型有 83-100% 的概率更偏好前沿模型译文,而不是人工译后编辑稿。
我们如何评测翻译质量?
评测由三部分组成:平行语料库、一套生产级 prompt,以及盲评评审组。下文使用的全部数据,包括原始评判结果,都在公开基准仓库中。
语料库。 语料包含 6 个领域的 52 个英文片段,每个模型都将它们翻译成全部 9 种语言。其中 4 个领域来自 WMT24++(Apache-2.0):新闻、社交媒体、口语和文学,每个领域通过固定 seed 抽样 8 个片段。WMT 是每年举办的机器翻译共享评测任务,WMT24++ 则是其评测集。每个 WMT24++ 片段都带有人工译后编辑参考稿,即专业译员完成翻译后,再由第二位语言专家审阅和修正。数据集覆盖了我们实际提供服务的全部 locale:zh_CN、zh_TW、ja、ko、fr、de、es_MX、pt_BR、it。另外两个领域由我们自行构建:过去 60 天内发布文章中的 10 段技术文档,可同时作为数据污染对照,因为任何模型的训练数据都不可能包含这些内容;以及 10 条合成 UI 字符串,覆盖已知的本地化风险,例如缺少上下文的 “Archive”、{placeholder} 完整性和复数形式。抽样使用固定 seed,segment id 也全部公开,因此不存在为了得到特定结果而筛选语料的问题。
评判。 每个候选译文都与固定基线 gpt-5.6-sol 对同一片段的译文进行盲测比较。这个模型目前也负责翻译本博客。三个评判模型系列(claude-sonnet-5、gpt-5.6-luna、gemini-3.1-pro)按照源自 MQM 的标准独立评分。MQM 是业界通用的翻译错误分类体系。各项按优先级排序,因此一个准确性错误会压过任何程度的语言润色:
1. 准确性 (Accuracy) 错译、漏译、增译、幻觉
2. 术语 (Terminology) 领域术语按母语工程师的习惯处理
3. 流畅度 (Fluency) 语法正确、读起来自然
4. 文体 (Style) 语域与文本类型相称
5. 本地惯例 (Locale) 数字、日期、单位、标点全半角
6. 标记 (Markup) 行内代码、占位符、链接原样保留
按严重程度分级的设计借鉴了 Error Span Annotation 方法。WMT 自 2024 年起一直使用这套协议进行人工评测,我们将其调整为 LLM 两两评判。语料和参考译文来自 WMT24++ 论文。每一组译文都会评判两次,并交换展示顺序。如果同一个评判模型在两个顺序下给出互相矛盾的结论,则记为平局。三个评判模型按相同权重取平均,不合并成单次投票;同时公布每个评判模型的数据,以便观察模型系列偏差。另一组实验将三个前沿模型(gpt-5.6-sol、claude-fable-5、gemini-3.1-pro)与 WMT24++ 的人工参考译文进行了比较。Placeholder 完整性由脚本判定,不交给评判模型。
各语言的最佳翻译模型是哪个?
先说结论:gpt-5.6-sol 不只是这张表的基线,也是实测冠军。下方所有挑战者都以它为参照,没有任何模型能在超过一种语言上取得 50% 以上的胜率。在另一组人工参考译文实验中,sol 的译文有 86-100% 的概率优于 WMT24++ 的专业译后编辑稿,是三个受测前沿模型中表现最好的。表中数据表示对 sol 的胜率,排除平局,并对三个评判模型取平均;50% 表示持平。
| 对比基线 | zh | zh-TW | ja | ko | fr | de | es | pt | it |
|---|---|---|---|---|---|---|---|---|---|
| gemini-3.7-flash | 26% | 35% | 43% | 50% | 40% | 37% | 39% | 8% | 52% |
| claude-fable-5 | 19% | 15% | 38% | 52% | 39% | 32% | 31% | 20% | 47% |
| gemini-3.1-pro | 17% | 22% | 24% | 45% | 30% | 21% | 38% | 14% | 25% |
| qwen3.8-max | 26% | 21% | 18% | 28% | 36% | 17% | 32% | 14% | 25% |
| kimi-k3 | 27% | 15% | 23% | 23% | 16% | 24% | 10% | 0% | 24% |
| claude-sonnet-5 | 3% | 6% | 9% | 32% | 25% | 27% | 28% | 10% | 9% |
| deepseek-v4-flash | 20% | 6% | 0% | 24% | 22% | 19% | 12% | 7% | 11% |
| glm-5.2 | 9% | 3% | 10% | 6% | 7% | 8% | 11% | 7% | 12% |
| 各语言推荐 | sol | sol | sol | fable-5 | sol | sol | sol | sol | 3.7-flash |
有四点很突出。第一,基线明确守住了 9 种语言中的 7 种,这也反过来验证了我们此前通过盲评将它选入生产流程的决定。第二,韩语竞争最激烈:fable-5 以 52% 略微胜出,3.7-flash 则达到持平。如果韩语是主要市场,模型排名确实不同。第三,中文开源权重模型在主场也输了:Qwen 的简体中文胜率为 26%,GLM 只有 9%。第四,GLM-5.2 的失利仅限于当前任务,并非整体能力问题。就在几天前,它还在我们的结构化输出研究中完整保留了 6/6 个 schema 关键词;它只是不擅长翻译。
哪类内容仍然难翻译?
下表按内容类型给出推荐模型和最强替代方案,并列出替代方案对基线的胜率。全体中位数基于另外 8 个挑战者计算:
| 领域 | 推荐模型 | 最强替代方案 | 全体中位数 |
|---|---|---|---|
| 文学 | gemini-3.7-flash(对基线 60%) | gpt-5.6-sol | 8% |
| 新闻 | gpt-5.6-sol | gemini-3.1-pro(48%) | 28% |
| 口语 | gpt-5.6-sol | gemini-3.7-flash(43%) | 25% |
| 社交媒体 | gpt-5.6-sol | qwen3.8-max(27%) | 12% |
| 技术文档 | gpt-5.6-sol | fable-5 / 3.7-flash(30%) | 15% |
| UI | 最便宜的模型(deepseek-v4-flash) | 任意模型,评判结果大多为平局(最高 77%) | 61% |
有一组对照数据需要单独说明:技术文档来自任何模型都不可能在训练中见过的段落,而 Gemini 模型在这里降幅最大。gemini-3.1-pro 在公开 WMT 领域的平均胜率为 33%,在这些新段落上只有 10%。这个差距既可能说明模型熟悉 benchmark,也可能来自基线的主场优势,因为它本来就在生产环境中翻译技术文章。因此我们只标出这个现象,不直接下结论。
按内容类型选择时,新闻、社交媒体、口语和技术文档继续使用基线。基线在社交媒体文本上的优势最大,因为俚语、残句和隐含语境会拉低所有挑战者的表现,8 个模型中有 3 个胜率低于 10%。文学文本是唯一结论不同的类别:gemini-3.7-flash 以 60% 的胜率直接击败基线,因此小说类内容有了更便宜、效果也更好的选择。UI 字符串则完全相反:十来个词的按钮文案很难拉开差距,因此评判结果大多是平局;9 个模型也都完整保留了全部 {seconds}、%d 和 {workspace_name},每个模型都是 27 个中损坏 0 个。质量无法区分时,就按价格选。UI 字符串用手头最便宜的模型翻译即可。Placeholder 损坏这个经典本地化问题,到 2026 年似乎已经在模型层解决。
同样的翻译任务,各模型成本是多少?
每 100 万个输出字符的成本从 $0.26 到 $104.37。该数据按全部 9 种语言汇总,以总实测支出除以总输出字符数,价格相差 400 倍,而且最贵的模型并不是最好的:
| 模型 | 每 100 万输出字符成本 | 消耗的 reasoning token | 胜率范围 |
|---|---|---|---|
| deepseek-v4-flash | $0.26 | 0 | 0-24% |
| glm-5.2 | $2.48 | 0 | 3-12% |
| qwen3.8-max | $3.18 | 0 | 14-36% |
| claude-sonnet-5 | $8.36 | 0 | 3-32% |
| kimi-k3 | $8.37 | 0 | 0-27% |
| gpt-5.6-sol(基线) | $13.70 | 0 | n/a |
| gemini-3.7-flash | $14.46 | 505K | 8-52% |
| claude-fable-5 | $39.81 | 0 | 15-52% |
| gemini-3.1-pro | $104.37 | 1,171,770 | 14-45% |
$104 这一行付的是思考税,不是质量溢价。翻译不需要 reasoning,所有允许我们将思考量固定为零的模型都运行正常。当前一代 Gemini 会拒绝所有关闭思考的参数写法,因此 gemini-3.1-pro 在 468 次翻译中消耗了 1.17M 个 reasoning token,成本达到基线的 7.6 倍,却在全部 9 种语言上都输给了基线。就连它的 flash 版本也额外消耗了 505K 个 token,最终成本高于基线。
高性价比选择也很明确。如果质量必须接近前沿水平,gemini-3.7-flash 是最强挑战者:在 9 种语言中的 7 种上,对基线胜率为 35-52%(50% 表示持平;其短板是简体中文的 26% 和葡萄牙语的 8%),而且拿下了唯一一个明确胜出的领域,即文学文本,胜率 60%。其实测成本与基线相差不到 6%,因为强制 reasoning 消耗抵消了 flash 的价格优势。如果成本优先,deepseek-v4-flash 的价格只有基线的 1/53,而且从未损坏 placeholder。代价是明显的质量下降,日语 0% 的胜率是下限,不是四舍五入误差。这个取舍适合内部内容,不适合任何面向客户的内容。
实际应该选哪个模型?
整张矩阵可以归纳为一张决策表:
| 优化目标 | 选择 | 依据 |
|---|---|---|
| 多语言综合质量最佳 | gpt-5.6-sol | 面对所有挑战者,守住了 9 种语言中的 7 种 |
| 韩语 | claude-fable-5,预算有限时选 3.7-flash | 对基线胜率 52%,是挑战者唯一胜出的语言;flash 持平(50%) |
| 意大利语 | gemini-3.7-flash | 以基线价格取得 52% 的对基线胜率 |
| 文学或小说类内容 | gemini-3.7-flash | 对基线胜率 60%,是唯一被挑战者明确拿下的领域 |
| 新闻、社交媒体、口语、技术文档 | 基线 | 这些领域中,没有挑战者超过 48% |
| UI 字符串 | deepseek-v4-flash | 各模型评判结果持平,placeholder 也全部安全,因此 $0.26 的模型靠价格胜出 |
| 每 100 万字符低于 $4 的多语言方案 | qwen3.8-max | 在 $4 以下档位中,9 种语言的胜率都最高 |
| 内部内容的绝对最低成本 | deepseek-v4-flash | 每 100 万字符 $0.26,只有基线的 1/53;需要接受 CJK 语言的质量差距 |
| 不应当用于翻译 | gemini-3.1-pro、glm-5.2 | 前者必须支付 7.6 倍的思考税,后者在这个任务上质量大幅下滑 |
LLM 现在已经超过人工译员了吗?
在全部 9 种语言中,三个前沿模型的机器译文都有 83-100% 的概率胜过 WMT24++ 的人工译后编辑参考稿。唯一例外是 claude-fable-5 的简体中文,胜率为 44%。这个数字有两种解读,两者都必须说明。较强的结论是:WMT24++ 的作者认为,LLM 已经是其覆盖的全部 55 种语言中最好的机器翻译系统,我们的评审结果与之一致。更谨慎的结论是:LLM 评判模型可能与 LLM 翻译模型共享风格偏好,另一个模型可能恰好更喜欢语言更流畅、润色更充分的机器译文;而且这些参考稿是译后编辑文本,不是文学级定稿。这个结果可以稳妥证明的是:对于我们能构建的任何自动化评审组,前沿机器翻译已经无法与专业人工参考译文区分。真正值得关注的问题因此转向价格,而价格差距达到几个数量级。
LLM 评判到底有多大噪声?
噪声大到不能使用毫无保护的单次评判,好在保护措施成本很低。我们将同一组译文展示两次并交换顺序后,评判模型给出完全矛盾结果,也就是从胜出直接翻转为落败的比例分别为:claude-sonnet-5 9%,gemini-3.1-pro 13%,gpt-5.6-luna 19%。我们的协议会把这类矛盾全部记为平局,让位置偏差相互抵消,而不是不断累积。汇总数据旁还会公布每个评判模型的胜率,以便确认结论是否由某一个模型系列主导。三个系列在幅度上有时意见不同,例如 sonnet-5 对同属 Claude 系列的模型最严格,但它们在每种语言上的方向都一致,而本文的结论正是建立在这个一致性上。
常见问题
翻译应该使用哪个 LLM?
gpt-5.6-sol 是多语言翻译的最佳默认选择:在 8,455 次盲评中,它面对所有挑战者守住了 9 种语言中的 7 种。如果希望以相同价格获得接近前沿的质量,可以选择 gemini-3.7-flash,它在韩语和意大利语上持平或胜出。如果是成本优先的大批量内部翻译,可以选择每 100 万字符 $0.26 的 deepseek-v4-flash,但要接受它在 CJK 语言上的明显质量差距。
LLM 比人工译员更好吗?
在我们测试的 9 种语言中,自动化评判模型有 83-100% 的概率更偏好前沿 LLM 的译文,而不是人工译后编辑参考稿,这与 WMT24++ 自身的结论一致。这个说法仅适用于参考质量的译后编辑稿和机器评判,不包括带有编辑意图的文学翻译;LLM 评判模型也可能与 LLM 翻译模型共享风格偏好。
翻译应该使用 reasoning 模型吗?
不应该。我们的数据中,思考过程对翻译没有任何收益,而无法关闭它的模型还要为此付费:gemini-3.1-pro 在 468 次短文本翻译中消耗了 1.17M 个 reasoning token,成本达到基线的 7.6 倍,却在每种语言上都落败。翻译工作负载应将 reasoning_effort 固定为 none,或使用对应模型表示关闭的参数值。
数据通过 Synthorai gateway 于 2026-08-26 至 2026-08-29 实测:9 个模型、9 种语言、6 个领域中的 52 个片段、4,210 个译文,以及 3 个评判模型系列依据源自 MQM 的标准、通过交换顺序完成的 8,455 次盲测两两评判。语料、代码和全部原始评判结果都在公开仓库中;绝对数值来自这一批次,依赖任何一行数据前都应重新实测。
同系列文章:各语言最便宜的 LLM、13 个模型的思考控制方式、结构化输出实测、Gemini 3.7 Flash 成本。