新人 免费注册,送 10 次调用,最高 $1,免绑卡。
翻译用哪个 LLM:9 个模型、9 种语言,成本相差 400 倍

翻译用哪个 LLM:9 个模型、9 种语言,成本相差 400 倍

目录
  1. 我们如何评测翻译质量?
  2. 各语言的最佳翻译模型是哪个?
  3. 哪类内容仍然难翻译?
  4. 同样的翻译任务,各模型成本是多少?
  5. 实际应该选哪个模型?
  6. LLM 现在已经超过人工译员了吗?
  7. LLM 评判到底有多大噪声?
  8. 常见问题

翻译并不存在一个适合所有场景的最佳模型:gpt-5.6-sol 在评测的 9 种语言中领先 7 种;claude-fable-5 在韩语上略胜一筹;gemini-3.7-flash 在韩语上与其持平,并以相同的实测价格在意大利语上超过它。根据所选 API,同样翻译 100 万字符,成本可从 $0.26 跨到 $104。我们使用 9 个模型翻译了 9 种语言,共生成 4,210 个译文,并进行了 8,455 次盲测两两评判。本文汇总了完整结果。

TL;DR

  • 默认选择:gpt-5.6-sol 在 8,455 次盲评中守住了 9 种语言里的 7 种;韩语由 claude-fable-5 胜出(52%),意大利语由 gemini-3.7-flash 胜出(52%)。
  • 按内容类型看:文学文本适合 gemini-3.7-flash(对基线胜率 60%);UI 字符串在 9 个模型间全部打平,且 placeholder 零损坏,因此选最便宜的即可;$4 以下最佳选择是 qwen3.8-max
  • 每 100 万字符成本从 $0.26(deepseek-v4-flash)到 $104(gemini-3.1-pro);其中 $104 主要来自模型拒绝关闭的 1.17M 个 reasoning token。
  • 评判模型有 83-100% 的概率更偏好前沿模型译文,而不是人工译后编辑稿。

我们如何评测翻译质量?

评测由三部分组成:平行语料库、一套生产级 prompt,以及盲评评审组。下文使用的全部数据,包括原始评判结果,都在公开基准仓库中。

语料库。 语料包含 6 个领域的 52 个英文片段,每个模型都将它们翻译成全部 9 种语言。其中 4 个领域来自 WMT24++(Apache-2.0):新闻、社交媒体、口语和文学,每个领域通过固定 seed 抽样 8 个片段。WMT 是每年举办的机器翻译共享评测任务,WMT24++ 则是其评测集。每个 WMT24++ 片段都带有人工译后编辑参考稿,即专业译员完成翻译后,再由第二位语言专家审阅和修正。数据集覆盖了我们实际提供服务的全部 locale:zh_CN、zh_TW、ja、ko、fr、de、es_MX、pt_BR、it。另外两个领域由我们自行构建:过去 60 天内发布文章中的 10 段技术文档,可同时作为数据污染对照,因为任何模型的训练数据都不可能包含这些内容;以及 10 条合成 UI 字符串,覆盖已知的本地化风险,例如缺少上下文的 “Archive”、{placeholder} 完整性和复数形式。抽样使用固定 seed,segment id 也全部公开,因此不存在为了得到特定结果而筛选语料的问题。

评判。 每个候选译文都与固定基线 gpt-5.6-sol 对同一片段的译文进行盲测比较。这个模型目前也负责翻译本博客。三个评判模型系列(claude-sonnet-5gpt-5.6-lunagemini-3.1-pro)按照源自 MQM 的标准独立评分。MQM 是业界通用的翻译错误分类体系。各项按优先级排序,因此一个准确性错误会压过任何程度的语言润色:

1. 准确性 (Accuracy)     错译、漏译、增译、幻觉
2. 术语 (Terminology)    领域术语按母语工程师的习惯处理
3. 流畅度 (Fluency)      语法正确、读起来自然
4. 文体 (Style)          语域与文本类型相称
5. 本地惯例 (Locale)     数字、日期、单位、标点全半角
6. 标记 (Markup)         行内代码、占位符、链接原样保留

按严重程度分级的设计借鉴了 Error Span Annotation 方法。WMT 自 2024 年起一直使用这套协议进行人工评测,我们将其调整为 LLM 两两评判。语料和参考译文来自 WMT24++ 论文。每一组译文都会评判两次,并交换展示顺序。如果同一个评判模型在两个顺序下给出互相矛盾的结论,则记为平局。三个评判模型按相同权重取平均,不合并成单次投票;同时公布每个评判模型的数据,以便观察模型系列偏差。另一组实验将三个前沿模型(gpt-5.6-sol、claude-fable-5、gemini-3.1-pro)与 WMT24++ 的人工参考译文进行了比较。Placeholder 完整性由脚本判定,不交给评判模型。

各语言的最佳翻译模型是哪个?

先说结论:gpt-5.6-sol 不只是这张表的基线,也是实测冠军。下方所有挑战者都以它为参照,没有任何模型能在超过一种语言上取得 50% 以上的胜率。在另一组人工参考译文实验中,sol 的译文有 86-100% 的概率优于 WMT24++ 的专业译后编辑稿,是三个受测前沿模型中表现最好的。表中数据表示对 sol 的胜率,排除平局,并对三个评判模型取平均;50% 表示持平。

对比基线zhzh-TWjakofrdeesptit
gemini-3.7-flash26%35%43%50%40%37%39%8%52%
claude-fable-519%15%38%52%39%32%31%20%47%
gemini-3.1-pro17%22%24%45%30%21%38%14%25%
qwen3.8-max26%21%18%28%36%17%32%14%25%
kimi-k327%15%23%23%16%24%10%0%24%
claude-sonnet-53%6%9%32%25%27%28%10%9%
deepseek-v4-flash20%6%0%24%22%19%12%7%11%
glm-5.29%3%10%6%7%8%11%7%12%
各语言推荐solsolsolfable-5solsolsolsol3.7-flash

有四点很突出。第一,基线明确守住了 9 种语言中的 7 种,这也反过来验证了我们此前通过盲评将它选入生产流程的决定。第二,韩语竞争最激烈:fable-5 以 52% 略微胜出,3.7-flash 则达到持平。如果韩语是主要市场,模型排名确实不同。第三,中文开源权重模型在主场也输了:Qwen 的简体中文胜率为 26%,GLM 只有 9%。第四,GLM-5.2 的失利仅限于当前任务,并非整体能力问题。就在几天前,它还在我们的结构化输出研究中完整保留了 6/6 个 schema 关键词;它只是不擅长翻译。

哪类内容仍然难翻译?

下表按内容类型给出推荐模型和最强替代方案,并列出替代方案对基线的胜率。全体中位数基于另外 8 个挑战者计算:

领域推荐模型最强替代方案全体中位数
文学gemini-3.7-flash(对基线 60%)gpt-5.6-sol8%
新闻gpt-5.6-solgemini-3.1-pro(48%)28%
口语gpt-5.6-solgemini-3.7-flash(43%)25%
社交媒体gpt-5.6-solqwen3.8-max(27%)12%
技术文档gpt-5.6-solfable-5 / 3.7-flash(30%)15%
UI最便宜的模型(deepseek-v4-flash任意模型,评判结果大多为平局(最高 77%)61%

有一组对照数据需要单独说明:技术文档来自任何模型都不可能在训练中见过的段落,而 Gemini 模型在这里降幅最大。gemini-3.1-pro 在公开 WMT 领域的平均胜率为 33%,在这些新段落上只有 10%。这个差距既可能说明模型熟悉 benchmark,也可能来自基线的主场优势,因为它本来就在生产环境中翻译技术文章。因此我们只标出这个现象,不直接下结论。

按内容类型选择时,新闻、社交媒体、口语和技术文档继续使用基线。基线在社交媒体文本上的优势最大,因为俚语、残句和隐含语境会拉低所有挑战者的表现,8 个模型中有 3 个胜率低于 10%。文学文本是唯一结论不同的类别:gemini-3.7-flash 以 60% 的胜率直接击败基线,因此小说类内容有了更便宜、效果也更好的选择。UI 字符串则完全相反:十来个词的按钮文案很难拉开差距,因此评判结果大多是平局;9 个模型也都完整保留了全部 {seconds}%d{workspace_name},每个模型都是 27 个中损坏 0 个。质量无法区分时,就按价格选。UI 字符串用手头最便宜的模型翻译即可。Placeholder 损坏这个经典本地化问题,到 2026 年似乎已经在模型层解决。

同样的翻译任务,各模型成本是多少?

每 100 万个输出字符的成本从 $0.26 到 $104.37。该数据按全部 9 种语言汇总,以总实测支出除以总输出字符数,价格相差 400 倍,而且最贵的模型并不是最好的:

模型每 100 万输出字符成本消耗的 reasoning token胜率范围
deepseek-v4-flash$0.2600-24%
glm-5.2$2.4803-12%
qwen3.8-max$3.18014-36%
claude-sonnet-5$8.3603-32%
kimi-k3$8.3700-27%
gpt-5.6-sol(基线)$13.700n/a
gemini-3.7-flash$14.46505K8-52%
claude-fable-5$39.81015-52%
gemini-3.1-pro$104.371,171,77014-45%

$104 这一行付的是思考税,不是质量溢价。翻译不需要 reasoning,所有允许我们将思考量固定为零的模型都运行正常。当前一代 Gemini 会拒绝所有关闭思考的参数写法,因此 gemini-3.1-pro 在 468 次翻译中消耗了 1.17M 个 reasoning token,成本达到基线的 7.6 倍,却在全部 9 种语言上都输给了基线。就连它的 flash 版本也额外消耗了 505K 个 token,最终成本高于基线。

高性价比选择也很明确。如果质量必须接近前沿水平,gemini-3.7-flash 是最强挑战者:在 9 种语言中的 7 种上,对基线胜率为 35-52%(50% 表示持平;其短板是简体中文的 26% 和葡萄牙语的 8%),而且拿下了唯一一个明确胜出的领域,即文学文本,胜率 60%。其实测成本与基线相差不到 6%,因为强制 reasoning 消耗抵消了 flash 的价格优势。如果成本优先,deepseek-v4-flash 的价格只有基线的 1/53,而且从未损坏 placeholder。代价是明显的质量下降,日语 0% 的胜率是下限,不是四舍五入误差。这个取舍适合内部内容,不适合任何面向客户的内容。

实际应该选哪个模型?

整张矩阵可以归纳为一张决策表:

优化目标选择依据
多语言综合质量最佳gpt-5.6-sol面对所有挑战者,守住了 9 种语言中的 7 种
韩语claude-fable-5,预算有限时选 3.7-flash对基线胜率 52%,是挑战者唯一胜出的语言;flash 持平(50%)
意大利语gemini-3.7-flash以基线价格取得 52% 的对基线胜率
文学或小说类内容gemini-3.7-flash对基线胜率 60%,是唯一被挑战者明确拿下的领域
新闻、社交媒体、口语、技术文档基线这些领域中,没有挑战者超过 48%
UI 字符串deepseek-v4-flash各模型评判结果持平,placeholder 也全部安全,因此 $0.26 的模型靠价格胜出
每 100 万字符低于 $4 的多语言方案qwen3.8-max在 $4 以下档位中,9 种语言的胜率都最高
内部内容的绝对最低成本deepseek-v4-flash每 100 万字符 $0.26,只有基线的 1/53;需要接受 CJK 语言的质量差距
不应当用于翻译gemini-3.1-proglm-5.2前者必须支付 7.6 倍的思考税,后者在这个任务上质量大幅下滑

LLM 现在已经超过人工译员了吗?

在全部 9 种语言中,三个前沿模型的机器译文都有 83-100% 的概率胜过 WMT24++ 的人工译后编辑参考稿。唯一例外是 claude-fable-5 的简体中文,胜率为 44%。这个数字有两种解读,两者都必须说明。较强的结论是:WMT24++ 的作者认为,LLM 已经是其覆盖的全部 55 种语言中最好的机器翻译系统,我们的评审结果与之一致。更谨慎的结论是:LLM 评判模型可能与 LLM 翻译模型共享风格偏好,另一个模型可能恰好更喜欢语言更流畅、润色更充分的机器译文;而且这些参考稿是译后编辑文本,不是文学级定稿。这个结果可以稳妥证明的是:对于我们能构建的任何自动化评审组,前沿机器翻译已经无法与专业人工参考译文区分。真正值得关注的问题因此转向价格,而价格差距达到几个数量级。

LLM 评判到底有多大噪声?

噪声大到不能使用毫无保护的单次评判,好在保护措施成本很低。我们将同一组译文展示两次并交换顺序后,评判模型给出完全矛盾结果,也就是从胜出直接翻转为落败的比例分别为:claude-sonnet-5 9%,gemini-3.1-pro 13%,gpt-5.6-luna 19%。我们的协议会把这类矛盾全部记为平局,让位置偏差相互抵消,而不是不断累积。汇总数据旁还会公布每个评判模型的胜率,以便确认结论是否由某一个模型系列主导。三个系列在幅度上有时意见不同,例如 sonnet-5 对同属 Claude 系列的模型最严格,但它们在每种语言上的方向都一致,而本文的结论正是建立在这个一致性上。

常见问题

翻译应该使用哪个 LLM?

gpt-5.6-sol 是多语言翻译的最佳默认选择:在 8,455 次盲评中,它面对所有挑战者守住了 9 种语言中的 7 种。如果希望以相同价格获得接近前沿的质量,可以选择 gemini-3.7-flash,它在韩语和意大利语上持平或胜出。如果是成本优先的大批量内部翻译,可以选择每 100 万字符 $0.26 的 deepseek-v4-flash,但要接受它在 CJK 语言上的明显质量差距。

LLM 比人工译员更好吗?

在我们测试的 9 种语言中,自动化评判模型有 83-100% 的概率更偏好前沿 LLM 的译文,而不是人工译后编辑参考稿,这与 WMT24++ 自身的结论一致。这个说法仅适用于参考质量的译后编辑稿和机器评判,不包括带有编辑意图的文学翻译;LLM 评判模型也可能与 LLM 翻译模型共享风格偏好。

翻译应该使用 reasoning 模型吗?

不应该。我们的数据中,思考过程对翻译没有任何收益,而无法关闭它的模型还要为此付费:gemini-3.1-pro 在 468 次短文本翻译中消耗了 1.17M 个 reasoning token,成本达到基线的 7.6 倍,却在每种语言上都落败。翻译工作负载应将 reasoning_effort 固定为 none,或使用对应模型表示关闭的参数值。

数据通过 Synthorai gateway 于 2026-08-26 至 2026-08-29 实测:9 个模型、9 种语言、6 个领域中的 52 个片段、4,210 个译文,以及 3 个评判模型系列依据源自 MQM 的标准、通过交换顺序完成的 8,455 次盲测两两评判。语料、代码和全部原始评判结果都在公开仓库中;绝对数值来自这一批次,依赖任何一行数据前都应重新实测。

同系列文章:各语言最便宜的 LLM13 个模型的思考控制方式结构化输出实测Gemini 3.7 Flash 成本

← 返回博客