Melhor LLM para tradução: 9 modelos, 9 idiomas, custo 400x
Conteúdo
- Como testamos a qualidade das traduções?
- Qual modelo traduz melhor em cada idioma?
- Quais tipos de conteúdo ainda são difíceis de traduzir?
- Quanto custa a mesma tradução em cada modelo?
- Qual modelo escolher na prática?
- LLMs já superam tradutores humanos?
- Qual é o nível de ruído dos avaliadores LLM?
- Perguntas frequentes
Não existe um único melhor modelo de tradução: gpt-5.6-sol lidera em 7 dos 9 idiomas avaliados, claude-fable-5 fica ligeiramente à frente em coreano, e gemini-3.7-flash empata em coreano e vence em italiano pelo mesmo preço medido. Dependendo da API escolhida, traduzir o mesmo milhão de caracteres custa de $0.26 a $104. Geramos 4.210 traduções com 9 modelos em 9 idiomas e coletamos 8.455 avaliações cegas em pares. Este post apresenta a matriz resultante.
TL;DR
- Escolha padrão: gpt-5.6-sol manteve a liderança em 7 de 9 idiomas nas 8.455 avaliações cegas; em coreano, vence claude-fable-5 (52%), e em italiano, gemini-3.7-flash (52%).
- Por tipo de conteúdo: gemini-3.7-flash vence em textos literários (60% contra o baseline); em strings de UI, os 9 modelos empatam e nenhum quebrou placeholders, portanto o mais barato vence; abaixo de $4, a melhor escolha é qwen3.8-max.
- O custo por 1M de caracteres vai de $0.26 (deepseek-v4-flash) a $104 (gemini-3.1-pro); os $104 vêm principalmente de 1,17M de reasoning tokens que o modelo não permite desativar.
- Os avaliadores preferiram modelos de ponta a traduções humanas pós-editadas em 83-100% dos casos.
Como testamos a qualidade das traduções?
Usamos três componentes: um corpus paralelo, um único prompt pronto para produção e um painel de avaliação cega. Todo o material abaixo, incluindo os resultados brutos, está no repositório público do benchmark.
Corpus. Selecionamos 52 segmentos em inglês, distribuídos por seis domínios. Todos os modelos traduziram cada segmento para os 9 idiomas. Quatro domínios (notícias, redes sociais, fala e literatura, com 8 segmentos cada em uma amostra de seed fixa) vêm do WMT24++ (Apache-2.0), o conjunto de avaliação do WMT, a competição anual de tradução automática. Cada segmento do WMT24++ inclui uma referência humana pós-editada, ou seja, uma tradução profissional revisada e corrigida por um segundo linguista. O conjunto cobre exatamente as variantes regionais que oferecemos: zh_CN, zh_TW, ja, ko, fr, de, es_MX, pt_BR, it. Os outros dois domínios são nossos: 10 parágrafos de documentação técnica retirados de posts publicados nos últimos 60 dias, usados também como controle de contaminação, já que não poderiam estar nos dados de treinamento de nenhum modelo, e 10 strings sintéticas de UI construídas a partir de problemas conhecidos de localização, como “Archive” sem contexto, integridade de {placeholder} e formas de plural. A amostragem usa seed fixa e os IDs dos segmentos estão publicados, evitando qualquer suspeita de seleção do corpus para favorecer um resultado.
Avaliação. Cada tradução candidata foi comparada às cegas com a tradução do mesmo segmento produzida por um baseline fixo, gpt-5.6-sol, o modelo que atualmente traduz este blog. Três famílias de avaliadores (claude-sonnet-5, gpt-5.6-luna e gemini-3.1-pro) deram notas de forma independente, seguindo critérios derivados do MQM, a tipologia padrão do setor para erros de tradução. Os critérios foram ordenados por prioridade, para que um erro de precisão pese mais do que qualquer refinamento de estilo:
1. Accuracy mistranslation, omission, addition, hallucination
2. Terminology domain terms as a native engineer would keep them
3. Fluency grammar, natural reading
4. Style register appropriate to the text type
5. Locale numbers, dates, units, punctuation width
6. Markup inline code, placeholders, links preserved exactly
O desenho com classificação por gravidade segue a abordagem do Error Span Annotation, protocolo adotado pelo WMT para avaliação humana desde 2024 e adaptado aqui para avaliações de pares por LLMs. O corpus e as referências vêm do artigo do WMT24++. Cada par foi avaliado duas vezes, com a ordem de apresentação invertida. Quando um avaliador se contradizia entre as duas ordens, o resultado passava a ser empate. As notas dos avaliadores têm o mesmo peso e nunca são combinadas em um único voto. Também publicamos os números de cada avaliador para deixar visível qualquer viés de família. Em um segundo experimento, comparamos os três modelos de ponta (gpt-5.6-sol, claude-fable-5 e gemini-3.1-pro) com as referências humanas do WMT24++. A integridade dos placeholders foi verificada por script, não pelos avaliadores.
Qual modelo traduz melhor em cada idioma?
Começando pelo vencedor: gpt-5.6-sol não é apenas o baseline desta tabela, mas também o campeão medido. Cada concorrente abaixo foi avaliado contra ele. Nenhum supera 50% em mais de um idioma. No experimento separado com referências humanas, as traduções do sol foram preferidas às versões profissionais pós-editadas do WMT24++ em 86-100% dos resultados, o melhor desempenho entre os três modelos de ponta testados nessa etapa. A tabela mostra a taxa de vitória contra o sol, sem contar empates e com média dos três avaliadores. 50% significa desempenho equivalente.
| contra o baseline | zh | zh-TW | ja | ko | fr | de | es | pt | it |
|---|---|---|---|---|---|---|---|---|---|
| gemini-3.7-flash | 26% | 35% | 43% | 50% | 40% | 37% | 39% | 8% | 52% |
| claude-fable-5 | 19% | 15% | 38% | 52% | 39% | 32% | 31% | 20% | 47% |
| gemini-3.1-pro | 17% | 22% | 24% | 45% | 30% | 21% | 38% | 14% | 25% |
| qwen3.8-max | 26% | 21% | 18% | 28% | 36% | 17% | 32% | 14% | 25% |
| kimi-k3 | 27% | 15% | 23% | 23% | 16% | 24% | 10% | 0% | 24% |
| claude-sonnet-5 | 3% | 6% | 9% | 32% | 25% | 27% | 28% | 10% | 9% |
| deepseek-v4-flash | 20% | 6% | 0% | 24% | 22% | 19% | 12% | 7% | 11% |
| glm-5.2 | 9% | 3% | 10% | 6% | 7% | 8% | 11% | 7% | 12% |
| Escolha por idioma | sol | sol | sol | fable-5 | sol | sol | sol | sol | 3.7-flash |
Quatro pontos chamam atenção. O baseline mantém a liderança em 7 dos 9 idiomas, confirmando retrospectivamente a rodada de avaliação cega que o escolheu para nosso próprio pipeline. O coreano é o idioma mais disputado: fable-5 fica ligeiramente à frente (52%) e 3.7-flash empata. Se o coreano for seu principal mercado, o ranking realmente muda. Os modelos chineses open-weight perdem no próprio território: Qwen marca 26% e GLM, 9% em chinês simplificado. O colapso do GLM-5.2 é específico desta tarefa, não geral: poucos dias antes, o mesmo modelo preservou 6/6 palavras-chave de schema em nosso estudo sobre outputs estruturados. Tradução simplesmente não é seu ponto forte.
Quais tipos de conteúdo ainda são difíceis de traduzir?
Para cada tipo de conteúdo, a tabela mostra a recomendação e a alternativa mais forte, incluindo a taxa de vitória da alternativa contra o baseline. A mediana considera os oito concorrentes:
| Domínio | Modelo recomendado | Alternativa mais forte | Mediana do grupo |
|---|---|---|---|
| literatura | gemini-3.7-flash (60% contra o baseline) | gpt-5.6-sol | 8% |
| notícias | gpt-5.6-sol | gemini-3.1-pro (48%) | 28% |
| fala | gpt-5.6-sol | gemini-3.7-flash (43%) | 25% |
| redes sociais | gpt-5.6-sol | qwen3.8-max (27%) | 12% |
| documentação técnica | gpt-5.6-sol | fable-5 / 3.7-flash (30%) | 15% |
| UI | o mais barato (deepseek-v4-flash) | qualquer modelo, a maioria dos resultados é empate (77% no topo) | 61% |
Um controle merece destaque: as linhas de documentação técnica usam parágrafos que não poderiam fazer parte do treinamento dos modelos. Os modelos Gemini têm a maior queda nesse conjunto. O gemini-3.1-pro obtém média de 33% nos domínios públicos do WMT, mas apenas 10% nos parágrafos recentes. Essa diferença é compatível tanto com familiaridade com o benchmark quanto com a vantagem do baseline em textos técnicos, já que ele os traduz em produção. Por isso, registramos a diferença sem tirar uma conclusão definitiva.
As recomendações por tipo de conteúdo são diretas: para notícias, redes sociais, fala e documentação técnica, o baseline continua sendo a melhor escolha. Sua maior vantagem aparece em redes sociais, onde gírias, fragmentos e contexto implícito prejudicam todos os concorrentes, três dos oito ficaram abaixo de 10%. Textos literários são a única categoria com outro vencedor: gemini-3.7-flash supera o baseline com 60%, oferecendo uma opção melhor e mais barata para conteúdo próximo de ficção. Em strings de UI, a lógica se inverte. Os resultados são majoritariamente empates porque dez palavras de texto de botão deixam pouca margem para divergência. Além disso, todos os nove modelos preservaram corretamente cada {seconds}, %d e {workspace_name} (0 falhas em 27 para cada modelo). Quando a qualidade não se diferencia, o preço decide: use seu modelo mais barato para traduzir strings de UI. A quebra de placeholders, um bug clássico de localização, parece resolvida no nível dos modelos em 2026.
Quanto custa a mesma tradução em cada modelo?
O custo por milhão de caracteres gerados vai de $0.26 a $104.37, considerando o gasto total medido dividido pelo volume total gerado nos nove idiomas. É uma diferença de 400x, e o modelo mais caro não é o melhor:
| Modelo | $/1M de caracteres gerados | Reasoning tokens consumidos | Faixa da taxa de vitória |
|---|---|---|---|
| deepseek-v4-flash | $0.26 | 0 | 0-24% |
| glm-5.2 | $2.48 | 0 | 3-12% |
| qwen3.8-max | $3.18 | 0 | 14-36% |
| claude-sonnet-5 | $8.36 | 0 | 3-32% |
| kimi-k3 | $8.37 | 0 | 0-27% |
| gpt-5.6-sol (baseline) | $13.70 | 0 | n/a |
| gemini-3.7-flash | $14.46 | 505K | 8-52% |
| claude-fable-5 | $39.81 | 0 | 15-52% |
| gemini-3.1-pro | $104.37 | 1,171,770 | 14-45% |
A linha de $104 representa um imposto de thinking, não um adicional por qualidade. Tradução não precisa de reasoning, e todos os modelos que permitem fixá-lo em zero funcionaram sem problemas. A geração atual do Gemini rejeita todas as formas de desativação. Como resultado, gemini-3.1-pro consumiu 1,17M de reasoning tokens em 468 traduções e custou 7,6x mais que o baseline, embora tenha perdido para ele nos nove idiomas. Até a versão flash consumiu 505K tokens extras, elevando seu custo acima do baseline.
As melhores opções em custo-benefício ficam claras. Para manter a qualidade próxima dos modelos de ponta, gemini-3.7-flash é o concorrente mais forte: marca 35-52% contra o baseline em sete dos nove idiomas (50% representa equivalência; seus pontos fracos são chinês simplificado, com 26%, e português, com 8%) e obtém a única vitória clara por domínio, com 60% em literatura. Seu custo medido fica a menos de 6% do baseline porque o reasoning obrigatório elimina o desconto esperado de um modelo flash. Quando o custo é prioridade, deepseek-v4-flash traduz por um valor 53x menor que o baseline e não quebrou nenhum placeholder. A perda de qualidade é real, 0% de vitória em japonês é o piso, não um efeito de arredondamento. A troca pode ser aceitável para conteúdo interno, mas não para material voltado a clientes.
Qual modelo escolher na prática?
Toda a matriz pode ser resumida nesta tabela de decisão:
| Seu objetivo | Escolha | Evidência |
|---|---|---|
| Melhor qualidade média em vários idiomas | gpt-5.6-sol | mantém a liderança em 7 de 9 idiomas contra todos os concorrentes |
| Coreano | claude-fable-5, ou 3.7-flash com orçamento limitado | 52% contra o baseline, o único idioma vencido por um concorrente; flash empata (50%) |
| Italiano | gemini-3.7-flash | 52% contra o baseline pelo mesmo preço |
| Conteúdo literário ou próximo de ficção | gemini-3.7-flash | 60% contra o baseline, o único domínio vencido de forma clara |
| Notícias, redes sociais, fala e documentação técnica | o baseline | nenhum concorrente passa de 48% nesses domínios |
| Strings de UI | deepseek-v4-flash | os modelos empatam e todos preservam placeholders, portanto o modelo de $0.26 vence pelo preço |
| Tradução multilíngue econômica, abaixo de $4/1M de caracteres | qwen3.8-max | melhores taxas de vitória da faixa abaixo de $4 nos 9 idiomas |
| Menor custo possível para conteúdo interno | deepseek-v4-flash | $0.26/1M de caracteres, 53x abaixo do baseline; aceite a diferença de qualidade em CJK |
| Evite em tradução | gemini-3.1-pro, glm-5.2 | imposto obrigatório de thinking de 7,6x; colapso de qualidade específico da tarefa |
LLMs já superam tradutores humanos?
Nossos avaliadores preferiram as traduções dos modelos às referências humanas pós-editadas do WMT24++ em 83-100% dos resultados para os três modelos de ponta e em todos os idiomas, com uma única exceção: claude-fable-5 em chinês simplificado, com 44%. Esse número permite duas leituras, e ambas precisam ser apresentadas. A mais forte: os próprios autores do WMT24++ concluíram que LLMs já são os melhores sistemas de tradução automática nos 55 idiomas avaliados, e nosso painel chega à mesma conclusão. A mais cautelosa: avaliadores LLM compartilham preferências de estilo com tradutores LLM, e uma tradução automática com fluência refinada pode ser exatamente o que outro modelo prefere. Além disso, as referências são pós-edições, não traduções literárias de excelência. O dado permite afirmar com segurança que nenhum painel automatizado que conseguimos construir distingue a tradução de modelos de ponta da qualidade de referências humanas profissionais. Com isso, a questão mais relevante passa a ser o preço, cuja diferença chega a várias ordens de grandeza.
Qual é o nível de ruído dos avaliadores LLM?
É alto o suficiente para tornar irresponsável uma avaliação sem proteção e em uma única passagem. As proteções, porém, custam pouco. Ao mostrar o mesmo par duas vezes com a ordem invertida, os avaliadores se contradisseram diretamente, mudando de vitória para derrota, em 9% dos casos com claude-sonnet-5, 13% com gemini-3.1-pro e 19% com gpt-5.6-luna. Nosso protocolo transforma cada contradição desse tipo em empate, neutralizando o viés de posição em vez de acumulá-lo. As taxas de vitória por avaliador são publicadas junto ao número agregado, permitindo verificar se alguma família isolada determina a conclusão. As três famílias divergiram na intensidade em alguns casos, sonnet-5 foi o avaliador mais rigoroso com outro modelo Claude, mas concordaram sobre a direção em todos os idiomas. É nessa concordância que as conclusões se apoiam.
Perguntas frequentes
Qual LLM devo usar para tradução?
gpt-5.6-sol é a melhor escolha padrão para tradução multilíngue: manteve a liderança em 7 de 9 idiomas contra todos os concorrentes, com base em 8.455 avaliações cegas. Para qualidade próxima dos modelos de ponta pelo mesmo preço, escolha gemini-3.7-flash, que empata ou vence em coreano e italiano. Para grandes volumes de conteúdo interno, quando o custo é prioridade, deepseek-v4-flash custa $0.26 por milhão de caracteres, mas há uma perda real de qualidade em idiomas CJK.
LLMs são melhores que tradutores humanos?
Em nossos nove idiomas, avaliadores automatizados já preferem traduções de LLMs de ponta a referências humanas pós-editadas em 83-100% dos casos, em linha com os resultados do próprio WMT24++. A afirmação se limita a pós-edições com qualidade de referência avaliadas por modelos. Não inclui tradução literária com intenção editorial, e avaliadores LLM podem compartilhar preferências de estilo com tradutores LLM.
Devo usar um modelo de reasoning para tradução?
Não. Nossos dados não mostram benefício do thinking para tradução, e modelos que não permitem desativá-lo tornam a tarefa mais cara: gemini-3.1-pro consumiu 1,17M de reasoning tokens em 468 traduções curtas, custando 7,6x mais que o baseline e perdendo em todos os idiomas. Defina reasoning_effort como none, ou use a opção equivalente do modelo, em workloads de tradução.
Medições realizadas de 2026-08-26 a 2026-08-29 pelo gateway da Synthorai: 9 modelos, 9 idiomas, 52 segmentos em 6 domínios, 4.210 traduções e 8.455 avaliações cegas em pares feitas por 3 famílias de avaliadores, seguindo critérios derivados do MQM e com inversão de ordem. O corpus, o código e todos os resultados brutos estão no repositório público. Os números absolutos vêm de um único lote, portanto faça novas medições antes de depender de qualquer linha.
Outros posts da série: LLM mais barato por idioma, controles de thinking em 13 modelos, medição de outputs estruturados, custo do Gemini 3.7 Flash.