Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
Mejor LLM para traducción: 9 modelos, 9 idiomas, coste 400x

Mejor LLM para traducción: 9 modelos, 9 idiomas, coste 400x

Contenido
  1. ¿Cómo evaluamos la calidad de la traducción?
  2. ¿Qué modelo traduce mejor cada idioma?
  3. ¿Qué tipo de contenido sigue siendo difícil de traducir?
  4. ¿Cuánto cuesta la misma traducción en cada modelo?
  5. Entonces, ¿qué modelo conviene elegir?
  6. ¿Los LLM ya superan a los traductores humanos?
  7. ¿Cuánto ruido introducen realmente los jueces LLM?
  8. Preguntas frecuentes

No existe un único modelo que sea el mejor para traducir: gpt-5.6-sol lidera en 7 de los 9 idiomas evaluados, claude-fable-5 lo supera por poco en coreano y gemini-3.7-flash empata con él en coreano y lo adelanta en italiano al mismo precio medido. Según la API elegida, traducir el mismo millón de caracteres cuesta entre $0.26 y $104. Generamos 4,210 traducciones con 9 modelos en 9 idiomas y recopilamos 8,455 veredictos ciegos por pares. Esta es la matriz resultante.

TL;DR

  • Opción predeterminada: gpt-5.6-sol mantuvo el liderazgo en 7 de 9 idiomas tras 8,455 veredictos ciegos. Para coreano gana claude-fable-5 (52%) y para italiano, gemini-3.7-flash (52%).
  • Por contenido: gemini-3.7-flash gana en textos literarios (60% frente al modelo base). Las cadenas de UI empatan en los 9 modelos y ninguno rompe placeholders, así que gana el más barato. La mejor opción por menos de $4 es qwen3.8-max.
  • El coste va de $0.26 (deepseek-v4-flash) a $104 (gemini-3.1-pro) por 1M de caracteres. Los $104 se deben sobre todo a 1.17M de tokens de razonamiento que el modelo no permite desactivar.
  • Los jueces prefirieron los modelos frontier a las posediciones humanas entre el 83% y el 100% de las veces.

¿Cómo evaluamos la calidad de la traducción?

Usamos tres elementos: un corpus paralelo, un único prompt preparado para producción y un panel de evaluación ciega. Todo lo que se describe a continuación, incluidos los veredictos sin procesar, está en el repositorio público del benchmark.

Corpus. Seleccionamos 52 segmentos en inglés de seis dominios y cada modelo los tradujo a los 9 idiomas. Cuatro dominios (noticias, redes sociales, habla y literatura, con 8 segmentos cada uno obtenidos mediante muestreo con seed) proceden de WMT24++ (Apache-2.0), el conjunto de evaluación de WMT, la competición anual compartida de traducción automática. Cada segmento de WMT24++ incluye una referencia con posedición humana, es decir, una traducción profesional revisada y corregida por un segundo lingüista. El conjunto cubre exactamente la variante de cada locale que ofrecemos: zh_CN, zh_TW, ja, ko, fr, de, es_MX, pt_BR, it. Los otros dos dominios son propios: 10 párrafos de documentación técnica tomados de posts publicados en los últimos 60 días, que también sirven como control de contaminación porque ningún modelo pudo incluirlos en sus datos de entrenamiento, y 10 cadenas de UI sintéticas creadas a partir de problemas conocidos de localización (el término “Archive” sin contexto, la integridad de {placeholder} y las formas plurales). El muestreo utiliza una seed y los identificadores de los segmentos son públicos, de modo que se puede comprobar que el corpus no fue seleccionado para favorecer un resultado.

Evaluación. Cada traducción candidata se comparó a ciegas con el mismo segmento traducido por un modelo base fijo, gpt-5.6-sol, que actualmente traduce este blog. Tres familias de jueces (claude-sonnet-5, gpt-5.6-luna y gemini-3.1-pro) puntuaron de forma independiente con una rúbrica derivada de MQM, la tipología estándar del sector para errores de traducción. Los criterios están ordenados por prioridad, por lo que un error de fidelidad pesa más que cualquier mejora estilística:

1. Accuracy     mistranslation, omission, addition, hallucination
2. Terminology  domain terms as a native engineer would keep them
3. Fluency      grammar, natural reading
4. Style        register appropriate to the text type
5. Locale       numbers, dates, units, punctuation width
6. Markup       inline code, placeholders, links preserved exactly

El diseño con niveles de gravedad sigue el enfoque de Anotación de intervalos de error, el protocolo que WMT utiliza para la evaluación humana desde 2024, adaptado aquí a comparaciones por pares realizadas por LLM. El corpus y las referencias proceden del paper de WMT24++. Cada par se evaluó dos veces, invirtiendo el orden de presentación. Si un juez se contradecía al cambiar el orden, el veredicto pasaba a ser un empate. Calculamos la media de los jueces con el mismo peso para cada uno, sin agruparlos en un único voto, y publicamos las cifras de cada juez para que el sesgo de familia siga siendo visible. En una segunda rama comparamos los tres modelos frontier (gpt-5.6-sol, claude-fable-5 y gemini-3.1-pro) con las referencias humanas de WMT24++. La integridad de los placeholders se comprobó mediante un script, no con jueces.

¿Qué modelo traduce mejor cada idioma?

Primero, el ganador: gpt-5.6-sol no es solo el modelo base de la tabla, sino también el campeón según las mediciones. Todos los rivales se puntúan frente a él y ninguno supera el 50% en más de un idioma. En la evaluación independiente contra referencias humanas, las traducciones de sol se prefirieron a las posediciones profesionales de WMT24++ en el 86-100% de los veredictos, el mejor resultado de los tres modelos frontier evaluados en esa rama. La tabla muestra la tasa de victorias frente a sol, sin contar empates y promediando los tres jueces. Un 50% indica paridad.

frente al modelo basezhzh-TWjakofrdeesptit
gemini-3.7-flash26%35%43%50%40%37%39%8%52%
claude-fable-519%15%38%52%39%32%31%20%47%
gemini-3.1-pro17%22%24%45%30%21%38%14%25%
qwen3.8-max26%21%18%28%36%17%32%14%25%
kimi-k327%15%23%23%16%24%10%0%24%
claude-sonnet-53%6%9%32%25%27%28%10%9%
deepseek-v4-flash20%6%0%24%22%19%12%7%11%
glm-5.29%3%10%6%7%8%11%7%12%
Elección por idiomasolsolsolfable-5solsolsolsol3.7-flash

Hay cuatro resultados claros. El modelo base mantiene el primer puesto en 7 de 9 idiomas, lo que valida retrospectivamente la ronda de evaluación ciega con la que lo elegimos para nuestro pipeline. El coreano es el idioma más disputado: fable-5 lo supera por poco (52%) y 3.7-flash alcanza la paridad. Si Corea es tu mercado principal, el ranking cambia de verdad. Los modelos open-weight chinos pierden incluso en su terreno: Qwen obtiene un 26% y GLM un 9% en chino simplificado. El desplome de GLM-5.2 se limita a esta tarea: pocos días antes, el mismo modelo mantuvo 6/6 keywords de schema en nuestro estudio de outputs estructurados. La traducción simplemente no es su fuerte.

¿Qué tipo de contenido sigue siendo difícil de traducir?

Para cada tipo de contenido mostramos la recomendación y su alternativa más fuerte, junto con la tasa de victorias de esa alternativa frente al modelo base. La mediana corresponde a los ocho rivales:

DominioModelo recomendadoAlternativa más fuerteMediana del resto
literaturagemini-3.7-flash (60% frente al modelo base)gpt-5.6-sol8%
noticiasgpt-5.6-solgemini-3.1-pro (48%)28%
hablagpt-5.6-solgemini-3.7-flash (43%)25%
redes socialesgpt-5.6-solqwen3.8-max (27%)12%
documentación técnicagpt-5.6-solfable-5 / 3.7-flash (30%)15%
UIel más barato (deepseek-v4-flash)cualquier modelo, la mayoría de los veredictos son empates (77% como máximo)61%

Un control merece atención aparte: los casos de documentación técnica proceden de párrafos que ningún modelo pudo ver durante el entrenamiento. Los modelos Gemini son los que más caen ahí. gemini-3.1-pro promedia un 33% en los dominios públicos de WMT, pero obtiene un 10% en los párrafos nuevos. La diferencia encaja tanto con una posible familiaridad con el benchmark como con la ventaja del modelo base en la prosa técnica que traduce en producción. Por eso la señalamos sin extraer una conclusión definitiva.

Las recomendaciones por tipo de contenido son directas. Para noticias, redes sociales, habla y documentación técnica, se mantiene el modelo base. Su ventaja es mayor en redes sociales, donde el slang, los fragmentos y el contexto implícito penalizan a todos los rivales, tres de los ocho quedan por debajo del 10%. La prosa literaria es la única categoría con otro ganador: gemini-3.7-flash supera al modelo base con un 60%, por lo que el contenido similar a la ficción tiene una opción mejor y más barata. En las cadenas de UI la lógica se invierte por completo. La mayoría de los veredictos son empates porque diez palabras de texto para botones dejan poco margen de discrepancia. Además, los nueve modelos conservaron intactos todos los {seconds}, %d y {workspace_name} (0 errores de 27 en cada uno). Si la calidad es indistinguible, decide el precio: traduce las cadenas de UI con el modelo más barato disponible. En 2026, los modelos parecen haber resuelto los placeholders rotos, uno de los errores clásicos de localización.

¿Cuánto cuesta la misma traducción en cada modelo?

El coste por millón de caracteres de salida va de $0.26 a $104.37. La cifra se calcula dividiendo el gasto total medido entre el output total para los nueve idiomas. Es una diferencia de 400x, y el modelo más caro no es el mejor:

Modelo$/1M de caracteres de salidaTokens de razonamiento consumidosRango de victorias
deepseek-v4-flash$0.2600-24%
glm-5.2$2.4803-12%
qwen3.8-max$3.18014-36%
claude-sonnet-5$8.3603-32%
kimi-k3$8.3700-27%
gpt-5.6-sol (modelo base)$13.700n/a
gemini-3.7-flash$14.46505K8-52%
claude-fable-5$39.81015-52%
gemini-3.1-pro$104.371,171,77014-45%

Los $104 son un impuesto por pensar, no una prima de calidad. La traducción no requiere razonamiento y todos los modelos que permiten fijarlo en cero funcionaron sin problemas. La generación actual de Gemini rechaza todas las formas de desactivarlo, así que gemini-3.1-pro consumió 1.17M de tokens de razonamiento en 468 traducciones. Terminó costando 7.6x más que el modelo base y perdió frente a él en los nueve idiomas. Incluso la variante flash consumió 505K tokens, lo que elevó su coste por encima del modelo base.

Las mejores opciones por coste se desprenden directamente de los datos. Si necesitas mantener una calidad cercana a la frontera, gemini-3.7-flash es el rival más fuerte: obtiene entre un 35% y un 52% frente al modelo base en siete de nueve idiomas (un 50% indica paridad; sus puntos débiles son el chino simplificado, con un 26%, y el portugués, con un 8%). También consigue la única victoria absoluta por dominio, literatura con un 60%, y su coste medido queda a menos de un 6% del modelo base porque el razonamiento obligatorio elimina el descuento de flash. Si el coste manda, deepseek-v4-flash traduce por 53x menos que el modelo base y no rompe ningún placeholder. La pérdida de calidad es real, un 0% de victorias en japonés es un mínimo, no un error de redondeo. Puede ser un compromiso razonable para contenido interno, pero no para contenido dirigido a clientes.

Entonces, ¿qué modelo conviene elegir?

Toda la matriz se resume en esta tabla de decisión:

Si quieres optimizarEligeEvidencia
Mejor calidad media en muchos idiomasgpt-5.6-solmantiene el liderazgo en 7 de 9 idiomas frente a todos los rivales
Coreanoclaude-fable-5, o 3.7-flash con un presupuesto ajustado52% frente al modelo base, el único idioma ganado por un rival; flash alcanza la paridad (50%)
Italianogemini-3.7-flash52% frente al modelo base al mismo precio
Literatura o contenido similar a la ficcióngemini-3.7-flash60% frente al modelo base, el único dominio ganado de forma absoluta
Noticias, redes sociales, habla y documentación técnicael modelo baseningún rival supera el 48% en estos dominios
Cadenas de UIdeepseek-v4-flashlos modelos empatan y todos conservan los placeholders, así que el modelo de $0.26 gana por precio
Traducción multilingüe económica, menos de $4/1M de caracteresqwen3.8-maxmejores tasas de victoria entre los modelos de menos de $4 en los 9 idiomas
Coste mínimo absoluto para contenido internodeepseek-v4-flash$0.26/1M de caracteres, 53x menos que el modelo base; hay que aceptar la brecha de calidad en CJK
No usar para traduccióngemini-3.1-pro, glm-5.2coste obligatorio de razonamiento de 7.6x; desplome de calidad específico de esta tarea

¿Los LLM ya superan a los traductores humanos?

Nuestros jueces prefirieron las traducciones automáticas a las referencias con posedición humana de WMT24++ entre el 83% y el 100% de las veces para los tres modelos frontier y en todos los idiomas, con una sola excepción: claude-fable-5 obtuvo un 44% en chino simplificado. Hay dos interpretaciones posibles y ambas deben tenerse en cuenta. La más contundente: los propios autores de WMT24++ concluyeron que los LLM ya son los mejores sistemas de traducción automática en los 55 idiomas que cubren, y nuestro panel coincide. La más prudente: los jueces LLM comparten preferencias estilísticas con los traductores LLM, y otro modelo puede preferir precisamente una traducción automática más pulida y fluida. Además, las referencias son posediciones, no textos literarios de referencia. El dato sí permite afirmar que ningún panel automatizado que podamos construir distingue ya la traducción automática frontier de una referencia profesional. La cuestión relevante pasa a ser el precio, donde las diferencias abarcan varios órdenes de magnitud.

¿Cuánto ruido introducen realmente los jueces LLM?

Lo suficiente para que una evaluación sin controles y en una sola pasada sea una mala práctica. Los controles, además, cuestan poco. Al mostrar dos veces el mismo par con el orden invertido, los jueces se contradijeron por completo, pasando de victoria a derrota, en el 9% de los casos para claude-sonnet-5, el 13% para gemini-3.1-pro y el 19% para gpt-5.6-luna. Nuestro protocolo convierte cada contradicción en empate. Así, el sesgo de posición se anula en vez de acumularse. Las tasas de victoria de cada juez se publican junto con la cifra agregada para comprobar que ninguna familia determina por sí sola una conclusión. Las tres familias discreparon en la magnitud de algunos resultados, sonnet-5 fue el juez más duro con el otro modelo de Claude, pero coincidieron en la dirección para todos los idiomas. Las conclusiones dependen de esa coincidencia.

Preguntas frecuentes

¿Qué LLM debería usar para traducir?

gpt-5.6-sol es la mejor opción predeterminada para traducción multilingüe: mantuvo el liderazgo en 7 de 9 idiomas frente a todos los rivales tras 8,455 veredictos ciegos. Para una calidad cercana a la frontera por el mismo precio, gemini-3.7-flash, que empata o gana en coreano e italiano. Para traducciones internas a gran escala donde manda el coste, deepseek-v4-flash por $0.26 por millón de caracteres, asumiendo una diferencia real de calidad en los idiomas CJK.

¿Los LLM son mejores que los traductores humanos?

En nuestros nueve idiomas, los jueces automatizados prefieren las traducciones de LLM frontier a las referencias con posedición humana entre el 83% y el 100% de las veces, en línea con los resultados de WMT24++. La afirmación se limita a posediciones con calidad de referencia y a jueces automáticos. No incluye la traducción literaria con intención editorial, y los jueces LLM pueden compartir preferencias estilísticas con los traductores LLM.

¿Conviene usar un modelo de razonamiento para traducir?

No. En nuestros datos, el razonamiento no aporta nada a la traducción y los modelos que no permiten desactivarlo cobran ese coste. gemini-3.1-pro consumió 1.17M de tokens de razonamiento en 468 traducciones cortas, costó 7.6x más que el modelo base y perdió en todos los idiomas. Fija reasoning_effort en none, o usa el parámetro equivalente del modelo para desactivarlo, en las cargas de traducción.

Mediciones realizadas del 2026-08-26 al 2026-08-29 a través del gateway de Synthorai: 9 modelos, 9 idiomas, 52 segmentos de 6 dominios, 4,210 traducciones y 8,455 veredictos ciegos por pares de 3 familias de jueces, con una rúbrica derivada de MQM e inversión del orden. El corpus, el código y todos los veredictos sin procesar están en el repositorio público. Las cifras absolutas proceden de este único lote, así que vuelve a medir antes de basarte en cualquier fila.

Artículos relacionados de la misma serie: LLM más barato por idioma, controles de razonamiento en 13 modelos, medición de outputs estructurados, coste de Gemini 3.7 Flash.

← Volver al blog