Mejor LLM para traducción: 9 modelos, 9 idiomas, coste 400x
Contenido
- ¿Cómo evaluamos la calidad de la traducción?
- ¿Qué modelo traduce mejor cada idioma?
- ¿Qué tipo de contenido sigue siendo difícil de traducir?
- ¿Cuánto cuesta la misma traducción en cada modelo?
- Entonces, ¿qué modelo conviene elegir?
- ¿Los LLM ya superan a los traductores humanos?
- ¿Cuánto ruido introducen realmente los jueces LLM?
- Preguntas frecuentes
No existe un único modelo que sea el mejor para traducir: gpt-5.6-sol lidera en 7 de los 9 idiomas evaluados, claude-fable-5 lo supera por poco en coreano y gemini-3.7-flash empata con él en coreano y lo adelanta en italiano al mismo precio medido. Según la API elegida, traducir el mismo millón de caracteres cuesta entre $0.26 y $104. Generamos 4,210 traducciones con 9 modelos en 9 idiomas y recopilamos 8,455 veredictos ciegos por pares. Esta es la matriz resultante.
TL;DR
- Opción predeterminada: gpt-5.6-sol mantuvo el liderazgo en 7 de 9 idiomas tras 8,455 veredictos ciegos. Para coreano gana claude-fable-5 (52%) y para italiano, gemini-3.7-flash (52%).
- Por contenido: gemini-3.7-flash gana en textos literarios (60% frente al modelo base). Las cadenas de UI empatan en los 9 modelos y ninguno rompe placeholders, así que gana el más barato. La mejor opción por menos de $4 es qwen3.8-max.
- El coste va de $0.26 (deepseek-v4-flash) a $104 (gemini-3.1-pro) por 1M de caracteres. Los $104 se deben sobre todo a 1.17M de tokens de razonamiento que el modelo no permite desactivar.
- Los jueces prefirieron los modelos frontier a las posediciones humanas entre el 83% y el 100% de las veces.
¿Cómo evaluamos la calidad de la traducción?
Usamos tres elementos: un corpus paralelo, un único prompt preparado para producción y un panel de evaluación ciega. Todo lo que se describe a continuación, incluidos los veredictos sin procesar, está en el repositorio público del benchmark.
Corpus. Seleccionamos 52 segmentos en inglés de seis dominios y cada modelo los tradujo a los 9 idiomas. Cuatro dominios (noticias, redes sociales, habla y literatura, con 8 segmentos cada uno obtenidos mediante muestreo con seed) proceden de WMT24++ (Apache-2.0), el conjunto de evaluación de WMT, la competición anual compartida de traducción automática. Cada segmento de WMT24++ incluye una referencia con posedición humana, es decir, una traducción profesional revisada y corregida por un segundo lingüista. El conjunto cubre exactamente la variante de cada locale que ofrecemos: zh_CN, zh_TW, ja, ko, fr, de, es_MX, pt_BR, it. Los otros dos dominios son propios: 10 párrafos de documentación técnica tomados de posts publicados en los últimos 60 días, que también sirven como control de contaminación porque ningún modelo pudo incluirlos en sus datos de entrenamiento, y 10 cadenas de UI sintéticas creadas a partir de problemas conocidos de localización (el término “Archive” sin contexto, la integridad de {placeholder} y las formas plurales). El muestreo utiliza una seed y los identificadores de los segmentos son públicos, de modo que se puede comprobar que el corpus no fue seleccionado para favorecer un resultado.
Evaluación. Cada traducción candidata se comparó a ciegas con el mismo segmento traducido por un modelo base fijo, gpt-5.6-sol, que actualmente traduce este blog. Tres familias de jueces (claude-sonnet-5, gpt-5.6-luna y gemini-3.1-pro) puntuaron de forma independiente con una rúbrica derivada de MQM, la tipología estándar del sector para errores de traducción. Los criterios están ordenados por prioridad, por lo que un error de fidelidad pesa más que cualquier mejora estilística:
1. Accuracy mistranslation, omission, addition, hallucination
2. Terminology domain terms as a native engineer would keep them
3. Fluency grammar, natural reading
4. Style register appropriate to the text type
5. Locale numbers, dates, units, punctuation width
6. Markup inline code, placeholders, links preserved exactly
El diseño con niveles de gravedad sigue el enfoque de Anotación de intervalos de error, el protocolo que WMT utiliza para la evaluación humana desde 2024, adaptado aquí a comparaciones por pares realizadas por LLM. El corpus y las referencias proceden del paper de WMT24++. Cada par se evaluó dos veces, invirtiendo el orden de presentación. Si un juez se contradecía al cambiar el orden, el veredicto pasaba a ser un empate. Calculamos la media de los jueces con el mismo peso para cada uno, sin agruparlos en un único voto, y publicamos las cifras de cada juez para que el sesgo de familia siga siendo visible. En una segunda rama comparamos los tres modelos frontier (gpt-5.6-sol, claude-fable-5 y gemini-3.1-pro) con las referencias humanas de WMT24++. La integridad de los placeholders se comprobó mediante un script, no con jueces.
¿Qué modelo traduce mejor cada idioma?
Primero, el ganador: gpt-5.6-sol no es solo el modelo base de la tabla, sino también el campeón según las mediciones. Todos los rivales se puntúan frente a él y ninguno supera el 50% en más de un idioma. En la evaluación independiente contra referencias humanas, las traducciones de sol se prefirieron a las posediciones profesionales de WMT24++ en el 86-100% de los veredictos, el mejor resultado de los tres modelos frontier evaluados en esa rama. La tabla muestra la tasa de victorias frente a sol, sin contar empates y promediando los tres jueces. Un 50% indica paridad.
| frente al modelo base | zh | zh-TW | ja | ko | fr | de | es | pt | it |
|---|---|---|---|---|---|---|---|---|---|
| gemini-3.7-flash | 26% | 35% | 43% | 50% | 40% | 37% | 39% | 8% | 52% |
| claude-fable-5 | 19% | 15% | 38% | 52% | 39% | 32% | 31% | 20% | 47% |
| gemini-3.1-pro | 17% | 22% | 24% | 45% | 30% | 21% | 38% | 14% | 25% |
| qwen3.8-max | 26% | 21% | 18% | 28% | 36% | 17% | 32% | 14% | 25% |
| kimi-k3 | 27% | 15% | 23% | 23% | 16% | 24% | 10% | 0% | 24% |
| claude-sonnet-5 | 3% | 6% | 9% | 32% | 25% | 27% | 28% | 10% | 9% |
| deepseek-v4-flash | 20% | 6% | 0% | 24% | 22% | 19% | 12% | 7% | 11% |
| glm-5.2 | 9% | 3% | 10% | 6% | 7% | 8% | 11% | 7% | 12% |
| Elección por idioma | sol | sol | sol | fable-5 | sol | sol | sol | sol | 3.7-flash |
Hay cuatro resultados claros. El modelo base mantiene el primer puesto en 7 de 9 idiomas, lo que valida retrospectivamente la ronda de evaluación ciega con la que lo elegimos para nuestro pipeline. El coreano es el idioma más disputado: fable-5 lo supera por poco (52%) y 3.7-flash alcanza la paridad. Si Corea es tu mercado principal, el ranking cambia de verdad. Los modelos open-weight chinos pierden incluso en su terreno: Qwen obtiene un 26% y GLM un 9% en chino simplificado. El desplome de GLM-5.2 se limita a esta tarea: pocos días antes, el mismo modelo mantuvo 6/6 keywords de schema en nuestro estudio de outputs estructurados. La traducción simplemente no es su fuerte.
¿Qué tipo de contenido sigue siendo difícil de traducir?
Para cada tipo de contenido mostramos la recomendación y su alternativa más fuerte, junto con la tasa de victorias de esa alternativa frente al modelo base. La mediana corresponde a los ocho rivales:
| Dominio | Modelo recomendado | Alternativa más fuerte | Mediana del resto |
|---|---|---|---|
| literatura | gemini-3.7-flash (60% frente al modelo base) | gpt-5.6-sol | 8% |
| noticias | gpt-5.6-sol | gemini-3.1-pro (48%) | 28% |
| habla | gpt-5.6-sol | gemini-3.7-flash (43%) | 25% |
| redes sociales | gpt-5.6-sol | qwen3.8-max (27%) | 12% |
| documentación técnica | gpt-5.6-sol | fable-5 / 3.7-flash (30%) | 15% |
| UI | el más barato (deepseek-v4-flash) | cualquier modelo, la mayoría de los veredictos son empates (77% como máximo) | 61% |
Un control merece atención aparte: los casos de documentación técnica proceden de párrafos que ningún modelo pudo ver durante el entrenamiento. Los modelos Gemini son los que más caen ahí. gemini-3.1-pro promedia un 33% en los dominios públicos de WMT, pero obtiene un 10% en los párrafos nuevos. La diferencia encaja tanto con una posible familiaridad con el benchmark como con la ventaja del modelo base en la prosa técnica que traduce en producción. Por eso la señalamos sin extraer una conclusión definitiva.
Las recomendaciones por tipo de contenido son directas. Para noticias, redes sociales, habla y documentación técnica, se mantiene el modelo base. Su ventaja es mayor en redes sociales, donde el slang, los fragmentos y el contexto implícito penalizan a todos los rivales, tres de los ocho quedan por debajo del 10%. La prosa literaria es la única categoría con otro ganador: gemini-3.7-flash supera al modelo base con un 60%, por lo que el contenido similar a la ficción tiene una opción mejor y más barata. En las cadenas de UI la lógica se invierte por completo. La mayoría de los veredictos son empates porque diez palabras de texto para botones dejan poco margen de discrepancia. Además, los nueve modelos conservaron intactos todos los {seconds}, %d y {workspace_name} (0 errores de 27 en cada uno). Si la calidad es indistinguible, decide el precio: traduce las cadenas de UI con el modelo más barato disponible. En 2026, los modelos parecen haber resuelto los placeholders rotos, uno de los errores clásicos de localización.
¿Cuánto cuesta la misma traducción en cada modelo?
El coste por millón de caracteres de salida va de $0.26 a $104.37. La cifra se calcula dividiendo el gasto total medido entre el output total para los nueve idiomas. Es una diferencia de 400x, y el modelo más caro no es el mejor:
| Modelo | $/1M de caracteres de salida | Tokens de razonamiento consumidos | Rango de victorias |
|---|---|---|---|
| deepseek-v4-flash | $0.26 | 0 | 0-24% |
| glm-5.2 | $2.48 | 0 | 3-12% |
| qwen3.8-max | $3.18 | 0 | 14-36% |
| claude-sonnet-5 | $8.36 | 0 | 3-32% |
| kimi-k3 | $8.37 | 0 | 0-27% |
| gpt-5.6-sol (modelo base) | $13.70 | 0 | n/a |
| gemini-3.7-flash | $14.46 | 505K | 8-52% |
| claude-fable-5 | $39.81 | 0 | 15-52% |
| gemini-3.1-pro | $104.37 | 1,171,770 | 14-45% |
Los $104 son un impuesto por pensar, no una prima de calidad. La traducción no requiere razonamiento y todos los modelos que permiten fijarlo en cero funcionaron sin problemas. La generación actual de Gemini rechaza todas las formas de desactivarlo, así que gemini-3.1-pro consumió 1.17M de tokens de razonamiento en 468 traducciones. Terminó costando 7.6x más que el modelo base y perdió frente a él en los nueve idiomas. Incluso la variante flash consumió 505K tokens, lo que elevó su coste por encima del modelo base.
Las mejores opciones por coste se desprenden directamente de los datos. Si necesitas mantener una calidad cercana a la frontera, gemini-3.7-flash es el rival más fuerte: obtiene entre un 35% y un 52% frente al modelo base en siete de nueve idiomas (un 50% indica paridad; sus puntos débiles son el chino simplificado, con un 26%, y el portugués, con un 8%). También consigue la única victoria absoluta por dominio, literatura con un 60%, y su coste medido queda a menos de un 6% del modelo base porque el razonamiento obligatorio elimina el descuento de flash. Si el coste manda, deepseek-v4-flash traduce por 53x menos que el modelo base y no rompe ningún placeholder. La pérdida de calidad es real, un 0% de victorias en japonés es un mínimo, no un error de redondeo. Puede ser un compromiso razonable para contenido interno, pero no para contenido dirigido a clientes.
Entonces, ¿qué modelo conviene elegir?
Toda la matriz se resume en esta tabla de decisión:
| Si quieres optimizar | Elige | Evidencia |
|---|---|---|
| Mejor calidad media en muchos idiomas | gpt-5.6-sol | mantiene el liderazgo en 7 de 9 idiomas frente a todos los rivales |
| Coreano | claude-fable-5, o 3.7-flash con un presupuesto ajustado | 52% frente al modelo base, el único idioma ganado por un rival; flash alcanza la paridad (50%) |
| Italiano | gemini-3.7-flash | 52% frente al modelo base al mismo precio |
| Literatura o contenido similar a la ficción | gemini-3.7-flash | 60% frente al modelo base, el único dominio ganado de forma absoluta |
| Noticias, redes sociales, habla y documentación técnica | el modelo base | ningún rival supera el 48% en estos dominios |
| Cadenas de UI | deepseek-v4-flash | los modelos empatan y todos conservan los placeholders, así que el modelo de $0.26 gana por precio |
| Traducción multilingüe económica, menos de $4/1M de caracteres | qwen3.8-max | mejores tasas de victoria entre los modelos de menos de $4 en los 9 idiomas |
| Coste mínimo absoluto para contenido interno | deepseek-v4-flash | $0.26/1M de caracteres, 53x menos que el modelo base; hay que aceptar la brecha de calidad en CJK |
| No usar para traducción | gemini-3.1-pro, glm-5.2 | coste obligatorio de razonamiento de 7.6x; desplome de calidad específico de esta tarea |
¿Los LLM ya superan a los traductores humanos?
Nuestros jueces prefirieron las traducciones automáticas a las referencias con posedición humana de WMT24++ entre el 83% y el 100% de las veces para los tres modelos frontier y en todos los idiomas, con una sola excepción: claude-fable-5 obtuvo un 44% en chino simplificado. Hay dos interpretaciones posibles y ambas deben tenerse en cuenta. La más contundente: los propios autores de WMT24++ concluyeron que los LLM ya son los mejores sistemas de traducción automática en los 55 idiomas que cubren, y nuestro panel coincide. La más prudente: los jueces LLM comparten preferencias estilísticas con los traductores LLM, y otro modelo puede preferir precisamente una traducción automática más pulida y fluida. Además, las referencias son posediciones, no textos literarios de referencia. El dato sí permite afirmar que ningún panel automatizado que podamos construir distingue ya la traducción automática frontier de una referencia profesional. La cuestión relevante pasa a ser el precio, donde las diferencias abarcan varios órdenes de magnitud.
¿Cuánto ruido introducen realmente los jueces LLM?
Lo suficiente para que una evaluación sin controles y en una sola pasada sea una mala práctica. Los controles, además, cuestan poco. Al mostrar dos veces el mismo par con el orden invertido, los jueces se contradijeron por completo, pasando de victoria a derrota, en el 9% de los casos para claude-sonnet-5, el 13% para gemini-3.1-pro y el 19% para gpt-5.6-luna. Nuestro protocolo convierte cada contradicción en empate. Así, el sesgo de posición se anula en vez de acumularse. Las tasas de victoria de cada juez se publican junto con la cifra agregada para comprobar que ninguna familia determina por sí sola una conclusión. Las tres familias discreparon en la magnitud de algunos resultados, sonnet-5 fue el juez más duro con el otro modelo de Claude, pero coincidieron en la dirección para todos los idiomas. Las conclusiones dependen de esa coincidencia.
Preguntas frecuentes
¿Qué LLM debería usar para traducir?
gpt-5.6-sol es la mejor opción predeterminada para traducción multilingüe: mantuvo el liderazgo en 7 de 9 idiomas frente a todos los rivales tras 8,455 veredictos ciegos. Para una calidad cercana a la frontera por el mismo precio, gemini-3.7-flash, que empata o gana en coreano e italiano. Para traducciones internas a gran escala donde manda el coste, deepseek-v4-flash por $0.26 por millón de caracteres, asumiendo una diferencia real de calidad en los idiomas CJK.
¿Los LLM son mejores que los traductores humanos?
En nuestros nueve idiomas, los jueces automatizados prefieren las traducciones de LLM frontier a las referencias con posedición humana entre el 83% y el 100% de las veces, en línea con los resultados de WMT24++. La afirmación se limita a posediciones con calidad de referencia y a jueces automáticos. No incluye la traducción literaria con intención editorial, y los jueces LLM pueden compartir preferencias estilísticas con los traductores LLM.
¿Conviene usar un modelo de razonamiento para traducir?
No. En nuestros datos, el razonamiento no aporta nada a la traducción y los modelos que no permiten desactivarlo cobran ese coste. gemini-3.1-pro consumió 1.17M de tokens de razonamiento en 468 traducciones cortas, costó 7.6x más que el modelo base y perdió en todos los idiomas. Fija reasoning_effort en none, o usa el parámetro equivalente del modelo para desactivarlo, en las cargas de traducción.
Mediciones realizadas del 2026-08-26 al 2026-08-29 a través del gateway de Synthorai: 9 modelos, 9 idiomas, 52 segmentos de 6 dominios, 4,210 traducciones y 8,455 veredictos ciegos por pares de 3 familias de jueces, con una rúbrica derivada de MQM e inversión del orden. El corpus, el código y todos los veredictos sin procesar están en el repositorio público. Las cifras absolutas proceden de este único lote, así que vuelve a medir antes de basarte en cualquier fila.
Artículos relacionados de la misma serie: LLM más barato por idioma, controles de razonamiento en 13 modelos, medición de outputs estructurados, coste de Gemini 3.7 Flash.