Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.
Meilleur LLM de traduction : 9 modèles, coûts multipliés par 400

Meilleur LLM de traduction : 9 modèles, coûts multipliés par 400

Sommaire
  1. Comment avons-nous évalué la qualité de traduction ?
  2. Quel modèle traduit le mieux dans chaque langue ?
  3. Quels contenus restent difficiles à traduire ?
  4. Combien coûte la même traduction selon le modèle ?
  5. Quel modèle faut-il choisir en pratique ?
  6. Les LLM dépassent-ils désormais les traducteurs humains ?
  7. À quel point les juges LLM sont-ils bruités ?
  8. FAQ

Il n’existe pas un seul meilleur modèle de traduction. gpt-5.6-sol arrive en tête dans 7 des 9 langues évaluées. claude-fable-5 le devance de peu en coréen. gemini-3.7-flash fait jeu égal en coréen et le dépasse en italien, pour le même prix mesuré. Selon l’API choisie, traduire un million de caractères coûte entre $0.26 et $104. Nous avons généré 4 210 traductions avec 9 modèles dans 9 langues, puis recueilli 8 455 verdicts comparatifs à l’aveugle. Cet article en présente la matrice complète.

TL;DR

  • Choix par défaut : gpt-5.6-sol conserve la première place dans 7 langues sur 9, d’après 8 455 verdicts à l’aveugle. Le coréen revient à claude-fable-5 (52 %) et l’italien à gemini-3.7-flash (52 %).
  • Par type de contenu : gemini-3.7-flash domine les textes littéraires (60 % face au modèle de référence). Pour les chaînes d’interface, les 9 modèles sont à égalité et aucun placeholder n’est endommagé, le moins cher l’emporte donc. Sous $4, le meilleur choix est qwen3.8-max.
  • Le coût par million de caractères va de $0.26 (deepseek-v4-flash) à $104 (gemini-3.1-pro). Les $104 viennent surtout des 1,17 million de tokens de raisonnement que le modèle refuse de désactiver.
  • Les juges ont préféré les modèles frontier aux traductions humaines révisées dans 83 à 100 % des cas.

Comment avons-nous évalué la qualité de traduction ?

Le protocole repose sur trois éléments : un corpus parallèle, un prompt adapté à la production et un panel de juges en aveugle. Toutes les données ci-dessous, y compris les verdicts bruts, sont disponibles dans le dépôt public du benchmark.

Corpus. Chaque modèle a traduit 52 segments anglais, répartis entre six domaines, dans les 9 langues. Quatre domaines (actualité, réseaux sociaux, parole et littérature, avec 8 segments échantillonnés à partir d’une seed pour chacun) proviennent de WMT24++ (Apache-2.0). Il s’agit du jeu d’évaluation de WMT, la campagne annuelle d’évaluation partagée en traduction automatique. Chaque segment WMT24++ possède une référence humaine révisée : une traduction professionnelle relue et corrigée par un second linguiste. Le corpus couvre précisément les variantes régionales que nous proposons : zh_CN, zh_TW, ja, ko, fr, de, es_MX, pt_BR, it. Nous avons ajouté deux domaines : 10 paragraphes de documentation technique tirés d’articles publiés au cours des 60 derniers jours, qui servent aussi de contrôle contre la contamination puisque les données d’entraînement des modèles ne peuvent pas les contenir, et 10 chaînes d’interface synthétiques construites à partir de difficultés connues de la localisation, comme le terme « Archive » sans contexte, l’intégrité des {placeholder} et les formes plurielles. L’échantillonnage utilise une seed et les identifiants des segments sont publics. Le corpus ne peut donc pas être accusé d’avoir été sélectionné pour favoriser un résultat.

Évaluation. Chaque traduction candidate a été comparée à l’aveugle à celle du même segment produite par un modèle de référence fixe, gpt-5.6-sol, qui traduit actuellement ce blog. Trois familles de juges (claude-sonnet-5, gpt-5.6-luna, gemini-3.1-pro) ont évalué les paires indépendamment selon une grille dérivée de MQM, la typologie de référence du secteur pour les erreurs de traduction. Les critères sont classés par priorité, afin qu’une erreur de sens pèse davantage que n’importe quelle amélioration stylistique :

1. Accuracy     mistranslation, omission, addition, hallucination
2. Terminology  domain terms as a native engineer would keep them
3. Fluency      grammar, natural reading
4. Style        register appropriate to the text type
5. Locale       numbers, dates, units, punctuation width
6. Markup       inline code, placeholders, links preserved exactly

La gradation par sévérité reprend l’approche de l’annotation des segments erronés, protocole utilisé par WMT pour l’évaluation humaine depuis 2024, adapté ici à une comparaison par paires effectuée par des LLM. Le corpus et les références viennent de l’article WMT24++. Chaque paire a été évaluée deux fois, en inversant l’ordre de présentation. Si un juge se contredisait après inversion, le verdict devenait une égalité. Les juges sont pondérés de manière identique, sans fusionner leurs résultats en un vote unique. Les chiffres de chaque juge sont publiés séparément pour rendre visibles les biais propres à chaque famille. Un second volet a comparé les trois modèles frontier (gpt-5.6-sol, claude-fable-5 et gemini-3.1-pro) aux références humaines de WMT24++. L’intégrité des placeholders a été vérifiée par un script, pas par les juges.

Quel modèle traduit le mieux dans chaque langue ?

Commençons par le vainqueur : gpt-5.6-sol n’est pas seulement le modèle de référence de ce tableau, c’est aussi celui qui obtient les meilleurs résultats. Tous les concurrents ci-dessous sont évalués face à lui. Aucun ne dépasse 50 % dans plus d’une langue. Dans le volet distinct consacré aux références humaines, les traductions de sol ont été préférées aux révisions professionnelles de WMT24++ dans 86 à 100 % des verdicts. C’est le meilleur résultat des trois modèles frontier testés dans ce volet. Le tableau indique le taux de victoire face à sol, hors égalités, avec une moyenne sur les trois juges. Un score de 50 % signifie que les modèles font jeu égal.

face au modèle de référencezhzh-TWjakofrdeesptit
gemini-3.7-flash26%35%43%50%40%37%39%8%52%
claude-fable-519%15%38%52%39%32%31%20%47%
gemini-3.1-pro17%22%24%45%30%21%38%14%25%
qwen3.8-max26%21%18%28%36%17%32%14%25%
kimi-k327%15%23%23%16%24%10%0%24%
claude-sonnet-53%6%9%32%25%27%28%10%9%
deepseek-v4-flash20%6%0%24%22%19%12%7%11%
glm-5.29%3%10%6%7%8%11%7%12%
Choix par languesolsolsolfable-5solsolsolsol3.7-flash

Quatre constats se dégagent. Le modèle de référence conserve nettement la tête dans 7 langues sur 9, ce qui valide a posteriori la campagne d’évaluation à l’aveugle qui nous avait conduits à le choisir pour notre propre pipeline. Le coréen est la langue la plus disputée : fable-5 passe légèrement devant (52 %) et 3.7-flash atteint la parité. Si le coréen est votre marché principal, le classement change réellement. Les modèles chinois à poids ouverts perdent sur leur propre terrain : Qwen obtient 26 % et GLM 9 % en chinois simplifié. Enfin, l’effondrement de GLM-5.2 est propre à cette tâche, pas général. Quelques jours plus tôt, le même modèle avait conservé 6 mots-clés de schéma sur 6 dans notre étude sur les sorties structurées. La traduction ne fait tout simplement pas partie de ses points forts.

Quels contenus restent difficiles à traduire ?

Pour chaque type de contenu, voici notre recommandation et sa meilleure alternative, avec le taux de victoire de cette dernière face au modèle de référence. La médiane du panel porte sur les huit concurrents :

DomaineModèle recommandéMeilleure alternativeMédiane du panel
littératuregemini-3.7-flash (60% face au modèle de référence)gpt-5.6-sol8%
actualitégpt-5.6-solgemini-3.1-pro (48%)28%
parolegpt-5.6-solgemini-3.7-flash (43%)25%
réseaux sociauxgpt-5.6-solqwen3.8-max (27%)12%
documentation techniquegpt-5.6-solfable-5 / 3.7-flash (30%)15%
interface utilisateurle moins cher (deepseek-v4-flash)tous les modèles, les verdicts sont principalement des égalités (77% au plus haut)61%

Un contrôle mérite d’être détaillé : les lignes de documentation technique viennent de paragraphes qu’aucun modèle n’a pu voir pendant son entraînement. C’est sur ces contenus que les modèles Gemini reculent le plus. gemini-3.1-pro affiche 33 % en moyenne sur les domaines publics de WMT, mais seulement 10 % sur les paragraphes récents. Cet écart peut indiquer une familiarité avec le benchmark, mais aussi un avantage du modèle de référence sur la prose technique qu’il traduit en production. Nous le signalons sans en tirer de conclusion définitive.

Par type de contenu, le modèle de référence reste recommandé pour l’actualité, les réseaux sociaux, la parole et la documentation technique. Son avance est particulièrement nette sur les réseaux sociaux : l’argot, les fragments de phrase et le contexte implicite pénalisent tous ses concurrents, dont trois sur huit obtiennent moins de 10 %. La littérature est la seule catégorie où le choix change. gemini-3.7-flash bat directement le modèle de référence avec 60 %. Pour les contenus proches de la fiction, il constitue donc une option à la fois moins chère et meilleure. Les chaînes d’interface inversent complètement le raisonnement. Les verdicts sont surtout des égalités, car dix mots de libellé de bouton laissent peu de place au désaccord. Les neuf modèles ont aussi conservé intacts tous les {seconds}, %d et {workspace_name} (0 erreur sur 27 pour chacun). Quand la qualité est indifférenciable, le prix tranche : utilisez votre modèle le moins cher pour traduire les chaînes d’interface. En 2026, les modèles semblent avoir résolu la corruption des placeholders, ce grand classique des bugs de localisation.

Combien coûte la même traduction selon le modèle ?

Le coût par million de caractères produits va de $0.26 à $104.37, soit un facteur 400. Il correspond aux dépenses totales mesurées divisées par le volume total produit, toutes langues confondues. Le modèle le plus cher n’est pas le meilleur :

Modèle$/1M caractères produitsTokens de raisonnement consommésFourchette de taux de victoire
deepseek-v4-flash$0.2600-24%
glm-5.2$2.4803-12%
qwen3.8-max$3.18014-36%
claude-sonnet-5$8.3603-32%
kimi-k3$8.3700-27%
gpt-5.6-sol (modèle de référence)$13.700n/a
gemini-3.7-flash$14.46505K8-52%
claude-fable-5$39.81015-52%
gemini-3.1-pro$104.371,171,77014-45%

La ligne à $104 correspond au coût du raisonnement, pas à une meilleure qualité. Traduire ne demande aucun raisonnement, et tous les modèles permettant de le fixer à zéro ont fonctionné sans problème. La génération actuelle de Gemini refuse toutes les variantes du paramètre de désactivation. gemini-3.1-pro a donc consommé 1,17 million de tokens de raisonnement pour 468 traductions. Il revient 7,6 fois plus cher que le modèle de référence, tout en perdant face à lui dans les neuf langues. Même la variante flash a consommé 505K tokens, ce qui porte son coût au-dessus de celui du modèle de référence.

Les meilleurs rapports qualité-prix se déduisent directement de ces résultats. Si vous visez une qualité proche du niveau frontier, gemini-3.7-flash est le concurrent le plus solide : il obtient 35 à 52 % face au modèle de référence dans sept langues sur neuf (50 % correspond à la parité, avec deux points faibles à 26 % en chinois simplifié et 8 % en portugais). C’est aussi le seul à remporter nettement un domaine, la littérature, avec 60 %. Son coût mesuré reste à moins de 6 % de celui du modèle de référence, car le raisonnement obligatoire absorbe la remise tarifaire de la variante flash. Si le coût prime, deepseek-v4-flash traduit pour 53 fois moins cher que le modèle de référence et n’a endommagé aucun placeholder. La perte de qualité est réelle : son taux de victoire de 0 % en japonais n’est pas un effet d’arrondi. Le compromis peut se défendre pour du contenu interne, beaucoup moins pour du contenu destiné aux clients.

Quel modèle faut-il choisir en pratique ?

Toute la matrice se résume à ce tableau de décision :

Votre prioritéChoixRésultat
Meilleure qualité moyenne, nombreuses languesgpt-5.6-solconserve la tête dans 7 langues sur 9 face à tous les concurrents
Coréenclaude-fable-5, ou 3.7-flash avec un budget limité52% face au modèle de référence, seule langue remportée par un concurrent; flash atteint la parité (50%)
Italiengemini-3.7-flash52% face au modèle de référence, au même prix
Littérature ou contenus proches de la fictiongemini-3.7-flash60% face au modèle de référence, seul domaine nettement remporté
Actualité, réseaux sociaux, parole, documentation techniquele modèle de référenceaucun concurrent ne dépasse 48% dans ces domaines
Chaînes d’interfacedeepseek-v4-flashégalité entre les modèles et placeholders préservés partout, le modèle à $0.26 gagne donc sur le prix
Multilingue à petit budget, sous $4/1M caractèresqwen3.8-maxmeilleurs taux de victoire de la tranche sous $4 dans les 9 langues
Coût minimal, contenu internedeepseek-v4-flash$0.26/1M caractères, 53x moins que le modèle de référence; il faut accepter l’écart de qualité en langues CJK
À ne jamais utiliser pour la traductiongemini-3.1-pro, glm-5.2surcoût obligatoire de raisonnement de 7,6x; chute de qualité propre à cette tâche

Les LLM dépassent-ils désormais les traducteurs humains ?

Pour les trois modèles frontier et dans toutes les langues, nos juges ont préféré la machine aux références humaines révisées de WMT24++ dans 83 à 100 % des verdicts. Une seule exception : claude-fable-5 en chinois simplifié, avec 44 %. Ce résultat permet deux lectures, qu’il faut présenter toutes les deux. La lecture forte : les auteurs de WMT24++ ont eux-mêmes conclu que les LLM sont désormais les meilleurs systèmes de traduction automatique dans les 55 langues couvertes, et notre panel arrive à la même conclusion. La lecture prudente : les LLM juges partagent des préférences stylistiques avec les LLM traducteurs. Une traduction automatique fluide et bien polie peut être exactement ce qu’un autre modèle préfère. Les références sont des traductions révisées, pas des références littéraires parfaites. Une conclusion reste solide : aucun panel automatisé à notre disposition ne distingue désormais la traduction des modèles frontier de références humaines professionnelles. La question intéressante devient donc celle du prix, où les écarts atteignent plusieurs ordres de grandeur.

À quel point les juges LLM sont-ils bruités ?

Assez pour qu’une évaluation non contrôlée en un seul passage soit inacceptable, mais les garde-fous coûtent peu. Lorsque nous avons présenté deux fois la même paire en inversant l’ordre, les juges ont produit des verdicts directement contradictoires, passant d’une victoire à une défaite, dans 9 % des cas pour claude-sonnet-5, 13 % pour gemini-3.1-pro et 19 % pour gpt-5.6-luna. Notre protocole transforme chaque contradiction en égalité. Le biais de position s’annule donc au lieu de s’accumuler. Les taux de victoire par juge sont publiés avec le résultat agrégé, ce qui permet de vérifier qu’aucune famille ne détermine seule une conclusion. Les trois familles divergent parfois sur l’ampleur des écarts, sonnet-5 étant notamment le juge le plus sévère envers l’autre modèle Claude. En revanche, elles s’accordent sur le sens du résultat dans chaque langue, et nos conclusions reposent sur ce point.

FAQ

Quel LLM utiliser pour la traduction ?

gpt-5.6-sol est le meilleur choix par défaut pour la traduction multilingue : il conserve la tête dans 7 langues sur 9 face à tous les concurrents, d’après 8 455 verdicts à l’aveugle. Pour une qualité proche du niveau frontier au même prix, choisissez gemini-3.7-flash, qui égale ou dépasse le modèle de référence en coréen et en italien. Pour de gros volumes de traduction interne où le coût prime, deepseek-v4-flash revient à $0.26 par million de caractères, au prix d’une baisse de qualité réelle dans les langues CJK.

Les LLM sont-ils meilleurs que les traducteurs humains ?

Dans nos neuf langues, les juges automatisés préfèrent désormais les traductions des LLM frontier aux références humaines révisées dans 83 à 100 % des cas, ce qui rejoint les conclusions de WMT24++. Cette affirmation se limite aux références révisées et aux juges automatiques. Elle ne couvre pas la traduction littéraire guidée par une intention éditoriale, et les juges LLM peuvent partager les préférences stylistiques des LLM traducteurs.

Faut-il utiliser un modèle de raisonnement pour traduire ?

Non. Nos données ne montrent aucun bénéfice du raisonnement pour la traduction, tandis que les modèles incapables de le désactiver en font payer le prix. gemini-3.1-pro a consommé 1,17 million de tokens de raisonnement pour 468 traductions courtes. Il coûte ainsi 7,6 fois plus cher que le modèle de référence, tout en perdant dans chaque langue. Pour les workloads de traduction, fixez reasoning_effort à none, ou utilisez le paramètre équivalent du modèle pour le désactiver.

Mesures effectuées du 2026-08-26 au 2026-08-29 via la gateway Synthorai : 9 modèles, 9 langues, 52 segments dans 6 domaines, 4 210 traductions et 8 455 verdicts comparatifs à l’aveugle produits par 3 familles de juges selon une grille dérivée de MQM, avec inversion de l’ordre. Le corpus, le code et tous les verdicts bruts sont disponibles dans le dépôt public. Les chiffres absolus proviennent de ce seul batch. Refaites les mesures avant de vous appuyer sur une ligne.

Dans la même série : LLM le moins cher par langue, contrôle du raisonnement sur 13 modèles, mesure des sorties structurées, coût de Gemini 3.7 Flash.

← Retour au blog