Miglior LLM per tradurre: 9 modelli e costi fino a 400x
Indice
- Come abbiamo valutato la qualità della traduzione?
- Qual è il modello migliore per tradurre ogni lingua?
- Quali contenuti restano difficili da tradurre?
- Quanto costa la stessa traduzione con ogni modello?
- Quale modello conviene scegliere in pratica?
- Gli LLM battono già i traduttori umani?
- Quanto sono rumorosi i giudici LLM?
- FAQ
Non esiste un unico modello migliore per la traduzione: gpt-5.6-sol prevale in 7 delle 9 lingue valutate, claude-fable-5 lo supera di poco in coreano, mentre gemini-3.7-flash lo eguaglia in coreano e lo batte in italiano allo stesso costo rilevato. A seconda dell’API scelta, tradurre lo stesso milione di caratteri costa da $0.26 a $104. Abbiamo generato 4.210 traduzioni con 9 modelli in 9 lingue e raccolto 8.455 verdetti ciechi a coppie. Questo articolo presenta la matrice risultante.
TL;DR
- Scelta predefinita: gpt-5.6-sol ha mantenuto il primato in 7 lingue su 9 nei nostri 8.455 verdetti ciechi. Per il coreano vince claude-fable-5 (52%), per l’italiano gemini-3.7-flash (52%).
- Per tipo di contenuto: nei testi letterari vince gemini-3.7-flash (60% contro la baseline). Per le stringhe UI, tutti i 9 modelli sono alla pari e nessun placeholder si rompe, quindi conviene il più economico. Sotto i $4, la scelta migliore è qwen3.8-max.
- Il costo per 1M di caratteri va da $0.26 (deepseek-v4-flash) a $104 (gemini-3.1-pro). I $104 dipendono soprattutto da 1,17M di reasoning token che il modello non consente di disattivare.
- Nell’83-100% dei casi, i giudici hanno preferito i modelli frontier alle traduzioni umane sottoposte a post-editing.
Come abbiamo valutato la qualità della traduzione?
Tre elementi: un corpus parallelo, un unico prompt adatto alla produzione e un panel di giudici in cieco. Tutto il materiale, compresi i verdetti grezzi, è disponibile nel repository pubblico del benchmark.
Corpus. 52 segmenti in inglese, distribuiti in sei domini e tradotti da ogni modello in tutte le 9 lingue. Quattro domini (notizie, social, parlato e letteratura, con 8 segmenti ciascuno estratti tramite campionamento con seed) provengono da WMT24++ (Apache-2.0), il set di valutazione di WMT, la competizione annuale dedicata alla traduzione automatica. Ogni segmento WMT24++ include una traduzione di riferimento sottoposta a post-editing umano, cioè una traduzione professionale rivista e corretta da un secondo linguista. Il set copre esattamente le varianti locali che supportiamo: zh_CN, zh_TW, ja, ko, fr, de, es_MX, pt_BR, it. Gli altri due domini sono nostri: 10 paragrafi di documentazione tecnica tratti da articoli pubblicati negli ultimi 60 giorni, usati anche come controllo della contaminazione perché non possono comparire nei dati di training dei modelli, e 10 stringhe UI sintetiche costruite a partire da problemi noti di localizzazione, come “Archive” senza contesto, integrità di {placeholder} e forme plurali. Il campionamento usa un seed e gli ID dei segmenti sono pubblici, quindi il corpus non può essere accusato di essere stato selezionato per favorire un risultato.
Valutazione. Ogni traduzione candidata è stata confrontata in cieco con la traduzione dello stesso segmento prodotta da una baseline fissa, gpt-5.6-sol, il modello che attualmente traduce questo blog. Tre famiglie di giudici (claude-sonnet-5, gpt-5.6-luna, gemini-3.1-pro) hanno valutato i risultati in modo indipendente, seguendo una rubrica derivata da MQM, la tassonomia standard del settore per gli errori di traduzione. I criteri sono ordinati per priorità, quindi un errore di accuratezza pesa più di qualsiasi miglioramento stilistico:
1. Accuracy mistranslation, omission, addition, hallucination
2. Terminology domain terms as a native engineer would keep them
3. Fluency grammar, natural reading
4. Style register appropriate to the text type
5. Locale numbers, dates, units, punctuation width
6. Markup inline code, placeholders, links preserved exactly
Il sistema basato sulla gravità degli errori riprende l’impostazione di Error Span Annotation, il protocollo usato da WMT per la valutazione umana dal 2024, qui adattato al giudizio a coppie con LLM. Corpus e riferimenti provengono dal paper di WMT24++. Ogni coppia è stata valutata due volte invertendo l’ordine di presentazione. Se un giudice si contraddiceva tra i due ordini, il risultato diventava un pareggio. Le valutazioni dei giudici sono mediate con lo stesso peso, mai aggregate in un unico voto. Pubblichiamo anche i dati per singolo giudice, così gli eventuali bias di famiglia restano visibili. Un secondo test ha confrontato i tre modelli frontier, gpt-5.6-sol, claude-fable-5 e gemini-3.1-pro, con le traduzioni umane di riferimento di WMT24++. L’integrità dei placeholder è stata verificata tramite script, non dai giudici.
Qual è il modello migliore per tradurre ogni lingua?
Partiamo dal vincitore: gpt-5.6-sol non è soltanto la baseline della tabella, ma il modello con i risultati migliori. Tutti i concorrenti sono valutati rispetto a sol e nessuno supera il 50% in più di una lingua. Nel test separato contro le traduzioni umane, i giudici hanno preferito le traduzioni di sol ai post-editing professionali di WMT24++ nell’86-100% dei verdetti. È il risultato migliore fra i tre modelli frontier valutati in quel test. La tabella indica il tasso di vittoria contro sol, escludendo i pareggi e mediando i tre giudici. Il 50% indica parità.
| contro la baseline | zh | zh-TW | ja | ko | fr | de | es | pt | it |
|---|---|---|---|---|---|---|---|---|---|
| gemini-3.7-flash | 26% | 35% | 43% | 50% | 40% | 37% | 39% | 8% | 52% |
| claude-fable-5 | 19% | 15% | 38% | 52% | 39% | 32% | 31% | 20% | 47% |
| gemini-3.1-pro | 17% | 22% | 24% | 45% | 30% | 21% | 38% | 14% | 25% |
| qwen3.8-max | 26% | 21% | 18% | 28% | 36% | 17% | 32% | 14% | 25% |
| kimi-k3 | 27% | 15% | 23% | 23% | 16% | 24% | 10% | 0% | 24% |
| claude-sonnet-5 | 3% | 6% | 9% | 32% | 25% | 27% | 28% | 10% | 9% |
| deepseek-v4-flash | 20% | 6% | 0% | 24% | 22% | 19% | 12% | 7% | 11% |
| glm-5.2 | 9% | 3% | 10% | 6% | 7% | 8% | 11% | 7% | 12% |
| Scelta per lingua | sol | sol | sol | fable-5 | sol | sol | sol | sol | 3.7-flash |
Emergono quattro punti. La baseline mantiene nettamente il primato in 7 lingue su 9, confermando a posteriori la selezione in cieco che ci aveva portato a usarla nella nostra pipeline. Il coreano è la lingua più contesa: fable-5 supera di poco la baseline (52%) e 3.7-flash raggiunge la parità. Se il vostro mercato principale è la Corea, quindi, la classifica cambia davvero. I modelli open-weight cinesi perdono anche sul proprio terreno: Qwen si ferma al 26% e GLM al 9% in cinese semplificato. Il crollo di GLM-5.2 riguarda questo task, non le sue prestazioni generali. Solo pochi giorni prima, lo stesso modello aveva mantenuto correttamente 6/6 keyword dello schema nel nostro studio sugli output strutturati. La traduzione, semplicemente, non è il suo punto forte.
Quali contenuti restano difficili da tradurre?
Per ogni tipo di contenuto riportiamo il modello consigliato e la migliore alternativa, con il relativo tasso di vittoria contro la baseline. La mediana considera tutti gli otto concorrenti:
| Dominio | Modello consigliato | Alternativa migliore | Mediana |
|---|---|---|---|
| letteratura | gemini-3.7-flash (60% contro la baseline) | gpt-5.6-sol | 8% |
| notizie | gpt-5.6-sol | gemini-3.1-pro (48%) | 28% |
| parlato | gpt-5.6-sol | gemini-3.7-flash (43%) | 25% |
| social | gpt-5.6-sol | qwen3.8-max (27%) | 12% |
| documentazione tecnica | gpt-5.6-sol | fable-5 / 3.7-flash (30%) | 15% |
| UI | il più economico (deepseek-v4-flash) | qualsiasi modello, perlopiù pareggi (77% al massimo) | 61% |
Un controllo merita attenzione: le righe sulla documentazione tecnica provengono da paragrafi che nessun modello può aver visto durante il training. È proprio qui che i modelli Gemini peggiorano di più. gemini-3.1-pro ottiene in media il 33% sui domini pubblici di WMT, ma scende al 10% sui paragrafi recenti. La differenza è compatibile sia con una familiarità con il benchmark, sia con il vantaggio della baseline su testi tecnici simili a quelli che traduce in produzione. La segnaliamo senza trarre conclusioni definitive.
Le raccomandazioni per tipo di contenuto sono chiare. Per notizie, social, parlato e documentazione tecnica resta valida la baseline. Il vantaggio è massimo sui contenuti social, dove slang, frasi incomplete e contesto implicito penalizzano tutti i concorrenti: tre su otto restano sotto il 10%. Per la prosa letteraria cambia tutto: gemini-3.7-flash batte nettamente la baseline con il 60%, quindi per contenuti simili alla narrativa esiste un’opzione migliore e più economica. Le stringhe UI seguono invece una logica opposta. I verdetti sono perlopiù pareggi perché dieci parole per il testo di un pulsante lasciano poco margine di differenza, e tutti i nove modelli hanno conservato correttamente ogni {seconds}, %d e {workspace_name} (0 errori su 27 per modello). A parità di qualità decide il prezzo: per le stringhe UI conviene usare il modello più economico disponibile. Nel 2026, la rottura dei placeholder, un classico bug di localizzazione, sembra risolta a livello di modello.
Quanto costa la stessa traduzione con ogni modello?
Il costo per milione di caratteri in output va da $0.26 a $104.37. Il dato è calcolato dividendo la spesa totale misurata per l’output complessivo, aggregato sulle nove lingue. La differenza è di 400x e il modello più costoso non è il migliore:
| Modello | $/1M di caratteri in output | Reasoning token consumati | Intervallo del tasso di vittoria |
|---|---|---|---|
| deepseek-v4-flash | $0.26 | 0 | 0-24% |
| glm-5.2 | $2.48 | 0 | 3-12% |
| qwen3.8-max | $3.18 | 0 | 14-36% |
| claude-sonnet-5 | $8.36 | 0 | 3-32% |
| kimi-k3 | $8.37 | 0 | 0-27% |
| gpt-5.6-sol (baseline) | $13.70 | 0 | n/d |
| gemini-3.7-flash | $14.46 | 505K | 8-52% |
| claude-fable-5 | $39.81 | 0 | 15-52% |
| gemini-3.1-pro | $104.37 | 1,171,770 | 14-45% |
I $104 sono il costo del thinking, non un sovrapprezzo giustificato dalla qualità. La traduzione non richiede reasoning e tutti i modelli che consentono di impostarlo a zero hanno funzionato senza problemi. L’attuale generazione Gemini rifiuta ogni variante dell’opzione per disattivarlo. Per 468 traduzioni, gemini-3.1-pro ha quindi consumato 1,17M di reasoning token, costando 7,6 volte più della baseline e perdendo in tutte le nove lingue. Anche la variante flash ha consumato 505K token, portando il costo sopra quello della baseline.
Le scelte con il miglior rapporto qualità-prezzo derivano direttamente dai dati. Se volete restare vicini alla qualità frontier, gemini-3.7-flash è il concorrente più forte: ottiene il 35-52% contro la baseline in sette lingue su nove, dove il 50% indica parità. I punti deboli sono il cinese semplificato al 26% e il portoghese all’8%. È anche l’unico modello a vincere nettamente un dominio, quello letterario, con il 60%. Il costo misurato resta entro il 6% rispetto alla baseline, perché il consumo obbligatorio di reasoning annulla lo sconto della variante flash. Se conta soprattutto il prezzo, deepseek-v4-flash traduce a un costo 53 volte inferiore alla baseline e non rompe mai i placeholder. La perdita di qualità è però concreta: lo 0% in giapponese è il valore minimo reale, non un effetto dell’arrotondamento. È un compromesso ragionevole per contenuti interni, ma inadatto a testi rivolti ai clienti.
Quale modello conviene scegliere in pratica?
L’intera matrice si riduce a questa tabella decisionale:
| Obiettivo | Scelta | Evidenza |
|---|---|---|
| Migliore qualità media in molte lingue | gpt-5.6-sol | mantiene il primato in 7 lingue su 9 contro ogni concorrente |
| Coreano | claude-fable-5, oppure 3.7-flash con un budget ridotto | 52% contro la baseline, l’unica lingua vinta da un concorrente; flash raggiunge la parità (50%) |
| Italiano | gemini-3.7-flash | 52% contro la baseline allo stesso prezzo |
| Testi letterari o simili alla narrativa | gemini-3.7-flash | 60% contro la baseline, l’unico dominio vinto nettamente |
| Notizie, social, parlato, documentazione tecnica | la baseline | nessun concorrente supera il 48% in questi domini |
| Stringhe UI | deepseek-v4-flash | i modelli sono alla pari e i placeholder sono sempre al sicuro, quindi il modello da $0.26 vince sul prezzo |
| Multilingua economico, sotto $4/1M di caratteri | qwen3.8-max | i migliori tassi di vittoria sotto i $4 in tutte le 9 lingue |
| Costo minimo assoluto, contenuti interni | deepseek-v4-flash | $0.26/1M di caratteri, 53 volte meno della baseline; accettando il divario qualitativo nelle lingue CJK |
| Da non usare mai per tradurre | gemini-3.1-pro, glm-5.2 | costo del thinking obbligatorio di 7,6x; crollo qualitativo specifico del task |
Gli LLM battono già i traduttori umani?
Per tutti e tre i modelli frontier e in ogni lingua, i nostri giudici hanno preferito la traduzione automatica ai riferimenti WMT24++ sottoposti a post-editing umano nell’83-100% dei verdetti. C’è una sola eccezione: claude-fable-5 in cinese semplificato, con il 44%. Questo dato ammette due interpretazioni, entrambe necessarie. La prima: gli stessi autori di WMT24++ hanno concluso che gli LLM sono ormai i migliori sistemi di traduzione automatica in tutte le 55 lingue coperte, e il nostro panel conferma il risultato. La seconda, più prudente: i giudici LLM condividono preferenze stilistiche con i traduttori LLM. Una traduzione automatica molto fluida potrebbe essere proprio ciò che un altro modello tende a preferire. Inoltre, i riferimenti sono post-editing, non testi letterari di riferimento. Il dato consente comunque una conclusione solida: nessun panel automatizzato che siamo in grado di costruire riesce più a distinguere la traduzione automatica frontier dalla qualità di un riferimento umano professionale. La questione interessante diventa quindi il prezzo, dove la differenza si misura in ordini di grandezza.
Quanto sono rumorosi i giudici LLM?
Abbastanza da rendere inaccettabile una valutazione singola senza controlli, ma le contromisure costano poco. Quando abbiamo mostrato due volte la stessa coppia invertendone l’ordine, i giudici si sono contraddetti completamente, passando da vittoria a sconfitta, nel 9% dei casi per claude-sonnet-5, nel 13% per gemini-3.1-pro e nel 19% per gpt-5.6-luna. Il nostro protocollo converte ogni contraddizione in un pareggio, così il bias di posizione si annulla invece di accumularsi. I tassi di vittoria per singolo giudice sono pubblicati accanto al dato aggregato, in modo da verificare che nessuna famiglia determini da sola una conclusione. Le tre famiglie non concordano sempre sull’entità delle differenze, per esempio sonnet-5 è stato il giudice più severo verso l’altro modello Claude, ma concordano sulla direzione in ogni lingua. Le nostre conclusioni si basano su questa convergenza.
FAQ
Quale LLM conviene usare per tradurre?
gpt-5.6-sol è la scelta predefinita migliore per la traduzione multilingue: ha mantenuto il primato in 7 lingue su 9 contro ogni concorrente, sulla base di 8.455 verdetti ciechi. Per una qualità vicina ai modelli frontier allo stesso prezzo, scegliete gemini-3.7-flash, che pareggia o vince in coreano e italiano. Per grandi volumi di traduzioni interne dove conta soprattutto il costo, deepseek-v4-flash costa $0.26 per milione di caratteri, accettando però un divario qualitativo concreto nelle lingue CJK.
Gli LLM sono migliori dei traduttori umani?
Nelle nostre nove lingue, i giudici automatici preferiscono ormai le traduzioni degli LLM frontier ai riferimenti umani sottoposti a post-editing nell’83-100% dei casi, in linea con i risultati di WMT24++. L’affermazione vale per post-editing di qualità professionale valutati da giudici automatici. Non include la traduzione letteraria con un preciso intento editoriale, e i giudici LLM potrebbero condividere preferenze stilistiche con i traduttori LLM.
Conviene usare un modello con reasoning per tradurre?
No. Nei nostri dati, il thinking non porta alcun vantaggio alla traduzione, mentre i modelli che non consentono di disattivarlo ne fanno pagare il costo. gemini-3.1-pro ha consumato 1,17M di reasoning token per 468 traduzioni brevi, costando 7,6 volte la baseline e perdendo in ogni lingua. Per i workload di traduzione, impostate reasoning_effort su none, oppure usate il parametro equivalente previsto dal modello.
Misurazioni eseguite dal 2026-08-26 al 2026-08-29 tramite il gateway Synthorai: 9 modelli, 9 lingue, 52 segmenti in 6 domini, 4.210 traduzioni e 8.455 verdetti ciechi a coppie, prodotti da 3 famiglie di giudici con una rubrica derivata da MQM e inversione dell’ordine. Corpus, codice e tutti i verdetti grezzi sono disponibili nel repository pubblico. I valori assoluti provengono da un unico batch, quindi ripetete le misurazioni prima di basarvi su una qualsiasi riga.
Articoli correlati della stessa serie: LLM più economico per lingua, controlli del thinking su 13 modelli, misurazione degli output strutturati, costo di Gemini 3.7 Flash.