Bestes LLM für Übersetzungen: 9 Modelle, 400x Kosten
Inhalt
- Wie haben wir die Übersetzungsqualität getestet?
- Welches Modell übersetzt welche Sprache am besten?
- Welche Inhalte sind weiterhin schwer zu übersetzen?
- Was kostet dieselbe Übersetzung je nach Modell?
- Welches Modell sollten Sie konkret wählen?
- Sind LLMs inzwischen besser als menschliche Übersetzer?
- Wie stark rauschen LLM-Judges wirklich?
- FAQ
Das beste Modell für Übersetzungen gibt es nicht: gpt-5.6-sol führt in 7 der 9 getesteten Sprachen, claude-fable-5 liegt bei Koreanisch knapp vorn, gemini-3.7-flash erreicht dort Gleichstand und gewinnt bei Italienisch zum gleichen gemessenen Preis. Je nach API kostet die Übersetzung derselben Million Zeichen zwischen $0.26 und $104. Wir haben mit 9 Modellen insgesamt 4.210 Übersetzungen in 9 Sprachen erstellt und dazu 8.455 paarweise Blindurteile erhoben. Dieser Beitrag zeigt die vollständige Ergebnismatrix.
TL;DR
- Standardempfehlung: gpt-5.6-sol behauptete sich in 7 von 9 Sprachen über 8.455 Blindurteile hinweg. Bei Koreanisch gewinnt claude-fable-5 (52%), bei Italienisch gemini-3.7-flash (52%).
- Nach Inhalt: Bei Literatur gewinnt gemini-3.7-flash (60% gegen die Baseline). Bei UI-Strings liegen alle 9 Modelle gleichauf und kein Placeholder ging kaputt, also gewinnt das günstigste. Unter $4 ist qwen3.8-max die beste Wahl.
- Die Kosten reichen von $0.26 (deepseek-v4-flash) bis $104 (gemini-3.1-pro) pro 1 Mio. Zeichen. Die $104 entstehen größtenteils durch 1,17 Mio. Reasoning-Token, die sich beim Modell nicht abschalten lassen.
- Die Judges bevorzugten Frontier-Modelle in 83-100% der Fälle gegenüber menschlich nachbearbeiteten Übersetzungen.
Wie haben wir die Übersetzungsqualität getestet?
Der Test besteht aus drei Teilen: einem Parallelkorpus, einem praxistauglichen Prompt und einem Blindpanel aus Judges. Alle Daten einschließlich der Rohurteile liegen im öffentlichen Benchmark-Repository.
Korpus. Jedes Modell übersetzte 52 englische Segmente aus sechs Bereichen in alle 9 Sprachen. Vier Bereiche (Nachrichten, Social Media, gesprochene Sprache und Literatur, jeweils 8 Segmente mit Seed-Stichprobe) stammen aus WMT24++ (Apache-2.0). Das ist das Evaluationsset der jährlich stattfindenden WMT Shared Task für maschinelle Übersetzung. Für jedes Segment in WMT24++ gibt es eine menschlich nachbearbeitete Referenzübersetzung: Eine professionelle Übersetzung wurde von einer zweiten Fachkraft geprüft und korrigiert. Das Set deckt genau die Sprachvarianten ab, die wir anbieten: zh_CN, zh_TW, ja, ko, fr, de, es_MX, pt_BR, it. Zwei Bereiche stammen von uns: 10 Absätze technischer Dokumentation aus Beiträgen der letzten 60 Tage. Sie dienen zugleich als Kontrolle gegen Kontamination, da sie in keinen Trainingsdaten der Modelle enthalten sein können. Dazu kommen 10 synthetische UI-Strings mit bekannten Fallstricken der Lokalisierung, etwa das kontextfreie Wort „Archive“, die korrekte Übernahme von {placeholder} und Pluralformen. Die Stichprobe verwendet einen festen Seed und die Segment-IDs sind veröffentlicht. Damit lässt sich prüfen, dass das Korpus nicht gezielt auf ein bestimmtes Ergebnis zugeschnitten wurde.
Bewertung. Jede Übersetzung wurde blind mit demselben Segment einer festen Baseline verglichen: gpt-5.6-sol, das Modell, mit dem wir derzeit diesen Blog übersetzen. Drei Judge-Familien (claude-sonnet-5, gpt-5.6-luna, gemini-3.1-pro) bewerteten unabhängig voneinander nach einem aus MQM abgeleiteten Kriterienkatalog. MQM ist die in der Branche etablierte Typologie für Übersetzungsfehler. Die Kriterien sind nach Priorität geordnet, sodass ein inhaltlicher Fehler schwerer wiegt als jede sprachliche Politur:
1. Accuracy mistranslation, omission, addition, hallucination
2. Terminology domain terms as a native engineer would keep them
3. Fluency grammar, natural reading
4. Style register appropriate to the text type
5. Locale numbers, dates, units, punctuation width
6. Markup inline code, placeholders, links preserved exactly
Die Bewertung nach Schweregrad orientiert sich an Error Span Annotation, dem Verfahren, das WMT seit 2024 für menschliche Evaluationen verwendet. Wir haben es für paarweise Bewertungen durch LLMs angepasst. Korpus und Referenzen stammen aus dem WMT24++-Paper. Jedes Paar wurde zweimal bewertet, wobei die Reihenfolge der Übersetzungen vertauscht wurde. Widersprach sich ein Judge zwischen beiden Reihenfolgen, wurde das Ergebnis als Gleichstand gewertet. Die Judges fließen gleich gewichtet in den Durchschnitt ein und werden nie zu einer einzigen Abstimmung zusammengefasst. Zusätzlich weisen wir die Zahlen für jeden Judge aus, damit Bias innerhalb einer Modellfamilie sichtbar bleibt. In einem zweiten Test wurden die drei Frontier-Modelle gpt-5.6-sol, claude-fable-5 und gemini-3.1-pro mit den menschlichen Referenzen aus WMT24++ verglichen. Die Integrität der Placeholder wurde per Script geprüft, nicht durch Judges.
Welches Modell übersetzt welche Sprache am besten?
Das Ergebnis vorweg: gpt-5.6-sol ist nicht nur die Baseline dieser Tabelle, sondern auch der gemessene Testsieger. Alle Herausforderer werden damit verglichen. Keiner von ihnen überschreitet in mehr als einer Sprache die Marke von 50%. Im separaten Vergleich mit menschlichen Referenzen bevorzugten die Judges sols Übersetzungen in 86-100% der Fälle gegenüber den professionell nachbearbeiteten WMT24++-Versionen. Damit schnitt sol unter den drei dort getesteten Frontier-Modellen am besten ab. Die Tabelle zeigt die Gewinnrate gegen sol ohne Gleichstände, gemittelt über drei Judges. 50% bedeutet Gleichstand.
| vs Baseline | zh | zh-TW | ja | ko | fr | de | es | pt | it |
|---|---|---|---|---|---|---|---|---|---|
| gemini-3.7-flash | 26% | 35% | 43% | 50% | 40% | 37% | 39% | 8% | 52% |
| claude-fable-5 | 19% | 15% | 38% | 52% | 39% | 32% | 31% | 20% | 47% |
| gemini-3.1-pro | 17% | 22% | 24% | 45% | 30% | 21% | 38% | 14% | 25% |
| qwen3.8-max | 26% | 21% | 18% | 28% | 36% | 17% | 32% | 14% | 25% |
| kimi-k3 | 27% | 15% | 23% | 23% | 16% | 24% | 10% | 0% | 24% |
| claude-sonnet-5 | 3% | 6% | 9% | 32% | 25% | 27% | 28% | 10% | 9% |
| deepseek-v4-flash | 20% | 6% | 0% | 24% | 22% | 19% | 12% | 7% | 11% |
| glm-5.2 | 9% | 3% | 10% | 6% | 7% | 8% | 11% | 7% | 12% |
| Empfehlung je Sprache | sol | sol | sol | fable-5 | sol | sol | sol | sol | 3.7-flash |
Vier Punkte fallen auf. Die Baseline gewinnt 7 von 9 Sprachen klar. Das bestätigt im Nachhinein die Blindbewertung, nach der wir sie für unsere eigene Pipeline ausgewählt haben. Bei Koreanisch ist das Ergebnis knapp: fable-5 liegt mit 52% vorn und 3.7-flash erreicht Gleichstand. Wer hauptsächlich für den koreanischen Markt übersetzt, bekommt daher tatsächlich eine andere Rangfolge. Die chinesischen Open-Weight-Modelle verlieren selbst auf ihrem Heimatmarkt: Qwen erreicht bei vereinfachtem Chinesisch 26%, GLM nur 9%. Der Einbruch von GLM-5.2 ist auf diese Aufgabe beschränkt und kein allgemeines Problem. Im wenige Tage zuvor durchgeführten Test zu strukturierten Ausgaben hielt dasselbe Modell 6/6 Schema-Keywords ein. Übersetzungen gehören schlicht nicht zu seinen Stärken.
Welche Inhalte sind weiterhin schwer zu übersetzen?
Für jeden Inhaltstyp zeigt die Tabelle die Empfehlung und die stärkste Alternative mit deren Gewinnrate gegen die Baseline. Der Median bezieht sich auf alle acht Herausforderer:
| Bereich | Empfohlenes Modell | Stärkste Alternative | Median des Feldes |
|---|---|---|---|
| Literatur | gemini-3.7-flash (60% gegen Baseline) | gpt-5.6-sol | 8% |
| Nachrichten | gpt-5.6-sol | gemini-3.1-pro (48%) | 28% |
| gesprochene Sprache | gpt-5.6-sol | gemini-3.7-flash (43%) | 25% |
| Social Media | gpt-5.6-sol | qwen3.8-max (27%) | 12% |
| technische Dokumentation | gpt-5.6-sol | fable-5 / 3.7-flash (30%) | 15% |
| UI | günstigstes Modell (deepseek-v4-flash) | beliebiges Modell, überwiegend Gleichstand (77% maximal) | 61% |
Ein Kontrollergebnis verdient besondere Beachtung: Die Absätze zur technischen Dokumentation können in keinem Trainingsdatensatz der Modelle enthalten gewesen sein. Dort brechen die Gemini-Modelle am stärksten ein. gemini-3.1-pro erreicht über die öffentlichen WMT-Bereiche hinweg durchschnittlich 33%, bei den neuen Absätzen aber nur 10%. Das passt zu einer Vertrautheit mit dem Benchmark. Es könnte jedoch ebenso der Heimvorteil der Baseline sein, die solche technischen Texte bereits produktiv übersetzt. Deshalb markieren wir die Abweichung, ziehen daraus aber keinen eindeutigen Schluss.
Als Empfehlungen nach Inhaltstyp gelesen bleibt die Baseline für Nachrichten, Social Media, gesprochene Sprache und technische Dokumentation vorn. Bei Social Media ist ihr Vorsprung am größten, weil Slang, Satzfragmente und impliziter Kontext allen Herausforderern Probleme bereiten. Drei von acht lagen unter 10%. Literatur ist die einzige Kategorie mit einem anderen Sieger: gemini-3.7-flash schlägt die Baseline klar mit 60%. Für fiktionale Inhalte gibt es damit eine günstigere und bessere Option. Bei UI-Strings kehrt sich die Logik vollständig um. Meist endet der Vergleich unentschieden, weil zehn Wörter Button-Text kaum Raum für relevante Unterschiede lassen. Außerdem übernahmen alle neun Modelle jedes {seconds}, %d und {workspace_name} korrekt (jeweils 0 von 27 beschädigt). Wenn die Qualität nicht unterscheidbar ist, entscheidet der Preis. UI-Strings sollten mit dem günstigsten verfügbaren Modell übersetzt werden. Beschädigte Placeholder, ein klassischer Fehler bei der Lokalisierung, scheinen 2026 auf Modellebene gelöst zu sein.
Was kostet dieselbe Übersetzung je nach Modell?
Die Kosten pro Million ausgegebener Zeichen reichen von $0.26 bis $104.37. Grundlage sind die gemessenen Gesamtkosten geteilt durch die gesamte Ausgabe über alle neun Sprachen. Das entspricht einer Spanne von 400x, und das teuerste Modell ist nicht das beste:
| Modell | $/1M Ausgabezeichen | Verbrauchte Reasoning-Token | Spanne der Gewinnrate |
|---|---|---|---|
| deepseek-v4-flash | $0.26 | 0 | 0-24% |
| glm-5.2 | $2.48 | 0 | 3-12% |
| qwen3.8-max | $3.18 | 0 | 14-36% |
| claude-sonnet-5 | $8.36 | 0 | 3-32% |
| kimi-k3 | $8.37 | 0 | 0-27% |
| gpt-5.6-sol (Baseline) | $13.70 | 0 | n/a |
| gemini-3.7-flash | $14.46 | 505K | 8-52% |
| claude-fable-5 | $39.81 | 0 | 15-52% |
| gemini-3.1-pro | $104.37 | 1,171,770 | 14-45% |
Die Zeile mit $104 zeigt keine Qualitätsprämie, sondern einen Aufschlag für Thinking. Übersetzungen benötigen kein Reasoning. Alle Modelle, bei denen sich Thinking auf null setzen ließ, arbeiteten ohne Probleme. Die aktuelle Gemini-Generation ignoriert jede Variante des Schalters zum Deaktivieren. Deshalb verbrauchte gemini-3.1-pro bei 468 Übersetzungen 1,17 Mio. Reasoning-Token. Das Modell kostete damit 7,6x so viel wie die Baseline und verlor trotzdem in allen neun Sprachen. Selbst das Flash-Modell verbrauchte 505K Reasoning-Token und wurde dadurch teurer als die Baseline.
Daraus ergeben sich die Empfehlungen nach Preis-Leistung direkt. Soll die Qualität nahe am Frontier-Niveau bleiben, ist gemini-3.7-flash der stärkste Herausforderer. In sieben von neun Sprachen erreicht es 35-52% gegen die Baseline, wobei 50% Gleichstand bedeutet. Seine Schwächen liegen bei vereinfachtem Chinesisch mit 26% und Portugiesisch mit 8%. Es gewinnt außerdem als einziges Modell einen ganzen Inhaltsbereich: Literatur mit 60%. Die gemessenen Kosten liegen höchstens 6% über denen der Baseline, weil der erzwungene Reasoning-Verbrauch den Flash-Rabatt aufzehrt. Stehen die Kosten im Vordergrund, übersetzt deepseek-v4-flash 53x günstiger als die Baseline und beschädigte keinen Placeholder. Der Qualitätsverlust ist allerdings real. Eine Gewinnrate von 0% bei Japanisch ist eine klare Untergrenze und kein Rundungseffekt. Für interne Inhalte kann dieser Kompromiss sinnvoll sein, für kundenorientierte Texte eher nicht.
Welches Modell sollten Sie konkret wählen?
Die gesamte Matrix lässt sich auf eine Entscheidungstabelle reduzieren:
| Optimierungsziel | Empfehlung | Beleg |
|---|---|---|
| Beste durchschnittliche Qualität in vielen Sprachen | gpt-5.6-sol | behauptet 7 von 9 Sprachen gegen alle Herausforderer |
| Koreanisch | claude-fable-5, bei kleinerem Budget 3.7-flash | 52% gegen die Baseline, die einzige von einem Herausforderer gewonnene Sprache; Flash erreicht Gleichstand (50%) |
| Italienisch | gemini-3.7-flash | 52% gegen die Baseline zum Preis der Baseline |
| Literatur oder fiktionale Inhalte | gemini-3.7-flash | 60% gegen die Baseline, der einzige klar gewonnene Inhaltsbereich |
| Nachrichten, Social Media, gesprochene Sprache, technische Dokumentation | die Baseline | kein Herausforderer erreicht in einem dieser Bereiche mehr als 48% |
| UI-Strings | deepseek-v4-flash | Modelle liegen gleichauf und Placeholder bleiben überall intakt, also gewinnt das $0.26-Modell über den Preis |
| Mehrsprachig mit kleinem Budget, unter $4/1M Zeichen | qwen3.8-max | beste Gewinnraten der Klasse unter $4 in allen 9 Sprachen |
| Absolutes Kostenminimum für interne Inhalte | deepseek-v4-flash | $0.26/1M Zeichen, 53x günstiger als die Baseline; Qualitätslücke bei CJK akzeptieren |
| Für Übersetzungen ungeeignet | gemini-3.1-pro, glm-5.2 | 7,6x Aufschlag durch erzwungenes Thinking; aufgabenspezifischer Qualitätseinbruch |
Sind LLMs inzwischen besser als menschliche Übersetzer?
Bei allen drei Frontier-Modellen bevorzugten unsere Judges die maschinelle Übersetzung in jeder Sprache in 83-100% der Urteile gegenüber den menschlich nachbearbeiteten Referenzen aus WMT24++. Es gab nur eine Ausnahme: claude-fable-5 erreichte bei vereinfachtem Chinesisch 44%. Diese Zahl lässt zwei Interpretationen zu, und beide müssen genannt werden. Die starke Aussage: Die Autoren von WMT24++ kamen selbst zu dem Ergebnis, dass LLMs inzwischen in allen 55 untersuchten Sprachen die besten Systeme für maschinelle Übersetzung sind. Unser Panel bestätigt das. Die vorsichtige Aussage: LLM-Judges teilen möglicherweise stilistische Präferenzen mit übersetzenden LLMs. Eine sprachlich geglättete maschinelle Übersetzung könnte genau das sein, was ein anderes Modell bevorzugt. Außerdem sind die Referenzen nachbearbeitete Übersetzungen und keine literarischen Idealversionen. Sicher belegt ist: Mit jedem automatisierten Panel, das wir aufstellen können, lässt sich maschinelle Übersetzung auf Frontier-Niveau nicht mehr von der Qualität professioneller menschlicher Referenzen unterscheiden. Damit rückt der Preis in den Mittelpunkt, und dort liegen Größenordnungen zwischen den Optionen.
Wie stark rauschen LLM-Judges wirklich?
So stark, dass eine ungesicherte Bewertung in nur einem Durchlauf nicht vertretbar wäre. Die nötigen Schutzmaßnahmen sind jedoch günstig. Wenn wir dasselbe Paar zweimal in vertauschter Reihenfolge zeigten, widersprachen sich die Judges vollständig, also mit einem Wechsel von Sieg zu Niederlage, in 9% der Fälle bei claude-sonnet-5, in 13% bei gemini-3.1-pro und in 19% bei gpt-5.6-luna. Unser Verfahren wertet jeden solchen Widerspruch als Gleichstand. Dadurch hebt sich der Positionseffekt auf, statt sich aufzusummieren. Die neben dem Gesamtergebnis veröffentlichten Gewinnraten pro Judge zeigen zudem, ob eine Schlussfolgerung nur von einer Modellfamilie getragen wird. Beim Ausmaß unterschieden sich die drei Familien teilweise. sonnet-5 bewertete sein eigenes Claude-Schwestermodell am strengsten. Bei der Richtung stimmten sie jedoch in jeder Sprache überein, und darauf beruhen unsere Schlussfolgerungen.
FAQ
Welches LLM sollte ich für Übersetzungen einsetzen?
gpt-5.6-sol ist die beste Standardwahl für mehrsprachige Übersetzungen. In 8.455 Blindurteilen behauptete es sich in 7 von 9 Sprachen gegen alle Herausforderer. Für nahezu gleichwertige Frontier-Qualität zum selben Preis eignet sich gemini-3.7-flash, das bei Koreanisch und Italienisch gleichzieht oder gewinnt. Für große Mengen interner Übersetzungen mit klarem Kostenfokus eignet sich deepseek-v4-flash für $0.26 pro Million Zeichen, wenn die deutliche Qualitätslücke bei CJK-Sprachen akzeptabel ist.
Sind LLMs besser als menschliche Übersetzer?
Automatisierte Judges bevorzugen Frontier-LLM-Übersetzungen in unseren neun Sprachen inzwischen in 83-100% der Fälle gegenüber menschlich nachbearbeiteten Referenzen. Das deckt sich mit den Ergebnissen von WMT24++. Die Aussage gilt für nachbearbeitete Übersetzungen in Referenzqualität und maschinelle Judges. Sie umfasst keine Literaturübersetzung mit redaktioneller Intention. Zudem können LLM-Judges stilistische Präferenzen mit übersetzenden LLMs teilen.
Sollte für Übersetzungen ein Reasoning-Modell eingesetzt werden?
Nein. In unseren Daten verbessert Thinking die Übersetzung nicht. Modelle, bei denen es sich nicht abschalten lässt, verursachen unnötige Kosten: gemini-3.1-pro verbrauchte für 468 kurze Übersetzungen 1,17 Mio. Reasoning-Token. Dadurch kostete es 7,6x so viel wie die Baseline und verlor trotzdem in jeder Sprache. Setzen Sie reasoning_effort für Übersetzungs-Workloads auf none oder verwenden Sie die entsprechende Einstellung des Modells zum Deaktivieren.
Gemessen vom 2026-08-26 bis 2026-08-29 über das Synthorai-Gateway: 9 Modelle, 9 Sprachen, 52 Segmente in 6 Bereichen, 4.210 Übersetzungen und 8.455 paarweise Blindurteile von 3 Judge-Familien nach einem von MQM abgeleiteten Kriterienkatalog mit vertauschter Reihenfolge. Korpus, Code und sämtliche Rohurteile liegen im öffentlichen Repository. Die absoluten Zahlen stammen aus diesem einzelnen Batch. Messen Sie erneut, bevor Sie sich auf eine Zeile verlassen.
Weitere Beiträge dieser Reihe: günstigstes LLM nach Sprache, Thinking-Steuerung bei 13 Modellen, Messwerte zu strukturierten Ausgaben, Kosten von Gemini 3.7 Flash.