Kosten von Transkriptions-APIs: 7 Modelle mit demselben Audiomaterial
Inhalt
Synthorai kann jetzt Audio transkribieren. Hinter einem einzigen OpenAI-kompatiblen Endpoint stehen sieben spezialisierte Speech-to-Text-Modelle für die Spracherkennung.
Dieser eine Endpoint nimmt viel Integrationsarbeit ab, denn die nativen APIs der Modelle haben kaum Gemeinsamkeiten. whisper-1 erwartet einen Multipart-Dateiupload und gibt {text} zurück. gpt-4o-transcribe nutzt denselben Upload, liefert zusätzlich aber die Token-Nutzung. ByteDances seed-asr spricht das BytePlus-AUC-Protokoll, Alibaba verwendet für qwen3-asr-flash ein eigenes Protokoll, und Googles chirp-Modelle sind Cloud-Speech-to-Text-Recognizer, die per OAuth angesprochen werden.
Unterschiedliche Endpoints, Auth-Verfahren und Response-Formate bedeuten jeweils eine eigene Integration. Über das Gateway genügt ein OpenAI-kompatibler Aufruf: gpt-4o-mini-transcribe lässt sich durch seed-asr-bigmodel oder chirp-3 ersetzen, ohne dass sich sonst etwas am Code ändert.
TL;DR
- Die Transkriptionskosten unterscheiden sich bei den sieben spezialisierten Modellen um den Faktor 8: seed-asr-bigmodel kostet $0.0020 pro Audiominute, die Chirp-Modelle $0.0164 (gemessen am 2026-06-25).
- seed-asr erkennt die Sprache nicht automatisch: Ohne gesetztes
languageliefert Audio in anderen Sprachen als Englisch oder Chinesisch HTTP 200 mit leerem oder romanisiertem Text und wird trotzdem abgerechnet. - qwen3-asr-flash ist mit $0.0021 pro Minute das günstigste Modell, das alle getesteten Sprachen automatisch erkennt.
- Nur die gpt-4o-Transkriptionsmodelle streamen Token für Token; die minutengenau abgerechneten Modelle unterstützen nur Batch-Verarbeitung.
- Bei sauber aufgenommenem Englisch, Spanisch und Französisch lagen alle Modelle bei rund 0% Fehlerquote. Die Genauigkeit ist daher kein sinnvolles Auswahlkriterium.
Der Aufruf läuft über den OpenAI-kompatiblen Transkriptions-Endpoint. Wer bereits Whisper verwendet, kann ihn direkt einsetzen:
curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 \
-F model=gpt-4o-mini-transcribe
from openai import OpenAI
client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
with open("meeting.mp3", "rb") as f:
result = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe", file=f)
print(result.text)
Das Transkript steht in text, die abgerechneten Kosten im Response-Header x-total-cost-usd.
Wir haben alle sieben Modelle demselben einfachen Test unterzogen. Die Art dieses Tests bestimmt, wie die folgenden Zahlen einzuordnen sind.
Was dieser Test misst und was nicht
Wir haben alltägliche Texte ohne Eigennamen verwendet, etwa über einen Morgen, das Wetter oder einen Marktbesuch. Diese wurden mit einer Standard-Text-to-Speech-Stimme in den fünf meistgesprochenen Sprachen der Welt erzeugt und anschließend von allen sieben Modellen transkribiert. Jeder Clip dauert etwa 12 bis 15 Sekunden und enthält ungefähr 40 normal schnell gesprochene Wörter ohne längere Pausen. Das Format ist 16 kHz Mono, 16-Bit-PCM-WAV mit 256 kbps und etwa 2 MB pro Minute. Der Ausgangstext dient als Ground Truth, die Laufzeiten sind exakt bekannt.
Der Test ist bewusst einfach: sauberes, geskriptetes Audio mit nur einem Sprecher, ohne Akzent, Störgeräusche oder Fachbegriffe. Damit eignet er sich für Messwerte, die nicht vom Schwierigkeitsgrad des Audiomaterials abhängen. Dazu zählen Kosten, Latenz, Sprachunterstützung und Streaming-Fähigkeit. Diese Ergebnisse sind stabil.
Es handelt sich nicht um einen Qualitätsbenchmark. Reale Aufnahmen mit Akzenten, Hintergrundgeräuschen, Fachvokabular, mehreren gleichzeitig sprechenden Personen und einer Stunde Laufzeit zeigen Unterschiede, die bei sauberer Sprache nicht sichtbar werden. Die hier gemessenen Genauigkeitswerte sagen darüber nichts aus. Sie sind als Mindestprüfung zu verstehen, nicht als Rangliste. Kosten, Abdeckung und Streaming-Fähigkeit bilden dagegen eine belastbare Ausgangsbasis.
Spezialisierte ASR statt multimodaler Modelle
Alle sieben Modelle sind spezialisierte Speech-to-Text-Systeme für die Spracherkennung: OpenAIs whisper-1, gpt-4o-transcribe und gpt-4o-mini-transcribe, ByteDances seed-asr-bigmodel, Alibabas qwen3-asr-flash sowie Googles chirp-2 und chirp-3.
Das Gateway kann den Transkriptions-Endpoint auch an ein allgemeines multimodales Modell wie Gemini weiterleiten. Solche Modelle können Audio im Rahmen ihres Audioverständnisses ebenfalls transkribieren. Wir haben sie nicht berücksichtigt und würden sie für reine Transkription auch nicht einsetzen. Google grenzt die eigenen Produkte genauso ab: Im Gemini-Leitfaden für Audio wird Gemini zum Beschreiben, Zusammenfassen und Beantworten von Fragen zu Audiodateien empfohlen. Für das eigentliche Transkript verweist Google auf eine andere Lösung: „Für spezialisierte Speech-to-Text-Modelle mit Unterstützung für Echtzeittranskription sollten Sie die Google Cloud Speech-to-Text API verwenden“, also die Chirp-Modelle. Ein multimodales Modell kann zwar ein Transkript erzeugen, wurde aber primär für das Verstehen von Audio entwickelt und nicht für die exakte Wiedergabe des Gesagten. Außerdem wird es über einen Chat-artigen generateContent-Aufruf statt über eine Transkriptions-API angesprochen. Für wortgetreue Spracherkennung ist ein spezialisiertes Modell die richtige Wahl. Das bestätigen auch Anbieter, die beide Modelltypen anbieten.
Audio lässt sich auf drei Arten verarbeiten:
- Datei rein, Batch-Ergebnis raus: Eine vollständige Aufnahme wird hochgeladen, das komplette Transkript kommt in einer Response zurück. Das unterstützen alle Modelle.
- Datei rein, Textstream raus: Derselbe Upload, aber das Transkript wird während der Erzeugung per SSE gestreamt. Einige Modelle unterstützen das, andere nur Batch-Verarbeitung.
- Audiostream rein, Textstream raus: Echtzeiterkennung eines Live-Mikrofons oder Anrufs. Diese Funktion befindet sich noch in Entwicklung und ist derzeit nicht verfügbar. Im Folgenden geht es daher nur um die ersten beiden Modi.
So wird Transkription abgerechnet
Es gibt zwei Abrechnungsmodelle. Pro Audiominute (whisper-1, seed-asr, qwen3-asr-flash, die Chirp-Modelle): Abgerechnet wird die tatsächliche Laufzeit der Aufnahme, unabhängig vom Inhalt. Pro Token (die gpt-4o-Modelle): Das Audio wird mit einer festen Rate tokenisiert. Berechnet werden diese Input-Token plus die Output-Token des Transkripts. Stille ist deshalb günstiger als durchgehend gesprochener Text.
Bei der Token-Abrechnung gibt es eine Falle: Der angegebene Input-Preis gilt für Text, Audio wird jedoch zu einem höheren Preis abgerechnet. gpt-4o-mini-transcribe nennt beispielsweise $1.25/M für Input, berechnet Audio aber mit $3/M. Eine Kalkulation anhand des Textpreises fällt daher zu niedrig aus. Das Gateway liefert die tatsächlichen Kosten im Header x-total-cost-usd. Dieser Wert ist verlässlicher als eine Schätzung anhand der Preisseite.
Kosten
Diesen Bereich bildet der Test zuverlässig ab, und hier sind die Unterschiede am größten. Die Kosten pro Minute stammen aus dem Abrechnungs-Header. Die aktuellen Listenpreise aller über das Gateway verfügbaren Modelle stehen auf der Modellseite:
| Modell | Kosten / Min. | Latenz | Streaming |
|---|---|---|---|
seed-asr-bigmodel | $0.0020 | ≈10s | nein |
qwen3-asr-flash | $0.0021 | ≈3s | nein |
gpt-4o-mini-transcribe | $0.0031 | ≈3s | Token für Token |
whisper-1 | $0.0060 | ≈4s | nein |
gpt-4o-transcribe | $0.0062 | ≈2s | Token für Token |
chirp-2 | $0.0164 | ≈3s | nein |
chirp-3 | $0.0164 | ≈4s | nein |
Die Preisspanne beträgt etwa das Achtfache: von seed-asr mit $0.0020 pro Minute bis zu den Chirp-Modellen mit $0.0164. Beim günstigsten Modell seed-asr muss die Sprache des Audios angegeben werden. Wenn die Sprache im Voraus bekannt ist, ist es damit die günstigste Wahl. Für gemischte oder unbekannte Sprachen ist qwen3-asr-flash mit $0.0021 die günstigste Lösung ohne zusätzlichen Konfigurationsaufwand. Die Chirp-Modelle sind mit Abstand am teuersten. Wer Chirp einsetzt, sollte chirp-3 wählen: Preis und Geschwindigkeit entsprechen chirp-2, Mandarin wird laut Genauigkeitstabelle aber deutlich besser transkribiert.
Wie sich diese Zahlen bei eigenen Dateien entwickeln, hängt vom Abrechnungsmodell ab. Die minutengenau abgerechneten Modelle (whisper-1, seed-asr, qwen3-asr-flash, die Chirp-Modelle) berechnen ausschließlich die Dauer. Der Preis lässt sich daher direkt hochrechnen: Zehn Minuten Audio kosten das Zehnfache des Minutenpreises, unabhängig von Format und Inhalt.
Bei den Token-Modellen, also den gpt-4o-Zeilen, skaliert der Input-Preis mit der Dauer statt mit der Dateigröße. Der Provider resampelt das Audio vor der Tokenisierung. Eine große MP3-Datei mit 320 kbps und unsere kompakte 16-kHz-WAV-Datei mit demselben gesprochenen Inhalt kosten bei der Tokenisierung ungefähr gleich viel. Kompression spart Speicherplatz, senkt aber nicht die Transkriptionskosten. Relevant ist dagegen die Menge des tatsächlich gesprochenen Textes. Unsere Clips enthalten normal schnelle Sprache ohne Leerlauf. Audio mit höherer oder geringerer Sprechdichte verursacht deshalb etwas mehr oder weniger Output-Token. Maßgeblich ist immer der Header x-total-cost-usd.
Genauigkeit und Sprachabdeckung
Bei Englisch, Spanisch und Französisch erreichten alle Modelle, die die jeweilige Sprache unterstützen, rund 0% Fehlerquote. Diesen Mindestwert schaffen alle. Bei Mandarin und Hindi zeigen sich selbst in diesem einfachen Test erste Schwächen. Die Ergebnisse geben Hinweise darauf, welche Modelle mit anspruchsvollerem Material getestet werden sollten, stellen aber kein abschließendes Urteil dar:
| Modell | Mandarin (CER) | Hindi (WER) | Abdeckung |
|---|---|---|---|
seed-asr-bigmodel | 0% | 9% | alle fünf (explizites language erforderlich) |
qwen3-asr-flash | 0% | 15% | alle fünf |
gpt-4o-mini-transcribe | 0% | 4% | alle fünf |
whisper-1 | 0% | 22% | alle fünf |
gpt-4o-transcribe | 0% | 13% | alle fünf |
chirp-2 | 16% | 15% | alle fünf |
chirp-3 | 2% | 15% | alle fünf |
Entscheidend ist hier nicht die Abdeckung, sondern die Spracherkennung. Mit gesetztem language-Parameter transkribierte seed-asr alle fünf Sprachen. In einem Folgetest funktionierten auch Japanisch, Deutsch, Italienisch und Koreanisch. Das Modell erkennt die Sprache jedoch nicht selbst. Ohne language liefert es für andere Sprachen als Englisch oder Chinesisch einen leeren String oder romanisierten Zeichensalat zurück, und zwar mit Status 200 und ohne Fehlermeldung. Die anderen sechs Modelle erkennen die Sprache automatisch. Dieser stille Fehler ist das eigentliche Problem: Ein Modell, das mit einem Fehler abbricht, ist lästig. Ein Modell, das unbemerkt falsche Ergebnisse liefert, verursacht einen Produktionsvorfall.
Die Unterschiede bei Hindi und der Ausreißer bei Mandarin, chirp-2 mit 16%, den chirp-3 behebt, zeigen, welche Modelle vor dem produktiven Einsatz mit schwierigeren Sprachen geprüft werden sollten. Sie belegen nicht, dass ein Modell grundsätzlich besser als ein anderes ist. Die absoluten Werte werden durch die synthetische Stimme und das Scoring beeinflusst und schwanken zwischen Testläufen. Bei sauberer Sprache in weit verbreiteten Sprachen unterscheiden sich die Modelle kaum in der Genauigkeit. Dieser Test liefert daher keine belastbare Grundlage, um danach auszuwählen.
Streaming-Ausgabe
Ob ein Modell Transkripte streamen kann, ist eine Funktionsfrage und keine Aussage über die Qualität. Hier teilt sich das Feld klar. Die minutengenau abgerechneten Modelle (whisper-1, seed-asr, qwen3-asr-flash und beide Chirp-Modelle) unterstützen nur Batch-Verarbeitung. Fordert man Streaming an, gibt das Gateway einen 400-Fehler zurück. Die gpt-4o-Modelle streamen Token für Token. gpt-4o-transcribe liefert die ersten Wörter nach ungefähr einer Sekunde und ergänzt anschließend den Rest. Das eignet sich für UIs, die sich in Echtzeit anfühlen sollen. Die Kosten entsprechen dem Batch-Modus. Für Streaming muss stream=true gesetzt werden:
curl -N https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 -F model=gpt-4o-transcribe -F stream=true
# data: {"type":"transcript.text.delta","delta":"When"}
# data: {"type":"transcript.text.delta","delta":" you"} ...
Caching
Für diese Modelle gibt es praktisch kein Caching. Die minutengenau abgerechneten Modelle berechnen die Dauer, daher bringt eine Wiederholung keinen Rabatt. Wir haben denselben Clip fünfmal an whisper-1 gesendet und jedes Mal exakt $0.015478 bezahlt. Für die Token-basiert abgerechneten gpt-4o-Modelle ist kein Cache-Preis angegeben; Wiederholungen zeigten lediglich die üblichen Schwankungen zwischen einzelnen Läufen. Kalkuliert deshalb mit dem Minutenpreis. Das erneute Senden derselben Datei wird nicht günstiger.
Was zuerst geprüft werden sollte und was selbst getestet werden muss
Dieser Test kann nicht bestimmen, welches Modell bei den eigenen Aufnahmen am genauesten ist. Er zeigt aber, nach welchen Kriterien sich das Feld vor einer eigenen Evaluation eingrenzen lässt:
- Sprachen. Prüft, ob das Modell alle benötigten Sprachen unterstützt und ob es die Sprache selbst erkennt.
seed-asrverarbeitete jede getestete Sprache, allerdings nur mit explizitemlanguage-Parameter. Ohne diesen Parameter schlägt Audio in anderen Sprachen als Englisch oder Chinesisch still fehl. Die anderen sechs Modelle erkennen die Sprache automatisch und sind damit die sicherere Standardeinstellung für gemischtes oder unbekanntes Audiomaterial. - Streaming. Für Live-Transkripte kommen nur die
gpt-4o-Modelle infrage, da sie Token für Token streamen. Die minutengenau abgerechneten Modelle unterstützen nur Batch-Verarbeitung. - Kosten. Die Spanne beträgt etwa das Achtfache. Das günstigste Modell mit vollständiger Sprachabdeckung ist
qwen3-asr-flashmit $0.0021. Die Chirp-Modelle sind am teuersten, und innerhalb der Chirp-Familie gibt es nur beichirp-3einen Grund, es den günstigeren Modellen vorzuziehen. Caching senkt die Kosten nicht, daher wird der volle Minutenpreis fällig. - Modelltyp. Verwendet ein spezialisiertes Speech-to-Text-Modell statt eines allgemeinen multimodalen Modells. Für wortgetreue Transkription ist das das richtige Werkzeug. Anbieter, die beide Varianten anbieten, empfehlen ebenfalls diesen Ansatz.
Sobald einige Modelle diese Kriterien erfüllen, bleibt nur noch die Frage, wie genau sie das eigene Audiomaterial mit seinen Akzenten, Störgeräuschen und seinem Vokabular transkribieren. Das muss mit echten Aufnahmen getestet werden. Kein Benchmark mit sauberer Sprache kann diesen Test ersetzen.
Fazit
Bei sauberer, geskripteter Sprache in weit verbreiteten Sprachen sind alle sieben Modelle ungefähr gleich genau. Das ist die wichtigste Erkenntnis des Tests: Die Genauigkeit eignet sich hier nicht als Auswahlkriterium. Belastbar und tatsächlich unterschiedlich sind dagegen die Rahmenbedingungen. Die Kosten unterscheiden sich um etwa den Faktor 8, ein Modell erkennt nur zwei Sprachen automatisch, und die minutengenau abgerechneten Modelle können nicht streamen. Grenzt das Feld anhand dieser Kriterien ein, statt vorschnell einen Sieger zu bestimmen, und testet anschließend die verbleibenden zwei oder drei Modelle mit eigenem Audiomaterial. Für Transkription sollte ein spezialisiertes Speech-to-Text-Modell statt eines allgemeinen multimodalen Modells verwendet werden. Genau das empfehlen auch Anbieter, die beide Modelltypen entwickeln.
Quellen
- OpenAI: Leitfaden zur Spracherkennung
- OpenAI: API-Preise
- Google: Audioverständnis mit der Gemini API (für spezialisierte Transkription Cloud Speech-to-Text verwenden)
- Google Cloud: Transkriptionsmodell Chirp 3
- BytePlus: Überblick über Seed-ASR von ByteDance
Kosten und Latenzen wurden am 2026-06-25 auf Synthorai mit sieben spezialisierten Transkriptionsmodellen und fünf Sprachen (Englisch, Mandarin, Hindi, Spanisch und Französisch) gemessen. Grundlage waren der Header x-total-cost-usd und das SSE-Timing. Die Sprachwerte für seed-asr stammen aus einer erneuten Messung am 2026-07-04 mit gesetztem language-Parameter. Das Audio wurde per Text-to-Speech erzeugt und war bewusst einfach. Die Genauigkeitswerte dienen daher nur als Mindestprüfung und nicht als Qualitätsbenchmark. Reale Sprache mit Akzenten und Störgeräuschen würde andere Unterschiede zwischen den Modellen sichtbar machen. Die Latenz schwankt zwischen den Testläufen. Die Listenpreise entsprechen den Tarifen dieser Plattform zum genannten Zeitpunkt. Prüft die aktuellen Preise, bevor ihr euch darauf verlasst.