Spracherkennungs-APIs: 14 Modelle von $0.002 bis $0.016 pro Minute
Inhalt
Eine Spracherkennungs-API kostet laut Listenpreis zwischen $0.002 und $0.016 pro Minute. Für eine scheinbar identische Aufgabe unterscheiden sich die Preise damit um den Faktor 8. Die günstigsten Angebote tauchen in den meisten Vergleichen nicht auf. Hinter einem Gateway betreiben wir 14 Transkriptionsmodelle: von der tokenbasiert abgerechneten gpt-4o-Familie von OpenAI bis zu chinesischen ASR-Modellen von ByteDance und Alibaba, die in internationalen Übersichten regelmäßig fehlen. Diese Seite gibt einen Überblick über den Markt: wie sich die Abrechnungsmodelle unterscheiden, welche Minutenpreise für die einzelnen Modelle gelten und welches Modell zu welchem Szenario passt.
TL;DR
- Die Listenpreise der 14 Modelle reichen von $0.002 (seed-asr, paraformer, fun-asr-realtime) bis $0.016 (Chirp von Google) pro Minute. Das entspricht Faktor 8.
- Die Transkriptionsmodelle der gpt-4o-Familie von OpenAI rechnen nach token statt nach Minuten ab. Für unsere Testaufnahmen ergaben sich umgerechnet etwa $0.0031/min für mini und $0.0062/min für das große Modell.
- Die günstigste Klasse bilden chinesische ASR-Modelle: ByteDance seed-asr sowie die paraformer-, fun-asr- und qwen3-Familien von Alibaba kosten laut Liste $0.002-$0.0021/min und bieten auch Streaming-Varianten.
- Bei klarer Sprache ist die Genauigkeit kein Unterscheidungsmerkmal. In unserem Test mit sieben Modellen lag die Fehlerrate für Englisch, Spanisch und Französisch bei allen Modellen, die die jeweilige Sprache unterstützen, bei ~0%.
Was kostet eine Spracherkennungs-API 2026?
Darauf gibt eine Tabelle die ehrlichste Antwort, denn die Art der Abrechnung ist ebenso relevant wie der Preis. Minutenbasierte Modelle berechnen die Dauer unabhängig vom Inhalt. Tokenbasierte Modelle sampeln das Audio neu und rechnen Eingabe- und Ausgabe-token ab. Der daraus resultierende effektive Minutenpreis schwankt je nach Sprechdichte leicht:
| Modell | Anbieter | Abrechnung | Listenpreis | Streaming |
|---|---|---|---|---|
| seed-asr-bigmodel | ByteDance | pro Minute | $0.002/min | nein |
| paraformer-realtime-v2 | Alibaba | pro Minute | $0.002/min | ja |
| qwen3-asr-flash-realtime | Alibaba | pro Minute | $0.002/min | ja |
| fun-asr-realtime | Alibaba | pro Minute | $0.002/min | ja |
| fun-asr | Alibaba | pro Minute | $0.0021/min | nein |
| fun-asr-flash | Alibaba | pro Minute | $0.0021/min | nein |
| fun-asr-mtl | Alibaba | pro Minute | $0.0021/min | nein |
| qwen3-asr-flash | Alibaba | pro Minute | $0.0021/min | nein |
| gpt-4o-mini-transcribe | OpenAI | pro token | gemessen ≈$0.0031/min | tokenweise |
| whisper-1 | OpenAI | pro Minute | $0.006/min | nein |
| gpt-4o-transcribe | OpenAI | pro token | gemessen ≈$0.0062/min | tokenweise |
| gpt-4o-transcribe-diarize | OpenAI | pro token | token-Preise | tokenweise |
| chirp-2 | pro Minute | $0.016/min | nein | |
| chirp-3 | pro Minute | $0.016/min | nein |
Die aktuellen Listenpreise stehen auf den jeweiligen Modellseiten. Die beiden ≈$/min-Werte der gpt-4o-Modelle entsprechen den Kosten, die für unsere mehrsprachigen Testaufnahmen tatsächlich über das Gateway abgerechnet wurden. Die Messwerte stammen aus unserem Vergleich von sieben Transkriptionsmodellen. Alle oben aufgeführten Batch-Modelle lassen sich mit einem einzigen API-Key über denselben OpenAI-kompatiblen Endpoint /v1/audio/transcriptions aufrufen. Das haben wir auch für das Modell mit Diarisierung geprüft. Die -realtime-Varianten sind Streaming-Modelle mit einer eigenen Schnittstelle, die auf der jeweiligen Modellseite dokumentiert ist.
Wie lassen sich tokenbasierte Preise in Minutenkosten umrechnen?
Bei tokenbasierter Transkription richten sich die Kosten nach dem gesprochenen Inhalt, nicht nach der Dateigröße. In der Praxis liegen diese Modelle preislich im Mittelfeld. Die gpt-4o-Transkriptionsmodelle sampeln das Audio vor der Tokenisierung neu. Eine große MP3-Datei mit 320 kbps kostet deshalb für denselben gesprochenen Inhalt ungefähr so viel wie eine kompakte WAV-Datei mit 16 kHz. Komprimierung spart Speicherplatz, nicht Transkriptionskosten. Bei Sprache in normalem Tempo ergaben unsere Messungen etwa $0.0031/min für gpt-4o-mini-transcribe und $0.0062/min für gpt-4o-transcribe. Bei höherer oder niedrigerer Sprechdichte weichen die Werte leicht nach oben oder unten ab. Braucht das Budget eine feste Obergrenze pro Audiostunde, bietet ein minutenbasiertes Modell Planungssicherheit. Bei einem tokenbasierten Modell bleibt es bei einer Prognose.
Was ist die chinesische ASR-Klasse und warum fehlt sie in den meisten Vergleichen?
Die chinesischen ASR-Modelle bilden den günstigsten Bereich der Tabelle und bieten zugleich die meisten Streaming-Optionen. In englischsprachigen Vergleichen werden sie meist gar nicht getestet. seed-asr-bigmodel von ByteDance ist mit $0.002/min das günstigste Modell. Alibaba bietet drei Familien an: paraformer mit Schwerpunkt auf Streaming, fun-asr als Batch-, Flash-, mehrsprachige mtl- und Realtime-Varianten sowie qwen3-asr als Flash- und Flash-Realtime-Version. Sie kosten alle $0.002-$0.0021/min. Das ist ein Drittel des Preises von whisper-1 und ein Achtel des Preises von Chirp.
Unsere Messungen zeigen zwei Einschränkungen. Erstens muss bei seed-asr die Audiosprache vorab angegeben werden. Das Modell ist die günstigste Wahl, wenn die Sprache bekannt ist. qwen3-asr-flash kostet $0.0021 und war in unserem Test das günstigste Modell, das jede Sprache automatisch erkannte. Zweitens bedeutet günstig nicht langsam: qwen3-asr-flash lieferte die Ergebnisse für unsere Clips nach etwa 3 Sekunden und lag damit auf dem Niveau der OpenAI-Modelle. Bei Workloads mit hohem Mandarin-Anteil ist diese Klasse nicht nur günstiger, sondern auch auf dem Heimatmarkt der Anbieter im Einsatz.
Welches Modell passt zu deinem Workload?
Entscheide zuerst nach Abrechnungsmodell und Streaming-Bedarf. Bei klarer Sprache unterscheiden sich die Modelle nicht durch ihre Genauigkeit. Die engere Auswahl nach Szenario:
| Szenario | Empfehlung | Begründung |
|---|---|---|
| Batch-Transkription, Sprache bekannt | seed-asr-bigmodel | günstigster Preis mit $0.002/min; Sprachangabe erforderlich |
| Batch, gemischte oder unbekannte Sprachen | qwen3-asr-flash | günstigste automatische Spracherkennung, ~3s Latenz |
| Live-Untertitel / Diktat | paraformer-realtime-v2 oder qwen3-asr-flash-realtime | Streaming zum Mindestpreis von $0.002 |
| Streaming von Textfragmenten über die OpenAI-kompatible Schnittstelle | gpt-4o-mini-transcribe | tokenweise Ausgabe, ≈$0.0031/min |
| Sprecherkennzeichnung erforderlich | gpt-4o-transcribe-diarize | einziges Modell mit Diarisierung in der Auswahl |
| Direkter Ersatz für Whisper | whisper-1 | Kompatibilitätsreferenz für $0.006/min |
Bei einer bidirektionalen Sprachkonversation statt einer Transkription handelt es sich um ein anderes Produkt mit einer anderen Kostenstruktur. Unser Preisvergleich für GPT Realtime behandelt die Kosten für Speech-to-Speech.
FAQ
Wie viel kostet die Whisper API?
Der Listenpreis von whisper-1 beträgt $0.006 pro Audiominute und richtet sich ausschließlich nach der Dauer. Eine einstündige Datei kostet unabhängig von Format und Bitrate $0.36. Wiederholte Anfragen werden nicht günstiger: Wir haben denselben Clip fünfmal gesendet und jedes Mal denselben Preis bezahlt. Inzwischen ist die Hälfte der Tabelle günstiger. Die chinesischen ASR-Modelle kosten mit $0.002-$0.0021/min nur ein Drittel, und für gpt-4o-mini-transcribe haben wir etwa die Hälfte gemessen.
Sind teurere Spracherkennungsmodelle genauer?
Nicht bei klarer Sprache. In unserem Test mit sieben Modellen erreichten alle Modelle, die die jeweilige Sprache unterstützen, bei Englisch, Spanisch und Französisch eine Fehlerrate von ungefähr 0%. Relevant sind stattdessen Kosten, Streaming, Sprachabdeckung und Funktionen wie Diarisierung. Bei schwierigen Aufnahmen mit Akzenten, Störgeräuschen oder Code-Switching solltest du eigene Samples testen. Die Transkriptionsstudie zeigt, wo in unserem Test zuerst Schwächen auftraten: bei Mandarin und Hindi.
Welche Spracherkennungs-APIs unterstützen Streaming?
Es gibt zwei Varianten. Die gpt-4o-Transkriptionsmodelle streamen Text tokenweise über die OpenAI-kompatible API. Die Realtime-Familie von Alibaba (paraformer-realtime-v2, qwen3-asr-flash-realtime, fun-asr-realtime) streamt zu minutenbasierten Preisen ab $0.002/min. whisper-1, seed-asr und die Chirp-Modelle liefern nur vollständige Transkripte zurück.
Alle 14 Modelle laufen hinter demselben Gateway-Endpoint und werden einheitlich abgerechnet. Die aktuellen Listenpreise aller Modelle stehen auf der Modellübersicht. Den gemessenen Vergleich von sieben Modellen einschließlich Latenz und Genauigkeit findest du in der Studie zu Transkriptionskosten.