Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

GPT-4o Transcribe

Veröffentlicht 2025-03-20

transcription

GPT-4o Transcribe ist ein Speech-to-Text-Modell, das GPT-4o zur Transkription von Audio nutzt und OpenAIs Premium-Transkriptionsangebot ist.

Eingabe
Audio Text $2.5/M
Ausgabe
Text $10/M
Audio-Input
$6/M
Kontext
16K
Knowledge Cutoff
2024-06

Benchmarks

Über dem Durchschnittnur 1 vergleichbar
GPT-4o Transcribe weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
WenetSpeech test-net (CER)
15.3%

Herstellerangaben: Alibaba (Qwen) ByteDance Google OpenAI

Preis im Vergleich

Preisposition unter 3 vergleichbaren Modellen

Eingabe$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
Ausgabe$10/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Max. Output (Anbieter-Spezifikation) 2.000
Knowledge Cutoff 2024-06

Audio

Sprachen 57 Sprachen für den Transkriptions-Endpoint gelistet (eine gemeinsame Liste für alle Transkriptionsmodelle); ISO-639-1- / 639-3-Codes werden für GPT-4o-basierte Modelle akzeptiert
Audio-Limits
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, bis 25MB
  • Streaming-Transkription unterstützt (inkl. Realtime-Transkriptionssitzungen)
  • nur json/text als Output
  • keine Wort-Zeitstempel und keine Diarisierung
Sprecher-Diarisierung Nein
Streaming-Transkription Ja
Zeitstempel Nein

Modell

Modalitäten Audio + Text → Text

laut Offizielle OpenAI-Dokumentation ↗

GPT-4o Transcribe in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über GPT-4o Transcribe

  • Die offizielle Seite schreibt ihm Verbesserungen bei der Wortfehlerrate sowie bessere Spracherkennung und Genauigkeit gegenüber den ursprünglichen Whisper-Modellen zu.
  • Anfragen tragen ein Kontextfenster von 16K Token mit bis zu 2K Output-Token, und das Modell wird über Transkriptions- und Realtime-Endpoints bereitgestellt.
  • Uploads folgen den gemeinsamen Limits der Transkriptions-API: mp3, mp4, mpeg, mpga, m4a, wav oder webm, bis zu 25MB pro Datei, wobei längere Aufnahmen clientseitig aufgeteilt werden.
  • Anders als Whisper akzeptiert es einen Prompt, den OpenAI als Möglichkeit beschreibt, die Transkriptionsqualität zu verbessern, indem man dem Modell zusätzlichen Kontext gibt, so wie man jedes andere GPT-4o-Modell prompten würde, was bei Namen, Fachjargon und Produktschreibweisen nützlich ist.
  • Streaming-Transkription wird unterstützt, ebenso Log-Probabilities für konfidenzbewusste Pipelines.
  • Zwei Grenzen prägen Integrationen: Die Ausgabe ist nur als JSON oder reiner Text verfügbar, ohne SRT, VTT oder Verbose-JSON, und Zeitstempel-Granularitäten auf Wort- oder Segmentebene werden bei diesem Modell nicht angeboten.
  • Die Sprachabdeckung folgt der veröffentlichten Liste der Transkriptions-API von mehr als siebzig Sprachen, die OpenAI an einen Schwellenwert für die Wortfehlerrate knüpft, statt universelle Unterstützung zu behaupten, und der Knowledge Cutoff liegt im Juni 2024.
  • OpenAI rahmt es als die genauere Wahl, wenn Streaming nicht im Vordergrund steht.
  • Auf Synthorai fügt es sich unverändert in die OpenAI-kompatible Route /v1/audio/transcriptions ein.

FAQ

Lässt sich die GPT-4o Transcribe API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um GPT-4o Transcribe mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist GPT-4o Transcribe am besten?

Premium-Transkriptionsstufe; bessere Spracherkennung als das ursprüngliche Whisper; über Transkriptions- und Realtime-Endpoints bereitgestellt. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet GPT-4o Transcribe?

GPT-4o Transcribe kostet auf Synthorai $2.5 pro Million Input-Tokens und $10 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.

Welche Sprachen unterstützt GPT-4o Transcribe?

GPT-4o Transcribe unterstützt 57 Sprachen für den Transkriptions-Endpoint gelistet (eine gemeinsame Liste für alle Transkriptionsmodelle); ISO-639-1- / 639-3-Codes werden für GPT-4o-basierte Modelle akzeptiert. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu GPT-4o Transcribe?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="gpt-4o-transcribe", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →