Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

GPT-4o Transcribe Diarize

Veröffentlicht 2025-10

transcription

GPT-4o Transcribe Diarize ist ein Modell zur automatischen Spracherkennung, das erkennt, wer wann spricht: Es ordnet Audiosegmente verschiedenen Sprechern in einem Gespräch zu, sodass Transkripte festhalten, wer was gesagt hat, und nicht nur, was gesagt wurde.

Eingabe
Audio Text $2.5/M
Ausgabe
Text $2.5/M
Audio-Input
$6.25/M
Kontext
16K
Knowledge Cutoff
2024-06

Preis im Vergleich

Preisposition unter 3 vergleichbaren Modellen

Eingabe$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
Ausgabe$2.5/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Max. Output (Anbieter-Spezifikation) 2.000
Knowledge Cutoff 2024-06

Audio

Sprachen 57 Sprachen für den Transkriptions-Endpoint gelistet (eine gemeinsame Liste für alle Transkriptionsmodelle); ISO-639-1- / 639-3-Codes werden für GPT-4o-basierte Modelle akzeptiert
Audio-Limits
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, bis 25MB
  • eingebaute Sprecher-Diarisierung mit diarized_json-Output (Sprecherlabels und Segment-Zeitstempel)
  • chunking_strategy ist für Audio >30s erforderlich
  • keine Prompt-Unterstützung
Sprecher-Diarisierung Ja
Streaming-Transkription Ja
Zeitstempel Ja

Modell

Modalitäten Audio + Text → Text

Einziges Transkriptionsmodell von OpenAI mit eingebauter Sprecher-Diarisierung.

laut Offizielle OpenAI-Dokumentation ↗

GPT-4o Transcribe Diarize in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe-diarize",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über GPT-4o Transcribe Diarize

  • Es teilt das Kontextfenster von 16K Token und die maximal 2K Output-Token der GPT-4o-Transkriptionsfamilie und ist eigens für den Transkriptions-Endpoint gebaut statt für allgemeinen Chat.
  • OpenAI stellt unmissverständlich fest, dass das Modell nur über die Transcription API und nicht in der Realtime API verfügbar ist.
  • Es ist das einzige OpenAI-Modell, das das diarisierte JSON-Antwortformat zurückgibt, das Sprecherbezeichnungen neben Segment-Zeitstempeln trägt; einfaches JSON und Text sind ebenfalls verfügbar, SRT, VTT und Verbose-JSON hingegen nicht.
  • Zwei Verhaltensweisen sind für dieses Modell spezifisch.
  • Für Audio, das länger als 30 Sekunden ist, wird eine Chunking-Strategie benötigt, entweder automatisch oder als von Ihnen gelieferte Voice-Activity-Konfiguration, und Prompting ist überhaupt nicht verfügbar, sodass die Kontext-Kniffe, die bei seinen Geschwistermodellen funktionieren, hier nicht greifen.
  • Sprecher können optional vorab benannt werden, indem bis zu vier kurze Referenzclips von jeweils wenigen Sekunden bereitgestellt werden.
  • Streaming funktioniert, wobei die Sprecherzuordnung pro Segment statt Wort für Wort finalisiert wird.
  • Meeting-Notizen, Anrufanalysen und Interview-Werkzeuge sind sein natürliches Einsatzfeld.
  • Synthorai stellt es über dieselbe OpenAI-kompatible Transkriptions-API bereit wie seine Geschwistermodelle.

FAQ

Lässt sich die GPT-4o Transcribe Diarize API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um GPT-4o Transcribe Diarize mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist GPT-4o Transcribe Diarize am besten?

Integrierte Sprecher-Diarisierung; Transkripte erfassen, wer was gesagt hat; passt zu Meeting-Notizen und Anrufanalysen. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet GPT-4o Transcribe Diarize?

GPT-4o Transcribe Diarize kostet auf Synthorai $2.5 pro Million Input-Tokens und $2.5 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.

Welche Sprachen unterstützt GPT-4o Transcribe Diarize?

GPT-4o Transcribe Diarize unterstützt 57 Sprachen für den Transkriptions-Endpoint gelistet (eine gemeinsame Liste für alle Transkriptionsmodelle); ISO-639-1- / 639-3-Codes werden für GPT-4o-basierte Modelle akzeptiert. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu GPT-4o Transcribe Diarize?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="gpt-4o-transcribe-diarize", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →