Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

GPT-4o Transcribe vs GPT-4o Transcribe Diarize

vs

Welches Modell wofür

Gleiche $2.5 pro Million Texteingabe und derselbe 16000-Token-Kontext; die diarize-Variante berechnet für Audio etwas mehr ($6.25 gegenüber $6 pro Million Audio-Eingabetokens) und für Textausgabe deutlich weniger ($2.5 gegenüber $10). Was sie ergänzt, ist Sprechertrennung mit diarized_json - Sprecherkennzeichen und Segment-Zeitstempel - um den Preis eines verpflichtenden chunking_strategy jenseits von 30 Sekunden und des Wegfalls der Prompt-Unterstützung. Nehmen Sie gpt-4o-transcribe für einfache Streaming-Transkripte, die diarize-Variante, wenn Sie wissen müssen, wer gesprochen hat.

Benchmarks

GPT-4o Transcribe Diarize: Der Anbieter hat keine Benchmark-Werte veröffentlicht.

Über dem DurchschnittGPT-4o Transcribenur 1 vergleichbar
GPT-4o Transcribe GPT-4o Transcribe Diarize weitere gemessene Modelle Durchschnitt der Vergleichsmodelle ★ kein anderes Modell war besser
WenetSpeech test-net (CER)
15.3%
N/A

Anbieterangaben: Alibaba (Qwen) ByteDance Google OpenAI

Preise

GPT-4o Transcribe GPT-4o Transcribe Diarize Δ
Audio-Eingabe / 1M Tokens $6 $6.25 0.96×
Text-Ausgabe / 1M Tokens $10 $2.5 4×

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Fähigkeiten

GPT-4o Transcribe GPT-4o Transcribe Diarize
Sprecherdiarisierung nein ja
Streaming ja ja
Zeitstempel nein ja

Spezifikationen

GPT-4o Transcribe GPT-4o Transcribe Diarize
Eingabemodalitäten Text Audio Text Audio
Ausgabemodalitäten Text Text
Veröffentlicht 2025-03-20 2025-10
Knowledge-Cutoff 2024-06 2024-06
Limits

mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB

streaming transcription supported (incl. Realtime transcription sessions)

json/text output only

no word timestamps or diarization

mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB

built-in speaker diarization with diarized_json output (speaker labels + segment timestamps)

chunking_strategy required for audio >30s

no prompt support

Sprachen

57 languages listed for the transcriptions endpoint (one shared list for all transcription models)

ISO 639-1 / 639-3 codes accepted for GPT-4o-based models

57 languages listed for the transcriptions endpoint (one shared list for all transcription models)

ISO 639-1 / 639-3 codes accepted for GPT-4o-based models

Maximale Ausgabe 2K 2K

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: GPT-4o Transcribe · GPT-4o Transcribe Diarize

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    # model="gpt-4o-transcribe-diarize",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: GPT-4o Transcribe oder GPT-4o Transcribe Diarize?

GPT-4o Transcribe ist bei Audio-Eingabe / 1M Tokens günstiger ($6 vs. $6.25, Faktor 1.0). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich GPT-4o Transcribe gegen GPT-4o Transcribe Diarize A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen GPT-4o Transcribe und GPT-4o Transcribe Diarize Sprecherdiarisierung?

Das beantwortet die Tabelle der Fähigkeiten oben für jedes Modell einzeln, direkt aus der Dokumentation des jeweiligen Anbieters. Diarisierung, Streaming und Zeitstempel stehen dort getrennt, weil sich die Modelle in allen drei Punkten unterscheiden.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen