GPT-4o Transcribe vs GPT-4o Transcribe Diarize
Welches Modell wofür
Gleiche $2.5 pro Million Texteingabe und derselbe 16000-Token-Kontext; die diarize-Variante berechnet für Audio etwas mehr ($6.25 gegenüber $6 pro Million Audio-Eingabetokens) und für Textausgabe deutlich weniger ($2.5 gegenüber $10). Was sie ergänzt, ist Sprechertrennung mit diarized_json - Sprecherkennzeichen und Segment-Zeitstempel - um den Preis eines verpflichtenden chunking_strategy jenseits von 30 Sekunden und des Wegfalls der Prompt-Unterstützung. Nehmen Sie gpt-4o-transcribe für einfache Streaming-Transkripte, die diarize-Variante, wenn Sie wissen müssen, wer gesprochen hat.
Benchmarks
GPT-4o Transcribe Diarize: Der Anbieter hat keine Benchmark-Werte veröffentlicht.
Anbieterangaben: Alibaba (Qwen) ByteDance Google OpenAI
Preise
| GPT-4o Transcribe | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Audio-Eingabe / 1M Tokens | $6 | $6.25 | 0.96× |
| Text-Ausgabe / 1M Tokens | $10 | $2.5 | 4× |
Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.
Fähigkeiten
| GPT-4o Transcribe | GPT-4o Transcribe Diarize | |
|---|---|---|
| Sprecherdiarisierung | nein | ja |
| Streaming | ja | ja |
| Zeitstempel | nein | ja |
Spezifikationen
| GPT-4o Transcribe | GPT-4o Transcribe Diarize | |
|---|---|---|
| Eingabemodalitäten | Text Audio | Text Audio |
| Ausgabemodalitäten | Text | Text |
| Veröffentlicht | 2025-03-20 | 2025-10 |
| Knowledge-Cutoff | 2024-06 | 2024-06 |
| Limits | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB streaming transcription supported (incl. Realtime transcription sessions) json/text output only no word timestamps or diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Sprachen | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Maximale Ausgabe | 2K | 2K |
Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: GPT-4o Transcribe · GPT-4o Transcribe Diarize
Eine Zeile genügt für den Wechsel
Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe",
# model="gpt-4o-transcribe-diarize", # diese Zeile einkommentieren, die darüberliegende auskommentieren
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe",
// model: "gpt-4o-transcribe-diarize", // diese Zeile einkommentieren, die darüberliegende auskommentieren
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe" \
# -F model="gpt-4o-transcribe-diarize" \ # diese Zeile einkommentieren, die darüberliegende auskommentieren
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe",
// Model: "gpt-4o-transcribe-diarize", // diese Zeile einkommentieren, die darüberliegende auskommentieren
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe")
// .model("gpt-4o-transcribe-diarize") // diese Zeile einkommentieren, die darüberliegende auskommentieren
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Welches Modell ist günstiger: GPT-4o Transcribe oder GPT-4o Transcribe Diarize?
GPT-4o Transcribe ist bei Audio-Eingabe / 1M Tokens günstiger ($6 vs. $6.25, Faktor 1.0). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.
Kann ich GPT-4o Transcribe gegen GPT-4o Transcribe Diarize A/B-testen, ohne zweimal zu integrieren?
Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.
Unterstützen GPT-4o Transcribe und GPT-4o Transcribe Diarize Sprecherdiarisierung?
Das beantwortet die Tabelle der Fähigkeiten oben für jedes Modell einzeln, direkt aus der Dokumentation des jeweiligen Anbieters. Diarisierung, Streaming und Zeitstempel stehen dort getrennt, weil sich die Modelle in allen drei Punkten unterscheiden.