GPT-4o Transcribe vs Whisper v1
Welches Modell wofür
Diese beiden rechnen in verschiedenen Einheiten ab - whisper-1 mit $0.006 pro Audiominute, gpt-4o-transcribe mit $6 pro Million Audio-Eingabetokens plus $2.5 und $10 pro Million Texttokens - also ist keine einzelne Umrechnung zwischen ihnen ehrlich. whisper-1 ist das mit Zeitstempeln auf Wort- und Segmentebene, srt/vtt-Ausgabe und dem Übersetzungs-Endpunkt, streamt aber nicht; gpt-4o-transcribe streamt, einschließlich Echtzeit-Transkriptionssitzungen, und liefert nur json oder Text. Nehmen Sie whisper-1 für Untertitel und Übersetzung, gpt-4o-transcribe für Live-Transkripte.
Benchmarks
Whisper v1: Der Anbieter hat keine Benchmark-Werte veröffentlicht.
Anbieterangaben: Alibaba (Qwen) ByteDance Google OpenAI
Preise
| GPT-4o Transcribe | Whisper v1 | Δ | |
|---|---|---|---|
| Pro Audiominute | - | $0.006 | - |
| Audio-Eingabe / 1M Tokens | $6 | - | - |
| Text-Ausgabe / 1M Tokens | $10 | - | - |
Die beiden Modelle werden in unterschiedlichen Einheiten abgerechnet, deshalb zeigen wir kein Δ: Für eine Umrechnung müssten wir etwas annehmen, das wir nicht gemessen haben. Oben steht jeder Preis in seiner eigenen Einheit.
Fähigkeiten
| GPT-4o Transcribe | Whisper v1 | |
|---|---|---|
| Sprecherdiarisierung | nein | nein |
| Streaming | ja | nein |
| Zeitstempel | nein | ja |
Spezifikationen
| GPT-4o Transcribe | Whisper v1 | |
|---|---|---|
| Eingabemodalitäten | Text Audio | Audio |
| Ausgabemodalitäten | Text | Text |
| Veröffentlicht | 2025-03-20 | 2023-03-01 |
| Knowledge-Cutoff | 2024-06 | - |
| Limits | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB streaming transcription supported (incl. Realtime transcription sessions) json/text output only no word timestamps or diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB word- and segment-level timestamps (verbose_json), srt/vtt output no streaming only model supported on the translations endpoint (to English) |
| Sprachen | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models | Trained on 98 languages 57 listed as supported, the languages that met OpenAI's under-50% word-error-rate threshold across the transcriptions and translations endpoints |
| Maximale Ausgabe | 2K | - |
Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: GPT-4o Transcribe · Whisper v1
Eine Zeile genügt für den Wechsel
Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe",
# model="whisper-1", # diese Zeile einkommentieren, die darüberliegende auskommentieren
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe",
// model: "whisper-1", // diese Zeile einkommentieren, die darüberliegende auskommentieren
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe" \
# -F model="whisper-1" \ # diese Zeile einkommentieren, die darüberliegende auskommentieren
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe",
// Model: "whisper-1", // diese Zeile einkommentieren, die darüberliegende auskommentieren
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe")
// .model("whisper-1") // diese Zeile einkommentieren, die darüberliegende auskommentieren
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Welches Modell ist günstiger: GPT-4o Transcribe oder Whisper v1?
Die beiden werden in unterschiedlichen Einheiten abgerechnet, eine einzelne belastbare Zahl gibt es deshalb nicht: GPT-4o Transcribe und Whisper v1 stehen in der Tabelle oben jeweils in ihrer eigenen Einheit. Vergleichen Sie sie mit Ihrem eigenen Workload. Welche Abwägung dahintersteckt, beschreibt das Fazit oben auf dieser Seite.
Kann ich GPT-4o Transcribe gegen Whisper v1 A/B-testen, ohne zweimal zu integrieren?
Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.
Unterstützen GPT-4o Transcribe und Whisper v1 Sprecherdiarisierung?
Das beantwortet die Tabelle der Fähigkeiten oben für jedes Modell einzeln, direkt aus der Dokumentation des jeweiligen Anbieters. Diarisierung, Streaming und Zeitstempel stehen dort getrennt, weil sich die Modelle in allen drei Punkten unterscheiden.