GPT-4o Mini Transcribe vs GPT-4o Transcribe
Welches Modell wofür
Die mini-Stufe halbiert die Rechnung ungefähr - $1.25 pro Million Texteingabe, $5 Ausgabe und $3 pro Million Audioeingabe gegenüber $2.5, $10 und $6 - bei derselben 25MB-Dateigrenze, derselben Liste von 57 Sprachen, demselben 16000-Token-Kontext und derselben Ausgabe nur als json/text, ohne Zeitstempel und ohne Sprechertrennung auf beiden Seiten. Nichts sonst in den veröffentlichten Spezifikationen trennt sie, nehmen Sie also gpt-4o-mini-transcribe, sofern Sie keinen Unterschied an Ihrem eigenen Audio gemessen haben.
Benchmarks
GPT-4o Mini Transcribe: 33 veröffentlicht, aber kein Benchmark, den genug andere Modelle teilen.
Anbieterangaben: Alibaba (Qwen) ByteDance Google OpenAI
Preise
| GPT-4o Mini Transcribe | GPT-4o Transcribe | Δ | |
|---|---|---|---|
| Audio-Eingabe / 1M Tokens | $3 | $6 | 0.5× |
| Text-Ausgabe / 1M Tokens | $5 | $10 | 0.5× |
Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.
Fähigkeiten
| GPT-4o Mini Transcribe | GPT-4o Transcribe | |
|---|---|---|
| Sprecherdiarisierung | nein | nein |
| Streaming | ja | ja |
| Zeitstempel | nein | nein |
Spezifikationen
| GPT-4o Mini Transcribe | GPT-4o Transcribe | |
|---|---|---|
| Eingabemodalitäten | Text Audio | Text Audio |
| Ausgabemodalitäten | Text | Text |
| Veröffentlicht | 2025-03-20 | 2025-03-20 |
| Knowledge-Cutoff | 2024-06 | 2024-06 |
| Limits | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB streaming transcription supported json/text output only no word timestamps or diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB streaming transcription supported (incl. Realtime transcription sessions) json/text output only no word timestamps or diarization |
| Sprachen | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Maximale Ausgabe | 2K | 2K |
Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: GPT-4o Mini Transcribe · GPT-4o Transcribe
Eine Zeile genügt für den Wechsel
Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-mini-transcribe",
# model="gpt-4o-transcribe", # diese Zeile einkommentieren, die darüberliegende auskommentieren
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-mini-transcribe",
// model: "gpt-4o-transcribe", // diese Zeile einkommentieren, die darüberliegende auskommentieren
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-mini-transcribe" \
# -F model="gpt-4o-transcribe" \ # diese Zeile einkommentieren, die darüberliegende auskommentieren
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-mini-transcribe",
// Model: "gpt-4o-transcribe", // diese Zeile einkommentieren, die darüberliegende auskommentieren
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-mini-transcribe")
// .model("gpt-4o-transcribe") // diese Zeile einkommentieren, die darüberliegende auskommentieren
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Welches Modell ist günstiger: GPT-4o Mini Transcribe oder GPT-4o Transcribe?
GPT-4o Mini Transcribe ist bei Audio-Eingabe / 1M Tokens günstiger ($3 vs. $6, Faktor 2.0). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.
Kann ich GPT-4o Mini Transcribe gegen GPT-4o Transcribe A/B-testen, ohne zweimal zu integrieren?
Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.
Unterstützen GPT-4o Mini Transcribe und GPT-4o Transcribe Sprecherdiarisierung?
Das beantwortet die Tabelle der Fähigkeiten oben für jedes Modell einzeln, direkt aus der Dokumentation des jeweiligen Anbieters. Diarisierung, Streaming und Zeitstempel stehen dort getrennt, weil sich die Modelle in allen drei Punkten unterscheiden.