GPT-4o Transcribe ist ein Speech-to-Text-Modell, das GPT-4o zur Transkription von Audio nutzt und OpenAIs Premium-Transkriptionsangebot ist.
- Eingabe
- Audio Text $2.5/M
- Ausgabe
- Text $10/M
- Audio-Input
- $6/M
- Kontext
- 16K
- Knowledge Cutoff
- 2024-06
Benchmarks
Herstellerangaben: Alibaba (Qwen) ByteDance Google OpenAI
Preis im Vergleich
Preisposition unter 3 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Max. Output (Anbieter-Spezifikation) | 2.000 |
|---|---|
| Knowledge Cutoff | 2024-06 |
Audio
| Sprachen | 57 Sprachen für den Transkriptions-Endpoint gelistet (eine gemeinsame Liste für alle Transkriptionsmodelle); ISO-639-1- / 639-3-Codes werden für GPT-4o-basierte Modelle akzeptiert |
|---|---|
| Audio-Limits |
|
| Sprecher-Diarisierung | Nein |
| Streaming-Transkription | Ja |
| Zeitstempel | Nein |
Modell
| Modalitäten | Audio + Text → Text |
|---|
GPT-4o Transcribe in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Über GPT-4o Transcribe
- Die offizielle Seite schreibt ihm Verbesserungen bei der Wortfehlerrate sowie bessere Spracherkennung und Genauigkeit gegenüber den ursprünglichen Whisper-Modellen zu.
- Anfragen tragen ein Kontextfenster von 16K Token mit bis zu 2K Output-Token, und das Modell wird über Transkriptions- und Realtime-Endpoints bereitgestellt.
- Uploads folgen den gemeinsamen Limits der Transkriptions-API: mp3, mp4, mpeg, mpga, m4a, wav oder webm, bis zu 25MB pro Datei, wobei längere Aufnahmen clientseitig aufgeteilt werden.
- Anders als Whisper akzeptiert es einen Prompt, den OpenAI als Möglichkeit beschreibt, die Transkriptionsqualität zu verbessern, indem man dem Modell zusätzlichen Kontext gibt, so wie man jedes andere GPT-4o-Modell prompten würde, was bei Namen, Fachjargon und Produktschreibweisen nützlich ist.
- Streaming-Transkription wird unterstützt, ebenso Log-Probabilities für konfidenzbewusste Pipelines.
- Zwei Grenzen prägen Integrationen: Die Ausgabe ist nur als JSON oder reiner Text verfügbar, ohne SRT, VTT oder Verbose-JSON, und Zeitstempel-Granularitäten auf Wort- oder Segmentebene werden bei diesem Modell nicht angeboten.
- Die Sprachabdeckung folgt der veröffentlichten Liste der Transkriptions-API von mehr als siebzig Sprachen, die OpenAI an einen Schwellenwert für die Wortfehlerrate knüpft, statt universelle Unterstützung zu behaupten, und der Knowledge Cutoff liegt im Juni 2024.
- OpenAI rahmt es als die genauere Wahl, wenn Streaming nicht im Vordergrund steht.
- Auf Synthorai fügt es sich unverändert in die OpenAI-kompatible Route /v1/audio/transcriptions ein.
FAQ
Lässt sich die GPT-4o Transcribe API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um GPT-4o Transcribe mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist GPT-4o Transcribe am besten?
Premium-Transkriptionsstufe; bessere Spracherkennung als das ursprüngliche Whisper; über Transkriptions- und Realtime-Endpoints bereitgestellt. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet GPT-4o Transcribe?
GPT-4o Transcribe kostet auf Synthorai $2.5 pro Million Input-Tokens und $10 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.
Welche Sprachen unterstützt GPT-4o Transcribe?
GPT-4o Transcribe unterstützt 57 Sprachen für den Transkriptions-Endpoint gelistet (eine gemeinsame Liste für alle Transkriptionsmodelle); ISO-639-1- / 639-3-Codes werden für GPT-4o-basierte Modelle akzeptiert. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.
Wie erhalte ich Zugang zu GPT-4o Transcribe?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="gpt-4o-transcribe", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.