GPT-4o Transcribe Diarize ist ein Modell zur automatischen Spracherkennung, das erkennt, wer wann spricht: Es ordnet Audiosegmente verschiedenen Sprechern in einem Gespräch zu, sodass Transkripte festhalten, wer was gesagt hat, und nicht nur, was gesagt wurde.
- Eingabe
- Audio Text $2.5/M
- Ausgabe
- Text $2.5/M
- Audio-Input
- $6.25/M
- Kontext
- 16K
- Knowledge Cutoff
- 2024-06
Preis im Vergleich
Preisposition unter 3 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Max. Output (Anbieter-Spezifikation) | 2.000 |
|---|---|
| Knowledge Cutoff | 2024-06 |
Audio
| Sprachen | 57 Sprachen für den Transkriptions-Endpoint gelistet (eine gemeinsame Liste für alle Transkriptionsmodelle); ISO-639-1- / 639-3-Codes werden für GPT-4o-basierte Modelle akzeptiert |
|---|---|
| Audio-Limits |
|
| Sprecher-Diarisierung | Ja |
| Streaming-Transkription | Ja |
| Zeitstempel | Ja |
Modell
| Modalitäten | Audio + Text → Text |
|---|
Einziges Transkriptionsmodell von OpenAI mit eingebauter Sprecher-Diarisierung.
GPT-4o Transcribe Diarize in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe-diarize",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe-diarize",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe-diarize" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe-diarize",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe-diarize")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Über GPT-4o Transcribe Diarize
- Es teilt das Kontextfenster von 16K Token und die maximal 2K Output-Token der GPT-4o-Transkriptionsfamilie und ist eigens für den Transkriptions-Endpoint gebaut statt für allgemeinen Chat.
- OpenAI stellt unmissverständlich fest, dass das Modell nur über die Transcription API und nicht in der Realtime API verfügbar ist.
- Es ist das einzige OpenAI-Modell, das das diarisierte JSON-Antwortformat zurückgibt, das Sprecherbezeichnungen neben Segment-Zeitstempeln trägt; einfaches JSON und Text sind ebenfalls verfügbar, SRT, VTT und Verbose-JSON hingegen nicht.
- Zwei Verhaltensweisen sind für dieses Modell spezifisch.
- Für Audio, das länger als 30 Sekunden ist, wird eine Chunking-Strategie benötigt, entweder automatisch oder als von Ihnen gelieferte Voice-Activity-Konfiguration, und Prompting ist überhaupt nicht verfügbar, sodass die Kontext-Kniffe, die bei seinen Geschwistermodellen funktionieren, hier nicht greifen.
- Sprecher können optional vorab benannt werden, indem bis zu vier kurze Referenzclips von jeweils wenigen Sekunden bereitgestellt werden.
- Streaming funktioniert, wobei die Sprecherzuordnung pro Segment statt Wort für Wort finalisiert wird.
- Meeting-Notizen, Anrufanalysen und Interview-Werkzeuge sind sein natürliches Einsatzfeld.
- Synthorai stellt es über dieselbe OpenAI-kompatible Transkriptions-API bereit wie seine Geschwistermodelle.
FAQ
Lässt sich die GPT-4o Transcribe Diarize API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um GPT-4o Transcribe Diarize mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist GPT-4o Transcribe Diarize am besten?
Integrierte Sprecher-Diarisierung; Transkripte erfassen, wer was gesagt hat; passt zu Meeting-Notizen und Anrufanalysen. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet GPT-4o Transcribe Diarize?
GPT-4o Transcribe Diarize kostet auf Synthorai $2.5 pro Million Input-Tokens und $2.5 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.
Welche Sprachen unterstützt GPT-4o Transcribe Diarize?
GPT-4o Transcribe Diarize unterstützt 57 Sprachen für den Transkriptions-Endpoint gelistet (eine gemeinsame Liste für alle Transkriptionsmodelle); ISO-639-1- / 639-3-Codes werden für GPT-4o-basierte Modelle akzeptiert. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.
Wie erhalte ich Zugang zu GPT-4o Transcribe Diarize?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="gpt-4o-transcribe-diarize", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.