GPT-4o Transcribe Diarize è un modello di riconoscimento vocale automatico che identifica chi parla e quando: associa i segmenti audio a parlanti diversi in una conversazione, così i trascritti registrano chi ha detto cosa, non solo cosa è stato detto.
- Input
- audio testo $2.5/M
- Output
- testo $2.5/M
- Input audio
- $6.25/M
- Contesto
- 16K
- Cutoff di conoscenza
- 2024-06
Il prezzo nel contesto
Posizione del prezzo tra 3 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Output massimo (specifica del vendor) | 2.000 |
|---|---|
| Cutoff di conoscenza | 2024-06 |
Audio
| Lingue | 57 lingue elencate per l'endpoint di trascrizione (un unico elenco condiviso da tutti i modelli di trascrizione); codici ISO 639-1 / 639-3 accettati per i modelli basati su GPT-4o |
|---|---|
| Limiti audio |
|
| Diarizzazione | Sì |
| Trascrizione in streaming | Sì |
| Timestamp | Sì |
Modello
| Modalità | audio + testo → testo |
|---|
Unico modello di trascrizione OpenAI con diarizzazione dei parlanti integrata.
Usa GPT-4o Transcribe Diarize in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe-diarize",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe-diarize",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe-diarize" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe-diarize",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe-diarize")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Informazioni su GPT-4o Transcribe Diarize
- Condivide la finestra di contesto da 16K token e i 2K token di output massimo della famiglia di trascrizione GPT-4o ed è costruito appositamente per l'endpoint di trascrizione anziché per la chat generica.
- OpenAI afferma chiaramente che il modello è disponibile solo tramite la Transcription API e non nella Realtime API.
- È l'unico modello OpenAI che restituisce il formato di risposta JSON diarizzato, che porta le etichette dei parlanti insieme ai timestamp dei segmenti; sono disponibili anche JSON semplice e testo, ma non SRT, VTT e verbose JSON.
- Due comportamenti sono specifici di questo modello.
- Per audio più lungo di 30 secondi è richiesta una strategia di chunking, automatica oppure una configurazione di voice activity fornita da te, e il prompting non è affatto disponibile, quindi i trucchi di contesto che funzionano sui suoi fratelli qui non si applicano.
- I parlanti possono facoltativamente essere nominati in anticipo fornendo fino a quattro brevi clip di riferimento di pochi secondi ciascuna.
- Lo streaming funziona, anche se l'assegnazione dei parlanti si consolida per segmento anziché parola per parola.
- Note di riunioni, analisi delle chiamate e strumenti per le interviste sono il suo ambito naturale.
- Synthorai lo espone tramite la stessa transcription API compatibile OpenAI dei suoi fratelli.
FAQ
L'API di GPT-4o Transcribe Diarize si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare GPT-4o Transcribe Diarize sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle GPT-4o Transcribe Diarize?
Diarizzazione dei parlanti integrata; le trascrizioni catturano chi ha detto cosa; adatto ad appunti di riunione e analisi delle chiamate. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa GPT-4o Transcribe Diarize?
Su Synthorai, GPT-4o Transcribe Diarize costa $2.5 per milione di token in input e $2.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.
Quali lingue supporta GPT-4o Transcribe Diarize?
GPT-4o Transcribe Diarize supporta 57 lingue elencate per l'endpoint di trascrizione (un unico elenco condiviso da tutti i modelli di trascrizione); codici ISO 639-1 / 639-3 accettati per i modelli basati su GPT-4o. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.
Come ottengo l'accesso a GPT-4o Transcribe Diarize?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gpt-4o-transcribe-diarize" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.