Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT-4o Transcribe Diarize

Rilasciato 2025-10

transcription

GPT-4o Transcribe Diarize è un modello di riconoscimento vocale automatico che identifica chi parla e quando: associa i segmenti audio a parlanti diversi in una conversazione, così i trascritti registrano chi ha detto cosa, non solo cosa è stato detto.

Input
audio testo $2.5/M
Output
testo $2.5/M
Input audio
$6.25/M
Contesto
16K
Cutoff di conoscenza
2024-06

Il prezzo nel contesto

Posizione del prezzo tra 3 modelli comparabili

Input$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
Output$2.5/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Output massimo (specifica del vendor) 2.000
Cutoff di conoscenza 2024-06

Audio

Lingue 57 lingue elencate per l'endpoint di trascrizione (un unico elenco condiviso da tutti i modelli di trascrizione); codici ISO 639-1 / 639-3 accettati per i modelli basati su GPT-4o
Limiti audio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, fino a 25MB
  • diarizzazione dei parlanti integrata con output diarized_json (etichette dei parlanti + timestamp dei segmenti)
  • chunking_strategy obbligatorio per audio >30s
  • nessun supporto per il prompt
Diarizzazione
Trascrizione in streaming
Timestamp

Modello

Modalità audio + testo → testo

Unico modello di trascrizione OpenAI con diarizzazione dei parlanti integrata.

fonte: documentazione ufficiale OpenAI ↗

Usa GPT-4o Transcribe Diarize in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe-diarize",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su GPT-4o Transcribe Diarize

  • Condivide la finestra di contesto da 16K token e i 2K token di output massimo della famiglia di trascrizione GPT-4o ed è costruito appositamente per l'endpoint di trascrizione anziché per la chat generica.
  • OpenAI afferma chiaramente che il modello è disponibile solo tramite la Transcription API e non nella Realtime API.
  • È l'unico modello OpenAI che restituisce il formato di risposta JSON diarizzato, che porta le etichette dei parlanti insieme ai timestamp dei segmenti; sono disponibili anche JSON semplice e testo, ma non SRT, VTT e verbose JSON.
  • Due comportamenti sono specifici di questo modello.
  • Per audio più lungo di 30 secondi è richiesta una strategia di chunking, automatica oppure una configurazione di voice activity fornita da te, e il prompting non è affatto disponibile, quindi i trucchi di contesto che funzionano sui suoi fratelli qui non si applicano.
  • I parlanti possono facoltativamente essere nominati in anticipo fornendo fino a quattro brevi clip di riferimento di pochi secondi ciascuna.
  • Lo streaming funziona, anche se l'assegnazione dei parlanti si consolida per segmento anziché parola per parola.
  • Note di riunioni, analisi delle chiamate e strumenti per le interviste sono il suo ambito naturale.
  • Synthorai lo espone tramite la stessa transcription API compatibile OpenAI dei suoi fratelli.

FAQ

L'API di GPT-4o Transcribe Diarize si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare GPT-4o Transcribe Diarize sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle GPT-4o Transcribe Diarize?

Diarizzazione dei parlanti integrata; le trascrizioni catturano chi ha detto cosa; adatto ad appunti di riunione e analisi delle chiamate. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa GPT-4o Transcribe Diarize?

Su Synthorai, GPT-4o Transcribe Diarize costa $2.5 per milione di token in input e $2.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

Quali lingue supporta GPT-4o Transcribe Diarize?

GPT-4o Transcribe Diarize supporta 57 lingue elencate per l'endpoint di trascrizione (un unico elenco condiviso da tutti i modelli di trascrizione); codici ISO 639-1 / 639-3 accettati per i modelli basati su GPT-4o. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a GPT-4o Transcribe Diarize?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gpt-4o-transcribe-diarize" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →