🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT-4o Transcribe vs GPT-4o Transcribe Diarize

vs

Quale scegliere e quando — verdetto curato, non una tabella di benchmark

Stessi $2.5 per milione in ingresso testo e stesso contesto da 16000 token; la variante diarize costa un po' di più sull'audio ($6.25 contro $6 per milione di token audio in ingresso) e molto meno sull'uscita testuale ($2.5 contro $10). Ciò che aggiunge è la diarizzazione con diarized_json — etichette di parlante e timestamp di segmento — al prezzo di un chunking_strategy obbligatorio oltre i 30 secondi e della perdita del supporto a prompt. Scegli gpt-4o-transcribe per trascrizioni in streaming, la variante diarize quando devi sapere chi ha parlato.

Prezzi

GPT-4o Transcribe GPT-4o Transcribe Diarize Δ
Input audio / 1M token $6 $6.25 0.96×
Output di testo / 1M token $10 $2.5

Le tariffe provengono dal catalogo live al momento della build; la pagina di ciascun modello riporta la scheda attuale.

Capacità

GPT-4o Transcribe GPT-4o Transcribe Diarize
Diarizzazione dei parlanti no
Streaming
Timestamp no

Specifiche

GPT-4o Transcribe GPT-4o Transcribe Diarize
Modalità di input testo audio testo audio
Modalità di output testo testo
Rilascio 2025-03-20 2025-10
Cutoff di conoscenza 2024-06 2024-06
Limiti

mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB

streaming transcription supported (incl. Realtime transcription sessions)

json/text output only

no word timestamps or diarization

mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB

built-in speaker diarization with diarized_json output (speaker labels + segment timestamps)

chunking_strategy required for audio >30s

no prompt support

Lingue

57 languages listed for the transcriptions endpoint (one shared list for all transcription models)

ISO 639-1 / 639-3 codes accepted for GPT-4o-based models

57 languages listed for the transcriptions endpoint (one shared list for all transcription models)

ISO 639-1 / 639-3 codes accepted for GPT-4o-based models

Output massimo 2K 2K

Le specifiche sono trascritte dalla documentazione di ciascun fornitore; una riga che un fornitore non pubblica viene omessa anziché essere dedotta. Fonti complete: GPT-4o Transcribe · GPT-4o Transcribe Diarize

Passa dall'uno all'altro con una sola riga

Entrambi gli id sono presenti in ogni scheda qui sotto — la coppia di righe evidenziata è l'unica modifica. Stesso endpoint, stessa chiave, stessa struttura della richiesta.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    # model="gpt-4o-transcribe-diarize",  # decommenta questa riga, commenta quella sopra
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Ottieni una chiave API →

FAQ

Qual è più economico, GPT-4o Transcribe o GPT-4o Transcribe Diarize?

GPT-4o Transcribe è più economico per input audio / 1m token ($6 contro $6.25, 1.0× di differenza). Altre righe potrebbero indicare il contrario — la tabella sopra riporta la scheda completa, e il costo reale dipende dal tuo mix.

Posso fare un A/B test di GPT-4o Transcribe contro GPT-4o Transcribe Diarize senza due integrazioni?

Sì. Entrambi sono serviti tramite lo stesso endpoint compatibile con OpenAI con una singola chiave API — il passaggio richiede la modifica della stringa del modello in una sola riga, quindi puoi instradare una frazione del traffico verso ciascuno e confrontare direttamente le fatture.

GPT-4o Transcribe e GPT-4o Transcribe Diarize supportano la diarizzazione dei parlanti?

La tabella delle funzionalità sopra risponde a questa domanda per ogni modello, direttamente dalla documentazione di ciascun fornitore — diarizzazione, streaming e timestamp sono elencati separatamente perché i modelli differiscono su tutti e tre.

Confronti correlati

Dai nostri studi misurati