Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT-4o Transcribe

Rilasciato 2025-03-20

transcription

GPT-4o Transcribe è un modello speech-to-text che usa GPT-4o per trascrivere l'audio ed è l'offerta di trascrizione premium di OpenAI.

Input
audio testo $2.5/M
Output
testo $10/M
Input audio
$6/M
Contesto
16K
Cutoff di conoscenza
2024-06

Benchmark

Sopra la mediasolo 1 confrontabili
GPT-4o Transcribe altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
WenetSpeech test-net (CER)
15.3%

Dati pubblicati dai fornitori: Alibaba (Qwen) ByteDance Google OpenAI

Il prezzo nel contesto

Posizione del prezzo tra 3 modelli comparabili

Input$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
Output$10/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Output massimo (specifica del vendor) 2.000
Cutoff di conoscenza 2024-06

Audio

Lingue 57 lingue elencate per l'endpoint di trascrizione (un unico elenco condiviso da tutti i modelli di trascrizione); codici ISO 639-1 / 639-3 accettati per i modelli basati su GPT-4o
Limiti audio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, fino a 25MB
  • trascrizione in streaming supportata (incl. le sessioni di trascrizione Realtime)
  • solo output json/text
  • nessun timestamp di parola né diarizzazione
Diarizzazione No
Trascrizione in streaming
Timestamp No

Modello

Modalità audio + testo → testo

fonte: documentazione ufficiale OpenAI ↗

Usa GPT-4o Transcribe in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su GPT-4o Transcribe

  • La pagina ufficiale gli attribuisce miglioramenti nel word error rate e un riconoscimento e un'accuratezza linguistica migliori rispetto ai modelli Whisper originali.
  • Le richieste portano una finestra di contesto da 16K token con fino a 2K token di output, e il modello è servito su endpoint di trascrizione e realtime.
  • Gli upload seguono i limiti condivisi della transcription API: mp3, mp4, mpeg, mpga, m4a, wav o webm, fino a 25MB per file, con le registrazioni più lunghe da suddividere lato client.
  • A differenza di Whisper accetta un prompt, che OpenAI descrive come un modo per migliorare la qualità della trascrizione dando al modello contesto aggiuntivo, allo stesso modo in cui si formula un prompt per qualsiasi altro modello GPT-4o, il che è utile per nomi, gergo e grafie di prodotto.
  • La trascrizione in streaming è supportata, così come le log probability per pipeline consapevoli della confidenza.
  • Due limiti danno forma alle integrazioni: l'output è disponibile solo come JSON o testo semplice, senza SRT, VTT o verbose JSON, e su questo modello non sono offerte granularità dei timestamp a livello di parola o di segmento.
  • La copertura linguistica segue l'elenco pubblicato dalla transcription API di più di settanta lingue, che OpenAI vincola a una soglia di word error rate anziché rivendicare un supporto universale, e il cutoff di conoscenza è giugno 2024.
  • OpenAI lo inquadra come la scelta a più alta accuratezza quando lo streaming non è la priorità.
  • Su Synthorai si inserisce senza modifiche nella rotta compatibile OpenAI /v1/audio/transcriptions.

FAQ

L'API di GPT-4o Transcribe si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare GPT-4o Transcribe sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle GPT-4o Transcribe?

Livello di trascrizione premium; miglior riconoscimento della lingua rispetto a Whisper originale; servito su endpoint di trascrizione e realtime. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa GPT-4o Transcribe?

Su Synthorai, GPT-4o Transcribe costa $2.5 per milione di token in input e $10 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

Quali lingue supporta GPT-4o Transcribe?

GPT-4o Transcribe supporta 57 lingue elencate per l'endpoint di trascrizione (un unico elenco condiviso da tutti i modelli di trascrizione); codici ISO 639-1 / 639-3 accettati per i modelli basati su GPT-4o. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a GPT-4o Transcribe?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gpt-4o-transcribe" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →