Costo delle API di trascrizione: 7 modelli sullo stesso audio
Indice
Synthorai ora supporta la trascrizione audio, con sette modelli speech-to-text dedicati dietro un unico endpoint compatibile con OpenAI.
Dietro quell’unico endpoint c’è parecchio lavoro, perché le interfacce native di questi modelli hanno ben poco in comune. whisper-1 accetta l’upload multipart di un file e restituisce {text}. gpt-4o-transcribe usa lo stesso tipo di upload, ma aggiunge il consumo di token. seed-asr di ByteDance usa il protocollo BytePlus AUC, qwen3-asr-flash di Alibaba ne ha uno proprio e i modelli chirp di Google sono recognizer Cloud Speech-to-Text accessibili tramite OAuth.
Endpoint, autenticazione e formati di risposta diversi: senza gateway, ogni modello richiede un’integrazione aggiuntiva. Con il gateway basta una chiamata compatibile con OpenAI. Puoi sostituire gpt-4o-mini-transcribe con seed-asr-bigmodel o chirp-3 senza modificare altro nel codice.
TL;DR
- Il costo della trascrizione varia di 8x tra i sette modelli dedicati:
seed-asr-bigmodelcosta $0.0020 per minuto di audio, mentre i modellichirpcostano $0.0164 (misurazione del 2026-06-25). seed-asrnon rileva automaticamente la lingua: selanguagenon è impostato, l’audio in lingue diverse da inglese e cinese restituisce HTTP 200 con testo vuoto o romanizzato, ma viene comunque fatturato.- A $0.0021 al minuto,
qwen3-asr-flashè il modello più economico che rileva automaticamente tutte le lingue testate. - Solo i modelli di trascrizione
gpt-4osupportano lo streaming token per token; quelli fatturati al minuto funzionano solo in batch. - Tutti i modelli hanno ottenuto un tasso di errore vicino allo 0% su parlato pulito in inglese, spagnolo e francese: l’accuratezza non è il criterio su cui scegliere.
La chiamata usa l’endpoint di trascrizione compatibile con OpenAI, quindi puoi adottarlo senza modifiche se usi già Whisper:
curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 \
-F model=gpt-4o-mini-transcribe
from openai import OpenAI
client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
with open("meeting.mp3", "rb") as f:
result = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe", file=f)
print(result.text)
La trascrizione viene restituita in text, mentre il costo addebitato si trova nell’header di risposta x-total-cost-usd.
Abbiamo sottoposto tutti e sette i modelli allo stesso test semplice. La natura del test determina come interpretare tutti i numeri riportati di seguito.
Cosa misura questo test e cosa no
Abbiamo generato brani di vita quotidiana senza nomi propri, su temi come la mattina, il meteo e una visita al mercato, usando una voce text-to-speech standard per ciascuna delle cinque lingue più parlate al mondo. Abbiamo poi trascritto ogni clip con tutti e sette i modelli. Le clip durano circa 12-15 secondi e contengono all’incirca 40 parole pronunciate a velocità normale, senza lunghe pause. Il formato è WAV PCM mono a 16 bit e 16 kHz (256 kbps, circa 2 MB al minuto). Il testo costituisce il ground truth e le durate sono esatte.
È un test volutamente semplice: audio pulito, preparato in anticipo, con un solo speaker, senza accenti, rumore o gergo specialistico. Proprio per questo è adatto a misurare gli aspetti che non dipendono dalla difficoltà dell’audio: costo, latenza, lingue accettate dal modello e supporto dello streaming. Questi sono dati stabili.
Non è un benchmark di qualità. Registrazioni reali con accenti, rumore di fondo, terminologia di settore, speaker sovrapposti e un’ora di durata mettono in evidenza differenze che il parlato pulito non può mostrare. I risultati qui riportati non permettono di prevederle. I valori di accuratezza vanno letti come verifica della soglia minima, non come classifica. Costi, copertura linguistica e supporto dello streaming sono invece una baseline affidabile.
ASR dedicato, non multimodale
Tutti e sette sono sistemi speech-to-text dedicati: whisper-1, gpt-4o-transcribe e gpt-4o-mini-transcribe di OpenAI; seed-asr-bigmodel di ByteDance; qwen3-asr-flash di Alibaba; chirp-2 e chirp-3 di Google.
Il gateway può anche indirizzare l’endpoint di trascrizione verso un modello multimodale generico come Gemini, che produce una trascrizione come effetto secondario della comprensione dell’audio. Non abbiamo incluso questi modelli e non li useremmo per la trascrizione. Anche Google fa la stessa distinzione nella propria offerta: la guida audio di Gemini presenta il modello come strumento per descrivere, riassumere o rispondere a domande sull’audio, poi rimanda altrove per ottenere la trascrizione vera e propria. Per i modelli speech-to-text dedicati con supporto alla trascrizione in tempo reale, indica Google Cloud Speech-to-Text API, cioè i modelli Chirp. Un modello multimodale può generare una trascrizione, ma è progettato per comprendere l’audio, non per riportare fedelmente ogni parola pronunciata. Inoltre viene chiamato tramite generateContent, in stile chat, anziché tramite un’API di trascrizione. Per una trascrizione verbatim serve un modello dedicato, e lo confermano anche i vendor che offrono entrambe le soluzioni.
L’audio può essere inviato in tre modi:
- File in input, risultato batch in output: si carica una registrazione completa e si riceve l’intera trascrizione in un’unica risposta. Tutti i modelli supportano questa modalità.
- File in input, testo in streaming in output: si carica lo stesso file, ma la trascrizione viene restituita progressivamente tramite SSE. Alcuni modelli la supportano, altri funzionano solo in batch.
- Stream audio in input, stream di testo in output: riconoscimento in tempo reale da un microfono o da una chiamata live. È in fase di sviluppo e non è ancora disponibile, quindi tutti i risultati seguenti riguardano le prime due modalità.
Come viene fatturata la trascrizione
Esistono due modalità di fatturazione. Per minuto di audio (whisper-1, seed-asr, qwen3-asr-flash e i modelli Chirp): si paga la durata effettiva della registrazione, indipendentemente dal contenuto. Per token (i modelli gpt-4o): l’audio viene tokenizzato a un ritmo costante e si pagano i token di input insieme a quelli della trascrizione in output. Di conseguenza, il silenzio costa meno del parlato continuo.
La fatturazione per token nasconde un’insidia: la tariffa di input pubblicata si riferisce al testo, mentre l’audio ha un costo maggiore (gpt-4o-mini-transcribe indica $1.25/M per l’input, ma fattura l’audio a $3/M). Una stima basata sulla tariffa testuale risulta quindi troppo bassa. Il gateway restituisce l’addebito effettivo nell’header x-total-cost-usd: è meglio leggere quel valore anziché stimarlo dalla pagina dei prezzi.
Costo
Il test misura il costo in modo preciso, ed è anche la metrica con la variazione maggiore. Ecco il costo al minuto ricavato dall’header di fatturazione. Le tariffe correnti di tutti i modelli disponibili tramite il gateway sono riportate nella pagina dei modelli:
| Modello | Costo / min | Latenza | Streaming |
|---|---|---|---|
seed-asr-bigmodel | $0.0020 | ≈10s | no |
qwen3-asr-flash | $0.0021 | ≈3s | no |
gpt-4o-mini-transcribe | $0.0031 | ≈3s | token per token |
whisper-1 | $0.0060 | ≈4s | no |
gpt-4o-transcribe | $0.0062 | ≈2s | token per token |
chirp-2 | $0.0164 | ≈3s | no |
chirp-3 | $0.0164 | ≈4s | no |
La differenza è di circa 8x: da $0.0020 al minuto per seed-asr a $0.0164 per i modelli Chirp. Il modello più economico, seed-asr, richiede che la lingua dell’audio venga specificata, come vedremo più avanti. È quindi la scelta migliore quando la lingua è nota in anticipo. Per audio multilingue o in una lingua sconosciuta, l’opzione più economica che non richiede configurazione è qwen3-asr-flash a $0.0021. I modelli Chirp sono nettamente i più costosi. Se devi usare Chirp, conviene scegliere chirp-3: ha lo stesso prezzo e prestazioni simili a chirp-2, ma trascrive molto meglio il mandarino, come mostra la tabella sull’accuratezza.
Il modo in cui questi valori cambiano con i tuoi file dipende dal tipo di fatturazione. I modelli a consumo temporale (whisper-1, seed-asr, qwen3-asr-flash e i Chirp) addebitano solo in base alla durata. La tariffa è quindi direttamente applicabile: dieci minuti di audio costano dieci volte il prezzo al minuto, a prescindere da formato e contenuto.
Nei modelli fatturati per token, cioè le righe gpt-4o, il costo di input cresce con la durata e non con la dimensione del file, perché il provider ricampiona l’audio prima di tokenizzarlo. Un MP3 pesante a 320 kbps e il nostro WAV leggero a 16 kHz, se contengono le stesse parole, producono all’incirca lo stesso costo in token. Comprimere i file riduce quindi lo spazio occupato, non la spesa per la trascrizione. La quantità di parlato effettivo incide invece sulla fattura per token: le nostre clip hanno un ritmo normale e non contengono silenzi, quindi un audio più denso o più silenzioso comporta un costo leggermente maggiore o minore per i token di output. In ogni caso, il valore definitivo è quello dell’header x-total-cost-usd.
Accuratezza e copertura linguistica
Per inglese, spagnolo e francese, ogni modello che supporta la lingua ha ottenuto un tasso di errore vicino allo 0%. È la soglia minima e tutti la superano. Anche in un test così semplice iniziano a emergere problemi con mandarino e hindi. Questi dati servono a capire su quali lingue concentrare i test interni, non a stabilire una classifica:
| Modello | Mandarino (CER) | Hindi (WER) | Copertura |
|---|---|---|---|
seed-asr-bigmodel | 0% | 9% | tutte e cinque (parametro language obbligatorio) |
qwen3-asr-flash | 0% | 15% | tutte e cinque |
gpt-4o-mini-transcribe | 0% | 4% | tutte e cinque |
whisper-1 | 0% | 22% | tutte e cinque |
gpt-4o-transcribe | 0% | 13% | tutte e cinque |
chirp-2 | 16% | 15% | tutte e cinque |
chirp-3 | 2% | 15% | tutte e cinque |
Il dato più rilevante non riguarda la copertura, ma il rilevamento automatico. seed-asr ha trascritto tutte e cinque le lingue quando abbiamo passato il parametro language, oltre a giapponese, tedesco, italiano e coreano in un test successivo. Non è però in grado di rilevare la lingua da solo: se language non è impostato, qualsiasi lingua diversa da inglese o cinese produce una stringa vuota o testo romanizzato senza senso, con stato 200 e nessun errore. Gli altri sei modelli rilevano automaticamente la lingua. Questo errore silenzioso è il risultato più importante: un modello che segnala chiaramente l’errore è scomodo, uno che fallisce senza avvertire causa un incidente in produzione.
La variabilità sull’hindi e il problema sul mandarino, con chirp-2 al 16% e chirp-3 che lo corregge, indicano che questi modelli vanno provati sulle lingue più difficili prima di considerarli affidabili. Non dimostrano che uno sia migliore dell’altro. I valori assoluti sono influenzati dalla voce sintetica e dal metodo di scoring, e variano tra un’esecuzione e l’altra. La conclusione corretta è che, sul parlato pulito nelle lingue principali, l’accuratezza non distingue questi modelli. Questo test non può quindi suggerire una scelta in base a quel criterio.
Output in streaming
Il supporto dello streaming è una funzionalità, non un indicatore di qualità, e divide nettamente i modelli. Quelli fatturati al minuto (whisper-1, seed-asr, qwen3-asr-flash ed entrambi i Chirp) funzionano solo in batch; se si richiede lo streaming, il gateway restituisce 400. I modelli gpt-4o inviano invece la trascrizione token per token: gpt-4o-transcribe restituisce le prime parole in circa un secondo e completa progressivamente il resto, come richiesto da un’interfaccia che deve sembrare live. Il costo non cambia rispetto alla modalità batch. Per abilitare lo streaming, aggiungi stream=true:
curl -N https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 -F model=gpt-4o-transcribe -F stream=true
# data: {"type":"transcript.text.delta","delta":"When"}
# data: {"type":"transcript.text.delta","delta":" you"} ...
Caching
Per questi modelli il caching è di fatto assente. Quelli fatturati al minuto addebitano in base alla durata, quindi ripetere la stessa richiesta non genera sconti: abbiamo inviato la stessa clip a whisper-1 cinque volte e pagato sempre $0.015478. I modelli gpt-4o, fatturati per token, non indicano una tariffa di cache e nelle richieste ripetute hanno mostrato soltanto le normali variazioni tra un’esecuzione e l’altra. Per pianificare i costi va quindi usata la tariffa al minuto: inviare di nuovo lo stesso file non costa meno.
Cosa verificare subito e cosa testare in proprio
Questo test non può dirti quale modello sia più accurato sulle tue registrazioni. Può però indicare i criteri con cui restringere la scelta prima di eseguire una valutazione interna:
- Lingue. Verifica che il modello supporti tutte le lingue necessarie e che sappia rilevarle autonomamente.
seed-asrha gestito ogni lingua provata, ma solo passando esplicitamente il parametrolanguage; senza, l’audio in lingue diverse da inglese e cinese fallisce senza segnalarlo. Gli altri sei rilevano automaticamente la lingua e costituiscono quindi una scelta predefinita più sicura per audio multilingue o in una lingua sconosciuta. - Streaming. Se serve una trascrizione live, solo i modelli
gpt-4osupportano lo streaming token per token; quelli fatturati al minuto funzionano esclusivamente in batch. - Costo. La differenza è di circa 8x. Il modello più economico che copre tutte le lingue è
qwen3-asr-flasha $0.0021; i Chirp sono i più costosi echirp-3è l’unico motivo per preferire Chirp ai modelli meno cari. Non c’è caching su cui fare affidamento, quindi il costo effettivo resta quello al minuto. - Tipo di modello. Usa un modello speech-to-text dedicato, non un modello multimodale generico. È lo strumento adatto alla trascrizione verbatim e lo confermano anche i vendor che offrono entrambe le categorie.
Dopo aver filtrato i modelli in base a questi criteri, resta una sola domanda: quale sia il più accurato sul tuo audio, con i suoi accenti, rumori e termini specifici. È una verifica che devi fare direttamente. Nessun benchmark su parlato pulito può sostituire un test dei modelli rimasti sulle registrazioni reali.
Conclusioni
Sul parlato pulito e preparato in anticipo nelle lingue principali, tutti e sette i modelli hanno un’accuratezza simile. È il risultato più utile del test: l’accuratezza non è il criterio su cui scegliere. Le differenze concrete sono altrove: il costo varia di circa 8x, un modello copre solo due lingue senza configurazione esplicita e quelli fatturati al minuto non supportano lo streaming. Usa questi dati per restringere il campo, non per proclamare un vincitore, poi prova i due o tre modelli rimasti sul tuo audio. Per la trascrizione scegli inoltre un modello speech-to-text dedicato anziché uno multimodale generico, come raccomandano gli stessi vendor che sviluppano entrambe le soluzioni.
Fonti
- OpenAI: guida allo speech-to-text
- OpenAI: prezzi delle API
- Google: comprensione dell’audio con Gemini API (per la trascrizione dedicata, usare Cloud Speech-to-Text)
- Google Cloud: modello di trascrizione Chirp 3
- BytePlus: panoramica di Seed-ASR (ByteDance)
Costi e latenze misurati su Synthorai il 2026-06-25 con sette modelli di trascrizione dedicati e cinque lingue (inglese, mandarino, hindi, spagnolo e francese), usando l’header x-total-cost-usd e i tempi SSE. Le righe relative alle lingue di seed-asr riflettono una nuova misurazione eseguita il 2026-07-04 con il parametro language impostato. L’audio è stato generato tramite text-to-speech ed era volutamente semplice, quindi i valori di accuratezza rappresentano una verifica della soglia minima e non un benchmark di qualità; il parlato reale con accenti e rumore metterebbe in evidenza differenze diverse tra i modelli. La latenza varia tra un’esecuzione e l’altra. I prezzi indicati sono le tariffe della piattaforma a quella data. Verifica i prezzi correnti prima di farvi affidamento.