API di trascrizione vocale: 14 modelli, da $0.002 a $0.016 al minuto
Indice
Un’API di trascrizione vocale costa da $0.002 a $0.016 al minuto secondo i prezzi di listino. È una differenza di 8 volte per un servizio che, almeno in apparenza, svolge lo stesso compito. Inoltre, la fascia più economica non è quella indicata dalla maggior parte dei confronti. Il nostro gateway espone 14 modelli di trascrizione: dalla famiglia gpt-4o di OpenAI, fatturata a token, fino ai modelli ASR cinesi di ByteDance e Alibaba, sistematicamente esclusi dalle analisi internazionali. Questa pagina offre una panoramica della categoria: spiega i diversi criteri di fatturazione, riporta il costo al minuto di ogni modello e aiuta a scegliere in base allo scenario anziché al brand.
TL;DR
- I prezzi di listino al minuto dei 14 modelli vanno da $0.002 (seed-asr, paraformer, fun-asr-realtime) a $0.016 (Chirp di Google), con una differenza di 8 volte.
- I modelli di trascrizione gpt-4o di OpenAI vengono fatturati a token, non al minuto. Sui file audio misurati da noi, il costo equivalente è stato di circa $0.0031/min per mini e $0.0062/min per il modello completo.
- La fascia più economica è quella dei modelli ASR cinesi: seed-asr di ByteDance e le famiglie paraformer, fun-asr e qwen3 di Alibaba costano tutte $0.002-$0.0021/min e includono varianti streaming.
- Con audio pulito, l’accuratezza non fa la differenza: nel nostro test su sette modelli, tutti quelli compatibili con la lingua hanno ottenuto un tasso di errore di circa lo 0% per inglese, spagnolo e francese.
Quanto costa un’API di trascrizione vocale nel 2026?
Per rispondere correttamente serve una tabella, perché il criterio di fatturazione conta quanto la tariffa. I modelli con prezzo al minuto addebitano la durata indipendentemente dal contenuto. Quelli fatturati a token ricampionano l’audio e addebitano i token di input e output. Il costo equivalente al minuto varia quindi leggermente in base alla densità del parlato:
| Modello | Provider | Fatturazione | Prezzo di listino | Streaming |
|---|---|---|---|---|
| seed-asr-bigmodel | ByteDance | al minuto | $0.002/min | no |
| paraformer-realtime-v2 | Alibaba | al minuto | $0.002/min | sì |
| qwen3-asr-flash-realtime | Alibaba | al minuto | $0.002/min | sì |
| fun-asr-realtime | Alibaba | al minuto | $0.002/min | sì |
| fun-asr | Alibaba | al minuto | $0.0021/min | no |
| fun-asr-flash | Alibaba | al minuto | $0.0021/min | no |
| fun-asr-mtl | Alibaba | al minuto | $0.0021/min | no |
| qwen3-asr-flash | Alibaba | al minuto | $0.0021/min | no |
| gpt-4o-mini-transcribe | OpenAI | a token | ≈$0.0031/min misurati | token per token |
| whisper-1 | OpenAI | al minuto | $0.006/min | no |
| gpt-4o-transcribe | OpenAI | a token | ≈$0.0062/min misurati | token per token |
| gpt-4o-transcribe-diarize | OpenAI | a token | tariffe a token | token per token |
| chirp-2 | al minuto | $0.016/min | no | |
| chirp-3 | al minuto | $0.016/min | no |
I prezzi di listino aggiornati sono disponibili nella pagina di ogni modello. I due valori ≈$/min dei modelli gpt-4o corrispondono agli addebiti effettivi rilevati tramite il gateway usando il nostro audio di test multilingue, come descritto nello studio comparativo su sette modelli di trascrizione. I modelli batch della tabella sono accessibili con un’unica API key tramite lo stesso endpoint OpenAI-compatible /v1/audio/transcriptions; abbiamo verificato che questo vale anche per il modello diarize. Le varianti -realtime sono modelli streaming con un’interfaccia dedicata, documentata nella pagina di ciascun modello.
Come si converte la fatturazione a token in un costo al minuto?
Nella trascrizione fatturata a token, il costo dipende dalla quantità di parlato e non dalle dimensioni del file. In pratica, questi modelli si collocano a metà della fascia di prezzo. Prima della tokenizzazione, i modelli di trascrizione gpt-4o ricampionano l’audio. Un MP3 pesante a 320 kbps e un WAV leggero a 16 kHz contenenti le stesse parole costano quindi più o meno uguale. Comprimere i file riduce lo spazio occupato, non il costo della trascrizione. Con un parlato a velocità normale, abbiamo misurato circa $0.0031/min per gpt-4o-mini-transcribe e $0.0062/min per gpt-4o-transcribe. Con audio più denso o più silenzioso, i valori possono variare leggermente in entrambe le direzioni. Se il budget richiede un tetto massimo preciso per ogni ora di audio, un modello fatturato al minuto lo garantisce; con un modello a token si può fare solo una previsione.
Cos’è la fascia ASR cinese e perché manca nella maggior parte dei confronti?
La fascia più economica della tabella, nonché quella con più modelli streaming, è composta dai modelli ASR cinesi. Gran parte delle analisi in lingua inglese non li mette nemmeno alla prova. seed-asr-bigmodel di ByteDance è in assoluto il più economico, con un prezzo di $0.002/min. Alibaba propone tre famiglie: paraformer, progettata soprattutto per lo streaming; fun-asr, con varianti batch, flash, multilingue mtl e realtime; e qwen3-asr, nelle versioni flash e flash-realtime. Tutte costano $0.002-$0.0021/min, un terzo della tariffa di whisper-1 e un ottavo di quella di Chirp.
Le nostre misurazioni evidenziano due limiti da considerare. Primo, seed-asr richiede di specificare in anticipo la lingua dell’audio. È la scelta migliore quando la lingua è nota, mentre qwen3-asr-flash, a $0.0021, è il modello più economico ad aver rilevato automaticamente tutte le lingue del nostro test. Secondo, un prezzo basso non implica tempi lunghi: sui nostri clip, qwen3-asr-flash ha restituito il risultato in circa 3 secondi, un tempo paragonabile a quello dei modelli OpenAI. Per carichi di lavoro prevalentemente in mandarino, questa fascia non offre soltanto prezzi inferiori: è anche quella sviluppata per il mercato e la lingua di riferimento.
Quale modello scegliere per il proprio carico di lavoro?
Conviene scegliere prima in base al criterio di fatturazione e alla necessità di streaming. Con audio pulito, l’accuratezza non distingue questi modelli. Ecco una selezione per scenario:
| Scenario | Scelta | Motivo |
|---|---|---|
| Trascrizione batch, lingua nota | seed-asr-bigmodel | prezzo minimo di $0.002/min; richiede di indicare la lingua |
| Batch, lingue miste o sconosciute | qwen3-asr-flash | rilevamento automatico più economico, latenza di ~3s |
| Sottotitoli live / dettatura | paraformer-realtime-v2 o qwen3-asr-flash-realtime | streaming al prezzo minimo di $0.002 |
| Streaming di testo parziale tramite interfaccia OpenAI | gpt-4o-mini-transcribe | output token per token, ≈$0.0031/min |
| Identificazione dei parlanti | gpt-4o-transcribe-diarize | l’unico modello dell’elenco con diarizzazione |
| Sostituzione diretta di whisper | whisper-1 | riferimento per la compatibilità a $0.006/min |
Se invece della trascrizione serve una conversazione vocale bidirezionale, si tratta di un prodotto diverso con costi diversi. Per i prezzi speech-to-speech, consulta il nostro studio sui prezzi di GPT Realtime.
FAQ
Quanto costa l’API Whisper?
Il prezzo di listino di whisper-1 è $0.006 per minuto di audio, calcolato unicamente sulla durata. Un file di un’ora costa $0.36 indipendentemente da formato e bitrate. Inviare più volte lo stesso contenuto non riduce il prezzo: abbiamo inviato lo stesso clip cinque volte e pagato sempre lo stesso importo. Oggi metà dei modelli nella tabella costa meno. La fascia ASR cinese, a $0.002-$0.0021/min, costa un terzo rispetto a whisper, mentre per gpt-4o-mini-transcribe abbiamo misurato circa la metà.
Un modello di trascrizione vocale più costoso è più accurato?
Non con audio pulito. Nel nostro test su sette modelli, tutti quelli compatibili con la lingua hanno ottenuto un tasso di errore di circa lo 0% su inglese, spagnolo e francese. Le differenze rilevanti riguardano costo, streaming, lingue supportate e funzionalità come la diarizzazione. Con audio difficile, ad esempio in presenza di accenti, rumore o code-switching, è necessario eseguire un test sui propri campioni. Lo studio sulla trascrizione mostra dove sono emersi i primi problemi, che nel nostro test hanno riguardato mandarino e hindi.
Quali API di trascrizione vocale supportano lo streaming?
Esistono due modalità. I modelli di trascrizione gpt-4o inviano il testo token per token tramite un’interfaccia conforme all’API OpenAI. La famiglia realtime di Alibaba, composta da paraformer-realtime-v2, qwen3-asr-flash-realtime e fun-asr-realtime, offre lo streaming con tariffe al minuto a partire da $0.002/min. whisper-1, seed-asr e i modelli Chirp restituiscono solo la trascrizione completa.
Tutti e 14 i modelli sono disponibili dietro lo stesso endpoint del gateway, con fatturazione unificata. I prezzi di listino aggiornati sono riportati nella pagina dei modelli, mentre il confronto sui costi di trascrizione contiene le misurazioni su sette modelli, inclusi latenza e accuratezza.