🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.
API di trascrizione vocale: 14 modelli, da $0.002 a $0.016 al minuto

API di trascrizione vocale: 14 modelli, da $0.002 a $0.016 al minuto

Indice
  1. Quanto costa un’API di trascrizione vocale nel 2026?
  2. Come si converte la fatturazione a token in un costo al minuto?
  3. Cos’è la fascia ASR cinese e perché manca nella maggior parte dei confronti?
  4. Quale modello scegliere per il proprio carico di lavoro?
  5. FAQ

Un’API di trascrizione vocale costa da $0.002 a $0.016 al minuto secondo i prezzi di listino. È una differenza di 8 volte per un servizio che, almeno in apparenza, svolge lo stesso compito. Inoltre, la fascia più economica non è quella indicata dalla maggior parte dei confronti. Il nostro gateway espone 14 modelli di trascrizione: dalla famiglia gpt-4o di OpenAI, fatturata a token, fino ai modelli ASR cinesi di ByteDance e Alibaba, sistematicamente esclusi dalle analisi internazionali. Questa pagina offre una panoramica della categoria: spiega i diversi criteri di fatturazione, riporta il costo al minuto di ogni modello e aiuta a scegliere in base allo scenario anziché al brand.

TL;DR

  • I prezzi di listino al minuto dei 14 modelli vanno da $0.002 (seed-asr, paraformer, fun-asr-realtime) a $0.016 (Chirp di Google), con una differenza di 8 volte.
  • I modelli di trascrizione gpt-4o di OpenAI vengono fatturati a token, non al minuto. Sui file audio misurati da noi, il costo equivalente è stato di circa $0.0031/min per mini e $0.0062/min per il modello completo.
  • La fascia più economica è quella dei modelli ASR cinesi: seed-asr di ByteDance e le famiglie paraformer, fun-asr e qwen3 di Alibaba costano tutte $0.002-$0.0021/min e includono varianti streaming.
  • Con audio pulito, l’accuratezza non fa la differenza: nel nostro test su sette modelli, tutti quelli compatibili con la lingua hanno ottenuto un tasso di errore di circa lo 0% per inglese, spagnolo e francese.

Quanto costa un’API di trascrizione vocale nel 2026?

Per rispondere correttamente serve una tabella, perché il criterio di fatturazione conta quanto la tariffa. I modelli con prezzo al minuto addebitano la durata indipendentemente dal contenuto. Quelli fatturati a token ricampionano l’audio e addebitano i token di input e output. Il costo equivalente al minuto varia quindi leggermente in base alla densità del parlato:

ModelloProviderFatturazionePrezzo di listinoStreaming
seed-asr-bigmodelByteDanceal minuto$0.002/minno
paraformer-realtime-v2Alibabaal minuto$0.002/min
qwen3-asr-flash-realtimeAlibabaal minuto$0.002/min
fun-asr-realtimeAlibabaal minuto$0.002/min
fun-asrAlibabaal minuto$0.0021/minno
fun-asr-flashAlibabaal minuto$0.0021/minno
fun-asr-mtlAlibabaal minuto$0.0021/minno
qwen3-asr-flashAlibabaal minuto$0.0021/minno
gpt-4o-mini-transcribeOpenAIa token≈$0.0031/min misuratitoken per token
whisper-1OpenAIal minuto$0.006/minno
gpt-4o-transcribeOpenAIa token≈$0.0062/min misuratitoken per token
gpt-4o-transcribe-diarizeOpenAIa tokentariffe a tokentoken per token
chirp-2Googleal minuto$0.016/minno
chirp-3Googleal minuto$0.016/minno

I prezzi di listino aggiornati sono disponibili nella pagina di ogni modello. I due valori ≈$/min dei modelli gpt-4o corrispondono agli addebiti effettivi rilevati tramite il gateway usando il nostro audio di test multilingue, come descritto nello studio comparativo su sette modelli di trascrizione. I modelli batch della tabella sono accessibili con un’unica API key tramite lo stesso endpoint OpenAI-compatible /v1/audio/transcriptions; abbiamo verificato che questo vale anche per il modello diarize. Le varianti -realtime sono modelli streaming con un’interfaccia dedicata, documentata nella pagina di ciascun modello.

Come si converte la fatturazione a token in un costo al minuto?

Nella trascrizione fatturata a token, il costo dipende dalla quantità di parlato e non dalle dimensioni del file. In pratica, questi modelli si collocano a metà della fascia di prezzo. Prima della tokenizzazione, i modelli di trascrizione gpt-4o ricampionano l’audio. Un MP3 pesante a 320 kbps e un WAV leggero a 16 kHz contenenti le stesse parole costano quindi più o meno uguale. Comprimere i file riduce lo spazio occupato, non il costo della trascrizione. Con un parlato a velocità normale, abbiamo misurato circa $0.0031/min per gpt-4o-mini-transcribe e $0.0062/min per gpt-4o-transcribe. Con audio più denso o più silenzioso, i valori possono variare leggermente in entrambe le direzioni. Se il budget richiede un tetto massimo preciso per ogni ora di audio, un modello fatturato al minuto lo garantisce; con un modello a token si può fare solo una previsione.

Cos’è la fascia ASR cinese e perché manca nella maggior parte dei confronti?

La fascia più economica della tabella, nonché quella con più modelli streaming, è composta dai modelli ASR cinesi. Gran parte delle analisi in lingua inglese non li mette nemmeno alla prova. seed-asr-bigmodel di ByteDance è in assoluto il più economico, con un prezzo di $0.002/min. Alibaba propone tre famiglie: paraformer, progettata soprattutto per lo streaming; fun-asr, con varianti batch, flash, multilingue mtl e realtime; e qwen3-asr, nelle versioni flash e flash-realtime. Tutte costano $0.002-$0.0021/min, un terzo della tariffa di whisper-1 e un ottavo di quella di Chirp.

Le nostre misurazioni evidenziano due limiti da considerare. Primo, seed-asr richiede di specificare in anticipo la lingua dell’audio. È la scelta migliore quando la lingua è nota, mentre qwen3-asr-flash, a $0.0021, è il modello più economico ad aver rilevato automaticamente tutte le lingue del nostro test. Secondo, un prezzo basso non implica tempi lunghi: sui nostri clip, qwen3-asr-flash ha restituito il risultato in circa 3 secondi, un tempo paragonabile a quello dei modelli OpenAI. Per carichi di lavoro prevalentemente in mandarino, questa fascia non offre soltanto prezzi inferiori: è anche quella sviluppata per il mercato e la lingua di riferimento.

Quale modello scegliere per il proprio carico di lavoro?

Conviene scegliere prima in base al criterio di fatturazione e alla necessità di streaming. Con audio pulito, l’accuratezza non distingue questi modelli. Ecco una selezione per scenario:

ScenarioSceltaMotivo
Trascrizione batch, lingua notaseed-asr-bigmodelprezzo minimo di $0.002/min; richiede di indicare la lingua
Batch, lingue miste o sconosciuteqwen3-asr-flashrilevamento automatico più economico, latenza di ~3s
Sottotitoli live / dettaturaparaformer-realtime-v2 o qwen3-asr-flash-realtimestreaming al prezzo minimo di $0.002
Streaming di testo parziale tramite interfaccia OpenAIgpt-4o-mini-transcribeoutput token per token, ≈$0.0031/min
Identificazione dei parlantigpt-4o-transcribe-diarizel’unico modello dell’elenco con diarizzazione
Sostituzione diretta di whisperwhisper-1riferimento per la compatibilità a $0.006/min

Se invece della trascrizione serve una conversazione vocale bidirezionale, si tratta di un prodotto diverso con costi diversi. Per i prezzi speech-to-speech, consulta il nostro studio sui prezzi di GPT Realtime.

FAQ

Quanto costa l’API Whisper?

Il prezzo di listino di whisper-1 è $0.006 per minuto di audio, calcolato unicamente sulla durata. Un file di un’ora costa $0.36 indipendentemente da formato e bitrate. Inviare più volte lo stesso contenuto non riduce il prezzo: abbiamo inviato lo stesso clip cinque volte e pagato sempre lo stesso importo. Oggi metà dei modelli nella tabella costa meno. La fascia ASR cinese, a $0.002-$0.0021/min, costa un terzo rispetto a whisper, mentre per gpt-4o-mini-transcribe abbiamo misurato circa la metà.

Un modello di trascrizione vocale più costoso è più accurato?

Non con audio pulito. Nel nostro test su sette modelli, tutti quelli compatibili con la lingua hanno ottenuto un tasso di errore di circa lo 0% su inglese, spagnolo e francese. Le differenze rilevanti riguardano costo, streaming, lingue supportate e funzionalità come la diarizzazione. Con audio difficile, ad esempio in presenza di accenti, rumore o code-switching, è necessario eseguire un test sui propri campioni. Lo studio sulla trascrizione mostra dove sono emersi i primi problemi, che nel nostro test hanno riguardato mandarino e hindi.

Quali API di trascrizione vocale supportano lo streaming?

Esistono due modalità. I modelli di trascrizione gpt-4o inviano il testo token per token tramite un’interfaccia conforme all’API OpenAI. La famiglia realtime di Alibaba, composta da paraformer-realtime-v2, qwen3-asr-flash-realtime e fun-asr-realtime, offre lo streaming con tariffe al minuto a partire da $0.002/min. whisper-1, seed-asr e i modelli Chirp restituiscono solo la trascrizione completa.

Tutti e 14 i modelli sono disponibili dietro lo stesso endpoint del gateway, con fatturazione unificata. I prezzi di listino aggiornati sono riportati nella pagina dei modelli, mentre il confronto sui costi di trascrizione contiene le misurazioni su sette modelli, inclusi latenza e accuratezza.

← Torna al blog