Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Qwen3-ASR Flash

Rilasciato 2025-09-08

transcription

Qwen3-ASR Flash è il modello di riconoscimento vocale della linea Qwen3, che trascrive file audio fino a 10 MB e cinque minuti con risultati intermedi in streaming per un feedback sul progresso in tempo reale.

Input
audio
Output
testo
Prezzo
$0.0021/min

Il prezzo nel contesto

Posizione del prezzo tra 11 modelli comparabili

Al minuto$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Audio

Lingue 26 lingue, un unico elenco condiviso da tutti i modelli Qwen-ASR: cinese (mandarino, sichuanese, hokkien, wu, cantonese), inglese, giapponese, tedesco, coreano, russo, francese, portoghese, arabo, italiano, spagnolo, hindi, indonesiano, thai, turco, ucraino, vietnamita, ceco, danese, filippino, finlandese, islandese, malese, norvegese, polacco, svedese
Limiti audio
  • Riconoscimento sincrono <=10MB / <=5 min, output in streaming o non in streaming
  • identificazione automatica della lingua su 26 lingue
  • iniezione di testo di contesto
  • riconoscimento del canto
  • nessuna diarizzazione
  • le risposte compatibili OpenAI non contengono campi di timestamp (per quelli usa qwen3-asr-flash-filetrans)
Diarizzazione No
Trascrizione in streaming
Timestamp No

Modello

Modalità audio → testo
  • Costruito sulla base Qwen3-Omni
  • il modello flash servito via API è proprietario (i Qwen3-ASR 0.6B/1.7B aperti sono modelli diversi)

fonte: documentazione ufficiale Alibaba ↗

Usa Qwen3-ASR Flash in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su Qwen3-ASR Flash

  • La documentazione ufficiale evidenzia il riconoscimento su circa trenta lingue, incluse cinque varianti cinesi (mandarino, sichuanese, hokkien, wu, cantonese), e una capacità che manca ai suoi simili Fun-ASR: il rilevamento dell'emozione accanto alla trascrizione.
  • La serie Qwen3-ASR è anche nota per il riconoscimento robusto del parlato mescolato con musica e canto.
  • L'etichettatura delle emozioni è sempre attiva e restituisce uno di sette stati (sorpreso, neutro, felice, triste, disgustato, arrabbiato o impaurito), e il rilevamento della lingua è automatico ogni volta che si lascia la lingua non impostata, anche per audio che mescola più lingue.
  • L'accuratezza sulla terminologia di dominio si guida in modo diverso rispetto alla famiglia Fun-ASR: invece di caricare liste di hotword, si inietta testo di contesto insieme alla richiesta, cosa che si adatta a un vocabolario che cambia da chiamata a chiamata.
  • I timestamp a livello di parola possono essere abilitati per un sottoinsieme documentato di lingue, e la normalizzazione inversa del testo è disponibile ma disattivata per impostazione predefinita.
  • L'audio è accettato in un ampio insieme di formati contenitore e codec, e il modello è raggiungibile sia tramite una rotta compatibile OpenAI sia tramite l'interfaccia sincrona di Alibaba.
  • La diarizzazione dei parlanti non è offerta e il tetto dei cinque minuti è rigido.
  • Alibaba instrada le registrazioni più lunghe verso un modello separato di trascrizione su file.
  • Synthorai lo eroga tramite il suo endpoint di trascrizione compatibile OpenAI.

FAQ

L'API di Qwen3-ASR Flash si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Qwen3-ASR Flash sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Qwen3-ASR Flash?

Rilevamento dell'emozione accanto alla trascrizione; circa trenta lingue, cinque varianti cinesi; robusto sul parlato mescolato con musica. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Qwen3-ASR Flash?

Su Synthorai, Qwen3-ASR Flash costa $0.0021 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.

Quali lingue supporta Qwen3-ASR Flash?

Qwen3-ASR Flash supporta 26 lingue, un unico elenco condiviso da tutti i modelli Qwen-ASR: cinese (mandarino, sichuanese, hokkien, wu, cantonese), inglese, giapponese, tedesco, coreano, russo, francese, portoghese, arabo, italiano, spagnolo, hindi, indonesiano, thai, turco, ucraino, vietnamita, ceco, danese, filippino, finlandese, islandese, malese, norvegese, polacco, svedese. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a Qwen3-ASR Flash?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3-asr-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →