Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Qwen3-ASR Flash Realtime

Rilasciato 2025-10-27

transcription

Qwen3-ASR Flash Realtime è la controparte in streaming di Qwen3-ASR Flash: l'audio viene inviato su una connessione WebSocket e le trascrizioni tornano in continuo, con durata dello stream illimitata per le sessioni di lunga durata.

Input
audio
Output
testo
Prezzo
$0.002/min

Il prezzo nel contesto

Posizione del prezzo tra 11 modelli comparabili

Al minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Audio

Lingue 26 lingue, un unico elenco condiviso da tutti i modelli Qwen-ASR: cinese (mandarino, sichuanese, hokkien, wu, cantonese), inglese, giapponese, tedesco, coreano, russo, francese, portoghese, arabo, italiano, spagnolo, hindi, indonesiano, thai, turco, ucraino, vietnamita, ceco, danese, filippino, finlandese, islandese, malese, norvegese, polacco, svedese
Limiti audio
  • Streaming WebSocket in tempo reale (pcm/opus, 8/16 kHz), durata illimitata
  • turni VAD o manuali
  • riconoscimento delle emozioni a 7 classi sempre attivo
  • rilevamento automatico della lingua
Diarizzazione No
Trascrizione in streaming
Timestamp No

Modello

Modalità audio → testo

Nessun timestamp, hotword o diarizzazione su questa variante realtime.

fonte: documentazione ufficiale Alibaba ↗

Usa Qwen3-ASR Flash Realtime in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su Qwen3-ASR Flash Realtime

  • Mantiene le capacità di punta del modello a file, incluso il rilevamento dell'emozione accanto alla trascrizione e il riconoscimento su circa trenta lingue, dalle cinque varianti cinesi all'inglese, al giapponese, al coreano e a molte lingue europee e del Sud-est asiatico.
  • Si adatta ai sottotitoli dal vivo e alle applicazioni a interazione vocale.
  • Due differenze rispetto al fratello su file danno forma al modo in cui ci si costruisce sopra.
  • Primo, il turn-taking è configurabile in un modo che gli altri modelli in streaming non offrono: una modalità di rilevamento dell'attività vocale segmenta gli enunciati automaticamente usando una soglia di silenzio regolabile, mentre una modalità manuale affida i confini di frase al proprio client, che effettua il commit del buffer audio, con l'avvertenza documentata che i segmenti guidati manualmente devono restare entro circa un minuto di audio accumulato.
  • Secondo, la documentazione afferma chiaramente che questa variante al momento non restituisce timestamp, quindi se servono tempi a livello di parola o di frase è il modello offline quello a cui rivolgersi.
  • Il riconoscimento delle emozioni resta sempre attivo sugli stessi sette stati, il rilevamento della lingua resta automatico, e non sono supportate né le liste di hotword né la diarizzazione dei parlanti.
  • Tramite Synthorai il modello è raggiungibile via la consueta API compatibile OpenAI.

FAQ

L'API di Qwen3-ASR Flash Realtime si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Qwen3-ASR Flash Realtime sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Qwen3-ASR Flash Realtime?

Durata dello stream illimitata su WebSocket; rilevamento dell'emozione mantenuto durante lo streaming; adatto a sottotitoli live e interazione vocale. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Qwen3-ASR Flash Realtime?

Su Synthorai, Qwen3-ASR Flash Realtime costa $0.002 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.

Quali lingue supporta Qwen3-ASR Flash Realtime?

Qwen3-ASR Flash Realtime supporta 26 lingue, un unico elenco condiviso da tutti i modelli Qwen-ASR: cinese (mandarino, sichuanese, hokkien, wu, cantonese), inglese, giapponese, tedesco, coreano, russo, francese, portoghese, arabo, italiano, spagnolo, hindi, indonesiano, thai, turco, ucraino, vietnamita, ceco, danese, filippino, finlandese, islandese, malese, norvegese, polacco, svedese. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a Qwen3-ASR Flash Realtime?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3-asr-flash-realtime" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →