Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Fun-ASR Realtime

Rilasciato 2025-09-23

transcription

Fun-ASR Realtime è il modello di riconoscimento vocale in streaming di Alibaba: l'audio viene inviato in streaming su una connessione persistente e il testo torna in streaming con bassa latenza, senza limiti alla durata dello stream.

Input
audio
Output
testo
Prezzo
$0.002/min

Il prezzo nel contesto

Posizione del prezzo tra 11 modelli comparabili

Al minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Audio

Lingue Multilingue con dialetti, 30 lingue: cinese (mandarino, cantonese, wu, hokkien, hakka, gan, xiang, jin più accenti regionali), inglese, giapponese, coreano, vietnamita, thai, indonesiano, malese, filippino, hindi, arabo, francese, tedesco, spagnolo, portoghese, russo, italiano, olandese, svedese, danese, finlandese, norvegese, greco, polacco, ceco, ungherese, rumeno, bulgaro, croato, slovacco
Limiti audio
  • Streaming WebSocket in tempo reale, durata illimitata
  • hotword su larga scala basate su RAG
  • timestamp al millisecondo
  • rilevamento dei turni VAD
Diarizzazione No
Trascrizione in streaming
Timestamp

Modello

Modalità audio → testo

La documentazione descrive inoltre il riconoscimento delle emozioni a 7 stati nella guida realtime.

fonte: documentazione ufficiale Alibaba ↗

Usa Fun-ASR Realtime in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su Fun-ASR Realtime

  • La documentazione ufficiale lo posiziona per sottotitoli dal vivo, assistenti vocali e trascrizione di riunioni, e porta con sé i punti di forza della famiglia Fun-ASR, cioè la personalizzazione con hotword e la copertura multilingue che include i dialetti regionali cinesi, l'inglese, il giapponese e il coreano.
  • La superficie realtime aggiunge controlli di cui i modelli su file non hanno bisogno: punteggiatura semantica, predizione della punteggiatura attiva per impostazione predefinita, un silenzio massimo di frase regolabile che decide quando un enunciato viene chiuso, una soglia di rumore rispetto al parlato per la messa a punto contro i suoni di fondo e timestamp a livello di parola emessi mentre lo stream procede.
  • L'audio arriva in PCM, WAV, MP3, Opus, Speex, AAC o AMR a 8 o 16 kHz.
  • Due limiti meritano di essere considerati in fase di progettazione: la diarizzazione dei parlanti non è disponibile sul percorso realtime (per sapere chi ha detto cosa servono i modelli su file registrato) e la copertura linguistica varia nettamente da uno snapshot datato all'altro anziché essere uniforme nella famiglia, quindi conviene fissare lo snapshot da cui dipende il proprio insieme di lingue.
  • Nemmeno l'etichettatura delle emozioni, l'elemento differenziante della linea Qwen3-ASR, è offerta qui, e la messa a punto dell'accuratezza basata sul contesto è disponibile solo su alcuni snapshot.
  • Synthorai lo rende richiamabile tramite la stessa interfaccia compatibile OpenAI usata per il resto del suo catalogo audio.

FAQ

L'API di Fun-ASR Realtime si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Fun-ASR Realtime sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Fun-ASR Realtime?

Trascrizione in streaming senza limite di durata; costruito per sottotitoli live e riunioni; personalizzazione con hotword e copertura multilingue. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Fun-ASR Realtime?

Su Synthorai, Fun-ASR Realtime costa $0.002 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.

Quali lingue supporta Fun-ASR Realtime?

Fun-ASR Realtime supporta Multilingue con dialetti, 30 lingue: cinese (mandarino, cantonese, wu, hokkien, hakka, gan, xiang, jin più accenti regionali), inglese, giapponese, coreano, vietnamita, thai, indonesiano, malese, filippino, hindi, arabo, francese, tedesco, spagnolo, portoghese, russo, italiano, olandese, svedese, danese, finlandese, norvegese, greco, polacco, ceco, ungherese, rumeno, bulgaro, croato, slovacco. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a Fun-ASR Realtime?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="fun-asr-realtime" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →