Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Fun-ASR

Rilasciato 2025-08-22

transcription

Fun-ASR è il modello di riconoscimento vocale su file registrato di Alibaba Cloud Model Studio per la trascrizione offline di audio preregistrato.

Input
audio
Output
testo
Prezzo
$0.0021/min

Il prezzo nel contesto

Posizione del prezzo tra 11 modelli comparabili

Al minuto$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Audio

Lingue Multilingue con dialetti, 30 lingue: cinese (mandarino, cantonese, wu, hokkien, hakka, gan, xiang, jin più accenti regionali), inglese, giapponese, coreano, vietnamita, thai, indonesiano, malese, filippino, hindi, arabo, francese, tedesco, spagnolo, portoghese, russo, italiano, olandese, svedese, danese, finlandese, norvegese, greco, polacco, ceco, ungherese, rumeno, bulgaro, croato, slovacco
Limiti audio
  • Trascrizione asincrona di file fino a 12h / 2GB
  • hotword + diarizzazione dei parlanti
  • timestamp di frase/parola
  • oltre 30 lingue inclusi i dialetti cinesi
Diarizzazione
Trascrizione in streaming No
Timestamp

Modello

Modalità audio → testo
  • Riconoscimento del canto aggiunto nel 2025-12
  • Fun-ASR-Nano, rilasciato open source, è un modello distinto rispetto ai pesi qui serviti

fonte: documentazione ufficiale Alibaba ↗

Usa Fun-ASR in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su Fun-ASR

  • Accetta file fino a 12 ore e 2 GB, gestisce job singoli e batch e riconosce il cinese (mandarino più molti dialetti regionali come cantonese, wu e hokkien), inglese, giapponese, coreano e decine di altre lingue.
  • La documentazione ufficiale evidenzia la personalizzazione con hotword per la terminologia di dominio e la diarizzazione dei parlanti per le registrazioni multi-parlante.
  • Entrambe portano con sé dettagli pratici che conviene conoscere fin dall'inizio: una tabella di hotword contiene fino a 500 voci ed è adatta a terminologia che cambia di rado, la diarizzazione resta disattivata finché non la si abilita e consente di dichiarare un numero atteso di parlanti, e Alibaba raccomanda di tenere l'audio diarizzato sotto le due ore circa, altrimenti il job può andare in timeout.
  • La trascrizione è asincrona (si invia il file, si riceve un id di task, si interroga per il risultato) e i timestamp a livello di frase e di parola in millisecondi tornano di serie, insieme al filtraggio delle parole sensibili e alla selezione per canale per le registrazioni multi-traccia.
  • L'etichettatura delle emozioni non fa parte di questo modello; appartiene alla linea Qwen3-ASR.
  • I suggerimenti di lingua sono accettati, ma la documentazione nota che viene letto solo il primo valore della lista.
  • Synthorai serve Fun-ASR tramite il suo endpoint compatibile OpenAI, così i client di trascrizione esistenti funzionano senza modifiche.

FAQ

L'API di Fun-ASR si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Fun-ASR sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Fun-ASR?

File in ingresso fino a 12 ore; personalizzazione con hotword per la terminologia di dominio; diarizzazione dei parlanti per registrazioni multi-parlante. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Fun-ASR?

Su Synthorai, Fun-ASR costa $0.0021 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.

Quali lingue supporta Fun-ASR?

Fun-ASR supporta Multilingue con dialetti, 30 lingue: cinese (mandarino, cantonese, wu, hokkien, hakka, gan, xiang, jin più accenti regionali), inglese, giapponese, coreano, vietnamita, thai, indonesiano, malese, filippino, hindi, arabo, francese, tedesco, spagnolo, portoghese, russo, italiano, olandese, svedese, danese, finlandese, norvegese, greco, polacco, ceco, ungherese, rumeno, bulgaro, croato, slovacco. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a Fun-ASR?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="fun-asr" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →