Fun-ASR è il modello di riconoscimento vocale su file registrato di Alibaba Cloud Model Studio per la trascrizione offline di audio preregistrato.
- Input
- audio
- Output
- testo
- Prezzo
- $0.0021/min
Il prezzo nel contesto
Posizione del prezzo tra 11 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Audio
| Lingue | Multilingue con dialetti, 30 lingue: cinese (mandarino, cantonese, wu, hokkien, hakka, gan, xiang, jin più accenti regionali), inglese, giapponese, coreano, vietnamita, thai, indonesiano, malese, filippino, hindi, arabo, francese, tedesco, spagnolo, portoghese, russo, italiano, olandese, svedese, danese, finlandese, norvegese, greco, polacco, ceco, ungherese, rumeno, bulgaro, croato, slovacco |
|---|---|
| Limiti audio |
|
| Diarizzazione | Sì |
| Trascrizione in streaming | No |
| Timestamp | Sì |
Modello
| Modalità | audio → testo |
|---|
- Riconoscimento del canto aggiunto nel 2025-12
- Fun-ASR-Nano, rilasciato open source, è un modello distinto rispetto ai pesi qui serviti
Usa Fun-ASR in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Informazioni su Fun-ASR
- Accetta file fino a 12 ore e 2 GB, gestisce job singoli e batch e riconosce il cinese (mandarino più molti dialetti regionali come cantonese, wu e hokkien), inglese, giapponese, coreano e decine di altre lingue.
- La documentazione ufficiale evidenzia la personalizzazione con hotword per la terminologia di dominio e la diarizzazione dei parlanti per le registrazioni multi-parlante.
- Entrambe portano con sé dettagli pratici che conviene conoscere fin dall'inizio: una tabella di hotword contiene fino a 500 voci ed è adatta a terminologia che cambia di rado, la diarizzazione resta disattivata finché non la si abilita e consente di dichiarare un numero atteso di parlanti, e Alibaba raccomanda di tenere l'audio diarizzato sotto le due ore circa, altrimenti il job può andare in timeout.
- La trascrizione è asincrona (si invia il file, si riceve un id di task, si interroga per il risultato) e i timestamp a livello di frase e di parola in millisecondi tornano di serie, insieme al filtraggio delle parole sensibili e alla selezione per canale per le registrazioni multi-traccia.
- L'etichettatura delle emozioni non fa parte di questo modello; appartiene alla linea Qwen3-ASR.
- I suggerimenti di lingua sono accettati, ma la documentazione nota che viene letto solo il primo valore della lista.
- Synthorai serve Fun-ASR tramite il suo endpoint compatibile OpenAI, così i client di trascrizione esistenti funzionano senza modifiche.
FAQ
L'API di Fun-ASR si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Fun-ASR sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle Fun-ASR?
File in ingresso fino a 12 ore; personalizzazione con hotword per la terminologia di dominio; diarizzazione dei parlanti per registrazioni multi-parlante. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Fun-ASR?
Su Synthorai, Fun-ASR costa $0.0021 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.
Quali lingue supporta Fun-ASR?
Fun-ASR supporta Multilingue con dialetti, 30 lingue: cinese (mandarino, cantonese, wu, hokkien, hakka, gan, xiang, jin più accenti regionali), inglese, giapponese, coreano, vietnamita, thai, indonesiano, malese, filippino, hindi, arabo, francese, tedesco, spagnolo, portoghese, russo, italiano, olandese, svedese, danese, finlandese, norvegese, greco, polacco, ceco, ungherese, rumeno, bulgaro, croato, slovacco. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.
Come ottengo l'accesso a Fun-ASR?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="fun-asr" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.