Fun-ASR Realtime è il modello di riconoscimento vocale in streaming di Alibaba: l'audio viene inviato in streaming su una connessione persistente e il testo torna in streaming con bassa latenza, senza limiti alla durata dello stream.
- Input
- audio
- Output
- testo
- Prezzo
- $0.002/min
Il prezzo nel contesto
Posizione del prezzo tra 11 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Audio
| Lingue | Multilingue con dialetti, 30 lingue: cinese (mandarino, cantonese, wu, hokkien, hakka, gan, xiang, jin più accenti regionali), inglese, giapponese, coreano, vietnamita, thai, indonesiano, malese, filippino, hindi, arabo, francese, tedesco, spagnolo, portoghese, russo, italiano, olandese, svedese, danese, finlandese, norvegese, greco, polacco, ceco, ungherese, rumeno, bulgaro, croato, slovacco |
|---|---|
| Limiti audio |
|
| Diarizzazione | No |
| Trascrizione in streaming | Sì |
| Timestamp | Sì |
Modello
| Modalità | audio → testo |
|---|
La documentazione descrive inoltre il riconoscimento delle emozioni a 7 stati nella guida realtime.
Usa Fun-ASR Realtime in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-realtime",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-realtime",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-realtime" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-realtime",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-realtime")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Informazioni su Fun-ASR Realtime
- La documentazione ufficiale lo posiziona per sottotitoli dal vivo, assistenti vocali e trascrizione di riunioni, e porta con sé i punti di forza della famiglia Fun-ASR, cioè la personalizzazione con hotword e la copertura multilingue che include i dialetti regionali cinesi, l'inglese, il giapponese e il coreano.
- La superficie realtime aggiunge controlli di cui i modelli su file non hanno bisogno: punteggiatura semantica, predizione della punteggiatura attiva per impostazione predefinita, un silenzio massimo di frase regolabile che decide quando un enunciato viene chiuso, una soglia di rumore rispetto al parlato per la messa a punto contro i suoni di fondo e timestamp a livello di parola emessi mentre lo stream procede.
- L'audio arriva in PCM, WAV, MP3, Opus, Speex, AAC o AMR a 8 o 16 kHz.
- Due limiti meritano di essere considerati in fase di progettazione: la diarizzazione dei parlanti non è disponibile sul percorso realtime (per sapere chi ha detto cosa servono i modelli su file registrato) e la copertura linguistica varia nettamente da uno snapshot datato all'altro anziché essere uniforme nella famiglia, quindi conviene fissare lo snapshot da cui dipende il proprio insieme di lingue.
- Nemmeno l'etichettatura delle emozioni, l'elemento differenziante della linea Qwen3-ASR, è offerta qui, e la messa a punto dell'accuratezza basata sul contesto è disponibile solo su alcuni snapshot.
- Synthorai lo rende richiamabile tramite la stessa interfaccia compatibile OpenAI usata per il resto del suo catalogo audio.
FAQ
L'API di Fun-ASR Realtime si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Fun-ASR Realtime sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle Fun-ASR Realtime?
Trascrizione in streaming senza limite di durata; costruito per sottotitoli live e riunioni; personalizzazione con hotword e copertura multilingue. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Fun-ASR Realtime?
Su Synthorai, Fun-ASR Realtime costa $0.002 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.
Quali lingue supporta Fun-ASR Realtime?
Fun-ASR Realtime supporta Multilingue con dialetti, 30 lingue: cinese (mandarino, cantonese, wu, hokkien, hakka, gan, xiang, jin più accenti regionali), inglese, giapponese, coreano, vietnamita, thai, indonesiano, malese, filippino, hindi, arabo, francese, tedesco, spagnolo, portoghese, russo, italiano, olandese, svedese, danese, finlandese, norvegese, greco, polacco, ceco, ungherese, rumeno, bulgaro, croato, slovacco. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.
Come ottengo l'accesso a Fun-ASR Realtime?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="fun-asr-realtime" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.