O Fun-ASR Realtime é o modelo de reconhecimento de fala em streaming da Alibaba: o áudio é transmitido por uma conexão persistente e o texto é retornado em streaming com baixa latência, sem limite de duração do stream.
- Entrada
- áudio
- Saída
- texto
- Preço
- $0.002/min
O preço em contexto
Posição do preço entre 11 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Áudio
| Idiomas | Multilíngue com dialetos: 30 idiomas: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco |
|---|---|
| Limites de áudio |
|
| Diarização | Não |
| Transcrição em streaming | Sim |
| Marcas de tempo | Sim |
Modelo
| Modalidades | áudio → texto |
|---|
A documentação também descreve reconhecimento de emoções em 7 estados no guia de tempo real.
conforme documentação oficial da Alibaba ↗
Use o Fun-ASR Realtime em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-realtime",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-realtime",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-realtime" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-realtime",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-realtime")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Sobre o Fun-ASR Realtime
- A documentação oficial o posiciona para legendas ao vivo, assistentes de voz e transcrição de reuniões, e ele carrega as forças da família Fun-ASR de personalização de hotwords mais cobertura multilíngue incluindo dialetos regionais chineses, inglês, japonês e coreano.
- A superfície de tempo real acrescenta controles de que os modelos baseados em arquivo não precisam: pontuação semântica, predição de pontuação ativada por padrão, um silêncio máximo de sentença ajustável que decide quando um enunciado é encerrado, um limiar de fala e ruído para ajuste contra som de fundo, e timestamps por palavra emitidos enquanto o stream corre.
- O áudio chega como PCM, WAV, MP3, Opus, Speex, AAC ou AMR a 8 ou 16 kHz.
- Dois limites merecem ser considerados no design: a diarização de locutores não está disponível no caminho de tempo real (para saber quem disse o quê são necessários os modelos por arquivo de gravação), e a cobertura de idiomas varia bastante conforme o snapshot datado em vez de ser uniforme na família, então fixe o snapshot de que o seu conjunto de idiomas depende.
- A rotulagem de emoção, o diferencial da linha Qwen3-ASR, também não é oferecida aqui, e o ajuste de precisão baseado em contexto está disponível apenas em alguns snapshots.
- A Synthorai o torna chamável pela mesma interface compatível com OpenAI usada pelo resto do seu catálogo de áudio.
Perguntas frequentes
A API do Fun-ASR Realtime é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Fun-ASR Realtime com sua carga de trabalho real antes de adicionar um meio de pagamento.
Em que o Fun-ASR Realtime é melhor?
Transcrição em streaming sem limite de duração; criado para legendas ao vivo e reuniões; personalização de hotwords com cobertura multilíngue. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Fun-ASR Realtime?
Na Synthorai, o Fun-ASR Realtime custa $0.002 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.
Quais idiomas o Fun-ASR Realtime suporta?
O Fun-ASR Realtime suporta Multilíngue com dialetos: 30 idiomas: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.
Como obtenho acesso ao Fun-ASR Realtime?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="fun-asr-realtime" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.