Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Fun-ASR Realtime

Lançado em 2025-09-23

transcription

O Fun-ASR Realtime é o modelo de reconhecimento de fala em streaming da Alibaba: o áudio é transmitido por uma conexão persistente e o texto é retornado em streaming com baixa latência, sem limite de duração do stream.

Entrada
áudio
Saída
texto
Preço
$0.002/min

O preço em contexto

Posição do preço entre 11 modelos comparáveis

Por minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Áudio

Idiomas Multilíngue com dialetos: 30 idiomas: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco
Limites de áudio
  • Streaming WebSocket em tempo real, duração ilimitada
  • hotwords em larga escala baseadas em RAG
  • timestamps em milissegundos
  • detecção de turno por VAD
Diarização Não
Transcrição em streaming Sim
Marcas de tempo Sim

Modelo

Modalidades áudio → texto

A documentação também descreve reconhecimento de emoções em 7 estados no guia de tempo real.

conforme documentação oficial da Alibaba ↗

Use o Fun-ASR Realtime em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Sobre o Fun-ASR Realtime

  • A documentação oficial o posiciona para legendas ao vivo, assistentes de voz e transcrição de reuniões, e ele carrega as forças da família Fun-ASR de personalização de hotwords mais cobertura multilíngue incluindo dialetos regionais chineses, inglês, japonês e coreano.
  • A superfície de tempo real acrescenta controles de que os modelos baseados em arquivo não precisam: pontuação semântica, predição de pontuação ativada por padrão, um silêncio máximo de sentença ajustável que decide quando um enunciado é encerrado, um limiar de fala e ruído para ajuste contra som de fundo, e timestamps por palavra emitidos enquanto o stream corre.
  • O áudio chega como PCM, WAV, MP3, Opus, Speex, AAC ou AMR a 8 ou 16 kHz.
  • Dois limites merecem ser considerados no design: a diarização de locutores não está disponível no caminho de tempo real (para saber quem disse o quê são necessários os modelos por arquivo de gravação), e a cobertura de idiomas varia bastante conforme o snapshot datado em vez de ser uniforme na família, então fixe o snapshot de que o seu conjunto de idiomas depende.
  • A rotulagem de emoção, o diferencial da linha Qwen3-ASR, também não é oferecida aqui, e o ajuste de precisão baseado em contexto está disponível apenas em alguns snapshots.
  • A Synthorai o torna chamável pela mesma interface compatível com OpenAI usada pelo resto do seu catálogo de áudio.

Perguntas frequentes

A API do Fun-ASR Realtime é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Fun-ASR Realtime com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o Fun-ASR Realtime é melhor?

Transcrição em streaming sem limite de duração; criado para legendas ao vivo e reuniões; personalização de hotwords com cobertura multilíngue. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Fun-ASR Realtime?

Na Synthorai, o Fun-ASR Realtime custa $0.002 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.

Quais idiomas o Fun-ASR Realtime suporta?

O Fun-ASR Realtime suporta Multilíngue com dialetos: 30 idiomas: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.

Como obtenho acesso ao Fun-ASR Realtime?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="fun-asr-realtime" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →