Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Fun-ASR

Lançado em 2025-08-22

transcription

O Fun-ASR é o modelo de reconhecimento de fala por arquivo de gravação do Alibaba Cloud Model Studio para transcrição offline de áudio pré-gravado.

Entrada
áudio
Saída
texto
Preço
$0.0021/min

O preço em contexto

Posição do preço entre 11 modelos comparáveis

Por minuto$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Áudio

Idiomas Multilíngue com dialetos: 30 idiomas: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco
Limites de áudio
  • Transcrição assíncrona de arquivos de até 12 h / 2 GB
  • hotwords + diarização de locutores
  • timestamps por sentença e por palavra
  • mais de 30 idiomas, incluindo dialetos chineses
Diarização Sim
Transcrição em streaming Não
Marcas de tempo Sim

Modelo

Modalidades áudio → texto
  • Reconhecimento de canto adicionado em 2025-12
  • o Fun-ASR-Nano de código aberto é um modelo distinto destes pesos servidos

conforme documentação oficial da Alibaba ↗

Use o Fun-ASR em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Sobre o Fun-ASR

  • Ele aceita arquivos de até 12 horas e 2 GB, lida com jobs de arquivo único e em lote, e reconhece chinês (mandarim mais muitos dialetos regionais como cantonês, wu e hokkien), inglês, japonês, coreano e dezenas de outros idiomas.
  • A documentação oficial destaca a personalização de hotwords para terminologia de domínio e a diarização de locutores para gravações com múltiplos falantes.
  • Ambos vêm com detalhes práticos que vale conhecer de antemão: uma tabela de hotwords comporta até 500 entradas e serve para terminologia que muda raramente, a diarização fica desligada até você ativá-la e permite declarar uma contagem esperada de locutores, e a Alibaba recomenda manter o áudio diarizado abaixo de cerca de duas horas, ou o job pode expirar.
  • A transcrição é assíncrona (envie o arquivo, receba um id de tarefa, consulte o resultado), e timestamps por sentença e por palavra em milissegundos voltam como padrão, ao lado de filtragem de palavras sensíveis e seleção por canal para gravações multipista.
  • A rotulagem de emoção não faz parte deste modelo; isso pertence à linha Qwen3-ASR.
  • Dicas de idioma são aceitas, mas a documentação nota que apenas o primeiro valor da lista é lido.
  • A Synthorai serve o Fun-ASR pelo seu endpoint compatível com OpenAI, então os clientes de transcrição existentes funcionam sem modificação.

Perguntas frequentes

A API do Fun-ASR é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Fun-ASR com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o Fun-ASR é melhor?

Aceita arquivos de até 12 horas; personalização de hotwords para terminologia de domínio; diarização de locutores para gravações com múltiplos falantes. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Fun-ASR?

Na Synthorai, o Fun-ASR custa $0.0021 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.

Quais idiomas o Fun-ASR suporta?

O Fun-ASR suporta Multilíngue com dialetos: 30 idiomas: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.

Como obtenho acesso ao Fun-ASR?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="fun-asr" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →