Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Fun-ASR MTL

Lançado em 2025-08

transcription

O Fun-ASR MTL é o membro multilíngue e multitarefa da família Fun-ASR da Alibaba para transcrição por arquivo de gravação.

Entrada
áudio
Saída
texto
Preço
$0.0021/min

O preço em contexto

Posição do preço entre 11 modelos comparáveis

Por minuto$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Áudio

Idiomas Multilíngue com dialetos: 30 idiomas, com o chinês limitado a mandarim e cantonês (sem cobertura mais ampla de dialetos ou sotaques). Chinês (mandarim, cantonês), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco
Limites de áudio
  • Transcrição assíncrona multilíngue de até 12 h / 2 GB
  • hotwords + diarização
  • timestamps por sentença e por palavra (sempre ativos)
  • 30 idiomas, com o chinês limitado a mandarim + cantonês
Diarização Sim
Transcrição em streaming Não
Marcas de tempo Sim

Modelo

Modalidades áudio → texto
  • Nível multilíngue e multitarefa da família Fun-ASR
  • a referência atual da API HTTP lista os mesmos 30 idiomas do modelo base, com o chinês limitado a mandarim e cantonês

conforme documentação oficial da Alibaba ↗

Use o Fun-ASR MTL em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-mtl",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Sobre o Fun-ASR MTL

  • Como o modelo base, ele processa arquivos de áudio de até 12 horas e 2 GB offline, e a documentação oficial lista suporte a personalização de hotwords e diarização de locutores, com reconhecimento abrangendo chinês (mandarim e cantonês), inglês, japonês, coreano e uma ampla gama de idiomas europeus e do Sudeste Asiático.
  • Ele mira cargas de trabalho que misturam idiomas e precisam de identificação de locutores em um único pipeline.
  • Sua história explica sua existência: quando a família foi lançada, o snapshot então atual do Fun-ASR cobria apenas chinês e inglês, e o MTL foi a variante que acrescentou cantonês, japonês, tailandês, vietnamita e indonésio por cima.
  • Desde então o modelo base foi atualizado e a referência da API HTTP agora lista o mesmo conjunto amplo de idiomas para os dois, de modo que ambos convergiram.
  • As próprias páginas da Alibaba não traçam mais uma linha explícita de capacidade entre eles.
  • Todo o resto segue a família: transcrição assíncrona de enviar e consultar, tabelas de hotwords para vocabulário de domínio estável, diarização opcional com contagem de locutores declarada, e timestamps por sentença e por palavra em milissegundos.
  • O reconhecimento de emoção não faz parte desta linha e, como no seu irmão, a documentação nota que apenas a primeira entrada de uma lista de dicas de idioma é lida.
  • O nome estável do modelo resolve para um snapshot datado, então fixe o snapshot se a sua cobertura de idiomas importa.
  • A Synthorai roteia requisições a ele pelo familiar endpoint compatível com OpenAI.

Perguntas frequentes

A API do Fun-ASR MTL é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Fun-ASR MTL com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o Fun-ASR MTL é melhor?

Cargas de idiomas mistos com identificação de locutores; processa arquivos de até 12 horas offline; abrange idiomas europeus e do Sudeste Asiático. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Fun-ASR MTL?

Na Synthorai, o Fun-ASR MTL custa $0.0021 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.

Quais idiomas o Fun-ASR MTL suporta?

O Fun-ASR MTL suporta Multilíngue com dialetos: 30 idiomas, com o chinês limitado a mandarim e cantonês (sem cobertura mais ampla de dialetos ou sotaques). Chinês (mandarim, cantonês), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.

Como obtenho acesso ao Fun-ASR MTL?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="fun-asr-mtl" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →