Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3-ASR Flash

Lançado em 2025-09-08

transcription

O Qwen3-ASR Flash é o modelo de reconhecimento de fala da linha Qwen3, transcrevendo arquivos de áudio de até 10 MB e cinco minutos com resultados intermediários em streaming para feedback de progresso em tempo real.

Entrada
áudio
Saída
texto
Preço
$0.0021/min

O preço em contexto

Posição do preço entre 11 modelos comparáveis

Por minuto$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Áudio

Idiomas 26 idiomas, uma lista única compartilhada por todos os modelos Qwen-ASR: chinês (mandarim, sichuanês, hokkien, wu, cantonês), inglês, japonês, alemão, coreano, russo, francês, português, árabe, italiano, espanhol, híndi, indonésio, tailandês, turco, ucraniano, vietnamita, tcheco, dinamarquês, filipino, finlandês, islandês, malaio, norueguês, polonês, sueco
Limites de áudio
  • Reconhecimento síncrono <=10MB / <=5 min, com saída em streaming ou não
  • identificação automática de idioma entre 26 idiomas
  • injeção de texto de contexto
  • reconhecimento de canto
  • sem diarização
  • as respostas compatíveis com OpenAI não trazem campos de timestamp (use qwen3-asr-flash-filetrans para isso)
Diarização Não
Transcrição em streaming Sim
Marcas de tempo Não

Modelo

Modalidades áudio → texto
  • Construído sobre a base Qwen3-Omni
  • o modelo flash servido pela API é proprietário (os Qwen3-ASR 0.6B/1.7B abertos são modelos diferentes)

conforme documentação oficial da Alibaba ↗

Use o Qwen3-ASR Flash em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Sobre o Qwen3-ASR Flash

  • A documentação oficial destaca reconhecimento em cerca de trinta idiomas, incluindo cinco variantes do chinês (mandarim, sichuanês, hokkien, wu, cantonês), e uma capacidade que seus irmãos Fun-ASR não têm: detecção de emoção junto à transcrição.
  • A série Qwen3-ASR também é notada pelo reconhecimento robusto de fala misturada com música e canto.
  • A rotulagem de emoção fica sempre ativa e retorna um de sete estados (surpreso, neutro, feliz, triste, enojado, irritado ou com medo), e a detecção de idioma é automática sempre que você deixa o idioma sem definir, inclusive para áudio que mistura idiomas.
  • A precisão em terminologia de domínio é guiada de forma diferente da família Fun-ASR: em vez de enviar listas de hotwords, você injeta texto de contexto com a requisição, o que combina com vocabulário que muda de chamada para chamada.
  • Timestamps por palavra podem ser ativados para um subconjunto documentado de idiomas, e a normalização inversa de texto está disponível, mas desligada por padrão.
  • O áudio é aceito em um amplo conjunto de formatos de contêiner e codec, e o modelo é alcançável tanto por uma rota compatível com OpenAI quanto pela interface síncrona da própria Alibaba.
  • A diarização de locutores não é oferecida, e o teto de cinco minutos é firme.
  • A Alibaba encaminha gravações mais longas para um modelo separado de transcrição de arquivos.
  • A Synthorai o entrega pelo seu endpoint de transcrição compatível com OpenAI.

Perguntas frequentes

A API do Qwen3-ASR Flash é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Qwen3-ASR Flash com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o Qwen3-ASR Flash é melhor?

Detecta emoção junto à transcrição; cerca de trinta idiomas, cinco variantes do chinês; robusto em fala misturada com música. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3-ASR Flash?

Na Synthorai, o Qwen3-ASR Flash custa $0.0021 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.

Quais idiomas o Qwen3-ASR Flash suporta?

O Qwen3-ASR Flash suporta 26 idiomas, uma lista única compartilhada por todos os modelos Qwen-ASR: chinês (mandarim, sichuanês, hokkien, wu, cantonês), inglês, japonês, alemão, coreano, russo, francês, português, árabe, italiano, espanhol, híndi, indonésio, tailandês, turco, ucraniano, vietnamita, tcheco, dinamarquês, filipino, finlandês, islandês, malaio, norueguês, polonês, sueco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.

Como obtenho acesso ao Qwen3-ASR Flash?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3-asr-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →