O Qwen3-ASR Flash é o modelo de reconhecimento de fala da linha Qwen3, transcrevendo arquivos de áudio de até 10 MB e cinco minutos com resultados intermediários em streaming para feedback de progresso em tempo real.
- Entrada
- áudio
- Saída
- texto
- Preço
- $0.0021/min
O preço em contexto
Posição do preço entre 11 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Áudio
| Idiomas | 26 idiomas, uma lista única compartilhada por todos os modelos Qwen-ASR: chinês (mandarim, sichuanês, hokkien, wu, cantonês), inglês, japonês, alemão, coreano, russo, francês, português, árabe, italiano, espanhol, híndi, indonésio, tailandês, turco, ucraniano, vietnamita, tcheco, dinamarquês, filipino, finlandês, islandês, malaio, norueguês, polonês, sueco |
|---|---|
| Limites de áudio |
|
| Diarização | Não |
| Transcrição em streaming | Sim |
| Marcas de tempo | Não |
Modelo
| Modalidades | áudio → texto |
|---|
- Construído sobre a base Qwen3-Omni
- o modelo flash servido pela API é proprietário (os Qwen3-ASR 0.6B/1.7B abertos são modelos diferentes)
conforme documentação oficial da Alibaba ↗
Use o Qwen3-ASR Flash em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="qwen3-asr-flash",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "qwen3-asr-flash",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="qwen3-asr-flash" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "qwen3-asr-flash",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("qwen3-asr-flash")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Sobre o Qwen3-ASR Flash
- A documentação oficial destaca reconhecimento em cerca de trinta idiomas, incluindo cinco variantes do chinês (mandarim, sichuanês, hokkien, wu, cantonês), e uma capacidade que seus irmãos Fun-ASR não têm: detecção de emoção junto à transcrição.
- A série Qwen3-ASR também é notada pelo reconhecimento robusto de fala misturada com música e canto.
- A rotulagem de emoção fica sempre ativa e retorna um de sete estados (surpreso, neutro, feliz, triste, enojado, irritado ou com medo), e a detecção de idioma é automática sempre que você deixa o idioma sem definir, inclusive para áudio que mistura idiomas.
- A precisão em terminologia de domínio é guiada de forma diferente da família Fun-ASR: em vez de enviar listas de hotwords, você injeta texto de contexto com a requisição, o que combina com vocabulário que muda de chamada para chamada.
- Timestamps por palavra podem ser ativados para um subconjunto documentado de idiomas, e a normalização inversa de texto está disponível, mas desligada por padrão.
- O áudio é aceito em um amplo conjunto de formatos de contêiner e codec, e o modelo é alcançável tanto por uma rota compatível com OpenAI quanto pela interface síncrona da própria Alibaba.
- A diarização de locutores não é oferecida, e o teto de cinco minutos é firme.
- A Alibaba encaminha gravações mais longas para um modelo separado de transcrição de arquivos.
- A Synthorai o entrega pelo seu endpoint de transcrição compatível com OpenAI.
Perguntas frequentes
A API do Qwen3-ASR Flash é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Qwen3-ASR Flash com sua carga de trabalho real antes de adicionar um meio de pagamento.
Em que o Qwen3-ASR Flash é melhor?
Detecta emoção junto à transcrição; cerca de trinta idiomas, cinco variantes do chinês; robusto em fala misturada com música. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Qwen3-ASR Flash?
Na Synthorai, o Qwen3-ASR Flash custa $0.0021 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.
Quais idiomas o Qwen3-ASR Flash suporta?
O Qwen3-ASR Flash suporta 26 idiomas, uma lista única compartilhada por todos os modelos Qwen-ASR: chinês (mandarim, sichuanês, hokkien, wu, cantonês), inglês, japonês, alemão, coreano, russo, francês, português, árabe, italiano, espanhol, híndi, indonésio, tailandês, turco, ucraniano, vietnamita, tcheco, dinamarquês, filipino, finlandês, islandês, malaio, norueguês, polonês, sueco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.
Como obtenho acesso ao Qwen3-ASR Flash?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3-asr-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.