O Qwen3-ASR Flash Realtime é a contraparte em streaming do Qwen3-ASR Flash: o áudio é enviado por uma conexão WebSocket e as transcrições retornam continuamente, com duração de stream ilimitada para sessões de longa duração.
- Entrada
- áudio
- Saída
- texto
- Preço
- $0.002/min
O preço em contexto
Posição do preço entre 11 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Áudio
| Idiomas | 26 idiomas, uma lista única compartilhada por todos os modelos Qwen-ASR: chinês (mandarim, sichuanês, hokkien, wu, cantonês), inglês, japonês, alemão, coreano, russo, francês, português, árabe, italiano, espanhol, híndi, indonésio, tailandês, turco, ucraniano, vietnamita, tcheco, dinamarquês, filipino, finlandês, islandês, malaio, norueguês, polonês, sueco |
|---|---|
| Limites de áudio |
|
| Diarização | Não |
| Transcrição em streaming | Sim |
| Marcas de tempo | Não |
Modelo
| Modalidades | áudio → texto |
|---|
Sem timestamps, hotwords ou diarização nesta variante realtime.
conforme documentação oficial da Alibaba ↗
Use o Qwen3-ASR Flash Realtime em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="qwen3-asr-flash-realtime",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "qwen3-asr-flash-realtime",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="qwen3-asr-flash-realtime" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "qwen3-asr-flash-realtime",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("qwen3-asr-flash-realtime")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Sobre o Qwen3-ASR Flash Realtime
- Ele mantém as capacidades principais do modelo em lote, incluindo detecção de emoção junto à transcrição e reconhecimento em cerca de trinta idiomas, de cinco variantes do chinês a inglês, japonês, coreano e muitos idiomas europeus e do Sudeste Asiático.
- Ele serve para legendagem ao vivo e aplicações de interação por voz.
- Duas diferenças em relação ao irmão baseado em arquivo moldam como você constrói sobre ele.
- Primeiro, a alternância de turnos é configurável de um jeito que os outros modelos de streaming não permitem: um modo de detecção de atividade de voz segmenta os enunciados automaticamente usando um limiar de silêncio ajustável, enquanto um modo manual entrega os limites de sentença ao seu cliente, que faz o commit do buffer de áudio, com a ressalva documentada de que os segmentos conduzidos manualmente precisam ficar dentro de cerca de um minuto de áudio acumulado.
- Segundo, a documentação afirma claramente que esta variante atualmente não retorna timestamps, então, se você precisa de tempo por palavra ou por sentença, o modelo offline é o que deve ser usado.
- O reconhecimento de emoção continua sempre ativo nos mesmos sete estados, a detecção de idioma continua automática, e nem listas de hotwords nem diarização de locutores são suportadas.
- Pela Synthorai, o modelo é alcançável pela API compatível com OpenAI padrão.
Perguntas frequentes
A API do Qwen3-ASR Flash Realtime é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Qwen3-ASR Flash Realtime com sua carga de trabalho real antes de adicionar um meio de pagamento.
Em que o Qwen3-ASR Flash Realtime é melhor?
Duração de stream ilimitada por WebSocket; mantém a detecção de emoção durante o streaming; adequado a legendagem ao vivo e interação por voz. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Qwen3-ASR Flash Realtime?
Na Synthorai, o Qwen3-ASR Flash Realtime custa $0.002 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.
Quais idiomas o Qwen3-ASR Flash Realtime suporta?
O Qwen3-ASR Flash Realtime suporta 26 idiomas, uma lista única compartilhada por todos os modelos Qwen-ASR: chinês (mandarim, sichuanês, hokkien, wu, cantonês), inglês, japonês, alemão, coreano, russo, francês, português, árabe, italiano, espanhol, híndi, indonésio, tailandês, turco, ucraniano, vietnamita, tcheco, dinamarquês, filipino, finlandês, islandês, malaio, norueguês, polonês, sueco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.
Como obtenho acesso ao Qwen3-ASR Flash Realtime?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3-asr-flash-realtime" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.