Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3 TTS Instruct Flash

O Qwen3-TTS-Instruct-Flash é o nível controlável por instrução da família Qwen3-TTS da Alibaba no Model Studio, com preço na região de Singapura e atualmente equivalente ao snapshot qwen3-tts-instruct-flash-2026-01-26.

Entrada
texto $11.5/M
Saída
áudio
Contexto
4K

O preço em contexto

Posição do preço entre 7 modelos comparáveis

Entrada$11.5/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Síntese de voz

Idiomas de síntese Chinês (mandarim), inglês, alemão, italiano, português, espanhol, japonês, coreano, francês e russo. language_type assume Auto por padrão para entrada em idiomas mistos ou indeterminada, o que a Alibaba documenta como não garantindo precisão; nomear um único idioma está documentado como capaz de melhorar significativamente a qualidade da síntese. Diferentemente da série Qwen3-TTS-Flash, a série Instruct não lista vozes de dialetos chineses (Pequim, xangainês, Sichuan, Nanquim, Shaanxi, hokkien, Tianjin, cantonês).
Vozes Vozes do sistema publicadas com personas de uma linha, entre elas Cherry (uma jovem alegre, positiva, amigável e natural), Serena, Ethan, Chelsie, Momo, Vivian, Moon, Maia, Kai, Nofish (um designer que não consegue pronunciar sons retroflexos), Bella, Eldric Sage, Mia, Mochi, Bellona, Vincent, Bunny, Neil, Elias, Arthur, Nini, Seren, Pip e Stella; a lista de vozes do Qwen-TTS associa cada voz aos ids de modelo exatos que a aceitam.
Limite de entrada 600 caracteres Os fornecedores publicam esse limite em unidades diferentes: em texto não latino, um limite em bytes não equivale a um limite em caracteres.
Síntese em streaming Sim
SSML Não documentado
Controlo de voz Instrução em linguagem natural
O que aceita
  • instructions orienta velocidade, emoção e estilo em linguagem natural, com até 1.600 tokens e documentado apenas para chinês e inglês
  • optimize_instructions (padrão false) reescreve a instrução em uma diretriz mais adequada à síntese e não tem efeito quando instructions está vazio
  • clonagem de voz e design de voz são ambos listados como não suportados para este id de modelo
Unidade de faturação Por carácter de entrada
Endpoints e formatos
  • API HTTP de síntese de fala não em tempo real
  • o sufixo -realtime marca o irmão em WebSocket. Texto de entrada limitado a 600 caracteres, com entrada mista multilíngue permitida. Sem streaming, retorna a URL de um arquivo de áudio válida por 24 horas
  • com streaming, retorna PCM codificado em Base64 em chunks, com a URL apenas no pacote final, reproduzido nos exemplos oficiais como áudio mono de 24 kHz e 16 bits. Cobrado por caracteres do texto de entrada, informados em usage.characters (input_tokens e output_tokens são sempre 0 na série Qwen3-TTS)
  • o áudio de saída é gratuito

Modelo

Modalidades texto → áudio

Nível controlável por instrução da família Qwen3-TTS da Alibaba no Model Studio, atualmente equivalente ao snapshot qwen3-tts-instruct-flash-2026-01-26. Posicionado para trabalho tolerante a latência, como produção de audiolivros, locuções de educação online e criação de conteúdo. Com preço na região de Singapura de $0,115 por 10.000 caracteres de entrada no escopo de implantação internacional, e uma cota gratuita de 110.000 caracteres válida por 90 dias após a ativação do Model Studio.

conforme documentação oficial da Alibaba ↗

Use o Qwen3 TTS Instruct Flash em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-tts-instruct-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Sobre o Qwen3 TTS Instruct Flash

  • O Model Studio divide a família por transporte, e não por capacidade: um id que carrega o sufixo realtime fala WebSocket, enquanto este, sem ele, é o modelo HTTP por trás do que a Alibaba chama de síntese de fala não em tempo real, desenhado para cenários tolerantes a latência, como produção de audiolivros, locuções de educação online e criação de conteúdo.
  • O controle por instrução é a razão para recorrer a ele em vez do qwen3-tts-flash simples.
  • Você descreve em linguagem comum a entrega que deseja para controlar velocidade, emoção e estilo a cada requisição, sendo os exemplos documentados falar suavemente em um ritmo mais lento ou usar um estilo empolgado de locução; o campo instructions aceita até 1.600 tokens e está documentado apenas para chinês e inglês, e optimize_instructions, desligado por padrão, faz o serviço reescrever seu texto em uma diretriz mais adequada à síntese.
  • As vozes são as personas nomeadas da família, entre elas Cherry, como uma jovem alegre, positiva, amigável e natural, e Nofish, um designer que não consegue pronunciar sons retroflexos, e a lista de vozes informa quais ids de modelo aceitam cada uma.
  • São cobertos dez idiomas, chinês (mandarim), inglês, alemão, italiano, português, espanhol, japonês, coreano, francês e russo, e, diferentemente do qwen3-tts-flash, a linha Instruct não traz nenhuma das vozes de dialetos chineses.
  • Dois limites moldam a integração: o texto de entrada é limitado a 600 caracteres, e language_type assume Auto por padrão, o que a Alibaba diz não garantir precisão, recomendando substituí-lo por um idioma explícito quando o texto está em um único idioma.
  • Sem streaming, ele retorna a URL de um arquivo de áudio válida por 24 horas, enquanto com streaming retorna PCM codificado em Base64 em chunks, com a URL apenas no pacote final, e os exemplos oficiais reproduzem esse stream como áudio mono de 24 kHz e 16 bits.
  • A cobrança conta os caracteres do texto de entrada, a $0,115 por 10.000 no escopo de implantação internacional, e o áudio de saída é gratuito.
  • A Synthorai o serve pelo endpoint /v1/audio/speech compatível com OpenAI.

Perguntas frequentes

A API do Qwen3 TTS Instruct Flash é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Qwen3 TTS Instruct Flash com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o Qwen3 TTS Instruct Flash é melhor?

Instruções em linguagem comum controlam velocidade, emoção e estilo; modelo http para audiolivros e locuções, não para tempo real; dez idiomas, limite de 600 caracteres de entrada. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3 TTS Instruct Flash?

Na Synthorai, o Qwen3 TTS Instruct Flash custa $11.5 por milhão de tokens de entrada e $0 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

O Qwen3 TTS Instruct Flash suporta cache de prompts?

O Qwen3 TTS Instruct Flash não tem desconto de leitura de cache na Synthorai hoje. O cache de prompts continua valendo para outros modelos do gateway; veja na tabela de preços as alternativas com cache habilitado. Comparativo de cache entre provedores →

Como obtenho acesso ao Qwen3 TTS Instruct Flash?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3-tts-instruct-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →