🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3 TTS Instruct Flash

Alibaba Síntese de vozStreaming
Entrada$11.5/M
Contexto4K

Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing.

Use o Qwen3 TTS Instruct Flash em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-tts-instruct-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Especificações e limites

Áudio

Idiomas
Chinês (mandarim), inglês, alemão, italiano, português, espanhol, japonês, coreano, francês e russo. language_type assume Auto por padrão para entrada em idiomas mistos ou indeterminada, o que a Alibaba documenta como não garantindo precisão; nomear um único idioma está documentado como capaz de melhorar significativamente a qualidade da síntese. Diferentemente da série Qwen3-TTS-Flash, a série Instruct não lista vozes de dialetos chineses (Pequim, xangainês, Sichuan, Nanquim, Shaanxi, hokkien, Tianjin, cantonês).
Limites de áudio
  • API HTTP de síntese de fala não em tempo real
  • o sufixo -realtime marca o irmão em WebSocket. Texto de entrada limitado a 600 caracteres, com entrada mista multilíngue permitida. Sem streaming, retorna a URL de um arquivo de áudio válida por 24 horas
  • com streaming, retorna PCM codificado em Base64 em chunks, com a URL apenas no pacote final, reproduzido nos exemplos oficiais como áudio mono de 24 kHz e 16 bits. Cobrado por caracteres do texto de entrada, informados em usage.characters (input_tokens e output_tokens são sempre 0 na série Qwen3-TTS)
  • o áudio de saída é gratuito

Tempo real

Vozes
Vozes do sistema publicadas com personas de uma linha, entre elas Cherry (uma jovem alegre, positiva, amigável e natural), Serena, Ethan, Chelsie, Momo, Vivian, Moon, Maia, Kai, Nofish (um designer que não consegue pronunciar sons retroflexos), Bella, Eldric Sage, Mia, Mochi, Bellona, Vincent, Bunny, Neil, Elias, Arthur, Nini, Seren, Pip e Stella; a lista de vozes do Qwen-TTS associa cada voz aos ids de modelo exatos que a aceitam.
Sessão
  • instructions orienta velocidade, emoção e estilo em linguagem natural, com até 1.600 tokens e documentado apenas para chinês e inglês
  • optimize_instructions (padrão false) reescreve a instrução em uma diretriz mais adequada à síntese e não tem efeito quando instructions está vazio
  • clonagem de voz e design de voz são ambos listados como não suportados para este id de modelo

Modelo

Modalidades
texto → áudio

Nível controlável por instrução da família Qwen3-TTS da Alibaba no Model Studio, atualmente equivalente ao snapshot qwen3-tts-instruct-flash-2026-01-26. Posicionado para trabalho tolerante a latência, como produção de audiolivros, locuções de educação online e criação de conteúdo. Com preço na região de Singapura de $0,115 por 10.000 caracteres de entrada no escopo de implantação internacional, e uma cota gratuita de 110.000 caracteres válida por 90 dias após a ativação do Model Studio.

conforme documentação oficial da Alibaba ↗

Sobre o Qwen3 TTS Instruct Flash

Instruções em linguagem comum controlam velocidade, emoção e estilo
Modelo http para audiolivros e locuções, não para tempo real
Dez idiomas, limite de 600 caracteres de entrada

O Qwen3-TTS-Instruct-Flash é o nível controlável por instrução da família Qwen3-TTS da Alibaba no Model Studio, com preço na região de Singapura e atualmente equivalente ao snapshot qwen3-tts-instruct-flash-2026-01-26.

  • O Model Studio divide a família por transporte, e não por capacidade: um id que carrega o sufixo realtime fala WebSocket, enquanto este, sem ele, é o modelo HTTP por trás do que a Alibaba chama de síntese de fala não em tempo real, desenhado para cenários tolerantes a latência, como produção de audiolivros, locuções de educação online e criação de conteúdo.
  • O controle por instrução é a razão para recorrer a ele em vez do qwen3-tts-flash simples.
  • Você descreve em linguagem comum a entrega que deseja para controlar velocidade, emoção e estilo a cada requisição, sendo os exemplos documentados falar suavemente em um ritmo mais lento ou usar um estilo empolgado de locução; o campo instructions aceita até 1.600 tokens e está documentado apenas para chinês e inglês, e optimize_instructions, desligado por padrão, faz o serviço reescrever seu texto em uma diretriz mais adequada à síntese.
  • As vozes são as personas nomeadas da família, entre elas Cherry, como uma jovem alegre, positiva, amigável e natural, e Nofish, um designer que não consegue pronunciar sons retroflexos, e a lista de vozes informa quais ids de modelo aceitam cada uma.
  • São cobertos dez idiomas, chinês (mandarim), inglês, alemão, italiano, português, espanhol, japonês, coreano, francês e russo, e, diferentemente do qwen3-tts-flash, a linha Instruct não traz nenhuma das vozes de dialetos chineses.
  • Dois limites moldam a integração: o texto de entrada é limitado a 600 caracteres, e language_type assume Auto por padrão, o que a Alibaba diz não garantir precisão, recomendando substituí-lo por um idioma explícito quando o texto está em um único idioma.
  • Sem streaming, ele retorna a URL de um arquivo de áudio válida por 24 horas, enquanto com streaming retorna PCM codificado em Base64 em chunks, com a URL apenas no pacote final, e os exemplos oficiais reproduzem esse stream como áudio mono de 24 kHz e 16 bits.
  • A cobrança conta os caracteres do texto de entrada, a $0,115 por 10.000 no escopo de implantação internacional, e o áudio de saída é gratuito.
  • A Synthorai o serve pelo endpoint /v1/audio/speech compatível com OpenAI.

Perguntas frequentes

A API do Qwen3 TTS Instruct Flash é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $11.5/M de tokens de entrada, só esse crédito já cobre cerca de 21 requisições de ~4K tokens ao Qwen3 TTS Instruct Flash.

Em que o Qwen3 TTS Instruct Flash é melhor?

Instruções em linguagem comum controlam velocidade, emoção e estilo; modelo http para audiolivros e locuções, não para tempo real; dez idiomas, limite de 600 caracteres de entrada. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3 TTS Instruct Flash?

Na Synthorai, o Qwen3 TTS Instruct Flash custa $11.5 por milhão de tokens de entrada e $0 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

O Qwen3 TTS Instruct Flash suporta cache de prompts?

O Qwen3 TTS Instruct Flash não tem desconto de leitura de cache na Synthorai hoje. O cache de prompts continua valendo para outros modelos do gateway; veja na tabela de preços as alternativas com cache habilitado. Comparativo de cache entre provedores →

Como obtenho acesso ao Qwen3 TTS Instruct Flash?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3-tts-instruct-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Obtenha sua chave de API gratuita Compare seu custo →