🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Qwen3 TTS Instruct Flash

Alibaba Sintesi vocaleStreaming
Input$11.5/M
Contesto4K

Prezzi di listino del provider: senza ricarico della piattaforma, pagamento a consumo. Questi sono i prezzi di listino ufficiali. I clienti autenticati possono vedere i prezzi effettivi, inclusi gli sconti workspace, su /console/pricing.

Usa Qwen3 TTS Instruct Flash in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-tts-instruct-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Specifiche e limiti

Audio

Lingue
Cinese (mandarino), inglese, tedesco, italiano, portoghese, spagnolo, giapponese, coreano, francese e russo. language_type è predefinito ad Auto per input multilingue o indeterminato, cosa che Alibaba documenta come non garante dell'accuratezza; indicare una singola lingua è documentato come un miglioramento significativo della qualità di sintesi. A differenza della serie Qwen3-TTS-Flash, la serie Instruct non elenca voci di dialetti cinesi (pechinese, shanghainese, sichuanese, nanchinese, shaanxi, hokkien, tianjin, cantonese).
Limiti audio
  • API HTTP di sintesi vocale non in tempo reale
  • il suffisso -realtime indica il fratello WebSocket. Testo in ingresso limitato a 600 caratteri, input misto multilingue ammesso. Il non-streaming restituisce l'URL di un file audio valido per 24 ore
  • lo streaming restituisce PCM codificato in Base64 a blocchi con l'URL solo nel pacchetto finale, riprodotto nei campioni ufficiali come audio mono a 24 kHz e 16 bit. Fatturato per caratteri del testo in ingresso, riportati come usage.characters (input_tokens e output_tokens sono sempre 0 sulla serie Qwen3-TTS)
  • l'audio in uscita è gratuito

Tempo reale

Voci
Voci di sistema pubblicate con persona descritte in una riga, tra cui Cherry (una giovane donna solare, positiva, amichevole e naturale), Serena, Ethan, Chelsie, Momo, Vivian, Moon, Maia, Kai, Nofish (un designer che non riesce a pronunciare i suoni retroflessi), Bella, Eldric Sage, Mia, Mochi, Bellona, Vincent, Bunny, Neil, Elias, Arthur, Nini, Seren, Pip e Stella; l'elenco delle voci Qwen-TTS abbina ogni voce agli id di modello esatti che la accettano.
Sessione
  • instructions guida velocità, emozione e stile in linguaggio naturale, fino a 1.600 token e documentato solo per cinese e inglese
  • optimize_instructions (predefinito false) riscrive l'istruzione in una direttiva più adatta alla sintesi e non ha effetto quando instructions è vuoto
  • la clonazione della voce e la voice design sono entrambe indicate come non supportate per questo id di modello

Modello

Modalità
testo → audio

Livello controllabile tramite istruzioni della famiglia Qwen3-TTS di Alibaba su Model Studio, attualmente equivalente allo snapshot qwen3-tts-instruct-flash-2026-01-26. Posizionato per lavori tolleranti alla latenza come la produzione di audiolibri, i voiceover per la formazione online e la creazione di contenuti. Prezzo nella regione di Singapore di $0.115 ogni 10.000 caratteri in ingresso nello scope di deployment internazionale, con una quota gratuita di 110.000 caratteri valida per 90 giorni dopo l'attivazione di Model Studio.

fonte: documentazione ufficiale Alibaba ↗

Informazioni su Qwen3 TTS Instruct Flash

Istruzioni in linguaggio ordinario controllano velocità, emozione e stile
Modello HTTP per audiolibri e voiceover, non realtime
Dieci lingue, tetto di 600 caratteri in ingresso

Qwen3-TTS-Instruct-Flash è il livello controllabile tramite istruzioni della famiglia Qwen3-TTS di Alibaba su Model Studio, con prezzi nella regione di Singapore e attualmente equivalente allo snapshot qwen3-tts-instruct-flash-2026-01-26.

  • Model Studio divide la famiglia per trasporto anziché per capacità: un id che porta il suffisso realtime parla WebSocket, mentre questo, che ne è privo, è il modello HTTP dietro quella che Alibaba chiama sintesi vocale non in tempo reale, pensata per scenari tolleranti alla latenza come la produzione di audiolibri, i voiceover per la formazione online e la creazione di contenuti.
  • Il controllo tramite istruzioni è la ragione per preferirlo al semplice qwen3-tts-flash.
  • Descrivi in linguaggio ordinario la resa che vuoi per controllare velocità, emozione e stile a ogni richiesta, e gli esempi documentati sono parlare con delicatezza a ritmo più lento oppure usare uno stile da annuncio entusiasta; il campo instructions accetta fino a 1.600 token ed è documentato solo per cinese e inglese, mentre optimize_instructions, disattivato di default, fa riscrivere al servizio la tua formulazione in una direttiva più adatta alla sintesi.
  • Le voci sono le persona con nome della famiglia, tra cui Cherry, una giovane donna solare, positiva, amichevole e naturale, e Nofish, un designer che non riesce a pronunciare i suoni retroflessi, e l'elenco delle voci indica quali id di modello accettano ciascuna.
  • Sono coperte dieci lingue, cinese (mandarino), inglese, tedesco, italiano, portoghese, spagnolo, giapponese, coreano, francese e russo, e a differenza di qwen3-tts-flash la linea Instruct non porta nessuna delle voci dei dialetti cinesi.
  • Due limiti condizionano l'integrazione: il testo in ingresso è limitato a 600 caratteri, e language_type è predefinito ad Auto, che secondo Alibaba non garantisce l'accuratezza e che l'azienda consiglia di sostituire con una lingua esplicita per il testo monolingue.
  • Il non-streaming restituisce l'URL di un file audio valido per 24 ore, mentre lo streaming restituisce PCM codificato in Base64 a blocchi con l'URL solo nel pacchetto finale, e i campioni ufficiali riproducono quel flusso come audio mono a 24 kHz e 16 bit.
  • La fatturazione conta i caratteri del testo in ingresso, a $0.115 ogni 10.000 nello scope di deployment internazionale, e l'audio in uscita è gratuito.
  • Synthorai lo serve tramite l'endpoint /v1/audio/speech compatibile OpenAI.

FAQ

L'API di Qwen3 TTS Instruct Flash si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $11.5/M token in input, quel credito da solo copre circa 21 richieste da ~4K token verso Qwen3 TTS Instruct Flash.

In cosa eccelle Qwen3 TTS Instruct Flash?

Istruzioni in linguaggio ordinario controllano velocità, emozione e stile; modello HTTP per audiolibri e voiceover, non realtime; dieci lingue, tetto di 600 caratteri in ingresso. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Qwen3 TTS Instruct Flash?

Su Synthorai, Qwen3 TTS Instruct Flash costa $11.5 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

Qwen3 TTS Instruct Flash supporta il caching dei prompt?

Qwen3 TTS Instruct Flash oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →

Come ottengo l'accesso a Qwen3 TTS Instruct Flash?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3-tts-instruct-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Ottieni la tua chiave API gratuita Confronta il tuo costo →