Qwen3-TTS-Instruct-Flash è il livello controllabile tramite istruzioni della famiglia Qwen3-TTS di Alibaba su Model Studio, con prezzi nella regione di Singapore e attualmente equivalente allo snapshot qwen3-tts-instruct-flash-2026-01-26.
- Input
- testo $11.5/M
- Output
- audio
- Contesto
- 4K
Il prezzo nel contesto
Posizione del prezzo tra 7 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Sintesi vocale
| Lingue di sintesi | Cinese (mandarino), inglese, tedesco, italiano, portoghese, spagnolo, giapponese, coreano, francese e russo. language_type è predefinito ad Auto per input multilingue o indeterminato, cosa che Alibaba documenta come non garante dell'accuratezza; indicare una singola lingua è documentato come un miglioramento significativo della qualità di sintesi. A differenza della serie Qwen3-TTS-Flash, la serie Instruct non elenca voci di dialetti cinesi (pechinese, shanghainese, sichuanese, nanchinese, shaanxi, hokkien, tianjin, cantonese). |
|---|---|
| Voci | Voci di sistema pubblicate con persona descritte in una riga, tra cui Cherry (una giovane donna solare, positiva, amichevole e naturale), Serena, Ethan, Chelsie, Momo, Vivian, Moon, Maia, Kai, Nofish (un designer che non riesce a pronunciare i suoni retroflessi), Bella, Eldric Sage, Mia, Mochi, Bellona, Vincent, Bunny, Neil, Elias, Arthur, Nini, Seren, Pip e Stella; l'elenco delle voci Qwen-TTS abbina ogni voce agli id di modello esatti che la accettano. |
| Limite di input | 600 caratteri I fornitori pubblicano questo limite in unità diverse: su testo non latino, un limite in byte non equivale a un limite in caratteri. |
| Sintesi in streaming | Sì |
| SSML | Non documentato |
| Controllo della voce | Istruzione in linguaggio naturale |
| Cosa accetta |
|
| Unità di fatturazione | Per carattere di input |
| Endpoint e formati |
|
Modello
| Modalità | testo → audio |
|---|
Livello controllabile tramite istruzioni della famiglia Qwen3-TTS di Alibaba su Model Studio, attualmente equivalente allo snapshot qwen3-tts-instruct-flash-2026-01-26. Posizionato per lavori tolleranti alla latenza come la produzione di audiolibri, i voiceover per la formazione online e la creazione di contenuti. Prezzo nella regione di Singapore di $0.115 ogni 10.000 caratteri in ingresso nello scope di deployment internazionale, con una quota gratuita di 110.000 caratteri valida per 90 giorni dopo l'attivazione di Model Studio.
Usa Qwen3 TTS Instruct Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-tts-instruct-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-tts-instruct-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-instruct-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-tts-instruct-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-tts-instruct-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Qwen3 TTS Instruct Flash
- Model Studio divide la famiglia per trasporto anziché per capacità: un id che porta il suffisso realtime parla WebSocket, mentre questo, che ne è privo, è il modello HTTP dietro quella che Alibaba chiama sintesi vocale non in tempo reale, pensata per scenari tolleranti alla latenza come la produzione di audiolibri, i voiceover per la formazione online e la creazione di contenuti.
- Il controllo tramite istruzioni è la ragione per preferirlo al semplice qwen3-tts-flash.
- Descrivi in linguaggio ordinario la resa che vuoi per controllare velocità, emozione e stile a ogni richiesta, e gli esempi documentati sono parlare con delicatezza a ritmo più lento oppure usare uno stile da annuncio entusiasta; il campo instructions accetta fino a 1.600 token ed è documentato solo per cinese e inglese, mentre optimize_instructions, disattivato di default, fa riscrivere al servizio la tua formulazione in una direttiva più adatta alla sintesi.
- Le voci sono le persona con nome della famiglia, tra cui Cherry, una giovane donna solare, positiva, amichevole e naturale, e Nofish, un designer che non riesce a pronunciare i suoni retroflessi, e l'elenco delle voci indica quali id di modello accettano ciascuna.
- Sono coperte dieci lingue, cinese (mandarino), inglese, tedesco, italiano, portoghese, spagnolo, giapponese, coreano, francese e russo, e a differenza di qwen3-tts-flash la linea Instruct non porta nessuna delle voci dei dialetti cinesi.
- Due limiti condizionano l'integrazione: il testo in ingresso è limitato a 600 caratteri, e language_type è predefinito ad Auto, che secondo Alibaba non garantisce l'accuratezza e che l'azienda consiglia di sostituire con una lingua esplicita per il testo monolingue.
- Il non-streaming restituisce l'URL di un file audio valido per 24 ore, mentre lo streaming restituisce PCM codificato in Base64 a blocchi con l'URL solo nel pacchetto finale, e i campioni ufficiali riproducono quel flusso come audio mono a 24 kHz e 16 bit.
- La fatturazione conta i caratteri del testo in ingresso, a $0.115 ogni 10.000 nello scope di deployment internazionale, e l'audio in uscita è gratuito.
- Synthorai lo serve tramite l'endpoint /v1/audio/speech compatibile OpenAI.
FAQ
L'API di Qwen3 TTS Instruct Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Qwen3 TTS Instruct Flash sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle Qwen3 TTS Instruct Flash?
Istruzioni in linguaggio ordinario controllano velocità, emozione e stile; modello HTTP per audiolibri e voiceover, non realtime; dieci lingue, tetto di 600 caratteri in ingresso. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Qwen3 TTS Instruct Flash?
Su Synthorai, Qwen3 TTS Instruct Flash costa $11.5 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.
Qwen3 TTS Instruct Flash supporta il caching dei prompt?
Qwen3 TTS Instruct Flash oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →
Come ottengo l'accesso a Qwen3 TTS Instruct Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3-tts-instruct-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.