Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Qwen3 TTS Instruct Flash vs TTS-1 HD

vs

Lequel choisir, et quand

qwen3-tts-instruct-flash coûte $11.5 par million de caractères contre $30, environ 2.6x moins, et c'est le seul des deux qui permet de diriger la voix en langage naturel - tts-1-hd n'expose aucun contrôle de voix. Le compromis est la taille de requête, 600 caractères contre 4096, donc les textes longs doivent être découpés. Les deux diffusent. Prenez tts-1-hd pour de longs passages en un appel, qwen3-tts-instruct-flash pour des répliques courtes dirigées à moindre coût.

Tarifs

Qwen3 TTS Instruct Flash TTS-1 HD Δ
Par 1M de caractères $11.5 $30 0.38×

Tarifs relevés dans le catalogue en direct à la génération du site ; la page de chaque modèle affiche la grille tarifaire à jour.

Leur position : prix pour 1M de caractères, parmi les 7 modèles de synthèse vocale facturés dans cette unité (échelle logarithmique)

Capacités

Qwen3 TTS Instruct Flash TTS-1 HD
Streaming oui oui
SSML undocumented undocumented
Unité de facturation character character

Spécifications

Qwen3 TTS Instruct Flash TTS-1 HD
Modalités d'entrée texte texte
Modalités de sortie audio audio
Date de sortie - 2023-11-06
Limite par requête 600 characters 4096 characters
Voix

System voices published with one-line personas, among them Cherry (a sunny, positive, friendly and natural young woman), Serena, Ethan, Chelsie, Momo, Vivian, Moon, Maia, Kai, Nofish (a designer who cannot pronounce retroflex sounds), Bella, Eldric Sage, Mia, Mochi, Bellona, Vincent, Bunny, Neil, Elias, Arthur, Nini, Seren, Pip and Stella

the Qwen-TTS voice list pairs each voice with the exact model ids that accept it.

alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English.
Langues

Chinese (Mandarin), English, German, Italian, Portuguese, Spanish, Japanese, Korean, French and Russian. language_type defaults to Auto for mixed-language or undetermined input, which Alibaba documents as not guaranteeing accuracy

naming a single language is documented to significantly improve synthesis quality. Unlike the Qwen3-TTS-Flash series, the Instruct series lists no Chinese dialect voices (Beijing, Shanghainese, Sichuan, Nanjing, Shaanxi, Hokkien, Tianjin, Cantonese).

Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English
Contrôle de la voix
  • instructions steers speed, emotion and style in natural language, up to 1,600 tokens and documented for Chinese and English only
  • optimize_instructions (default false) rewrites the instruction into a directive better suited to synthesis and has no effect when instructions is empty
  • voice cloning and voice design are both listed as unsupported for this model id
none
Limites

HTTP non-real-time speech synthesis API

the -realtime suffix marks the WebSocket sibling. Input text capped at 600 characters, multilingual mixed input allowed. Non-streaming returns an audio file URL valid for 24 hours

streaming returns Base64-encoded PCM in chunks with the URL only in the final packet, played back in the official samples as 24 kHz mono 16-bit audio. Billed by input text characters, reported as usage.characters (input_tokens and output_tokens are always 0 on the Qwen3-TTS series)

output audio is free.

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : Qwen3 TTS Instruct Flash · TTS-1 HD

Passez de l'un à l'autre en changeant une seule ligne

Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-tts-instruct-flash",
    # model="tts-1-hd",  # décommentez cette ligne, commentez celle du dessus
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenez votre clé API →

FAQ

Lequel est le moins cher, Qwen3 TTS Instruct Flash ou TTS-1 HD ?

Qwen3 TTS Instruct Flash est moins cher sur la ligne « Par 1M de caractères » ($11.5 contre $30, soit un écart de 2.6×). D'autres lignes peuvent dire l'inverse : le tableau ci-dessus donne la grille tarifaire complète, et le coût réel dépend de la composition de votre trafic.

Puis-je faire un test A/B entre Qwen3 TTS Instruct Flash et TTS-1 HD sans deux intégrations ?

Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.

Comment la synthèse vocale est-elle facturée ?

Au caractère de texte en entrée, avec un plafond de caractères par requête indiqué dans le tableau des spécifications. Avec l'un comme avec l'autre, un texte long doit être découpé en plusieurs requêtes.

Comparatifs associés

Nos études, mesures à l'appui