Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Qwen3 TTS Instruct Flash vs BytePlus Seed TTS 2.0

vs

Lequel choisir, et quand

qwen3-tts-instruct-flash revient 2.6x moins cher par million de caractères ($11.5 contre $30) et les deux acceptent une direction de voix en langage naturel, mais les limites de requête diffèrent nettement : 600 caractères contre 4096. seed-tts-2.0 offre en plus des paramètres numériques de voix à côté du contrôle descriptif et publie ses voix regroupées par scénario. Prenez qwen3-tts-instruct-flash pour le coût sur des répliques courtes, seed-tts-2.0 pour des passages longs et un contrôle de voix plus fin.

Tarifs

Qwen3 TTS Instruct Flash BytePlus Seed TTS 2.0 Δ
Par 1M de caractères $11.5 $30 0.38×

Tarifs relevés dans le catalogue en direct à la génération du site ; la page de chaque modèle affiche la grille tarifaire à jour.

Leur position : prix pour 1M de caractères, parmi les 7 modèles de synthèse vocale facturés dans cette unité (échelle logarithmique)

Capacités

Qwen3 TTS Instruct Flash BytePlus Seed TTS 2.0
Streaming oui oui
SSML undocumented unsupported
Unité de facturation character character

Spécifications

Qwen3 TTS Instruct Flash BytePlus Seed TTS 2.0
Modalités d'entrée texte texte
Modalités de sortie audio audio
Date de sortie - 2025-10-16
Limite par requête 600 characters -
Voix

System voices published with one-line personas, among them Cherry (a sunny, positive, friendly and natural young woman), Serena, Ethan, Chelsie, Momo, Vivian, Moon, Maia, Kai, Nofish (a designer who cannot pronounce retroflex sounds), Bella, Eldric Sage, Mia, Mochi, Bellona, Vincent, Bunny, Neil, Elias, Arthur, Nini, Seren, Pip and Stella

the Qwen-TTS voice list pairs each voice with the exact model ids that accept it.

TTS 2.0 voices carry *_uranus_bigtts speaker IDs and are listed by scenario (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) on the Voice List page

per-voice emotion via audio_params.emotion with emotion_scale 1 to 5 (default 4), speech_rate and loudness_rate in [-50, 100], and post_process.pitch in [-12, 12].

Langues

Chinese (Mandarin), English, German, Italian, Portuguese, Spanish, Japanese, Korean, French and Russian. language_type defaults to Auto for mixed-language or undetermined input, which Alibaba documents as not guaranteeing accuracy

naming a single language is documented to significantly improve synthesis quality. Unlike the Qwen3-TTS-Flash series, the Instruct series lists no Chinese dialect voices (Beijing, Shanghainese, Sichuan, Nanjing, Shaanxi, Hokkien, Tianjin, Cantonese).

English, Chinese, Japanese, German, French, Mexican Spanish, Indonesian Bahasa, Brazilian Portuguese, Italian and Korean
Contrôle de la voix
  • instructions steers speed, emotion and style in natural language, up to 1,600 tokens and documented for Chinese and English only
  • optimize_instructions (default false) rewrites the instruction into a directive better suited to synthesis and has no effect when instructions is empty
  • voice cloning and voice design are both listed as unsupported for this model id
context_texts and section_id are TTS 2.0 only: a plain-language instruction steers rate, emotion, volume and style (only the first list value takes effect, and its text is not billed), and section_id links up to 30 rounds or 10 minutes of earlier synthesis as historical context.
Limites

HTTP non-real-time speech synthesis API

the -realtime suffix marks the WebSocket sibling. Input text capped at 600 characters, multilingual mixed input allowed. Non-streaming returns an audio file URL valid for 24 hours

streaming returns Base64-encoded PCM in chunks with the URL only in the final packet, played back in the official samples as 24 kHz mono 16-bit audio. Billed by input text characters, reported as usage.characters (input_tokens and output_tokens are always 0 on the Qwen3-TTS series)

output audio is free.

Integration via uni-directional streaming HTTP, uni- or bi-directional streaming WebSocket and online SDK

sampling rate 24K/16K/8K on the uni-directional streaming and non-streaming interfaces, 48K/24K/16K/8K on the bi-directional interface

output PCM, OGG_OPUS or MP3 (WAV is accepted but returns multiple headers when streaming)

SSML is not supported

Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : Qwen3 TTS Instruct Flash · BytePlus Seed TTS 2.0

Passez de l'un à l'autre en changeant une seule ligne

Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-tts-instruct-flash",
    # model="seed-tts-2.0",  # décommentez cette ligne, commentez celle du dessus
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenez votre clé API →

FAQ

Lequel est le moins cher, Qwen3 TTS Instruct Flash ou BytePlus Seed TTS 2.0 ?

Qwen3 TTS Instruct Flash est moins cher sur la ligne « Par 1M de caractères » ($11.5 contre $30, soit un écart de 2.6×). D'autres lignes peuvent dire l'inverse : le tableau ci-dessus donne la grille tarifaire complète, et le coût réel dépend de la composition de votre trafic.

Puis-je faire un test A/B entre Qwen3 TTS Instruct Flash et BytePlus Seed TTS 2.0 sans deux intégrations ?

Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.

Comment la synthèse vocale est-elle facturée ?

Au caractère de texte en entrée, avec un plafond de caractères par requête indiqué dans le tableau des spécifications. Avec l'un comme avec l'autre, un texte long doit être découpé en plusieurs requêtes.

Comparatifs associés

Nos études, mesures à l'appui