Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

BytePlus Seed TTS 2.0

Seed TTS 2.0 est la génération text-to-speech actuelle de ByteDance sur BytePlus, et la présentation officielle la construit autour d'un mécanisme requête-réponse : le modèle lit à la fois la requête de l'utilisateur et le texte de réponse qu'il s'apprête à dire, ce qui, selon BytePlus, élargit la compréhension contextuelle et affine le naturel et l'expression émotionnelle d'une conversation.

Entrée
texte $30/M
Sortie
audio
Contexte
4K

Le prix en contexte

Position du prix parmi 7 modèles comparables

Entrée$30/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Synthèse vocale

Langues de synthèse Anglais, chinois, japonais, allemand, français, espagnol du Mexique, bahasa indonésien, portugais du Brésil, italien et coréen
Voix Les voix TTS 2.0 portent des identifiants de locuteur *_uranus_bigtts et sont listées par scénario (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) sur la page Voice List ; émotion par voix via audio_params.emotion avec emotion_scale de 1 à 5 (4 par défaut), speech_rate et loudness_rate dans [-50, 100], et post_process.pitch dans [-12, 12].
Synthèse en streaming Oui
SSML Non prise en charge
Contrôle de la voix Paramètres numériques et instruction
Ce qui est accepté context_texts et section_id sont propres à TTS 2.0: une instruction en langage naturel oriente le débit, l'émotion, le volume et le style (seule la première valeur de la liste prend effet, et son texte n'est pas facturé), et section_id rattache jusqu'à 30 tours ou 10 minutes de synthèse antérieure comme contexte historique.
Unité de facturation Par caractère d'entrée
Points de terminaison et formats
  • Intégration via HTTP en streaming unidirectionnel, WebSocket en streaming uni- ou bidirectionnel et SDK en ligne
  • fréquence d'échantillonnage 24K/16K/8K sur les interfaces en streaming unidirectionnel et non-streaming, 48K/24K/16K/8K sur l'interface bidirectionnelle
  • sortie PCM, OGG_OPUS ou MP3 (le WAV est accepté mais renvoie plusieurs en-têtes en streaming)
  • SSML n'est pas pris en charge

Modèle

Modalités texte → audio
  • TTS question-réponse qui comprend ensemble la question et le texte de la réponse, et ajoute par rapport à TTS 1.0 des prompts textuels pour l'émotion, le ton, le débit et la hauteur, des balises d'émotion au niveau de la phrase et la compréhension du contexte. Sélectionné via le X-Api-Resource-Id seed-tts-2.0
  • enable_subtitle renvoie les horodatages de mots et de phonèmes sur les voix TTS 2.0 (chinois et anglais uniquement)
  • cache de réponse optionnel conservé 1 heure

selon docs officielles ByteDance ↗

Utilisez BytePlus Seed TTS 2.0 en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="seed-tts-2.0",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

À propos de BytePlus Seed TTS 2.0

  • Elle désigne les assistants IA, les compagnons IA, les centres d'appels et le doublage vidéo comme scénarios cibles.
  • Trois fonctionnalités sont présentées comme exclusives à la 2.0 par rapport à la ligne 1.0 : un prompt textuel qui pilote l'émotion, le ton, le débit et la hauteur en langage courant ; une balise d'émotion au niveau de la phrase ; et la compréhension du contexte, où vous fournissez le dialogue environnant et où le modèle reporte sa tonalité émotionnelle dans la synthèse.
  • Dix langues sont couvertes, à savoir l'anglais, le chinois, le japonais, l'allemand, le français, l'espagnol mexicain, l'indonésien, le portugais brésilien, l'italien et le coréen, accessibles via le streaming HTTP unidirectionnel, le WebSocket en streaming unidirectionnel ou bidirectionnel, et le SDK en ligne.
  • L'audio revient en PCM par défaut, ou en OGG_OPUS ou MP3, à une fréquence d'échantillonnage par défaut de 24 kHz, et le WAV est documenté comme ne prenant pas du tout en charge le streaming.
  • La surface de requête est riche : un identifiant de voix choisi dans la liste publiée, un débit et un volume chacun sur une échelle de -50 à 100, un réglage d'émotion avec une intensité de 1 à 5 que seules certaines voix acceptent, des horodatages optionnels au niveau du mot et du phonème pour le chinois et l'anglais, et un cache de synthèse d'une heure pour les textes répétés.
  • Deux notes pratiques : le SSML n'est pas pris en charge actuellement dans le texte d'entrée, et le contexte transmis pour le pilotage émotionnel n'est pas facturé.
  • La facturation se fait sinon au caractère, espaces et ponctuation compris.
  • Synthorai le sert via l'endpoint /v1/audio/speech compatible OpenAI, aux côtés du reste de son catalogue vocal.

FAQ

Peut-on essayer l'API BytePlus Seed TTS 2.0 gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer BytePlus Seed TTS 2.0 sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de BytePlus Seed TTS 2.0 ?

Destiné aux assistants IA, aux centres d'appels et au doublage vidéo ; un prompt en langage courant pilote l'émotion, le ton, le débit et la hauteur ; lit la requête de l'utilisateur en plus du texte de réponse qu'il énonce. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte BytePlus Seed TTS 2.0 ?

Sur Synthorai, BytePlus Seed TTS 2.0 coûte $30 par million de tokens en entrée et $0 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.

BytePlus Seed TTS 2.0 prend-il en charge la mise en cache des prompts ?

BytePlus Seed TTS 2.0 n'a pas de remise sur les lectures de cache sur Synthorai aujourd'hui. La mise en cache des prompts s'applique toujours aux autres modèles de la passerelle ; voir la table des prix pour les alternatives compatibles avec le cache. Comparatif de la mise en cache par fournisseur →

Comment obtenir l'accès à BytePlus Seed TTS 2.0 ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="seed-tts-2.0", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →