🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

BytePlus Seed TTS 2.0

ByteDance Synthèse vocaleStreamingMise en cache des prompts
Entrée$30/M
Contexte4K

Prix catalogue du fournisseur : sans majoration de plateforme, paiement à l'usage. Ce sont les prix catalogue officiels. Les clients connectés peuvent voir les prix effectifs incluant les remises de l’espace de travail sur /console/pricing.

Utilisez BytePlus Seed TTS 2.0 en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="seed-tts-2.0",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Spécifications et limites

Audio

Langues
Anglais, chinois, japonais, allemand, français, espagnol du Mexique, bahasa indonésien, portugais du Brésil, italien et coréen
Limites audio
  • Intégration via HTTP en streaming unidirectionnel, WebSocket en streaming uni- ou bidirectionnel et SDK en ligne
  • fréquence d'échantillonnage 24K/16K/8K sur les interfaces en streaming unidirectionnel et non-streaming, 48K/24K/16K/8K sur l'interface bidirectionnelle
  • sortie PCM, OGG_OPUS ou MP3 (le WAV est accepté mais renvoie plusieurs en-têtes en streaming)
  • SSML n'est pas pris en charge

Temps réel

Voix
Les voix TTS 2.0 portent des identifiants de locuteur *_uranus_bigtts et sont listées par scénario (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) sur la page Voice List ; émotion par voix via audio_params.emotion avec emotion_scale de 1 à 5 (4 par défaut), speech_rate et loudness_rate dans [-50, 100], et post_process.pitch dans [-12, 12].
Session
context_texts et section_id sont propres à TTS 2.0 : une instruction en langage naturel oriente le débit, l'émotion, le volume et le style (seule la première valeur de la liste prend effet, et son texte n'est pas facturé), et section_id rattache jusqu'à 30 tours ou 10 minutes de synthèse antérieure comme contexte historique.

Modèle

Modalités
texte → audio
  • TTS question-réponse qui comprend ensemble la question et le texte de la réponse, et ajoute par rapport à TTS 1.0 des prompts textuels pour l'émotion, le ton, le débit et la hauteur, des balises d'émotion au niveau de la phrase et la compréhension du contexte. Sélectionné via le X-Api-Resource-Id seed-tts-2.0
  • enable_subtitle renvoie les horodatages de mots et de phonèmes sur les voix TTS 2.0 (chinois et anglais uniquement)
  • cache de réponse optionnel conservé 1 heure

selon docs officielles ByteDance ↗

À propos de BytePlus Seed TTS 2.0

Destiné aux assistants IA, aux centres d'appels et au doublage vidéo
Un prompt en langage courant pilote l'émotion, le ton, le débit et la hauteur
Lit la requête de l'utilisateur en plus du texte de réponse qu'il énonce

Seed TTS 2.0 est la génération text-to-speech actuelle de ByteDance sur BytePlus, et la présentation officielle la construit autour d'un mécanisme requête-réponse : le modèle lit à la fois la requête de l'utilisateur et le texte de réponse qu'il s'apprête à dire, ce qui, selon BytePlus, élargit la compréhension contextuelle et affine le naturel et l'expression émotionnelle d'une conversation.

  • Elle désigne les assistants IA, les compagnons IA, les centres d'appels et le doublage vidéo comme scénarios cibles.
  • Trois fonctionnalités sont présentées comme exclusives à la 2.0 par rapport à la ligne 1.0 : un prompt textuel qui pilote l'émotion, le ton, le débit et la hauteur en langage courant ; une balise d'émotion au niveau de la phrase ; et la compréhension du contexte, où vous fournissez le dialogue environnant et où le modèle reporte sa tonalité émotionnelle dans la synthèse.
  • Dix langues sont couvertes, à savoir l'anglais, le chinois, le japonais, l'allemand, le français, l'espagnol mexicain, l'indonésien, le portugais brésilien, l'italien et le coréen, accessibles via le streaming HTTP unidirectionnel, le WebSocket en streaming unidirectionnel ou bidirectionnel, et le SDK en ligne.
  • L'audio revient en PCM par défaut, ou en OGG_OPUS ou MP3, à une fréquence d'échantillonnage par défaut de 24 kHz, et le WAV est documenté comme ne prenant pas du tout en charge le streaming.
  • La surface de requête est riche : un identifiant de voix choisi dans la liste publiée, un débit et un volume chacun sur une échelle de -50 à 100, un réglage d'émotion avec une intensité de 1 à 5 que seules certaines voix acceptent, des horodatages optionnels au niveau du mot et du phonème pour le chinois et l'anglais, et un cache de synthèse d'une heure pour les textes répétés.
  • Deux notes pratiques : le SSML n'est pas pris en charge actuellement dans le texte d'entrée, et le contexte transmis pour le pilotage émotionnel n'est pas facturé.
  • La facturation se fait sinon au caractère, espaces et ponctuation compris.
  • Synthorai le sert via l'endpoint /v1/audio/speech compatible OpenAI, aux côtés du reste de son catalogue vocal.

FAQ

Peut-on essayer l'API BytePlus Seed TTS 2.0 gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $30/M de tokens en entrée, ce crédit couvre à lui seul environ 8 requêtes de ~4K tokens sur BytePlus Seed TTS 2.0.

Quels sont les points forts de BytePlus Seed TTS 2.0 ?

Destiné aux assistants IA, aux centres d'appels et au doublage vidéo ; un prompt en langage courant pilote l'émotion, le ton, le débit et la hauteur ; lit la requête de l'utilisateur en plus du texte de réponse qu'il énonce. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte BytePlus Seed TTS 2.0 ?

Sur Synthorai, BytePlus Seed TTS 2.0 coûte $30 par million de tokens en entrée et $0 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.

BytePlus Seed TTS 2.0 prend-il en charge la mise en cache des prompts ?

BytePlus Seed TTS 2.0 n'a pas de remise sur les lectures de cache sur Synthorai aujourd'hui. La mise en cache des prompts s'applique toujours aux autres modèles de la passerelle ; voir la table des prix pour les alternatives compatibles avec le cache. Comparatif de la mise en cache par fournisseur →

Comment obtenir l'accès à BytePlus Seed TTS 2.0 ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="seed-tts-2.0", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Obtenez votre clé API gratuite Comparez votre coût →