Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Google TTS Chirp 3 HD vs BytePlus Seed TTS 2.0

vs

Qual usar e quando

Nos fatos do catálogo, esses dois são intercambiáveis: google-tts-chirp3-hd e seed-tts-2.0 ambos cobram $30 por milhão de tokens de entrada, ambos possuem uma janela de contexto de 4096 tokens, e ambos aceitam entrada de texto e retornam áudio sob a mesma capacidade de fala. Sem nenhuma diferença de tarifa, contexto ou modalidade para compensar, a escolha se resume à preferência do fornecedor - Google para google-tts-chirp3-hd, ByteDance para seed-tts-2.0 - e a qualquer saída de voz que seus ouvintes realmente preferirem em um teste A/B. O planejamento de orçamento e tamanho do prompt pode ser idêntico para qualquer um dos dois.

Preços

Google TTS Chirp 3 HD BytePlus Seed TTS 2.0 Δ
Por 1M caracteres $30 $30 =

Tarifas do catálogo em tempo real, lidas no momento do build; a página de cada modelo traz a tabela de preços atual.

Onde cada um fica: preço por 1M caracteres entre os 7 modelos de síntese de voz com esta unidade de cobrança (escala logarítmica)

Capacidades

Google TTS Chirp 3 HD BytePlus Seed TTS 2.0
Streaming sim sim
SSML preview unsupported
Unidade de cobrança character character

Especificações

Google TTS Chirp 3 HD BytePlus Seed TTS 2.0
Modalidades de entrada texto texto
Modalidades de saída áudio áudio
Lançamento 2025-03 2025-10-16
Limite por requisição 5000 bytes -
Vozes Voices are named after stars and published with a gender: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr and Zubenelgenubi. A locale prefix forms the id, e.g. en-US-Chirp3-HD-Charon. Google describes the set as 30 distinct styles across many languages.

TTS 2.0 voices carry *_uranus_bigtts speaker IDs and are listed by scenario (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) on the Voice List page

per-voice emotion via audio_params.emotion with emotion_scale 1 to 5 (default 4), speech_rate and loudness_rate in [-50, 100], and post_process.pitch in [-12, 12].

Idiomas ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN and vi-VN. English, Chinese, Japanese, German, French, Mexican Spanish, Indonesian Bahasa, Brazilian Portuguese, Italian and Korean
Controle de voz
  • Voice controls are Preview: pace via speaking_rate 0.25 to 2.0
  • pause tags [pause short], [pause long] and [pause] accepted only in the markup input field, never in text, and the model may disregard tags placed unnaturally
  • custom pronunciations in IPA or X-SAMPA
  • SSML support is Preview and synchronous-only, unsupported for streaming requests, with unlisted tags ignored and say-as interpret-as=expletive or bleep not supported
context_texts and section_id are TTS 2.0 only: a plain-language instruction steers rate, emotion, volume and style (only the first list value takes effect, and its text is not billed), and section_id links up to 30 rounds or 10 minutes of earlier synthesis as historical context.
Limites

Content limit of 5,000 total bytes per synthesize request. Default response format LINEAR16

streaming supports ALAW, MULAW, OGG_OPUS and PCM, batch adds MP3, so MP3 is not available on the streaming path. The only voice type Google's comparison table marks as streaming-capable. Generally available in the global, us and eu endpoints plus asia-southeast1, europe-west2 and asia-northeast1, but out of scope for regionalization and data residency. Billed per character including spaces and newlines, with all SSML tags except <mark> counted.

Integration via uni-directional streaming HTTP, uni- or bi-directional streaming WebSocket and online SDK

sampling rate 24K/16K/8K on the uni-directional streaming and non-streaming interfaces, 48K/24K/16K/8K on the bi-directional interface

output PCM, OGG_OPUS or MP3 (WAV is accepted but returns multiple headers when streaming)

SSML is not supported

As especificações são transcritas da documentação de cada provedor; quando um provedor não publica um dado, a linha é omitida, e não inferida. Fontes completas: Google TTS Chirp 3 HD · BytePlus Seed TTS 2.0

Troque de um para o outro mudando uma linha

Os dois ids estão em todas as abas abaixo; o par de linhas destacado é a única alteração. O endpoint, a chave e o formato da requisição são os mesmos.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="google-tts-chirp3-hd",
    # model="seed-tts-2.0",  # descomente esta linha, comente a linha acima
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenha sua chave de API →

Perguntas frequentes

Qual é mais barato, Google TTS Chirp 3 HD ou BytePlus Seed TTS 2.0?

Na linha “Por 1M caracteres”, os dois custam o mesmo ($30); o preço não decide este caso. Veja as especificações e capacidades abaixo.

Posso fazer um teste A/B de Google TTS Chirp 3 HD contra BytePlus Seed TTS 2.0 sem duas integrações?

Sim. Os dois são servidos pelo mesmo endpoint compatível com OpenAI, com uma única chave de API. Para trocar, basta mudar uma linha, a string do modelo; assim você pode direcionar uma parte do tráfego para cada um e comparar as contas diretamente.

Como o text-to-speech é cobrado?

Por caractere do texto de entrada, com um limite de caracteres por requisição indicado na tabela de especificações. Nos dois modelos, textos longos precisam ser divididos em várias requisições.

Comparações relacionadas

Dos nossos estudos com medições