Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

TTS-1 vs TTS-1 HD

vs

Quale scegliere e quando

Stesso limite di 4096 caratteri, stesso streaming, stesse voci e la stessa assenza di controllo della voce; tts-1-hd costa $30 per milione di caratteri contro $15, esattamente 2x, per la resa di qualità superiore. Nient'altro nelle specifiche pubblicate li separa. Scegli tts-1 per bozze e volume, tts-1-hd quando l'audio arriva agli utenti.

Prezzi

TTS-1 TTS-1 HD Δ
Per 1M caratteri $15 $30 0.5×

Tariffe lette dal catalogo live al momento della build; il listino aggiornato è sulla pagina di ciascun modello.

Dove si collocano: prezzo per 1M di caratteri tra tutti i modelli di sintesi vocale con questa unità di fatturazione (7, scala logaritmica)

Funzionalità

TTS-1 TTS-1 HD
Streaming sì sì
SSML undocumented undocumented
Unità di fatturazione character character

Specifiche

TTS-1 TTS-1 HD
Modalità di input testo testo
Modalità di output audio audio
Rilascio 2023-11-06 2023-11-06
Limite per richiesta 4096 characters 4096 characters
Voci alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English. alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English.
Lingue Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English
Controllo della voce none none
Limiti

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

Le specifiche sono riprese dalla documentazione di ciascun provider; se un provider non pubblica un dato, la riga viene omessa e non dedotta. Fonti complete: TTS-1 · TTS-1 HD

Passa dall'uno all'altro cambiando una sola riga

In ogni scheda qui sotto ci sono entrambi gli id: le due righe evidenziate sono l'unica modifica. Stesso endpoint, stessa chiave, stessa struttura della richiesta.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="tts-1",
    # model="tts-1-hd",  # decommenta questa riga, commenta quella sopra
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Ottieni la tua chiave API →

FAQ

Qual è il più economico, TTS-1 o TTS-1 HD?

TTS-1 costa meno alla voce Per 1M caratteri ($15 contro $30, 2.0× di differenza). Altre voci potrebbero dire il contrario: la tabella qui sopra riporta il listino completo, e il costo reale dipende dal tuo mix di utilizzo.

Posso fare un A/B test di TTS-1 contro TTS-1 HD senza due integrazioni?

Sì. Si chiamano entrambi dallo stesso endpoint compatibile con OpenAI, con una sola chiave API. Per passare dall'uno all'altro basta cambiare la stringa del modello in una riga, quindi puoi mandare una parte del traffico a ciascuno e confrontare direttamente i costi.

Come viene fatturata la sintesi vocale?

Per carattere del testo di input, con un tetto massimo di caratteri per richiesta indicato nella tabella delle specifiche. Con entrambi i modelli i testi lunghi vanno suddivisi su più richieste.

Confronti correlati

Dai nostri studi con dati misurati