🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

TTS-1 HD

OpenAI Sintesi vocaleStreaming
Input$30/M
Contesto4K

Prezzi di listino del provider: senza ricarico della piattaforma, pagamento a consumo. Questi sono i prezzi di listino ufficiali. I clienti autenticati possono vedere i prezzi effettivi, inclusi gli sconti workspace, su /console/pricing.

Usa TTS-1 HD in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Specifiche e limiti

Audio

Lingue
In genere segue il supporto linguistico del modello Whisper: afrikaans, arabo, armeno, azero, bielorusso, bosniaco, bulgaro, catalano, cinese, croato, ceco, danese, olandese, inglese, estone, finlandese, francese, galiziano, tedesco, greco, ebraico, hindi, ungherese, islandese, indonesiano, italiano, giapponese, kannada, kazako, coreano, lettone, lituano, macedone, malese, marathi, maori, nepalese, norvegese, persiano, polacco, portoghese, rumeno, russo, serbo, slovacco, sloveno, spagnolo, swahili, svedese, tagalog, tamil, thai, turco, ucraino, urdu, vietnamita e gallese, nonostante le voci siano ottimizzate per l'inglese
Limiti audio
  • Solo endpoint di generazione vocale (v1/audio/speech), con Chat Completions, Responses, Realtime, Batch e Fine-tuning tutti indicati come non supportati
  • il testo in input è limitato a 4096 caratteri
  • output mp3 (predefinito), opus, aac, flac, wav o pcm (campioni grezzi a 24 kHz, 16 bit, signed little-endian)
  • riproduzione in tempo reale tramite chunked transfer encoding

Tempo reale

Voci
alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer, un insieme più ristretto rispetto all'elenco TTS completo di 13 voci, e le voci sono attualmente ottimizzate per l'inglese.

Modello

Modalità
testo → audio

Modello text-to-speech ottimizzato per la qualità: lo stesso endpoint Speech di tts-1, tarato su casi d'uso ad alta qualità anziché a bassa latenza. Il parametro instructions che governa accento, emozione, intonazione e tono su gpt-4o-mini-tts non funziona con tts-1 o tts-1-hd.

fonte: documentazione ufficiale OpenAI ↗

Informazioni su TTS-1 HD

Ottimizzato per la qualità anziché per la latenza
Il doppio della tariffa di tts-1, a $30 per milione di caratteri
Adatto a narrazione e audio pubblicato, non al parlato interattivo

TTS-1 HD è il modello text-to-speech di OpenAI ottimizzato per la qualità, la metà a più alta fedeltà della coppia che forma con tts-1.

  • La pagina del modello lo inquadra come un convertitore da testo a parlato dal suono naturale per casi d'uso di text-to-speech di alta qualità, e la guida enuncia il compromesso in modo diretto: tts-1 offre una latenza più bassa, ma a una qualità inferiore rispetto a tts-1-hd.
  • Quella qualità in più è tutta la differenza, ed è prezzata di conseguenza a $30 per milione di caratteri, il doppio della tariffa di tts-1, il che ne fa la scelta per la narrazione, l'audio pubblicato e tutto ciò che un ascoltatore sentirà più di una volta, anziché per il parlato interattivo turno per turno.
  • Tutto il resto è condiviso con il suo gemello.
  • Serve solo l'endpoint speech dell'Audio API, prendendo testo in ingresso e restituendo audio, con le stesse nove voci (alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer), gli stessi formati di output MP3, Opus, AAC, FLAC, WAV e PCM a 24 kHz, lo stesso intervallo di velocità da 0.25 a 4.0 attorno a un predefinito di 1.0, e lo stesso streaming a chunked transfer, così la riproduzione può iniziare presto.
  • Valgono anche le stesse due restrizioni: il parametro instructions per guidare tono e resa è documentato come non funzionante su tts-1 o tts-1-hd, e il formato di stream sse non è supportato, il che lascia lo streaming audio grezzo come unica opzione.
  • La copertura linguistica segue l'elenco di Whisper mentre le voci restano ottimizzate per l'inglese, e OpenAI richiede una comunicazione chiara del fatto che la voce è generata dall'IA.
  • Synthorai serve TTS-1 HD tramite lo stesso endpoint /v1/audio/speech compatibile OpenAI.

FAQ

L'API di TTS-1 HD si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $30/M token in input, quel credito da solo copre circa 8 richieste da ~4K token verso TTS-1 HD.

In cosa eccelle TTS-1 HD?

Ottimizzato per la qualità anziché per la latenza; il doppio della tariffa di tts-1, a $30 per milione di caratteri; adatto a narrazione e audio pubblicato, non al parlato interattivo. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa TTS-1 HD?

Su Synthorai, TTS-1 HD costa $30 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

TTS-1 HD supporta il caching dei prompt?

TTS-1 HD oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →

Come ottengo l'accesso a TTS-1 HD?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="tts-1-hd" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Ottieni la tua chiave API gratuita Confronta il tuo costo →