🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

TTS-1

OpenAI Sintesi vocaleStreaming
Input$15/M
Contesto4K

Prezzi di listino del provider: senza ricarico della piattaforma, pagamento a consumo. Questi sono i prezzi di listino ufficiali. I clienti autenticati possono vedere i prezzi effettivi, inclusi gli sconti workspace, su /console/pricing.

Usa TTS-1 in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Specifiche e limiti

Audio

Lingue
In genere segue il supporto linguistico del modello Whisper: afrikaans, arabo, armeno, azero, bielorusso, bosniaco, bulgaro, catalano, cinese, croato, ceco, danese, olandese, inglese, estone, finlandese, francese, galiziano, tedesco, greco, ebraico, hindi, ungherese, islandese, indonesiano, italiano, giapponese, kannada, kazako, coreano, lettone, lituano, macedone, malese, marathi, maori, nepalese, norvegese, persiano, polacco, portoghese, rumeno, russo, serbo, slovacco, sloveno, spagnolo, swahili, svedese, tagalog, tamil, thai, turco, ucraino, urdu, vietnamita e gallese, nonostante le voci siano ottimizzate per l'inglese
Limiti audio
  • Solo endpoint di generazione vocale (v1/audio/speech), con Chat Completions, Responses, Realtime, Batch e Fine-tuning tutti indicati come non supportati
  • il testo in input è limitato a 4096 caratteri
  • output mp3 (predefinito), opus, aac, flac, wav o pcm (campioni grezzi a 24 kHz, 16 bit, signed little-endian)
  • riproduzione in tempo reale tramite chunked transfer encoding

Tempo reale

Voci
alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer, un insieme più ristretto rispetto all'elenco TTS completo di 13 voci, e le voci sono attualmente ottimizzate per l'inglese.

Modello

Modalità
testo → audio

Modello text-to-speech ottimizzato per la velocità: OpenAI documenta tts-1 come l'opzione a latenza e qualità inferiori accanto a tts-1-hd. Il parametro instructions che governa accento, emozione, intonazione e tono su gpt-4o-mini-tts non funziona con tts-1 o tts-1-hd.

fonte: documentazione ufficiale OpenAI ↗

Informazioni su TTS-1

Ottimizzato per la velocità e i casi d'uso text-to-speech in realtime
Latenza più bassa a qualità inferiore rispetto a tts-1-hd
Nessun parametro instructions e nessun formato di stream sse

TTS-1 è il modello text-to-speech di OpenAI ottimizzato per la velocità.

  • La pagina del modello lo descrive come un convertitore da testo a parlato dal suono naturale e come tarato per casi d'uso di text-to-speech in realtime, e la guida al text-to-speech traccia la linea di famiglia con chiarezza: tts-1 offre una latenza più bassa, ma a una qualità inferiore rispetto a tts-1-hd.
  • È un modello monouso, supportato solo sull'endpoint speech dell'Audio API e su nessun'altra rotta, che prende testo in ingresso e restituisce audio, al prezzo di $15 per milione di caratteri.
  • Ha a disposizione nove voci, un insieme più piccolo delle tredici che l'endpoint Speech offre in totale: alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer.
  • L'output può essere MP3 di default, oppure Opus, AAC, FLAC, WAV o PCM grezzo a 24 kHz, e OpenAI raccomanda WAV o PCM per la risposta più rapida; la velocità del parlato è regolabile da 0.25 a 4.0, con 1.0 come predefinito, e l'audio può essere trasmesso in streaming con chunked transfer encoding, così la riproduzione inizia prima che il file completo esista.
  • Due limiti distinguono questa generazione dalla più recente e romperanno il codice copiato: il parametro instructions che guida accento, emozione e resa non funziona su tts-1 o tts-1-hd, e il formato di stream sse non è supportato qui.
  • La copertura linguistica segue in generale l'elenco di Whisper di più di cinquanta lingue, anche se le voci stesse sono ottimizzate per l'inglese, e le usage policy di OpenAI richiedono di comunicare agli utenti finali che la voce è generata dall'IA.
  • Synthorai serve TTS-1 tramite il suo endpoint /v1/audio/speech compatibile OpenAI, così i client vocali esistenti funzionano senza modifiche.

FAQ

L'API di TTS-1 si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $15/M token in input, quel credito da solo copre circa 16 richieste da ~4K token verso TTS-1.

In cosa eccelle TTS-1?

Ottimizzato per la velocità e i casi d'uso text-to-speech in realtime; latenza più bassa a qualità inferiore rispetto a tts-1-hd; nessun parametro instructions e nessun formato di stream sse. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa TTS-1?

Su Synthorai, TTS-1 costa $15 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

TTS-1 supporta il caching dei prompt?

TTS-1 oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →

Come ottengo l'accesso a TTS-1?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="tts-1" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Ottieni la tua chiave API gratuita Confronta il tuo costo →