🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

TTS-1

OpenAI SprachsyntheseStreaming
Input$15/M
Kontext4K

Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten.

TTS-1 in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Spezifikationen & Limits

Audio

Sprachen
Folgt im Wesentlichen der Sprachunterstützung des Whisper-Modells: Afrikaans, Arabisch, Armenisch, Aserbaidschanisch, Belarussisch, Bosnisch, Bulgarisch, Katalanisch, Chinesisch, Kroatisch, Tschechisch, Dänisch, Niederländisch, Englisch, Estnisch, Finnisch, Französisch, Galicisch, Deutsch, Griechisch, Hebräisch, Hindi, Ungarisch, Isländisch, Indonesisch, Italienisch, Japanisch, Kannada, Kasachisch, Koreanisch, Lettisch, Litauisch, Mazedonisch, Malaiisch, Marathi, Maori, Nepalesisch, Norwegisch, Persisch, Polnisch, Portugiesisch, Rumänisch, Russisch, Serbisch, Slowakisch, Slowenisch, Spanisch, Suaheli, Schwedisch, Tagalog, Tamil, Thailändisch, Türkisch, Ukrainisch, Urdu, Vietnamesisch und Walisisch, obwohl die Stimmen auf Englisch optimiert sind
Audio-Limits
  • Nur der Endpoint zur Sprachgenerierung (v1/audio/speech)
  • Chat Completions, Responses, Realtime, Batch und Fine-Tuning sind sämtlich als nicht unterstützt gelistet
  • der Eingabetext ist auf 4096 Zeichen begrenzt
  • Output als mp3 (Standard), opus, aac, flac, wav oder pcm (rohe 24-kHz-16-Bit-Samples, vorzeichenbehaftet, Little Endian)
  • Echtzeitwiedergabe über Chunked Transfer Encoding

Realtime

Stimmen
alloy, ash, coral, echo, fable, onyx, nova, sage und shimmer, eine kleinere Auswahl als die vollständige TTS-Liste mit 13 Stimmen, und die Stimmen sind derzeit auf Englisch optimiert.

Modell

Modalitäten
Text → Audio

Auf Geschwindigkeit optimiertes Text-to-Speech-Modell: OpenAI dokumentiert tts-1 als die Option mit geringerer Latenz und geringerer Qualität neben tts-1-hd. Der instructions-Parameter, der bei gpt-4o-mini-tts Akzent, Emotion, Intonation und Tonfall steuert, funktioniert bei tts-1 und tts-1-hd nicht.

laut Offizielle OpenAI-Dokumentation ↗

Über TTS-1

Auf Geschwindigkeit und Echtzeit-Text-to-Speech-Anwendungsfälle optimiert
Niedrigere Latenz bei geringerer Qualität als tts-1-hd
Kein instructions-Parameter und kein sse-Stream-Format

TTS-1 ist OpenAIs auf Geschwindigkeit optimiertes Text-to-Speech-Modell.

  • Seine Modellseite beschreibt es als Umwandlung von Text in natürlich klingende gesprochene Sprache und als auf Echtzeit-Text-to-Speech-Anwendungsfälle abgestimmt, und der Text-to-Speech-Leitfaden zieht die Familienlinie unmissverständlich: tts-1 bietet niedrigere Latenz, aber bei geringerer Qualität als tts-1-hd.
  • Es ist ein Einzweckmodell, das nur auf dem Speech-Endpoint der Audio API und auf keiner anderen Route unterstützt wird, Text entgegennimmt und Audio zurückgibt, zu $15 pro Million Zeichen.
  • Neun Stimmen stehen ihm zur Verfügung, ein kleinerer Satz als die dreizehn, die der Speech-Endpoint insgesamt anbietet: alloy, ash, coral, echo, fable, onyx, nova, sage und shimmer.
  • Die Ausgabe kann standardmäßig MP3 sein oder Opus, AAC, FLAC, WAV oder rohes 24-kHz-PCM, und OpenAI empfiehlt WAV oder PCM für die schnellste Antwort; die Sprechgeschwindigkeit ist von 0.25 bis 4.0 einstellbar, mit 1.0 als Standard, und Audio kann mit Chunked Transfer Encoding gestreamt werden, sodass die Wiedergabe beginnt, bevor die vollständige Datei existiert.
  • Zwei Grenzen unterscheiden diese Generation von der neueren und werden kopierten Code brechen: Der instructions-Parameter, der Akzent, Emotion und Vortrag steuert, funktioniert bei tts-1 und tts-1-hd nicht, und das sse-Stream-Format wird hier nicht unterstützt.
  • Die Sprachabdeckung folgt im Allgemeinen Whispers Liste von mehr als fünfzig Sprachen, wobei die Stimmen selbst auf Englisch optimiert sind, und OpenAIs Nutzungsrichtlinien verlangen, Endnutzern mitzuteilen, dass die Stimme KI-generiert ist.
  • Synthorai stellt TTS-1 über seinen OpenAI-kompatiblen /v1/audio/speech Endpoint bereit, sodass bestehende Speech-Clients unverändert funktionieren.

FAQ

Lässt sich die TTS-1 API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $15/M Input-Tokens deckt allein dieses Guthaben rund 16 Requests mit je ~4K Tokens gegen TTS-1 ab.

Worin ist TTS-1 am besten?

Auf Geschwindigkeit und Echtzeit-Text-to-Speech-Anwendungsfälle optimiert; niedrigere Latenz bei geringerer Qualität als tts-1-hd; kein instructions-Parameter und kein sse-Stream-Format. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet TTS-1?

TTS-1 kostet auf Synthorai $15 pro Million Input-Tokens und $0 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.

Unterstützt TTS-1 Prompt-Caching?

TTS-1 hat auf Synthorai derzeit keinen Cache-Lese-Rabatt. Prompt-Caching gilt weiterhin für andere Modelle auf dem Gateway; cache-fähige Alternativen finden Sie in der Preistabelle. Caching-Vergleich der Anbieter →

Wie erhalte ich Zugang zu TTS-1?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="tts-1", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Kostenlosen API-Key holen Ihre Kosten vergleichen →