Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Qwen3 TTS Instruct Flash

Qwen3-TTS-Instruct-Flash ist die per Anweisung steuerbare Stufe von Alibabas Qwen3-TTS-Familie auf Model Studio, bepreist in der Region Singapur und derzeit gleichbedeutend mit dem Snapshot qwen3-tts-instruct-flash-2026-01-26.

Eingabe
Text $11.5/M
Ausgabe
Audio
Kontext
4K

Preis im Vergleich

Preisposition unter 7 vergleichbaren Modellen

Eingabe$11.5/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Sprachsynthese

Synthesesprachen Chinesisch (Mandarin), Englisch, Deutsch, Italienisch, Portugiesisch, Spanisch, Japanisch, Koreanisch, Französisch und Russisch. language_type steht bei gemischtsprachiger oder unbestimmter Eingabe standardmäßig auf Auto, was Alibaba als nicht genauigkeitsgarantierend dokumentiert; die Angabe einer einzelnen Sprache verbessert die Synthesequalität laut Dokumentation deutlich. Anders als die Qwen3-TTS-Flash-Reihe listet die Instruct-Reihe keine chinesischen Dialektstimmen (Peking, Shanghainesisch, Sichuan, Nanjing, Shaanxi, Hokkien, Tianjin, Kantonesisch).
Stimmen Systemstimmen, veröffentlicht mit einzeiligen Personas, darunter Cherry (eine sonnige, positive, freundliche und natürliche junge Frau), Serena, Ethan, Chelsie, Momo, Vivian, Moon, Maia, Kai, Nofish (ein Designer, der Retroflexlaute nicht aussprechen kann), Bella, Eldric Sage, Mia, Mochi, Bellona, Vincent, Bunny, Neil, Elias, Arthur, Nini, Seren, Pip und Stella; die Qwen-TTS-Stimmliste ordnet jeder Stimme genau die Modell-ids zu, die sie akzeptieren.
Eingabelimit 600 Zeichen Anbieter geben dieses Limit in unterschiedlichen Einheiten an: Bei nicht lateinischem Text ist ein Byte-Limit kein Zeichen-Limit.
Streaming-Synthese Ja
SSML Nicht dokumentiert
Stimmsteuerung Anweisung in natürlicher Sprache
Was akzeptiert wird
  • instructions steuert Geschwindigkeit, Emotion und Stil in natürlicher Sprache, bis zu 1.600 Token und nur für Chinesisch und Englisch dokumentiert
  • optimize_instructions (Standard false) schreibt die Anweisung in eine für die Synthese besser geeignete Direktive um und hat keine Wirkung, wenn instructions leer ist
  • Voice Cloning und Voice Design sind für diese Modell-id beide als nicht unterstützt gelistet
Abrechnungseinheit Pro Eingabezeichen
Endpunkte und Formate
  • HTTP-API für nicht-echtzeitfähige Sprachsynthese
  • das Suffix -realtime kennzeichnet das WebSocket-Geschwistermodell. Eingabetext auf 600 Zeichen begrenzt, mehrsprachig gemischte Eingabe erlaubt. Nicht-Streaming liefert eine 24 Stunden gültige URL zur Audiodatei zurück
  • Streaming gibt Base64-kodiertes PCM in Chunks zurück, mit der URL erst im letzten Paket, in den offiziellen Beispielen als 24-kHz-Mono-Audio mit 16 Bit wiedergegeben. Abgerechnet nach Zeichen des Eingabetexts, gemeldet als usage.characters (input_tokens und output_tokens sind in der Qwen3-TTS-Reihe immer 0)
  • das Ausgabe-Audio ist kostenlos

Modell

Modalitäten Text → Audio

Per Anweisung steuerbare Stufe von Alibabas Qwen3-TTS-Familie auf Model Studio, derzeit gleichbedeutend mit dem Snapshot qwen3-tts-instruct-flash-2026-01-26. Positioniert für latenztolerante Arbeit wie Hörbuchproduktion, Voiceovers für Online-Bildung und Content-Erstellung. Bepreist in der Region Singapur mit $0.115 pro 10.000 Eingabezeichen im internationalen Deployment-Scope, mit einem Freikontingent von 110.000 Zeichen, gültig für 90 Tage nach der Aktivierung von Model Studio.

laut Offizielle Alibaba-Dokumentation ↗

Qwen3 TTS Instruct Flash in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-tts-instruct-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Über Qwen3 TTS Instruct Flash

  • Model Studio teilt die Familie nach Transport statt nach Fähigkeit auf: Eine id mit dem realtime-Suffix spricht WebSocket, während diese hier, ohne das Suffix, das HTTP-Modell hinter dem ist, was Alibaba nicht-echtzeitfähige Sprachsynthese nennt, ausgelegt auf latenztolerante Szenarien wie Hörbuchproduktion, Voiceovers für Online-Bildung und Content-Erstellung.
  • Die Anweisungssteuerung ist der Grund, es dem einfachen qwen3-tts-flash vorzuziehen.
  • Sie beschreiben den gewünschten Vortrag in gewöhnlicher Sprache, um Geschwindigkeit, Emotion und Stil pro Anfrage zu steuern; die dokumentierten Beispiele lauten, sanft und langsamer zu sprechen oder einen aufgeregten Broadcast-Stil zu verwenden.
  • Das Feld instructions nimmt bis zu 1.600 Token entgegen und ist nur für Chinesisch und Englisch dokumentiert, und optimize_instructions, standardmäßig aus, lässt den Dienst Ihre Formulierung in eine für die Synthese besser geeignete Anweisung umschreiben.
  • Die Stimmen sind die benannten Personas der Familie, darunter Cherry als sonnige, positive, freundliche und natürliche junge Frau und Nofish als Designer, der Retroflexlaute nicht aussprechen kann, und die Stimmliste nennt, welche Modell-ids die jeweilige Stimme akzeptieren.
  • Zehn Sprachen werden abgedeckt: Chinesisch (Mandarin), Englisch, Deutsch, Italienisch, Portugiesisch, Spanisch, Japanisch, Koreanisch, Französisch und Russisch.
  • Anders als qwen3-tts-flash führt die Instruct-Linie keine der chinesischen Dialektstimmen.
  • Zwei Grenzen prägen die Integration: Der Eingabetext ist auf 600 Zeichen begrenzt, und language_type steht standardmäßig auf Auto, was laut Alibaba keine Genauigkeit garantiert; für einsprachigen Text rät Alibaba, es durch eine explizite Sprache zu ersetzen.
  • Nicht-Streaming liefert eine 24 Stunden gültige URL zur Audiodatei zurück, während Streaming Base64-kodiertes PCM in Chunks zurückgibt und die URL erst im letzten Paket enthält; die offiziellen Beispiele geben diesen Stream als 24-kHz-Mono-Audio mit 16 Bit wieder.
  • Abgerechnet werden die Zeichen des Eingabetexts, zu $0.115 pro 10.000 im internationalen Deployment-Scope, und das Ausgabe-Audio ist kostenlos.
  • Synthorai stellt es über den OpenAI-kompatiblen Endpoint /v1/audio/speech bereit.

FAQ

Lässt sich die Qwen3 TTS Instruct Flash API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Qwen3 TTS Instruct Flash mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Qwen3 TTS Instruct Flash am besten?

Anweisungen in gewöhnlicher Sprache steuern Geschwindigkeit, Emotion und Stil; HTTP-Modell für Hörbücher und Voiceovers, nicht für Realtime; zehn Sprachen, Eingabegrenze von 600 Zeichen. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Qwen3 TTS Instruct Flash?

Qwen3 TTS Instruct Flash kostet auf Synthorai $11.5 pro Million Input-Tokens und $0 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.

Unterstützt Qwen3 TTS Instruct Flash Prompt-Caching?

Qwen3 TTS Instruct Flash hat auf Synthorai derzeit keinen Cache-Lese-Rabatt. Prompt-Caching gilt weiterhin für andere Modelle auf dem Gateway; cache-fähige Alternativen finden Sie in der Preistabelle. Caching-Vergleich der Anbieter →

Wie erhalte ich Zugang zu Qwen3 TTS Instruct Flash?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3-tts-instruct-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →