Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Qwen3-ASR Flash Realtime

Veröffentlicht 2025-10-27

transcription

Qwen3-ASR Flash Realtime ist das Streaming-Gegenstück zu Qwen3-ASR Flash: Audio wird über eine WebSocket-Verbindung gesendet und Transkripte kommen fortlaufend zurück, mit unbegrenzter Streamdauer für langlaufende Sitzungen.

Eingabe
Audio
Ausgabe
Text
Preis
$0.002/min

Preis im Vergleich

Preisposition unter 11 vergleichbaren Modellen

Pro Minute$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Audio

Sprachen 26 Sprachen, eine gemeinsame Liste für jedes Qwen-ASR-Modell: Chinesisch (Mandarin, Sichuanesisch, Hokkien, Wu, Kantonesisch), Englisch, Japanisch, Deutsch, Koreanisch, Russisch, Französisch, Portugiesisch, Arabisch, Italienisch, Spanisch, Hindi, Indonesisch, Thailändisch, Türkisch, Ukrainisch, Vietnamesisch, Tschechisch, Dänisch, Filipino, Finnisch, Isländisch, Malaiisch, Norwegisch, Polnisch, Schwedisch
Audio-Limits
  • Echtzeit-WebSocket-Streaming (pcm/opus, 8/16 kHz), unbegrenzte Dauer
  • Turns per VAD oder manuell
  • dauerhaft aktive Emotionserkennung mit 7 Klassen
  • automatische Spracherkennung
Sprecher-Diarisierung Nein
Streaming-Transkription Ja
Zeitstempel Nein

Modell

Modalitäten Audio → Text

Keine Zeitstempel, Hotwords oder Diarisierung bei dieser Realtime-Variante.

laut Offizielle Alibaba-Dokumentation ↗

Qwen3-ASR Flash Realtime in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über Qwen3-ASR Flash Realtime

  • Es behält die Kernfähigkeiten des Batch-Modells, darunter Emotionserkennung neben der Transkription und die Erkennung von rund dreißig Sprachen, von fünf chinesischen Varianten über Englisch, Japanisch und Koreanisch bis zu vielen europäischen und südostasiatischen Sprachen.
  • Es eignet sich für Live-Untertitelung und sprachinteraktive Anwendungen.
  • Zwei Unterschiede zum dateibasierten Geschwistermodell prägen, wie Sie darauf aufbauen.
  • Erstens ist das Turn-Taking auf eine Weise konfigurierbar, wie es die anderen Streaming-Modelle nicht sind: Ein Modus mit Voice-Activity-Detection segmentiert Äußerungen automatisch über einen einstellbaren Stille-Schwellenwert, während ein manueller Modus die Satzgrenzen Ihrem Client überlässt, indem dieser den Audio-Puffer selbst committet, mit dem dokumentierten Vorbehalt, dass manuell gesteuerte Segmente innerhalb von etwa einer Minute angesammelten Audios bleiben müssen.
  • Zweitens stellt die Dokumentation unmissverständlich fest, dass diese Variante derzeit keine Zeitstempel zurückgibt; wenn Sie also Wort- oder Satz-Timing brauchen, ist das Offline-Modell das richtige.
  • Die Emotionserkennung bleibt über dieselben sieben Zustände hinweg immer aktiv, die Spracherkennung bleibt automatisch, und weder Hotword-Listen noch Sprecher-Diarisierung werden unterstützt.
  • Über Synthorai ist das Modell über die standardmäßige OpenAI-kompatible API erreichbar.

FAQ

Lässt sich die Qwen3-ASR Flash Realtime API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Qwen3-ASR Flash Realtime mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Qwen3-ASR Flash Realtime am besten?

Unbegrenzte Stream-Dauer über WebSocket; behält Emotionserkennung beim Streaming; eignet sich für Live-Untertitelung und Sprachinteraktion. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Qwen3-ASR Flash Realtime?

Qwen3-ASR Flash Realtime kostet auf Synthorai $0.002 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.

Welche Sprachen unterstützt Qwen3-ASR Flash Realtime?

Qwen3-ASR Flash Realtime unterstützt 26 Sprachen, eine gemeinsame Liste für jedes Qwen-ASR-Modell: Chinesisch (Mandarin, Sichuanesisch, Hokkien, Wu, Kantonesisch), Englisch, Japanisch, Deutsch, Koreanisch, Russisch, Französisch, Portugiesisch, Arabisch, Italienisch, Spanisch, Hindi, Indonesisch, Thailändisch, Türkisch, Ukrainisch, Vietnamesisch, Tschechisch, Dänisch, Filipino, Finnisch, Isländisch, Malaiisch, Norwegisch, Polnisch, Schwedisch. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu Qwen3-ASR Flash Realtime?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3-asr-flash-realtime", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →