Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Fun-ASR Realtime

Veröffentlicht 2025-09-23

transcription

Fun-ASR Realtime ist Alibabas Modell für Streaming-Spracherkennung: Audio wird über eine dauerhafte Verbindung eingespeist und Text mit niedriger Latenz zurückgestreamt, ohne Begrenzung der Streamdauer.

Eingabe
Audio
Ausgabe
Text
Preis
$0.002/min

Preis im Vergleich

Preisposition unter 11 vergleichbaren Modellen

Pro Minute$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Audio

Sprachen Mehrsprachig mit Dialekten, 30 Sprachen: Chinesisch (Mandarin, Kantonesisch, Wu, Hokkien, Hakka, Gan, Xiang, Jin sowie regionale Akzente), Englisch, Japanisch, Koreanisch, Vietnamesisch, Thailändisch, Indonesisch, Malaiisch, Filipino, Hindi, Arabisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Italienisch, Niederländisch, Schwedisch, Dänisch, Finnisch, Norwegisch, Griechisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Bulgarisch, Kroatisch, Slowakisch
Audio-Limits
  • Echtzeit-WebSocket-Streaming, unbegrenzte Dauer
  • RAG-basierte Hotwords in großem Umfang
  • Zeitstempel im Millisekundenbereich
  • VAD-Turn-Erkennung
Sprecher-Diarisierung Nein
Streaming-Transkription Ja
Zeitstempel Ja

Modell

Modalitäten Audio → Text

Die Dokumentation beschreibt im Realtime-Leitfaden zusätzlich eine Emotionserkennung mit 7 Zuständen.

laut Offizielle Alibaba-Dokumentation ↗

Fun-ASR Realtime in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über Fun-ASR Realtime

  • Die offizielle Dokumentation positioniert es für Live-Untertitel, Sprachassistenten und Besprechungstranskription, und es trägt die Stärken der Fun-ASR-Familie in Hotword-Anpassung und mehrsprachiger Abdeckung einschließlich chinesischer Regionaldialekte, Englisch, Japanisch und Koreanisch.
  • Die Realtime-Oberfläche ergänzt Steuerungen, welche die dateibasierten Modelle nicht brauchen: semantische Interpunktion, standardmäßig aktive Interpunktionsvorhersage, eine einstellbare maximale Satzstille, die entscheidet, wann eine Äußerung abgeschlossen wird, einen Sprach-Rausch-Schwellenwert zur Abstimmung gegen Hintergrundgeräusche sowie Zeitstempel auf Wortebene, die während des laufenden Streams ausgegeben werden.
  • Audio kommt als PCM, WAV, MP3, Opus, Speex, AAC oder AMR mit 8 oder 16 kHz an.
  • Zwei Grenzen sind einzuplanen: Sprecher-Diarisierung ist auf dem Realtime-Pfad nicht verfügbar (für wer-hat-was-gesagt brauchen Sie die Modelle für Aufnahmedateien), und die Sprachabdeckung variiert stark je datiertem Snapshot, statt über die Familie hinweg einheitlich zu sein, fixieren Sie also den Snapshot, von dem Ihr Sprachset abhängt.
  • Emotionskennzeichnung, das Unterscheidungsmerkmal der Qwen3-ASR-Reihe, wird hier ebenfalls nicht angeboten, und kontextbasierte Genauigkeitsabstimmung ist nur auf manchen Snapshots verfügbar.
  • Synthorai macht es über dieselbe OpenAI-kompatible Schnittstelle aufrufbar, die auch für den Rest seines Audio-Katalogs genutzt wird.

FAQ

Lässt sich die Fun-ASR Realtime API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Fun-ASR Realtime mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Fun-ASR Realtime am besten?

Streaming-Transkription ohne Zeitbegrenzung; für Live-Untertitel und Meetings gebaut; Hotword-Anpassung mit mehrsprachiger Abdeckung. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Fun-ASR Realtime?

Fun-ASR Realtime kostet auf Synthorai $0.002 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.

Welche Sprachen unterstützt Fun-ASR Realtime?

Fun-ASR Realtime unterstützt Mehrsprachig mit Dialekten, 30 Sprachen: Chinesisch (Mandarin, Kantonesisch, Wu, Hokkien, Hakka, Gan, Xiang, Jin sowie regionale Akzente), Englisch, Japanisch, Koreanisch, Vietnamesisch, Thailändisch, Indonesisch, Malaiisch, Filipino, Hindi, Arabisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Italienisch, Niederländisch, Schwedisch, Dänisch, Finnisch, Norwegisch, Griechisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Bulgarisch, Kroatisch, Slowakisch. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu Fun-ASR Realtime?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="fun-asr-realtime", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →