Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Paraformer Realtime v2

transcription

Paraformer-Realtime-v2 ist Alibaba Clouds Echtzeit-Spracherkennungsmodell der früheren Generation, das Audio über eine bidirektionale Verbindung einspeist und Transkripte zurückstreamt.

Eingabe
Audio
Ausgabe
Text
Preis
$0.002/min

Preis im Vergleich

Preisposition unter 11 vergleichbaren Modellen

Pro Minute$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Audio

Sprachen 7 Sprachen: Chinesisch (Mandarin sowie Kantonesisch, Wu, Hokkien und 15 regionale Akzente), Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch
Audio-Limits
  • Echtzeit-WebSocket-Streaming, unbegrenzte Dauer
  • Hotwords und language_hints
  • Zeitstempel auf Wort- und Satzebene
  • zh-Dialekte/EN/JA/KO/DE/FR/RU
Streaming-Transkription Ja
Zeitstempel Ja

Modell

Modalitäten Audio → Text

Streaming-orientierte Paraformer-Generation mit Hotword-Anpassung und mehrsprachiger Abdeckung.

laut Offizielle Alibaba-Dokumentation ↗

Paraformer Realtime v2 in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="paraformer-realtime-v2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über Paraformer Realtime v2

  • Es erkennt chinesisches Mandarin sowie ein ungewöhnlich breites Set regionaler Dialekte (Kantonesisch, Wu, Hokkien, Sichuan und mehr) sowie Englisch, Japanisch, Koreanisch, Deutsch, Französisch und Russisch und unterstützt einen language_hints-Parameter zur Steuerung der Erkennung.
  • Das ist eine reine v2-Ergänzung, ebenso wie die Annahme beliebiger Abtastraten, wo die vorherige Version 16 kHz verlangte.
  • Alibabas Dokumentation empfiehlt inzwischen Fun-ASR oder Qwen-ASR für neue Projekte und positioniert dieses Modell für bestehende Integrationen.
  • Nutzbar hält es eine ausgereifte Parameteroberfläche: Hotword-Tabellen für Fachvokabular, standardmäßig aktive inverse Textnormalisierung, standardmäßig aktive Interpunktionsvorhersage mit optionaler semantischer Interpunktion, eine konfigurierbare maximale Satzstille, die eine Äußerung abschließt, sowie ein optionaler Disfluenz-Filter, der Füllwörter entfernt (eine Steuerung, die das Fun-ASR-Realtime-Modell nicht dokumentiert).
  • Zeitstempel auf Satz- und Wortebene werden in Millisekunden zurückgegeben, und die Verbindung akzeptiert PCM, WAV, MP3, Opus, Speex, AAC und AMR.
  • Sprecher-Diarisierung wird auf dem Realtime-Pfad nicht angeboten, und es gibt keine Emotionserkennung.
  • Behandeln Sie es als stabilen Endpoint für Pipelines, die bereits darauf abgestimmt sind, statt als Ausgangspunkt für neue Arbeit.
  • Synthorai stellt es weiterhin über den OpenAI-kompatiblen Endpoint bereit.

FAQ

Lässt sich die Paraformer Realtime v2 API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Paraformer Realtime v2 mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Paraformer Realtime v2 am besten?

Streamt Audio hinein, Transkripte heraus; ungewöhnlich breite Abdeckung chinesischer regionaler Dialekte; language_hints-Parameter steuert die Erkennung. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Paraformer Realtime v2?

Paraformer Realtime v2 kostet auf Synthorai $0.002 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.

Welche Sprachen unterstützt Paraformer Realtime v2?

Paraformer Realtime v2 unterstützt 7 Sprachen: Chinesisch (Mandarin sowie Kantonesisch, Wu, Hokkien und 15 regionale Akzente), Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu Paraformer Realtime v2?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="paraformer-realtime-v2", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →