Paraformer-Realtime-v2 ist Alibaba Clouds Echtzeit-Spracherkennungsmodell der früheren Generation, das Audio über eine bidirektionale Verbindung einspeist und Transkripte zurückstreamt.
- Eingabe
- Audio
- Ausgabe
- Text
- Preis
- $0.002/min
Preis im Vergleich
Preisposition unter 11 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Audio
| Sprachen | 7 Sprachen: Chinesisch (Mandarin sowie Kantonesisch, Wu, Hokkien und 15 regionale Akzente), Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch |
|---|---|
| Audio-Limits |
|
| Streaming-Transkription | Ja |
| Zeitstempel | Ja |
Modell
| Modalitäten | Audio → Text |
|---|
Streaming-orientierte Paraformer-Generation mit Hotword-Anpassung und mehrsprachiger Abdeckung.
Paraformer Realtime v2 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="paraformer-realtime-v2",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "paraformer-realtime-v2",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="paraformer-realtime-v2" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "paraformer-realtime-v2",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("paraformer-realtime-v2")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Über Paraformer Realtime v2
- Es erkennt chinesisches Mandarin sowie ein ungewöhnlich breites Set regionaler Dialekte (Kantonesisch, Wu, Hokkien, Sichuan und mehr) sowie Englisch, Japanisch, Koreanisch, Deutsch, Französisch und Russisch und unterstützt einen language_hints-Parameter zur Steuerung der Erkennung.
- Das ist eine reine v2-Ergänzung, ebenso wie die Annahme beliebiger Abtastraten, wo die vorherige Version 16 kHz verlangte.
- Alibabas Dokumentation empfiehlt inzwischen Fun-ASR oder Qwen-ASR für neue Projekte und positioniert dieses Modell für bestehende Integrationen.
- Nutzbar hält es eine ausgereifte Parameteroberfläche: Hotword-Tabellen für Fachvokabular, standardmäßig aktive inverse Textnormalisierung, standardmäßig aktive Interpunktionsvorhersage mit optionaler semantischer Interpunktion, eine konfigurierbare maximale Satzstille, die eine Äußerung abschließt, sowie ein optionaler Disfluenz-Filter, der Füllwörter entfernt (eine Steuerung, die das Fun-ASR-Realtime-Modell nicht dokumentiert).
- Zeitstempel auf Satz- und Wortebene werden in Millisekunden zurückgegeben, und die Verbindung akzeptiert PCM, WAV, MP3, Opus, Speex, AAC und AMR.
- Sprecher-Diarisierung wird auf dem Realtime-Pfad nicht angeboten, und es gibt keine Emotionserkennung.
- Behandeln Sie es als stabilen Endpoint für Pipelines, die bereits darauf abgestimmt sind, statt als Ausgangspunkt für neue Arbeit.
- Synthorai stellt es weiterhin über den OpenAI-kompatiblen Endpoint bereit.
FAQ
Lässt sich die Paraformer Realtime v2 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Paraformer Realtime v2 mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist Paraformer Realtime v2 am besten?
Streamt Audio hinein, Transkripte heraus; ungewöhnlich breite Abdeckung chinesischer regionaler Dialekte; language_hints-Parameter steuert die Erkennung. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Paraformer Realtime v2?
Paraformer Realtime v2 kostet auf Synthorai $0.002 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.
Welche Sprachen unterstützt Paraformer Realtime v2?
Paraformer Realtime v2 unterstützt 7 Sprachen: Chinesisch (Mandarin sowie Kantonesisch, Wu, Hokkien und 15 regionale Akzente), Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.
Wie erhalte ich Zugang zu Paraformer Realtime v2?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="paraformer-realtime-v2", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.