Fun-ASR Realtime ist Alibabas Modell für Streaming-Spracherkennung: Audio wird über eine dauerhafte Verbindung eingespeist und Text mit niedriger Latenz zurückgestreamt, ohne Begrenzung der Streamdauer.
- Eingabe
- Audio
- Ausgabe
- Text
- Preis
- $0.002/min
Preis im Vergleich
Preisposition unter 11 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Audio
| Sprachen | Mehrsprachig mit Dialekten, 30 Sprachen: Chinesisch (Mandarin, Kantonesisch, Wu, Hokkien, Hakka, Gan, Xiang, Jin sowie regionale Akzente), Englisch, Japanisch, Koreanisch, Vietnamesisch, Thailändisch, Indonesisch, Malaiisch, Filipino, Hindi, Arabisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Italienisch, Niederländisch, Schwedisch, Dänisch, Finnisch, Norwegisch, Griechisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Bulgarisch, Kroatisch, Slowakisch |
|---|---|
| Audio-Limits |
|
| Sprecher-Diarisierung | Nein |
| Streaming-Transkription | Ja |
| Zeitstempel | Ja |
Modell
| Modalitäten | Audio → Text |
|---|
Die Dokumentation beschreibt im Realtime-Leitfaden zusätzlich eine Emotionserkennung mit 7 Zuständen.
Fun-ASR Realtime in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-realtime",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-realtime",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-realtime" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-realtime",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-realtime")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Über Fun-ASR Realtime
- Die offizielle Dokumentation positioniert es für Live-Untertitel, Sprachassistenten und Besprechungstranskription, und es trägt die Stärken der Fun-ASR-Familie in Hotword-Anpassung und mehrsprachiger Abdeckung einschließlich chinesischer Regionaldialekte, Englisch, Japanisch und Koreanisch.
- Die Realtime-Oberfläche ergänzt Steuerungen, welche die dateibasierten Modelle nicht brauchen: semantische Interpunktion, standardmäßig aktive Interpunktionsvorhersage, eine einstellbare maximale Satzstille, die entscheidet, wann eine Äußerung abgeschlossen wird, einen Sprach-Rausch-Schwellenwert zur Abstimmung gegen Hintergrundgeräusche sowie Zeitstempel auf Wortebene, die während des laufenden Streams ausgegeben werden.
- Audio kommt als PCM, WAV, MP3, Opus, Speex, AAC oder AMR mit 8 oder 16 kHz an.
- Zwei Grenzen sind einzuplanen: Sprecher-Diarisierung ist auf dem Realtime-Pfad nicht verfügbar (für wer-hat-was-gesagt brauchen Sie die Modelle für Aufnahmedateien), und die Sprachabdeckung variiert stark je datiertem Snapshot, statt über die Familie hinweg einheitlich zu sein, fixieren Sie also den Snapshot, von dem Ihr Sprachset abhängt.
- Emotionskennzeichnung, das Unterscheidungsmerkmal der Qwen3-ASR-Reihe, wird hier ebenfalls nicht angeboten, und kontextbasierte Genauigkeitsabstimmung ist nur auf manchen Snapshots verfügbar.
- Synthorai macht es über dieselbe OpenAI-kompatible Schnittstelle aufrufbar, die auch für den Rest seines Audio-Katalogs genutzt wird.
FAQ
Lässt sich die Fun-ASR Realtime API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Fun-ASR Realtime mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist Fun-ASR Realtime am besten?
Streaming-Transkription ohne Zeitbegrenzung; für Live-Untertitel und Meetings gebaut; Hotword-Anpassung mit mehrsprachiger Abdeckung. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Fun-ASR Realtime?
Fun-ASR Realtime kostet auf Synthorai $0.002 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.
Welche Sprachen unterstützt Fun-ASR Realtime?
Fun-ASR Realtime unterstützt Mehrsprachig mit Dialekten, 30 Sprachen: Chinesisch (Mandarin, Kantonesisch, Wu, Hokkien, Hakka, Gan, Xiang, Jin sowie regionale Akzente), Englisch, Japanisch, Koreanisch, Vietnamesisch, Thailändisch, Indonesisch, Malaiisch, Filipino, Hindi, Arabisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Italienisch, Niederländisch, Schwedisch, Dänisch, Finnisch, Norwegisch, Griechisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Bulgarisch, Kroatisch, Slowakisch. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.
Wie erhalte ich Zugang zu Fun-ASR Realtime?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="fun-asr-realtime", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.