Fun-ASR ist das Modell für die Spracherkennung von Aufnahmedateien in Alibaba Cloud Model Studio, für die Offline-Transkription vorab aufgezeichneter Audiodaten.
- Eingabe
- Audio
- Ausgabe
- Text
- Preis
- $0.0021/min
Preis im Vergleich
Preisposition unter 11 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Audio
| Sprachen | Mehrsprachig mit Dialekten, 30 Sprachen: Chinesisch (Mandarin, Kantonesisch, Wu, Hokkien, Hakka, Gan, Xiang, Jin sowie regionale Akzente), Englisch, Japanisch, Koreanisch, Vietnamesisch, Thailändisch, Indonesisch, Malaiisch, Filipino, Hindi, Arabisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Italienisch, Niederländisch, Schwedisch, Dänisch, Finnisch, Norwegisch, Griechisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Bulgarisch, Kroatisch, Slowakisch |
|---|---|
| Audio-Limits |
|
| Sprecher-Diarisierung | Ja |
| Streaming-Transkription | Nein |
| Zeitstempel | Ja |
Modell
| Modalitäten | Audio → Text |
|---|
- Gesangserkennung 2025-12 ergänzt
- das quelloffene Fun-ASR-Nano ist ein anderes Modell als die hier bereitgestellten Gewichte
Fun-ASR in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Über Fun-ASR
- Es akzeptiert Dateien von bis zu 12 Stunden und 2 GB, verarbeitet Einzel- und Batch-Jobs und erkennt Chinesisch (Mandarin sowie viele regionale Dialekte wie Kantonesisch, Wu und Hokkien), Englisch, Japanisch, Koreanisch und Dutzende weiterer Sprachen.
- Die offizielle Dokumentation hebt Hotword-Anpassung für Fachterminologie und Sprecher-Diarisierung für Aufnahmen mit mehreren Sprechern hervor.
- Beide bringen praktische Details mit, die man vorab kennen sollte: Eine Hotword-Tabelle fasst bis zu 500 Einträge und eignet sich für Terminologie, die sich selten ändert, die Diarisierung ist deaktiviert, bis Sie sie einschalten, und erlaubt es, eine erwartete Sprecherzahl anzugeben, und Alibaba empfiehlt, diarisiertes Audio unter etwa zwei Stunden zu halten, da der Job sonst in ein Timeout laufen kann.
- Die Transkription ist asynchron (Datei einreichen, Task-ID erhalten, Ergebnis abfragen), und Zeitstempel auf Satz- und Wortebene in Millisekunden kommen standardmäßig zurück, daneben Filterung sensibler Wörter und kanalweise Auswahl für Mehrspuraufnahmen.
- Emotionskennzeichnung gehört nicht zu diesem Modell; sie gehört zur Qwen3-ASR-Reihe.
- Sprachhinweise werden akzeptiert, doch die Dokumentation merkt an, dass nur der erste Wert in der Liste gelesen wird.
- Synthorai stellt Fun-ASR über seinen OpenAI-kompatiblen Endpoint bereit, sodass bestehende Transkriptions-Clients ohne Änderung funktionieren.
FAQ
Lässt sich die Fun-ASR API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Fun-ASR mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist Fun-ASR am besten?
Akzeptiert Dateien von bis zu 12 Stunden; Hotword-Anpassung für Fachterminologie; Sprecher-Diarisierung für Aufnahmen mit mehreren Sprechern. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Fun-ASR?
Fun-ASR kostet auf Synthorai $0.0021 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.
Welche Sprachen unterstützt Fun-ASR?
Fun-ASR unterstützt Mehrsprachig mit Dialekten, 30 Sprachen: Chinesisch (Mandarin, Kantonesisch, Wu, Hokkien, Hakka, Gan, Xiang, Jin sowie regionale Akzente), Englisch, Japanisch, Koreanisch, Vietnamesisch, Thailändisch, Indonesisch, Malaiisch, Filipino, Hindi, Arabisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Italienisch, Niederländisch, Schwedisch, Dänisch, Finnisch, Norwegisch, Griechisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Bulgarisch, Kroatisch, Slowakisch. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.
Wie erhalte ich Zugang zu Fun-ASR?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="fun-asr", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.