Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Fun-ASR MTL

Veröffentlicht 2025-08

transcription

Fun-ASR MTL ist das mehrsprachige, multitaskfähige Mitglied von Alibabas Fun-ASR-Familie für die Transkription von Aufnahmedateien.

Eingabe
Audio
Ausgabe
Text
Preis
$0.0021/min

Preis im Vergleich

Preisposition unter 11 vergleichbaren Modellen

Pro Minute$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Audio

Sprachen Mehrsprachig mit Dialekten: 30 Sprachen, wobei Chinesisch auf Mandarin und Kantonesisch beschränkt ist (keine breitere Dialekt- oder Akzentabdeckung). Chinesisch (Mandarin, Kantonesisch), Englisch, Japanisch, Koreanisch, Vietnamesisch, Thailändisch, Indonesisch, Malaiisch, Filipino, Hindi, Arabisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Italienisch, Niederländisch, Schwedisch, Dänisch, Finnisch, Norwegisch, Griechisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Bulgarisch, Kroatisch, Slowakisch
Audio-Limits
  • Mehrsprachige asynchrone Transkription bis 12h / 2GB
  • Hotwords und Diarisierung
  • Zeitstempel auf Satz- und Wortebene (immer aktiv)
  • 30 Sprachen, Chinesisch beschränkt auf Mandarin und Kantonesisch
Sprecher-Diarisierung Ja
Streaming-Transkription Nein
Zeitstempel Ja

Modell

Modalitäten Audio → Text
  • Mehrsprachige, multitaskfähige Stufe der Fun-ASR-Familie
  • die aktuelle HTTP-API-Referenz listet dieselben 30 Sprachen wie das Basismodell, wobei Chinesisch auf Mandarin und Kantonesisch beschränkt ist

laut Offizielle Alibaba-Dokumentation ↗

Fun-ASR MTL in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-mtl",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über Fun-ASR MTL

  • Wie das Basismodell verarbeitet es Audiodateien von bis zu 12 Stunden und 2 GB offline, und die offizielle Dokumentation listet Unterstützung für Hotword-Anpassung und Sprecher-Diarisierung, mit Erkennung von Chinesisch (Mandarin und Kantonesisch), Englisch, Japanisch, Koreanisch sowie einer breiten Palette europäischer und südostasiatischer Sprachen.
  • Es zielt auf Workloads, die Sprachen mischen und Sprecheridentifikation innerhalb einer Pipeline benötigen.
  • Seine Geschichte erklärt seine Existenz: Als die Familie startete, deckte der damals aktuelle Fun-ASR-Snapshot nur Chinesisch und Englisch ab, und MTL war die Variante, die Kantonesisch, Japanisch, Thai, Vietnamesisch und Indonesisch ergänzte.
  • Seither wurde das Basismodell weiterentwickelt, und die HTTP-API-Referenz listet inzwischen für beide dasselbe breite Sprachset, sodass die zwei konvergiert sind.
  • Alibabas eigene Seiten ziehen zwischen ihnen keine ausdrückliche Fähigkeitsgrenze mehr.
  • Alles Weitere folgt der Familie: asynchrone Transkription nach dem Muster einreichen und abfragen, Hotword-Tabellen für stabiles Fachvokabular, optionale Diarisierung mit angegebener Sprecherzahl sowie Zeitstempel auf Satz- und Wortebene in Millisekunden.
  • Emotionserkennung gehört nicht zu dieser Reihe, und wie beim Geschwistermodell merkt die Dokumentation an, dass nur der erste Eintrag einer Liste von Sprachhinweisen gelesen wird.
  • Der stabile Modellname löst auf einen datierten Snapshot auf; fixieren Sie den Snapshot also, wenn Ihre Sprachabdeckung wichtig ist.
  • Synthorai leitet Anfragen über den vertrauten OpenAI-kompatiblen Endpoint an es weiter.

FAQ

Lässt sich die Fun-ASR MTL API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Fun-ASR MTL mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Fun-ASR MTL am besten?

Gemischtsprachige Workloads mit Sprecheridentifikation; verarbeitet Dateien von bis zu 12 Stunden offline; umfasst europäische und südostasiatische Sprachen. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Fun-ASR MTL?

Fun-ASR MTL kostet auf Synthorai $0.0021 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.

Welche Sprachen unterstützt Fun-ASR MTL?

Fun-ASR MTL unterstützt Mehrsprachig mit Dialekten: 30 Sprachen, wobei Chinesisch auf Mandarin und Kantonesisch beschränkt ist (keine breitere Dialekt- oder Akzentabdeckung). Chinesisch (Mandarin, Kantonesisch), Englisch, Japanisch, Koreanisch, Vietnamesisch, Thailändisch, Indonesisch, Malaiisch, Filipino, Hindi, Arabisch, Französisch, Deutsch, Spanisch, Portugiesisch, Russisch, Italienisch, Niederländisch, Schwedisch, Dänisch, Finnisch, Norwegisch, Griechisch, Polnisch, Tschechisch, Ungarisch, Rumänisch, Bulgarisch, Kroatisch, Slowakisch. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu Fun-ASR MTL?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="fun-asr-mtl", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →