🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Fun-ASR Flash vs Seed ASR

vs

Welches und wann — kuratiertes Fazit, keine Benchmark-Tabelle

Die Minutenpreise unterscheiden sich nur um einen Rundungsfehler ($0.0021 gegenüber $0.002), was die Wahl vollständig auf die Fähigkeiten legt: seed-asr-bigmodel trennt Sprecher über seine Audiodatei-API (dokumentiert als am besten bei höchstens 10 Sprechern), liefert Zeitstempel auf Satz- und Wortebene und nimmt bis zu 5 Stunden je Datei, während fun-asr-flash nur synchron arbeitet, bei 5 Minuten und 2GB gedeckelt ist, ohne Trennung, aber mit Kontextinjektion für Fachbegriffe. Nehmen Sie fun-asr-flash für schnelle kurze Clips, seed-asr-bigmodel für alles Lange oder Mehrsprecherige.

Preise

Fun-ASR Flash Seed ASR Δ
Pro Audiominute $0.0021 $0.002

Preise aus dem Live-Katalog zum Zeitpunkt des Builds; jede Modellseite enthält die aktuelle Übersicht.

Wo sie stehen — Preis pro Audiominute über alle 11 Speech-to-Text-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fun-ASR Flash · $0.0021 Seed ASR · $0.002
$0.002 · Fun-ASR Realtime $0.016 · Chirp 2

Fähigkeiten

Fun-ASR Flash Seed ASR
Sprecherdiarisierung nein ja
Streaming ja ja
Zeitstempel ja

Spezifikationen

Fun-ASR Flash Seed ASR
Input-Modalitäten Audio Audio
Ausgabemodalitäten Text Text
Veröffentlicht 2026-06
Limits

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

Async audio-file mode: <512MB, <5 hours, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (raw PCM also accepted), results returned within 3 hours and retained 7 days

speaker diarization via enable_speaker_info (audio-file API only, best with <=10 speakers, no diarization on the streaming API)

sentence + word segmentation with start_time/end_time via show_utterances

language identification via enable_lid

hotwords/context up to 800 tokens and 20 rounds

per-call billing

Sprachen Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

With `language` empty the model covers Mandarin, English, Cantonese, Shanghainese, Minnan, Sichuan and Shaanxi dialects

39 language keys can be pinned explicitly (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus optional auto-detection (enable_auto_lang)

Die Spezifikationen sind aus der Dokumentation der jeweiligen Anbieter übernommen; eine Zeile, die ein Anbieter nicht veröffentlicht, wird weggelassen und nicht abgeleitet. Vollständige Quellen: Fun-ASR Flash · Seed ASR

Mit einer Zeile zwischen ihnen wechseln

Beide IDs befinden sich in jedem Tab unten — das hervorgehobene Zeilenpaar ist die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiche Request-Struktur.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-flash",
    # model="seed-asr-bigmodel",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API-Schlüssel holen →

FAQ

Welches ist günstiger, Fun-ASR Flash oder Seed ASR?

Seed ASR ist günstiger bei pro audiominute ($0.002 vs. $0.0021, 1.0× Unterschied). Andere Zeilen können in die andere Richtung deuten — die obige Tabelle enthält alle Daten, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich Fun-ASR Flash gegen Seed ASR ohne zwei Integrationen A/B-testen?

Ja. Beide werden über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel bereitgestellt — der Wechsel ist eine einzeilige Änderung des Modell-Strings, sodass Sie einen Bruchteil des Traffics an jedes Modell leiten und die Rechnungen direkt vergleichen können.

Unterstützen Fun-ASR Flash und Seed ASR Sprecherdiarisierung?

Die obige Fähigkeitentabelle beantwortet dies pro Modell, direkt aus der Dokumentation des jeweiligen Anbieters — Diarisierung, Streaming und Zeitstempel sind separat aufgeführt, da sich die Modelle bei allen dreien unterscheiden.

Verwandte Vergleiche

Aus unseren gemessenen Studien