Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

Fun-ASR Flash vs Seed ASR

vs

Welches Modell wofür

Die Minutenpreise unterscheiden sich nur um einen Rundungsfehler ($0.0021 gegenüber $0.002), was die Wahl vollständig auf die Fähigkeiten legt: seed-asr-bigmodel trennt Sprecher über seine Audiodatei-API (dokumentiert als am besten bei höchstens 10 Sprechern), liefert Zeitstempel auf Satz- und Wortebene und nimmt bis zu 5 Stunden je Datei, während fun-asr-flash nur synchron arbeitet, bei 5 Minuten und 2GB gedeckelt ist, ohne Trennung, aber mit Kontextinjektion für Fachbegriffe. Nehmen Sie fun-asr-flash für schnelle kurze Clips, seed-asr-bigmodel für alles Lange oder Mehrsprecherige.

Preise

Fun-ASR Flash Seed ASR Δ
Pro Audiominute $0.0021 $0.002 1×

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro Audiominute aller 12 Speech-to-Text-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fun-ASR Flash · $0.0021 Seed ASR · $0.002

Fähigkeiten

Fun-ASR Flash Seed ASR
Sprecherdiarisierung nein ja
Streaming ja ja
Zeitstempel - ja

Spezifikationen

Fun-ASR Flash Seed ASR
Eingabemodalitäten Audio Audio
Ausgabemodalitäten Text Text
Veröffentlicht 2026-06 2025-12-05
Limits

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

Async audio-file mode: <512MB, <5 hours, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (raw PCM also accepted), results returned within 3 hours and retained 7 days

speaker diarization via enable_speaker_info (audio-file API only, best with <=10 speakers, no diarization on the streaming API)

sentence + word segmentation with start_time/end_time via show_utterances

language identification via enable_lid

hotwords/context up to 800 tokens and 20 rounds

per-call billing

Sprachen Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

With `language` empty the model covers Mandarin, English, Cantonese, Shanghainese, Minnan, Sichuan and Shaanxi dialects

39 language keys can be pinned explicitly (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus optional auto-detection (enable_auto_lang)

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: Fun-ASR Flash · Seed ASR

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-flash",
    # model="seed-asr-bigmodel",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: Fun-ASR Flash oder Seed ASR?

Seed ASR ist bei Pro Audiominute günstiger ($0.002 vs. $0.0021, Faktor 1.0). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich Fun-ASR Flash gegen Seed ASR A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen Fun-ASR Flash und Seed ASR Sprecherdiarisierung?

Das beantwortet die Tabelle der Fähigkeiten oben für jedes Modell einzeln, direkt aus der Dokumentation des jeweiligen Anbieters. Diarisierung, Streaming und Zeitstempel stehen dort getrennt, weil sich die Modelle in allen drei Punkten unterscheiden.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen