Fun-ASR Flash vs Seed ASR
Welches und wann — kuratiertes Fazit, keine Benchmark-Tabelle
Die Minutenpreise unterscheiden sich nur um einen Rundungsfehler ($0.0021 gegenüber $0.002), was die Wahl vollständig auf die Fähigkeiten legt: seed-asr-bigmodel trennt Sprecher über seine Audiodatei-API (dokumentiert als am besten bei höchstens 10 Sprechern), liefert Zeitstempel auf Satz- und Wortebene und nimmt bis zu 5 Stunden je Datei, während fun-asr-flash nur synchron arbeitet, bei 5 Minuten und 2GB gedeckelt ist, ohne Trennung, aber mit Kontextinjektion für Fachbegriffe. Nehmen Sie fun-asr-flash für schnelle kurze Clips, seed-asr-bigmodel für alles Lange oder Mehrsprecherige.
Preise
| Fun-ASR Flash | Seed ASR | Δ | |
|---|---|---|---|
| Pro Audiominute | $0.0021 | $0.002 | 1× |
Preise aus dem Live-Katalog zum Zeitpunkt des Builds; jede Modellseite enthält die aktuelle Übersicht.
Wo sie stehen — Preis pro Audiominute über alle 11 Speech-to-Text-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)
Fähigkeiten
| Fun-ASR Flash | Seed ASR | |
|---|---|---|
| Sprecherdiarisierung | nein | ja |
| Streaming | ja | ja |
| Zeitstempel | — | ja |
Spezifikationen
| Fun-ASR Flash | Seed ASR | |
|---|---|---|
| Input-Modalitäten | Audio | Audio |
| Ausgabemodalitäten | Text | Text |
| Veröffentlicht | 2026-06 | — |
| Limits | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | Async audio-file mode: <512MB, <5 hours, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (raw PCM also accepted), results returned within 3 hours and retained 7 days speaker diarization via enable_speaker_info (audio-file API only, best with <=10 speakers, no diarization on the streaming API) sentence + word segmentation with start_time/end_time via show_utterances language identification via enable_lid hotwords/context up to 800 tokens and 20 rounds per-call billing |
| Sprachen | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | With `language` empty the model covers Mandarin, English, Cantonese, Shanghainese, Minnan, Sichuan and Shaanxi dialects 39 language keys can be pinned explicitly (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus optional auto-detection (enable_auto_lang) |
Die Spezifikationen sind aus der Dokumentation der jeweiligen Anbieter übernommen; eine Zeile, die ein Anbieter nicht veröffentlicht, wird weggelassen und nicht abgeleitet. Vollständige Quellen: Fun-ASR Flash · Seed ASR
Mit einer Zeile zwischen ihnen wechseln
Beide IDs befinden sich in jedem Tab unten — das hervorgehobene Zeilenpaar ist die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiche Request-Struktur.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="seed-asr-bigmodel", # diese Zeile einkommentieren, die darüberliegende auskommentieren
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "seed-asr-bigmodel", // diese Zeile einkommentieren, die darüberliegende auskommentieren
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="seed-asr-bigmodel" \ # diese Zeile einkommentieren, die darüberliegende auskommentieren
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "seed-asr-bigmodel", // diese Zeile einkommentieren, die darüberliegende auskommentieren
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("seed-asr-bigmodel") // diese Zeile einkommentieren, die darüberliegende auskommentieren
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Welches ist günstiger, Fun-ASR Flash oder Seed ASR?
Seed ASR ist günstiger bei pro audiominute ($0.002 vs. $0.0021, 1.0× Unterschied). Andere Zeilen können in die andere Richtung deuten — die obige Tabelle enthält alle Daten, und die tatsächlichen Kosten hängen von Ihrem Mix ab.
Kann ich Fun-ASR Flash gegen Seed ASR ohne zwei Integrationen A/B-testen?
Ja. Beide werden über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel bereitgestellt — der Wechsel ist eine einzeilige Änderung des Modell-Strings, sodass Sie einen Bruchteil des Traffics an jedes Modell leiten und die Rechnungen direkt vergleichen können.
Unterstützen Fun-ASR Flash und Seed ASR Sprecherdiarisierung?
Die obige Fähigkeitentabelle beantwortet dies pro Modell, direkt aus der Dokumentation des jeweiligen Anbieters — Diarisierung, Streaming und Zeitstempel sind separat aufgeführt, da sich die Modelle bei allen dreien unterscheiden.