Fun-ASR Flash vs GPT-4o Transcribe Diarize
Welches Modell wofür
Beide sind reine Transkriptionsmodelle, rechnen aber in unterschiedlichen Einheiten ab - fun-asr-flash berechnet $0.0021 pro Audiominute, während gpt-4o-transcribe-diarize $6.25 pro Million Audio-Input-Token berechnet, sodass keine einzelne Umrechnung zwischen ihnen aussagekräftig ist. Wählen Sie fun-asr-flash für unkomplizierte synchrone Aufgaben unter 5 Minuten oder 2GB, in 30+ Sprachen, mit Kontextinjektion für Fachbegriffe, aber ohne Diarisierung. Wählen Sie gpt-4o-transcribe-diarize, wenn Sie integrierte Sprecherdiarisierung mit diarized_json Sprecher-Labels und Segment-Timestamps benötigen, und dabei das Dateilimit von 25MB, den 16000-token Kontext und die erforderliche chunking_strategy für Audio über 30s akzeptieren.
Preise
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Pro Audiominute | $0.0021 | - | - |
| Audio-Eingabe / 1M Tokens | - | $6.25 | - |
| Text-Ausgabe / 1M Tokens | - | $2.5 | - |
Die beiden Modelle werden in unterschiedlichen Einheiten abgerechnet, deshalb zeigen wir kein Δ: Für eine Umrechnung müssten wir etwas annehmen, das wir nicht gemessen haben. Oben steht jeder Preis in seiner eigenen Einheit.
Fähigkeiten
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Sprecherdiarisierung | nein | ja |
| Streaming | ja | ja |
| Zeitstempel | - | ja |
Spezifikationen
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Eingabemodalitäten | Audio | Text Audio |
| Ausgabemodalitäten | Text | Text |
| Veröffentlicht | 2026-06 | 2025-10 |
| Knowledge-Cutoff | - | 2024-06 |
| Limits | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Sprachen | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Maximale Ausgabe | - | 2K |
Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: Fun-ASR Flash · GPT-4o Transcribe Diarize
Eine Zeile genügt für den Wechsel
Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # diese Zeile einkommentieren, die darüberliegende auskommentieren
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // diese Zeile einkommentieren, die darüberliegende auskommentieren
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # diese Zeile einkommentieren, die darüberliegende auskommentieren
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // diese Zeile einkommentieren, die darüberliegende auskommentieren
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // diese Zeile einkommentieren, die darüberliegende auskommentieren
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Welches Modell ist günstiger: Fun-ASR Flash oder GPT-4o Transcribe Diarize?
Die beiden werden in unterschiedlichen Einheiten abgerechnet, eine einzelne belastbare Zahl gibt es deshalb nicht: Fun-ASR Flash und GPT-4o Transcribe Diarize stehen in der Tabelle oben jeweils in ihrer eigenen Einheit. Vergleichen Sie sie mit Ihrem eigenen Workload. Welche Abwägung dahintersteckt, beschreibt das Fazit oben auf dieser Seite.
Kann ich Fun-ASR Flash gegen GPT-4o Transcribe Diarize A/B-testen, ohne zweimal zu integrieren?
Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.
Unterstützen Fun-ASR Flash und GPT-4o Transcribe Diarize Sprecherdiarisierung?
Das beantwortet die Tabelle der Fähigkeiten oben für jedes Modell einzeln, direkt aus der Dokumentation des jeweiligen Anbieters. Diarisierung, Streaming und Zeitstempel stehen dort getrennt, weil sich die Modelle in allen drei Punkten unterscheiden.