Fun-ASR Flash vs GPT-4o Transcribe Diarize
Lequel, quand — verdict de synthèse, pas un tableau de benchmarks
Les deux sont des modèles dédiés uniquement à la transcription, mais ils facturent dans des unités différentes — fun-asr-flash facture $0.0021 par minute d'audio tandis que gpt-4o-transcribe-diarize facture $6.25 par million de tokens d'entrée audio, aucune conversion simple entre eux n'est donc fiable. Choisissez fun-asr-flash pour les tâches synchrones simples de moins de 5 minutes ou 2GB, dans 30+ langues, avec injection de contexte pour les termes du domaine mais sans diarisation. Choisissez gpt-4o-transcribe-diarize lorsque vous avez besoin d'une diarisation des locuteurs intégrée avec des étiquettes de locuteurs diarized_json et des horodatages de segments, en acceptant sa limite de fichier de 25MB, son contexte de 16000 tokens et le chunking_strategy requis pour l'audio de plus de 30s.
Tarification
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Par minute d'audio | $0.0021 | — | — |
| Entrée audio / 1M tokens | — | $6.25 | — |
| Sortie texte / 1M tokens | — | $2.5 | — |
Ces deux modèles facturent dans des unités différentes, donc aucun Δ n'est affiché — leur conversion nécessiterait une hypothèse que nous n'avons pas mesurée. Chaque fiche est répertoriée dans sa propre unité ci-dessus.
Capacités
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Diarisation des locuteurs | non | oui |
| Streaming | oui | oui |
| Horodatages | — | oui |
Spécifications
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Modalités d'entrée | audio | texte audio |
| Modalités de sortie | texte | texte |
| Sortie | 2026-06 | 2025-10 |
| Limite de connaissances | — | 2024-06 |
| Limites | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Langues | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Sortie maximale | — | 2K |
Les spécifications sont transcrites à partir de la documentation de chaque fournisseur ; une ligne qu'un fournisseur ne publie pas est omise plutôt que déduite. Sources complètes : Fun-ASR Flash · GPT-4o Transcribe Diarize
Basculez de l'un à l'autre avec une seule ligne
Les deux ids sont dans chaque onglet ci-dessous — la paire de lignes en surbrillance est la seule modification. Même endpoint, même clé, même structure de requête.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # décommentez cette ligne, commentez celle du dessus
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // décommentez cette ligne, commentez celle du dessus
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # décommentez cette ligne, commentez celle du dessus
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // décommentez cette ligne, commentez celle du dessus
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // décommentez cette ligne, commentez celle du dessus
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Lequel est le moins cher, Fun-ASR Flash ou GPT-4o Transcribe Diarize ?
Ils facturent dans des unités différentes, il n'y a donc pas de chiffre unique honnête : Fun-ASR Flash et GPT-4o Transcribe Diarize apparaissent chacun dans leur propre unité dans le tableau ci-dessus. Comparez-les sur votre propre charge de travail — le compromis pratique est décrit dans le verdict en haut de cette page.
Puis-je faire un test A/B de Fun-ASR Flash par rapport à GPT-4o Transcribe Diarize sans deux intégrations ?
Oui. Les deux sont servis via le même endpoint compatible OpenAI avec une seule clé API — le basculement est un changement de chaîne de modèle en une ligne, vous pouvez donc diriger une fraction du trafic vers chacun et comparer les factures directement.
Fun-ASR Flash et GPT-4o Transcribe Diarize prennent-ils en charge la diarisation des locuteurs ?
Le tableau des capacités ci-dessus y répond par modèle, directement à partir de la documentation de chaque fournisseur — la diarisation, le streaming et les horodatages sont listés séparément car les modèles diffèrent sur ces trois points.