Fun-ASR Flash vs GPT-4o Transcribe Diarize
Lequel choisir, et quand
Les deux sont des modèles dédiés uniquement à la transcription, mais ils facturent dans des unités différentes - fun-asr-flash facture $0.0021 par minute d'audio tandis que gpt-4o-transcribe-diarize facture $6.25 par million de tokens d'entrée audio, aucune conversion simple entre eux n'est donc fiable. Choisissez fun-asr-flash pour les tâches synchrones simples de moins de 5 minutes ou 2GB, dans 30+ langues, avec injection de contexte pour les termes du domaine mais sans diarisation. Choisissez gpt-4o-transcribe-diarize lorsque vous avez besoin d'une diarisation des locuteurs intégrée avec des étiquettes de locuteurs diarized_json et des horodatages de segments, en acceptant sa limite de fichier de 25MB, son contexte de 16000 tokens et le chunking_strategy requis pour l'audio de plus de 30s.
Tarifs
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Par minute d'audio | $0.0021 | - | - |
| Entrée audio / 1M de tokens | - | $6.25 | - |
| Sortie texte / 1M de tokens | - | $2.5 | - |
Ces deux modèles ne sont pas facturés dans la même unité : aucun Δ n'est donc affiché, car les convertir supposerait une hypothèse que nous n'avons pas mesurée. Chaque grille tarifaire figure ci-dessus dans sa propre unité.
Capacités
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Diarisation des locuteurs | non | oui |
| Streaming | oui | oui |
| Horodatages | - | oui |
Spécifications
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Modalités d'entrée | audio | texte audio |
| Modalités de sortie | texte | texte |
| Date de sortie | 2026-06 | 2025-10 |
| Coupure des connaissances | - | 2024-06 |
| Limites | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Langues | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Sortie maximale | - | 2K |
Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : Fun-ASR Flash · GPT-4o Transcribe Diarize
Passez de l'un à l'autre en changeant une seule ligne
Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # décommentez cette ligne, commentez celle du dessus
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // décommentez cette ligne, commentez celle du dessus
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # décommentez cette ligne, commentez celle du dessus
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // décommentez cette ligne, commentez celle du dessus
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // décommentez cette ligne, commentez celle du dessus
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Lequel est le moins cher, Fun-ASR Flash ou GPT-4o Transcribe Diarize ?
Ils ne sont pas facturés dans la même unité, il n'existe donc pas de chiffre unique qui soit honnête : dans le tableau ci-dessus, Fun-ASR Flash et GPT-4o Transcribe Diarize apparaissent chacun dans sa propre unité. Comparez-les sur votre charge de travail réelle. Le verdict en haut de cette page décrit le compromis en pratique.
Puis-je faire un test A/B entre Fun-ASR Flash et GPT-4o Transcribe Diarize sans deux intégrations ?
Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.
Fun-ASR Flash et GPT-4o Transcribe Diarize prennent-ils en charge la diarisation des locuteurs ?
Le tableau des capacités ci-dessus répond modèle par modèle, d'après la documentation de chaque fournisseur. La diarisation, le streaming et les horodatages y figurent séparément, car les modèles diffèrent sur ces trois points.