Fun-ASR Flash vs GPT-4o Transcribe Diarize
Qual usar, quando — veredito curado, não uma tabela de benchmark
Ambos são modelos apenas de transcrição, mas cobram em unidades diferentes — fun-asr-flash cobra $0.0021 por minuto de áudio enquanto gpt-4o-transcribe-diarize cobra $6.25 por milhão de tokens de entrada de áudio, portanto nenhuma conversão única entre eles é honesta. Escolha o fun-asr-flash para trabalhos síncronos diretos de menos de 5 minutos ou 2GB, em mais de 30 idiomas, com injeção de contexto de termos de domínio, mas sem diarização. Escolha o gpt-4o-transcribe-diarize quando você precisar de diarização de locutor integrada com rótulos de locutor em diarized_json e timestamps de segmento, aceitando seu limite de arquivo de 25MB, contexto de 16000 tokens e chunking_strategy obrigatório para áudio com mais de 30s.
Preços
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Por minuto de áudio | $0.0021 | — | — |
| Entrada de áudio / 1M tokens | — | $6.25 | — |
| Saída de texto / 1M tokens | — | $2.5 | — |
Esses dois modelos cobram em unidades diferentes, portanto, nenhum Δ é mostrado — a conversão entre eles exigiria uma suposição que não medimos. Cada cartão está listado em sua própria unidade acima.
Capacidades
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Diarização de locutor | não | sim |
| Streaming | sim | sim |
| Timestamps | — | sim |
Especificações
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Modalidades de entrada | áudio | texto áudio |
| Modalidades de saída | texto | texto |
| Lançamento | 2026-06 | 2025-10 |
| Corte de conhecimento | — | 2024-06 |
| Limites | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Idiomas | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Saída máxima | — | 2K |
As especificações são transcritas da documentação de cada fornecedor; uma linha que um fornecedor não publica é omitida em vez de ser inferida. Fontes completas: Fun-ASR Flash · GPT-4o Transcribe Diarize
Alterne entre eles com uma linha
Ambos os IDs estão em todas as abas abaixo — o par de linhas destacado é a única edição. Mesmo endpoint, mesma chave, mesmo formato de requisição.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # descomente esta linha, comente a linha acima
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // descomente esta linha, comente a linha acima
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # descomente esta linha, comente a linha acima
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // descomente esta linha, comente a linha acima
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // descomente esta linha, comente a linha acima
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Qual é mais barato, Fun-ASR Flash ou GPT-4o Transcribe Diarize?
Eles cobram em unidades diferentes, então não há um único número honesto: Fun-ASR Flash e GPT-4o Transcribe Diarize aparecem cada um em sua própria unidade na tabela acima. Compare-os em sua própria carga de trabalho — o trade-off prático está descrito no veredito no topo desta página.
Posso fazer um teste A/B de Fun-ASR Flash contra GPT-4o Transcribe Diarize sem duas integrações?
Sim. Ambos são servidos pelo mesmo endpoint compatível com OpenAI com uma única chave de API — a troca é uma alteração de uma linha na string do modelo, de modo que você pode rotear uma fração do tráfego para cada um e comparar as faturas diretamente.
Fun-ASR Flash e GPT-4o Transcribe Diarize suportam diarização de locutor?
A tabela de capacidades acima responde a isso por modelo, direto da documentação de cada fornecedor — diarização, streaming e timestamps são listados separadamente porque os modelos diferem nos três.