Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Fun-ASR Flash vs GPT-4o Transcribe Diarize

vs

Qual usar e quando

Ambos são modelos apenas de transcrição, mas cobram em unidades diferentes - fun-asr-flash cobra $0.0021 por minuto de áudio enquanto gpt-4o-transcribe-diarize cobra $6.25 por milhão de tokens de entrada de áudio, portanto nenhuma conversão única entre eles é honesta. Escolha o fun-asr-flash para trabalhos síncronos diretos de menos de 5 minutos ou 2GB, em mais de 30 idiomas, com injeção de contexto de termos de domínio, mas sem diarização. Escolha o gpt-4o-transcribe-diarize quando você precisar de diarização de locutor integrada com rótulos de locutor em diarized_json e timestamps de segmento, aceitando seu limite de arquivo de 25MB, contexto de 16000 tokens e chunking_strategy obrigatório para áudio com mais de 30s.

Preços

Fun-ASR Flash GPT-4o Transcribe Diarize Δ
Por minuto de áudio $0.0021 - -
Entrada de áudio / 1M tokens - $6.25 -
Saída de texto / 1M tokens - $2.5 -

Estes dois modelos cobram em unidades diferentes, então nenhum Δ é mostrado: converter uma na outra exigiria uma suposição que não medimos. Acima, os preços de cada um aparecem na sua própria unidade.

Capacidades

Fun-ASR Flash GPT-4o Transcribe Diarize
Diarização de locutor não sim
Streaming sim sim
Timestamps - sim

Especificações

Fun-ASR Flash GPT-4o Transcribe Diarize
Modalidades de entrada áudio texto áudio
Modalidades de saída texto texto
Lançamento 2026-06 2025-10
Corte de conhecimento - 2024-06
Limites

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB

built-in speaker diarization with diarized_json output (speaker labels + segment timestamps)

chunking_strategy required for audio >30s

no prompt support

Idiomas Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

57 languages listed for the transcriptions endpoint (one shared list for all transcription models)

ISO 639-1 / 639-3 codes accepted for GPT-4o-based models

Saída máxima - 2K

As especificações são transcritas da documentação de cada provedor; quando um provedor não publica um dado, a linha é omitida, e não inferida. Fontes completas: Fun-ASR Flash · GPT-4o Transcribe Diarize

Troque de um para o outro mudando uma linha

Os dois ids estão em todas as abas abaixo; o par de linhas destacado é a única alteração. O endpoint, a chave e o formato da requisição são os mesmos.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-flash",
    # model="gpt-4o-transcribe-diarize",  # descomente esta linha, comente a linha acima
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenha sua chave de API →

Perguntas frequentes

Qual é mais barato, Fun-ASR Flash ou GPT-4o Transcribe Diarize?

Eles cobram em unidades diferentes, então não existe um número único que seja honesto: na tabela acima, Fun-ASR Flash e GPT-4o Transcribe Diarize aparecem cada um na sua unidade. Compare os dois na sua própria carga de trabalho; o trade-off na prática está descrito no veredito, no topo desta página.

Posso fazer um teste A/B de Fun-ASR Flash contra GPT-4o Transcribe Diarize sem duas integrações?

Sim. Os dois são servidos pelo mesmo endpoint compatível com OpenAI, com uma única chave de API. Para trocar, basta mudar uma linha, a string do modelo; assim você pode direcionar uma parte do tráfego para cada um e comparar as contas diretamente.

Fun-ASR Flash e GPT-4o Transcribe Diarize suportam diarização de locutor?

A tabela de capacidades acima responde modelo a modelo, direto da documentação de cada provedor. Diarização, streaming e timestamps aparecem em linhas separadas porque os modelos diferem nos três.

Comparações relacionadas

Dos nossos estudos com medições