Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT-4o Transcribe

Lançado em 2025-03-20

transcription

O GPT-4o Transcribe é um modelo de speech-to-text que usa o GPT-4o para transcrever áudio, servindo como a oferta de transcrição premium da OpenAI.

Entrada
áudio texto $2.5/M
Saída
texto $10/M
Entrada de áudio
$6/M
Contexto
16K
Corte de conhecimento
2024-06

Benchmarks

Acima da médiaapenas 1 comparáveis
GPT-4o Transcribe outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
WenetSpeech test-net (CER)
15.3%

Publicado pelos fornecedores: Alibaba (Qwen) ByteDance Google OpenAI

O preço em contexto

Posição do preço entre 3 modelos comparáveis

Entrada$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
Saída$10/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Saída máxima (especificação do fornecedor) 2.000
Corte de conhecimento 2024-06

Áudio

Idiomas 57 idiomas listados para o endpoint de transcrições (uma lista única para todos os modelos de transcrição); códigos ISO 639-1 / 639-3 aceitos nos modelos baseados em GPT-4o
Limites de áudio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, até 25MB
  • transcrição em streaming suportada (incluindo sessões de transcrição em Realtime)
  • saída apenas em json/text
  • sem timestamps por palavra nem diarização
Diarização Não
Transcrição em streaming Sim
Marcas de tempo Não

Modelo

Modalidades áudio + texto → texto

conforme documentação oficial da OpenAI ↗

Use o GPT-4o Transcribe em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Sobre o GPT-4o Transcribe

  • A página oficial o credita com melhorias na taxa de erro por palavra e melhor reconhecimento e precisão de idioma em comparação com os modelos Whisper originais.
  • As requisições carregam uma janela de contexto de 16K tokens com até 2K tokens de saída, e o modelo é servido nos endpoints de transcrição e realtime.
  • Os uploads seguem os limites compartilhados da API de transcrição: mp3, mp4, mpeg, mpga, m4a, wav ou webm, até 25MB por arquivo, com gravações mais longas divididas no lado do cliente.
  • Diferente do Whisper, ele aceita um prompt, que a OpenAI descreve como uma forma de melhorar a qualidade da transcrição dando ao modelo contexto adicional do mesmo jeito que você faria com qualquer outro modelo GPT-4o, o que é útil para nomes, jargão e grafias de produtos.
  • A transcrição em streaming é suportada, assim como as log probabilities para pipelines conscientes de confiança.
  • Dois limites moldam as integrações: a saída está disponível apenas como JSON ou texto simples, sem SRT, VTT ou verbose JSON, e granularidades de timestamp por palavra ou por segmento não são oferecidas neste modelo.
  • A cobertura de idiomas segue a lista publicada da API de transcrição de mais de setenta idiomas, que a OpenAI condiciona a um limiar de taxa de erro por palavra em vez de afirmar suporte universal, e o corte de conhecimento é junho de 2024.
  • A OpenAI o enquadra como a escolha de maior precisão quando o streaming não é a prioridade.
  • Na Synthorai, ele se conecta à rota /v1/audio/transcriptions compatível com OpenAI sem alterações.

Perguntas frequentes

A API do GPT-4o Transcribe é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o GPT-4o Transcribe com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o GPT-4o Transcribe é melhor?

Nível de transcrição premium; melhor reconhecimento de idioma que o Whisper original; servido nos endpoints de transcrição e realtime. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GPT-4o Transcribe?

Na Synthorai, o GPT-4o Transcribe custa $2.5 por milhão de tokens de entrada e $10 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

Quais idiomas o GPT-4o Transcribe suporta?

O GPT-4o Transcribe suporta 57 idiomas listados para o endpoint de transcrições (uma lista única para todos os modelos de transcrição); códigos ISO 639-1 / 639-3 aceitos nos modelos baseados em GPT-4o. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.

Como obtenho acesso ao GPT-4o Transcribe?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="gpt-4o-transcribe" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →