Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Whisper v1

Lançado em 2023-03-01

transcription

O Whisper v1 é o modelo de reconhecimento de fala de propósito geral da OpenAI, treinado em um grande conjunto de dados de áudio diverso.

Entrada
áudio
Saída
texto
Preço
$0.006/min

O preço em contexto

Posição do preço entre 11 modelos comparáveis

Por minuto$0.006/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Áudio

Idiomas Treinado em 98 idiomas; 57 listados como suportados, os idiomas que atingiram o limiar da OpenAI de taxa de erro por palavra abaixo de 50% nos endpoints de transcrições e traduções
Limites de áudio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, até 25MB
  • timestamps por palavra e por segmento (verbose_json), saída srt/vtt
  • sem streaming
  • único modelo suportado no endpoint de traduções (para inglês)
Diarização Não
Transcrição em streaming Não
Marcas de tempo Sim

Modelo

Modalidades áudio → texto

Whisper large-v2 de código aberto servido via API; prompt limitado a 224 tokens.

conforme documentação oficial da OpenAI ↗

Use o Whisper v1 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="whisper-1",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Sobre o Whisper v1

  • É um sistema multitarefa que realiza transcrição, reconhecimento de fala multilíngue, tradução de fala e identificação de idioma, e é cobrado simplesmente por minuto de áudio processado.
  • Apesar dos modelos de transcrição mais novos baseados em GPT-4o, para vários trabalhos ele ainda é a única opção no stack de áudio da OpenAI.
  • É o único modelo servido no endpoint de traduções, que verte fala para inglês, e o único que suporta granularidades de timestamp em nível de segmento ou de palavra.
  • Ele também tem o suporte a formatos de resposta mais amplo da família, cobrindo JSON, texto simples, verbose JSON, SRT e VTT, que é o que os pipelines de legenda precisam.
  • As contrapartidas são igualmente concretas: a transcrição em streaming não é suportada, os prompts direcionam o estilo em vez do conteúdo (o modelo tende a espelhar a pontuação e a capitalização do prompt), e apenas os 224 tokens finais de um prompt são considerados.
  • Os limites compartilhados de transcrição se aplicam, com mp3, mp4, mpeg, mpga, m4a, wav e webm aceitos até 25MB.
  • A documentação da OpenAI agora o enquadra historicamente, embora a página do modelo não traga aviso de descontinuação.
  • A Synthorai aceita jobs do Whisper na sua rota /v1/audio/transcriptions compatível com OpenAI, então os clientes existentes funcionam como estão.

Perguntas frequentes

A API do Whisper v1 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Whisper v1 com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o Whisper v1 é melhor?

Multitarefa: transcrição, tradução, identificação de idioma; cobrado simplesmente por minuto de áudio; compatível entre os endpoints de transcrição e tradução. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Whisper v1?

Na Synthorai, o Whisper v1 custa $0.006 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.

Quais idiomas o Whisper v1 suporta?

O Whisper v1 suporta Treinado em 98 idiomas; 57 listados como suportados, os idiomas que atingiram o limiar da OpenAI de taxa de erro por palavra abaixo de 50% nos endpoints de transcrições e traduções. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.

Como obtenho acesso ao Whisper v1?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="whisper-1" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →