O Whisper v1 é o modelo de reconhecimento de fala de propósito geral da OpenAI, treinado em um grande conjunto de dados de áudio diverso.
- Entrada
- áudio
- Saída
- texto
- Preço
- $0.006/min
O preço em contexto
Posição do preço entre 11 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Áudio
| Idiomas | Treinado em 98 idiomas; 57 listados como suportados, os idiomas que atingiram o limiar da OpenAI de taxa de erro por palavra abaixo de 50% nos endpoints de transcrições e traduções |
|---|---|
| Limites de áudio |
|
| Diarização | Não |
| Transcrição em streaming | Não |
| Marcas de tempo | Sim |
Modelo
| Modalidades | áudio → texto |
|---|
Whisper large-v2 de código aberto servido via API; prompt limitado a 224 tokens.
conforme documentação oficial da OpenAI ↗
Use o Whisper v1 em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="whisper-1",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "whisper-1",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="whisper-1" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "whisper-1",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("whisper-1")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Sobre o Whisper v1
- É um sistema multitarefa que realiza transcrição, reconhecimento de fala multilíngue, tradução de fala e identificação de idioma, e é cobrado simplesmente por minuto de áudio processado.
- Apesar dos modelos de transcrição mais novos baseados em GPT-4o, para vários trabalhos ele ainda é a única opção no stack de áudio da OpenAI.
- É o único modelo servido no endpoint de traduções, que verte fala para inglês, e o único que suporta granularidades de timestamp em nível de segmento ou de palavra.
- Ele também tem o suporte a formatos de resposta mais amplo da família, cobrindo JSON, texto simples, verbose JSON, SRT e VTT, que é o que os pipelines de legenda precisam.
- As contrapartidas são igualmente concretas: a transcrição em streaming não é suportada, os prompts direcionam o estilo em vez do conteúdo (o modelo tende a espelhar a pontuação e a capitalização do prompt), e apenas os 224 tokens finais de um prompt são considerados.
- Os limites compartilhados de transcrição se aplicam, com mp3, mp4, mpeg, mpga, m4a, wav e webm aceitos até 25MB.
- A documentação da OpenAI agora o enquadra historicamente, embora a página do modelo não traga aviso de descontinuação.
- A Synthorai aceita jobs do Whisper na sua rota /v1/audio/transcriptions compatível com OpenAI, então os clientes existentes funcionam como estão.
Perguntas frequentes
A API do Whisper v1 é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Whisper v1 com sua carga de trabalho real antes de adicionar um meio de pagamento.
Em que o Whisper v1 é melhor?
Multitarefa: transcrição, tradução, identificação de idioma; cobrado simplesmente por minuto de áudio; compatível entre os endpoints de transcrição e tradução. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Whisper v1?
Na Synthorai, o Whisper v1 custa $0.006 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.
Quais idiomas o Whisper v1 suporta?
O Whisper v1 suporta Treinado em 98 idiomas; 57 listados como suportados, os idiomas que atingiram o limiar da OpenAI de taxa de erro por palavra abaixo de 50% nos endpoints de transcrições e traduções. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.
Como obtenho acesso ao Whisper v1?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="whisper-1" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.