GPT-4o Transcribe Diarize vs Seed ASR
Qual usar e quando
Estes dois cobram em unidades diferentes - gpt-4o-transcribe-diarize a $6.25 por milhão de tokens de áudio de entrada mais $2.5 por milhão de tokens de texto, seed-asr-bigmodel a $0.002 fixos por minuto de áudio - então nenhuma conversão única entre eles é honesta. Ambos diarizam: o seed-asr-bigmodel aceita arquivos de até 5 horas e 512MB com carimbos de tempo por palavra, contra um limite de 25MB e um chunking_strategy obrigatório acima de 30 segundos do lado da OpenAI. Escolha o gpt-4o-transcribe-diarize para diarized_json dentro de um pipeline no formato OpenAI, o seed-asr-bigmodel para gravações longas cobradas por minuto.
Preços
| GPT-4o Transcribe Diarize | Seed ASR | Δ | |
|---|---|---|---|
| Por minuto de áudio | - | $0.002 | - |
| Entrada de áudio / 1M tokens | $6.25 | - | - |
| Saída de texto / 1M tokens | $2.5 | - | - |
Estes dois modelos cobram em unidades diferentes, então nenhum Δ é mostrado: converter uma na outra exigiria uma suposição que não medimos. Acima, os preços de cada um aparecem na sua própria unidade.
Capacidades
| GPT-4o Transcribe Diarize | Seed ASR | |
|---|---|---|
| Diarização de locutor | sim | sim |
| Streaming | sim | sim |
| Timestamps | sim | sim |
Especificações
| GPT-4o Transcribe Diarize | Seed ASR | |
|---|---|---|
| Modalidades de entrada | texto áudio | áudio |
| Modalidades de saída | texto | texto |
| Lançamento | 2025-10 | 2025-12-05 |
| Corte de conhecimento | 2024-06 | - |
| Limites | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support | Async audio-file mode: <512MB, <5 hours, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (raw PCM also accepted), results returned within 3 hours and retained 7 days speaker diarization via enable_speaker_info (audio-file API only, best with <=10 speakers, no diarization on the streaming API) sentence + word segmentation with start_time/end_time via show_utterances language identification via enable_lid hotwords/context up to 800 tokens and 20 rounds per-call billing |
| Idiomas | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models | With `language` empty the model covers Mandarin, English, Cantonese, Shanghainese, Minnan, Sichuan and Shaanxi dialects 39 language keys can be pinned explicitly (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus optional auto-detection (enable_auto_lang) |
| Saída máxima | 2K | - |
As especificações são transcritas da documentação de cada provedor; quando um provedor não publica um dado, a linha é omitida, e não inferida. Fontes completas: GPT-4o Transcribe Diarize · Seed ASR
Troque de um para o outro mudando uma linha
Os dois ids estão em todas as abas abaixo; o par de linhas destacado é a única alteração. O endpoint, a chave e o formato da requisição são os mesmos.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe-diarize",
# model="seed-asr-bigmodel", # descomente esta linha, comente a linha acima
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe-diarize",
// model: "seed-asr-bigmodel", // descomente esta linha, comente a linha acima
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe-diarize" \
# -F model="seed-asr-bigmodel" \ # descomente esta linha, comente a linha acima
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe-diarize",
// Model: "seed-asr-bigmodel", // descomente esta linha, comente a linha acima
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe-diarize")
// .model("seed-asr-bigmodel") // descomente esta linha, comente a linha acima
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Perguntas frequentes
Qual é mais barato, GPT-4o Transcribe Diarize ou Seed ASR?
Eles cobram em unidades diferentes, então não existe um número único que seja honesto: na tabela acima, GPT-4o Transcribe Diarize e Seed ASR aparecem cada um na sua unidade. Compare os dois na sua própria carga de trabalho; o trade-off na prática está descrito no veredito, no topo desta página.
Posso fazer um teste A/B de GPT-4o Transcribe Diarize contra Seed ASR sem duas integrações?
Sim. Os dois são servidos pelo mesmo endpoint compatível com OpenAI, com uma única chave de API. Para trocar, basta mudar uma linha, a string do modelo; assim você pode direcionar uma parte do tráfego para cada um e comparar as contas diretamente.
GPT-4o Transcribe Diarize e Seed ASR suportam diarização de locutor?
A tabela de capacidades acima responde modelo a modelo, direto da documentação de cada provedor. Diarização, streaming e timestamps aparecem em linhas separadas porque os modelos diferem nos três.