Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

GPT-4o Transcribe vs Whisper v1

vs

Lequel choisir, et quand

Ces deux-là facturent dans des unités différentes - whisper-1 à $0.006 par minute d'audio, gpt-4o-transcribe à $6 par million de tokens audio en entrée plus $2.5 et $10 par million de tokens texte - donc aucune conversion unique entre eux n'est honnête. whisper-1 est celui qui offre les horodatages au mot et au segment, la sortie srt/vtt et le point de terminaison de traduction, mais il ne diffuse pas ; gpt-4o-transcribe diffuse, y compris en sessions de transcription temps réel, et ne renvoie que du json ou du texte. Prenez whisper-1 pour les sous-titres et la traduction, gpt-4o-transcribe pour du direct.

Benchmarks

Whisper v1 : le fournisseur n'a publié aucun résultat de benchmark.

Au-dessus de la moyenneGPT-4o Transcribeseulement 1 comparables
GPT-4o Transcribe Whisper v1 autres modèles mesurés moyenne des modèles comparés ★ aucun autre modèle n'a fait mieux
WenetSpeech test-net (CER)
15.3%
N/A

Chiffres publiés par les fournisseurs : Alibaba (Qwen) ByteDance Google OpenAI

Tarifs

GPT-4o Transcribe Whisper v1 Δ
Par minute d'audio - $0.006 -
Entrée audio / 1M de tokens $6 - -
Sortie texte / 1M de tokens $10 - -

Ces deux modèles ne sont pas facturés dans la même unité : aucun Δ n'est donc affiché, car les convertir supposerait une hypothèse que nous n'avons pas mesurée. Chaque grille tarifaire figure ci-dessus dans sa propre unité.

Capacités

GPT-4o Transcribe Whisper v1
Diarisation des locuteurs non non
Streaming oui non
Horodatages non oui

Spécifications

GPT-4o Transcribe Whisper v1
Modalités d'entrée texte audio audio
Modalités de sortie texte texte
Date de sortie 2025-03-20 2023-03-01
Coupure des connaissances 2024-06 -
Limites

mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB

streaming transcription supported (incl. Realtime transcription sessions)

json/text output only

no word timestamps or diarization

mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB

word- and segment-level timestamps (verbose_json), srt/vtt output

no streaming

only model supported on the translations endpoint (to English)

Langues

57 languages listed for the transcriptions endpoint (one shared list for all transcription models)

ISO 639-1 / 639-3 codes accepted for GPT-4o-based models

Trained on 98 languages

57 listed as supported, the languages that met OpenAI's under-50% word-error-rate threshold across the transcriptions and translations endpoints

Sortie maximale 2K -

Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : GPT-4o Transcribe · Whisper v1

Passez de l'un à l'autre en changeant une seule ligne

Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    # model="whisper-1",  # décommentez cette ligne, commentez celle du dessus
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenez votre clé API →

FAQ

Lequel est le moins cher, GPT-4o Transcribe ou Whisper v1 ?

Ils ne sont pas facturés dans la même unité, il n'existe donc pas de chiffre unique qui soit honnête : dans le tableau ci-dessus, GPT-4o Transcribe et Whisper v1 apparaissent chacun dans sa propre unité. Comparez-les sur votre charge de travail réelle. Le verdict en haut de cette page décrit le compromis en pratique.

Puis-je faire un test A/B entre GPT-4o Transcribe et Whisper v1 sans deux intégrations ?

Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.

GPT-4o Transcribe et Whisper v1 prennent-ils en charge la diarisation des locuteurs ?

Le tableau des capacités ci-dessus répond modèle par modèle, d'après la documentation de chaque fournisseur. La diarisation, le streaming et les horodatages y figurent séparément, car les modèles diffèrent sur ces trois points.

Comparatifs associés

Nos études, mesures à l'appui