Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

GPT-4o Transcribe

Date de sortie : 2025-03-20

transcription

GPT-4o Transcribe est un modèle speech-to-text qui utilise GPT-4o pour transcrire de l'audio et constitue l'offre de transcription premium d'OpenAI.

Entrée
audio texte $2.5/M
Sortie
texte $10/M
Entrée audio
$6/M
Contexte
16K
Coupure des connaissances
2024-06

Benchmarks

Au-dessus de la moyenneseulement 1 comparables
GPT-4o Transcribe autres modèles mesurés moyenne des modèles comparés aucun autre modèle n'a fait mieux
WenetSpeech test-net (CER)
15.3%

Chiffres publiés par les fournisseurs : Alibaba (Qwen) ByteDance Google OpenAI

Le prix en contexte

Position du prix parmi 3 modèles comparables

Entrée$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
Sortie$10/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Sortie max (spéc. fournisseur) 2 000
Coupure des connaissances 2024-06

Audio

Langues 57 langues listées pour l'endpoint de transcriptions (une liste unique partagée par tous les modèles de transcription) ; codes ISO 639-1 / 639-3 acceptés pour les modèles basés sur GPT-4o
Limites audio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, jusqu'à 25 Mo
  • transcription en streaming prise en charge (y compris les sessions de transcription Realtime)
  • sortie json/text uniquement
  • pas d'horodatages de mots ni de diarisation
Diarisation Non
Transcription en streaming Oui
Horodatages Non

Modèle

Modalités audio + texte → texte

selon docs officielles OpenAI ↗

Utilisez GPT-4o Transcribe en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

À propos de GPT-4o Transcribe

  • La page officielle lui crédite des améliorations du taux d'erreur sur les mots ainsi qu'une meilleure reconnaissance et une meilleure précision linguistiques par rapport aux modèles Whisper d'origine.
  • Les requêtes disposent d'une fenêtre de contexte de 16K tokens avec jusqu'à 2K tokens de sortie, et le modèle est servi sur les endpoints de transcription et temps réel.
  • Les envois suivent les limites communes de l'API de transcription : mp3, mp4, mpeg, mpga, m4a, wav ou webm, jusqu'à 25 Mo par fichier, les enregistrements plus longs devant être découpés côté client.
  • Contrairement à Whisper, il accepte un prompt, qu'OpenAI décrit comme un moyen d'améliorer la qualité de transcription en donnant au modèle du contexte supplémentaire, exactement comme on promptera n'importe quel autre modèle GPT-4o, ce qui est utile pour les noms propres, le jargon et l'orthographe des produits.
  • La transcription en streaming est prise en charge, tout comme les probabilités logarithmiques pour les pipelines qui exploitent la confiance.
  • Deux limites façonnent les intégrations : la sortie n'est disponible qu'en JSON ou en texte brut, sans SRT, VTT ni JSON détaillé, et les granularités d'horodatage au niveau du mot ou du segment ne sont pas proposées sur ce modèle.
  • La couverture linguistique suit la liste publiée par l'API de transcription de plus de soixante-dix langues, qu'OpenAI conditionne à un seuil de taux d'erreur sur les mots plutôt que de revendiquer une prise en charge universelle, et la date limite des connaissances est juin 2024.
  • OpenAI le présente comme le choix de plus haute précision lorsque le streaming n'est pas la priorité.
  • Sur Synthorai, il se branche tel quel sur la route /v1/audio/transcriptions compatible OpenAI.

FAQ

Peut-on essayer l'API GPT-4o Transcribe gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer GPT-4o Transcribe sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de GPT-4o Transcribe ?

Palier de transcription premium ; meilleure reconnaissance linguistique que Whisper d'origine ; servi sur les endpoints de transcription et temps réel. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte GPT-4o Transcribe ?

Sur Synthorai, GPT-4o Transcribe coûte $2.5 par million de tokens en entrée et $10 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.

Quelles langues GPT-4o Transcribe prend-il en charge ?

GPT-4o Transcribe prend en charge 57 langues listées pour l'endpoint de transcriptions (une liste unique partagée par tous les modèles de transcription) ; codes ISO 639-1 / 639-3 acceptés pour les modèles basés sur GPT-4o. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.

Comment obtenir l'accès à GPT-4o Transcribe ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gpt-4o-transcribe", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →