Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Whisper v1

Date de sortie : 2023-03-01

transcription

Whisper v1 est le modèle de reconnaissance vocale polyvalent d'OpenAI, entraîné sur un vaste jeu de données audio variées.

Entrée
audio
Sortie
texte
Prix
$0.006/min

Le prix en contexte

Position du prix parmi 11 modèles comparables

Par minute$0.006/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Audio

Langues Entraîné sur 98 langues ; 57 listées comme prises en charge, celles qui atteignaient le seuil d'OpenAI d'un taux d'erreur sur les mots inférieur à 50 % sur les endpoints transcriptions et translations
Limites audio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, jusqu'à 25 Mo
  • horodatages au niveau du mot et du segment (verbose_json), sortie srt/vtt
  • pas de streaming
  • seul modèle pris en charge sur l'endpoint de traductions (vers l'anglais)
Diarisation Non
Transcription en streaming Non
Horodatages Oui

Modèle

Modalités audio → texte

Whisper large-v2, open source, servi via API ; prompt limité à 224 tokens.

selon docs officielles OpenAI ↗

Utilisez Whisper v1 en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="whisper-1",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

À propos de Whisper v1

  • C'est un système multitâche qui réalise la transcription, la reconnaissance vocale multilingue, la traduction vocale et l'identification de la langue, et il est facturé simplement à la minute d'audio traité.
  • Malgré les nouveaux modèles de transcription fondés sur GPT-4o, il reste, pour plusieurs tâches, la seule option de la pile audio d'OpenAI.
  • C'est le seul modèle servi sur l'endpoint translations, qui rend la parole en anglais, et le seul à prendre en charge les granularités d'horodatage au niveau du segment ou du mot.
  • Il possède aussi la plus large prise en charge de formats de réponse de la famille, couvrant JSON, texte brut, JSON détaillé, SRT et VTT, ce dont les pipelines de sous-titres ont besoin.
  • Les compromis sont tout aussi concrets : la transcription en streaming n'est pas prise en charge, les prompts orientent le style plutôt que le contenu (le modèle a tendance à refléter la ponctuation et la capitalisation du prompt), et seuls les 224 derniers tokens d'un prompt sont pris en compte.
  • Les limites communes de transcription s'appliquent, avec mp3, mp4, mpeg, mpga, m4a, wav et webm acceptés jusqu'à 25 Mo.
  • La documentation d'OpenAI le présente désormais sous un angle historique, même si la page modèle ne porte aucun avis de dépréciation.
  • Synthorai accepte les tâches Whisper sur sa route /v1/audio/transcriptions compatible OpenAI, si bien que les clients existants fonctionnent tels quels.

FAQ

Peut-on essayer l'API Whisper v1 gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Whisper v1 sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de Whisper v1 ?

Multitâche : transcription, traduction, identification de la langue ; simplement facturé à la minute d'audio ; compatible avec les endpoints de transcription et de traduction. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Whisper v1 ?

Sur Synthorai, Whisper v1 coûte $0.006 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.

Quelles langues Whisper v1 prend-il en charge ?

Whisper v1 prend en charge Entraîné sur 98 langues ; 57 listées comme prises en charge, celles qui atteignaient le seuil d'OpenAI d'un taux d'erreur sur les mots inférieur à 50 % sur les endpoints transcriptions et translations. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.

Comment obtenir l'accès à Whisper v1 ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="whisper-1", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →