Whisper v1 est le modèle de reconnaissance vocale polyvalent d'OpenAI, entraîné sur un vaste jeu de données audio variées.
- Entrée
- audio
- Sortie
- texte
- Prix
- $0.006/min
Le prix en contexte
Position du prix parmi 11 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Audio
| Langues | Entraîné sur 98 langues ; 57 listées comme prises en charge, celles qui atteignaient le seuil d'OpenAI d'un taux d'erreur sur les mots inférieur à 50 % sur les endpoints transcriptions et translations |
|---|---|
| Limites audio |
|
| Diarisation | Non |
| Transcription en streaming | Non |
| Horodatages | Oui |
Modèle
| Modalités | audio → texte |
|---|
Whisper large-v2, open source, servi via API ; prompt limité à 224 tokens.
Utilisez Whisper v1 en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="whisper-1",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "whisper-1",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="whisper-1" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "whisper-1",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("whisper-1")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());À propos de Whisper v1
- C'est un système multitâche qui réalise la transcription, la reconnaissance vocale multilingue, la traduction vocale et l'identification de la langue, et il est facturé simplement à la minute d'audio traité.
- Malgré les nouveaux modèles de transcription fondés sur GPT-4o, il reste, pour plusieurs tâches, la seule option de la pile audio d'OpenAI.
- C'est le seul modèle servi sur l'endpoint translations, qui rend la parole en anglais, et le seul à prendre en charge les granularités d'horodatage au niveau du segment ou du mot.
- Il possède aussi la plus large prise en charge de formats de réponse de la famille, couvrant JSON, texte brut, JSON détaillé, SRT et VTT, ce dont les pipelines de sous-titres ont besoin.
- Les compromis sont tout aussi concrets : la transcription en streaming n'est pas prise en charge, les prompts orientent le style plutôt que le contenu (le modèle a tendance à refléter la ponctuation et la capitalisation du prompt), et seuls les 224 derniers tokens d'un prompt sont pris en compte.
- Les limites communes de transcription s'appliquent, avec mp3, mp4, mpeg, mpga, m4a, wav et webm acceptés jusqu'à 25 Mo.
- La documentation d'OpenAI le présente désormais sous un angle historique, même si la page modèle ne porte aucun avis de dépréciation.
- Synthorai accepte les tâches Whisper sur sa route /v1/audio/transcriptions compatible OpenAI, si bien que les clients existants fonctionnent tels quels.
FAQ
Peut-on essayer l'API Whisper v1 gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Whisper v1 sur votre charge de travail réelle avant d'ajouter un moyen de paiement.
Quels sont les points forts de Whisper v1 ?
Multitâche : transcription, traduction, identification de la langue ; simplement facturé à la minute d'audio ; compatible avec les endpoints de transcription et de traduction. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Whisper v1 ?
Sur Synthorai, Whisper v1 coûte $0.006 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.
Quelles langues Whisper v1 prend-il en charge ?
Whisper v1 prend en charge Entraîné sur 98 langues ; 57 listées comme prises en charge, celles qui atteignaient le seuil d'OpenAI d'un taux d'erreur sur les mots inférieur à 50 % sur les endpoints transcriptions et translations. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.
Comment obtenir l'accès à Whisper v1 ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="whisper-1", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.