GPT-4o Transcribe est un modèle speech-to-text qui utilise GPT-4o pour transcrire de l'audio et constitue l'offre de transcription premium d'OpenAI.
- Entrée
- audio texte $2.5/M
- Sortie
- texte $10/M
- Entrée audio
- $6/M
- Contexte
- 16K
- Coupure des connaissances
- 2024-06
Benchmarks
Chiffres publiés par les fournisseurs : Alibaba (Qwen) ByteDance Google OpenAI
Le prix en contexte
Position du prix parmi 3 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Sortie max (spéc. fournisseur) | 2 000 |
|---|---|
| Coupure des connaissances | 2024-06 |
Audio
| Langues | 57 langues listées pour l'endpoint de transcriptions (une liste unique partagée par tous les modèles de transcription) ; codes ISO 639-1 / 639-3 acceptés pour les modèles basés sur GPT-4o |
|---|---|
| Limites audio |
|
| Diarisation | Non |
| Transcription en streaming | Oui |
| Horodatages | Non |
Modèle
| Modalités | audio + texte → texte |
|---|
Utilisez GPT-4o Transcribe en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());À propos de GPT-4o Transcribe
- La page officielle lui crédite des améliorations du taux d'erreur sur les mots ainsi qu'une meilleure reconnaissance et une meilleure précision linguistiques par rapport aux modèles Whisper d'origine.
- Les requêtes disposent d'une fenêtre de contexte de 16K tokens avec jusqu'à 2K tokens de sortie, et le modèle est servi sur les endpoints de transcription et temps réel.
- Les envois suivent les limites communes de l'API de transcription : mp3, mp4, mpeg, mpga, m4a, wav ou webm, jusqu'à 25 Mo par fichier, les enregistrements plus longs devant être découpés côté client.
- Contrairement à Whisper, il accepte un prompt, qu'OpenAI décrit comme un moyen d'améliorer la qualité de transcription en donnant au modèle du contexte supplémentaire, exactement comme on promptera n'importe quel autre modèle GPT-4o, ce qui est utile pour les noms propres, le jargon et l'orthographe des produits.
- La transcription en streaming est prise en charge, tout comme les probabilités logarithmiques pour les pipelines qui exploitent la confiance.
- Deux limites façonnent les intégrations : la sortie n'est disponible qu'en JSON ou en texte brut, sans SRT, VTT ni JSON détaillé, et les granularités d'horodatage au niveau du mot ou du segment ne sont pas proposées sur ce modèle.
- La couverture linguistique suit la liste publiée par l'API de transcription de plus de soixante-dix langues, qu'OpenAI conditionne à un seuil de taux d'erreur sur les mots plutôt que de revendiquer une prise en charge universelle, et la date limite des connaissances est juin 2024.
- OpenAI le présente comme le choix de plus haute précision lorsque le streaming n'est pas la priorité.
- Sur Synthorai, il se branche tel quel sur la route /v1/audio/transcriptions compatible OpenAI.
FAQ
Peut-on essayer l'API GPT-4o Transcribe gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer GPT-4o Transcribe sur votre charge de travail réelle avant d'ajouter un moyen de paiement.
Quels sont les points forts de GPT-4o Transcribe ?
Palier de transcription premium ; meilleure reconnaissance linguistique que Whisper d'origine ; servi sur les endpoints de transcription et temps réel. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte GPT-4o Transcribe ?
Sur Synthorai, GPT-4o Transcribe coûte $2.5 par million de tokens en entrée et $10 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.
Quelles langues GPT-4o Transcribe prend-il en charge ?
GPT-4o Transcribe prend en charge 57 langues listées pour l'endpoint de transcriptions (une liste unique partagée par tous les modèles de transcription) ; codes ISO 639-1 / 639-3 acceptés pour les modèles basés sur GPT-4o. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.
Comment obtenir l'accès à GPT-4o Transcribe ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gpt-4o-transcribe", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.