GPT-4o Transcribe Diarize est un modèle de reconnaissance vocale automatique qui identifie qui parle et quand : il associe les segments audio aux différents locuteurs d'une conversation, de sorte que les transcriptions capturent qui a dit quoi, et pas seulement ce qui a été dit.
- Entrée
- audio texte $2.5/M
- Sortie
- texte $2.5/M
- Entrée audio
- $6.25/M
- Contexte
- 16K
- Coupure des connaissances
- 2024-06
Le prix en contexte
Position du prix parmi 3 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Sortie max (spéc. fournisseur) | 2 000 |
|---|---|
| Coupure des connaissances | 2024-06 |
Audio
| Langues | 57 langues listées pour l'endpoint de transcriptions (une liste unique partagée par tous les modèles de transcription) ; codes ISO 639-1 / 639-3 acceptés pour les modèles basés sur GPT-4o |
|---|---|
| Limites audio |
|
| Diarisation | Oui |
| Transcription en streaming | Oui |
| Horodatages | Oui |
Modèle
| Modalités | audio + texte → texte |
|---|
Seul modèle de transcription d'OpenAI doté d'une diarisation des locuteurs intégrée.
Utilisez GPT-4o Transcribe Diarize en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe-diarize",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe-diarize",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe-diarize" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe-diarize",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe-diarize")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());À propos de GPT-4o Transcribe Diarize
- Il partage la fenêtre de contexte de 16K tokens et les 2K tokens de sortie maximale de la famille de transcription GPT-4o et est conçu spécifiquement pour l'endpoint de transcription plutôt que pour le chat général.
- OpenAI indique clairement que le modèle n'est disponible que via la Transcription API et pas dans la Realtime API.
- C'est le seul modèle OpenAI qui renvoie le format de réponse JSON diarisé, lequel porte les étiquettes de locuteur à côté des horodatages de segment ; le JSON simple et le texte sont également disponibles, mais pas SRT, VTT ni le JSON détaillé.
- Deux comportements lui sont propres.
- Une stratégie de découpage est requise pour l'audio de plus de 30 secondes, soit automatique, soit via une configuration de détection d'activité vocale que vous fournissez, et le prompting n'est pas disponible du tout, si bien que les astuces de contexte qui fonctionnent sur ses frères ne s'appliquent pas ici.
- Les locuteurs peuvent facultativement être nommés à l'avance en fournissant jusqu'à quatre courts extraits de référence de quelques secondes chacun.
- Le streaming fonctionne, même si l'attribution des locuteurs se fige par segment plutôt que mot à mot.
- Les comptes rendus de réunion, l'analyse d'appels et l'outillage d'entretiens sont son terrain naturel.
- Synthorai l'expose via la même API de transcription compatible OpenAI que ses frères.
FAQ
Peut-on essayer l'API GPT-4o Transcribe Diarize gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer GPT-4o Transcribe Diarize sur votre charge de travail réelle avant d'ajouter un moyen de paiement.
Quels sont les points forts de GPT-4o Transcribe Diarize ?
Diarisation des locuteurs intégrée ; les transcriptions capturent qui a dit quoi ; adapté aux comptes rendus de réunion et à l'analyse d'appels. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte GPT-4o Transcribe Diarize ?
Sur Synthorai, GPT-4o Transcribe Diarize coûte $2.5 par million de tokens en entrée et $2.5 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.
Quelles langues GPT-4o Transcribe Diarize prend-il en charge ?
GPT-4o Transcribe Diarize prend en charge 57 langues listées pour l'endpoint de transcriptions (une liste unique partagée par tous les modèles de transcription) ; codes ISO 639-1 / 639-3 acceptés pour les modèles basés sur GPT-4o. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.
Comment obtenir l'accès à GPT-4o Transcribe Diarize ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gpt-4o-transcribe-diarize", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.