Chirp 3 vs GPT-4o Transcribe Diarize
Lequel choisir, et quand
Ces deux modèles effectuent de la transcription avec diarisation des locuteurs, mais ils facturent dans des unités différentes - chirp-3 à $0.016 par minute d'audio contre gpt-4o-transcribe-diarize à $6.25 par million de tokens d'entrée audio plus $2.5 par million de tokens de texte en entrée et en sortie - aucune conversion simple entre eux n'est donc fiable. Choisissez chirp-3 pour les tâches longues ou en direct : BatchRecognize s'étend de 1 minute à 1 heure, StreamingRecognize gère le temps réel, et il couvre 29 locales GA plus 82 en préversion, bien que les horodatages au niveau du mot ne soient pas pris en charge. Choisissez gpt-4o-transcribe-diarize pour les fichiers plus courts de moins de 25MB où vous souhaitez un diarized_json avec des étiquettes de locuteurs et des horodatages de segments, dans la limite de son contexte de 16000 tokens et de son plafond de sortie de 2000 tokens.
Tarifs
| Chirp 3 | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Par minute d'audio | $0.016 | - | - |
| Entrée audio / 1M de tokens | - | $6.25 | - |
| Sortie texte / 1M de tokens | - | $2.5 | - |
Ces deux modèles ne sont pas facturés dans la même unité : aucun Δ n'est donc affiché, car les convertir supposerait une hypothèse que nous n'avons pas mesurée. Chaque grille tarifaire figure ci-dessus dans sa propre unité.
Capacités
| Chirp 3 | GPT-4o Transcribe Diarize | |
|---|---|---|
| Diarisation des locuteurs | oui | oui |
| Streaming | oui | oui |
| Horodatages | oui | oui |
Spécifications
| Chirp 3 | GPT-4o Transcribe Diarize | |
|---|---|---|
| Modalités d'entrée | audio | texte audio |
| Modalités de sortie | texte | texte |
| Date de sortie | 2025-10-13 | 2025-10 |
| Coupure des connaissances | - | 2024-06 |
| Limites | Auto-detected audio decoding sync Recognize <1 min, BatchRecognize 1 min - 1 hr (<=20 min with word timestamps), StreamingRecognize for real-time speaker diarization in BatchRecognize and Recognize (14 languages) utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported language-agnostic transcription 29 GA + 82 preview locales | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Langues | 29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize diarization covers 14 of them | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Sortie maximale | - | 2K |
Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : Chirp 3 · GPT-4o Transcribe Diarize
Passez de l'un à l'autre en changeant une seule ligne
Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-3",
# model="gpt-4o-transcribe-diarize", # décommentez cette ligne, commentez celle du dessus
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-3",
// model: "gpt-4o-transcribe-diarize", // décommentez cette ligne, commentez celle du dessus
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-3" \
# -F model="gpt-4o-transcribe-diarize" \ # décommentez cette ligne, commentez celle du dessus
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-3",
// Model: "gpt-4o-transcribe-diarize", // décommentez cette ligne, commentez celle du dessus
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-3")
// .model("gpt-4o-transcribe-diarize") // décommentez cette ligne, commentez celle du dessus
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Lequel est le moins cher, Chirp 3 ou GPT-4o Transcribe Diarize ?
Ils ne sont pas facturés dans la même unité, il n'existe donc pas de chiffre unique qui soit honnête : dans le tableau ci-dessus, Chirp 3 et GPT-4o Transcribe Diarize apparaissent chacun dans sa propre unité. Comparez-les sur votre charge de travail réelle. Le verdict en haut de cette page décrit le compromis en pratique.
Puis-je faire un test A/B entre Chirp 3 et GPT-4o Transcribe Diarize sans deux intégrations ?
Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.
Chirp 3 et GPT-4o Transcribe Diarize prennent-ils en charge la diarisation des locuteurs ?
Le tableau des capacités ci-dessus répond modèle par modèle, d'après la documentation de chaque fournisseur. La diarisation, le streaming et les horodatages y figurent séparément, car les modèles diffèrent sur ces trois points.