Chirp 3 vs GPT-4o Transcribe Diarize
Lequel, quand — verdict de synthèse, pas un tableau de benchmarks
Ces deux modèles effectuent de la transcription avec diarisation des locuteurs, mais ils facturent dans des unités différentes — chirp-3 à $0.016 par minute d'audio contre gpt-4o-transcribe-diarize à $6.25 par million de tokens d'entrée audio plus $2.5 par million de tokens de texte en entrée et en sortie — aucune conversion simple entre eux n'est donc fiable. Choisissez chirp-3 pour les tâches longues ou en direct : BatchRecognize s'étend de 1 minute à 1 heure, StreamingRecognize gère le temps réel, et il couvre 29 locales GA plus 82 en préversion, bien que les horodatages au niveau du mot ne soient pas pris en charge. Choisissez gpt-4o-transcribe-diarize pour les fichiers plus courts de moins de 25MB où vous souhaitez un diarized_json avec des étiquettes de locuteurs et des horodatages de segments, dans la limite de son contexte de 16000 tokens et de son plafond de sortie de 2000 tokens.
Tarification
| Chirp 3 | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Par minute d'audio | $0.016 | — | — |
| Entrée audio / 1M tokens | — | $6.25 | — |
| Sortie texte / 1M tokens | — | $2.5 | — |
Ces deux modèles facturent dans des unités différentes, donc aucun Δ n'est affiché — leur conversion nécessiterait une hypothèse que nous n'avons pas mesurée. Chaque fiche est répertoriée dans sa propre unité ci-dessus.
Capacités
| Chirp 3 | GPT-4o Transcribe Diarize | |
|---|---|---|
| Diarisation des locuteurs | oui | oui |
| Streaming | oui | oui |
| Horodatages | oui | oui |
Spécifications
| Chirp 3 | GPT-4o Transcribe Diarize | |
|---|---|---|
| Modalités d'entrée | audio | texte audio |
| Modalités de sortie | texte | texte |
| Sortie | 2025-10-13 | 2025-10 |
| Limite de connaissances | — | 2024-06 |
| Limites | Auto-detected audio decoding sync Recognize <1 min, BatchRecognize 1 min–1 hr (<=20 min with word timestamps), StreamingRecognize for real-time speaker diarization in BatchRecognize and Recognize (14 languages) utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported language-agnostic transcription 29 GA + 82 preview locales | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Langues | 29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize diarization covers 14 of them | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Sortie maximale | — | 2K |
Les spécifications sont transcrites à partir de la documentation de chaque fournisseur ; une ligne qu'un fournisseur ne publie pas est omise plutôt que déduite. Sources complètes : Chirp 3 · GPT-4o Transcribe Diarize
Basculez de l'un à l'autre avec une seule ligne
Les deux ids sont dans chaque onglet ci-dessous — la paire de lignes en surbrillance est la seule modification. Même endpoint, même clé, même structure de requête.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-3",
# model="gpt-4o-transcribe-diarize", # décommentez cette ligne, commentez celle du dessus
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-3",
// model: "gpt-4o-transcribe-diarize", // décommentez cette ligne, commentez celle du dessus
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-3" \
# -F model="gpt-4o-transcribe-diarize" \ # décommentez cette ligne, commentez celle du dessus
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-3",
// Model: "gpt-4o-transcribe-diarize", // décommentez cette ligne, commentez celle du dessus
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-3")
// .model("gpt-4o-transcribe-diarize") // décommentez cette ligne, commentez celle du dessus
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Lequel est le moins cher, Chirp 3 ou GPT-4o Transcribe Diarize ?
Ils facturent dans des unités différentes, il n'y a donc pas de chiffre unique honnête : Chirp 3 et GPT-4o Transcribe Diarize apparaissent chacun dans leur propre unité dans le tableau ci-dessus. Comparez-les sur votre propre charge de travail — le compromis pratique est décrit dans le verdict en haut de cette page.
Puis-je faire un test A/B de Chirp 3 par rapport à GPT-4o Transcribe Diarize sans deux intégrations ?
Oui. Les deux sont servis via le même endpoint compatible OpenAI avec une seule clé API — le basculement est un changement de chaîne de modèle en une ligne, vous pouvez donc diriger une fraction du trafic vers chacun et comparer les factures directement.
Chirp 3 et GPT-4o Transcribe Diarize prennent-ils en charge la diarisation des locuteurs ?
Le tableau des capacités ci-dessus y répond par modèle, directement à partir de la documentation de chaque fournisseur — la diarisation, le streaming et les horodatages sont listés séparément car les modèles diffèrent sur ces trois points.