Chirp 3 est la dernière génération des modèles génératifs multilingues spécialisés en ASR de Google sur l'API Speech-to-Text v2, en disponibilité générale depuis octobre 2025 dans les multi-régions US et EU.
- Entrée
- audio
- Sortie
- texte
- Prix
- $0.016/min
Le prix en contexte
Position du prix parmi 11 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Audio
| Langues | 29 locales GA + 82 en préversion (111 au total) sur StreamingRecognize, Recognize et BatchRecognize ; la diarisation en couvre 14 |
|---|---|
| Limites audio |
|
| Diarisation | Oui |
| Transcription en streaming | Oui |
| Horodatages | Oui |
Modèle
| Modalités | audio → texte |
|---|
- L'id officiel du modèle est chirp_3
- préversion privée le 2025-04-11, GA le 2025-10-13 selon les notes de version Speech-to-Text
- facturé à l'audio
Utilisez Chirp 3 en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-3",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-3",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-3" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-3",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-3")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());À propos de Chirp 3
- La documentation officielle met en avant une précision et une vitesse accrues par rapport aux modèles Chirp précédents, plus deux nouvelles capacités : la diarisation des locuteurs et la détection automatique de la langue.
- Il publie plus d'une centaine de locales réparties entre les paliers de disponibilité générale et de préversion, génère la ponctuation et la capitalisation automatiques, et accepte l'adaptation vocale avec jusqu'à 1 000 indices de phrases, même si Google recommande d'utiliser le moins d'entrées possible afin que les termes hors adaptation ne se dégradent pas.
- La reconnaissance en streaming, synchrone et par lots est prise en charge, et la diarisation est disponible en reconnaissance par lots pour quatorze langues.
- Les nouveaux contrôles comprennent un prompt personnalisé en préversion pour orienter la mise en forme du transcript, un indicateur de débruitage dont Google avertit qu'il ne peut pas supprimer les voix humaines en arrière-plan, et une sensibilité de détection de fin de parole à standard, short ou supershort.
- La mise à niveau n'est pas purement additive, et les lacunes méritent vérification avant de basculer : Chirp 3 documente des horodatages au niveau de l'énoncé plutôt que du mot, ne documente ni traduction vocale ni filtre de grossièretés, et plafonne l'audio par lots à une heure, ou vingt minutes lorsque les horodatages sont activés, contre huit heures pour Chirp 2.
- Sur Synthorai, Chirp 3 est accessible via la même interface de transcription compatible OpenAI que tout autre modèle vocal.
FAQ
Peut-on essayer l'API Chirp 3 gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Chirp 3 sur votre charge de travail réelle avant d'ajouter un moyen de paiement.
Quels sont les points forts de Chirp 3 ?
Diarisation des locuteurs et détection automatique de la langue ; transcrit plus de 100 langues et variantes ; adaptation vocale avec jusqu'à 1 000 indices de phrases. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Chirp 3 ?
Sur Synthorai, Chirp 3 coûte $0.016 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.
Quelles langues Chirp 3 prend-il en charge ?
Chirp 3 prend en charge 29 locales GA + 82 en préversion (111 au total) sur StreamingRecognize, Recognize et BatchRecognize ; la diarisation en couvre 14. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.
Comment obtenir l'accès à Chirp 3 ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="chirp-3", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.