Chirp 2 è il modello multilingue di riconoscimento vocale automatico di Google Cloud, servito tramite la Speech-to-Text v2 API.
- Input
- audio
- Output
- testo
- Prezzo
- $0.016/min
Il prezzo nel contesto
Posizione del prezzo tra 11 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Audio
| Lingue | Varia in base al metodo: BatchRecognize offre la copertura più estesa e Recognize è "alla pari con Chirp"; StreamingRecognize è limitato a 16 locale (cinese semplificato/tradizionale, cantonese, inglese AU/IN/GB/US, francese CA/FR, tedesco, italiano, giapponese, coreano, portoghese (Brasile), spagnolo ES/US) |
|---|---|
| Limiti audio |
|
| Diarizzazione | No |
| Trascrizione in streaming | Sì |
| Timestamp | Sì |
Modello
| Modalità | audio → testo |
|---|
- L'id ufficiale del modello nella Speech-to-Text V2 è chirp_2 (con underscore)
- GA, con espansione GA regionale (us-central1/europe-west4/asia-southeast1) il 2025-01-27
- fatturato in base all'audio
Usa Chirp 2 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-2",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-2",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-2" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-2",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-2")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Informazioni su Chirp 2
- Google lo posiziona come un miglioramento rispetto al Chirp originale sia in accuratezza sia in velocità, aggiungendo timestamp a livello di parola, adattamento del modello (phrase biasing) e traduzione del parlato.
- Offre punteggiatura e maiuscole automatiche, trascrizione indipendente dalla lingua, in cui il modello deduce la lingua prevalente dell'audio e trascrive in quella, e filtro delle volgarità, e supporta riconoscimento in streaming, sincrono e batch per audio da meno di un minuto fino a otto ore, il tetto batch più lungo di qualsiasi modello Chirp.
- Lo streaming copre sedici lingue e varianti locali, mentre il batch porta il supporto linguistico più esteso della famiglia.
- I timestamp a livello di parola vanno attivati esplicitamente, e Google osserva che qualità e velocità della trascrizione peggiorano leggermente quando sono attivi; il valore di confidenza a livello di parola che restituisce è documentato come non un vero punteggio di confidenza.
- L'adattamento accetta parole e frasi semplici, ma i class token e le classi personalizzate non sono supportati.
- La traduzione del parlato funziona su coppie asimmetriche, ventisette lingue di origine verso l'inglese statunitense e diciotto lingue di destinazione a partire da esso, e la normalizzazione forzata e un denoiser completano il set di funzionalità.
- L'unica lacuna significativa è la diarizzazione dei parlanti, che Google indica come non supportata; è quella capacità la ragione per passare a Chirp 3.
- La disponibilità è limitata a un piccolo insieme di regioni.
- Synthorai serve la trascrizione con Chirp 2 tramite il suo endpoint audio compatibile OpenAI.
FAQ
L'API di Chirp 2 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Chirp 2 sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle Chirp 2?
Accuratezza e velocità migliorate rispetto al predecessore; timestamp a livello di parola e traduzione del parlato; audio da meno di un minuto a otto ore. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Chirp 2?
Su Synthorai, Chirp 2 costa $0.016 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.
Quali lingue supporta Chirp 2?
Chirp 2 supporta Varia in base al metodo: BatchRecognize offre la copertura più estesa e Recognize è "alla pari con Chirp"; StreamingRecognize è limitato a 16 locale (cinese semplificato/tradizionale, cantonese, inglese AU/IN/GB/US, francese CA/FR, tedesco, italiano, giapponese, coreano, portoghese (Brasile), spagnolo ES/US). Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.
Come ottengo l'accesso a Chirp 2?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="chirp-2" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.