Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Chirp 2

transcription

Chirp 2 è il modello multilingue di riconoscimento vocale automatico di Google Cloud, servito tramite la Speech-to-Text v2 API.

Input
audio
Output
testo
Prezzo
$0.016/min

Il prezzo nel contesto

Posizione del prezzo tra 11 modelli comparabili

Al minuto$0.016/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Audio

Lingue Varia in base al metodo: BatchRecognize offre la copertura più estesa e Recognize è "alla pari con Chirp"; StreamingRecognize è limitato a 16 locale (cinese semplificato/tradizionale, cantonese, inglese AU/IN/GB/US, francese CA/FR, tedesco, italiano, giapponese, coreano, portoghese (Brasile), spagnolo ES/US)
Limiti audio
  • Decodifica audio rilevata automaticamente
  • Recognize sincrono <1 min, BatchRecognize 1 min-8 ore, StreamingRecognize per il tempo reale
  • timestamp a livello di parola opzionali
  • trascrizione indipendente dalla lingua (il modello deduce la lingua prevalente dell'audio e trascrive in quella)
  • nessun rilevamento della lingua a sé stante
  • nessuna diarizzazione dei parlanti
  • traduzione del parlato supportata
Diarizzazione No
Trascrizione in streaming
Timestamp

Modello

Modalità audio → testo
  • L'id ufficiale del modello nella Speech-to-Text V2 è chirp_2 (con underscore)
  • GA, con espansione GA regionale (us-central1/europe-west4/asia-southeast1) il 2025-01-27
  • fatturato in base all'audio

fonte: documentazione ufficiale Google ↗

Usa Chirp 2 in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su Chirp 2

  • Google lo posiziona come un miglioramento rispetto al Chirp originale sia in accuratezza sia in velocità, aggiungendo timestamp a livello di parola, adattamento del modello (phrase biasing) e traduzione del parlato.
  • Offre punteggiatura e maiuscole automatiche, trascrizione indipendente dalla lingua, in cui il modello deduce la lingua prevalente dell'audio e trascrive in quella, e filtro delle volgarità, e supporta riconoscimento in streaming, sincrono e batch per audio da meno di un minuto fino a otto ore, il tetto batch più lungo di qualsiasi modello Chirp.
  • Lo streaming copre sedici lingue e varianti locali, mentre il batch porta il supporto linguistico più esteso della famiglia.
  • I timestamp a livello di parola vanno attivati esplicitamente, e Google osserva che qualità e velocità della trascrizione peggiorano leggermente quando sono attivi; il valore di confidenza a livello di parola che restituisce è documentato come non un vero punteggio di confidenza.
  • L'adattamento accetta parole e frasi semplici, ma i class token e le classi personalizzate non sono supportati.
  • La traduzione del parlato funziona su coppie asimmetriche, ventisette lingue di origine verso l'inglese statunitense e diciotto lingue di destinazione a partire da esso, e la normalizzazione forzata e un denoiser completano il set di funzionalità.
  • L'unica lacuna significativa è la diarizzazione dei parlanti, che Google indica come non supportata; è quella capacità la ragione per passare a Chirp 3.
  • La disponibilità è limitata a un piccolo insieme di regioni.
  • Synthorai serve la trascrizione con Chirp 2 tramite il suo endpoint audio compatibile OpenAI.

FAQ

L'API di Chirp 2 si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Chirp 2 sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Chirp 2?

Accuratezza e velocità migliorate rispetto al predecessore; timestamp a livello di parola e traduzione del parlato; audio da meno di un minuto a otto ore. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Chirp 2?

Su Synthorai, Chirp 2 costa $0.016 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.

Quali lingue supporta Chirp 2?

Chirp 2 supporta Varia in base al metodo: BatchRecognize offre la copertura più estesa e Recognize è "alla pari con Chirp"; StreamingRecognize è limitato a 16 locale (cinese semplificato/tradizionale, cantonese, inglese AU/IN/GB/US, francese CA/FR, tedesco, italiano, giapponese, coreano, portoghese (Brasile), spagnolo ES/US). Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a Chirp 2?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="chirp-2" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →