O Chirp 2 é o modelo multilíngue de reconhecimento automático de fala do Google Cloud, servido pela API Speech-to-Text v2.
- Entrada
- áudio
- Saída
- texto
- Preço
- $0.016/min
O preço em contexto
Posição do preço entre 11 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Áudio
| Idiomas | Varia conforme o método: o BatchRecognize oferece a cobertura mais extensa e o Recognize está "no mesmo nível do Chirp"; o StreamingRecognize é limitado a 16 locales (chinês simplificado/tradicional, cantonês, inglês AU/IN/GB/US, francês CA/FR, alemão, italiano, japonês, coreano, português (Brasil), espanhol ES/US) |
|---|---|
| Limites de áudio |
|
| Diarização | Não |
| Transcrição em streaming | Sim |
| Marcas de tempo | Sim |
Modelo
| Modalidades | áudio → texto |
|---|
- O id oficial do modelo no Speech-to-Text V2 é chirp_2 (com sublinhado)
- GA, com expansão regional de GA (us-central1/europe-west4/asia-southeast1) em 2025-01-27
- cobrado por áudio
conforme documentação oficial da Google ↗
Use o Chirp 2 em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-2",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-2",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-2" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-2",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-2")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Sobre o Chirp 2
- O Google o posiciona como uma melhoria em relação ao Chirp original tanto em precisão quanto em velocidade, adicionando timestamps por palavra, adaptação de modelo (viés por frases) e tradução de fala.
- Ele oferece pontuação e capitalização automáticas, transcrição agnóstica de idioma, na qual o modelo infere o idioma predominante do áudio e transcreve nele, e filtragem de palavrões, e suporta reconhecimento em streaming, síncrono e em lote para áudio de menos de um minuto até oito horas, o maior teto em lote de qualquer modelo Chirp.
- O streaming cobre dezesseis locales, enquanto o modo em lote traz o suporte a idiomas mais extenso da família.
- Os timestamps por palavra são opcionais, e o Google observa que a qualidade e a velocidade da transcrição degradam ligeiramente quando estão ativos; o valor de confiança por palavra que ele retorna está documentado como não sendo uma pontuação de confiança real.
- A adaptação aceita palavras e frases simples, mas tokens de classe e classes customizadas não são suportados.
- A tradução de fala funciona em pares assimétricos, vinte e sete idiomas de origem para o inglês dos EUA e dezoito destinos a partir dele, e a normalização forçada e um redutor de ruído completam o conjunto de recursos.
- A única lacuna significativa é a diarização de locutores, que o Google lista como não suportada; essa capacidade é a razão para migrar para o Chirp 3.
- A disponibilidade é limitada a um pequeno conjunto de regiões.
- A Synthorai serve a transcrição do Chirp 2 pelo seu endpoint de áudio compatível com OpenAI.
Perguntas frequentes
A API do Chirp 2 é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Chirp 2 com sua carga de trabalho real antes de adicionar um meio de pagamento.
Em que o Chirp 2 é melhor?
Precisão e velocidade aprimoradas em relação ao antecessor; timestamps por palavra e tradução de fala; áudio de menos de um minuto a oito horas. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Chirp 2?
Na Synthorai, o Chirp 2 custa $0.016 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.
Quais idiomas o Chirp 2 suporta?
O Chirp 2 suporta Varia conforme o método: o BatchRecognize oferece a cobertura mais extensa e o Recognize está "no mesmo nível do Chirp"; o StreamingRecognize é limitado a 16 locales (chinês simplificado/tradicional, cantonês, inglês AU/IN/GB/US, francês CA/FR, alemão, italiano, japonês, coreano, português (Brasil), espanhol ES/US). Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.
Como obtenho acesso ao Chirp 2?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="chirp-2" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.