Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Chirp 2

transcription

O Chirp 2 é o modelo multilíngue de reconhecimento automático de fala do Google Cloud, servido pela API Speech-to-Text v2.

Entrada
áudio
Saída
texto
Preço
$0.016/min

O preço em contexto

Posição do preço entre 11 modelos comparáveis

Por minuto$0.016/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Áudio

Idiomas Varia conforme o método: o BatchRecognize oferece a cobertura mais extensa e o Recognize está "no mesmo nível do Chirp"; o StreamingRecognize é limitado a 16 locales (chinês simplificado/tradicional, cantonês, inglês AU/IN/GB/US, francês CA/FR, alemão, italiano, japonês, coreano, português (Brasil), espanhol ES/US)
Limites de áudio
  • Decodificação de áudio detectada automaticamente
  • Recognize síncrono <1 min, BatchRecognize de 1 min a 8 h, StreamingRecognize para tempo real
  • timestamps por palavra opcionais
  • transcrição agnóstica de idioma (o modelo infere o idioma predominante do áudio e transcreve nele)
  • sem detecção de idioma independente
  • sem diarização de locutores
  • tradução de fala suportada
Diarização Não
Transcrição em streaming Sim
Marcas de tempo Sim

Modelo

Modalidades áudio → texto
  • O id oficial do modelo no Speech-to-Text V2 é chirp_2 (com sublinhado)
  • GA, com expansão regional de GA (us-central1/europe-west4/asia-southeast1) em 2025-01-27
  • cobrado por áudio

conforme documentação oficial da Google ↗

Use o Chirp 2 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Sobre o Chirp 2

  • O Google o posiciona como uma melhoria em relação ao Chirp original tanto em precisão quanto em velocidade, adicionando timestamps por palavra, adaptação de modelo (viés por frases) e tradução de fala.
  • Ele oferece pontuação e capitalização automáticas, transcrição agnóstica de idioma, na qual o modelo infere o idioma predominante do áudio e transcreve nele, e filtragem de palavrões, e suporta reconhecimento em streaming, síncrono e em lote para áudio de menos de um minuto até oito horas, o maior teto em lote de qualquer modelo Chirp.
  • O streaming cobre dezesseis locales, enquanto o modo em lote traz o suporte a idiomas mais extenso da família.
  • Os timestamps por palavra são opcionais, e o Google observa que a qualidade e a velocidade da transcrição degradam ligeiramente quando estão ativos; o valor de confiança por palavra que ele retorna está documentado como não sendo uma pontuação de confiança real.
  • A adaptação aceita palavras e frases simples, mas tokens de classe e classes customizadas não são suportados.
  • A tradução de fala funciona em pares assimétricos, vinte e sete idiomas de origem para o inglês dos EUA e dezoito destinos a partir dele, e a normalização forçada e um redutor de ruído completam o conjunto de recursos.
  • A única lacuna significativa é a diarização de locutores, que o Google lista como não suportada; essa capacidade é a razão para migrar para o Chirp 3.
  • A disponibilidade é limitada a um pequeno conjunto de regiões.
  • A Synthorai serve a transcrição do Chirp 2 pelo seu endpoint de áudio compatível com OpenAI.

Perguntas frequentes

A API do Chirp 2 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Chirp 2 com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o Chirp 2 é melhor?

Precisão e velocidade aprimoradas em relação ao antecessor; timestamps por palavra e tradução de fala; áudio de menos de um minuto a oito horas. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Chirp 2?

Na Synthorai, o Chirp 2 custa $0.016 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.

Quais idiomas o Chirp 2 suporta?

O Chirp 2 suporta Varia conforme o método: o BatchRecognize oferece a cobertura mais extensa e o Recognize está "no mesmo nível do Chirp"; o StreamingRecognize é limitado a 16 locales (chinês simplificado/tradicional, cantonês, inglês AU/IN/GB/US, francês CA/FR, alemão, italiano, japonês, coreano, português (Brasil), espanhol ES/US). Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.

Como obtenho acesso ao Chirp 2?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="chirp-2" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →