O Chirp 3 é a geração mais recente dos modelos generativos multilíngues específicos para ASR do Google na API Speech-to-Text v2, em disponibilidade geral desde outubro de 2025 nas multirregiões dos EUA e da UE.
- Entrada
- áudio
- Saída
- texto
- Preço
- $0.016/min
O preço em contexto
Posição do preço entre 11 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Áudio
| Idiomas | 29 locales GA + 82 em Preview (111 no total) entre StreamingRecognize, Recognize e BatchRecognize; a diarização cobre 14 deles |
|---|---|
| Limites de áudio |
|
| Diarização | Sim |
| Transcrição em streaming | Sim |
| Marcas de tempo | Sim |
Modelo
| Modalidades | áudio → texto |
|---|
- O id oficial do modelo é chirp_3
- preview privado em 2025-04-11, GA em 2025-10-13 conforme as notas de lançamento do Speech-to-Text
- cobrado por áudio
conforme documentação oficial da Google ↗
Use o Chirp 3 em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-3",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-3",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-3" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-3",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-3")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Sobre o Chirp 3
- A documentação oficial destaca precisão e velocidade aprimoradas além dos modelos Chirp anteriores, mais duas novas capacidades: diarização de locutores (speaker diarization) e detecção automática de idioma.
- Ele publica mais de cem locales entre os níveis de disponibilidade geral e de preview, gera pontuação e capitalização automáticas e aceita adaptação de fala com até 1.000 dicas de frases, embora o Google recomende usar o menor número possível de entradas para que os termos fora da adaptação não se degradem.
- Reconhecimento em streaming, síncrono e em lote são todos suportados, e a diarização está disponível no reconhecimento em lote em catorze idiomas.
- Os novos controles incluem um prompt customizado em preview para direcionar a formatação da transcrição, um flag de redutor de ruído que o Google adverte não ser capaz de remover vozes humanas de fundo, e sensibilidade de endpointing em standard, short ou supershort.
- A atualização não é puramente aditiva, e as lacunas valem ser verificadas antes de trocar: o Chirp 3 documenta timestamps em nível de enunciado em vez de por palavra, não documenta tradução de fala nem filtro de palavrões, e limita o áudio em lote a uma hora, ou vinte minutos quando os timestamps estão habilitados, contra as oito horas do Chirp 2.
- Na Synthorai, o Chirp 3 é acessível pela mesma interface de transcrição compatível com OpenAI que todos os outros modelos de fala.
Perguntas frequentes
A API do Chirp 3 é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Chirp 3 com sua carga de trabalho real antes de adicionar um meio de pagamento.
Em que o Chirp 3 é melhor?
Diarização de locutores e detecção automática de idioma; transcreve mais de 100 idiomas e variantes; adaptação de fala com até 1.000 dicas de frases. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Chirp 3?
Na Synthorai, o Chirp 3 custa $0.016 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.
Quais idiomas o Chirp 3 suporta?
O Chirp 3 suporta 29 locales GA + 82 em Preview (111 no total) entre StreamingRecognize, Recognize e BatchRecognize; a diarização cobre 14 deles. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.
Como obtenho acesso ao Chirp 3?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="chirp-3" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.