Chirp 2 es el modelo multilingüe de reconocimiento automático de voz de Google Cloud, servido a través de la API Speech-to-Text v2.
- Entrada
- audio
- Salida
- texto
- Precio
- $0.016/min
El precio en contexto
Posición del precio entre 11 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Audio
| Idiomas | Varía según el método: BatchRecognize ofrece la cobertura más amplia y Recognize está «a la par con Chirp»; StreamingRecognize se limita a 16 configuraciones regionales (chino simplificado/tradicional, cantonés, inglés AU/IN/GB/US, francés CA/FR, alemán, italiano, japonés, coreano, portugués (Brasil), español ES/US) |
|---|---|
| Límites de audio |
|
| Diarización | No |
| Transcripción en streaming | Sí |
| Marcas de tiempo | Sí |
Modelo
| Modalidades | audio → texto |
|---|
- El id oficial del modelo en Speech-to-Text V2 es chirp_2 (con guion bajo)
- GA, con expansión regional GA (us-central1/europe-west4/asia-southeast1) el 2025-01-27
- facturado por audio
Use Chirp 2 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-2",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-2",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-2" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-2",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-2")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Acerca de Chirp 2
- Google lo posiciona como una mejora sobre el Chirp original tanto en precisión como en velocidad, a la vez que añade marcas de tiempo a nivel de palabra, adaptación del modelo (sesgo por frases) y traducción de voz.
- Ofrece puntuación y mayúsculas automáticas, transcripción agnóstica al idioma, en la que el modelo infiere el idioma predominante del audio y transcribe en él, y filtrado de lenguaje soez, y admite reconocimiento en streaming, síncrono y por lotes para audio desde menos de un minuto hasta ocho horas, el techo por lotes más alto de cualquier modelo Chirp.
- El streaming cubre dieciséis configuraciones regionales, mientras que el modo por lotes lleva el soporte de idiomas más extenso de la familia.
- Las marcas de tiempo a nivel de palabra son opcionales y hay que activarlas, y Google señala que la calidad y la velocidad de transcripción se degradan ligeramente cuando están activas; el valor de confianza por palabra que devuelve está documentado como no siendo una puntuación de confianza real.
- La adaptación acepta palabras y frases simples, pero no se admiten los tokens de clase ni las clases personalizadas.
- La traducción de voz funciona con pares asimétricos, veintisiete idiomas de origen hacia el inglés de Estados Unidos y dieciocho destinos a partir de él, y la normalización forzada y un reductor de ruido completan el conjunto de funciones.
- La única carencia significativa es la diarización de hablantes, que Google lista como no admitida; esa capacidad es la razón para pasar a Chirp 3.
- La disponibilidad se limita a un pequeño conjunto de regiones.
- Synthorai sirve la transcripción de Chirp 2 a través de su endpoint de audio compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Chirp 2?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Chirp 2 con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca Chirp 2?
Precisión y velocidad mejoradas sobre su predecesor; marcas de tiempo a nivel de palabra y traducción de voz; audio desde menos de un minuto hasta ocho horas. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Chirp 2?
Chirp 2 cuesta $0.016 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.
¿Qué idiomas admite Chirp 2?
Chirp 2 admite Varía según el método: BatchRecognize ofrece la cobertura más amplia y Recognize está «a la par con Chirp»; StreamingRecognize se limita a 16 configuraciones regionales (chino simplificado/tradicional, cantonés, inglés AU/IN/GB/US, francés CA/FR, alemán, italiano, japonés, coreano, portugués (Brasil), español ES/US). En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.
¿Cómo obtengo acceso a Chirp 2?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="chirp-2" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.