Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Chirp 2

transcription

Chirp 2 es el modelo multilingüe de reconocimiento automático de voz de Google Cloud, servido a través de la API Speech-to-Text v2.

Entrada
audio
Salida
texto
Precio
$0.016/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.016/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas Varía según el método: BatchRecognize ofrece la cobertura más amplia y Recognize está «a la par con Chirp»; StreamingRecognize se limita a 16 configuraciones regionales (chino simplificado/tradicional, cantonés, inglés AU/IN/GB/US, francés CA/FR, alemán, italiano, japonés, coreano, portugués (Brasil), español ES/US)
Límites de audio
  • Decodificación de audio autodetectada
  • Recognize síncrono <1 min, BatchRecognize de 1 min a 8 h, StreamingRecognize en tiempo real
  • marcas de tiempo por palabra opcionales
  • transcripción agnóstica al idioma (el modelo infiere el idioma predominante del audio y transcribe en él)
  • sin detección de idioma independiente
  • sin diarización de hablantes
  • traducción de voz admitida
Diarización No
Transcripción en streaming
Marcas de tiempo

Modelo

Modalidades audio → texto
  • El id oficial del modelo en Speech-to-Text V2 es chirp_2 (con guion bajo)
  • GA, con expansión regional GA (us-central1/europe-west4/asia-southeast1) el 2025-01-27
  • facturado por audio

según documentación oficial de Google ↗

Use Chirp 2 en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Chirp 2

  • Google lo posiciona como una mejora sobre el Chirp original tanto en precisión como en velocidad, a la vez que añade marcas de tiempo a nivel de palabra, adaptación del modelo (sesgo por frases) y traducción de voz.
  • Ofrece puntuación y mayúsculas automáticas, transcripción agnóstica al idioma, en la que el modelo infiere el idioma predominante del audio y transcribe en él, y filtrado de lenguaje soez, y admite reconocimiento en streaming, síncrono y por lotes para audio desde menos de un minuto hasta ocho horas, el techo por lotes más alto de cualquier modelo Chirp.
  • El streaming cubre dieciséis configuraciones regionales, mientras que el modo por lotes lleva el soporte de idiomas más extenso de la familia.
  • Las marcas de tiempo a nivel de palabra son opcionales y hay que activarlas, y Google señala que la calidad y la velocidad de transcripción se degradan ligeramente cuando están activas; el valor de confianza por palabra que devuelve está documentado como no siendo una puntuación de confianza real.
  • La adaptación acepta palabras y frases simples, pero no se admiten los tokens de clase ni las clases personalizadas.
  • La traducción de voz funciona con pares asimétricos, veintisiete idiomas de origen hacia el inglés de Estados Unidos y dieciocho destinos a partir de él, y la normalización forzada y un reductor de ruido completan el conjunto de funciones.
  • La única carencia significativa es la diarización de hablantes, que Google lista como no admitida; esa capacidad es la razón para pasar a Chirp 3.
  • La disponibilidad se limita a un pequeño conjunto de regiones.
  • Synthorai sirve la transcripción de Chirp 2 a través de su endpoint de audio compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Chirp 2?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Chirp 2 con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Chirp 2?

Precisión y velocidad mejoradas sobre su predecesor; marcas de tiempo a nivel de palabra y traducción de voz; audio desde menos de un minuto hasta ocho horas. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Chirp 2?

Chirp 2 cuesta $0.016 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Chirp 2?

Chirp 2 admite Varía según el método: BatchRecognize ofrece la cobertura más amplia y Recognize está «a la par con Chirp»; StreamingRecognize se limita a 16 configuraciones regionales (chino simplificado/tradicional, cantonés, inglés AU/IN/GB/US, francés CA/FR, alemán, italiano, japonés, coreano, portugués (Brasil), español ES/US). En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Chirp 2?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="chirp-2" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →