Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Chirp 3

Lanzamiento: 2025-10-13

transcription

Chirp 3 es la última generación de los modelos generativos multilingües específicos de ASR de Google en la API Speech-to-Text v2, en disponibilidad general desde octubre de 2025 en las multirregiones de Estados Unidos y de la Unión Europea.

Entrada
audio
Salida
texto
Precio
$0.016/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.016/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas 29 configuraciones regionales GA + 82 en Preview (111 en total) en StreamingRecognize, Recognize y BatchRecognize; la diarización cubre 14 de ellas
Límites de audio
  • Decodificación de audio autodetectada
  • Recognize síncrono <1 min, BatchRecognize de 1 min - 1 h (<=20 min con marcas de tiempo por palabra), StreamingRecognize en tiempo real
  • diarización de hablantes en BatchRecognize y Recognize (14 idiomas)
  • marcas de tiempo por enunciado (solo StreamingRecognize), marcas de tiempo por palabra indicadas como no admitidas
  • transcripción agnóstica al idioma
  • 29 configuraciones regionales GA + 82 en preview
Diarización
Transcripción en streaming
Marcas de tiempo

Modelo

Modalidades audio → texto
  • El id oficial del modelo es chirp_3
  • preview privada el 2025-04-11 y GA el 2025-10-13 según las notas de versión de Speech-to-Text
  • facturado por audio

según documentación oficial de Google ↗

Use Chirp 3 en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Chirp 3

  • La documentación oficial destaca una precisión y una velocidad mejoradas más allá de los modelos Chirp anteriores, además de dos nuevas capacidades: la diarización de hablantes y la detección automática de idioma.
  • Publica más de cien configuraciones regionales entre los niveles de disponibilidad general y de vista previa, genera puntuación y mayúsculas automáticas y acepta adaptación de voz con hasta 1000 sugerencias de frases, aunque Google recomienda usar el menor número posible de entradas para que los términos ajenos a la adaptación no se degraden.
  • Se admiten el reconocimiento en streaming, síncrono y por lotes, y la diarización está disponible en el reconocimiento por lotes en catorce idiomas.
  • Los nuevos controles incluyen un prompt personalizado en vista previa para dirigir el formato de la transcripción, un indicador de reducción de ruido que, según advierte Google, no puede eliminar voces humanas de fondo, y una sensibilidad de detección de fin de habla en standard, short o supershort.
  • La actualización no es puramente aditiva, y conviene revisar las carencias antes de cambiar: Chirp 3 documenta marcas de tiempo a nivel de enunciado en lugar de a nivel de palabra, no documenta traducción de voz ni filtro de lenguaje soez, y limita el audio por lotes a una hora, o veinte minutos con las marcas de tiempo activadas, frente a las ocho de Chirp 2.
  • En Synthorai, Chirp 3 es accesible a través de la misma interfaz de transcripción compatible con OpenAI que cualquier otro modelo de voz.

Preguntas frecuentes

¿Se puede probar gratis la API de Chirp 3?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Chirp 3 con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Chirp 3?

Diarización de hablantes y detección automática de idioma; transcribe más de 100 idiomas y variantes; adaptación de voz con hasta 1000 sugerencias de frases. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Chirp 3?

Chirp 3 cuesta $0.016 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Chirp 3?

Chirp 3 admite 29 configuraciones regionales GA + 82 en Preview (111 en total) en StreamingRecognize, Recognize y BatchRecognize; la diarización cubre 14 de ellas. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Chirp 3?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="chirp-3" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →