Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Whisper v1

Lanzamiento: 2023-03-01

transcription

Whisper v1 es el modelo de reconocimiento de voz de propósito general de OpenAI, entrenado sobre un gran conjunto de datos de audio diverso.

Entrada
audio
Salida
texto
Precio
$0.006/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.006/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas Entrenado en 98 idiomas; 57 figuran como admitidos, los idiomas que cumplieron el umbral de OpenAI de una tasa de error por palabra inferior al 50% en los endpoints de transcriptions y translations
Límites de audio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, hasta 25MB
  • marcas de tiempo por palabra y por segmento (verbose_json), salida srt/vtt
  • sin streaming
  • único modelo admitido en el endpoint de translations (al inglés)
Diarización No
Transcripción en streaming No
Marcas de tiempo

Modelo

Modalidades audio → texto

Whisper large-v2 de código abierto servido por API; prompt limitado a 224 tokens.

según documentación oficial de OpenAI ↗

Use Whisper v1 en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="whisper-1",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Whisper v1

  • Es un sistema multitarea que realiza transcripción, reconocimiento de voz multilingüe, traducción de voz e identificación de idioma, y se factura simplemente por minuto de audio procesado.
  • Pese a los modelos de transcripción más recientes basados en GPT-4o, para varios trabajos sigue siendo la única opción de la pila de audio de OpenAI.
  • Es el único modelo servido en el endpoint de traducciones, que vierte el habla al inglés, y el único que admite granularidades de marcas de tiempo a nivel de segmento o de palabra.
  • También tiene el soporte de formatos de respuesta más amplio de la familia, que abarca JSON, texto plano, JSON detallado, SRT y VTT, que es lo que necesitan las canalizaciones de subtítulos.
  • Los compromisos son igual de concretos: no se admite la transcripción en streaming, los prompts dirigen el estilo más que el contenido (el modelo tiende a reflejar la puntuación y el uso de mayúsculas del prompt) y solo se consideran los últimos 224 tokens de un prompt.
  • Se aplican los límites compartidos de transcripción, con mp3, mp4, mpeg, mpga, m4a, wav y webm aceptados hasta 25MB.
  • La documentación de OpenAI lo plantea ahora en términos históricos, aunque la página del modelo no lleva aviso de obsolescencia.
  • Synthorai acepta trabajos de Whisper en su ruta /v1/audio/transcriptions compatible con OpenAI, así que los clientes existentes funcionan tal cual.

Preguntas frecuentes

¿Se puede probar gratis la API de Whisper v1?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Whisper v1 con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Whisper v1?

Multitarea: transcripción, traducción, identificación de idioma; se factura simplemente por minuto de audio; compatible en los endpoints de transcripción y traducción. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Whisper v1?

Whisper v1 cuesta $0.006 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Whisper v1?

Whisper v1 admite Entrenado en 98 idiomas; 57 figuran como admitidos, los idiomas que cumplieron el umbral de OpenAI de una tasa de error por palabra inferior al 50% en los endpoints de transcriptions y translations. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Whisper v1?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="whisper-1" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →