Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Seed ASR

transcription

seed-asr-bigmodel es el servicio de reconocimiento de voz de gran modelo Seed-ASR de ByteDance en BytePlus, expuesto a través de la API de reconocimiento de archivos de audio como el motor bigmodel.

Entrada
audio
Salida
texto
Precio
$0.002/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas Con `language` vacío, el modelo cubre mandarín, inglés, cantonés, shanghainés, minnan y los dialectos de Sichuan y Shaanxi; se pueden fijar explícitamente 39 claves de idioma (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), además de la detección automática opcional (enable_auto_lang)
Límites de audio
  • Modo asíncrono de archivo de audio: <512MB, <5 horas, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (también se acepta PCM en bruto), resultados devueltos en un plazo de 3 horas y conservados 7 días
  • diarización de hablantes mediante enable_speaker_info (solo en la API de archivo de audio, mejor con <=10 hablantes, sin diarización en la API de streaming)
  • segmentación por frase y por palabra con start_time/end_time mediante show_utterances
  • identificación de idioma mediante enable_lid
  • hotwords y contexto de hasta 800 tokens y 20 rondas
  • facturación por llamada
Diarización
Transcripción en streaming
Marcas de tiempo

Modelo

Modalidades audio → texto

No existe un id de modelo oficial 'seed-asr-bigmodel': BytePlus Seed Speech usa el model_name 'bigmodel' con los ids de recurso volc.bigasr.auc (Seed ASR 1.0) / volc.seedasr.auc (Seed ASR 2.0).

según documentación oficial de ByteDance ↗

Use Seed ASR en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="seed-asr-bigmodel",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Seed ASR

  • Transcribe grabaciones de forma asíncrona mediante un flujo de envío y consulta adecuado para cargas de trabajo por lotes y offline: quien llama aporta su propio identificador de solicitud, que hace también de identificador de tarea, y luego consulta hasta que el código de estado informa de la finalización, con resultados producidos en un plazo de tres horas y recuperables durante siete días.
  • El audio puede llegar a cinco horas y 512 MB en OPUS, WAV, MP3, OGG, AMR, AAC y M4A, en mono o estéreo.
  • Reconoce por defecto mandarín, inglés, cantonés y varios dialectos chinos, con decenas de idiomas configurables desde el japonés hasta el árabe y detección automática de idioma opcional, que tiene prioridad sobre un idioma nombrado explícitamente cuando se fijan ambos.
  • El sesgo por hotwords y el contexto conversacional mejoran la precisión, con listas de hotwords limitadas a 5000 palabras y el contexto de diálogo a 800 tokens o veinte rondas, y Seed ASR 2.0 extiende ese contexto a una imagen adjunta, una por solicitud.
  • La diarización de hablantes, la separación de canales, las marcas de tiempo a nivel de enunciado y de palabra con confianza, el filtrado de palabras sensibles y las variantes de chino tradicional son todos indicadores opcionales; conviene señalar que la puntuación está desactivada por defecto mientras que la normalización inversa de texto está activada, y que la diarización es una función del modo de archivo que los modos en streaming no ofrecen.
  • Synthorai lo envuelve en un endpoint de transcripción compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Seed ASR?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Seed ASR con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Seed ASR?

Transcripción por lotes asíncrona de envío y consulta; decenas de idiomas configurables con detección automática; el contexto conversacional se extiende a una imagen adjunta. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Seed ASR?

Seed ASR cuesta $0.002 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Seed ASR?

Seed ASR admite Con `language` vacío, el modelo cubre mandarín, inglés, cantonés, shanghainés, minnan y los dialectos de Sichuan y Shaanxi; se pueden fijar explícitamente 39 claves de idioma (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), además de la detección automática opcional (enable_auto_lang). En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Seed ASR?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="seed-asr-bigmodel" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →