Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Fun-ASR

Lanzamiento: 2025-08-22

transcription

Fun-ASR es el modelo de reconocimiento de voz de archivos de grabación de Alibaba Cloud Model Studio, para la transcripción offline de audio pregrabado.

Entrada
audio
Salida
texto
Precio
$0.0021/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas Multilingüe con dialectos, 30 idiomas: chino (mandarín, cantonés, wu, hokkien, hakka, gan, xiang y jin, además de acentos regionales), inglés, japonés, coreano, vietnamita, tailandés, indonesio, malayo, filipino, hindi, árabe, francés, alemán, español, portugués, ruso, italiano, neerlandés, sueco, danés, finés, noruego, griego, polaco, checo, húngaro, rumano, búlgaro, croata y eslovaco
Límites de audio
  • Transcripción asíncrona de archivos de hasta 12 h / 2GB
  • hotwords y diarización de hablantes
  • marcas de tiempo por frase y por palabra
  • más de 30 idiomas, incluidos dialectos del chino
Diarización
Transcripción en streaming No
Marcas de tiempo

Modelo

Modalidades audio → texto
  • Reconocimiento de canto añadido en 2025-12
  • Fun-ASR-Nano, de código abierto, es un modelo distinto de estos pesos servidos

según documentación oficial de Alibaba ↗

Use Fun-ASR en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Fun-ASR

  • Acepta archivos de hasta 12 horas y 2 GB, gestiona trabajos de archivo único y por lotes, y reconoce chino (mandarín más muchos dialectos regionales como el cantonés, el wu y el hokkien), inglés, japonés, coreano y decenas de otros idiomas.
  • La documentación oficial destaca la personalización de hotwords para terminología de dominio y la diarización de hablantes para grabaciones con varios interlocutores.
  • Ambas vienen con detalles prácticos que conviene conocer de antemano: una tabla de hotwords admite hasta 500 entradas y encaja con terminología que cambia poco, la diarización está desactivada hasta que se habilita y permite declarar un número de hablantes esperado, y Alibaba recomienda mantener el audio diarizado por debajo de unas dos horas o el trabajo puede agotar el tiempo de espera.
  • La transcripción es asíncrona (se envía el archivo, se recibe un id de tarea y se consulta el resultado), y las marcas de tiempo en milisegundos a nivel de frase y de palabra vuelven de serie, junto con el filtrado de palabras sensibles y la selección por canal para grabaciones multipista.
  • El etiquetado de emociones no forma parte de este modelo; eso pertenece a la línea Qwen3-ASR.
  • Se aceptan pistas de idioma, pero la documentación señala que solo se lee el primer valor de la lista.
  • Synthorai sirve Fun-ASR a través de su endpoint compatible con OpenAI, de modo que los clientes de transcripción existentes funcionan sin modificaciones.

Preguntas frecuentes

¿Se puede probar gratis la API de Fun-ASR?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Fun-ASR con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Fun-ASR?

Acepta archivos de hasta 12 horas; personalización de hotwords para terminología de dominio; diarización de hablantes para grabaciones con varios interlocutores. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Fun-ASR?

Fun-ASR cuesta $0.0021 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Fun-ASR?

Fun-ASR admite Multilingüe con dialectos, 30 idiomas: chino (mandarín, cantonés, wu, hokkien, hakka, gan, xiang y jin, además de acentos regionales), inglés, japonés, coreano, vietnamita, tailandés, indonesio, malayo, filipino, hindi, árabe, francés, alemán, español, portugués, ruso, italiano, neerlandés, sueco, danés, finés, noruego, griego, polaco, checo, húngaro, rumano, búlgaro, croata y eslovaco. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Fun-ASR?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="fun-asr" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →