Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Fun-ASR Flash

Lanzamiento: 2026-06

transcription

Fun-ASR Flash es la variante offline rápida de la familia de reconocimiento de voz Fun-ASR de Alibaba, diseñada para transcribir grabaciones cortas de hasta cinco minutos.

Entrada
audio
Salida
texto
Precio
$0.0021/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas Multilingüe con dialectos, la misma lista de 30 idiomas que las versiones principales de Fun-ASR: chino (mandarín, cantonés, wu, hokkien, hakka, gan, xiang y jin, además de acentos regionales), inglés, japonés, coreano, vietnamita, tailandés, indonesio, malayo, filipino, hindi, árabe, francés, alemán, español, portugués, ruso, italiano, neerlandés, sueco, danés, finés, noruego, griego, polaco, checo, húngaro, rumano, búlgaro, croata y eslovaco
Límites de audio
  • Reconocimiento rápido síncrono, <=5 min / <=2GB por audio
  • inyección de contexto para términos de dominio
  • más de 30 idiomas
  • sin diarización
Diarización No
Transcripción en streaming

Modelo

Modalidades audio → texto

Nivel síncrono rápido de la familia Fun-ASR.

según documentación oficial de Alibaba ↗

Use Fun-ASR Flash en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-flash",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Fun-ASR Flash

  • Su rasgo distintivo, según la documentación oficial, es la inyección de contexto basada en prompt: en lugar de mantener listas de hotwords, se proporciona la terminología de dominio directamente en un prompt para guiar la precisión del reconocimiento.
  • Es el único modelo de la familia documentado para esto, y acepta hasta cinco rondas de contexto de unos cientos de caracteres cada una, lo que encaja con terminología que cambia de una llamada a otra en lugar de de un proyecto a otro.
  • Conserva la amplia cobertura lingüística de la familia, que abarca chino con dialectos regionales, inglés, japonés, coreano y muchos idiomas europeos y del sudeste asiático.
  • El resto del intercambio frente al modelo base es igual de concreto: las llamadas son síncronas con resultados en streaming en lugar de enviar y consultar, así que un clip corto se devuelve en línea en vez de mediante un id de tarea, pero el techo de cinco minutos sustituye al de doce horas (el límite de 2 GB por archivo se mantiene, así que aquí lo que restringe es la duración), y la diarización de hablantes no está disponible.
  • Leídas en conjunto, la elección dentro de la familia queda clara: Fun-ASR para archivos largos con varios hablantes y vocabulario estable, y Fun-ASR Flash para clips cortos que necesitan una respuesta rápida y terminología por solicitud.
  • En Synthorai está disponible a través de la superficie de API estándar compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Fun-ASR Flash?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Fun-ASR Flash con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Fun-ASR Flash?

Inyección de contexto por prompt en lugar de hotwords; transcribe grabaciones cortas de hasta cinco minutos; amplia cobertura incluidos los dialectos regionales chinos. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Fun-ASR Flash?

Fun-ASR Flash cuesta $0.0021 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Fun-ASR Flash?

Fun-ASR Flash admite Multilingüe con dialectos, la misma lista de 30 idiomas que las versiones principales de Fun-ASR: chino (mandarín, cantonés, wu, hokkien, hakka, gan, xiang y jin, además de acentos regionales), inglés, japonés, coreano, vietnamita, tailandés, indonesio, malayo, filipino, hindi, árabe, francés, alemán, español, portugués, ruso, italiano, neerlandés, sueco, danés, finés, noruego, griego, polaco, checo, húngaro, rumano, búlgaro, croata y eslovaco. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Fun-ASR Flash?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="fun-asr-flash" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →