Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Fun-ASR Realtime

Lanzamiento: 2025-09-23

transcription

Fun-ASR Realtime es el modelo de reconocimiento de voz en streaming de Alibaba: el audio se transmite por una conexión persistente y el texto se devuelve en streaming con baja latencia, sin límite de duración del flujo.

Entrada
audio
Salida
texto
Precio
$0.002/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas Multilingüe con dialectos, 30 idiomas: chino (mandarín, cantonés, wu, hokkien, hakka, gan, xiang y jin, además de acentos regionales), inglés, japonés, coreano, vietnamita, tailandés, indonesio, malayo, filipino, hindi, árabe, francés, alemán, español, portugués, ruso, italiano, neerlandés, sueco, danés, finés, noruego, griego, polaco, checo, húngaro, rumano, búlgaro, croata y eslovaco
Límites de audio
  • Streaming WebSocket en tiempo real, duración ilimitada
  • hotwords a gran escala basadas en RAG
  • marcas de tiempo con precisión de milisegundos
  • detección de turnos por VAD
Diarización No
Transcripción en streaming
Marcas de tiempo

Modelo

Modalidades audio → texto

La documentación describe también el reconocimiento de emociones en 7 estados en la guía de tiempo real.

según documentación oficial de Alibaba ↗

Use Fun-ASR Realtime en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Fun-ASR Realtime

  • La documentación oficial lo posiciona para subtítulos en directo, asistentes de voz y transcripción de reuniones, y lleva las fortalezas de la familia Fun-ASR de personalización de hotwords más cobertura multilingüe, incluidos dialectos regionales chinos, inglés, japonés y coreano.
  • La superficie en tiempo real añade controles que los modelos basados en archivos no necesitan: puntuación semántica, predicción de puntuación activada por defecto, un silencio máximo de frase ajustable que decide cuándo se cierra una intervención, un umbral de ruido de voz para ajustarse al sonido de fondo, y marcas de tiempo a nivel de palabra emitidas mientras el flujo avanza.
  • El audio llega como PCM, WAV, MP3, Opus, Speex, AAC o AMR a 8 o 16 kHz.
  • Hay dos límites que conviene tener en cuenta al diseñar: la diarización de hablantes no está disponible en la vía en tiempo real (para saber quién dijo qué hacen falta los modelos de archivos de grabación), y la cobertura lingüística varía notablemente según la instantánea fechada en lugar de ser uniforme en toda la familia, así que fije la instantánea de la que dependa su conjunto de idiomas.
  • El etiquetado de emociones, el diferenciador de la línea Qwen3-ASR, tampoco se ofrece aquí, y el ajuste de precisión basado en contexto solo está disponible en algunas instantáneas.
  • Synthorai lo hace invocable a través de la misma interfaz compatible con OpenAI que utiliza para el resto de su catálogo de audio.

Preguntas frecuentes

¿Se puede probar gratis la API de Fun-ASR Realtime?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Fun-ASR Realtime con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Fun-ASR Realtime?

Transcripción en streaming sin límite de duración; diseñado para subtítulos en directo y reuniones; personalización de hotwords con cobertura multilingüe. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Fun-ASR Realtime?

Fun-ASR Realtime cuesta $0.002 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Fun-ASR Realtime?

Fun-ASR Realtime admite Multilingüe con dialectos, 30 idiomas: chino (mandarín, cantonés, wu, hokkien, hakka, gan, xiang y jin, además de acentos regionales), inglés, japonés, coreano, vietnamita, tailandés, indonesio, malayo, filipino, hindi, árabe, francés, alemán, español, portugués, ruso, italiano, neerlandés, sueco, danés, finés, noruego, griego, polaco, checo, húngaro, rumano, búlgaro, croata y eslovaco. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Fun-ASR Realtime?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="fun-asr-realtime" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →