Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Qwen3-ASR Flash Realtime

Lanzamiento: 2025-10-27

transcription

Qwen3-ASR Flash Realtime es la contraparte en streaming de Qwen3-ASR Flash: el audio se envía por una conexión WebSocket y las transcripciones se devuelven de forma continua, con duración de flujo ilimitada para sesiones de larga duración.

Entrada
audio
Salida
texto
Precio
$0.002/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas 26 idiomas, una única lista compartida por todos los modelos Qwen-ASR: chino (mandarín, sichuanés, hokkien, wu, cantonés), inglés, japonés, alemán, coreano, ruso, francés, portugués, árabe, italiano, español, hindi, indonesio, tailandés, turco, ucraniano, vietnamita, checo, danés, filipino, finés, islandés, malayo, noruego, polaco y sueco
Límites de audio
  • Streaming WebSocket en tiempo real (pcm/opus, 8/16 kHz), duración ilimitada
  • turnos por VAD o manuales
  • reconocimiento de emociones de 7 clases siempre activo
  • detección automática de idioma
Diarización No
Transcripción en streaming
Marcas de tiempo No

Modelo

Modalidades audio → texto

Esta variante en tiempo real no ofrece marcas de tiempo, hotwords ni diarización.

según documentación oficial de Alibaba ↗

Use Qwen3-ASR Flash Realtime en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Qwen3-ASR Flash Realtime

  • Conserva las capacidades principales del modelo por lotes, incluidas la detección de emociones junto con la transcripción y el reconocimiento de aproximadamente treinta idiomas, desde cinco variantes del chino hasta inglés, japonés, coreano y muchos idiomas europeos y del sudeste asiático.
  • Encaja con el subtitulado en directo y las aplicaciones de interacción por voz.
  • Dos diferencias frente a su hermano basado en archivos determinan cómo se construye sobre él.
  • Primera, la toma de turno es configurable de una forma que los otros modelos en streaming no ofrecen: un modo de detección de actividad de voz segmenta las intervenciones automáticamente usando un umbral de silencio ajustable, mientras que un modo manual deja los límites de frase en manos de su cliente, que confirma el búfer de audio por su cuenta, con la salvedad documentada de que los segmentos gestionados manualmente deben mantenerse dentro de aproximadamente un minuto de audio acumulado.
  • Segunda, la documentación afirma sin rodeos que esta variante no devuelve marcas de tiempo por ahora, así que si necesita tiempos de palabra o de frase, el modelo offline es el indicado.
  • El reconocimiento de emociones sigue estando siempre activo con los mismos siete estados, la detección de idioma sigue siendo automática, y no se admiten ni las listas de hotwords ni la diarización de hablantes.
  • A través de Synthorai, el modelo es accesible mediante la API estándar compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Qwen3-ASR Flash Realtime?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Qwen3-ASR Flash Realtime con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Qwen3-ASR Flash Realtime?

Duración de flujo ilimitada por WebSocket; mantiene la detección de emoción en streaming; encaja con subtítulos en directo e interacción de voz. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Qwen3-ASR Flash Realtime?

Qwen3-ASR Flash Realtime cuesta $0.002 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Qwen3-ASR Flash Realtime?

Qwen3-ASR Flash Realtime admite 26 idiomas, una única lista compartida por todos los modelos Qwen-ASR: chino (mandarín, sichuanés, hokkien, wu, cantonés), inglés, japonés, alemán, coreano, ruso, francés, portugués, árabe, italiano, español, hindi, indonesio, tailandés, turco, ucraniano, vietnamita, checo, danés, filipino, finés, islandés, malayo, noruego, polaco y sueco. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Qwen3-ASR Flash Realtime?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3-asr-flash-realtime" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →