Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Qwen3-ASR Flash

Lanzamiento: 2025-09-08

transcription

Qwen3-ASR Flash es el modelo de reconocimiento de voz de la línea Qwen3, que transcribe archivos de audio de hasta 10 MB y cinco minutos con resultados intermedios en streaming para retroalimentación de progreso en tiempo real.

Entrada
audio
Salida
texto
Precio
$0.0021/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas 26 idiomas, una única lista compartida por todos los modelos Qwen-ASR: chino (mandarín, sichuanés, hokkien, wu, cantonés), inglés, japonés, alemán, coreano, ruso, francés, portugués, árabe, italiano, español, hindi, indonesio, tailandés, turco, ucraniano, vietnamita, checo, danés, filipino, finés, islandés, malayo, noruego, polaco y sueco
Límites de audio
  • Reconocimiento síncrono <=10MB / <=5 min, con salida en streaming o sin streaming
  • identificación automática de idioma entre 26 idiomas
  • inyección de texto de contexto
  • reconocimiento de canto
  • sin diarización
  • las respuestas compatibles con OpenAI no llevan campos de marca de tiempo (use qwen3-asr-flash-filetrans para eso)
Diarización No
Transcripción en streaming
Marcas de tiempo No

Modelo

Modalidades audio → texto
  • Construido sobre la base Qwen3-Omni
  • el modelo flash servido por API es propietario (los Qwen3-ASR abiertos de 0.6B/1.7B son modelos distintos)

según documentación oficial de Alibaba ↗

Use Qwen3-ASR Flash en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Qwen3-ASR Flash

  • La documentación oficial destaca el reconocimiento de aproximadamente treinta idiomas, incluidas cinco variantes del chino (mandarín, sichuanés, hokkien, wu, cantonés), y una capacidad de la que carecen sus hermanos Fun-ASR: detectar la emoción junto con la transcripción.
  • La serie Qwen3-ASR también se destaca por su reconocimiento robusto de voz mezclada con música y canto.
  • El etiquetado de emociones está siempre activo y devuelve uno de siete estados (sorpresa, neutral, alegría, tristeza, asco, enfado o miedo), y la detección de idioma es automática siempre que se deje el idioma sin fijar, incluso para audio que mezcla idiomas.
  • La precisión sobre terminología de dominio se guía de forma distinta a la de la familia Fun-ASR: en lugar de subir listas de hotwords, se inyecta texto de contexto con la solicitud, lo que encaja con vocabulario que cambia de una llamada a otra.
  • Las marcas de tiempo a nivel de palabra pueden habilitarse para un subconjunto documentado de idiomas, y la normalización inversa de texto está disponible pero desactivada por defecto.
  • El audio se acepta en un amplio conjunto de formatos de contenedor y códec, y el modelo es accesible tanto por una ruta compatible con OpenAI como por la interfaz síncrona propia de Alibaba.
  • La diarización de hablantes no se ofrece, y el techo de cinco minutos es firme.
  • Alibaba dirige las grabaciones más largas a un modelo de transcripción de archivos aparte.
  • Synthorai lo entrega a través de su endpoint de transcripción compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Qwen3-ASR Flash?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Qwen3-ASR Flash con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Qwen3-ASR Flash?

Detecta la emoción junto con la transcripción; aproximadamente treinta idiomas, cinco variantes del chino; robusto con voz mezclada con música. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Qwen3-ASR Flash?

Qwen3-ASR Flash cuesta $0.0021 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Qwen3-ASR Flash?

Qwen3-ASR Flash admite 26 idiomas, una única lista compartida por todos los modelos Qwen-ASR: chino (mandarín, sichuanés, hokkien, wu, cantonés), inglés, japonés, alemán, coreano, ruso, francés, portugués, árabe, italiano, español, hindi, indonesio, tailandés, turco, ucraniano, vietnamita, checo, danés, filipino, finés, islandés, malayo, noruego, polaco y sueco. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Qwen3-ASR Flash?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3-asr-flash" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →