Qwen3-ASR Flash es el modelo de reconocimiento de voz de la línea Qwen3, que transcribe archivos de audio de hasta 10 MB y cinco minutos con resultados intermedios en streaming para retroalimentación de progreso en tiempo real.
- Entrada
- audio
- Salida
- texto
- Precio
- $0.0021/min
El precio en contexto
Posición del precio entre 11 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Audio
| Idiomas | 26 idiomas, una única lista compartida por todos los modelos Qwen-ASR: chino (mandarín, sichuanés, hokkien, wu, cantonés), inglés, japonés, alemán, coreano, ruso, francés, portugués, árabe, italiano, español, hindi, indonesio, tailandés, turco, ucraniano, vietnamita, checo, danés, filipino, finés, islandés, malayo, noruego, polaco y sueco |
|---|---|
| Límites de audio |
|
| Diarización | No |
| Transcripción en streaming | Sí |
| Marcas de tiempo | No |
Modelo
| Modalidades | audio → texto |
|---|
- Construido sobre la base Qwen3-Omni
- el modelo flash servido por API es propietario (los Qwen3-ASR abiertos de 0.6B/1.7B son modelos distintos)
Use Qwen3-ASR Flash en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="qwen3-asr-flash",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "qwen3-asr-flash",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="qwen3-asr-flash" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "qwen3-asr-flash",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("qwen3-asr-flash")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Acerca de Qwen3-ASR Flash
- La documentación oficial destaca el reconocimiento de aproximadamente treinta idiomas, incluidas cinco variantes del chino (mandarín, sichuanés, hokkien, wu, cantonés), y una capacidad de la que carecen sus hermanos Fun-ASR: detectar la emoción junto con la transcripción.
- La serie Qwen3-ASR también se destaca por su reconocimiento robusto de voz mezclada con música y canto.
- El etiquetado de emociones está siempre activo y devuelve uno de siete estados (sorpresa, neutral, alegría, tristeza, asco, enfado o miedo), y la detección de idioma es automática siempre que se deje el idioma sin fijar, incluso para audio que mezcla idiomas.
- La precisión sobre terminología de dominio se guía de forma distinta a la de la familia Fun-ASR: en lugar de subir listas de hotwords, se inyecta texto de contexto con la solicitud, lo que encaja con vocabulario que cambia de una llamada a otra.
- Las marcas de tiempo a nivel de palabra pueden habilitarse para un subconjunto documentado de idiomas, y la normalización inversa de texto está disponible pero desactivada por defecto.
- El audio se acepta en un amplio conjunto de formatos de contenedor y códec, y el modelo es accesible tanto por una ruta compatible con OpenAI como por la interfaz síncrona propia de Alibaba.
- La diarización de hablantes no se ofrece, y el techo de cinco minutos es firme.
- Alibaba dirige las grabaciones más largas a un modelo de transcripción de archivos aparte.
- Synthorai lo entrega a través de su endpoint de transcripción compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3-ASR Flash?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Qwen3-ASR Flash con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca Qwen3-ASR Flash?
Detecta la emoción junto con la transcripción; aproximadamente treinta idiomas, cinco variantes del chino; robusto con voz mezclada con música. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3-ASR Flash?
Qwen3-ASR Flash cuesta $0.0021 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.
¿Qué idiomas admite Qwen3-ASR Flash?
Qwen3-ASR Flash admite 26 idiomas, una única lista compartida por todos los modelos Qwen-ASR: chino (mandarín, sichuanés, hokkien, wu, cantonés), inglés, japonés, alemán, coreano, ruso, francés, portugués, árabe, italiano, español, hindi, indonesio, tailandés, turco, ucraniano, vietnamita, checo, danés, filipino, finés, islandés, malayo, noruego, polaco y sueco. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.
¿Cómo obtengo acceso a Qwen3-ASR Flash?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3-asr-flash" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.