Qwen3-ASR Flash Realtime es la contraparte en streaming de Qwen3-ASR Flash: el audio se envía por una conexión WebSocket y las transcripciones se devuelven de forma continua, con duración de flujo ilimitada para sesiones de larga duración.
- Entrada
- audio
- Salida
- texto
- Precio
- $0.002/min
El precio en contexto
Posición del precio entre 11 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Audio
| Idiomas | 26 idiomas, una única lista compartida por todos los modelos Qwen-ASR: chino (mandarín, sichuanés, hokkien, wu, cantonés), inglés, japonés, alemán, coreano, ruso, francés, portugués, árabe, italiano, español, hindi, indonesio, tailandés, turco, ucraniano, vietnamita, checo, danés, filipino, finés, islandés, malayo, noruego, polaco y sueco |
|---|---|
| Límites de audio |
|
| Diarización | No |
| Transcripción en streaming | Sí |
| Marcas de tiempo | No |
Modelo
| Modalidades | audio → texto |
|---|
Esta variante en tiempo real no ofrece marcas de tiempo, hotwords ni diarización.
Use Qwen3-ASR Flash Realtime en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="qwen3-asr-flash-realtime",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "qwen3-asr-flash-realtime",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="qwen3-asr-flash-realtime" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "qwen3-asr-flash-realtime",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("qwen3-asr-flash-realtime")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Acerca de Qwen3-ASR Flash Realtime
- Conserva las capacidades principales del modelo por lotes, incluidas la detección de emociones junto con la transcripción y el reconocimiento de aproximadamente treinta idiomas, desde cinco variantes del chino hasta inglés, japonés, coreano y muchos idiomas europeos y del sudeste asiático.
- Encaja con el subtitulado en directo y las aplicaciones de interacción por voz.
- Dos diferencias frente a su hermano basado en archivos determinan cómo se construye sobre él.
- Primera, la toma de turno es configurable de una forma que los otros modelos en streaming no ofrecen: un modo de detección de actividad de voz segmenta las intervenciones automáticamente usando un umbral de silencio ajustable, mientras que un modo manual deja los límites de frase en manos de su cliente, que confirma el búfer de audio por su cuenta, con la salvedad documentada de que los segmentos gestionados manualmente deben mantenerse dentro de aproximadamente un minuto de audio acumulado.
- Segunda, la documentación afirma sin rodeos que esta variante no devuelve marcas de tiempo por ahora, así que si necesita tiempos de palabra o de frase, el modelo offline es el indicado.
- El reconocimiento de emociones sigue estando siempre activo con los mismos siete estados, la detección de idioma sigue siendo automática, y no se admiten ni las listas de hotwords ni la diarización de hablantes.
- A través de Synthorai, el modelo es accesible mediante la API estándar compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3-ASR Flash Realtime?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Qwen3-ASR Flash Realtime con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca Qwen3-ASR Flash Realtime?
Duración de flujo ilimitada por WebSocket; mantiene la detección de emoción en streaming; encaja con subtítulos en directo e interacción de voz. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3-ASR Flash Realtime?
Qwen3-ASR Flash Realtime cuesta $0.002 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.
¿Qué idiomas admite Qwen3-ASR Flash Realtime?
Qwen3-ASR Flash Realtime admite 26 idiomas, una única lista compartida por todos los modelos Qwen-ASR: chino (mandarín, sichuanés, hokkien, wu, cantonés), inglés, japonés, alemán, coreano, ruso, francés, portugués, árabe, italiano, español, hindi, indonesio, tailandés, turco, ucraniano, vietnamita, checo, danés, filipino, finés, islandés, malayo, noruego, polaco y sueco. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.
¿Cómo obtengo acceso a Qwen3-ASR Flash Realtime?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3-asr-flash-realtime" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.