Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Qwen3-ASR Flash Realtime

Date de sortie : 2025-10-27

transcription

Qwen3-ASR Flash Realtime est le pendant en streaming de Qwen3-ASR Flash : l'audio est envoyé sur une connexion WebSocket et les transcriptions reviennent en continu, avec une durée de flux illimitée pour les sessions de longue durée.

Entrée
audio
Sortie
texte
Prix
$0.002/min

Le prix en contexte

Position du prix parmi 11 modèles comparables

Par minute$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Audio

Langues 26 langues, une liste unique partagée par tous les modèles Qwen-ASR: chinois (mandarin, sichuanais, hokkien, wu, cantonais), anglais, japonais, allemand, coréen, russe, français, portugais, arabe, italien, espagnol, hindi, indonésien, thaï, turc, ukrainien, vietnamien, tchèque, danois, filipino, finnois, islandais, malais, norvégien, polonais, suédois
Limites audio
  • Streaming WebSocket en temps réel (pcm/opus, 8/16 kHz), durée illimitée
  • tours par VAD ou manuels
  • reconnaissance des émotions à 7 classes toujours active
  • détection automatique de la langue
Diarisation Non
Transcription en streaming Oui
Horodatages Non

Modèle

Modalités audio → texte

Ni horodatages, ni mots-clés, ni diarisation sur cette variante temps réel.

selon docs officielles Alibaba ↗

Utilisez Qwen3-ASR Flash Realtime en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

À propos de Qwen3-ASR Flash Realtime

  • Il conserve les capacités phares du modèle par lots, dont la détection des émotions en plus de la transcription et la reconnaissance d'une trentaine de langues, des cinq variantes chinoises à l'anglais, au japonais, au coréen et à de nombreuses langues européennes et d'Asie du Sud-Est.
  • Il convient au sous-titrage en direct et aux applications vocales interactives.
  • Deux différences avec son homologue sur fichier déterminent la façon de construire dessus.
  • D'abord, la gestion des tours de parole est configurable comme sur aucun autre modèle de streaming : un mode de détection d'activité vocale segmente automatiquement les énoncés à l'aide d'un seuil de silence ajustable, tandis qu'un mode manuel confie les frontières de phrase à votre client, qui valide lui-même le tampon audio, avec la réserve documentée que les segments pilotés manuellement doivent rester dans la limite d'environ une minute d'audio accumulé.
  • Ensuite, la documentation indique clairement que cette variante ne renvoie pas de timestamps pour l'instant : s'il vous faut le minutage des mots ou des phrases, c'est vers le modèle hors ligne qu'il faut se tourner.
  • La reconnaissance des émotions reste toujours active sur les mêmes sept états, la détection de la langue reste automatique, et ni les listes de mots-clés ni la diarisation des locuteurs ne sont prises en charge.
  • Via Synthorai, le modèle est joignable par l'API standard compatible OpenAI.

FAQ

Peut-on essayer l'API Qwen3-ASR Flash Realtime gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Qwen3-ASR Flash Realtime sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de Qwen3-ASR Flash Realtime ?

Durée de flux illimitée via WebSocket ; conserve la détection de l'émotion en streaming ; adapté au sous-titrage en direct et à l'interaction vocale. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Qwen3-ASR Flash Realtime ?

Sur Synthorai, Qwen3-ASR Flash Realtime coûte $0.002 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.

Quelles langues Qwen3-ASR Flash Realtime prend-il en charge ?

Qwen3-ASR Flash Realtime prend en charge 26 langues, une liste unique partagée par tous les modèles Qwen-ASR: chinois (mandarin, sichuanais, hokkien, wu, cantonais), anglais, japonais, allemand, coréen, russe, français, portugais, arabe, italien, espagnol, hindi, indonésien, thaï, turc, ukrainien, vietnamien, tchèque, danois, filipino, finnois, islandais, malais, norvégien, polonais, suédois. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.

Comment obtenir l'accès à Qwen3-ASR Flash Realtime ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="qwen3-asr-flash-realtime", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →