Qwen3-ASR Flash est le modèle de reconnaissance vocale de la lignée Qwen3, qui transcrit des fichiers audio jusqu'à 10 Mo et cinq minutes avec des résultats intermédiaires en streaming pour un retour de progression en temps réel.
- Entrée
- audio
- Sortie
- texte
- Prix
- $0.0021/min
Le prix en contexte
Position du prix parmi 11 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Audio
| Langues | 26 langues, une liste unique partagée par tous les modèles Qwen-ASR: chinois (mandarin, sichuanais, hokkien, wu, cantonais), anglais, japonais, allemand, coréen, russe, français, portugais, arabe, italien, espagnol, hindi, indonésien, thaï, turc, ukrainien, vietnamien, tchèque, danois, filipino, finnois, islandais, malais, norvégien, polonais, suédois |
|---|---|
| Limites audio |
|
| Diarisation | Non |
| Transcription en streaming | Oui |
| Horodatages | Non |
Modèle
| Modalités | audio → texte |
|---|
- Construit sur la base Qwen3-Omni
- le modèle flash servi via API est propriétaire (les Qwen3-ASR 0.6B/1.7B ouverts sont des modèles différents)
Utilisez Qwen3-ASR Flash en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="qwen3-asr-flash",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "qwen3-asr-flash",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="qwen3-asr-flash" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "qwen3-asr-flash",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("qwen3-asr-flash")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());À propos de Qwen3-ASR Flash
- La documentation officielle met en avant la reconnaissance d'une trentaine de langues, dont cinq variantes chinoises (mandarin, sichuanais, hokkien, wu, cantonais), et une capacité qui manque à ses homologues Fun-ASR : la détection des émotions en même temps que la transcription.
- La série Qwen3-ASR est également saluée pour sa reconnaissance robuste de la parole mêlée à de la musique et à du chant.
- L'étiquetage des émotions est toujours actif et renvoie l'un de sept états (surpris, neutre, heureux, triste, dégoûté, en colère ou apeuré), et la détection de la langue est automatique dès que vous laissez la langue non renseignée, y compris pour un audio qui mélange les langues.
- La précision sur la terminologie métier se pilote autrement que dans la famille Fun-ASR : au lieu de téléverser des listes de mots-clés, vous injectez un texte de contexte avec la requête, ce qui convient à un vocabulaire qui change d'un appel à l'autre.
- Les horodatages au niveau du mot peuvent être activés pour un sous-ensemble documenté de langues, et la normalisation inverse du texte est disponible mais désactivée par défaut.
- L'audio est accepté dans un large ensemble de conteneurs et de codecs, et le modèle est joignable à la fois par une route compatible OpenAI et par l'interface synchrone propre à Alibaba.
- La diarisation des locuteurs n'est pas proposée, et le plafond de cinq minutes est ferme.
- Alibaba oriente les enregistrements plus longs vers un modèle de transcription de fichiers distinct.
- Synthorai le fournit via son endpoint de transcription compatible OpenAI.
FAQ
Peut-on essayer l'API Qwen3-ASR Flash gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Qwen3-ASR Flash sur votre charge de travail réelle avant d'ajouter un moyen de paiement.
Quels sont les points forts de Qwen3-ASR Flash ?
Détecte l'émotion en même temps que la transcription ; environ trente langues, cinq variantes chinoises ; robuste sur la parole mêlée à de la musique. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Qwen3-ASR Flash ?
Sur Synthorai, Qwen3-ASR Flash coûte $0.0021 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.
Quelles langues Qwen3-ASR Flash prend-il en charge ?
Qwen3-ASR Flash prend en charge 26 langues, une liste unique partagée par tous les modèles Qwen-ASR: chinois (mandarin, sichuanais, hokkien, wu, cantonais), anglais, japonais, allemand, coréen, russe, français, portugais, arabe, italien, espagnol, hindi, indonésien, thaï, turc, ukrainien, vietnamien, tchèque, danois, filipino, finnois, islandais, malais, norvégien, polonais, suédois. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.
Comment obtenir l'accès à Qwen3-ASR Flash ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="qwen3-asr-flash", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.