Qwen3-ASR Flash ist das Spracherkennungsmodell der Qwen3-Reihe und transkribiert Audiodateien von bis zu 10 MB und fünf Minuten, mit gestreamten Zwischenergebnissen für eine Fortschrittsrückmeldung in Echtzeit.
- Eingabe
- Audio
- Ausgabe
- Text
- Preis
- $0.0021/min
Preis im Vergleich
Preisposition unter 11 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Audio
| Sprachen | 26 Sprachen, eine gemeinsame Liste für jedes Qwen-ASR-Modell: Chinesisch (Mandarin, Sichuanesisch, Hokkien, Wu, Kantonesisch), Englisch, Japanisch, Deutsch, Koreanisch, Russisch, Französisch, Portugiesisch, Arabisch, Italienisch, Spanisch, Hindi, Indonesisch, Thailändisch, Türkisch, Ukrainisch, Vietnamesisch, Tschechisch, Dänisch, Filipino, Finnisch, Isländisch, Malaiisch, Norwegisch, Polnisch, Schwedisch |
|---|---|
| Audio-Limits |
|
| Sprecher-Diarisierung | Nein |
| Streaming-Transkription | Ja |
| Zeitstempel | Nein |
Modell
| Modalitäten | Audio → Text |
|---|
- Basiert auf dem Qwen3-Omni-Fundament
- das bereitgestellte Flash-API-Modell ist proprietär (die offenen Qwen3-ASR 0.6B/1.7B sind andere Modelle)
Qwen3-ASR Flash in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="qwen3-asr-flash",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "qwen3-asr-flash",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="qwen3-asr-flash" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "qwen3-asr-flash",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("qwen3-asr-flash")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Über Qwen3-ASR Flash
- Die offizielle Dokumentation hebt die Erkennung von rund dreißig Sprachen hervor, darunter fünf chinesische Varianten (Mandarin, Sichuanesisch, Hokkien, Wu, Kantonesisch), sowie eine Fähigkeit, die den Fun-ASR-Geschwistermodellen fehlt: das Erkennen von Emotionen neben der Transkription.
- Die Qwen3-ASR-Serie ist zudem für die robuste Erkennung von Sprache in Mischung mit Musik und Gesang bekannt.
- Die Emotionskennzeichnung ist immer aktiv und gibt einen von sieben Zuständen zurück (überrascht, neutral, glücklich, traurig, angewidert, wütend oder ängstlich), und die Spracherkennung erfolgt automatisch, sobald Sie die Sprache nicht setzen, auch bei Audio, das Sprachen mischt.
- Die Genauigkeit bei Fachterminologie wird anders gesteuert als in der Fun-ASR-Familie: Statt Hotword-Listen hochzuladen, injizieren Sie Kontexttext mit der Anfrage, was zu Vokabular passt, das sich von Aufruf zu Aufruf ändert.
- Zeitstempel auf Wortebene lassen sich für eine dokumentierte Teilmenge von Sprachen aktivieren, und inverse Textnormalisierung ist verfügbar, aber standardmäßig deaktiviert.
- Audio wird in einem breiten Satz von Container- und Codec-Formaten akzeptiert, und das Modell ist sowohl über eine OpenAI-kompatible Route als auch über Alibabas eigene synchrone Schnittstelle erreichbar.
- Sprecher-Diarisierung wird nicht angeboten, und die Obergrenze von fünf Minuten ist fest.
- Längere Aufnahmen leitet Alibaba an ein separates Modell für Dateitranskription weiter.
- Synthorai liefert es über seinen OpenAI-kompatiblen Transkriptions-Endpoint aus.
FAQ
Lässt sich die Qwen3-ASR Flash API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Qwen3-ASR Flash mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist Qwen3-ASR Flash am besten?
Erkennt Emotion neben der Transkription; rund dreißig Sprachen, fünf chinesische Varianten; robust bei mit Musik vermischter Sprache. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Qwen3-ASR Flash?
Qwen3-ASR Flash kostet auf Synthorai $0.0021 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.
Welche Sprachen unterstützt Qwen3-ASR Flash?
Qwen3-ASR Flash unterstützt 26 Sprachen, eine gemeinsame Liste für jedes Qwen-ASR-Modell: Chinesisch (Mandarin, Sichuanesisch, Hokkien, Wu, Kantonesisch), Englisch, Japanisch, Deutsch, Koreanisch, Russisch, Französisch, Portugiesisch, Arabisch, Italienisch, Spanisch, Hindi, Indonesisch, Thailändisch, Türkisch, Ukrainisch, Vietnamesisch, Tschechisch, Dänisch, Filipino, Finnisch, Isländisch, Malaiisch, Norwegisch, Polnisch, Schwedisch. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.
Wie erhalte ich Zugang zu Qwen3-ASR Flash?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3-asr-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.