Qwen3-VL Flash ist die schnelle, kosteneffiziente Stufe der Qwen3-VL-Vision-Language-Serie mit einem 256K-Token-Kontext.
- Eingabe
- Text Bild Video $0.05/M
- Ausgabe
- Text $0.4/M
- Cache-Read
- $0.022/M
- Kontext
- 256K
- vs. GPT-4o
- ~99%+ günstiger
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 262.144 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 32.768 |
Prompt Caching
| Modus | automatisch + explizit |
|---|---|
| Min. Präfix | 1.024 |
| Lebensdauer | explizit: 5 Min., bei Treffer zurückgesetzt |
| Schreibkosten | 1.25x |
Thinking
| Anbieter-Parameter | enable_thinking + thinking_budget |
|---|---|
| Zulässige Werte | enable_thinking true · false; thinking_budget in tokens |
| Standardwert | aus; enable_thinking steht in den Reihen qwen3-vl-plus und qwen3-vl-flash standardmäßig auf false gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Die Spur wird in reasoning_content zurückgegeben; über dem Budget wird das Reasoning abgeschnitten und das Modell antwortet sofort. Steht nicht auf der Modellliste für preserve_thinking. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild + Video → Text |
|---|
- Kompaktes Qwen3-VL-Modell für visuelles Verständnis
- hybrides Thinking (standardmäßig aus)
- Videoeingabe bis 1 Stunde / 2GB
- strukturierte Ausgaben nur im Non-Thinking-Modus
Qwen3 VL Flash in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-vl-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-vl-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-vl-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-vl-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-vl-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Qwen3 VL Flash
- Laut der offiziellen Model-Studio-Dokumentation verarbeitet es einzelne und mehrere Bildeingaben, Video-Frame-Analyse, Bildbeschreibung, visuelle Fragenbeantwortung, 2D- und 3D-Objektlokalisierung sowie das Parsen von Dokumenten in HTML oder Markdown, dazu OCR über Belege, Zertifikate und Formulare.
- Es ist ein hybrides Thinking-Modell: Es kann Schritt für Schritt reasonieren, bevor es antwortet, oder direkt antworten, wobei Thinking standardmäßig deaktiviert ist, mit enable_thinking geschaltet und mit thinking_budget begrenzt wird und die Spur in einem separaten reasoning_content-Feld zurückkommt.
- Alibaba nennt es das Small-Size-Modell der Serie und benennt die Aufgaben, für die es geformt wurde: Sicherheitsüberwachung, Inspektionsrundgänge in Filialen und an Standorten sowie das Lösen fotografierter Probleme.
- Das ist eine schärfere Antwort als „billigeres Plus“ auf die Frage, wann man es wählt.
- Der Rahmen ist für diese Stufe großzügig: bis zu 32.768 Output-Token neben einem großen separaten Reasoning-Kontingent, Video bis zu einer Stunde und 2 GB sowie Limits pro Bild, die über eine Token-Obergrenze statt über eine feste Bildanzahl geregelt sind.
- Video wird über eine Frame-Extraktion abgetastet, die Sie steuern, mit einer Frames-pro-Sekunde-Einstellung und einer Frame-Obergrenze, wobei auch vorab extrahierte Frame-Listen anstelle einer Datei akzeptiert werden.
- Tool Calling, Batch-Inferenz und Context-Caching werden unterstützt, strukturierte Ausgaben sind für den Non-Thinking-Modus dokumentiert.
- Gewichte für das gehostete Modell werden nicht freigegeben, obwohl die weitere Qwen3-VL-Familie offen ist.
- Synthorai stellt es für multimodalen Chat über den OpenAI-kompatiblen Endpoint bereit.
FAQ
Lässt sich die Qwen3 VL Flash API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.05/M Input-Tokens deckt allein dieses Guthaben rund 2,500 Requests mit je ~8K Tokens gegen Qwen3 VL Flash ab.
Worin ist Qwen3 VL Flash am besten?
2D- und 3D-Objektlokalisierung; Dokument-Parsing in HTML oder Markdown; hybrides Thinking, standardmäßig deaktiviert. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Qwen3 VL Flash?
Qwen3 VL Flash kostet auf Synthorai $0.05 pro Million Input-Tokens und $0.4 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.022/M abgerechnet.
Unterstützt Qwen3 VL Flash Prompt-Caching?
Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.022/M statt $0.05/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 1,024 Tokens, um gecacht zu werden (TTL explizit: 5 Min., bei Treffer zurückgesetzt). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Qwen3 VL Flash?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3-vl-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.