Qwen3.6 Flash ist die schnelle, wirtschaftliche Stufe der Qwen3.6-Generation, die das Qwen-Team als Schritt „Towards Real World Agents“ einordnete.
- Eingabe
- Text Bild Video $0.25/M
- Ausgabe
- Text $1.5/M
- Cache-Read
- $0.05/M
- Kontext
- 256K
- vs. GPT-4o
- ~95% günstiger
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.000.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 65.536 |
Prompt Caching
| Modus | automatisch + explizit |
|---|---|
| Min. Präfix | 1.024 |
| Lebensdauer | explizit: 5 Min., bei Treffer zurückgesetzt |
| Schreibkosten | 1.25x |
Thinking
| Anbieter-Parameter | enable_thinking + thinking_budget |
|---|---|
| Zulässige Werte | enable_thinking true · false; thinking_budget in tokens |
| Standardwert | an; die Qwen3.6-Flash-Reihe nutzt hybrides Thinking, das standardmäßig aktiviert ist gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Die Spur wird in reasoning_content zurückgegeben und in späteren Turns ignoriert; qwen3.6-flash gehört anders als qwen3.6-plus nicht zu den Modellen, die Alibaba als preserve_thinking-fähig listet. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild + Video → Text |
|---|
- Natives Vision-Language-Flash-Modell, offiziell ein deutliches Upgrade gegenüber Qwen3.5-Flash
- die Qwen3.6-Generation ergänzt preserve_thinking, um Reasoning über Turns hinweg mitzuführen, doch Alibaba listet es für qwen3.6-plus und qwen3.6-max-preview, nicht für diese Flash-Stufe
Ein Prompt, gemessen über das Gateway
Qwen3.6 Flash bestanden · 3 sentences
Enabling reasoning mode forces the model to generate multiple internal analysis steps before producing a final answer, effectively doubling the computational effort per request. Because our vendor bills for every token processed—including these hidden reasoning tokens—the increased processing directly multiplied our usage charges by approximately two. This spike reflects a deliberate shift from low-cost, basic outputs to higher-intelligence results that reduce error rates and downstream correction costs, optimizing spend for long-term efficiency.
Ausgabe 1231 tok (+1141 Denken) Latenz 11.7 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
Qwen3.6 Flash bestanden · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The original implementation counts matching transitions rather than actual element counts, initializing both accumulators to zero. This causes single-element inputs to bypass the loop entirely and return zero instead of one, while any run of length `k` only increments the counter `k-1` times, consistently undercounting by one. Additionally, resetting `cur` to zero on a mismatch discards the newly started element, losing a potential candidate for the longest run. […]
Ausgabe 2724 tok (+2473 Denken) Latenz 19.0 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
Qwen3.6 Flash bestanden · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11.0, "guidance": null } ```
Ausgabe 1629 tok (+1564 Denken) Latenz 12.0 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
Qwen3.6 Flash bestanden · 120 words, 0 banned, 1 question
We are pleased to announce PromptCache, a new capability built directly into our enterprise API gateway. This innovation stores frequently used text prompts across all integrated model providers, eliminating redundant transmission costs while accelerating response times. Developers can now configure retention policies, set TTL limits, and monitor cache hit rates through our unified dashboard. System performance improves dramatically when identical queries bypass repeated network hops. Your infrastructure will maintain consistent throughput during peak traffic windows without additional provisioning overhead. Teams deploying multimodal applications benefit from reduced latency across diverse inference endpoints. […]
Ausgabe 5005 tok (+4866 Denken) Latenz 26.3 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
Qwen3.6 Flash in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.6-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.6-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.6-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.6-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Qwen3.6 Flash
- Gegenüber Qwen3.5 hebt die offizielle Ankündigung der Generation drastisch verbessertes agentisches Coding von Frontend-Arbeit bis zu Aufgaben auf Repository-Ebene hervor, verbesserte multimodale Wahrnehmung und Reasoning-Genauigkeit sowie eine neue preserve_thinking-Option, die Reasoning-Inhalte über Turns hinweg mitführt, um Agent-Entscheidungen konsistent zu halten und zugleich den Token-Verbrauch zu senken.
- Flash tauscht etwas Tiefe gegen niedrigere Latenz und Kosten.
- Alibabas eigene Empfehlung lautet, auf der neueren Plus-Stufe zu beginnen und hierher zu wechseln, um die Ausgaben bei ähnlicher Fähigkeit zu senken, und es benennt dieses Modell für lange Dokumente und große Codebasen aufgrund seines 1M-Token-Kontexts.
- Es ist nativ Vision-Language, akzeptiert neben Text auch Bild- und Videoeingaben, gibt bis zu 65.536 Output-Token zurück und hebt das Reasoning-Kontingent der Generation deutlich über das von Qwen3.5.
- Model Studio listet Function Calling, eingebaute Tools, strukturierte Ausgaben, Batch-Inferenz und explizites Prompt-Caching.
- Wie der Rest seiner Generation ist es ein hybrides Thinking-Modell mit standardmäßig aktiviertem Reasoning, dem Gegenteil der Qwen3-Serie, sodass eine schlichte Anfrage abwägt, sofern enable_thinking nicht auf false gesetzt wird; thinking_budget begrenzt den Aufwand, und die Spur kommt in reasoning_content zurück und wird als Output abgerechnet.
- Bevor Sie darauf aufbauen, lohnt eine Prüfung: Alibabas Thinking-Dokumentation listet die preserve_thinking-Unterstützung Modell für Modell auf, und die Flash-Stufe gehört nicht zu den genannten Einträgen, weshalb Reasoning über Turns hinweg als Merkmal der Generation zu behandeln ist statt als hier garantiert.
- Synthorai stellt es über den OpenAI-kompatiblen Endpoint bereit.
FAQ
Lässt sich die Qwen3.6 Flash API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.25/M Input-Tokens deckt allein dieses Guthaben rund 500 Requests mit je ~8K Tokens gegen Qwen3.6 Flash ab.
Worin ist Qwen3.6 Flash am besten?
Verbessertes agentisches Coding bis auf Repository-Ebene; 1M Kontext für lange Dokumente und Codebasen; tauscht etwas Tiefe gegen niedrigere Latenz. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Qwen3.6 Flash?
Qwen3.6 Flash kostet auf Synthorai $0.25 pro Million Input-Tokens und $1.5 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.05/M abgerechnet.
Unterstützt Qwen3.6 Flash Prompt-Caching?
Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.05/M statt $0.25/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 1,024 Tokens, um gecacht zu werden (TTL explizit: 5 Min., bei Treffer zurückgesetzt). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Qwen3.6 Flash?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3.6-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.