Qwen3.5 Flash ist die auf Geschwindigkeit und Kosten optimierte gehostete Stufe der Qwen3.5-Generation, die das Qwen-Team unter dem Motto „Towards Native Multimodal Agents“ vorstellte.
- Eingabe
- Text Bild Video $0.1/M
- Ausgabe
- Text $0.4/M
- Cache-Read
- $0.029/M
- Kontext
- 1M
- vs. GPT-4o
- ~98% günstiger
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.000.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 65.536 |
Prompt Caching
| Modus | automatisch + explizit |
|---|---|
| Min. Präfix | 1.024 |
| Lebensdauer | explizit: 5 Min., bei Treffer zurückgesetzt |
| Schreibkosten | 1.25x |
Thinking
| Anbieter-Parameter | enable_thinking + thinking_budget |
|---|---|
| Zulässige Werte | enable_thinking true · false; thinking_budget in tokens |
| Standardwert | an; die Qwen3.5-Reihe nutzt hybrides Thinking, das standardmäßig aktiviert ist gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Die Spur wird in reasoning_content zurückgegeben; das reasoning_content früherer Turns wird ignoriert, und kein Qwen3.5-Modell steht auf der preserve_thinking-Liste. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild + Video → Text |
|---|---|
| Parameter | 35B gesamt · 3B aktiv MoE |
- Natives Vision-Language-Flash-Modell (Text-, Bild- und Videoeingabe)
- hybrides Thinking standardmäßig aktiv
- die Gesamtqualität wird offiziell nahe an qwen3.5-plus positioniert
Ein Prompt, gemessen über das Gateway
Qwen3.5 Flash bestanden · 3 sentences
Enabling reasoning requires the model to execute multi-step verification internally, which consumes significantly more tokens than a standard query. Since vendor fees are calculated per token processed, this added workload has directly resulted in a doubling of our total monthly expenditure. We view this cost increase as a strategic investment in higher model reliability, which prevents far more expensive errors from occurring downstream.
Ausgabe 2010 tok (+1934 Denken) Latenz 18.7 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
Qwen3.5 Flash bestanden · 8/8 cases
The bug stems from two related issues: the function incorrectly initializes its counters and fails to account for runs starting at the beginning or ending at the last element. Specifically, `cur` counts how many consecutive pairs match (transitions) rather than the actual number of items in a run—for example, two equal items yield a `cur` value of 1 instead of 2. Additionally, if the input has fewer than two elements, the loop never executes, causing single-element lists to return 0 instead of 1, and runs that end at the final index may not be fully captured since updates rely on detecting a mismatch or completing the loop. To fix it, initialize `cur` and `best` to 1 (assuming a non-empty input), handle empty inputs explicitly, and ensure every comparison contributes accurately to the actual item count in the current run. […]
Ausgabe 1020 tok (+747 Denken) Latenz 9.8 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
Qwen3.5 Flash bestanden · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
Ausgabe 3545 tok (+3487 Denken) Latenz 33.1 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
Qwen3.5 Flash bestanden · 120 words, 0 banned, 1 question
We announce our cross platform prompt caching feature in the API Gateway. Storing frequent inputs allows developers to significantly reduce latency and minimize token costs for every request sent through our system. Utilizing OpenAI or Anthropic ensures consistency without repetitive processing fees. Organizations gain better control over spending while maintaining rapid response times for end users globally. Our engineering team ensured compatibility with your existing infrastructure without friction. Can your current setup handle such efficiency improvements effectively? All clients receive immediate access starting today. Update your configuration files now to enable this capability. Join thousands of others optimizing deployment pipelines efficiently. This tool delivers tangible results for scalable applications needing lower overhead costs. […]
Ausgabe 10675 tok (+10535 Denken) Latenz 80.1 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
Qwen3.5 Flash in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.5-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.5-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.5-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.5-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Qwen3.5 Flash
- Die Generation baut auf der Qwen3-Next-Architektur, die Gated Linear Attention mit sparser Mixture-of-Experts für durchsatzstarke Inferenz verbindet, und ist nativ für agentische Arbeit trainiert: Planung, Tool Calling und mehrstufige Ausführung.
- Die gehostete Flash-Stufe bietet standardmäßig einen 1M-Token-Kontext mit offiziellen eingebauten Tools und bis zu 65.536 Output-Token.
- Alibaba positioniert sie als nahe an Qwen3.5 Plus in der Fähigkeit, bei schnellerer Antwort, und der Größenunterschied dahinter ist öffentlich: Die Karte des Qwen-Teams zu Qwen3.5-35B-A3B benennt es als offenes Gegenstück dieser gehosteten Stufe, eine Mixture of Experts mit 35B Parametern, die etwa 3B pro Token aktiviert, veröffentlicht unter Apache 2.0, gegenüber den 397B von Plus.
- Die Wahl zwischen beiden ist also eine Frage der Kapazität und nicht nur der Latenz, und Flash können Sie zudem selbst betreiben.
- Es ist nativ Vision-Language, nimmt neben Text auch Bild- und Videoeingaben und gibt Text aus.
- Thinking dreht die Qwen3-Vorgabe um: In der 3.5-Generation kommt hybrides Thinking aktiviert an, sodass Anfragen reasonieren, sofern Sie enable_thinking nicht auf false setzen, wobei thinking_budget den Aufwand begrenzt und die Spur in reasoning_content zurückkommt.
- Tool Calling, strukturierte Ausgaben, Batch-Inferenz und explizites Prompt-Caching werden unterstützt; parallele Tool-Aufrufe sind opt-in statt Standard.
- Synthorai stellt es zur direkten Nutzung hinter den standardmäßigen OpenAI-kompatiblen Endpoint.
FAQ
Lässt sich die Qwen3.5 Flash API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.1/M Input-Tokens deckt allein dieses Guthaben rund 1,250 Requests mit je ~8K Tokens gegen Qwen3.5 Flash ab.
Worin ist Qwen3.5 Flash am besten?
Gated Linear Attention mit Sparse MoE; standardmäßig 1M-Token-Kontext; nativ für agentische Arbeit trainiert. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Qwen3.5 Flash?
Qwen3.5 Flash kostet auf Synthorai $0.1 pro Million Input-Tokens und $0.4 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.029/M abgerechnet.
Unterstützt Qwen3.5 Flash Prompt-Caching?
Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.029/M statt $0.1/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 1,024 Tokens, um gecacht zu werden (TTL explizit: 5 Min., bei Treffer zurückgesetzt). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Qwen3.5 Flash?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3.5-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.