Qwen3.8 Max ist Alibabas Flaggschiff der Qwen-Reihe, veröffentlicht am 3.
- Eingabe
- Text Bild $2/M
- Ausgabe
- Text $6/M
- Cache-Read
- $0.25/M
- Kontext
- 984K
- vs. GPT-4o
- ~60% günstiger
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Preisposition unter 66 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 983.616 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 131.072 |
Prompt Caching
| Modus | automatisch + explizit |
|---|---|
| Min. Präfix | 1.024 |
| Lebensdauer | explizit: 5 Min., bei Treffer zurückgesetzt |
| Schreibkosten | 1.25x |
Thinking
| Parameter | reasoning_effort |
|---|---|
| Werte | minimal · low · medium · high akzeptierte Werte je Anbieter |
Modell
| Modalitäten | Text + Bild → Text |
|---|---|
| Parameter | 2.4T gesamt MoE |
- Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
- thinking trace returned in reasoning_content
- text and image in, text out
Ein Prompt, gemessen über das Gateway
Qwen3.8 Max bestanden · 3 sentences
Enabling reasoning makes the model produce additional hidden steps before responding, and those tokens are billable. It also tends to lengthen each interaction because the model works through more possibilities before settling on an answer. Therefore, the bill doubled mainly due to higher compute and token usage per request, not necessarily because the number of requests doubled.
Ausgabe 378 tok (+305 Denken) Latenz 8.6 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
Qwen3.8 Max bestanden · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that the original code starts `best` and `cur` at `0`, so it counts adjacent equal *transitions* rather than the number of items in the run. A run of length `n` has only `n - 1` equal-neighbor transitions, so single-element inputs return `0`, and runs that reach the end are undercounted by one. Initializing the current run to `1` for the first element, resetting it to `1` on a break, and updating `best` from that count fixes the off-by-one.
Ausgabe 1616 tok (+1411 Denken) Latenz 34.7 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
Qwen3.8 Max bestanden · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
Ausgabe 1199 tok (+1141 Denken) Latenz 24.4 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
Qwen3.8 Max bestanden · 120 words, 0 banned, 1 question
Today, our API gateway adds prompt caching across major model providers. It stores prompts and responses in one fast cache layer. Teams can lower token spend, reduce latency, and repeat reliable answers. The feature supports OpenAI, Anthropic, Google, and Mistral through one configuration. You can set retention rules, scope access, and invalidate entries quickly. How does your team maintain consistent results during provider outages? Approved cached responses keep applications stable while fallback routes recover. The dashboard shows hit rates, savings, latency, and provider usage. Engineers receive audit trails for every cached prompt, enabling safer testing. Product managers can compare cost trends before and after cache adoption. Start with a small route, then safely expand caching to production traffic right now.
Ausgabe 2744 tok (+2591 Denken) Latenz 46.3 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
Qwen3.8 Max in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.8-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.8-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.8-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Qwen3.8 Max
- August 2026.
- Alibaba beschreibt es als nativ visuell-sprachliches Max-Modell auf einer Mixture-of-Experts-Architektur mit 2,4 Billionen Parametern und als das bislang leistungsfähigste Modell der Qwen-Linie.
- Es nimmt Text und Bilder entgegen und liefert Text zurück, sodass eine einzelne Anfrage Prompt, Screenshots, Diagramme oder gescannte Seiten zusammenfassen kann, ohne Bilder über ein separates Vision-Modell zu leiten.
- Das Nachdenken gehört zum Standardverhalten: Die Denkspur kommt getrennt im Feld reasoning_content zurück, weshalb auch kurze Antworten Reasoning-Tokens verbrauchen und ein sehr knappes max_tokens-Budget eine leere Antwort liefern kann, obwohl die Anfrage erfolgreich war.
- Function Calling, strikte strukturierte Ausgabe per JSON-Schema und Streaming mit usage im letzten Chunk stehen bereit, sodass sich das Modell ohne Sonderbehandlung in eine bestehende OpenAI-kompatible Integration einfügt.
- Das Kontextfenster liegt knapp unter einer Million Tokens, eine einzelne Antwort kann bis zu 131.072 Tokens umfassen - doppelt so viel wie die Ausgabegrenze der vorherigen Max-Generation und der konkrete Grund, lange Generierung dorthin zu verlagern.
- Die Preise staffeln sich nach Cache-Verhalten statt nach Kontextlänge: Standard-Input, ein günstigerer Satz für automatische Cache-Treffer sowie eigene Sätze für das explizite Anlegen und Lesen von Cache-Einträgen.
- Agenten-Schleifen, die ein stabiles Präfix wiederverwenden, profitieren dadurch spürbar.
- Alibaba nennt Peking und Singapur als Regionen.
- Synthorai stellt das Modell über den OpenAI-kompatiblen Chat-Completions-Endpunkt bereit.
FAQ
Lässt sich die Qwen3.8 Max API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $2/M Input-Tokens deckt allein dieses Guthaben rund 62 Requests mit je ~8K Tokens gegen Qwen3.8 Max ab.
Worin ist Qwen3.8 Max am besten?
2,4-Billionen-Parameter-MoE, nativ visuell-sprachlich; Text- und Bildeingabe, bis 131K Ausgabe; Nach Cache gestaffelte Preise. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Qwen3.8 Max?
Qwen3.8 Max kostet auf Synthorai $2 pro Million Input-Tokens und $6 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.25/M abgerechnet.
Unterstützt Qwen3.8 Max Prompt-Caching?
Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.25/M statt $2/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 1,024 Tokens, um gecacht zu werden (TTL explizit: 5 Min., bei Treffer zurückgesetzt). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Qwen3.8 Max?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3.8-max", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.