Qwen3-Max ist das Flaggschiff des Qwen-Teams im Billionen-Parameter-Maßstab, vorgestellt im offiziellen Beitrag „Qwen3-Max: Just Scale“ mit einem 256K-Token-Kontext.
- Eingabe
- Text $1.2/M
- Ausgabe
- Text $6/M
- Cache-Read
- $0.359/M
- Kontext
- 256K
- vs. GPT-4o
- ~76% günstiger
Benchmarks
Herstellerangaben: Alibaba (Qwen)
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 256.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 65.536 |
Prompt Caching
| Modus | automatisch + explizit |
|---|---|
| Min. Präfix | 1.024 |
| Lebensdauer | explizit: 5 Min., bei Treffer zurückgesetzt |
| Schreibkosten | 1.25x |
Thinking
| Anbieter-Parameter | enable_thinking + thinking_budget |
|---|---|
| Zulässige Werte | enable_thinking true · false; thinking_budget in tokens |
| Standardwert | aus; enable_thinking steht standardmäßig auf false, und thinking_budget entspricht standardmäßig der maximalen Chain-of-Thought-Länge des Modells gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Die Spur wird in reasoning_content zurückgegeben; reasoning_content im Nachrichtenverlauf wird standardmäßig ignoriert, und qwen3-max gehört nicht zu den Modellen, die preserve_thinking akzeptieren. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text → Text |
|---|---|
| Parameter | 1T+ gesamt MoE |
- Erstes Qwen-Flaggschiff mit über einer Billion Parametern (geschlossene Gewichte), rein textbasiert
- offiziell für agentisches Coding und Tool-Calling positioniert
- hybrides Thinking, standardmäßig abgeschaltet
Qwen3 Max in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Qwen3 Max
- Alibaba berichtet über hochmoderne Ergebnisse in seinen eigenen Evaluationen zu Wissen, Reasoning, Coding, Instruction-Following, Agent-Aufgaben und mehrsprachigem Verständnis, und seine Release Note hebt eigens ein Upgrade für agentisches Coding und Tool Calling hervor.
- Die Reihe wird in Instruct-Form ausgeliefert, daneben eine Thinking-Variante, die für schwierigere Reasoning-Probleme einen Code Interpreter und adaptive Tool-Nutzung integriert.
- Als größtes Modell der Qwen3-Serie zielt es auf anspruchsvolle Produktions-Workloads.
- Es ist ein Text-ein-Text-aus-Modell (Vision liegt bei den Qwen3-VL-Geschwistermodellen) mit bis zu 65.536 Output-Token, und Model Studio listet Tool Calling, strukturierte Ausgaben, Batch-Inferenz sowie explizites und implizites Context-Caching.
- Ein Verhaltensdetail trennt es von jeder späteren Qwen-Generation in diesem Katalog: Es ist ein hybrides Thinking-Modell, dessen Reasoning mit dem Parameter enable_thinking geschaltet wird und standardmäßig deaktiviert ist, während Qwen3.5 und neuer bereits mit aktiviertem Thinking ankommen.
- Ist das Reasoning aktiviert, begrenzt ein thinking_budget-Parameter den Aufwand, und die Spur kommt separat in reasoning_content zurück und wird als Output abgerechnet.
- Gewichte für dieses gehostete Flaggschiff werden nicht veröffentlicht, und Alibaba führt es inzwischen unter den Legacy-Modellen und verweist neue Projekte auf die Serien Qwen3.5 und Qwen3.6.
- Synthorai bietet es über den OpenAI-kompatiblen Chat-Endpoint an.
FAQ
Lässt sich die Qwen3 Max API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1.2/M Input-Tokens deckt allein dieses Guthaben rund 104 Requests mit je ~8K Tokens gegen Qwen3 Max ab.
Worin ist Qwen3 Max am besten?
Flaggschiff im Billionen-Parameter-Maßstab mit 256K Kontext; Thinking-Variante integriert einen Code Interpreter; adaptive Tool-Nutzung für schwierigeres Reasoning. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Qwen3 Max?
Qwen3 Max kostet auf Synthorai $1.2 pro Million Input-Tokens und $6 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.359/M abgerechnet.
Unterstützt Qwen3 Max Prompt-Caching?
Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.359/M statt $1.2/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 1,024 Tokens, um gecacht zu werden (TTL explizit: 5 Min., bei Treffer zurückgesetzt). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Qwen3 Max?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3-max", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.