Qwen3.8 Max
Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten. Effektiver Input-Preis bei 70 % Cache-Trefferquote:$0.775/M. Impliziter Kontext-Cache ist automatisch; ein expliziter cache_control-Modus bietet tiefere Rabatte (Mindestblöcke von 1.024 Token, 5-Minuten-TTL, die bei einem Treffer zurückgesetzt wird). Die Preise für gecachte Lesezugriffe pro Modell stehen in der Preistabelle.
Qwen3.8 Max in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.8-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.8-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.8-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Spezifikationen & Limits
Tokens
- Kontextfenster (Herstellerangabe)
- 983.616
- Max. Output (Anbieter-Spezifikation)
- 131.072
Prompt Caching
- Modus
- automatisch + explizit
- Lebensdauer
- explizit: 5 Min., bei Treffer zurückgesetzt
Thinking
- Parameter
- reasoning_effort
- Werte
- minimal · low · medium · high akzeptierte Werte je Anbieter
Modell
- Modalitäten
- Text + Bild → Text
- Parameter
- 2.4T gesamt MoE
- Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
- thinking trace returned in reasoning_content
- text and image in, text out
Über Qwen3.8 Max
Qwen3.8 Max ist Alibabas Flaggschiff der Qwen-Reihe, veröffentlicht am 3.
- August 2026.
- Alibaba beschreibt es als nativ visuell-sprachliches Max-Modell auf einer Mixture-of-Experts-Architektur mit 2,4 Billionen Parametern und als das bislang leistungsfähigste Modell der Qwen-Linie.
- Es nimmt Text und Bilder entgegen und liefert Text zurück, sodass eine einzelne Anfrage Prompt, Screenshots, Diagramme oder gescannte Seiten zusammenfassen kann, ohne Bilder über ein separates Vision-Modell zu leiten.
- Das Nachdenken gehört zum Standardverhalten: Die Denkspur kommt getrennt im Feld reasoning_content zurück, weshalb auch kurze Antworten Reasoning-Tokens verbrauchen und ein sehr knappes max_tokens-Budget eine leere Antwort liefern kann, obwohl die Anfrage erfolgreich war.
- Function Calling, strikte strukturierte Ausgabe per JSON-Schema und Streaming mit usage im letzten Chunk stehen bereit, sodass sich das Modell ohne Sonderbehandlung in eine bestehende OpenAI-kompatible Integration einfügt.
- Das Kontextfenster liegt knapp unter einer Million Tokens, eine einzelne Antwort kann bis zu 131.072 Tokens umfassen — doppelt so viel wie die Ausgabegrenze der vorherigen Max-Generation und der konkrete Grund, lange Generierung dorthin zu verlagern.
- Die Preise staffeln sich nach Cache-Verhalten statt nach Kontextlänge: Standard-Input, ein günstigerer Satz für automatische Cache-Treffer sowie eigene Sätze für das explizite Anlegen und Lesen von Cache-Einträgen.
- Agenten-Schleifen, die ein stabiles Präfix wiederverwenden, profitieren dadurch spürbar.
- Alibaba nennt Peking und Singapur als Regionen.
- Synthorai stellt das Modell über den OpenAI-kompatiblen Chat-Completions-Endpunkt bereit.
FAQ
Lässt sich die Qwen3.8 Max API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $2/M Input-Tokens deckt allein dieses Guthaben rund 62 Requests mit je ~8K Tokens gegen Qwen3.8 Max ab.
Worin ist Qwen3.8 Max am besten?
2,4-Billionen-Parameter-MoE, nativ visuell-sprachlich; Text- und Bildeingabe, bis 131K Ausgabe; Nach Cache gestaffelte Preise. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Qwen3.8 Max?
Qwen3.8 Max kostet auf Synthorai $2 pro Million Input-Tokens und $6 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.25/M abgerechnet.
Unterstützt Qwen3.8 Max Prompt-Caching?
Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.25/M statt $2/M (ungecacht) abgerechnet (TTL explizit: 5 Min., bei Treffer zurückgesetzt). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Qwen3.8 Max?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3.8-max", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.