🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Qwen3.8 Max Veröffentlicht 2026-08-03

Alibaba chatVisionCodeReasoningTool-AufrufeLanger KontextStrukturierte AusgabeStreamingPrompt Caching
Input$2/M
Output$6/M
Cache-Read$0.25/M
Kontext984K
vs. GPT-4o~60% günstiger

Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten. Effektiver Input-Preis bei 70 % Cache-Trefferquote:$0.775/M. Impliziter Kontext-Cache ist automatisch; ein expliziter cache_control-Modus bietet tiefere Rabatte (Mindestblöcke von 1.024 Token, 5-Minuten-TTL, die bei einem Treffer zurückgesetzt wird). Die Preise für gecachte Lesezugriffe pro Modell stehen in der Preistabelle.

Qwen3.8 Max in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe)
983.616
Max. Output (Anbieter-Spezifikation)
131.072

Prompt Caching

Modus
automatisch + explizit
Lebensdauer
explizit: 5 Min., bei Treffer zurückgesetzt

Thinking

Parameter
reasoning_effort
Werte
minimal · low · medium · high akzeptierte Werte je Anbieter

Modell

Modalitäten
Text + Bild → Text
Parameter
2.4T gesamt MoE
  • Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
  • thinking trace returned in reasoning_content
  • text and image in, text out

laut Offizielle Alibaba-Dokumentation ↗

Über Qwen3.8 Max

2,4-Billionen-Parameter-MoE, nativ visuell-sprachlich
Text- und Bildeingabe, bis 131K Ausgabe
Nach Cache gestaffelte Preise

Qwen3.8 Max ist Alibabas Flaggschiff der Qwen-Reihe, veröffentlicht am 3.

  • August 2026.
  • Alibaba beschreibt es als nativ visuell-sprachliches Max-Modell auf einer Mixture-of-Experts-Architektur mit 2,4 Billionen Parametern und als das bislang leistungsfähigste Modell der Qwen-Linie.
  • Es nimmt Text und Bilder entgegen und liefert Text zurück, sodass eine einzelne Anfrage Prompt, Screenshots, Diagramme oder gescannte Seiten zusammenfassen kann, ohne Bilder über ein separates Vision-Modell zu leiten.
  • Das Nachdenken gehört zum Standardverhalten: Die Denkspur kommt getrennt im Feld reasoning_content zurück, weshalb auch kurze Antworten Reasoning-Tokens verbrauchen und ein sehr knappes max_tokens-Budget eine leere Antwort liefern kann, obwohl die Anfrage erfolgreich war.
  • Function Calling, strikte strukturierte Ausgabe per JSON-Schema und Streaming mit usage im letzten Chunk stehen bereit, sodass sich das Modell ohne Sonderbehandlung in eine bestehende OpenAI-kompatible Integration einfügt.
  • Das Kontextfenster liegt knapp unter einer Million Tokens, eine einzelne Antwort kann bis zu 131.072 Tokens umfassen — doppelt so viel wie die Ausgabegrenze der vorherigen Max-Generation und der konkrete Grund, lange Generierung dorthin zu verlagern.
  • Die Preise staffeln sich nach Cache-Verhalten statt nach Kontextlänge: Standard-Input, ein günstigerer Satz für automatische Cache-Treffer sowie eigene Sätze für das explizite Anlegen und Lesen von Cache-Einträgen.
  • Agenten-Schleifen, die ein stabiles Präfix wiederverwenden, profitieren dadurch spürbar.
  • Alibaba nennt Peking und Singapur als Regionen.
  • Synthorai stellt das Modell über den OpenAI-kompatiblen Chat-Completions-Endpunkt bereit.

FAQ

Lässt sich die Qwen3.8 Max API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $2/M Input-Tokens deckt allein dieses Guthaben rund 62 Requests mit je ~8K Tokens gegen Qwen3.8 Max ab.

Worin ist Qwen3.8 Max am besten?

2,4-Billionen-Parameter-MoE, nativ visuell-sprachlich; Text- und Bildeingabe, bis 131K Ausgabe; Nach Cache gestaffelte Preise. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Qwen3.8 Max?

Qwen3.8 Max kostet auf Synthorai $2 pro Million Input-Tokens und $6 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.25/M abgerechnet.

Unterstützt Qwen3.8 Max Prompt-Caching?

Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.25/M statt $2/M (ungecacht) abgerechnet (TTL explizit: 5 Min., bei Treffer zurückgesetzt). Prompt-Caching-Guide →

Wie erhalte ich Zugang zu Qwen3.8 Max?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3.8-max", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Kostenlosen API-Key holen Ihre Kosten vergleichen →