Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Qwen3.8 Max

Rilasciato 2026-08-03

chatVisioneCodiceRagionamentoChiamata di strumentiCaching dei prompt

Qwen3.8 Max è il modello di punta della linea Qwen di Alibaba, pubblicato il 3 agosto 2026.

Input
testo immagine $2/M
Output
testo $6/M
Lettura cache
$0.25/M
Contesto
984K
vs GPT-4o
~60% più economico

Benchmark

Sopra la mediaNessuno migliore31 / 408 / 40
Qwen3.8 Max altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
SWE-Bench Pro
67.7%
AndroidBench
75.1%
Cybergym
78.5%
HealthBench
nessun altro modello ha fatto meglio 60.2%
JobBench
53.4%
PLawBench
nessun altro modello ha fatto meglio 73.2%
GPQA Diamond
92.6%
Agents' Last Exam
27%

Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Il prezzo nel contesto

Posizione del prezzo tra 66 modelli comparabili

Input$2/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.25/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 983.616
Output massimo (specifica del vendor) 131.072

Caching prompt

Modalità automatico + esplicito
Prefisso min. 1.024
Durata esplicita: 5 min, si azzera a ogni hit
Costo di scrittura 1.25x

Ragionamento

Parametro reasoning_effort
Valori minimal · low · medium · high l'insieme accettato è del provider

Modello

Modalità testo + immagine → testo
Parametri 2.4T totali MoE
  • Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
  • thinking trace returned in reasoning_content
  • text and image in, text out

fonte: documentazione ufficiale Alibaba ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

Qwen3.8 Max superato · 3 sentences

Enabling reasoning makes the model produce additional hidden steps before responding, and those tokens are billable. It also tends to lengthen each interaction because the model works through more possibilities before settling on an answer. Therefore, the bill doubled mainly due to higher compute and token usage per request, not necessarily because the number of requests doubled.

out 378 tok (+305 ragionamento) latenza 8.6 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

Qwen3.8 Max superato · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that the original code starts `best` and `cur` at `0`, so it counts adjacent equal *transitions* rather than the number of items in the run. A run of length `n` has only `n - 1` equal-neighbor transitions, so single-element inputs return `0`, and runs that reach the end are undercounted by one. Initializing the current run to `1` for the first element, resetting it to `1` on a break, and updating `best` from that count fixes the off-by-one.

out 1616 tok (+1411 ragionamento) latenza 34.7 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

Qwen3.8 Max superato · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

out 1199 tok (+1141 ragionamento) latenza 24.4 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

Qwen3.8 Max superato · 120 words, 0 banned, 1 question

Today, our API gateway adds prompt caching across major model providers. It stores prompts and responses in one fast cache layer. Teams can lower token spend, reduce latency, and repeat reliable answers. The feature supports OpenAI, Anthropic, Google, and Mistral through one configuration. You can set retention rules, scope access, and invalidate entries quickly. How does your team maintain consistent results during provider outages? Approved cached responses keep applications stable while fallback routes recover. The dashboard shows hit rates, savings, latency, and provider usage. Engineers receive audit trails for every cached prompt, enabling safer testing. Product managers can compare cost trends before and after cache adoption. Start with a small route, then safely expand caching to production traffic right now.

out 2744 tok (+2591 ragionamento) latenza 46.3 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa Qwen3.8 Max in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su Qwen3.8 Max

  • Alibaba lo descrive come un modello Max nativamente visivo-linguistico costruito su un'architettura Mixture-of-Experts da 2,4 bilioni di parametri e come il modello più capace della linea Qwen fino a oggi.
  • Accetta testo e immagini e restituisce testo, così una singola richiesta può unire il prompt a screenshot, grafici o pagine scansionate senza dirottare le immagini su un modello di visione separato.
  • Il ragionamento fa parte del comportamento predefinito: la traccia torna separatamente nel campo reasoning_content, il che significa che anche una risposta breve consuma token di ragionamento e che un budget max_tokens molto stretto può restituire una risposta vuota pur essendo la richiesta andata a buon fine.
  • Chiamata di funzioni, output strutturato rigoroso tramite schema JSON e streaming con usage nell'ultimo frammento sono tutti disponibili, quindi si inserisce senza trattamenti speciali in un'integrazione compatibile con OpenAI già esistente.
  • La finestra di contesto sfiora il milione di token e una singola risposta può arrivare a 131.072 token, il doppio del tetto di output della generazione Max precedente e la ragione concreta per spostarvi la generazione di testi lunghi.
  • I prezzi sono scaglionati in base al comportamento della cache anziché alla lunghezza del contesto: tariffa di input standard, una tariffa più bassa per gli hit automatici di cache e tariffe proprie per la creazione e la lettura esplicite delle voci di cache.
  • I cicli agentici che riutilizzano un prefisso stabile ne traggono un vantaggio concreto.
  • Alibaba indica Pechino e Singapore come regioni.
  • Synthorai lo offre tramite l'endpoint chat completions compatibile con OpenAI.

FAQ

L'API di Qwen3.8 Max si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $2/M token in input, quel credito da solo copre circa 62 richieste da ~8K token verso Qwen3.8 Max.

In cosa eccelle Qwen3.8 Max?

MoE da 2,4 bilioni di parametri, visivo-linguistico nativo; input testo e immagini, output fino a 131K; prezzi scaglionati per cache. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Qwen3.8 Max?

Su Synthorai, Qwen3.8 Max costa $2 per milione di token in input e $6 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.25/M.

Qwen3.8 Max supporta il caching dei prompt?

Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.25/M contro $2/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →

Come ottengo l'accesso a Qwen3.8 Max?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3.8-max" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →