Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Qwen3 Max

Rilasciato 2025-09-23

chatCodiceRagionamentoChiamata di strumentiCaching dei prompt

Qwen3-Max è il flagship su scala di mille miliardi di parametri del team Qwen, introdotto nel post ufficiale "Qwen3-Max: Just Scale" con un contesto da 256K token.

Input
testo $1.2/M
Output
testo $6/M
Lettura cache
$0.359/M
Contesto
256K
vs GPT-4o
~76% più economico

Benchmark

Qwen3 Max
LiveCodeBench Instruct, v6 (25.02-25.05) secondo Alibaba (Qwen)
nessun altro modello misurato
69%
SWE-bench Verified Instruct secondo Alibaba (Qwen)
nessun altro modello misurato
69.6%
AIME 2025 Instruct secondo Alibaba (Qwen)
nessun altro modello misurato
81.6%
SuperGPQA Instruct secondo Alibaba (Qwen)
nessun altro modello misurato
65.1%
τ²-Bench Instruct, weighted secondo Alibaba (Qwen)
nessun altro modello misurato
74.8%

Dati pubblicati dai fornitori: Alibaba (Qwen)

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$1.2/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.359/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 256.000
Output massimo (specifica del vendor) 65.536

Caching prompt

Modalità automatico + esplicito
Prefisso min. 1.024
Durata esplicita: 5 min, si azzera a ogni hit
Costo di scrittura 1.25x

Ragionamento

Parametro del fornitore enable_thinking + thinking_budget
Valori accettati enable_thinking true · false; thinking_budget in tokens
Valore predefinito disattivato; enable_thinking vale false di default e thinking_budget vale di default la lunghezza massima di chain-of-thought del modello applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La traccia viene restituita in reasoning_content; il reasoning_content presente nella cronologia dei messaggi viene ignorato di default, e qwen3-max non è tra i modelli che accettano preserve_thinking.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo → testo
Parametri 1T+ totali MoE
  • Primo flagship Qwen con oltre mille miliardi di parametri (pesi chiusi), solo testo
  • posizionato ufficialmente per il coding agentico e il tool calling
  • thinking ibrido, disattivato di default

fonte: documentazione ufficiale Alibaba ↗

Usa Qwen3 Max in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su Qwen3 Max

  • Alibaba riporta risultati allo stato dell'arte nelle proprie valutazioni di conoscenza, ragionamento, coding, rispetto delle istruzioni, compiti di agent e comprensione multilingue, e la sua nota di rilascio segnala in particolare un aggiornamento per il coding agentico e il tool calling.
  • La linea è distribuita in forma Instruct accanto a una variante Thinking che integra un code interpreter e un uso adattivo degli strumenti per problemi di ragionamento più difficili.
  • Come modello più grande della serie Qwen3, punta a carichi di lavoro di produzione esigenti.
  • È un modello da testo a testo (la vision vive nei simili Qwen3-VL) con fino a 65.536 token di output, e Model Studio elenca tool calling, output strutturato, inferenza batch e caching del contesto sia esplicito sia implicito.
  • Un dettaglio di comportamento lo separa da ogni generazione Qwen successiva presente in questo catalogo: è un modello di thinking ibrido il cui ragionamento si commuta con il parametro enable_thinking ed è disattivato per impostazione predefinita, mentre Qwen3.5 e successivi arrivano con il thinking già attivo.
  • Quando il ragionamento è abilitato, un parametro thinking_budget limita la spesa e la traccia torna separatamente in reasoning_content, fatturata come output.
  • I pesi di questo flagship ospitato non sono pubblicati, e Alibaba ora lo elenca tra i modelli legacy, indirizzando i nuovi progetti verso le serie Qwen3.5 e Qwen3.6.
  • Synthorai lo offre tramite l'endpoint chat compatibile OpenAI.

FAQ

L'API di Qwen3 Max si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.2/M token in input, quel credito da solo copre circa 104 richieste da ~8K token verso Qwen3 Max.

In cosa eccelle Qwen3 Max?

Flagship su scala di mille miliardi di parametri con contesto da 256K; la variante thinking integra un code interpreter; uso adattivo degli strumenti per ragionamento più difficile. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Qwen3 Max?

Su Synthorai, Qwen3 Max costa $1.2 per milione di token in input e $6 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.359/M.

Qwen3 Max supporta il caching dei prompt?

Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.359/M contro $1.2/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →

Come ottengo l'accesso a Qwen3 Max?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3-max" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →