Qwen3.8 Max
Prezzi di listino del provider: senza ricarico della piattaforma, pagamento a consumo. Questi sono i prezzi di listino ufficiali. I clienti autenticati possono vedere i prezzi effettivi, inclusi gli sconti workspace, su /console/pricing. Input effettivo con un tasso di cache hit del 70%:$0.775/M. La cache implicita del contesto è automatica; una modalità cache_control esplicita offre sconti maggiori (blocchi minimi da 1.024 token, TTL di 5 minuti che si azzera a ogni hit). I prezzi di lettura dalla cache per modello sono nella tabella prezzi.
Usa Qwen3.8 Max in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.8-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.8-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.8-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Specifiche e limiti
Token
- Finestra di contesto (specifica del fornitore)
- 983.616
- Output massimo (specifica del vendor)
- 131.072
Caching prompt
- Modalità
- automatico + esplicito
- Durata
- esplicita: 5 min, si azzera a ogni hit
Ragionamento
- Parametro
- reasoning_effort
- Valori
- minimal · low · medium · high l'insieme accettato è del provider
Modello
- Modalità
- testo + immagine → testo
- Parametri
- 2.4T totali MoE
- Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
- thinking trace returned in reasoning_content
- text and image in, text out
Informazioni su Qwen3.8 Max
Qwen3.8 Max è il modello di punta della linea Qwen di Alibaba, pubblicato il 3 agosto 2026.
- Alibaba lo descrive come un modello Max nativamente visivo-linguistico costruito su un'architettura Mixture-of-Experts da 2,4 bilioni di parametri e come il modello più capace della linea Qwen fino a oggi.
- Accetta testo e immagini e restituisce testo, così una singola richiesta può unire il prompt a screenshot, grafici o pagine scansionate senza dirottare le immagini su un modello di visione separato.
- Il ragionamento fa parte del comportamento predefinito: la traccia torna separatamente nel campo reasoning_content, il che significa che anche una risposta breve consuma token di ragionamento e che un budget max_tokens molto stretto può restituire una risposta vuota pur essendo la richiesta andata a buon fine.
- Chiamata di funzioni, output strutturato rigoroso tramite schema JSON e streaming con usage nell'ultimo frammento sono tutti disponibili, quindi si inserisce senza trattamenti speciali in un'integrazione compatibile con OpenAI già esistente.
- La finestra di contesto sfiora il milione di token e una singola risposta può arrivare a 131.072 token, il doppio del tetto di output della generazione Max precedente e la ragione concreta per spostarvi la generazione di testi lunghi.
- I prezzi sono scaglionati in base al comportamento della cache anziché alla lunghezza del contesto: tariffa di input standard, una tariffa più bassa per gli hit automatici di cache e tariffe proprie per la creazione e la lettura esplicite delle voci di cache.
- I cicli agentici che riutilizzano un prefisso stabile ne traggono un vantaggio concreto.
- Alibaba indica Pechino e Singapore come regioni.
- Synthorai lo offre tramite l'endpoint chat completions compatibile con OpenAI.
FAQ
L'API di Qwen3.8 Max si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $2/M token in input, quel credito da solo copre circa 62 richieste da ~8K token verso Qwen3.8 Max.
In cosa eccelle Qwen3.8 Max?
MoE da 2,4 bilioni di parametri, visivo-linguistico nativo; input testo e immagini, output fino a 131K; prezzi scaglionati per cache. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Qwen3.8 Max?
Su Synthorai, Qwen3.8 Max costa $2 per milione di token in input e $6 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.25/M.
Qwen3.8 Max supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.25/M contro $2/M senza cache (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →
Come ottengo l'accesso a Qwen3.8 Max?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3.8-max" e hai finito: una sola chiave API copre tutti i modelli del gateway.