Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Qwen3.6 Flash

Rilasciato 2026-04-16

chatCodiceChiamata di strumentiVisioneRagionamentoCaching dei prompt

Qwen3.6 Flash è il livello rapido ed economico della generazione Qwen3.6, che il team Qwen ha inquadrato come un passo "Towards Real World Agents."

Input
testo immagine video $0.25/M
Output
testo $1.5/M
Lettura cache
$0.05/M
Contesto
256K
vs GPT-4o
~95% più economico

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$0.25/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$1.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.05/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.000.000
Output massimo (specifica del vendor) 65.536

Caching prompt

Modalità automatico + esplicito
Prefisso min. 1.024
Durata esplicita: 5 min, si azzera a ogni hit
Costo di scrittura 1.25x

Ragionamento

Parametro del fornitore enable_thinking + thinking_budget
Valori accettati enable_thinking true · false; thinking_budget in tokens
Valore predefinito attivo; la serie Qwen3.6 Flash è a thinking ibrido con il thinking abilitato di default applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La traccia viene restituita in reasoning_content e viene ignorata nei turni successivi; qwen3.6-flash non è tra i modelli che Alibaba elenca come compatibili con preserve_thinking, a differenza di qwen3.6-plus.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine + video → testo
  • Modello Flash vision-language nativo, ufficialmente un miglioramento significativo rispetto a Qwen3.5-Flash
  • la generazione Qwen3.6 aggiunge preserve_thinking per portare il ragionamento tra i turni, ma Alibaba lo elenca per qwen3.6-plus e qwen3.6-max-preview, non per questo livello Flash

fonte: documentazione ufficiale Alibaba ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

Qwen3.6 Flash superato · 3 sentences

Enabling reasoning mode forces the model to generate multiple internal analysis steps before producing a final answer, effectively doubling the computational effort per request. Because our vendor bills for every token processed—including these hidden reasoning tokens—the increased processing directly multiplied our usage charges by approximately two. This spike reflects a deliberate shift from low-cost, basic outputs to higher-intelligence results that reduce error rates and downstream correction costs, optimizing spend for long-term efficiency.

out 1231 tok (+1141 ragionamento) latenza 11.7 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

Qwen3.6 Flash superato · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The original implementation counts matching transitions rather than actual element counts, initializing both accumulators to zero. This causes single-element inputs to bypass the loop entirely and return zero instead of one, while any run of length `k` only increments the counter `k-1` times, consistently undercounting by one. Additionally, resetting `cur` to zero on a mismatch discards the newly started element, losing a potential candidate for the longest run. […]

out 2724 tok (+2473 ragionamento) latenza 19.0 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

Qwen3.6 Flash superato · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11.0, "guidance": null } ```

out 1629 tok (+1564 ragionamento) latenza 12.0 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

Qwen3.6 Flash superato · 120 words, 0 banned, 1 question

We are pleased to announce PromptCache, a new capability built directly into our enterprise API gateway. This innovation stores frequently used text prompts across all integrated model providers, eliminating redundant transmission costs while accelerating response times. Developers can now configure retention policies, set TTL limits, and monitor cache hit rates through our unified dashboard. System performance improves dramatically when identical queries bypass repeated network hops. Your infrastructure will maintain consistent throughput during peak traffic windows without additional provisioning overhead. Teams deploying multimodal applications benefit from reduced latency across diverse inference endpoints. […]

out 5005 tok (+4866 ragionamento) latenza 26.3 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa Qwen3.6 Flash in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.6-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Informazioni su Qwen3.6 Flash

  • Rispetto a Qwen3.5, l'annuncio ufficiale della generazione evidenzia un coding agentico drasticamente migliorato, dal lavoro sul frontend ai compiti a livello di repository, una percezione e un'accuratezza di ragionamento multimodale migliori e una nuova opzione preserve_thinking che porta il contenuto di ragionamento da un turno all'altro per mantenere coerenti le decisioni dell'agent riducendo al contempo l'uso di token.
  • Flash scambia un po' di profondità con latenza e costo più bassi.
  • La guida di Alibaba è di partire dal livello Plus più recente e passare qui per ridurre la spesa mantenendo una capacità simile, e nomina questo modello per i documenti lunghi e le codebase estese sulla forza del suo contesto da 1M di token.
  • È nativamente visione-linguaggio, accetta input di immagini e video accanto al testo, restituisce fino a 65.536 token di output e alza la riserva di ragionamento della generazione ben oltre quella di Qwen3.5.
  • Model Studio elenca function calling, strumenti integrati, output strutturato, inferenza batch e caching esplicito dei prompt.
  • Come il resto della sua generazione è un modello di thinking ibrido con il ragionamento abilitato per impostazione predefinita, l'opposto della serie Qwen3, quindi una richiesta semplice delibera a meno che enable_thinking non sia impostato a false; thinking_budget limita la spesa e la traccia è restituita in reasoning_content e fatturata come output.
  • Vale la pena verificarlo prima di progettarci sopra: la documentazione di Alibaba sul thinking elenca il supporto per preserve_thinking modello per modello, e il livello Flash non è tra le voci nominate, quindi il ragionamento tra turni va trattato come una funzionalità di generazione anziché come qualcosa di garantito qui.
  • Synthorai lo serve tramite l'endpoint compatibile OpenAI.

FAQ

L'API di Qwen3.6 Flash si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.25/M token in input, quel credito da solo copre circa 500 richieste da ~8K token verso Qwen3.6 Flash.

In cosa eccelle Qwen3.6 Flash?

Coding agentico potenziato fino al livello di repository; contesto da 1M per documenti e codebase lunghi; parte della profondità scambiata per latenza più bassa. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Qwen3.6 Flash?

Su Synthorai, Qwen3.6 Flash costa $0.25 per milione di token in input e $1.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.05/M.

Qwen3.6 Flash supporta il caching dei prompt?

Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.05/M contro $0.25/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →

Come ottengo l'accesso a Qwen3.6 Flash?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3.6-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →