Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Qwen3.5 Flash

Rilasciato 2026-02-24

chatCodiceRagionamentoChiamata di strumentiVisioneCaching dei prompt

Qwen3.5 Flash è il livello ospitato ottimizzato per velocità e costo della generazione Qwen3.5, che il team Qwen ha presentato sotto l'insegna "Towards Native Multimodal Agents."

Input
testo immagine video $0.1/M
Output
testo $0.4/M
Lettura cache
$0.029/M
Contesto
1M
vs GPT-4o
~98% più economico

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$0.1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$0.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.029/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.000.000
Output massimo (specifica del vendor) 65.536

Caching prompt

Modalità automatico + esplicito
Prefisso min. 1.024
Durata esplicita: 5 min, si azzera a ogni hit
Costo di scrittura 1.25x

Ragionamento

Parametro del fornitore enable_thinking + thinking_budget
Valori accettati enable_thinking true · false; thinking_budget in tokens
Valore predefinito attivo; la serie Qwen3.5 è a thinking ibrido con il thinking abilitato di default applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La traccia viene restituita in reasoning_content; il reasoning_content dei turni precedenti viene ignorato e nessun modello Qwen3.5 è nell'elenco preserve_thinking.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine + video → testo
Parametri 35B totali · 3B attivi MoE
  • Modello flash vision-language nativo (input di testo/immagini/video)
  • thinking ibrido attivo di default
  • qualità complessiva posizionata ufficialmente vicino a qwen3.5-plus

fonte: documentazione ufficiale Alibaba ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

Qwen3.5 Flash superato · 3 sentences

Enabling reasoning requires the model to execute multi-step verification internally, which consumes significantly more tokens than a standard query. Since vendor fees are calculated per token processed, this added workload has directly resulted in a doubling of our total monthly expenditure. We view this cost increase as a strategic investment in higher model reliability, which prevents far more expensive errors from occurring downstream.

out 2010 tok (+1934 ragionamento) latenza 18.7 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

Qwen3.5 Flash superato · 8/8 cases

The bug stems from two related issues: the function incorrectly initializes its counters and fails to account for runs starting at the beginning or ending at the last element. Specifically, `cur` counts how many consecutive pairs match (transitions) rather than the actual number of items in a run—for example, two equal items yield a `cur` value of 1 instead of 2. Additionally, if the input has fewer than two elements, the loop never executes, causing single-element lists to return 0 instead of 1, and runs that end at the final index may not be fully captured since updates rely on detecting a mismatch or completing the loop. To fix it, initialize `cur` and `best` to 1 (assuming a non-empty input), handle empty inputs explicitly, and ensure every comparison contributes accurately to the actual item count in the current run. […]

out 1020 tok (+747 ragionamento) latenza 9.8 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

Qwen3.5 Flash superato · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

out 3545 tok (+3487 ragionamento) latenza 33.1 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

Qwen3.5 Flash superato · 120 words, 0 banned, 1 question

We announce our cross platform prompt caching feature in the API Gateway. Storing frequent inputs allows developers to significantly reduce latency and minimize token costs for every request sent through our system. Utilizing OpenAI or Anthropic ensures consistency without repetitive processing fees. Organizations gain better control over spending while maintaining rapid response times for end users globally. Our engineering team ensured compatibility with your existing infrastructure without friction. Can your current setup handle such efficiency improvements effectively? All clients receive immediate access starting today. Update your configuration files now to enable this capability. Join thousands of others optimizing deployment pipelines efficiently. This tool delivers tangible results for scalable applications needing lower overhead costs. […]

out 10675 tok (+10535 ragionamento) latenza 80.1 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa Qwen3.5 Flash in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.5-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su Qwen3.5 Flash

  • La generazione è costruita sull'architettura Qwen3-Next, che combina gated linear attention e Mixture-of-Experts sparso per un'inferenza ad alto throughput, ed è addestrata nativamente per il lavoro agentico: pianificazione, tool calling ed esecuzione multi-step.
  • Il livello Flash ospitato offre un contesto da 1M di token per impostazione predefinita con gli strumenti integrati ufficiali, e fino a 65.536 token di output.
  • Alibaba lo posiziona come vicino a Qwen3.5 Plus in capacità pur rispondendo più in fretta, e il divario di dimensione che sta dietro a questo è pubblico: la card del team Qwen per Qwen3.5-35B-A3B lo indica come la controparte aperta di questo livello ospitato, un Mixture-of-Experts da 35B di parametri che ne attiva circa 3B per token, rilasciato sotto Apache 2.0, contro i 397B di Plus.
  • Quindi la scelta tra i due riguarda la capacità e non solo la latenza, e Flash è anche uno che si può eseguire in proprio.
  • È nativamente visione-linguaggio, accetta input di immagini e video accanto al testo e restituisce testo.
  • Il thinking ribalta il valore predefinito di Qwen3: nella generazione 3.5 il thinking ibrido arriva abilitato, quindi le richieste ragionano a meno di passare enable_thinking come false, con thinking_budget disponibile per limitare la spesa e la traccia restituita in reasoning_content.
  • Tool calling, output strutturato, inferenza batch e caching esplicito dei prompt sono supportati; le chiamate parallele agli strumenti sono opt-in anziché il valore predefinito.
  • Synthorai lo colloca dietro il consueto endpoint compatibile OpenAI per un uso immediato.

FAQ

L'API di Qwen3.5 Flash si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.1/M token in input, quel credito da solo copre circa 1,250 richieste da ~8K token verso Qwen3.5 Flash.

In cosa eccelle Qwen3.5 Flash?

Gated linear attention con MoE sparsa; contesto da 1M di token di default; addestrato nativamente per il lavoro agentico. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Qwen3.5 Flash?

Su Synthorai, Qwen3.5 Flash costa $0.1 per milione di token in input e $0.4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.029/M.

Qwen3.5 Flash supporta il caching dei prompt?

Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.029/M contro $0.1/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →

Come ottengo l'accesso a Qwen3.5 Flash?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3.5-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →