Qwen3.5 Flash è il livello ospitato ottimizzato per velocità e costo della generazione Qwen3.5, che il team Qwen ha presentato sotto l'insegna "Towards Native Multimodal Agents."
- Input
- testo immagine video $0.1/M
- Output
- testo $0.4/M
- Lettura cache
- $0.029/M
- Contesto
- 1M
- vs GPT-4o
- ~98% più economico
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.000.000 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 1.024 |
| Durata | esplicita: 5 min, si azzera a ogni hit |
| Costo di scrittura | 1.25x |
Ragionamento
| Parametro del fornitore | enable_thinking + thinking_budget |
|---|---|
| Valori accettati | enable_thinking true · false; thinking_budget in tokens |
| Valore predefinito | attivo; la serie Qwen3.5 è a thinking ibrido con il thinking abilitato di default applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La traccia viene restituita in reasoning_content; il reasoning_content dei turni precedenti viene ignorato e nessun modello Qwen3.5 è nell'elenco preserve_thinking. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video → testo |
|---|---|
| Parametri | 35B totali · 3B attivi MoE |
- Modello flash vision-language nativo (input di testo/immagini/video)
- thinking ibrido attivo di default
- qualità complessiva posizionata ufficialmente vicino a qwen3.5-plus
Un solo prompt, misurato attraverso il gateway
Qwen3.5 Flash superato · 3 sentences
Enabling reasoning requires the model to execute multi-step verification internally, which consumes significantly more tokens than a standard query. Since vendor fees are calculated per token processed, this added workload has directly resulted in a doubling of our total monthly expenditure. We view this cost increase as a strategic investment in higher model reliability, which prevents far more expensive errors from occurring downstream.
out 2010 tok (+1934 ragionamento) latenza 18.7 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Qwen3.5 Flash superato · 8/8 cases
The bug stems from two related issues: the function incorrectly initializes its counters and fails to account for runs starting at the beginning or ending at the last element. Specifically, `cur` counts how many consecutive pairs match (transitions) rather than the actual number of items in a run—for example, two equal items yield a `cur` value of 1 instead of 2. Additionally, if the input has fewer than two elements, the loop never executes, causing single-element lists to return 0 instead of 1, and runs that end at the final index may not be fully captured since updates rely on detecting a mismatch or completing the loop. To fix it, initialize `cur` and `best` to 1 (assuming a non-empty input), handle empty inputs explicitly, and ensure every comparison contributes accurately to the actual item count in the current run. […]
out 1020 tok (+747 ragionamento) latenza 9.8 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Qwen3.5 Flash superato · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
out 3545 tok (+3487 ragionamento) latenza 33.1 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Qwen3.5 Flash superato · 120 words, 0 banned, 1 question
We announce our cross platform prompt caching feature in the API Gateway. Storing frequent inputs allows developers to significantly reduce latency and minimize token costs for every request sent through our system. Utilizing OpenAI or Anthropic ensures consistency without repetitive processing fees. Organizations gain better control over spending while maintaining rapid response times for end users globally. Our engineering team ensured compatibility with your existing infrastructure without friction. Can your current setup handle such efficiency improvements effectively? All clients receive immediate access starting today. Update your configuration files now to enable this capability. Join thousands of others optimizing deployment pipelines efficiently. This tool delivers tangible results for scalable applications needing lower overhead costs. […]
out 10675 tok (+10535 ragionamento) latenza 80.1 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Qwen3.5 Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.5-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.5-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.5-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.5-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Qwen3.5 Flash
- La generazione è costruita sull'architettura Qwen3-Next, che combina gated linear attention e Mixture-of-Experts sparso per un'inferenza ad alto throughput, ed è addestrata nativamente per il lavoro agentico: pianificazione, tool calling ed esecuzione multi-step.
- Il livello Flash ospitato offre un contesto da 1M di token per impostazione predefinita con gli strumenti integrati ufficiali, e fino a 65.536 token di output.
- Alibaba lo posiziona come vicino a Qwen3.5 Plus in capacità pur rispondendo più in fretta, e il divario di dimensione che sta dietro a questo è pubblico: la card del team Qwen per Qwen3.5-35B-A3B lo indica come la controparte aperta di questo livello ospitato, un Mixture-of-Experts da 35B di parametri che ne attiva circa 3B per token, rilasciato sotto Apache 2.0, contro i 397B di Plus.
- Quindi la scelta tra i due riguarda la capacità e non solo la latenza, e Flash è anche uno che si può eseguire in proprio.
- È nativamente visione-linguaggio, accetta input di immagini e video accanto al testo e restituisce testo.
- Il thinking ribalta il valore predefinito di Qwen3: nella generazione 3.5 il thinking ibrido arriva abilitato, quindi le richieste ragionano a meno di passare enable_thinking come false, con thinking_budget disponibile per limitare la spesa e la traccia restituita in reasoning_content.
- Tool calling, output strutturato, inferenza batch e caching esplicito dei prompt sono supportati; le chiamate parallele agli strumenti sono opt-in anziché il valore predefinito.
- Synthorai lo colloca dietro il consueto endpoint compatibile OpenAI per un uso immediato.
FAQ
L'API di Qwen3.5 Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.1/M token in input, quel credito da solo copre circa 1,250 richieste da ~8K token verso Qwen3.5 Flash.
In cosa eccelle Qwen3.5 Flash?
Gated linear attention con MoE sparsa; contesto da 1M di token di default; addestrato nativamente per il lavoro agentico. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Qwen3.5 Flash?
Su Synthorai, Qwen3.5 Flash costa $0.1 per milione di token in input e $0.4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.029/M.
Qwen3.5 Flash supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.029/M contro $0.1/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →
Come ottengo l'accesso a Qwen3.5 Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3.5-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.