Qwen3.6 Flash è il livello rapido ed economico della generazione Qwen3.6, che il team Qwen ha inquadrato come un passo "Towards Real World Agents."
- Input
- testo immagine video $0.25/M
- Output
- testo $1.5/M
- Lettura cache
- $0.05/M
- Contesto
- 256K
- vs GPT-4o
- ~95% più economico
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.000.000 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 1.024 |
| Durata | esplicita: 5 min, si azzera a ogni hit |
| Costo di scrittura | 1.25x |
Ragionamento
| Parametro del fornitore | enable_thinking + thinking_budget |
|---|---|
| Valori accettati | enable_thinking true · false; thinking_budget in tokens |
| Valore predefinito | attivo; la serie Qwen3.6 Flash è a thinking ibrido con il thinking abilitato di default applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La traccia viene restituita in reasoning_content e viene ignorata nei turni successivi; qwen3.6-flash non è tra i modelli che Alibaba elenca come compatibili con preserve_thinking, a differenza di qwen3.6-plus. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video → testo |
|---|
- Modello Flash vision-language nativo, ufficialmente un miglioramento significativo rispetto a Qwen3.5-Flash
- la generazione Qwen3.6 aggiunge preserve_thinking per portare il ragionamento tra i turni, ma Alibaba lo elenca per qwen3.6-plus e qwen3.6-max-preview, non per questo livello Flash
Un solo prompt, misurato attraverso il gateway
Qwen3.6 Flash superato · 3 sentences
Enabling reasoning mode forces the model to generate multiple internal analysis steps before producing a final answer, effectively doubling the computational effort per request. Because our vendor bills for every token processed—including these hidden reasoning tokens—the increased processing directly multiplied our usage charges by approximately two. This spike reflects a deliberate shift from low-cost, basic outputs to higher-intelligence results that reduce error rates and downstream correction costs, optimizing spend for long-term efficiency.
out 1231 tok (+1141 ragionamento) latenza 11.7 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Qwen3.6 Flash superato · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The original implementation counts matching transitions rather than actual element counts, initializing both accumulators to zero. This causes single-element inputs to bypass the loop entirely and return zero instead of one, while any run of length `k` only increments the counter `k-1` times, consistently undercounting by one. Additionally, resetting `cur` to zero on a mismatch discards the newly started element, losing a potential candidate for the longest run. […]
out 2724 tok (+2473 ragionamento) latenza 19.0 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Qwen3.6 Flash superato · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11.0, "guidance": null } ```
out 1629 tok (+1564 ragionamento) latenza 12.0 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Qwen3.6 Flash superato · 120 words, 0 banned, 1 question
We are pleased to announce PromptCache, a new capability built directly into our enterprise API gateway. This innovation stores frequently used text prompts across all integrated model providers, eliminating redundant transmission costs while accelerating response times. Developers can now configure retention policies, set TTL limits, and monitor cache hit rates through our unified dashboard. System performance improves dramatically when identical queries bypass repeated network hops. Your infrastructure will maintain consistent throughput during peak traffic windows without additional provisioning overhead. Teams deploying multimodal applications benefit from reduced latency across diverse inference endpoints. […]
out 5005 tok (+4866 ragionamento) latenza 26.3 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Qwen3.6 Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.6-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.6-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.6-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.6-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Qwen3.6 Flash
- Rispetto a Qwen3.5, l'annuncio ufficiale della generazione evidenzia un coding agentico drasticamente migliorato, dal lavoro sul frontend ai compiti a livello di repository, una percezione e un'accuratezza di ragionamento multimodale migliori e una nuova opzione preserve_thinking che porta il contenuto di ragionamento da un turno all'altro per mantenere coerenti le decisioni dell'agent riducendo al contempo l'uso di token.
- Flash scambia un po' di profondità con latenza e costo più bassi.
- La guida di Alibaba è di partire dal livello Plus più recente e passare qui per ridurre la spesa mantenendo una capacità simile, e nomina questo modello per i documenti lunghi e le codebase estese sulla forza del suo contesto da 1M di token.
- È nativamente visione-linguaggio, accetta input di immagini e video accanto al testo, restituisce fino a 65.536 token di output e alza la riserva di ragionamento della generazione ben oltre quella di Qwen3.5.
- Model Studio elenca function calling, strumenti integrati, output strutturato, inferenza batch e caching esplicito dei prompt.
- Come il resto della sua generazione è un modello di thinking ibrido con il ragionamento abilitato per impostazione predefinita, l'opposto della serie Qwen3, quindi una richiesta semplice delibera a meno che enable_thinking non sia impostato a false; thinking_budget limita la spesa e la traccia è restituita in reasoning_content e fatturata come output.
- Vale la pena verificarlo prima di progettarci sopra: la documentazione di Alibaba sul thinking elenca il supporto per preserve_thinking modello per modello, e il livello Flash non è tra le voci nominate, quindi il ragionamento tra turni va trattato come una funzionalità di generazione anziché come qualcosa di garantito qui.
- Synthorai lo serve tramite l'endpoint compatibile OpenAI.
FAQ
L'API di Qwen3.6 Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.25/M token in input, quel credito da solo copre circa 500 richieste da ~8K token verso Qwen3.6 Flash.
In cosa eccelle Qwen3.6 Flash?
Coding agentico potenziato fino al livello di repository; contesto da 1M per documenti e codebase lunghi; parte della profondità scambiata per latenza più bassa. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Qwen3.6 Flash?
Su Synthorai, Qwen3.6 Flash costa $0.25 per milione di token in input e $1.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.05/M.
Qwen3.6 Flash supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.05/M contro $0.25/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →
Come ottengo l'accesso a Qwen3.6 Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3.6-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.