Qwen3-VL Flash è il livello rapido ed efficiente nei costi della serie visione-linguaggio Qwen3-VL, con un contesto da 256K token.
- Input
- testo immagine video $0.05/M
- Output
- testo $0.4/M
- Lettura cache
- $0.022/M
- Contesto
- 256K
- vs GPT-4o
- ~99%+ più economico
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 262.144 |
|---|---|
| Output massimo (specifica del vendor) | 32.768 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 1.024 |
| Durata | esplicita: 5 min, si azzera a ogni hit |
| Costo di scrittura | 1.25x |
Ragionamento
| Parametro del fornitore | enable_thinking + thinking_budget |
|---|---|
| Valori accettati | enable_thinking true · false; thinking_budget in tokens |
| Valore predefinito | disattivato; enable_thinking vale false di default sulle serie qwen3-vl-plus e qwen3-vl-flash applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La traccia viene restituita in reasoning_content; superato il budget il ragionamento viene troncato e il modello risponde immediatamente. Non è nell'elenco dei modelli con preserve_thinking. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video → testo |
|---|
- Modello di comprensione visiva Qwen3-VL di piccola dimensione
- thinking ibrido (disattivato di default)
- input video fino a 1 ora / 2GB
- output strutturato solo in modalità non-thinking
Usa Qwen3 VL Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-vl-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-vl-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-vl-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-vl-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-vl-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Qwen3 VL Flash
- Secondo la documentazione ufficiale di Model Studio gestisce input a immagine singola e multipla, analisi dei fotogrammi video, didascalie di immagini, risposta a domande visive, localizzazione di oggetti 2D e 3D e parsing di documenti in HTML o Markdown, oltre a OCR su ricevute, certificati e moduli.
- È un modello di thinking ibrido: può ragionare passo dopo passo prima di rispondere oppure rispondere direttamente, con il thinking disattivato per impostazione predefinita, commutato con enable_thinking e limitato con thinking_budget, e la traccia restituita in un campo reasoning_content separato.
- Alibaba lo chiama il modello di piccola taglia della serie e nomina i compiti per cui è stato modellato: monitoraggio della sicurezza, giri di ispezione di negozi e siti e risoluzione di problemi a partire da fotografie.
- È una risposta più netta di "un Plus più economico" alla domanda su quando sceglierlo.
- L'inviluppo è generoso per il livello: fino a 32.768 token di output accanto a un'ampia riserva separata per il ragionamento, video accettati fino a un'ora e 2 GB e limiti per immagine governati da un tetto di token anziché da un numero fisso di immagini.
- Il video viene campionato tramite un'estrazione di fotogrammi che si controlla direttamente, con un'impostazione di fotogrammi al secondo e un tetto di fotogrammi, e con liste di fotogrammi pre-estratti accettate al posto di un file.
- Tool calling, inferenza batch e caching del contesto sono supportati, con l'output strutturato documentato per la modalità non-thinking.
- I pesi del modello ospitato non sono rilasciati, sebbene la più ampia famiglia Qwen3-VL sia aperta.
- Synthorai lo serve per la chat multimodale tramite l'endpoint compatibile OpenAI.
FAQ
L'API di Qwen3 VL Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.05/M token in input, quel credito da solo copre circa 2,500 richieste da ~8K token verso Qwen3 VL Flash.
In cosa eccelle Qwen3 VL Flash?
Localizzazione di oggetti 2D e 3D; parsing di documenti in HTML o Markdown; hybrid thinking, disabilitato di default. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Qwen3 VL Flash?
Su Synthorai, Qwen3 VL Flash costa $0.05 per milione di token in input e $0.4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.022/M.
Qwen3 VL Flash supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.022/M contro $0.05/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →
Come ottengo l'accesso a Qwen3 VL Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3-vl-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.