Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Qwen3 VL Flash

Rilasciato 2025-10-16

chatVisioneRagionamentoChiamata di strumentiCaching dei prompt

Qwen3-VL Flash è il livello rapido ed efficiente nei costi della serie visione-linguaggio Qwen3-VL, con un contesto da 256K token.

Input
testo immagine video $0.05/M
Output
testo $0.4/M
Lettura cache
$0.022/M
Contesto
256K
vs GPT-4o
~99%+ più economico

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$0.05/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$0.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.022/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 262.144
Output massimo (specifica del vendor) 32.768

Caching prompt

Modalità automatico + esplicito
Prefisso min. 1.024
Durata esplicita: 5 min, si azzera a ogni hit
Costo di scrittura 1.25x

Ragionamento

Parametro del fornitore enable_thinking + thinking_budget
Valori accettati enable_thinking true · false; thinking_budget in tokens
Valore predefinito disattivato; enable_thinking vale false di default sulle serie qwen3-vl-plus e qwen3-vl-flash applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La traccia viene restituita in reasoning_content; superato il budget il ragionamento viene troncato e il modello risponde immediatamente. Non è nell'elenco dei modelli con preserve_thinking.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine + video → testo
  • Modello di comprensione visiva Qwen3-VL di piccola dimensione
  • thinking ibrido (disattivato di default)
  • input video fino a 1 ora / 2GB
  • output strutturato solo in modalità non-thinking

fonte: documentazione ufficiale Alibaba ↗

Usa Qwen3 VL Flash in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-vl-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su Qwen3 VL Flash

  • Secondo la documentazione ufficiale di Model Studio gestisce input a immagine singola e multipla, analisi dei fotogrammi video, didascalie di immagini, risposta a domande visive, localizzazione di oggetti 2D e 3D e parsing di documenti in HTML o Markdown, oltre a OCR su ricevute, certificati e moduli.
  • È un modello di thinking ibrido: può ragionare passo dopo passo prima di rispondere oppure rispondere direttamente, con il thinking disattivato per impostazione predefinita, commutato con enable_thinking e limitato con thinking_budget, e la traccia restituita in un campo reasoning_content separato.
  • Alibaba lo chiama il modello di piccola taglia della serie e nomina i compiti per cui è stato modellato: monitoraggio della sicurezza, giri di ispezione di negozi e siti e risoluzione di problemi a partire da fotografie.
  • È una risposta più netta di "un Plus più economico" alla domanda su quando sceglierlo.
  • L'inviluppo è generoso per il livello: fino a 32.768 token di output accanto a un'ampia riserva separata per il ragionamento, video accettati fino a un'ora e 2 GB e limiti per immagine governati da un tetto di token anziché da un numero fisso di immagini.
  • Il video viene campionato tramite un'estrazione di fotogrammi che si controlla direttamente, con un'impostazione di fotogrammi al secondo e un tetto di fotogrammi, e con liste di fotogrammi pre-estratti accettate al posto di un file.
  • Tool calling, inferenza batch e caching del contesto sono supportati, con l'output strutturato documentato per la modalità non-thinking.
  • I pesi del modello ospitato non sono rilasciati, sebbene la più ampia famiglia Qwen3-VL sia aperta.
  • Synthorai lo serve per la chat multimodale tramite l'endpoint compatibile OpenAI.

FAQ

L'API di Qwen3 VL Flash si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.05/M token in input, quel credito da solo copre circa 2,500 richieste da ~8K token verso Qwen3 VL Flash.

In cosa eccelle Qwen3 VL Flash?

Localizzazione di oggetti 2D e 3D; parsing di documenti in HTML o Markdown; hybrid thinking, disabilitato di default. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Qwen3 VL Flash?

Su Synthorai, Qwen3 VL Flash costa $0.05 per milione di token in input e $0.4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.022/M.

Qwen3 VL Flash supporta il caching dei prompt?

Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.022/M contro $0.05/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL esplicita: 5 min, si azzera a ogni hit). Guida al caching dei prompt →

Come ottengo l'accesso a Qwen3 VL Flash?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="qwen3-vl-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →