Qwen3-VL Flash es el nivel rápido y rentable de la serie de lenguaje-visión Qwen3-VL, con un contexto de 256K tokens.
- Entrada
- texto imagen vídeo $0.05/M
- Salida
- texto $0.4/M
- Lectura de caché
- $0.022/M
- Contexto
- 256K
- vs GPT-4o
- ~99%+ más barato
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 262.144 |
|---|---|
| Salida máxima (especificación del proveedor) | 32.768 |
Caché de prompts
| Modo | automático + explícito |
|---|---|
| Prefijo mín. | 1024 |
| Duración | explícito: 5 min, se reinicia en cada acierto |
| Coste de escritura | 1.25x |
Razonamiento
| Parámetro del proveedor | enable_thinking + thinking_budget |
|---|---|
| Valores admitidos | enable_thinking true · false; thinking_budget in tokens |
| Valor por defecto | off; enable_thinking es false por defecto en las series qwen3-vl-plus y qwen3-vl-flash se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content; superado el presupuesto, el razonamiento se trunca y el modelo responde de inmediato. No figura en la lista de modelos con preserve_thinking. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen + vídeo → texto |
|---|
- Modelo Qwen3-VL de comprensión visual de tamaño reducido
- pensamiento híbrido (desactivado por defecto)
- entrada de vídeo de hasta 1 hora / 2GB
- salida estructurada solo en modo sin pensamiento
Use Qwen3 VL Flash en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-vl-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-vl-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-vl-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-vl-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-vl-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Qwen3 VL Flash
- Según la documentación oficial de Model Studio, gestiona entradas de una y varias imágenes, análisis de fotogramas de vídeo, descripción de imágenes, respuesta a preguntas visuales, localización de objetos en 2D y 3D, y análisis de documentos a HTML o Markdown, además de OCR sobre recibos, certificados y formularios.
- Es un modelo de pensamiento híbrido: puede razonar paso a paso antes de responder o contestar directamente, con el pensamiento desactivado por defecto, conmutado con enable_thinking y limitado con thinking_budget, y con la traza devuelta en un campo reasoning_content aparte.
- Alibaba lo llama el modelo de tamaño pequeño de la serie y nombra los trabajos para los que se moldeó: vigilancia de seguridad, rondas de inspección de tiendas e instalaciones, y resolución de problemas a partir de fotografías.
- Esa es una respuesta más precisa que «un Plus más barato» a la pregunta de cuándo elegirlo.
- La envolvente es generosa para el nivel: hasta 32.768 tokens de salida junto a una amplia asignación de razonamiento aparte, vídeo aceptado hasta una hora y 2 GB, y límites por imagen regidos por un techo de tokens en lugar de por un número fijo de imágenes.
- El vídeo se muestrea mediante una extracción de fotogramas que usted controla, con un ajuste de fotogramas por segundo y un tope de fotogramas, y se aceptan listas de fotogramas preextraídos en lugar de un archivo.
- Se admiten la llamada a herramientas, la inferencia por lotes y la caché de contexto, con salida estructurada documentada para el modo sin pensamiento.
- Los pesos del modelo alojado no se publican, aunque la familia Qwen3-VL más amplia es abierta.
- Synthorai lo sirve para chat multimodal mediante el endpoint compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3 VL Flash?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.05/M por tokens de entrada, solo ese crédito cubre aproximadamente 2,500 solicitudes de ~8K tokens contra Qwen3 VL Flash.
¿En qué destaca Qwen3 VL Flash?
Localización de objetos en 2D y 3D; análisis de documentos a HTML o Markdown; pensamiento híbrido, desactivado por defecto. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3 VL Flash?
Qwen3 VL Flash cuesta $0.05 por millón de tokens de entrada y $0.4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.022/M.
¿Qwen3 VL Flash admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.022/M frente a $0.05/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →
¿Cómo obtengo acceso a Qwen3 VL Flash?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3-vl-flash" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.