Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Qwen3.6 Flash

Lanzamiento: 2026-04-16

chatCódigoLlamada a herramientasVisiónRazonamientoCaché de prompts

Qwen3.6 Flash es el nivel rápido y económico de la generación Qwen3.6, que el equipo Qwen planteó como un avance «Towards Real World Agents».

Entrada
texto imagen vídeo $0.25/M
Salida
texto $1.5/M
Lectura de caché
$0.05/M
Contexto
256K
vs GPT-4o
~95% más barato

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$0.25/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$1.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.05/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.000.000
Salida máxima (especificación del proveedor) 65.536

Caché de prompts

Modo automático + explícito
Prefijo mín. 1024
Duración explícito: 5 min, se reinicia en cada acierto
Coste de escritura 1.25x

Razonamiento

Parámetro del proveedor enable_thinking + thinking_budget
Valores admitidos enable_thinking true · false; thinking_budget in tokens
Valor por defecto on; la serie Qwen3.6 Flash es de pensamiento híbrido, con el pensamiento activado por defecto se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La traza se devuelve en reasoning_content y se ignora en los turnos posteriores; qwen3.6-flash no está entre los modelos que Alibaba indica que aceptan preserve_thinking, a diferencia de qwen3.6-plus.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto + imagen + vídeo → texto
  • Modelo Flash nativo de visión y lenguaje, oficialmente una mejora significativa sobre Qwen3.5-Flash
  • la generación Qwen3.6 añade preserve_thinking para arrastrar el razonamiento entre turnos, pero Alibaba lo indica para qwen3.6-plus y qwen3.6-max-preview, no para este nivel Flash

según documentación oficial de Alibaba ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

Qwen3.6 Flash superado · 3 sentences

Enabling reasoning mode forces the model to generate multiple internal analysis steps before producing a final answer, effectively doubling the computational effort per request. Because our vendor bills for every token processed—including these hidden reasoning tokens—the increased processing directly multiplied our usage charges by approximately two. This spike reflects a deliberate shift from low-cost, basic outputs to higher-intelligence results that reduce error rates and downstream correction costs, optimizing spend for long-term efficiency.

salida 1231 tok (+1141 pensamiento) latencia 11.7 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

Qwen3.6 Flash superado · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The original implementation counts matching transitions rather than actual element counts, initializing both accumulators to zero. This causes single-element inputs to bypass the loop entirely and return zero instead of one, while any run of length `k` only increments the counter `k-1` times, consistently undercounting by one. Additionally, resetting `cur` to zero on a mismatch discards the newly started element, losing a potential candidate for the longest run. […]

salida 2724 tok (+2473 pensamiento) latencia 19.0 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

Qwen3.6 Flash superado · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11.0, "guidance": null } ```

salida 1629 tok (+1564 pensamiento) latencia 12.0 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

Qwen3.6 Flash superado · 120 words, 0 banned, 1 question

We are pleased to announce PromptCache, a new capability built directly into our enterprise API gateway. This innovation stores frequently used text prompts across all integrated model providers, eliminating redundant transmission costs while accelerating response times. Developers can now configure retention policies, set TTL limits, and monitor cache hit rates through our unified dashboard. System performance improves dramatically when identical queries bypass repeated network hops. Your infrastructure will maintain consistent throughput during peak traffic windows without additional provisioning overhead. Teams deploying multimodal applications benefit from reduced latency across diverse inference endpoints. […]

salida 5005 tok (+4866 pensamiento) latencia 26.3 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use Qwen3.6 Flash en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.6-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Acerca de Qwen3.6 Flash

  • Frente a Qwen3.5, el anuncio oficial de la generación destaca una codificación agéntica drásticamente mejorada, del trabajo de frontend a las tareas a escala de repositorio, una percepción y una precisión de razonamiento multimodales mejoradas, y una nueva opción preserve_thinking que arrastra el contenido de razonamiento entre turnos para mantener coherentes las decisiones del agente reduciendo a la vez el uso de tokens.
  • Flash cede algo de profundidad a cambio de menor latencia y coste.
  • La propia orientación de Alibaba es empezar en el nivel Plus más reciente y pasarse aquí para reducir el gasto manteniendo una capacidad similar, y nombra este modelo para documentos largos y bases de código grandes gracias a su contexto de 1M tokens.
  • Es de lenguaje-visión nativo, acepta entrada de imagen y vídeo junto al texto, devuelve hasta 65.536 tokens de salida y eleva la asignación de razonamiento de la generación muy por encima de la de Qwen3.5.
  • Model Studio enumera llamada a funciones, herramientas integradas, salida estructurada, inferencia por lotes y caché explícita de prompts.
  • Como el resto de su generación, es un modelo de pensamiento híbrido con el razonamiento habilitado por defecto, lo contrario que la serie Qwen3, así que una solicitud simple delibera salvo que enable_thinking se fije en false; thinking_budget limita el gasto, y la traza se devuelve en reasoning_content y se factura como salida.
  • Conviene comprobar algo antes de diseñar en torno a él: la documentación de pensamiento de Alibaba enumera el soporte de preserve_thinking modelo por modelo, y el nivel Flash no está entre las entradas nombradas, así que trate el razonamiento entre turnos como una función de la generación y no como algo garantizado aquí.
  • Synthorai lo sirve por el endpoint compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Qwen3.6 Flash?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.25/M por tokens de entrada, solo ese crédito cubre aproximadamente 500 solicitudes de ~8K tokens contra Qwen3.6 Flash.

¿En qué destaca Qwen3.6 Flash?

Codificación agéntica mejorada a nivel de repositorio; 1M de contexto para documentos y bases de código largos; cambia algo de profundidad por menor latencia. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Qwen3.6 Flash?

Qwen3.6 Flash cuesta $0.25 por millón de tokens de entrada y $1.5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.05/M.

¿Qwen3.6 Flash admite caché de prompts?

Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.05/M frente a $0.25/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →

¿Cómo obtengo acceso a Qwen3.6 Flash?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3.6-flash" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →