Qwen3.6 Flash es el nivel rápido y económico de la generación Qwen3.6, que el equipo Qwen planteó como un avance «Towards Real World Agents».
- Entrada
- texto imagen vídeo $0.25/M
- Salida
- texto $1.5/M
- Lectura de caché
- $0.05/M
- Contexto
- 256K
- vs GPT-4o
- ~95% más barato
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 65.536 |
Caché de prompts
| Modo | automático + explícito |
|---|---|
| Prefijo mín. | 1024 |
| Duración | explícito: 5 min, se reinicia en cada acierto |
| Coste de escritura | 1.25x |
Razonamiento
| Parámetro del proveedor | enable_thinking + thinking_budget |
|---|---|
| Valores admitidos | enable_thinking true · false; thinking_budget in tokens |
| Valor por defecto | on; la serie Qwen3.6 Flash es de pensamiento híbrido, con el pensamiento activado por defecto se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content y se ignora en los turnos posteriores; qwen3.6-flash no está entre los modelos que Alibaba indica que aceptan preserve_thinking, a diferencia de qwen3.6-plus. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen + vídeo → texto |
|---|
- Modelo Flash nativo de visión y lenguaje, oficialmente una mejora significativa sobre Qwen3.5-Flash
- la generación Qwen3.6 añade preserve_thinking para arrastrar el razonamiento entre turnos, pero Alibaba lo indica para qwen3.6-plus y qwen3.6-max-preview, no para este nivel Flash
Un prompt, medido a través del gateway
Qwen3.6 Flash superado · 3 sentences
Enabling reasoning mode forces the model to generate multiple internal analysis steps before producing a final answer, effectively doubling the computational effort per request. Because our vendor bills for every token processed—including these hidden reasoning tokens—the increased processing directly multiplied our usage charges by approximately two. This spike reflects a deliberate shift from low-cost, basic outputs to higher-intelligence results that reduce error rates and downstream correction costs, optimizing spend for long-term efficiency.
salida 1231 tok (+1141 pensamiento) latencia 11.7 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Qwen3.6 Flash superado · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The original implementation counts matching transitions rather than actual element counts, initializing both accumulators to zero. This causes single-element inputs to bypass the loop entirely and return zero instead of one, while any run of length `k` only increments the counter `k-1` times, consistently undercounting by one. Additionally, resetting `cur` to zero on a mismatch discards the newly started element, losing a potential candidate for the longest run. […]
salida 2724 tok (+2473 pensamiento) latencia 19.0 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Qwen3.6 Flash superado · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11.0, "guidance": null } ```
salida 1629 tok (+1564 pensamiento) latencia 12.0 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Qwen3.6 Flash superado · 120 words, 0 banned, 1 question
We are pleased to announce PromptCache, a new capability built directly into our enterprise API gateway. This innovation stores frequently used text prompts across all integrated model providers, eliminating redundant transmission costs while accelerating response times. Developers can now configure retention policies, set TTL limits, and monitor cache hit rates through our unified dashboard. System performance improves dramatically when identical queries bypass repeated network hops. Your infrastructure will maintain consistent throughput during peak traffic windows without additional provisioning overhead. Teams deploying multimodal applications benefit from reduced latency across diverse inference endpoints. […]
salida 5005 tok (+4866 pensamiento) latencia 26.3 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Qwen3.6 Flash en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.6-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.6-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.6-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.6-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Qwen3.6 Flash
- Frente a Qwen3.5, el anuncio oficial de la generación destaca una codificación agéntica drásticamente mejorada, del trabajo de frontend a las tareas a escala de repositorio, una percepción y una precisión de razonamiento multimodales mejoradas, y una nueva opción preserve_thinking que arrastra el contenido de razonamiento entre turnos para mantener coherentes las decisiones del agente reduciendo a la vez el uso de tokens.
- Flash cede algo de profundidad a cambio de menor latencia y coste.
- La propia orientación de Alibaba es empezar en el nivel Plus más reciente y pasarse aquí para reducir el gasto manteniendo una capacidad similar, y nombra este modelo para documentos largos y bases de código grandes gracias a su contexto de 1M tokens.
- Es de lenguaje-visión nativo, acepta entrada de imagen y vídeo junto al texto, devuelve hasta 65.536 tokens de salida y eleva la asignación de razonamiento de la generación muy por encima de la de Qwen3.5.
- Model Studio enumera llamada a funciones, herramientas integradas, salida estructurada, inferencia por lotes y caché explícita de prompts.
- Como el resto de su generación, es un modelo de pensamiento híbrido con el razonamiento habilitado por defecto, lo contrario que la serie Qwen3, así que una solicitud simple delibera salvo que enable_thinking se fije en false; thinking_budget limita el gasto, y la traza se devuelve en reasoning_content y se factura como salida.
- Conviene comprobar algo antes de diseñar en torno a él: la documentación de pensamiento de Alibaba enumera el soporte de preserve_thinking modelo por modelo, y el nivel Flash no está entre las entradas nombradas, así que trate el razonamiento entre turnos como una función de la generación y no como algo garantizado aquí.
- Synthorai lo sirve por el endpoint compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3.6 Flash?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.25/M por tokens de entrada, solo ese crédito cubre aproximadamente 500 solicitudes de ~8K tokens contra Qwen3.6 Flash.
¿En qué destaca Qwen3.6 Flash?
Codificación agéntica mejorada a nivel de repositorio; 1M de contexto para documentos y bases de código largos; cambia algo de profundidad por menor latencia. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3.6 Flash?
Qwen3.6 Flash cuesta $0.25 por millón de tokens de entrada y $1.5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.05/M.
¿Qwen3.6 Flash admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.05/M frente a $0.25/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →
¿Cómo obtengo acceso a Qwen3.6 Flash?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3.6-flash" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.