Qwen3.5 Flash es el nivel alojado optimizado en velocidad y coste de la generación Qwen3.5, que el equipo Qwen presentó bajo el lema «Towards Native Multimodal Agents».
- Entrada
- texto imagen vídeo $0.1/M
- Salida
- texto $0.4/M
- Lectura de caché
- $0.029/M
- Contexto
- 1M
- vs GPT-4o
- ~98% más barato
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 65.536 |
Caché de prompts
| Modo | automático + explícito |
|---|---|
| Prefijo mín. | 1024 |
| Duración | explícito: 5 min, se reinicia en cada acierto |
| Coste de escritura | 1.25x |
Razonamiento
| Parámetro del proveedor | enable_thinking + thinking_budget |
|---|---|
| Valores admitidos | enable_thinking true · false; thinking_budget in tokens |
| Valor por defecto | on; la serie Qwen3.5 es de pensamiento híbrido, con el pensamiento activado por defecto se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content; el reasoning_content de los turnos anteriores se ignora, y ningún modelo Qwen3.5 figura en la lista de preserve_thinking. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen + vídeo → texto |
|---|---|
| Parámetros | 35B totales · 3B activos MoE |
- Modelo flash nativo de visión y lenguaje (entrada de texto, imagen y vídeo)
- pensamiento híbrido activado por defecto
- calidad global posicionada oficialmente cerca de qwen3.5-plus
Un prompt, medido a través del gateway
Qwen3.5 Flash superado · 3 sentences
Enabling reasoning requires the model to execute multi-step verification internally, which consumes significantly more tokens than a standard query. Since vendor fees are calculated per token processed, this added workload has directly resulted in a doubling of our total monthly expenditure. We view this cost increase as a strategic investment in higher model reliability, which prevents far more expensive errors from occurring downstream.
salida 2010 tok (+1934 pensamiento) latencia 18.7 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Qwen3.5 Flash superado · 8/8 cases
The bug stems from two related issues: the function incorrectly initializes its counters and fails to account for runs starting at the beginning or ending at the last element. Specifically, `cur` counts how many consecutive pairs match (transitions) rather than the actual number of items in a run—for example, two equal items yield a `cur` value of 1 instead of 2. Additionally, if the input has fewer than two elements, the loop never executes, causing single-element lists to return 0 instead of 1, and runs that end at the final index may not be fully captured since updates rely on detecting a mismatch or completing the loop. To fix it, initialize `cur` and `best` to 1 (assuming a non-empty input), handle empty inputs explicitly, and ensure every comparison contributes accurately to the actual item count in the current run. […]
salida 1020 tok (+747 pensamiento) latencia 9.8 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Qwen3.5 Flash superado · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
salida 3545 tok (+3487 pensamiento) latencia 33.1 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Qwen3.5 Flash superado · 120 words, 0 banned, 1 question
We announce our cross platform prompt caching feature in the API Gateway. Storing frequent inputs allows developers to significantly reduce latency and minimize token costs for every request sent through our system. Utilizing OpenAI or Anthropic ensures consistency without repetitive processing fees. Organizations gain better control over spending while maintaining rapid response times for end users globally. Our engineering team ensured compatibility with your existing infrastructure without friction. Can your current setup handle such efficiency improvements effectively? All clients receive immediate access starting today. Update your configuration files now to enable this capability. Join thousands of others optimizing deployment pipelines efficiently. This tool delivers tangible results for scalable applications needing lower overhead costs. […]
salida 10675 tok (+10535 pensamiento) latencia 80.1 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Qwen3.5 Flash en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.5-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.5-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.5-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.5-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Qwen3.5 Flash
- La generación está construida sobre la arquitectura Qwen3-Next, que combina atención lineal con puertas y Mixture-of-Experts dispersa para una inferencia de alto rendimiento, y se entrena de forma nativa para el trabajo agéntico: planificación, llamada a herramientas y ejecución en varios pasos.
- El nivel Flash alojado ofrece un contexto de 1M tokens por defecto con las herramientas integradas oficiales, y hasta 65.536 tokens de salida.
- Alibaba lo posiciona como cercano a Qwen3.5 Plus en capacidad pero más rápido al responder, y la diferencia de tamaño que hay detrás es pública: la ficha del equipo Qwen para Qwen3.5-35B-A3B lo nombra como la contraparte abierta de este nivel alojado, un Mixture-of-Experts de 35B parámetros que activa unos 3B por token, publicado bajo Apache 2.0, frente a los 397B de Plus.
- Así que la elección entre ambos es de capacidad, no solo de latencia, y Flash es además uno que puede ejecutar usted mismo.
- Es de lenguaje-visión nativo, acepta entrada de imagen y vídeo junto al texto y devuelve texto.
- El pensamiento invierte el valor por defecto de Qwen3: en toda la generación 3.5 el pensamiento híbrido llega habilitado, así que las solicitudes razonan salvo que se pase enable_thinking como false, con thinking_budget disponible para limitar el gasto y la traza devuelta en reasoning_content.
- Se admiten la llamada a herramientas, la salida estructurada, la inferencia por lotes y la caché explícita de prompts; las llamadas a herramientas en paralelo son opcionales y no vienen por defecto.
- Synthorai lo pone tras el endpoint estándar compatible con OpenAI para un uso directo.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3.5 Flash?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.1/M por tokens de entrada, solo ese crédito cubre aproximadamente 1,250 solicitudes de ~8K tokens contra Qwen3.5 Flash.
¿En qué destaca Qwen3.5 Flash?
Atención lineal con puertas y MoE dispersa; contexto de 1M tokens por defecto; entrenado de forma nativa para el trabajo agéntico. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3.5 Flash?
Qwen3.5 Flash cuesta $0.1 por millón de tokens de entrada y $0.4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.029/M.
¿Qwen3.5 Flash admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.029/M frente a $0.1/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →
¿Cómo obtengo acceso a Qwen3.5 Flash?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3.5-flash" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.