Qwen3.7 Max es el buque insignia de la generación «Agent Frontier» del equipo Qwen, descrito por Alibaba como su modelo de agente más avanzado y completo hasta la fecha.
- Entrada
- texto $2.5/M
- Salida
- texto $7.5/M
- Lectura de caché
- $0.5/M
- Contexto
- 1M
- vs GPT-4o
- ~50% más barato
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 65.536 |
Caché de prompts
| Modo | automático + explícito |
|---|---|
| Prefijo mín. | 1024 |
| Duración | explícito: 5 min, se reinicia en cada acierto |
| Coste de escritura | 1.25x |
Razonamiento
| Parámetro del proveedor | enable_thinking + thinking_budget + preserve_thinking |
|---|---|
| Valores admitidos | enable_thinking true · false; thinking_budget in tokens; preserve_thinking true · false |
| Valor por defecto | on; la serie Qwen3.7 Max es de pensamiento híbrido, con el pensamiento activado por defecto y preserve_thinking desactivado se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content y se descarta en los turnos posteriores salvo que preserve_thinking sea true; las instantáneas qwen3.7-max-preview son solo de pensamiento y no pueden desactivarlo. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto → texto |
|---|
- Buque insignia «Agent Frontier»: solo texto, pensamiento activado por defecto, contexto de 1M tokens
- construido para ejecuciones autónomas de agente de largo horizonte (con una sesión de 35 horas y 1158 llamadas a herramientas demostrada oficialmente)
- no figura como compatible con el modo JSON
Un prompt, medido a través del gateway
Qwen3.7 Max superado · 3 sentences
Enabling reasoning requires the model to generate extensive, step-by-step internal logic before delivering a final answer, drastically increasing our consumption of premium-priced output tokens. Because AI providers charge significantly higher rates for generated text than for input prompts, this surge in behind-the-scenes computation directly multiplied our baseline API costs. However, this increased spend delivers a strong ROI by successfully automating complex workflows that previously required expensive human intervention.
salida 1700 tok (+1613 pensamiento) latencia 28.9 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Qwen3.7 Max superado · 8/8 cases
## Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` ## Explanation The bug is that `cur` and `best` are initialized to `0`, which makes the function count adjacent equal **pairs** (transitions) rather than the number of **elements** in a run. A run of *n* consecutive equal items contains only *n − 1* adjacent pairs, so the reported length is always one less than the true length. This causes single-element inputs (and any list with no adjacent duplicates) to return `0` instead of `1`, and causes every longer run—including those that extend to the final index—to be undercounted by one. […]
salida 3433 tok (+3149 pensamiento) latencia 50.6 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Qwen3.7 Max superado · 5/5 fields, guidance "withheld"
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" }
salida 1595 tok (+1534 pensamiento) latencia 26.9 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Qwen3.7 Max superado · 120 words, 0 banned, 1 question
Introducing Global Prompt Caching for our API gateway. Why pay multiple artificial intelligence vendors for the exact same query? Our new feature intercepts identical requests before they reach external models, serving cached responses instantly. This reduces your monthly bills significantly while dropping latency to near absolute zero. Developers routing traffic between various large language models now share a unified memory layer. When a user asks a repeated question, the gateway retrieves the stored answer, bypassing redundant compute entirely. You maintain complete control over cache expiration and invalidation rules directly through your main configuration dashboard. Stop wasting your expensive tokens on duplicate prompts today. Upgrade your infrastructure right now and watch your operational costs drop while your overall application speed increases.
salida 8147 tok (+8005 pensamiento) latencia 114.3 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Qwen3.7 Max en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.7-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.7-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.7-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.7-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.7-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Qwen3.7 Max
- Aporta una ventana de contexto de 1M tokens, el doble del límite de vista previa de la generación anterior, y está construido para la ejecución autónoma de largo horizonte a lo largo de cientos o incluso miles de pasos, incluidas la codificación y depuración y la automatización de flujos de trabajo ofimáticos.
- La propia demostración de esa afirmación por parte de Alibaba es una sola sesión que se prolonga unas 35 horas a lo largo de más de mil llamadas a herramientas.
- Se centra en la entrada de texto con razonamiento profundo e invocación de herramientas (la visión vive en el nivel Plus) y devuelve hasta 65.536 tokens de salida, además de la mayor asignación de razonamiento documentada de la línea Qwen, duplicada de nuevo sobre Qwen3.6.
- La orientación de selección de Alibaba es tajante sobre cuándo gastar en él: elija Max cuando necesite el razonamiento más fuerte, y Plus en los demás casos.
- El pensamiento es híbrido y está habilitado por defecto, se desactiva con enable_thinking y se acota con thinking_budget, con la traza devuelta en reasoning_content y facturada como salida; tenga en cuenta que las instantáneas de vista previa de este modelo son solo de pensamiento y no pueden desactivarlo.
- El control distintivo de la generación es preserve_thinking, que arrastra el razonamiento entre turnos para que la deliberación previa de un agente siga disponible en lugar de tener que rederivarse, y Alibaba nombra este modelo entre el puñado que lo admite, algo que importa aquí más que en ningún otro sitio dadas las duraciones de sesión a las que apunta.
- Se admiten la llamada a funciones, la inferencia por lotes y la caché tanto explícita como implícita; el modo JSON no figura.
- Synthorai pone Qwen3.7 Max tras su API compatible con OpenAI para una adopción sin fricciones.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3.7 Max?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $2.5/M por tokens de entrada, solo ese crédito cubre aproximadamente 49 solicitudes de ~8K tokens contra Qwen3.7 Max.
¿En qué destaca Qwen3.7 Max?
1M de contexto, el doble del límite de vista previa anterior; ejecución de largo horizonte que abarca miles de pasos; el modelo de agente más avanzado y completo hasta la fecha. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3.7 Max?
Qwen3.7 Max cuesta $2.5 por millón de tokens de entrada y $7.5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.5/M.
¿Qwen3.7 Max admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.5/M frente a $2.5/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →
¿Cómo obtengo acceso a Qwen3.7 Max?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3.7-max" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.