Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Qwen3.7 Max

Lanzamiento: 2026-05-21

chatCódigoRazonamientoLlamada a herramientasCaché de prompts

Qwen3.7 Max es el buque insignia de la generación «Agent Frontier» del equipo Qwen, descrito por Alibaba como su modelo de agente más avanzado y completo hasta la fecha.

Entrada
texto $2.5/M
Salida
texto $7.5/M
Lectura de caché
$0.5/M
Contexto
1M
vs GPT-4o
~50% más barato

Benchmarks

Sobre la mediaNinguno mejor43 / 9112 / 91
Qwen3.7 Max otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
SWE-Bench Pro
60.6%
AndroidBench
56.5%
HealthBench
54.5%
JobBench
31.3%
PLawBench
58.9%
GPQA Diamond
92.4%
MCP-Atlas
76.4%

Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$2.5/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$7.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.5/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.000.000
Salida máxima (especificación del proveedor) 65.536

Caché de prompts

Modo automático + explícito
Prefijo mín. 1024
Duración explícito: 5 min, se reinicia en cada acierto
Coste de escritura 1.25x

Razonamiento

Parámetro del proveedor enable_thinking + thinking_budget + preserve_thinking
Valores admitidos enable_thinking true · false; thinking_budget in tokens; preserve_thinking true · false
Valor por defecto on; la serie Qwen3.7 Max es de pensamiento híbrido, con el pensamiento activado por defecto y preserve_thinking desactivado se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La traza se devuelve en reasoning_content y se descarta en los turnos posteriores salvo que preserve_thinking sea true; las instantáneas qwen3.7-max-preview son solo de pensamiento y no pueden desactivarlo.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto → texto
  • Buque insignia «Agent Frontier»: solo texto, pensamiento activado por defecto, contexto de 1M tokens
  • construido para ejecuciones autónomas de agente de largo horizonte (con una sesión de 35 horas y 1158 llamadas a herramientas demostrada oficialmente)
  • no figura como compatible con el modo JSON

según documentación oficial de Alibaba ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

Qwen3.7 Max superado · 3 sentences

Enabling reasoning requires the model to generate extensive, step-by-step internal logic before delivering a final answer, drastically increasing our consumption of premium-priced output tokens. Because AI providers charge significantly higher rates for generated text than for input prompts, this surge in behind-the-scenes computation directly multiplied our baseline API costs. However, this increased spend delivers a strong ROI by successfully automating complex workflows that previously required expensive human intervention.

salida 1700 tok (+1613 pensamiento) latencia 28.9 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

Qwen3.7 Max superado · 8/8 cases

## Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` ## Explanation The bug is that `cur` and `best` are initialized to `0`, which makes the function count adjacent equal **pairs** (transitions) rather than the number of **elements** in a run. A run of *n* consecutive equal items contains only *n − 1* adjacent pairs, so the reported length is always one less than the true length. This causes single-element inputs (and any list with no adjacent duplicates) to return `0` instead of `1`, and causes every longer run—including those that extend to the final index—to be undercounted by one. […]

salida 3433 tok (+3149 pensamiento) latencia 50.6 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

Qwen3.7 Max superado · 5/5 fields, guidance "withheld"

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" }

salida 1595 tok (+1534 pensamiento) latencia 26.9 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

Qwen3.7 Max superado · 120 words, 0 banned, 1 question

Introducing Global Prompt Caching for our API gateway. Why pay multiple artificial intelligence vendors for the exact same query? Our new feature intercepts identical requests before they reach external models, serving cached responses instantly. This reduces your monthly bills significantly while dropping latency to near absolute zero. Developers routing traffic between various large language models now share a unified memory layer. When a user asks a repeated question, the gateway retrieves the stored answer, bypassing redundant compute entirely. You maintain complete control over cache expiration and invalidation rules directly through your main configuration dashboard. Stop wasting your expensive tokens on duplicate prompts today. Upgrade your infrastructure right now and watch your operational costs drop while your overall application speed increases.

salida 8147 tok (+8005 pensamiento) latencia 114.3 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use Qwen3.7 Max en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.7-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de Qwen3.7 Max

  • Aporta una ventana de contexto de 1M tokens, el doble del límite de vista previa de la generación anterior, y está construido para la ejecución autónoma de largo horizonte a lo largo de cientos o incluso miles de pasos, incluidas la codificación y depuración y la automatización de flujos de trabajo ofimáticos.
  • La propia demostración de esa afirmación por parte de Alibaba es una sola sesión que se prolonga unas 35 horas a lo largo de más de mil llamadas a herramientas.
  • Se centra en la entrada de texto con razonamiento profundo e invocación de herramientas (la visión vive en el nivel Plus) y devuelve hasta 65.536 tokens de salida, además de la mayor asignación de razonamiento documentada de la línea Qwen, duplicada de nuevo sobre Qwen3.6.
  • La orientación de selección de Alibaba es tajante sobre cuándo gastar en él: elija Max cuando necesite el razonamiento más fuerte, y Plus en los demás casos.
  • El pensamiento es híbrido y está habilitado por defecto, se desactiva con enable_thinking y se acota con thinking_budget, con la traza devuelta en reasoning_content y facturada como salida; tenga en cuenta que las instantáneas de vista previa de este modelo son solo de pensamiento y no pueden desactivarlo.
  • El control distintivo de la generación es preserve_thinking, que arrastra el razonamiento entre turnos para que la deliberación previa de un agente siga disponible en lugar de tener que rederivarse, y Alibaba nombra este modelo entre el puñado que lo admite, algo que importa aquí más que en ningún otro sitio dadas las duraciones de sesión a las que apunta.
  • Se admiten la llamada a funciones, la inferencia por lotes y la caché tanto explícita como implícita; el modo JSON no figura.
  • Synthorai pone Qwen3.7 Max tras su API compatible con OpenAI para una adopción sin fricciones.

Preguntas frecuentes

¿Se puede probar gratis la API de Qwen3.7 Max?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $2.5/M por tokens de entrada, solo ese crédito cubre aproximadamente 49 solicitudes de ~8K tokens contra Qwen3.7 Max.

¿En qué destaca Qwen3.7 Max?

1M de contexto, el doble del límite de vista previa anterior; ejecución de largo horizonte que abarca miles de pasos; el modelo de agente más avanzado y completo hasta la fecha. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Qwen3.7 Max?

Qwen3.7 Max cuesta $2.5 por millón de tokens de entrada y $7.5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.5/M.

¿Qwen3.7 Max admite caché de prompts?

Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.5/M frente a $2.5/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →

¿Cómo obtengo acceso a Qwen3.7 Max?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3.7-max" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →