Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Qwen3 Max

Lanzamiento: 2025-09-23

chatCódigoRazonamientoLlamada a herramientasCaché de prompts

Qwen3-Max es el buque insignia a escala de billón de parámetros del equipo Qwen, presentado en la publicación oficial «Qwen3-Max: Just Scale» con un contexto de 256K tokens.

Entrada
texto $1.2/M
Salida
texto $6/M
Lectura de caché
$0.359/M
Contexto
256K
vs GPT-4o
~76% más barato

Benchmarks

Qwen3 Max
LiveCodeBench Instruct, v6 (25.02-25.05) según Alibaba (Qwen)
ningún otro modelo medido
69%
SWE-bench Verified Instruct según Alibaba (Qwen)
ningún otro modelo medido
69.6%
AIME 2025 Instruct según Alibaba (Qwen)
ningún otro modelo medido
81.6%
SuperGPQA Instruct según Alibaba (Qwen)
ningún otro modelo medido
65.1%
τ²-Bench Instruct, weighted según Alibaba (Qwen)
ningún otro modelo medido
74.8%

Publicado por los proveedores: Alibaba (Qwen)

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$1.2/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.359/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 256.000
Salida máxima (especificación del proveedor) 65.536

Caché de prompts

Modo automático + explícito
Prefijo mín. 1024
Duración explícito: 5 min, se reinicia en cada acierto
Coste de escritura 1.25x

Razonamiento

Parámetro del proveedor enable_thinking + thinking_budget
Valores admitidos enable_thinking true · false; thinking_budget in tokens
Valor por defecto off; enable_thinking es false por defecto, y thinking_budget toma por defecto la longitud máxima de cadena de pensamiento del modelo se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La traza se devuelve en reasoning_content; el reasoning_content del historial de mensajes se ignora por defecto, y qwen3-max no está entre los modelos que aceptan preserve_thinking.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto → texto
Parámetros 1T+ totales MoE
  • Primer buque insignia de Qwen con más de un billón de parámetros (pesos cerrados), solo texto
  • posicionado oficialmente para programación agéntica y llamada a herramientas
  • pensamiento híbrido, desactivado por defecto

según documentación oficial de Alibaba ↗

Use Qwen3 Max en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de Qwen3 Max

  • Alibaba reporta resultados de vanguardia en sus propias evaluaciones de conocimiento, razonamiento, codificación, seguimiento de instrucciones, tareas de agente y comprensión multilingüe, y su nota de lanzamiento subraya una mejora en codificación agéntica y llamada a herramientas.
  • La línea se distribuye en forma Instruct junto a una variante Thinking que integra un intérprete de código y uso adaptativo de herramientas para problemas de razonamiento más difíciles.
  • Como el modelo más grande de la serie Qwen3, se dirige a cargas de trabajo de producción exigentes.
  • Es un modelo de texto a texto (la visión vive en los hermanos Qwen3-VL) con hasta 65.536 tokens de salida, y Model Studio enumera llamada a herramientas, salida estructurada, inferencia por lotes y caché de contexto tanto explícita como implícita.
  • Un detalle de comportamiento lo separa de todas las generaciones Qwen posteriores de este catálogo: es un modelo de pensamiento híbrido cuyo razonamiento se conmuta con el parámetro enable_thinking y está desactivado por defecto, mientras que Qwen3.5 y posteriores llegan con el pensamiento ya activado.
  • Cuando el razonamiento está habilitado, un parámetro thinking_budget limita el gasto, y la traza vuelve por separado en reasoning_content, facturada como salida.
  • Los pesos de este buque insignia alojado no se publican, y Alibaba ahora lo lista entre los modelos heredados, y dirige los proyectos nuevos a las series Qwen3.5 y Qwen3.6.
  • Synthorai lo ofrece a través del endpoint de chat compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Qwen3 Max?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.2/M por tokens de entrada, solo ese crédito cubre aproximadamente 104 solicitudes de ~8K tokens contra Qwen3 Max.

¿En qué destaca Qwen3 Max?

Buque insignia a escala de billón de parámetros con 256K de contexto; la variante Thinking integra un intérprete de código; uso adaptativo de herramientas para problemas más difíciles. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Qwen3 Max?

Qwen3 Max cuesta $1.2 por millón de tokens de entrada y $6 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.359/M.

¿Qwen3 Max admite caché de prompts?

Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.359/M frente a $1.2/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →

¿Cómo obtengo acceso a Qwen3 Max?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3-max" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →