Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Qwen3.8 Max

Lanzamiento: 2026-08-03

chatVisiónCódigoRazonamientoLlamada a herramientasCaché de prompts

Qwen3.8 Max es el modelo insignia de la gama Qwen de Alibaba, publicado el 3 de agosto de 2026.

Entrada
texto imagen $2/M
Salida
texto $6/M
Lectura de caché
$0.25/M
Contexto
984K
vs GPT-4o
~60% más barato

Benchmarks

Sobre la mediaNinguno mejor31 / 408 / 40
Qwen3.8 Max otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
SWE-Bench Pro
67.7%
AndroidBench
75.1%
Cybergym
78.5%
HealthBench
ningún otro modelo puntuó más alto 60.2%
JobBench
53.4%
PLawBench
ningún otro modelo puntuó más alto 73.2%
GPQA Diamond
92.6%
Agents' Last Exam
27%

Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

El precio en contexto

Posición del precio entre 66 modelos comparables

Entrada$2/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.25/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 983.616
Salida máxima (especificación del proveedor) 131.072

Caché de prompts

Modo automático + explícito
Prefijo mín. 1024
Duración explícito: 5 min, se reinicia en cada acierto
Coste de escritura 1.25x

Razonamiento

Parámetro reasoning_effort
Valores minimal · low · medium · high el conjunto aceptado es del proveedor

Modelo

Modalidades texto + imagen → texto
Parámetros 2.4T totales MoE
  • Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
  • thinking trace returned in reasoning_content
  • text and image in, text out

según documentación oficial de Alibaba ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

Qwen3.8 Max superado · 3 sentences

Enabling reasoning makes the model produce additional hidden steps before responding, and those tokens are billable. It also tends to lengthen each interaction because the model works through more possibilities before settling on an answer. Therefore, the bill doubled mainly due to higher compute and token usage per request, not necessarily because the number of requests doubled.

salida 378 tok (+305 pensamiento) latencia 8.6 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

Qwen3.8 Max superado · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that the original code starts `best` and `cur` at `0`, so it counts adjacent equal *transitions* rather than the number of items in the run. A run of length `n` has only `n - 1` equal-neighbor transitions, so single-element inputs return `0`, and runs that reach the end are undercounted by one. Initializing the current run to `1` for the first element, resetting it to `1` on a break, and updating `best` from that count fixes the off-by-one.

salida 1616 tok (+1411 pensamiento) latencia 34.7 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

Qwen3.8 Max superado · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

salida 1199 tok (+1141 pensamiento) latencia 24.4 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

Qwen3.8 Max superado · 120 words, 0 banned, 1 question

Today, our API gateway adds prompt caching across major model providers. It stores prompts and responses in one fast cache layer. Teams can lower token spend, reduce latency, and repeat reliable answers. The feature supports OpenAI, Anthropic, Google, and Mistral through one configuration. You can set retention rules, scope access, and invalidate entries quickly. How does your team maintain consistent results during provider outages? Approved cached responses keep applications stable while fallback routes recover. The dashboard shows hit rates, savings, latency, and provider usage. Engineers receive audit trails for every cached prompt, enabling safer testing. Product managers can compare cost trends before and after cache adoption. Start with a small route, then safely expand caching to production traffic right now.

salida 2744 tok (+2591 pensamiento) latencia 46.3 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use Qwen3.8 Max en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de Qwen3.8 Max

  • Alibaba lo describe como un modelo Max nativamente visual-lingüístico construido sobre una arquitectura Mixture-of-Experts con 2,4 billones de parámetros, y como el modelo más capaz de la línea Qwen hasta la fecha.
  • Acepta texto e imágenes y devuelve texto, de modo que una sola petición puede combinar la indicación con capturas de pantalla, gráficos o páginas escaneadas sin desviar las imágenes a un modelo de visión aparte.
  • El razonamiento forma parte del comportamiento por defecto: la traza vuelve por separado en el campo reasoning_content, lo que significa que incluso una respuesta corta consume tokens de razonamiento y que un presupuesto de max_tokens muy ajustado puede devolver una respuesta vacía aunque la petición haya tenido éxito.
  • La llamada a funciones, la salida estructurada estricta por esquema JSON y el streaming con usage en el último fragmento están disponibles, así que encaja sin tratamiento especial en una integración compatible con OpenAI ya existente.
  • La ventana de contexto roza el millón de tokens y una sola respuesta puede llegar a 131.072 tokens, el doble del techo de salida de la generación Max anterior y la razón concreta para trasladar allí la generación de textos largos.
  • Los precios se escalonan según el comportamiento de la caché y no según la longitud del contexto: tarifa de entrada estándar, una tarifa menor para los aciertos automáticos de caché y tarifas propias para crear y leer entradas de caché de forma explícita.
  • Los bucles de agente que reutilizan un prefijo estable se benefician de manera apreciable.
  • Alibaba indica Pekín y Singapur como regiones.
  • Synthorai lo ofrece a través del endpoint de chat completions compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Qwen3.8 Max?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $2/M por tokens de entrada, solo ese crédito cubre aproximadamente 62 solicitudes de ~8K tokens contra Qwen3.8 Max.

¿En qué destaca Qwen3.8 Max?

MoE de 2,4 billones de parámetros, visual-lingüístico nativo; entrada de texto e imagen, salida hasta 131K; precios escalonados por caché. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Qwen3.8 Max?

Qwen3.8 Max cuesta $2 por millón de tokens de entrada y $6 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.25/M.

¿Qwen3.8 Max admite caché de prompts?

Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.25/M frente a $2/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →

¿Cómo obtengo acceso a Qwen3.8 Max?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3.8-max" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →