Qwen3.8 Max es el modelo insignia de la gama Qwen de Alibaba, publicado el 3 de agosto de 2026.
- Entrada
- texto imagen $2/M
- Salida
- texto $6/M
- Lectura de caché
- $0.25/M
- Contexto
- 984K
- vs GPT-4o
- ~60% más barato
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 66 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 983.616 |
|---|---|
| Salida máxima (especificación del proveedor) | 131.072 |
Caché de prompts
| Modo | automático + explícito |
|---|---|
| Prefijo mín. | 1024 |
| Duración | explícito: 5 min, se reinicia en cada acierto |
| Coste de escritura | 1.25x |
Razonamiento
| Parámetro | reasoning_effort |
|---|---|
| Valores | minimal · low · medium · high el conjunto aceptado es del proveedor |
Modelo
| Modalidades | texto + imagen → texto |
|---|---|
| Parámetros | 2.4T totales MoE |
- Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
- thinking trace returned in reasoning_content
- text and image in, text out
Un prompt, medido a través del gateway
Qwen3.8 Max superado · 3 sentences
Enabling reasoning makes the model produce additional hidden steps before responding, and those tokens are billable. It also tends to lengthen each interaction because the model works through more possibilities before settling on an answer. Therefore, the bill doubled mainly due to higher compute and token usage per request, not necessarily because the number of requests doubled.
salida 378 tok (+305 pensamiento) latencia 8.6 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Qwen3.8 Max superado · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that the original code starts `best` and `cur` at `0`, so it counts adjacent equal *transitions* rather than the number of items in the run. A run of length `n` has only `n - 1` equal-neighbor transitions, so single-element inputs return `0`, and runs that reach the end are undercounted by one. Initializing the current run to `1` for the first element, resetting it to `1` on a break, and updating `best` from that count fixes the off-by-one.
salida 1616 tok (+1411 pensamiento) latencia 34.7 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Qwen3.8 Max superado · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
salida 1199 tok (+1141 pensamiento) latencia 24.4 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Qwen3.8 Max superado · 120 words, 0 banned, 1 question
Today, our API gateway adds prompt caching across major model providers. It stores prompts and responses in one fast cache layer. Teams can lower token spend, reduce latency, and repeat reliable answers. The feature supports OpenAI, Anthropic, Google, and Mistral through one configuration. You can set retention rules, scope access, and invalidate entries quickly. How does your team maintain consistent results during provider outages? Approved cached responses keep applications stable while fallback routes recover. The dashboard shows hit rates, savings, latency, and provider usage. Engineers receive audit trails for every cached prompt, enabling safer testing. Product managers can compare cost trends before and after cache adoption. Start with a small route, then safely expand caching to production traffic right now.
salida 2744 tok (+2591 pensamiento) latencia 46.3 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Qwen3.8 Max en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.8-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.8-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.8-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Qwen3.8 Max
- Alibaba lo describe como un modelo Max nativamente visual-lingüístico construido sobre una arquitectura Mixture-of-Experts con 2,4 billones de parámetros, y como el modelo más capaz de la línea Qwen hasta la fecha.
- Acepta texto e imágenes y devuelve texto, de modo que una sola petición puede combinar la indicación con capturas de pantalla, gráficos o páginas escaneadas sin desviar las imágenes a un modelo de visión aparte.
- El razonamiento forma parte del comportamiento por defecto: la traza vuelve por separado en el campo reasoning_content, lo que significa que incluso una respuesta corta consume tokens de razonamiento y que un presupuesto de max_tokens muy ajustado puede devolver una respuesta vacía aunque la petición haya tenido éxito.
- La llamada a funciones, la salida estructurada estricta por esquema JSON y el streaming con usage en el último fragmento están disponibles, así que encaja sin tratamiento especial en una integración compatible con OpenAI ya existente.
- La ventana de contexto roza el millón de tokens y una sola respuesta puede llegar a 131.072 tokens, el doble del techo de salida de la generación Max anterior y la razón concreta para trasladar allí la generación de textos largos.
- Los precios se escalonan según el comportamiento de la caché y no según la longitud del contexto: tarifa de entrada estándar, una tarifa menor para los aciertos automáticos de caché y tarifas propias para crear y leer entradas de caché de forma explícita.
- Los bucles de agente que reutilizan un prefijo estable se benefician de manera apreciable.
- Alibaba indica Pekín y Singapur como regiones.
- Synthorai lo ofrece a través del endpoint de chat completions compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3.8 Max?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $2/M por tokens de entrada, solo ese crédito cubre aproximadamente 62 solicitudes de ~8K tokens contra Qwen3.8 Max.
¿En qué destaca Qwen3.8 Max?
MoE de 2,4 billones de parámetros, visual-lingüístico nativo; entrada de texto e imagen, salida hasta 131K; precios escalonados por caché. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3.8 Max?
Qwen3.8 Max cuesta $2 por millón de tokens de entrada y $6 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.25/M.
¿Qwen3.8 Max admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.25/M frente a $2/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →
¿Cómo obtengo acceso a Qwen3.8 Max?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3.8-max" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.