Qwen3-Max es el buque insignia a escala de billón de parámetros del equipo Qwen, presentado en la publicación oficial «Qwen3-Max: Just Scale» con un contexto de 256K tokens.
- Entrada
- texto $1.2/M
- Salida
- texto $6/M
- Lectura de caché
- $0.359/M
- Contexto
- 256K
- vs GPT-4o
- ~76% más barato
Benchmarks
Publicado por los proveedores: Alibaba (Qwen)
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 256.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 65.536 |
Caché de prompts
| Modo | automático + explícito |
|---|---|
| Prefijo mín. | 1024 |
| Duración | explícito: 5 min, se reinicia en cada acierto |
| Coste de escritura | 1.25x |
Razonamiento
| Parámetro del proveedor | enable_thinking + thinking_budget |
|---|---|
| Valores admitidos | enable_thinking true · false; thinking_budget in tokens |
| Valor por defecto | off; enable_thinking es false por defecto, y thinking_budget toma por defecto la longitud máxima de cadena de pensamiento del modelo se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content; el reasoning_content del historial de mensajes se ignora por defecto, y qwen3-max no está entre los modelos que aceptan preserve_thinking. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parámetros | 1T+ totales MoE |
- Primer buque insignia de Qwen con más de un billón de parámetros (pesos cerrados), solo texto
- posicionado oficialmente para programación agéntica y llamada a herramientas
- pensamiento híbrido, desactivado por defecto
Use Qwen3 Max en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Qwen3 Max
- Alibaba reporta resultados de vanguardia en sus propias evaluaciones de conocimiento, razonamiento, codificación, seguimiento de instrucciones, tareas de agente y comprensión multilingüe, y su nota de lanzamiento subraya una mejora en codificación agéntica y llamada a herramientas.
- La línea se distribuye en forma Instruct junto a una variante Thinking que integra un intérprete de código y uso adaptativo de herramientas para problemas de razonamiento más difíciles.
- Como el modelo más grande de la serie Qwen3, se dirige a cargas de trabajo de producción exigentes.
- Es un modelo de texto a texto (la visión vive en los hermanos Qwen3-VL) con hasta 65.536 tokens de salida, y Model Studio enumera llamada a herramientas, salida estructurada, inferencia por lotes y caché de contexto tanto explícita como implícita.
- Un detalle de comportamiento lo separa de todas las generaciones Qwen posteriores de este catálogo: es un modelo de pensamiento híbrido cuyo razonamiento se conmuta con el parámetro enable_thinking y está desactivado por defecto, mientras que Qwen3.5 y posteriores llegan con el pensamiento ya activado.
- Cuando el razonamiento está habilitado, un parámetro thinking_budget limita el gasto, y la traza vuelve por separado en reasoning_content, facturada como salida.
- Los pesos de este buque insignia alojado no se publican, y Alibaba ahora lo lista entre los modelos heredados, y dirige los proyectos nuevos a las series Qwen3.5 y Qwen3.6.
- Synthorai lo ofrece a través del endpoint de chat compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3 Max?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.2/M por tokens de entrada, solo ese crédito cubre aproximadamente 104 solicitudes de ~8K tokens contra Qwen3 Max.
¿En qué destaca Qwen3 Max?
Buque insignia a escala de billón de parámetros con 256K de contexto; la variante Thinking integra un intérprete de código; uso adaptativo de herramientas para problemas más difíciles. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3 Max?
Qwen3 Max cuesta $1.2 por millón de tokens de entrada y $6 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.359/M.
¿Qwen3 Max admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.359/M frente a $1.2/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →
¿Cómo obtengo acceso a Qwen3 Max?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3-max" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.