Qwen3.8 Max
Precios de lista del proveedor, sin margen de plataforma, pago por uso. Estos son los precios de lista oficiales. Los clientes con sesión iniciada pueden ver los precios efectivos con descuentos del espacio de trabajo en /console/pricing. Precio de entrada efectivo con una tasa de aciertos de caché del 70%:$0.775/M. La caché de contexto implícita es automática; un modo explícito cache_control ofrece descuentos más profundos (bloques mínimos de 1024 tokens, TTL de 5 minutos que se reinicia en cada acierto). Los precios de lectura en caché por modelo están en la tabla de precios.
Use Qwen3.8 Max en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.8-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.8-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.8-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Especificaciones y límites
Tokens
- Ventana de contexto (especificación del proveedor)
- 983.616
- Salida máxima (especificación del proveedor)
- 131.072
Caché de prompts
- Modo
- automático + explícito
- Duración
- explícito: 5 min, se reinicia en cada acierto
Razonamiento
- Parámetro
- reasoning_effort
- Valores
- minimal · low · medium · high el conjunto aceptado es del proveedor
Modelo
- Modalidades
- texto + imagen → texto
- Parámetros
- 2.4T totales MoE
- Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
- thinking trace returned in reasoning_content
- text and image in, text out
Acerca de Qwen3.8 Max
Qwen3.8 Max es el modelo insignia de la gama Qwen de Alibaba, publicado el 3 de agosto de 2026.
- Alibaba lo describe como un modelo Max nativamente visual-lingüístico construido sobre una arquitectura Mixture-of-Experts con 2,4 billones de parámetros, y como el modelo más capaz de la línea Qwen hasta la fecha.
- Acepta texto e imágenes y devuelve texto, de modo que una sola petición puede combinar la indicación con capturas de pantalla, gráficos o páginas escaneadas sin desviar las imágenes a un modelo de visión aparte.
- El razonamiento forma parte del comportamiento por defecto: la traza vuelve por separado en el campo reasoning_content, lo que significa que incluso una respuesta corta consume tokens de razonamiento y que un presupuesto de max_tokens muy ajustado puede devolver una respuesta vacía aunque la petición haya tenido éxito.
- La llamada a funciones, la salida estructurada estricta por esquema JSON y el streaming con usage en el último fragmento están disponibles, así que encaja sin tratamiento especial en una integración compatible con OpenAI ya existente.
- La ventana de contexto roza el millón de tokens y una sola respuesta puede llegar a 131.072 tokens, el doble del techo de salida de la generación Max anterior y la razón concreta para trasladar allí la generación de textos largos.
- Los precios se escalonan según el comportamiento de la caché y no según la longitud del contexto: tarifa de entrada estándar, una tarifa menor para los aciertos automáticos de caché y tarifas propias para crear y leer entradas de caché de forma explícita.
- Los bucles de agente que reutilizan un prefijo estable se benefician de manera apreciable.
- Alibaba indica Pekín y Singapur como regiones.
- Synthorai lo ofrece a través del endpoint de chat completions compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Qwen3.8 Max?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $2/M por tokens de entrada, solo ese crédito cubre aproximadamente 62 solicitudes de ~8K tokens contra Qwen3.8 Max.
¿En qué destaca Qwen3.8 Max?
MoE de 2,4 billones de parámetros, visual-lingüístico nativo; entrada de texto e imagen, salida hasta 131K; precios escalonados por caché. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Qwen3.8 Max?
Qwen3.8 Max cuesta $2 por millón de tokens de entrada y $6 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.25/M.
¿Qwen3.8 Max admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.25/M frente a $2/M sin caché (TTL explícito: 5 min, se reinicia en cada acierto). Guía de caché de prompts →
¿Cómo obtengo acceso a Qwen3.8 Max?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="qwen3.8-max" y listo. Una sola clave API cubre todos los modelos del gateway.