🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3.8 Max Lançado em 2026-08-03

Alibaba chatVisãoCódigoRaciocínioChamada de ferramentasContexto longoSaída estruturadaStreamingCache de prompts
Entrada$2/M
Saída$6/M
Leitura de cache$0.25/M
Contexto984K
vs GPT-4o~60% mais barato

Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing. Entrada efetiva com taxa de acerto de cache de 70%:$0.775/M. O cache de contexto implícito é automático; um modo explícito cache_control oferece descontos mais profundos (blocos mínimos de 1.024 tokens, TTL de 5 minutos que reinicia a cada acerto). Os preços de leitura em cache por modelo estão na tabela de preços.

Use o Qwen3.8 Max em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor)
983.616
Saída máxima (especificação do fornecedor)
131.072

Cache de prompts

Modo
automático + explícito
Duração
explícito: 5 min, reinicia a cada acerto

Raciocínio

Parâmetro
reasoning_effort
Valores
minimal · low · medium · high o conjunto aceite é do provedor

Modelo

Modalidades
texto + imagem → texto
Parâmetros
2.4T no total MoE
  • Flagship Qwen3.8 Max: natively vision-language, 2.4T-parameter MoE
  • thinking trace returned in reasoning_content
  • text and image in, text out

conforme documentação oficial da Alibaba ↗

Sobre o Qwen3.8 Max

MoE de 2,4 trilhões de parâmetros, visual-linguístico nativo
Entrada de texto e imagem, saída até 131K
Preços escalonados por cache

Qwen3.8 Max é o modelo principal da linha Qwen da Alibaba, publicado em 3 de agosto de 2026.

  • A Alibaba o descreve como um modelo Max nativamente visual-linguístico construído sobre uma arquitetura Mixture-of-Experts com 2,4 trilhões de parâmetros e como o modelo mais capaz da linha Qwen até hoje.
  • Ele aceita texto e imagens e devolve texto, de modo que uma única requisição pode reunir o prompt com capturas de tela, gráficos ou páginas digitalizadas sem desviar as imagens para um modelo de visão separado.
  • O raciocínio faz parte do comportamento padrão: o traço volta separadamente no campo reasoning_content, o que significa que mesmo uma resposta curta consome tokens de raciocínio e que um orçamento de max_tokens muito apertado pode devolver uma resposta vazia embora a requisição tenha tido sucesso.
  • Chamada de funções, saída estruturada estrita por esquema JSON e streaming com usage no último fragmento estão todos disponíveis, de modo que ele entra sem tratamento especial em uma integração compatível com OpenAI já existente.
  • A janela de contexto chega perto de um milhão de tokens e uma única resposta pode alcançar 131.072 tokens, o dobro do teto de saída da geração Max anterior e a razão concreta para mover para lá a geração de textos longos.
  • Os preços são escalonados pelo comportamento do cache e não pelo comprimento do contexto: tarifa de entrada padrão, uma tarifa menor para acertos automáticos de cache e tarifas próprias para criar e ler entradas de cache explicitamente.
  • Laços de agente que reutilizam um prefixo estável se beneficiam de forma apreciável.
  • A Alibaba indica Pequim e Singapura como regiões.
  • A Synthorai o oferece pelo endpoint de chat completions compatível com OpenAI.

Perguntas frequentes

A API do Qwen3.8 Max é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $2/M de tokens de entrada, só esse crédito já cobre cerca de 62 requisições de ~8K tokens ao Qwen3.8 Max.

Em que o Qwen3.8 Max é melhor?

MoE de 2,4 trilhões de parâmetros, visual-linguístico nativo; entrada de texto e imagem, saída até 131K; preços escalonados por cache. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3.8 Max?

Na Synthorai, o Qwen3.8 Max custa $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.25/M.

O Qwen3.8 Max suporta cache de prompts?

Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.25/M, contra $2/M sem cache (TTL explícito: 5 min, reinicia a cada acerto). Guia de cache de prompts →

Como obtenho acesso ao Qwen3.8 Max?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3.8-max" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Obtenha sua chave de API gratuita Compare seu custo →