Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3.7 Max

Lançado em 2026-05-21

chatCódigoRaciocínioChamada de ferramentasCache de prompts

O Qwen3.7 Max é o carro-chefe da geração “Agent Frontier” da equipe Qwen, descrito pela Alibaba como seu modelo de agente mais avançado e abrangente até hoje.

Entrada
texto $2.5/M
Saída
texto $7.5/M
Leitura de cache
$0.5/M
Contexto
1M
vs GPT-4o
~50% mais barato

Benchmarks

Acima da médiaNenhum melhor43 / 9112 / 91
Qwen3.7 Max outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
SWE-Bench Pro
60.6%
AndroidBench
56.5%
HealthBench
54.5%
JobBench
31.3%
PLawBench
58.9%
GPQA Diamond
92.4%
MCP-Atlas
76.4%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$2.5/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$7.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.5/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 65.536

Cache de prompts

Modo automático + explícito
Prefixo mín. 1.024
Duração explícito: 5 min, reinicia a cada acerto
Custo de escrita 1.25x

Raciocínio

Parâmetro do fornecedor enable_thinking + thinking_budget + preserve_thinking
Valores aceites enable_thinking true · false; thinking_budget in tokens; preserve_thinking true · false
Valor predefinido ativado; a série Qwen3.7 Max é de raciocínio híbrido, com o raciocínio ativado por padrão, e preserve_thinking desativado aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content e é descartado nos turnos seguintes, a menos que preserve_thinking seja true; os snapshots qwen3.7-max-preview são exclusivamente de raciocínio e não podem desativá-lo.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto → texto
  • Carro-chefe "Agent Frontier": apenas texto, raciocínio ativado por padrão, contexto de 1M tokens
  • criado para execuções autônomas de agente de longo horizonte (sessão de 35 horas com 1.158 chamadas de ferramentas demonstrada oficialmente)
  • não listado para o modo JSON

conforme documentação oficial da Alibaba ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

Qwen3.7 Max passou · 3 sentences

Enabling reasoning requires the model to generate extensive, step-by-step internal logic before delivering a final answer, drastically increasing our consumption of premium-priced output tokens. Because AI providers charge significantly higher rates for generated text than for input prompts, this surge in behind-the-scenes computation directly multiplied our baseline API costs. However, this increased spend delivers a strong ROI by successfully automating complex workflows that previously required expensive human intervention.

saída 1700 tok (+1613 pensamento) latência 28.9 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

Qwen3.7 Max passou · 8/8 cases

## Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` ## Explanation The bug is that `cur` and `best` are initialized to `0`, which makes the function count adjacent equal **pairs** (transitions) rather than the number of **elements** in a run. A run of *n* consecutive equal items contains only *n − 1* adjacent pairs, so the reported length is always one less than the true length. This causes single-element inputs (and any list with no adjacent duplicates) to return `0` instead of `1`, and causes every longer run—including those that extend to the final index—to be undercounted by one. […]

saída 3433 tok (+3149 pensamento) latência 50.6 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

Qwen3.7 Max passou · 5/5 fields, guidance "withheld"

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" }

saída 1595 tok (+1534 pensamento) latência 26.9 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

Qwen3.7 Max passou · 120 words, 0 banned, 1 question

Introducing Global Prompt Caching for our API gateway. Why pay multiple artificial intelligence vendors for the exact same query? Our new feature intercepts identical requests before they reach external models, serving cached responses instantly. This reduces your monthly bills significantly while dropping latency to near absolute zero. Developers routing traffic between various large language models now share a unified memory layer. When a user asks a repeated question, the gateway retrieves the stored answer, bypassing redundant compute entirely. You maintain complete control over cache expiration and invalidation rules directly through your main configuration dashboard. Stop wasting your expensive tokens on duplicate prompts today. Upgrade your infrastructure right now and watch your operational costs drop while your overall application speed increases.

saída 8147 tok (+8005 pensamento) latência 114.3 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o Qwen3.7 Max em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.7-max",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o Qwen3.7 Max

  • Ele traz uma janela de contexto de 1M tokens, o dobro do limite de preview da geração anterior, e é construído para execução autônoma de longo horizonte abrangendo centenas ou até milhares de etapas, incluindo código e depuração e automação de fluxos de escritório.
  • A própria demonstração dessa afirmação pela Alibaba é uma única sessão rodando cerca de 35 horas ao longo de mais de mil chamadas de ferramentas.
  • Ele foca em entrada de texto com raciocínio profundo e invocação de ferramentas (o nível Plus é onde a visão vive) e retorna até 65.536 tokens de saída, além da maior cota de raciocínio documentada na linha Qwen, dobrada novamente em relação ao Qwen3.6.
  • A orientação de seleção da Alibaba é direta sobre quando gastar com ele: escolha o Max quando você precisa do raciocínio mais forte, e o Plus caso contrário.
  • O raciocínio é híbrido e vem ativado por padrão, desligado com enable_thinking e limitado com thinking_budget, com o trace retornado em reasoning_content e cobrado como saída; note que os snapshots de preview deste modelo são somente thinking e não podem desligá-lo.
  • O controle distintivo da geração é o preserve_thinking, que carrega o raciocínio entre turnos para que a deliberação anterior de um agente continue disponível em vez de ser refeita, e a Alibaba nomeia este modelo entre os poucos que o suportam, o que importa mais aqui do que em qualquer outro lugar, dadas as durações de sessão que ele mira.
  • Function calling, inferência em lote e cache explícito e implícito são suportados; o modo JSON não está listado.
  • A Synthorai coloca o Qwen3.7 Max atrás da sua API compatível com OpenAI para adoção sem atritos.

Perguntas frequentes

A API do Qwen3.7 Max é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $2.5/M de tokens de entrada, só esse crédito já cobre cerca de 49 requisições de ~8K tokens ao Qwen3.7 Max.

Em que o Qwen3.7 Max é melhor?

Contexto de 1M, o dobro do limite de preview anterior; execução de longo horizonte abrangendo milhares de etapas; modelo de agente mais avançado e abrangente até agora. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3.7 Max?

Na Synthorai, o Qwen3.7 Max custa $2.5 por milhão de tokens de entrada e $7.5 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.5/M.

O Qwen3.7 Max suporta cache de prompts?

Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.5/M, contra $2.5/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL explícito: 5 min, reinicia a cada acerto). Guia de cache de prompts →

Como obtenho acesso ao Qwen3.7 Max?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3.7-max" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →