O Qwen3.7 Max é o carro-chefe da geração “Agent Frontier” da equipe Qwen, descrito pela Alibaba como seu modelo de agente mais avançado e abrangente até hoje.
- Entrada
- texto $2.5/M
- Saída
- texto $7.5/M
- Leitura de cache
- $0.5/M
- Contexto
- 1M
- vs GPT-4o
- ~50% mais barato
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
O preço em contexto
Posição do preço entre 60 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.000.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 65.536 |
Cache de prompts
| Modo | automático + explícito |
|---|---|
| Prefixo mín. | 1.024 |
| Duração | explícito: 5 min, reinicia a cada acerto |
| Custo de escrita | 1.25x |
Raciocínio
| Parâmetro do fornecedor | enable_thinking + thinking_budget + preserve_thinking |
|---|---|
| Valores aceites | enable_thinking true · false; thinking_budget in tokens; preserve_thinking true · false |
| Valor predefinido | ativado; a série Qwen3.7 Max é de raciocínio híbrido, com o raciocínio ativado por padrão, e preserve_thinking desativado aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Comportamento do raciocínio | O trace retorna em reasoning_content e é descartado nos turnos seguintes, a menos que preserve_thinking seja true; os snapshots qwen3.7-max-preview são exclusivamente de raciocínio e não podem desativá-lo. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto → texto |
|---|
- Carro-chefe "Agent Frontier": apenas texto, raciocínio ativado por padrão, contexto de 1M tokens
- criado para execuções autônomas de agente de longo horizonte (sessão de 35 horas com 1.158 chamadas de ferramentas demonstrada oficialmente)
- não listado para o modo JSON
conforme documentação oficial da Alibaba ↗
Um prompt, medido pelo gateway
Qwen3.7 Max passou · 3 sentences
Enabling reasoning requires the model to generate extensive, step-by-step internal logic before delivering a final answer, drastically increasing our consumption of premium-priced output tokens. Because AI providers charge significantly higher rates for generated text than for input prompts, this surge in behind-the-scenes computation directly multiplied our baseline API costs. However, this increased spend delivers a strong ROI by successfully automating complex workflows that previously required expensive human intervention.
saída 1700 tok (+1613 pensamento) latência 28.9 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
Qwen3.7 Max passou · 8/8 cases
## Fixed Function ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` ## Explanation The bug is that `cur` and `best` are initialized to `0`, which makes the function count adjacent equal **pairs** (transitions) rather than the number of **elements** in a run. A run of *n* consecutive equal items contains only *n − 1* adjacent pairs, so the reported length is always one less than the true length. This causes single-element inputs (and any list with no adjacent duplicates) to return `0` instead of `1`, and causes every longer run—including those that extend to the final index—to be undercounted by one. […]
saída 3433 tok (+3149 pensamento) latência 50.6 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
Qwen3.7 Max passou · 5/5 fields, guidance "withheld"
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" }
saída 1595 tok (+1534 pensamento) latência 26.9 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
Qwen3.7 Max passou · 120 words, 0 banned, 1 question
Introducing Global Prompt Caching for our API gateway. Why pay multiple artificial intelligence vendors for the exact same query? Our new feature intercepts identical requests before they reach external models, serving cached responses instantly. This reduces your monthly bills significantly while dropping latency to near absolute zero. Developers routing traffic between various large language models now share a unified memory layer. When a user asks a repeated question, the gateway retrieves the stored answer, bypassing redundant compute entirely. You maintain complete control over cache expiration and invalidation rules directly through your main configuration dashboard. Stop wasting your expensive tokens on duplicate prompts today. Upgrade your infrastructure right now and watch your operational costs drop while your overall application speed increases.
saída 8147 tok (+8005 pensamento) latência 114.3 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o Qwen3.7 Max em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.7-max",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.7-max",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.7-max",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.7-max",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.7-max")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o Qwen3.7 Max
- Ele traz uma janela de contexto de 1M tokens, o dobro do limite de preview da geração anterior, e é construído para execução autônoma de longo horizonte abrangendo centenas ou até milhares de etapas, incluindo código e depuração e automação de fluxos de escritório.
- A própria demonstração dessa afirmação pela Alibaba é uma única sessão rodando cerca de 35 horas ao longo de mais de mil chamadas de ferramentas.
- Ele foca em entrada de texto com raciocínio profundo e invocação de ferramentas (o nível Plus é onde a visão vive) e retorna até 65.536 tokens de saída, além da maior cota de raciocínio documentada na linha Qwen, dobrada novamente em relação ao Qwen3.6.
- A orientação de seleção da Alibaba é direta sobre quando gastar com ele: escolha o Max quando você precisa do raciocínio mais forte, e o Plus caso contrário.
- O raciocínio é híbrido e vem ativado por padrão, desligado com enable_thinking e limitado com thinking_budget, com o trace retornado em reasoning_content e cobrado como saída; note que os snapshots de preview deste modelo são somente thinking e não podem desligá-lo.
- O controle distintivo da geração é o preserve_thinking, que carrega o raciocínio entre turnos para que a deliberação anterior de um agente continue disponível em vez de ser refeita, e a Alibaba nomeia este modelo entre os poucos que o suportam, o que importa mais aqui do que em qualquer outro lugar, dadas as durações de sessão que ele mira.
- Function calling, inferência em lote e cache explícito e implícito são suportados; o modo JSON não está listado.
- A Synthorai coloca o Qwen3.7 Max atrás da sua API compatível com OpenAI para adoção sem atritos.
Perguntas frequentes
A API do Qwen3.7 Max é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $2.5/M de tokens de entrada, só esse crédito já cobre cerca de 49 requisições de ~8K tokens ao Qwen3.7 Max.
Em que o Qwen3.7 Max é melhor?
Contexto de 1M, o dobro do limite de preview anterior; execução de longo horizonte abrangendo milhares de etapas; modelo de agente mais avançado e abrangente até agora. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Qwen3.7 Max?
Na Synthorai, o Qwen3.7 Max custa $2.5 por milhão de tokens de entrada e $7.5 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.5/M.
O Qwen3.7 Max suporta cache de prompts?
Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.5/M, contra $2.5/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL explícito: 5 min, reinicia a cada acerto). Guia de cache de prompts →
Como obtenho acesso ao Qwen3.7 Max?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3.7-max" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.