Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3.7 Plus

Lançado em 2026-06-01

chatCódigoRaciocínioChamada de ferramentasVisãoCache de prompts

O Qwen3.7 Plus é o cavalo de batalha multimodal da geração Qwen3.7, que a equipe Qwen chama de “The Agent Frontier”.

Entrada
texto imagem vídeo $0.4/M
Saída
texto $1.6/M
Leitura de cache
$0.08/M
Contexto
1M
vs GPT-4o
~92% mais barato

Benchmarks

Acima da médiaNenhum melhor7 / 125 / 12
Qwen3.7 Plus outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
SWE-Bench Pro
57.6%
ScreenSpot-Pro
nenhum outro modelo pontuou mais alto 79%
Humanity's Last Exam no tools
34.7%
MCP-Mark
58.7%
BabyVision
nenhum outro modelo pontuou mais alto 64.7%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$0.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$1.6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.08/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 65.536

Cache de prompts

Modo automático + explícito
Prefixo mín. 1.024
Duração explícito: 5 min, reinicia a cada acerto
Custo de escrita 1.25x

Raciocínio

Parâmetro do fornecedor enable_thinking + thinking_budget + preserve_thinking
Valores aceites enable_thinking true · false; thinking_budget in tokens; preserve_thinking true · false
Valor predefinido ativado; a série Qwen3.7 Plus é de raciocínio híbrido, com o raciocínio ativado por padrão, e preserve_thinking desativado aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content e é descartado nos turnos seguintes, a menos que preserve_thinking seja true, o que o anexa à entrada e o cobra como tokens de entrada.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto + imagem + vídeo → texto
  • Modelo de agente multimodal que unifica visão e linguagem
  • operação unificada de GUI e CLI e capacidade de agente de código oficiais
  • contexto de 1M tokens
  • raciocínio híbrido ativado por padrão

conforme documentação oficial da Alibaba ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

Qwen3.7 Plus passou · 3 sentences

Enabling reasoning requires the model to generate extensive internal "thinking" tokens to process complex logic before delivering a final answer. Because our vendor charges us per token consumed, this hidden computational overhead effectively doubles our output volume for the exact same number of user requests. Consequently, our costs have doubled because we are now paying for the model's increased processing time to achieve higher-quality, more accurate results.

saída 1428 tok (+1345 pensamento) latência 25.2 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

Qwen3.7 Plus passou · 8/8 cases

## Fixed Code ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ## Bug Explanation The function has two related bugs rooted in how it counts run lengths. First, `cur` is initialized to `0` and only incremented on matches, so it counts the number of *transitions* between equal elements rather than the total elements in the run—a run of N identical items only reaches `cur = N − 1`, undercounting by one. This also causes the single-element case to return `0`, since the loop never executes and `cur` never increments. […]

saída 2317 tok (+2005 pensamento) latência 40.5 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

Qwen3.7 Plus passou · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

saída 1807 tok (+1750 pensamento) latência 31.6 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

Qwen3.7 Plus passou · 120 words, 0 banned, 1 question

Introducing PromptCache, our new API gateway feature designed to store and reuse prompts across multiple artificial intelligence providers. Have you ever noticed how repeatedly sending identical queries drains your budget and increases latency? PromptCache solves this by intelligently storing responses at the gateway level. When your application requests the same prompt from a different provider, the system instantly returns the cached result. This drastically reduces API costs and accelerates response times for your users. You can configure custom expiration times and set specific fallback rules for each vendor. You must stop paying twice for the exact same computation. Please upgrade your entire infrastructure today and experience much faster and cheaper integrations without changing a single line of your application code.

saída 4453 tok (+4312 pensamento) latência 76.8 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o Qwen3.7 Plus em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.7-plus",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o Qwen3.7 Plus

  • Ele estende a espinha dorsal agêntica da geração com entendimento de imagem e vídeo mantendo raciocínio profundo, força em código e invocação de ferramentas, e carrega uma janela de contexto de 1M tokens para sessões de longo horizonte.
  • Posicionado como o irmão equilibrado e de menor custo do Qwen3.7 Max, ele aceita entrada de texto e visual e retorna texto, o que o torna adequado a agentes cientes de tela e a fluxos de documentos.
  • A Alibaba o descreve percebendo cenas do mundo real, lendo uma tela e operando a GUI, gerando código a partir de uma referência visual e navegando um aplicativo móvel de ponta a ponta.
  • Ele é também o nível que a Alibaba recomenda por padrão em toda a sua linha, por desempenho e custo equilibrados, com chamada de ferramentas completa e contexto suficiente para uma grande base de código.
  • Os limites de entrada documentados são incomumente concretos: até 2.048 imagens ou 64 vídeos em uma requisição, com vídeo de até duas horas e 2 GB, e saída de até 65.536 tokens.
  • O raciocínio é híbrido e vem ligado por padrão, desativado por requisição com enable_thinking, limitado com thinking_budget e retornado separadamente em reasoning_content, onde é cobrado como saída; como o carro-chefe, ele é um dos modelos que a Alibaba documenta como suportando preserve_thinking, carregando o raciocínio entre turnos para que execuções de agente em múltiplas etapas permaneçam consistentes sem refazer decisões anteriores.
  • Saída estruturada, function calling, ferramentas integradas, inferência em lote e ambos os modos de cache estão listados para ele.
  • A Synthorai o serve pelo endpoint compatível com OpenAI.

Perguntas frequentes

A API do Qwen3.7 Plus é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.4/M de tokens de entrada, só esse crédito já cobre cerca de 312 requisições de ~8K tokens ao Qwen3.7 Plus.

Em que o Qwen3.7 Plus é melhor?

Adiciona entendimento de imagem e vídeo; irmão balanceado e de menor custo do carro-chefe; adequado a agentes cientes de tela e a documentos. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3.7 Plus?

Na Synthorai, o Qwen3.7 Plus custa $0.4 por milhão de tokens de entrada e $1.6 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.08/M.

O Qwen3.7 Plus suporta cache de prompts?

Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.08/M, contra $0.4/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL explícito: 5 min, reinicia a cada acerto). Guia de cache de prompts →

Como obtenho acesso ao Qwen3.7 Plus?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3.7-plus" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →