Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3.5 Plus

Lançado em 2026-02-16

chatCódigoRaciocínioChamada de ferramentasVisãoCache de prompts

O Qwen3.5 Plus é o nível hospedado carro-chefe da geração Qwen3.5, o passo da equipe Qwen “Towards Native Multimodal Agents”.

Entrada
texto imagem vídeo $0.4/M
Saída
texto $2.4/M
Leitura de cache
$0.115/M
Contexto
1M
vs GPT-4o
~92% mais barato

Benchmarks

Acima da médiaNenhum melhor49 / 8318 / 83
Qwen3.5 Plus outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
SWE-Bench Pro
50.9%
OSWorld-Verified
62.2%
SecCodeBench
68.3%
MedXpertQA-MM
70%
SkillsBench Avg@5
30%
GPQA Diamond
88.4%
EmbSpatialBench
nenhum outro modelo pontuou mais alto 84.5%
MCP-Atlas
74.2%
Video-MME (w. sub)
87.5%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$0.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$2.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.115/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 65.536

Cache de prompts

Modo automático + explícito
Prefixo mín. 1.024
Duração explícito: 5 min, reinicia a cada acerto
Custo de escrita 1.25x

Raciocínio

Parâmetro do fornecedor enable_thinking + thinking_budget
Valores aceites enable_thinking true · false; thinking_budget in tokens
Valor predefinido ativado; a série Qwen3.5 é de raciocínio híbrido, com o raciocínio ativado por padrão aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content; o reasoning_content dos turnos anteriores é ignorado, e nenhum modelo Qwen3.5 está na lista de preserve_thinking.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto + imagem + vídeo → texto
Parâmetros 397B no total · 17B ativos MoE
  • Contraparte hospedada na nuvem do Qwen3.5-397B-A17B (VLM nativo, atenção linear Gated-Delta + MoE esparso)
  • contexto de 1M tokens por padrão, ferramentas integradas, 201 idiomas
  • raciocínio híbrido ativado por padrão

conforme documentação oficial da Alibaba ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

Qwen3.5 Plus passou · 3 sentences

Enabling reasoning requires the model to generate hidden intermediate steps before answering, which effectively doubles the computational tokens consumed per query. This increase in unit economics is direct, as we are now paying for deeper analytical work rather than simple response generation. The higher spend is justified by improved accuracy, which reduces downstream error correction costs and operational risk.

saída 1903 tok (+1832 pensamento) latência 33.2 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

Qwen3.5 Plus passou · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: best = max(best, cur) cur = 1 return max(best, cur) ``` The bug arises because `cur` and `best` are initialized to 0, which counts matching transitions rather than the actual number of elements, causing single-item runs to incorrectly return 0; furthermore, `best` is only updated inside the loop, so if the longest run extends to the final index, the final value of `cur` is never compared against `best` before the function returns.

saída 5421 tok (+5243 pensamento) latência 93.1 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

Qwen3.5 Plus passou · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

saída 1298 tok (+1240 pensamento) latência 23.0 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

Qwen3.5 Plus passou · 120 words, 0 banned, 1 question

Introducing intelligent prompt caching within our API gateway. This new capability stores frequent requests across multiple AI providers, significantly reducing latency and costs for your applications. Why pay for repeated computations when you can serve stored responses instantly? Our system identifies identical inputs and delivers cached outputs without querying external models every time. This ensures faster performance while maintaining secure privacy standards. Developers can optimize their workflows without complex infrastructure changes. The update is available immediately for enterprise plans. Start saving resources by enabling this feature in your dashboard. We believe this tool will transform how you manage API traffic efficiently. Join thousands of users already benefiting from reduced overhead and improved speed. Your infrastructure really deserves this upgrade today.

saída 6787 tok (+6649 pensamento) latência 116.3 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o Qwen3.5 Plus em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.5-plus",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o Qwen3.5 Plus

  • Construída sobre a arquitetura Qwen3-Next, que combina atenção linear com gating (gated linear attention) com Mixture-of-Experts esparso, a geração usa treinamento multimodal de fusão precoce e enfatiza a capacidade agêntica em raciocínio, código e uso de ferramentas, com modos adaptativos de chamada de ferramentas.
  • O nível hospedado Plus fornece uma janela de contexto de 1M tokens por padrão, adequada a cargas de trabalho de documentos grandes e de agentes de longo horizonte.
  • O cartão da própria equipe Qwen para o Qwen3.5-397B-A17B descreve este nível hospedado como sua versão gerenciada: um Mixture-of-Experts de 397B de parâmetros ativando cerca de 17B por token, publicado abertamente sob Apache 2.0.
  • Isso é cerca de uma ordem de magnitude a mais de capacidade total que o nível Flash, que é a diferença real entre eles, e não a latência sozinha.
  • Os limites servidos chegam a 65.536 tokens de saída com uma grande cota separada de raciocínio, entrada nativa de imagem e vídeo, e cobertura multilíngue que a equipe Qwen coloca em 201 idiomas e dialetos.
  • O raciocínio é híbrido e, ao contrário da geração Qwen3, vem ativado por padrão: passe enable_thinking como false para uma resposta direta, use thinking_budget para limitar quanto ele delibera, e leia o trace no campo separado reasoning_content, onde é cobrado como saída.
  • Ferramentas integradas, function calling, saída estruturada, inferência em lote e cache explícito de prompts completam a superfície, com chamadas de ferramentas em paralelo desligadas a menos que sejam solicitadas.
  • A Synthorai roteia o tráfego do Qwen3.5 Plus pela sua API compatível com OpenAI.

Perguntas frequentes

A API do Qwen3.5 Plus é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.4/M de tokens de entrada, só esse crédito já cobre cerca de 312 requisições de ~8K tokens ao Qwen3.5 Plus.

Em que o Qwen3.5 Plus é melhor?

Treinamento multimodal de fusão precoce; modos adaptativos de chamada de ferramentas; janela de contexto de 1M tokens por padrão. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3.5 Plus?

Na Synthorai, o Qwen3.5 Plus custa $0.4 por milhão de tokens de entrada e $2.4 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.115/M.

O Qwen3.5 Plus suporta cache de prompts?

Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.115/M, contra $0.4/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL explícito: 5 min, reinicia a cada acerto). Guia de cache de prompts →

Como obtenho acesso ao Qwen3.5 Plus?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3.5-plus" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →