Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3.5 Flash

Lançado em 2026-02-24

chatCódigoRaciocínioChamada de ferramentasVisãoCache de prompts

O Qwen3.5 Flash é o nível hospedado otimizado para velocidade e custo da geração Qwen3.5, que a equipe Qwen apresentou sob o lema “Towards Native Multimodal Agents”.

Entrada
texto imagem vídeo $0.1/M
Saída
texto $0.4/M
Leitura de cache
$0.029/M
Contexto
1M
vs GPT-4o
~98% mais barato

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$0.1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$0.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.029/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 65.536

Cache de prompts

Modo automático + explícito
Prefixo mín. 1.024
Duração explícito: 5 min, reinicia a cada acerto
Custo de escrita 1.25x

Raciocínio

Parâmetro do fornecedor enable_thinking + thinking_budget
Valores aceites enable_thinking true · false; thinking_budget in tokens
Valor predefinido ativado; a série Qwen3.5 é de raciocínio híbrido, com o raciocínio ativado por padrão aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content; o reasoning_content dos turnos anteriores é ignorado, e nenhum modelo Qwen3.5 está na lista de preserve_thinking.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto + imagem + vídeo → texto
Parâmetros 35B no total · 3B ativos MoE
  • Modelo flash de visão-linguagem nativo (entrada de texto/imagem/vídeo)
  • raciocínio híbrido ativado por padrão
  • qualidade geral oficialmente posicionada perto do qwen3.5-plus

conforme documentação oficial da Alibaba ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

Qwen3.5 Flash passou · 3 sentences

Enabling reasoning requires the model to execute multi-step verification internally, which consumes significantly more tokens than a standard query. Since vendor fees are calculated per token processed, this added workload has directly resulted in a doubling of our total monthly expenditure. We view this cost increase as a strategic investment in higher model reliability, which prevents far more expensive errors from occurring downstream.

saída 2010 tok (+1934 pensamento) latência 18.7 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

Qwen3.5 Flash passou · 8/8 cases

The bug stems from two related issues: the function incorrectly initializes its counters and fails to account for runs starting at the beginning or ending at the last element. Specifically, `cur` counts how many consecutive pairs match (transitions) rather than the actual number of items in a run—for example, two equal items yield a `cur` value of 1 instead of 2. Additionally, if the input has fewer than two elements, the loop never executes, causing single-element lists to return 0 instead of 1, and runs that end at the final index may not be fully captured since updates rely on detecting a mismatch or completing the loop. To fix it, initialize `cur` and `best` to 1 (assuming a non-empty input), handle empty inputs explicitly, and ensure every comparison contributes accurately to the actual item count in the current run. […]

saída 1020 tok (+747 pensamento) latência 9.8 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

Qwen3.5 Flash passou · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

saída 3545 tok (+3487 pensamento) latência 33.1 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

Qwen3.5 Flash passou · 120 words, 0 banned, 1 question

We announce our cross platform prompt caching feature in the API Gateway. Storing frequent inputs allows developers to significantly reduce latency and minimize token costs for every request sent through our system. Utilizing OpenAI or Anthropic ensures consistency without repetitive processing fees. Organizations gain better control over spending while maintaining rapid response times for end users globally. Our engineering team ensured compatibility with your existing infrastructure without friction. Can your current setup handle such efficiency improvements effectively? All clients receive immediate access starting today. Update your configuration files now to enable this capability. Join thousands of others optimizing deployment pipelines efficiently. This tool delivers tangible results for scalable applications needing lower overhead costs. […]

saída 10675 tok (+10535 pensamento) latência 80.1 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o Qwen3.5 Flash em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.5-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o Qwen3.5 Flash

  • A geração é construída sobre a arquitetura Qwen3-Next combinando atenção linear com gating (gated linear attention) com Mixture-of-Experts esparso para inferência de alta vazão, e é treinada nativamente para trabalho agêntico: planejamento, chamada de ferramentas e execução em múltiplas etapas.
  • O nível hospedado Flash oferece um contexto de 1M tokens por padrão com ferramentas oficiais integradas, e até 65.536 tokens de saída.
  • A Alibaba o posiciona como chegando perto do Qwen3.5 Plus em capacidade enquanto responde mais rápido, e a diferença de tamanho por trás disso é pública: o cartão da equipe Qwen para o Qwen3.5-35B-A3B o nomeia como a contraparte aberta deste nível hospedado, um Mixture-of-Experts de 35B de parâmetros ativando cerca de 3B por token, lançado sob Apache 2.0, contra os 397B do Plus.
  • Então a escolha entre eles é de capacidade, e não apenas de latência, e o Flash é um que você também pode rodar por conta própria.
  • Ele é nativamente visão-linguagem, aceitando entrada de imagem e vídeo junto ao texto e retornando texto.
  • O raciocínio inverte o padrão do Qwen3: em toda a geração 3.5 o raciocínio híbrido chega ativado, então as requisições raciocinam a menos que você passe enable_thinking como false, com thinking_budget disponível para limitar o gasto e o trace retornado em reasoning_content.
  • Chamada de ferramentas, saída estruturada, inferência em lote e cache explícito de prompts são suportados; chamadas de ferramentas em paralelo são opt-in, e não o padrão.
  • A Synthorai o coloca atrás do endpoint compatível com OpenAI padrão para uso drop-in.

Perguntas frequentes

A API do Qwen3.5 Flash é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.1/M de tokens de entrada, só esse crédito já cobre cerca de 1,250 requisições de ~8K tokens ao Qwen3.5 Flash.

Em que o Qwen3.5 Flash é melhor?

Atenção linear com gating e MoE esparso; contexto de 1M tokens por padrão; treinado nativamente para trabalho agêntico. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3.5 Flash?

Na Synthorai, o Qwen3.5 Flash custa $0.1 por milhão de tokens de entrada e $0.4 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.029/M.

O Qwen3.5 Flash suporta cache de prompts?

Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.029/M, contra $0.1/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL explícito: 5 min, reinicia a cada acerto). Guia de cache de prompts →

Como obtenho acesso ao Qwen3.5 Flash?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3.5-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →