Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Qwen3.6 Flash

Lançado em 2026-04-16

chatCódigoChamada de ferramentasVisãoRaciocínioCache de prompts

O Qwen3.6 Flash é o nível rápido e econômico da geração Qwen3.6, que a equipe Qwen enquadrou como um passo “Towards Real World Agents”.

Entrada
texto imagem vídeo $0.25/M
Saída
texto $1.5/M
Leitura de cache
$0.05/M
Contexto
256K
vs GPT-4o
~95% mais barato

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$0.25/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$1.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.05/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 65.536

Cache de prompts

Modo automático + explícito
Prefixo mín. 1.024
Duração explícito: 5 min, reinicia a cada acerto
Custo de escrita 1.25x

Raciocínio

Parâmetro do fornecedor enable_thinking + thinking_budget
Valores aceites enable_thinking true · false; thinking_budget in tokens
Valor predefinido ativado; a série Qwen3.6 Flash é de raciocínio híbrido, com o raciocínio ativado por padrão aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content e é ignorado nos turnos seguintes; o qwen3.6-flash não está entre os modelos que a Alibaba lista como aceitando preserve_thinking, ao contrário do qwen3.6-plus.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto + imagem + vídeo → texto
  • Modelo Flash de visão-linguagem nativo, oficialmente uma atualização significativa em relação ao Qwen3.5-Flash
  • a geração Qwen3.6 adiciona preserve_thinking para carregar o raciocínio entre turnos, mas a Alibaba o lista para qwen3.6-plus e qwen3.6-max-preview, não para este nível Flash

conforme documentação oficial da Alibaba ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

Qwen3.6 Flash passou · 3 sentences

Enabling reasoning mode forces the model to generate multiple internal analysis steps before producing a final answer, effectively doubling the computational effort per request. Because our vendor bills for every token processed—including these hidden reasoning tokens—the increased processing directly multiplied our usage charges by approximately two. This spike reflects a deliberate shift from low-cost, basic outputs to higher-intelligence results that reduce error rates and downstream correction costs, optimizing spend for long-term efficiency.

saída 1231 tok (+1141 pensamento) latência 11.7 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

Qwen3.6 Flash passou · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The original implementation counts matching transitions rather than actual element counts, initializing both accumulators to zero. This causes single-element inputs to bypass the loop entirely and return zero instead of one, while any run of length `k` only increments the counter `k-1` times, consistently undercounting by one. Additionally, resetting `cur` to zero on a mismatch discards the newly started element, losing a potential candidate for the longest run. […]

saída 2724 tok (+2473 pensamento) latência 19.0 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

Qwen3.6 Flash passou · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11.0, "guidance": null } ```

saída 1629 tok (+1564 pensamento) latência 12.0 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

Qwen3.6 Flash passou · 120 words, 0 banned, 1 question

We are pleased to announce PromptCache, a new capability built directly into our enterprise API gateway. This innovation stores frequently used text prompts across all integrated model providers, eliminating redundant transmission costs while accelerating response times. Developers can now configure retention policies, set TTL limits, and monitor cache hit rates through our unified dashboard. System performance improves dramatically when identical queries bypass repeated network hops. Your infrastructure will maintain consistent throughput during peak traffic windows without additional provisioning overhead. Teams deploying multimodal applications benefit from reduced latency across diverse inference endpoints. […]

saída 5005 tok (+4866 pensamento) latência 26.3 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o Qwen3.6 Flash em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.6-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Sobre o Qwen3.6 Flash

  • Em relação ao Qwen3.5, o anúncio oficial da geração destaca código agêntico drasticamente aprimorado, do trabalho de frontend a tarefas em escala de repositório, percepção e precisão de raciocínio multimodais melhores, e uma nova opção preserve_thinking que carrega o conteúdo de raciocínio entre turnos para manter as decisões do agente consistentes reduzindo o uso de tokens.
  • O Flash troca parte da profundidade por menor latência e custo.
  • A própria orientação da Alibaba é começar no nível Plus mais novo e mudar para cá para reduzir gastos mantendo capacidade semelhante, e ela nomeia este modelo para documentos longos e grandes bases de código com base no seu contexto de 1M tokens.
  • Ele é nativamente visão-linguagem, aceitando entrada de imagem e vídeo junto ao texto, retorna até 65.536 tokens de saída e eleva a cota de raciocínio da geração bem acima da do Qwen3.5.
  • O Model Studio lista function calling, ferramentas integradas, saída estruturada, inferência em lote e cache explícito de prompts.
  • Como o resto da sua geração, é um modelo de raciocínio híbrido com o raciocínio ativado por padrão, o oposto da série Qwen3, então uma requisição simples delibera a menos que enable_thinking seja definido como false; thinking_budget limita o gasto, e o trace é retornado em reasoning_content e cobrado como saída.
  • Vale conferir antes de projetar em cima dele: a documentação de raciocínio da Alibaba lista o suporte a preserve_thinking modelo a modelo, e o nível Flash não está entre as entradas nomeadas, então trate o raciocínio entre turnos como um recurso de geração, e não como algo garantido aqui.
  • A Synthorai o serve pelo endpoint compatível com OpenAI.

Perguntas frequentes

A API do Qwen3.6 Flash é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.25/M de tokens de entrada, só esse crédito já cobre cerca de 500 requisições de ~8K tokens ao Qwen3.6 Flash.

Em que o Qwen3.6 Flash é melhor?

Código agêntico aprimorado até o nível de repositório; contexto de 1M para documentos longos e bases de código; troca alguma profundidade por menor latência. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Qwen3.6 Flash?

Na Synthorai, o Qwen3.6 Flash custa $0.25 por milhão de tokens de entrada e $1.5 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.05/M.

O Qwen3.6 Flash suporta cache de prompts?

Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.05/M, contra $0.25/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL explícito: 5 min, reinicia a cada acerto). Guia de cache de prompts →

Como obtenho acesso ao Qwen3.6 Flash?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3.6-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →