O Qwen3.5 Flash é o nível hospedado otimizado para velocidade e custo da geração Qwen3.5, que a equipe Qwen apresentou sob o lema “Towards Native Multimodal Agents”.
- Entrada
- texto imagem vídeo $0.1/M
- Saída
- texto $0.4/M
- Leitura de cache
- $0.029/M
- Contexto
- 1M
- vs GPT-4o
- ~98% mais barato
O preço em contexto
Posição do preço entre 60 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.000.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 65.536 |
Cache de prompts
| Modo | automático + explícito |
|---|---|
| Prefixo mín. | 1.024 |
| Duração | explícito: 5 min, reinicia a cada acerto |
| Custo de escrita | 1.25x |
Raciocínio
| Parâmetro do fornecedor | enable_thinking + thinking_budget |
|---|---|
| Valores aceites | enable_thinking true · false; thinking_budget in tokens |
| Valor predefinido | ativado; a série Qwen3.5 é de raciocínio híbrido, com o raciocínio ativado por padrão aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Comportamento do raciocínio | O trace retorna em reasoning_content; o reasoning_content dos turnos anteriores é ignorado, e nenhum modelo Qwen3.5 está na lista de preserve_thinking. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto + imagem + vídeo → texto |
|---|---|
| Parâmetros | 35B no total · 3B ativos MoE |
- Modelo flash de visão-linguagem nativo (entrada de texto/imagem/vídeo)
- raciocínio híbrido ativado por padrão
- qualidade geral oficialmente posicionada perto do qwen3.5-plus
conforme documentação oficial da Alibaba ↗
Um prompt, medido pelo gateway
Qwen3.5 Flash passou · 3 sentences
Enabling reasoning requires the model to execute multi-step verification internally, which consumes significantly more tokens than a standard query. Since vendor fees are calculated per token processed, this added workload has directly resulted in a doubling of our total monthly expenditure. We view this cost increase as a strategic investment in higher model reliability, which prevents far more expensive errors from occurring downstream.
saída 2010 tok (+1934 pensamento) latência 18.7 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
Qwen3.5 Flash passou · 8/8 cases
The bug stems from two related issues: the function incorrectly initializes its counters and fails to account for runs starting at the beginning or ending at the last element. Specifically, `cur` counts how many consecutive pairs match (transitions) rather than the actual number of items in a run—for example, two equal items yield a `cur` value of 1 instead of 2. Additionally, if the input has fewer than two elements, the loop never executes, causing single-element lists to return 0 instead of 1, and runs that end at the final index may not be fully captured since updates rely on detecting a mismatch or completing the loop. To fix it, initialize `cur` and `best` to 1 (assuming a non-empty input), handle empty inputs explicitly, and ensure every comparison contributes accurately to the actual item count in the current run. […]
saída 1020 tok (+747 pensamento) latência 9.8 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
Qwen3.5 Flash passou · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
saída 3545 tok (+3487 pensamento) latência 33.1 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
Qwen3.5 Flash passou · 120 words, 0 banned, 1 question
We announce our cross platform prompt caching feature in the API Gateway. Storing frequent inputs allows developers to significantly reduce latency and minimize token costs for every request sent through our system. Utilizing OpenAI or Anthropic ensures consistency without repetitive processing fees. Organizations gain better control over spending while maintaining rapid response times for end users globally. Our engineering team ensured compatibility with your existing infrastructure without friction. Can your current setup handle such efficiency improvements effectively? All clients receive immediate access starting today. Update your configuration files now to enable this capability. Join thousands of others optimizing deployment pipelines efficiently. This tool delivers tangible results for scalable applications needing lower overhead costs. […]
saída 10675 tok (+10535 pensamento) latência 80.1 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o Qwen3.5 Flash em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3.5-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3.5-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3.5-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3.5-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o Qwen3.5 Flash
- A geração é construída sobre a arquitetura Qwen3-Next combinando atenção linear com gating (gated linear attention) com Mixture-of-Experts esparso para inferência de alta vazão, e é treinada nativamente para trabalho agêntico: planejamento, chamada de ferramentas e execução em múltiplas etapas.
- O nível hospedado Flash oferece um contexto de 1M tokens por padrão com ferramentas oficiais integradas, e até 65.536 tokens de saída.
- A Alibaba o posiciona como chegando perto do Qwen3.5 Plus em capacidade enquanto responde mais rápido, e a diferença de tamanho por trás disso é pública: o cartão da equipe Qwen para o Qwen3.5-35B-A3B o nomeia como a contraparte aberta deste nível hospedado, um Mixture-of-Experts de 35B de parâmetros ativando cerca de 3B por token, lançado sob Apache 2.0, contra os 397B do Plus.
- Então a escolha entre eles é de capacidade, e não apenas de latência, e o Flash é um que você também pode rodar por conta própria.
- Ele é nativamente visão-linguagem, aceitando entrada de imagem e vídeo junto ao texto e retornando texto.
- O raciocínio inverte o padrão do Qwen3: em toda a geração 3.5 o raciocínio híbrido chega ativado, então as requisições raciocinam a menos que você passe enable_thinking como false, com thinking_budget disponível para limitar o gasto e o trace retornado em reasoning_content.
- Chamada de ferramentas, saída estruturada, inferência em lote e cache explícito de prompts são suportados; chamadas de ferramentas em paralelo são opt-in, e não o padrão.
- A Synthorai o coloca atrás do endpoint compatível com OpenAI padrão para uso drop-in.
Perguntas frequentes
A API do Qwen3.5 Flash é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.1/M de tokens de entrada, só esse crédito já cobre cerca de 1,250 requisições de ~8K tokens ao Qwen3.5 Flash.
Em que o Qwen3.5 Flash é melhor?
Atenção linear com gating e MoE esparso; contexto de 1M tokens por padrão; treinado nativamente para trabalho agêntico. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Qwen3.5 Flash?
Na Synthorai, o Qwen3.5 Flash custa $0.1 por milhão de tokens de entrada e $0.4 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.029/M.
O Qwen3.5 Flash suporta cache de prompts?
Sim: o cache automático vem ativado por padrão, com um modo explícito para economia garantida. Tokens de entrada em cache são cobrados a $0.029/M, contra $0.1/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL explícito: 5 min, reinicia a cada acerto). Guia de cache de prompts →
Como obtenho acesso ao Qwen3.5 Flash?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="qwen3.5-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.