Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

DeepSeek V4 Flash

Lançado em 2026-04-24

chatCódigoChamada de ferramentasRaciocínioCache de prompts

O DeepSeek V4 Flash é o membro rápido e econômico da série open-source DeepSeek-V4: um modelo Mixture-of-Experts com 284B de parâmetros totais e 13B ativados, pré-treinado, como seu irmão maior, em mais de 32T tokens.

Entrada
texto $0.138/M
Saída
texto $0.275/M
Leitura de cache
$0.0028/M
Contexto
1M
vs GPT-4o
~97% mais barato

Benchmarks

Acima da médiaapenas 2 comparáveis
DeepSeek V4 Flash outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
SWE-Bench Pro max
52.6%
GPQA Diamond max
88.1%
APEX-Agents high
19.1%

Publicado pelos fornecedores: Alibaba (Qwen) DeepSeek Google

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$0.138/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$0.275/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.0028/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 393.216

Cache de prompts

Modo automático
Duração sem TTL fixo (limpo quando deixa de ser usado)

Raciocínio

Parâmetro do fornecedor thinking.type + reasoning_effort
Valores aceites thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max)
Valor predefinido enabled, com reasoning_effort high; algumas requisições de agente complexas são definidas automaticamente como max aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content e, em um turno em que o modelo chamou uma ferramenta, ele precisa ser devolvido em todos os turnos seguintes; fora isso, é ignorado. O modo de raciocínio também ignora silenciosamente temperature, top_p, presence_penalty e frequency_penalty. A DeepSeek publica esse padrão para a sua própria API; outras plataformas que hospedam o modelo documentam padrões diferentes, então confirme na plataforma para a qual você é roteado.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto → texto
Parâmetros 284B no total · 13B ativos MoE
Licença MIT
  • MoE de 284B com 13B ativos, contexto de 1M, modos Thinking e Non-Thinking
  • atenção esparsa híbrida, precisão mista FP4+FP8
  • a variante V4 rápida e econômica

conforme documentação oficial da DeepSeek ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

DeepSeek V4 Flash passou · 3 sentences

When reasoning is enabled, the model generates additional "chain-of-thought" tokens internally before producing the final answer, effectively doubling the total token count per request. Since our billing is based on tokens processed, this directly doubled your usage. Additionally, reasoning often requires more expensive model tiers or higher compute resources, further amplifying the cost increase.

saída 154 tok (+85 pensamento) latência 3.1 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

DeepSeek V4 Flash passou · 8/8 cases

The bug is that the function counts the number of consecutive equal **pairs** (i.e., `cur` increments for each `i` where `xs[i] == xs[i-1]`), but it should return the **length** of the longest run. For a run of length `L`, the number of pairs is `L-1`, so the result is always one less than the correct value. This causes the function to return 0 for a single‑element list (expected 1) and to undercount runs that end at the last index (e.g., `[1,1]` returns 1 instead of 2). Additionally, runs of length 1 that are not part of any pair (such as a single element at the end of a list) are never considered because `best` is only updated when a pair is found. […]

saída 2494 tok (+2227 pensamento) latência 19.4 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

DeepSeek V4 Flash passou · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }

saída 1101 tok (+1054 pensamento) latência 10.2 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

DeepSeek V4 Flash passou · 119 words, 0 banned, 1 question

We're thrilled to introduce Prompt Cache, a new feature for our API Gateway that stores prompt responses from any provider. When a user submits a prompt you've already processed, the system returns the cached result instantly—eliminating redundant API calls and reducing latency. This works across OpenAI, Anthropic, Google, and more, with automatic cache invalidation based on your rules. What does this mean for your budget? Fewer API calls directly lower your monthly spend. Additionally, response times drop by up to 80% for cached prompts, improving user experience. Developers can configure cache duration per provider, set TTLs, and bypass cache when needed. The feature is available now in your gateway dashboard. Start saving time and money with Prompt Cache.

saída 2039 tok (+1887 pensamento) latência 15.6 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o DeepSeek V4 Flash em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Sobre o DeepSeek V4 Flash

  • Ele carrega a janela de contexto de 1M tokens da série como padrão, chega ao teto de 384K tokens de saída e suporta os modos non-thinking e thinking, incluindo configurações mais altas de esforço de raciocínio.
  • A DeepSeek destaca inovações de atenção esparsa híbrida que reduzem fortemente o compute de inferência de contexto longo e o custo de KV-cache em relação ao DeepSeek-V3.2, com desempenho de raciocínio se aproximando do V4 Pro a menor preço e latência; as notas de lançamento vão além e dizem que o Flash tem desempenho equivalente ao do Pro em tarefas simples de agente, que é a linha a ler na hora de escolher entre eles: Pro para trabalho intensivo em conhecimento e agêntico difícil, Flash para tudo o que é de alto volume.
  • Ele também é o membro do par com maior concorrência.
  • Mecanicamente, os dois são idênticos de integrar: o mesmo objeto thinking e os mesmos níveis de reasoning_effort, o mesmo campo reasoning_content carregando a chain of thought, a mesma exigência de devolver esse campo nos turnos que chamaram uma ferramenta, a mesma chamada de ferramentas com 128 funções, saída JSON e cache de prefixo automático, e o mesmo empacotamento de precisão mista FP4/FP8.
  • Os pesos têm licença MIT e são publicados no próprio hub de modelos da DeepSeek.
  • A Synthorai serve o DeepSeek V4 Flash pelo seu endpoint compatível com OpenAI, sem mudanças de cliente necessárias.

Perguntas frequentes

A API do DeepSeek V4 Flash é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.138/M de tokens de entrada, só esse crédito já cobre cerca de 905 requisições de ~8K tokens ao DeepSeek V4 Flash.

Em que o DeepSeek V4 Flash é melhor?

MoE de 284B parâmetros com 13B ativados; atenção esparsa híbrida reduz custos de contexto longo; pesos com licença MIT e contexto de 1M tokens. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o DeepSeek V4 Flash?

Na Synthorai, o DeepSeek V4 Flash custa $0.138 por milhão de tokens de entrada e $0.275 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.0028/M.

O DeepSeek V4 Flash suporta cache de prompts?

Sim, automaticamente: prompts servidos pela DeepSeek entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.0028/M, contra $0.138/M sem cache (TTL sem TTL fixo (limpo quando deixa de ser usado)). Guia de cache de prompts →

Como obtenho acesso ao DeepSeek V4 Flash?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="deepseek-v4-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.

O DeepSeek V4 Flash é open source?

Sim, os pesos são publicados sob a MIT License. Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →