O DeepSeek V4 Flash é o membro rápido e econômico da série open-source DeepSeek-V4: um modelo Mixture-of-Experts com 284B de parâmetros totais e 13B ativados, pré-treinado, como seu irmão maior, em mais de 32T tokens.
- Entrada
- texto $0.138/M
- Saída
- texto $0.275/M
- Leitura de cache
- $0.0028/M
- Contexto
- 1M
- vs GPT-4o
- ~97% mais barato
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) DeepSeek Google
O preço em contexto
Posição do preço entre 60 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.000.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 393.216 |
Cache de prompts
| Modo | automático |
|---|---|
| Duração | sem TTL fixo (limpo quando deixa de ser usado) |
Raciocínio
| Parâmetro do fornecedor | thinking.type + reasoning_effort |
|---|---|
| Valores aceites | thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max) |
| Valor predefinido | enabled, com reasoning_effort high; algumas requisições de agente complexas são definidas automaticamente como max aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Comportamento do raciocínio | O trace retorna em reasoning_content e, em um turno em que o modelo chamou uma ferramenta, ele precisa ser devolvido em todos os turnos seguintes; fora isso, é ignorado. O modo de raciocínio também ignora silenciosamente temperature, top_p, presence_penalty e frequency_penalty. A DeepSeek publica esse padrão para a sua própria API; outras plataformas que hospedam o modelo documentam padrões diferentes, então confirme na plataforma para a qual você é roteado. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parâmetros | 284B no total · 13B ativos MoE |
| Licença | MIT |
- MoE de 284B com 13B ativos, contexto de 1M, modos Thinking e Non-Thinking
- atenção esparsa híbrida, precisão mista FP4+FP8
- a variante V4 rápida e econômica
conforme documentação oficial da DeepSeek ↗
Um prompt, medido pelo gateway
DeepSeek V4 Flash passou · 3 sentences
When reasoning is enabled, the model generates additional "chain-of-thought" tokens internally before producing the final answer, effectively doubling the total token count per request. Since our billing is based on tokens processed, this directly doubled your usage. Additionally, reasoning often requires more expensive model tiers or higher compute resources, further amplifying the cost increase.
saída 154 tok (+85 pensamento) latência 3.1 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
DeepSeek V4 Flash passou · 8/8 cases
The bug is that the function counts the number of consecutive equal **pairs** (i.e., `cur` increments for each `i` where `xs[i] == xs[i-1]`), but it should return the **length** of the longest run. For a run of length `L`, the number of pairs is `L-1`, so the result is always one less than the correct value. This causes the function to return 0 for a single‑element list (expected 1) and to undercount runs that end at the last index (e.g., `[1,1]` returns 1 instead of 2). Additionally, runs of length 1 that are not part of any pair (such as a single element at the end of a list) are never considered because `best` is only updated when a pair is found. […]
saída 2494 tok (+2227 pensamento) latência 19.4 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
DeepSeek V4 Flash passou · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }
saída 1101 tok (+1054 pensamento) latência 10.2 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
DeepSeek V4 Flash passou · 119 words, 0 banned, 1 question
We're thrilled to introduce Prompt Cache, a new feature for our API Gateway that stores prompt responses from any provider. When a user submits a prompt you've already processed, the system returns the cached result instantly—eliminating redundant API calls and reducing latency. This works across OpenAI, Anthropic, Google, and more, with automatic cache invalidation based on your rules. What does this mean for your budget? Fewer API calls directly lower your monthly spend. Additionally, response times drop by up to 80% for cached prompts, improving user experience. Developers can configure cache duration per provider, set TTLs, and bypass cache when needed. The feature is available now in your gateway dashboard. Start saving time and money with Prompt Cache.
saída 2039 tok (+1887 pensamento) latência 15.6 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o DeepSeek V4 Flash em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o DeepSeek V4 Flash
- Ele carrega a janela de contexto de 1M tokens da série como padrão, chega ao teto de 384K tokens de saída e suporta os modos non-thinking e thinking, incluindo configurações mais altas de esforço de raciocínio.
- A DeepSeek destaca inovações de atenção esparsa híbrida que reduzem fortemente o compute de inferência de contexto longo e o custo de KV-cache em relação ao DeepSeek-V3.2, com desempenho de raciocínio se aproximando do V4 Pro a menor preço e latência; as notas de lançamento vão além e dizem que o Flash tem desempenho equivalente ao do Pro em tarefas simples de agente, que é a linha a ler na hora de escolher entre eles: Pro para trabalho intensivo em conhecimento e agêntico difícil, Flash para tudo o que é de alto volume.
- Ele também é o membro do par com maior concorrência.
- Mecanicamente, os dois são idênticos de integrar: o mesmo objeto thinking e os mesmos níveis de reasoning_effort, o mesmo campo reasoning_content carregando a chain of thought, a mesma exigência de devolver esse campo nos turnos que chamaram uma ferramenta, a mesma chamada de ferramentas com 128 funções, saída JSON e cache de prefixo automático, e o mesmo empacotamento de precisão mista FP4/FP8.
- Os pesos têm licença MIT e são publicados no próprio hub de modelos da DeepSeek.
- A Synthorai serve o DeepSeek V4 Flash pelo seu endpoint compatível com OpenAI, sem mudanças de cliente necessárias.
Perguntas frequentes
A API do DeepSeek V4 Flash é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.138/M de tokens de entrada, só esse crédito já cobre cerca de 905 requisições de ~8K tokens ao DeepSeek V4 Flash.
Em que o DeepSeek V4 Flash é melhor?
MoE de 284B parâmetros com 13B ativados; atenção esparsa híbrida reduz custos de contexto longo; pesos com licença MIT e contexto de 1M tokens. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o DeepSeek V4 Flash?
Na Synthorai, o DeepSeek V4 Flash custa $0.138 por milhão de tokens de entrada e $0.275 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.0028/M.
O DeepSeek V4 Flash suporta cache de prompts?
Sim, automaticamente: prompts servidos pela DeepSeek entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.0028/M, contra $0.138/M sem cache (TTL sem TTL fixo (limpo quando deixa de ser usado)). Guia de cache de prompts →
Como obtenho acesso ao DeepSeek V4 Flash?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="deepseek-v4-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.
O DeepSeek V4 Flash é open source?
Sim, os pesos são publicados sob a MIT License. Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.