O DeepSeek V4 Pro é o carro-chefe da série open-source DeepSeek-V4: um modelo Mixture-of-Experts com 1,6T de parâmetros totais e 49B ativados, pré-treinado em mais de 32T tokens.
- Entrada
- texto $1.32/M
- Saída
- texto $3.96/M
- Leitura de cache
- $0.132/M
- Contexto
- 1M
- vs GPT-4o
- ~74% mais barato
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) Anthropic DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
O preço em contexto
Posição do preço entre 60 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.000.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 393.216 |
Cache de prompts
| Modo | automático |
|---|---|
| Duração | sem TTL fixo (limpo quando deixa de ser usado) |
Raciocínio
| Parâmetro do fornecedor | thinking.type + reasoning_effort |
|---|---|
| Valores aceites | thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max) |
| Valor predefinido | enabled, com reasoning_effort high; algumas requisições de agente complexas são definidas automaticamente como max aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Comportamento do raciocínio | O trace retorna em reasoning_content e, em um turno em que o modelo chamou uma ferramenta, ele precisa ser devolvido em todos os turnos seguintes; fora isso, é ignorado. O modo de raciocínio também ignora silenciosamente temperature, top_p, presence_penalty e frequency_penalty. A DeepSeek publica esse padrão para a sua própria API; outras plataformas que hospedam o modelo documentam padrões diferentes, então confirme na plataforma para a qual você é roteado. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parâmetros | 1.6T no total · 49B ativos MoE |
| Licença | MIT |
- Carro-chefe MoE de 1,6T com 49B ativos, contexto de 1M, modos Thinking e Non-Thinking
- a atenção esparsa híbrida reduz os FLOPs de um único token para 27% e o cache KV para 10% em relação ao V3.2 com contexto de 1M
conforme documentação oficial da DeepSeek ↗
Um prompt, medido pelo gateway
DeepSeek V4 Pro passou · 3 sentences
Enabling reasoning causes the model to generate a lengthy internal chain‑of‑thought before it delivers a visible answer, and we are billed for every one of those hidden reasoning tokens just as we are for the final output. In most interactions, the volume of these unseen tokens at least equals the visible response, effectively doubling the total tokens consumed per query. That doubled token consumption translates directly into a doubled per‑query cost, which is why our overall LLM bill doubled.
saída 641 tok (+545 pensamento) latência 11.5 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
DeepSeek V4 Pro passou · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `cur = 0` and only incrementing it when two adjacent elements match, which counts the number of *additional* equal elements rather than the actual run length (which is `cur + 1`). As a result, the returned `best` is always one less than the true longest run—most obviously returning 0 for a single-element list instead of 1. […]
saída 2418 tok (+2131 pensamento) latência 35.6 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
DeepSeek V4 Pro passou · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": "eleven and change", "guidance": null }
saída 1204 tok (+1153 pensamento) latência 19.9 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
DeepSeek V4 Pro sem resposta para avaliar · no answer text within 16,384 tokens (all of it went to thinking)
O modelo não retornou nenhum texto de resposta - todo o orçamento de tokens foi para o pensamento oculto.
saída 8193 tok (+8192 pensamento) latência 106.2 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o DeepSeek V4 Pro em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o DeepSeek V4 Pro
- Ele suporta uma janela de contexto de 1M tokens e modos duais thinking/non-thinking, e a DeepSeek destaca forte código agêntico, amplo conhecimento de mundo e raciocínio em matemática, STEM e programação.
- O cartão do modelo nomeia as peças por trás disso: um stack de atenção híbrida que combina Compressed Sparse Attention com Heavily Compressed Attention, Manifold-Constrained Hyper-Connections e o otimizador Muon, com os pesos dos especialistas do MoE mantidos em FP4 e a maior parte dos demais parâmetros em FP8.
- Novos designs de atenção esparsa reduzem os FLOPs de inferência de contexto longo e o KV cache a uma fração dos do DeepSeek-V3.2.
- O raciocínio é um parâmetro de requisição em vez de um nome de modelo separado: um objeto thinking o liga ou desliga, uma configuração reasoning_effort seleciona os comportamentos documentados Non-think, Think High e Think Max, e a chain of thought volta em reasoning_content ao lado da resposta.
- O guia da DeepSeek acrescenta uma regra que vale programar: em qualquer turno em que o modelo chamou uma ferramenta, o reasoning_content daquele turno precisa ser devolvido nos turnos seguintes.
- Function calling e saída JSON funcionam com o raciocínio ativado, a saída vai até 384K tokens e o cache de prefixo é automático.
- Os pesos são liberados abertamente sob a licença MIT.
- Na Synthorai, o DeepSeek V4 Pro está disponível pelo endpoint de chat completions compatível com OpenAI.
Perguntas frequentes
A API do DeepSeek V4 Pro é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $1.32/M de tokens de entrada, só esse crédito já cobre cerca de 94 requisições de ~8K tokens ao DeepSeek V4 Pro.
Em que o DeepSeek V4 Pro é melhor?
MoE de 1,6T parâmetros com 49B ativados; pré-treinado em mais de 32T tokens; contexto de 1M com modos duais de raciocínio. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o DeepSeek V4 Pro?
Na Synthorai, o DeepSeek V4 Pro custa $1.32 por milhão de tokens de entrada e $3.96 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.132/M.
O DeepSeek V4 Pro suporta cache de prompts?
Sim, automaticamente: prompts servidos pela DeepSeek entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.132/M, contra $1.32/M sem cache (TTL sem TTL fixo (limpo quando deixa de ser usado)). Guia de cache de prompts →
Como obtenho acesso ao DeepSeek V4 Pro?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="deepseek-v4-pro" e pronto. Uma única chave de API cobre todos os modelos do gateway.
O DeepSeek V4 Pro é open source?
Sim, os pesos são publicados sob a MIT License (repositório oficial com link na seção Sobre). Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.