DeepSeek V4 Pro 0813 é a versão de agosto de 2026 da linha principal V4 Pro da DeepSeek, e o cartão do modelo a apresenta como substituta da versão preliminar, e não como uma variante colocada ao lado dela.
- Entrada
- texto $1.32/M
- Saída
- texto $3.96/M
- Leitura de cache
- $0.132/M
- Contexto
- 1M
- vs GPT-4o
- ~74% mais barato
Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing. Entrada efetiva com taxa de acerto de cache de 70%:$0.4884/M. Cache automático de prefixo KV em disco: os acertos de cache são cobrados à taxa de leitura de cache com desconto, sem opt-in e sem taxa de gravação. Essa tarifa de leitura em cache é publicada como um valor por milhão próprio. Sem custo em separado para uma escrita em cache.
Preço · posição entre 62 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.000.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 393.216 |
Cache de prompts
| Modo | automático |
|---|---|
| Duração | sem TTL fixo (limpo quando deixa de ser usado) |
Raciocínio
| Parâmetro do fornecedor | reasoning_effort |
|---|---|
| Valores aceites | the model card documents low · high · max |
| Comportamento do raciocínio | The trace returns in reasoning_content and on short prompts can account for the large majority of the completion tokens, so a tight max_tokens budget returns an empty answer that is still billed in full. DeepSeek documents three effort levels for its own API; platforms that host the model may accept a different set, so confirm against the platform you are routed to. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway — aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto → texto |
|---|---|
| Licença | MIT |
August 2026 release of DeepSeek V4 Pro, superseding the preview version with what the model card describes as greatly enhanced agentic capabilities, and shipping with a DSpark speculative decoding module attached. The card states neither a parameter count nor an architecture, so neither is listed here.
conforme documentação oficial da DeepSeek ↗
Um prompt, medido pelo gateway
DeepSeek V4 Pro (0813) passou · 3 sentences
Enabling reasoning causes the model to generate a hidden chain-of-thought with many additional tokens before producing the final answer, which sharply increases compute consumption per request. Those extra reasoning tokens are billed at the same or higher rates, so total usage doubled even though the volume of final outputs stayed similar. We can control this by adjusting reasoning effort, setting token limits, or routing only complex requests through reasoning mode.
saída 308 tok (+226 pensamento) latência 5.1 s
Cumprimento da instrução (exatamente três frases — contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
DeepSeek V4 Pro (0813) passou · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` was initialized to `0` and only counted adjacent matching pairs, so a run of length `n` produced `n - 1` (or `0` for a single element) instead of `n`. The code also reset to `0` on a change, when the new run should start at length `1`. Initializing `cur` and `best` to `1` fixes both the single-element case and runs ending at the last index.
saída 1315 tok (+1130 pensamento) latência 16.9 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
DeepSeek V4 Pro (0813) passou · 5/5 fields, guidance null
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":null}
saída 2155 tok (+2121 pensamento) latência 26.0 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
DeepSeek V4 Pro (0813) passou · 121 words, 0 banned, 1 question
Introducing cross-provider prompt caching in our API gateway. Send a prompt once, and the gateway stores its computed prefix across Anthropic, OpenAI, and other LLM providers. Subsequent requests with the same prompt hit the cache, cutting latency and token costs while keeping outputs consistent across routing decisions and provider failovers. Teams can route identical prompts between providers without reprocessing shared context or lengthy system instructions. How much could you save on repeated prompt prefixes? The cache respects provider-specific key formats, handles TTLs automatically, and works with streaming and batch requests. Enable it with one configuration flag—no changes to your application code. Available today on all plans. Monitor cache hit rates, token savings, and provider-specific performance metrics in the live dashboard.
saída 2845 tok (+2694 pensamento) latência 25.5 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o DeepSeek V4 Pro (0813) em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro-0813",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro-0813",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro-0813",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro-0813",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro-0813")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o DeepSeek V4 Pro (0813)
- A DeepSeek atribui a mudança a capacidades agênticas bastante reforçadas e a ganhos de desempenho que descreve como especialmente pronunciados em produção; a versão traz ainda um módulo de decodificação especulativa DSpark.
- O cartão é excepcionalmente econômico em especificações: não indica nem a contagem de parâmetros nem a arquitetura, de modo que qualquer número herdado da V4 Pro anterior deve ser tratado como não confirmado para esta versão.
- O que ele de fato declara é o envelope operacional: pesos sob licença MIT, um comprimento máximo de saída recomendado de 384K tokens nos níveis mais altos de esforço de raciocínio e um parâmetro reasoning_effort documentado em três níveis, low, high e max.
- O que precisa ser planejado é o raciocínio.
- O rastro volta em reasoning_content e, em prompts curtos, pode responder pela grande maioria dos tokens de saída, de forma que um orçamento de max_tokens apertado demais devolverá uma resposta vazia que ainda assim é cobrada integralmente pelos tokens gastos pensando.
- Reserve essa folga, ou reduza o nível de esforço, antes de ligá-lo a um caminho sensível a latência.
- O custo do esforço não para na saída: subir de nível alonga o preâmbulo do qual o modelo parte, então a mesma mensagem cobra mais tokens de entrada num ajuste alto do que num baixo.
- O modelo é somente texto tanto na entrada quanto na saída; entrada de imagem não é suportada, portanto combine-o com um modelo de visão em vez de enviar mensagens multimodais.
- Como tanto a versão datada quanto o nome contínuo permanecem chamáveis, fixe o id com data quando precisar de comportamento reproduzível e conte que o nome sem data avance com o tempo.
- A Synthorai o serve pelo endpoint chat completions compatível com OpenAI, sem mudanças no cliente.
Perguntas frequentes
A API do DeepSeek V4 Pro (0813) é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $1.32/M de tokens de entrada, só esse crédito já cobre cerca de 94 requisições de ~8K tokens ao DeepSeek V4 Pro (0813).
Em que o DeepSeek V4 Pro (0813) é melhor?
Substitui a prévia da V4 Pro; licença MIT, saída máxima recomendada de 384K; reasoning_effort documentado em low, high e max. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o DeepSeek V4 Pro (0813)?
Na Synthorai, o DeepSeek V4 Pro (0813) custa $1.32 por milhão de tokens de entrada e $3.96 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.132/M.
O DeepSeek V4 Pro (0813) suporta cache de prompts?
Sim, automaticamente: prompts servidos pela DeepSeek entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.132/M, contra $1.32/M sem cache (TTL sem TTL fixo (limpo quando deixa de ser usado)). Guia de cache de prompts →
Como obtenho acesso ao DeepSeek V4 Pro (0813)?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="deepseek-v4-pro-0813" e pronto. Uma única chave de API cobre todos os modelos do gateway.
O DeepSeek V4 Pro (0813) é open source?
Sim, os pesos são publicados sob a MIT License (repositório oficial com link na seção Sobre). Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.