DeepSeek V4 Pro 0813 è la release di agosto 2026 della linea di punta V4 Pro di DeepSeek, e la scheda del modello la presenta come sostituta della versione preliminare anziché come una variante affiancata.
- Input
- testo $1.32/M
- Output
- testo $3.96/M
- Lettura cache
- $0.132/M
- Contesto
- 1M
- vs GPT-4o
- ~74% più economico
Benchmark
Dati pubblicati dai provider: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo a confronto
Dove si colloca il prezzo tra 68 modelli confrontabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del provider) | 1.000.000 |
|---|---|
| Output massimo (specifica del provider) | 393.216 |
Prompt caching
| Modalità | automatico |
|---|---|
| Durata | nessun TTL fisso (svuotata quando non viene più usata) |
Ragionamento
| Parametro del provider | reasoning_effort |
|---|---|
| Valori accettati | the model card documents low · high · max |
| Comportamento del ragionamento | The trace returns in reasoning_content and on short prompts can account for the large majority of the completion tokens, so a tight max_tokens budget returns an empty answer that is still billed in full. DeepSeek documents three effort levels for its own API; platforms that host the model may accept a different set, so confirm against the platform you are routed to. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high parametri esposti dal gateway: vale la mappatura del provider indicata sopra |
Modello
| Modalità | testo → testo |
|---|---|
| Licenza | MIT |
August 2026 release of DeepSeek V4 Pro, superseding the preview version with what the model card describes as greatly enhanced agentic capabilities, and shipping with a DSpark speculative decoding module attached. The card states neither a parameter count nor an architecture, so neither is listed here.
Un solo prompt, misurato attraverso il gateway
DeepSeek V4 Pro (0813) superato · 3 sentences
Enabling reasoning causes the model to generate a hidden chain-of-thought with many additional tokens before producing the final answer, which sharply increases compute consumption per request. Those extra reasoning tokens are billed at the same or higher rates, so total usage doubled even though the volume of final outputs stayed similar. We can control this by adjusting reasoning effort, setting token limits, or routing only complex requests through reasoning mode.
out 308 tok (+226 ragionamento) latenza 5.1 s
Rispetto delle istruzioni (esattamente tre frasi: si contano), adattamento al destinatario (registro da CFO) e lo scarto di fatturazione dovuto al ragionamento nascosto, che i contatori di token qui sotto mettono in luce.
DeepSeek V4 Pro (0813) superato · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` was initialized to `0` and only counted adjacent matching pairs, so a run of length `n` produced `n - 1` (or `0` for a single element) instead of `n`. The code also reset to `0` on a change, when the new run should start at length `1`. Initializing `cur` and `best` to `1` fixes both the single-element case and runs ending at the last index.
out 1315 tok (+1130 ragionamento) latenza 16.9 s
Se la correzione è davvero giusta (si può eseguire), quanto è densa la spiegazione e quanti token servono per un compito circoscritto.
DeepSeek V4 Pro (0813) superato · 5/5 fields, guidance null
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":null}
out 2155 tok (+2121 ragionamento) latenza 26.0 s
Aderenza allo schema (nessun campo inventato), tentazione di allucinare (il testo dice espressamente che la guidance non viene comunicata) e differenze tra i percorsi di output strutturato.
DeepSeek V4 Pro (0813) superato · 121 words, 0 banned, 1 question
Introducing cross-provider prompt caching in our API gateway. Send a prompt once, and the gateway stores its computed prefix across Anthropic, OpenAI, and other LLM providers. Subsequent requests with the same prompt hit the cache, cutting latency and token costs while keeping outputs consistent across routing decisions and provider failovers. Teams can route identical prompts between providers without reprocessing shared context or lengthy system instructions. How much could you save on repeated prompt prefixes? The cache respects provider-specific key formats, handles TTLs automatically, and works with streaming and batch requests. Enable it with one configuration flag—no changes to your application code. Available today on all plans. Monitor cache hit rates, token savings, and provider-specific performance metrics in the live dashboard.
out 2845 tok (+2694 ragionamento) latenza 25.5 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica e controllo della lunghezza.
Usa DeepSeek V4 Pro (0813) in 30 secondi
Compatibile con OpenAI: cambi base_url e tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro-0813",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro-0813",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro-0813",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro-0813",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro-0813")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su DeepSeek V4 Pro (0813)
- DeepSeek attribuisce il cambiamento a capacità agentiche nettamente potenziate e a miglioramenti prestazionali che descrive come particolarmente evidenti in produzione; la release include inoltre un modulo di decodifica speculativa DSpark.
- La scheda è insolitamente avara di specifiche: non indica né il numero di parametri né l'architettura, quindi ogni cifra ereditata dalla V4 Pro precedente va considerata non confermata per questa release.
- Ciò che invece dichiara è l'ambito operativo: pesi con licenza MIT, una lunghezza massima di output consigliata di 384K token ai livelli più alti di sforzo di ragionamento e un parametro reasoning_effort documentato su tre livelli, low, high e max.
- È il ragionamento la parte da pianificare.
- La traccia torna in reasoning_content e, su prompt brevi, può rappresentare la grande maggioranza dei token di output: un budget max_tokens troppo stretto restituirà quindi una risposta vuota, comunque fatturata per intero per i token spesi a ragionare.
- Prevedete quel margine, o abbassate il livello di sforzo, prima di inserirlo in un percorso sensibile alla latenza.
- Il costo dello sforzo non si ferma all'output: salire di livello allunga il preambolo da cui il modello parte, così lo stesso messaggio fattura più token di input con un'impostazione alta che con una bassa.
- Il modello è solo testo sia in ingresso sia in uscita; l'input immagine non è supportato, quindi abbinatelo a un modello di visione invece di inviare messaggi multimodali.
- Poiché sia la release datata sia il nome continuo restano invocabili, fissate l'id datato quando serve un comportamento riproducibile e aspettatevi che il nome senza data avanzi nel tempo.
- Synthorai lo eroga tramite l'endpoint chat completions compatibile con OpenAI, senza modifiche lato client.
FAQ
L'API di DeepSeek V4 Pro (0813) si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza bisogno di carta. A $1.32/M per i token di input, quel credito basta da solo per circa 94 richieste da ~8K token a DeepSeek V4 Pro (0813).
In cosa eccelle DeepSeek V4 Pro (0813)?
Sostituisce la preview di V4 Pro; licenza MIT, output massimo consigliato di 384K; reasoning_effort documentato su low, high e max. Il quadro completo è nella sezione «Informazioni», ripreso dalle note di rilascio ufficiali del provider.
Quanto costa DeepSeek V4 Pro (0813)?
Su Synthorai DeepSeek V4 Pro (0813) costa $1.32 per milione di token di input e $3.96 per milione di token di output: è il prezzo di listino del provider, senza sovrapprezzo di piattaforma. I token di input letti dalla cache costano $0.132/M.
DeepSeek V4 Pro (0813) supporta il prompt caching?
Sì, in automatico: i prompt serviti da DeepSeek vanno in cache senza modifiche al codice. I token di input letti dalla cache costano $0.132/M, contro $1.32/M senza cache (TTL nessun TTL fisso (svuotata quando non viene più usata)). Guida al prompt caching →
Come ottengo l'accesso a DeepSeek V4 Pro (0813)?
Fai puntare l'SDK OpenAI che usi già a base_url="https://synthorai.io/v1", imposta model="deepseek-v4-pro-0813" e hai finito: una sola chiave API vale per tutti i modelli del gateway.
DeepSeek V4 Pro (0813) è open source?
Sì: i pesi sono pubblicati sotto licenza MIT (repository ufficiale linkato nella sezione «Informazioni»). Oppure lascia perdere le GPU: qui la versione hosted si paga a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →
Modelli correlati
Confronta
Ogni valore di questa pagina è ripreso dalla documentazione del provider (il link è qui sopra) e riporta la data dell'ultima verifica. I prezzi sono confrontati sull'intero catalogo; per le specifiche che ogni provider definisce a modo suo indichiamo la differenza invece di metterle in un grafico. Qui non c'è nulla di misurato da noi e non assegniamo punteggi.