🎁 Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

DeepSeek V4 Pro (0813)

Rilasciato 2026-08-13

chatCodiceRagionamentoChiamata di strumentiCaching dei prompt

DeepSeek V4 Pro 0813 è la release di agosto 2026 della linea di punta V4 Pro di DeepSeek, e la scheda del modello la presenta come sostituta della versione preliminare anziché come una variante affiancata.

Input
testo $1.32/M
Output
testo $3.96/M
Lettura cache
$0.132/M
Contesto
1M
vs GPT-4o
~74% più economico

Prezzi di listino del provider: senza ricarico della piattaforma, pagamento a consumo. Questi sono i prezzi di listino ufficiali. I clienti autenticati possono vedere i prezzi effettivi, inclusi gli sconti workspace, su /console/pricing. Input effettivo con un tasso di cache hit del 70%:$0.4884/M. Caching automatico su disco del prefisso KV: gli hit della cache si fatturano alla tariffa scontata di lettura dalla cache senza opt-in e senza commissione di scrittura. Questa tariffa di lettura da cache è pubblicata come importo per milione a sé stante. Nessun addebito separato per una scrittura in cache.

Prezzo · posizione tra 62 modelli comparabili

Input$1.32/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$3.96/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.132/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.000.000
Output massimo (specifica del vendor) 393.216

Caching prompt

Modalità automatico
Durata nessun TTL fisso (svuotata quando non viene più usata)

Ragionamento

Parametro del fornitore reasoning_effort
Valori accettati the model card documents low · high · max
Comportamento del ragionamento The trace returns in reasoning_content and on short prompts can account for the large majority of the completion tokens, so a tight max_tokens budget returns an empty answer that is still billed in full. DeepSeek documents three effort levels for its own API; platforms that host the model may accept a different set, so confirm against the platform you are routed to.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway — vale la mappatura del fornitore sopra

Modello

Modalità testo → testo
Licenza MIT

August 2026 release of DeepSeek V4 Pro, superseding the preview version with what the model card describes as greatly enhanced agentic capabilities, and shipping with a DSpark speculative decoding module attached. The card states neither a parameter count nor an architecture, so neither is listed here.

fonte: documentazione ufficiale DeepSeek ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

DeepSeek V4 Pro (0813) superato · 3 sentences

Enabling reasoning causes the model to generate a hidden chain-of-thought with many additional tokens before producing the final answer, which sharply increases compute consumption per request. Those extra reasoning tokens are billed at the same or higher rates, so total usage doubled even though the volume of final outputs stayed similar. We can control this by adjusting reasoning effort, setting token limits, or routing only complex requests through reasoning mode.

out 308 tok (+226 ragionamento) latenza 5.1 s

Rispetto dell'istruzione (esattamente tre frasi — contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

DeepSeek V4 Pro (0813) superato · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` was initialized to `0` and only counted adjacent matching pairs, so a run of length `n` produced `n - 1` (or `0` for a single element) instead of `n`. The code also reset to `0` on a change, when the new run should start at length `1`. Initializing `cur` and `best` to `1` fixes both the single-element case and runs ending at the last index.

out 1315 tok (+1130 ragionamento) latenza 16.9 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

DeepSeek V4 Pro (0813) superato · 5/5 fields, guidance null

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":null}

out 2155 tok (+2121 ragionamento) latenza 26.0 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

DeepSeek V4 Pro (0813) superato · 121 words, 0 banned, 1 question

Introducing cross-provider prompt caching in our API gateway. Send a prompt once, and the gateway stores its computed prefix across Anthropic, OpenAI, and other LLM providers. Subsequent requests with the same prompt hit the cache, cutting latency and token costs while keeping outputs consistent across routing decisions and provider failovers. Teams can route identical prompts between providers without reprocessing shared context or lengthy system instructions. How much could you save on repeated prompt prefixes? The cache respects provider-specific key formats, handles TTLs automatically, and works with streaming and batch requests. Enable it with one configuration flag—no changes to your application code. Available today on all plans. Monitor cache hit rates, token savings, and provider-specific performance metrics in the live dashboard.

out 2845 tok (+2694 ragionamento) latenza 25.5 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa DeepSeek V4 Pro (0813) in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro-0813",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su DeepSeek V4 Pro (0813)

  • DeepSeek attribuisce il cambiamento a capacità agentiche nettamente potenziate e a miglioramenti prestazionali che descrive come particolarmente evidenti in produzione; la release include inoltre un modulo di decodifica speculativa DSpark.
  • La scheda è insolitamente avara di specifiche: non indica né il numero di parametri né l'architettura, quindi ogni cifra ereditata dalla V4 Pro precedente va considerata non confermata per questa release.
  • Ciò che invece dichiara è l'ambito operativo: pesi con licenza MIT, una lunghezza massima di output consigliata di 384K token ai livelli più alti di sforzo di ragionamento e un parametro reasoning_effort documentato su tre livelli, low, high e max.
  • È il ragionamento la parte da pianificare.
  • La traccia torna in reasoning_content e, su prompt brevi, può rappresentare la grande maggioranza dei token di output: un budget max_tokens troppo stretto restituirà quindi una risposta vuota, comunque fatturata per intero per i token spesi a ragionare.
  • Prevedete quel margine, o abbassate il livello di sforzo, prima di inserirlo in un percorso sensibile alla latenza.
  • Il costo dello sforzo non si ferma all'output: salire di livello allunga il preambolo da cui il modello parte, così lo stesso messaggio fattura più token di input con un'impostazione alta che con una bassa.
  • Il modello è solo testo sia in ingresso sia in uscita; l'input immagine non è supportato, quindi abbinatelo a un modello di visione invece di inviare messaggi multimodali.
  • Poiché sia la release datata sia il nome continuo restano invocabili, fissate l'id datato quando serve un comportamento riproducibile e aspettatevi che il nome senza data avanzi nel tempo.
  • Synthorai lo eroga tramite l'endpoint chat completions compatibile con OpenAI, senza modifiche lato client.

FAQ

L'API di DeepSeek V4 Pro (0813) si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.32/M token in input, quel credito da solo copre circa 94 richieste da ~8K token verso DeepSeek V4 Pro (0813).

In cosa eccelle DeepSeek V4 Pro (0813)?

Sostituisce la preview di V4 Pro; licenza MIT, output massimo consigliato di 384K; reasoning_effort documentato su low, high e max. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa DeepSeek V4 Pro (0813)?

Su Synthorai, DeepSeek V4 Pro (0813) costa $1.32 per milione di token in input e $3.96 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.132/M.

DeepSeek V4 Pro (0813) supporta il caching dei prompt?

Sì, in automatico: i prompt serviti da DeepSeek vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.132/M contro $1.32/M senza cache (TTL nessun TTL fisso (svuotata quando non viene più usata)). Guida al caching dei prompt →

Come ottengo l'accesso a DeepSeek V4 Pro (0813)?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="deepseek-v4-pro-0813" e hai finito: una sola chiave API copre tutti i modelli del gateway.

DeepSeek V4 Pro (0813) è open source?

Sì: i pesi sono pubblicati sotto MIT License (repository ufficiale linkato nella sezione «Informazioni»). Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API gratuita Confronta il tuo costo →