Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

DeepSeek V4 Pro

Rilasciato 2026-04-24

chatCodiceRagionamentoChiamata di strumentiCaching dei prompt

DeepSeek V4 Pro è il flagship della serie open-source DeepSeek-V4: un modello Mixture-of-Experts con 1.6T di parametri totali e 49B attivati, pre-addestrato su più di 32T token.

Input
testo $1.32/M
Output
testo $3.96/M
Lettura cache
$0.132/M
Contesto
1M
vs GPT-4o
~74% più economico

Benchmark

Sopra la media4 / 10
DeepSeek V4 Pro altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
SWE-Bench Pro
59%
CoWorkBench max
66.3%
Humanity's Last Exam no tools
37.7%
MCP-Mark
57.1%

Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$1.32/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$3.96/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.132/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.000.000
Output massimo (specifica del vendor) 393.216

Caching prompt

Modalità automatico
Durata nessun TTL fisso (svuotata quando non viene più usata)

Ragionamento

Parametro del fornitore thinking.type + reasoning_effort
Valori accettati thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max)
Valore predefinito enabled, con reasoning_effort high; alcune richieste agentiche complesse vengono impostate automaticamente su max applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La traccia viene restituita in reasoning_content e, nei turni in cui il modello ha chiamato uno strumento, va restituita in ogni turno successivo; altrimenti viene ignorata. La modalità thinking ignora inoltre silenziosamente temperature, top_p, presence_penalty e frequency_penalty. DeepSeek pubblica questo valore predefinito per la propria API; altre piattaforme che ospitano il modello documentano valori predefiniti diversi, quindi verifica sulla piattaforma verso cui vieni instradato.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo → testo
Parametri 1.6T totali · 49B attivi MoE
Licenza MIT
  • Flagship MoE da 1.6T con 49B attivi, contesto da 1M, modalità Thinking + Non-Thinking
  • la sparse attention ibrida riduce i FLOP per singolo token al 27% e la KV cache al 10% rispetto a V3.2 con contesto da 1M

fonte: documentazione ufficiale DeepSeek ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

DeepSeek V4 Pro superato · 3 sentences

Enabling reasoning causes the model to generate a lengthy internal chain‑of‑thought before it delivers a visible answer, and we are billed for every one of those hidden reasoning tokens just as we are for the final output. In most interactions, the volume of these unseen tokens at least equals the visible response, effectively doubling the total tokens consumed per query. That doubled token consumption translates directly into a doubled per‑query cost, which is why our overall LLM bill doubled.

out 641 tok (+545 ragionamento) latenza 11.5 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

DeepSeek V4 Pro superato · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `cur = 0` and only incrementing it when two adjacent elements match, which counts the number of *additional* equal elements rather than the actual run length (which is `cur + 1`). As a result, the returned `best` is always one less than the true longest run—most obviously returning 0 for a single-element list instead of 1. […]

out 2418 tok (+2131 ragionamento) latenza 35.6 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

DeepSeek V4 Pro superato · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": "eleven and change", "guidance": null }

out 1204 tok (+1153 ragionamento) latenza 19.9 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

DeepSeek V4 Pro nessuna risposta da valutare · no answer text within 16,384 tokens (all of it went to thinking)

Il modello non ha restituito alcun testo di risposta - l'intero budget di token è stato speso per il ragionamento nascosto.

out 8193 tok (+8192 ragionamento) latenza 106.2 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa DeepSeek V4 Pro in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su DeepSeek V4 Pro

  • Supporta una finestra di contesto da 1M di token e le modalità duali thinking/non-thinking, e DeepSeek evidenzia forte coding agentico, ampia conoscenza del mondo e ragionamento su matematica, STEM e programmazione.
  • La model card nomina i pezzi che stanno dietro a tutto questo: uno stack di attenzione ibrida che accoppia Compressed Sparse Attention e Heavily Compressed Attention, le Manifold-Constrained Hyper-Connections e l'ottimizzatore Muon, con i pesi degli esperti MoE tenuti in FP4 e la maggior parte degli altri parametri in FP8.
  • I nuovi design di sparse attention riducono i FLOP di inferenza a contesto lungo e la KV cache a una frazione di quelli di DeepSeek-V3.2.
  • Il thinking è un parametro della richiesta anziché un nome di modello separato: un oggetto thinking lo attiva o disattiva, un'impostazione reasoning_effort seleziona i comportamenti documentati Non-think, Think High e Think Max, e la chain of thought torna in reasoning_content accanto alla risposta.
  • La guida di DeepSeek aggiunge una regola che vale la pena implementare nel codice: in ogni turno in cui il modello ha chiamato uno strumento, il reasoning_content di quel turno deve essere restituito nei turni successivi.
  • Function calling e output JSON funzionano entrambi con il thinking attivo, l'output arriva a 384K token e il caching del prefisso è automatico.
  • I pesi sono rilasciati apertamente sotto la licenza MIT.
  • Su Synthorai, DeepSeek V4 Pro è disponibile tramite l'endpoint chat completions compatibile OpenAI.

FAQ

L'API di DeepSeek V4 Pro si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.32/M token in input, quel credito da solo copre circa 94 richieste da ~8K token verso DeepSeek V4 Pro.

In cosa eccelle DeepSeek V4 Pro?

MoE da 1.6T di parametri con 49B attivati; pre-addestrato su più di 32T token; contesto da 1M con modalità thinking duali. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa DeepSeek V4 Pro?

Su Synthorai, DeepSeek V4 Pro costa $1.32 per milione di token in input e $3.96 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.132/M.

DeepSeek V4 Pro supporta il caching dei prompt?

Sì, in automatico: i prompt serviti da DeepSeek vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.132/M contro $1.32/M senza cache (TTL nessun TTL fisso (svuotata quando non viene più usata)). Guida al caching dei prompt →

Come ottengo l'accesso a DeepSeek V4 Pro?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="deepseek-v4-pro" e hai finito: una sola chiave API copre tutti i modelli del gateway.

DeepSeek V4 Pro è open source?

Sì: i pesi sono pubblicati sotto MIT License (repository ufficiale linkato nella sezione «Informazioni»). Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →