DeepSeek V4 Pro è il flagship della serie open-source DeepSeek-V4: un modello Mixture-of-Experts con 1.6T di parametri totali e 49B attivati, pre-addestrato su più di 32T token.
- Input
- testo $1.32/M
- Output
- testo $3.96/M
- Lettura cache
- $0.132/M
- Contesto
- 1M
- vs GPT-4o
- ~74% più economico
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.000.000 |
|---|---|
| Output massimo (specifica del vendor) | 393.216 |
Caching prompt
| Modalità | automatico |
|---|---|
| Durata | nessun TTL fisso (svuotata quando non viene più usata) |
Ragionamento
| Parametro del fornitore | thinking.type + reasoning_effort |
|---|---|
| Valori accettati | thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max) |
| Valore predefinito | enabled, con reasoning_effort high; alcune richieste agentiche complesse vengono impostate automaticamente su max applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La traccia viene restituita in reasoning_content e, nei turni in cui il modello ha chiamato uno strumento, va restituita in ogni turno successivo; altrimenti viene ignorata. La modalità thinking ignora inoltre silenziosamente temperature, top_p, presence_penalty e frequency_penalty. DeepSeek pubblica questo valore predefinito per la propria API; altre piattaforme che ospitano il modello documentano valori predefiniti diversi, quindi verifica sulla piattaforma verso cui vieni instradato. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo → testo |
|---|---|
| Parametri | 1.6T totali · 49B attivi MoE |
| Licenza | MIT |
- Flagship MoE da 1.6T con 49B attivi, contesto da 1M, modalità Thinking + Non-Thinking
- la sparse attention ibrida riduce i FLOP per singolo token al 27% e la KV cache al 10% rispetto a V3.2 con contesto da 1M
Un solo prompt, misurato attraverso il gateway
DeepSeek V4 Pro superato · 3 sentences
Enabling reasoning causes the model to generate a lengthy internal chain‑of‑thought before it delivers a visible answer, and we are billed for every one of those hidden reasoning tokens just as we are for the final output. In most interactions, the volume of these unseen tokens at least equals the visible response, effectively doubling the total tokens consumed per query. That doubled token consumption translates directly into a doubled per‑query cost, which is why our overall LLM bill doubled.
out 641 tok (+545 ragionamento) latenza 11.5 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
DeepSeek V4 Pro superato · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `cur = 0` and only incrementing it when two adjacent elements match, which counts the number of *additional* equal elements rather than the actual run length (which is `cur + 1`). As a result, the returned `best` is always one less than the true longest run—most obviously returning 0 for a single-element list instead of 1. […]
out 2418 tok (+2131 ragionamento) latenza 35.6 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
DeepSeek V4 Pro superato · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": "eleven and change", "guidance": null }
out 1204 tok (+1153 ragionamento) latenza 19.9 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
DeepSeek V4 Pro nessuna risposta da valutare · no answer text within 16,384 tokens (all of it went to thinking)
Il modello non ha restituito alcun testo di risposta - l'intero budget di token è stato speso per il ragionamento nascosto.
out 8193 tok (+8192 ragionamento) latenza 106.2 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa DeepSeek V4 Pro in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su DeepSeek V4 Pro
- Supporta una finestra di contesto da 1M di token e le modalità duali thinking/non-thinking, e DeepSeek evidenzia forte coding agentico, ampia conoscenza del mondo e ragionamento su matematica, STEM e programmazione.
- La model card nomina i pezzi che stanno dietro a tutto questo: uno stack di attenzione ibrida che accoppia Compressed Sparse Attention e Heavily Compressed Attention, le Manifold-Constrained Hyper-Connections e l'ottimizzatore Muon, con i pesi degli esperti MoE tenuti in FP4 e la maggior parte degli altri parametri in FP8.
- I nuovi design di sparse attention riducono i FLOP di inferenza a contesto lungo e la KV cache a una frazione di quelli di DeepSeek-V3.2.
- Il thinking è un parametro della richiesta anziché un nome di modello separato: un oggetto thinking lo attiva o disattiva, un'impostazione reasoning_effort seleziona i comportamenti documentati Non-think, Think High e Think Max, e la chain of thought torna in reasoning_content accanto alla risposta.
- La guida di DeepSeek aggiunge una regola che vale la pena implementare nel codice: in ogni turno in cui il modello ha chiamato uno strumento, il reasoning_content di quel turno deve essere restituito nei turni successivi.
- Function calling e output JSON funzionano entrambi con il thinking attivo, l'output arriva a 384K token e il caching del prefisso è automatico.
- I pesi sono rilasciati apertamente sotto la licenza MIT.
- Su Synthorai, DeepSeek V4 Pro è disponibile tramite l'endpoint chat completions compatibile OpenAI.
FAQ
L'API di DeepSeek V4 Pro si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.32/M token in input, quel credito da solo copre circa 94 richieste da ~8K token verso DeepSeek V4 Pro.
In cosa eccelle DeepSeek V4 Pro?
MoE da 1.6T di parametri con 49B attivati; pre-addestrato su più di 32T token; contesto da 1M con modalità thinking duali. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa DeepSeek V4 Pro?
Su Synthorai, DeepSeek V4 Pro costa $1.32 per milione di token in input e $3.96 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.132/M.
DeepSeek V4 Pro supporta il caching dei prompt?
Sì, in automatico: i prompt serviti da DeepSeek vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.132/M contro $1.32/M senza cache (TTL nessun TTL fisso (svuotata quando non viene più usata)). Guida al caching dei prompt →
Come ottengo l'accesso a DeepSeek V4 Pro?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="deepseek-v4-pro" e hai finito: una sola chiave API copre tutti i modelli del gateway.
DeepSeek V4 Pro è open source?
Sì: i pesi sono pubblicati sotto MIT License (repository ufficiale linkato nella sezione «Informazioni»). Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.