Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

DeepSeek V4 Flash

Rilasciato 2026-04-24

chatCodiceChiamata di strumentiRagionamentoCaching dei prompt

DeepSeek V4 Flash è il membro rapido ed economico della serie open-source DeepSeek-V4: un modello Mixture-of-Experts con 284B di parametri totali e 13B attivati, pre-addestrato come il fratello maggiore su più di 32T token.

Input
testo $0.138/M
Output
testo $0.275/M
Lettura cache
$0.0028/M
Contesto
1M
vs GPT-4o
~97% più economico

Benchmark

Sopra la mediasolo 2 confrontabili
DeepSeek V4 Flash altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
SWE-Bench Pro max
52.6%
GPQA Diamond max
88.1%
APEX-Agents high
19.1%

Dati pubblicati dai fornitori: Alibaba (Qwen) DeepSeek Google

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$0.138/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$0.275/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.0028/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.000.000
Output massimo (specifica del vendor) 393.216

Caching prompt

Modalità automatico
Durata nessun TTL fisso (svuotata quando non viene più usata)

Ragionamento

Parametro del fornitore thinking.type + reasoning_effort
Valori accettati thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max)
Valore predefinito enabled, con reasoning_effort high; alcune richieste agentiche complesse vengono impostate automaticamente su max applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La traccia viene restituita in reasoning_content e, nei turni in cui il modello ha chiamato uno strumento, va restituita in ogni turno successivo; altrimenti viene ignorata. La modalità thinking ignora inoltre silenziosamente temperature, top_p, presence_penalty e frequency_penalty. DeepSeek pubblica questo valore predefinito per la propria API; altre piattaforme che ospitano il modello documentano valori predefiniti diversi, quindi verifica sulla piattaforma verso cui vieni instradato.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo → testo
Parametri 284B totali · 13B attivi MoE
Licenza MIT
  • MoE da 284B con 13B attivi, contesto da 1M, modalità Thinking + Non-Thinking
  • sparse attention ibrida, precisione mista FP4+FP8
  • la variante V4 veloce ed economica

fonte: documentazione ufficiale DeepSeek ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

DeepSeek V4 Flash superato · 3 sentences

When reasoning is enabled, the model generates additional "chain-of-thought" tokens internally before producing the final answer, effectively doubling the total token count per request. Since our billing is based on tokens processed, this directly doubled your usage. Additionally, reasoning often requires more expensive model tiers or higher compute resources, further amplifying the cost increase.

out 154 tok (+85 ragionamento) latenza 3.1 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

DeepSeek V4 Flash superato · 8/8 cases

The bug is that the function counts the number of consecutive equal **pairs** (i.e., `cur` increments for each `i` where `xs[i] == xs[i-1]`), but it should return the **length** of the longest run. For a run of length `L`, the number of pairs is `L-1`, so the result is always one less than the correct value. This causes the function to return 0 for a single‑element list (expected 1) and to undercount runs that end at the last index (e.g., `[1,1]` returns 1 instead of 2). Additionally, runs of length 1 that are not part of any pair (such as a single element at the end of a list) are never considered because `best` is only updated when a pair is found. […]

out 2494 tok (+2227 ragionamento) latenza 19.4 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

DeepSeek V4 Flash superato · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }

out 1101 tok (+1054 ragionamento) latenza 10.2 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

DeepSeek V4 Flash superato · 119 words, 0 banned, 1 question

We're thrilled to introduce Prompt Cache, a new feature for our API Gateway that stores prompt responses from any provider. When a user submits a prompt you've already processed, the system returns the cached result instantly—eliminating redundant API calls and reducing latency. This works across OpenAI, Anthropic, Google, and more, with automatic cache invalidation based on your rules. What does this mean for your budget? Fewer API calls directly lower your monthly spend. Additionally, response times drop by up to 80% for cached prompts, improving user experience. Developers can configure cache duration per provider, set TTLs, and bypass cache when needed. The feature is available now in your gateway dashboard. Start saving time and money with Prompt Cache.

out 2039 tok (+1887 ragionamento) latenza 15.6 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa DeepSeek V4 Flash in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Informazioni su DeepSeek V4 Flash

  • Porta di serie la finestra di contesto da 1M di token della serie, arriva al massimo a 384K token di output e supporta le modalità non-thinking e thinking, incluse impostazioni di reasoning effort più alte.
  • DeepSeek evidenzia innovazioni di sparse attention ibrida che riducono nettamente il calcolo di inferenza a contesto lungo e il costo della KV cache rispetto a DeepSeek-V3.2, con prestazioni di ragionamento vicine a V4 Pro a prezzo e latenza inferiori; le note di rilascio si spingono oltre e affermano che Flash si comporta alla pari di Pro sui compiti di agent semplici, ed è questa la riga da leggere quando si sceglie tra i due: Pro per il lavoro ad alta intensità di conoscenza e per quello agentico difficile, Flash per tutto ciò che è ad alto volume.
  • È anche il membro della coppia con concorrenza più alta.
  • Dal punto di vista meccanico i due sono identici da integrare: lo stesso oggetto thinking e gli stessi livelli di reasoning_effort, lo stesso campo reasoning_content che porta la chain of thought, lo stesso requisito di restituire quel campo nei turni che hanno chiamato uno strumento, lo stesso tool calling con 128 funzioni, l'output JSON e il caching automatico del prefisso, e lo stesso confezionamento a precisione mista FP4/FP8.
  • I pesi sono sotto licenza MIT e pubblicati sul model hub di DeepSeek.
  • Synthorai serve DeepSeek V4 Flash tramite il suo endpoint compatibile OpenAI senza richiedere modifiche ai client.

FAQ

L'API di DeepSeek V4 Flash si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.138/M token in input, quel credito da solo copre circa 905 richieste da ~8K token verso DeepSeek V4 Flash.

In cosa eccelle DeepSeek V4 Flash?

MoE da 284B di parametri con 13B attivati; sparse attention ibrida riduce i costi a contesto lungo; pesi con licenza MIT e contesto da 1M di token. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa DeepSeek V4 Flash?

Su Synthorai, DeepSeek V4 Flash costa $0.138 per milione di token in input e $0.275 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.0028/M.

DeepSeek V4 Flash supporta il caching dei prompt?

Sì, in automatico: i prompt serviti da DeepSeek vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.0028/M contro $0.138/M senza cache (TTL nessun TTL fisso (svuotata quando non viene più usata)). Guida al caching dei prompt →

Come ottengo l'accesso a DeepSeek V4 Flash?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="deepseek-v4-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.

DeepSeek V4 Flash è open source?

Sì: i pesi sono pubblicati sotto MIT License. Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →