DeepSeek V4 Flash è il membro rapido ed economico della serie open-source DeepSeek-V4: un modello Mixture-of-Experts con 284B di parametri totali e 13B attivati, pre-addestrato come il fratello maggiore su più di 32T token.
- Input
- testo $0.138/M
- Output
- testo $0.275/M
- Lettura cache
- $0.0028/M
- Contesto
- 1M
- vs GPT-4o
- ~97% più economico
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) DeepSeek Google
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.000.000 |
|---|---|
| Output massimo (specifica del vendor) | 393.216 |
Caching prompt
| Modalità | automatico |
|---|---|
| Durata | nessun TTL fisso (svuotata quando non viene più usata) |
Ragionamento
| Parametro del fornitore | thinking.type + reasoning_effort |
|---|---|
| Valori accettati | thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max) |
| Valore predefinito | enabled, con reasoning_effort high; alcune richieste agentiche complesse vengono impostate automaticamente su max applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La traccia viene restituita in reasoning_content e, nei turni in cui il modello ha chiamato uno strumento, va restituita in ogni turno successivo; altrimenti viene ignorata. La modalità thinking ignora inoltre silenziosamente temperature, top_p, presence_penalty e frequency_penalty. DeepSeek pubblica questo valore predefinito per la propria API; altre piattaforme che ospitano il modello documentano valori predefiniti diversi, quindi verifica sulla piattaforma verso cui vieni instradato. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo → testo |
|---|---|
| Parametri | 284B totali · 13B attivi MoE |
| Licenza | MIT |
- MoE da 284B con 13B attivi, contesto da 1M, modalità Thinking + Non-Thinking
- sparse attention ibrida, precisione mista FP4+FP8
- la variante V4 veloce ed economica
Un solo prompt, misurato attraverso il gateway
DeepSeek V4 Flash superato · 3 sentences
When reasoning is enabled, the model generates additional "chain-of-thought" tokens internally before producing the final answer, effectively doubling the total token count per request. Since our billing is based on tokens processed, this directly doubled your usage. Additionally, reasoning often requires more expensive model tiers or higher compute resources, further amplifying the cost increase.
out 154 tok (+85 ragionamento) latenza 3.1 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
DeepSeek V4 Flash superato · 8/8 cases
The bug is that the function counts the number of consecutive equal **pairs** (i.e., `cur` increments for each `i` where `xs[i] == xs[i-1]`), but it should return the **length** of the longest run. For a run of length `L`, the number of pairs is `L-1`, so the result is always one less than the correct value. This causes the function to return 0 for a single‑element list (expected 1) and to undercount runs that end at the last index (e.g., `[1,1]` returns 1 instead of 2). Additionally, runs of length 1 that are not part of any pair (such as a single element at the end of a list) are never considered because `best` is only updated when a pair is found. […]
out 2494 tok (+2227 ragionamento) latenza 19.4 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
DeepSeek V4 Flash superato · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }
out 1101 tok (+1054 ragionamento) latenza 10.2 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
DeepSeek V4 Flash superato · 119 words, 0 banned, 1 question
We're thrilled to introduce Prompt Cache, a new feature for our API Gateway that stores prompt responses from any provider. When a user submits a prompt you've already processed, the system returns the cached result instantly—eliminating redundant API calls and reducing latency. This works across OpenAI, Anthropic, Google, and more, with automatic cache invalidation based on your rules. What does this mean for your budget? Fewer API calls directly lower your monthly spend. Additionally, response times drop by up to 80% for cached prompts, improving user experience. Developers can configure cache duration per provider, set TTLs, and bypass cache when needed. The feature is available now in your gateway dashboard. Start saving time and money with Prompt Cache.
out 2039 tok (+1887 ragionamento) latenza 15.6 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa DeepSeek V4 Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su DeepSeek V4 Flash
- Porta di serie la finestra di contesto da 1M di token della serie, arriva al massimo a 384K token di output e supporta le modalità non-thinking e thinking, incluse impostazioni di reasoning effort più alte.
- DeepSeek evidenzia innovazioni di sparse attention ibrida che riducono nettamente il calcolo di inferenza a contesto lungo e il costo della KV cache rispetto a DeepSeek-V3.2, con prestazioni di ragionamento vicine a V4 Pro a prezzo e latenza inferiori; le note di rilascio si spingono oltre e affermano che Flash si comporta alla pari di Pro sui compiti di agent semplici, ed è questa la riga da leggere quando si sceglie tra i due: Pro per il lavoro ad alta intensità di conoscenza e per quello agentico difficile, Flash per tutto ciò che è ad alto volume.
- È anche il membro della coppia con concorrenza più alta.
- Dal punto di vista meccanico i due sono identici da integrare: lo stesso oggetto thinking e gli stessi livelli di reasoning_effort, lo stesso campo reasoning_content che porta la chain of thought, lo stesso requisito di restituire quel campo nei turni che hanno chiamato uno strumento, lo stesso tool calling con 128 funzioni, l'output JSON e il caching automatico del prefisso, e lo stesso confezionamento a precisione mista FP4/FP8.
- I pesi sono sotto licenza MIT e pubblicati sul model hub di DeepSeek.
- Synthorai serve DeepSeek V4 Flash tramite il suo endpoint compatibile OpenAI senza richiedere modifiche ai client.
FAQ
L'API di DeepSeek V4 Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.138/M token in input, quel credito da solo copre circa 905 richieste da ~8K token verso DeepSeek V4 Flash.
In cosa eccelle DeepSeek V4 Flash?
MoE da 284B di parametri con 13B attivati; sparse attention ibrida riduce i costi a contesto lungo; pesi con licenza MIT e contesto da 1M di token. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa DeepSeek V4 Flash?
Su Synthorai, DeepSeek V4 Flash costa $0.138 per milione di token in input e $0.275 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.0028/M.
DeepSeek V4 Flash supporta il caching dei prompt?
Sì, in automatico: i prompt serviti da DeepSeek vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.0028/M contro $0.138/M senza cache (TTL nessun TTL fisso (svuotata quando non viene più usata)). Guida al caching dei prompt →
Come ottengo l'accesso a DeepSeek V4 Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="deepseek-v4-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.
DeepSeek V4 Flash è open source?
Sì: i pesi sono pubblicati sotto MIT License. Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.