DeepSeek V4 Flash ist das schnelle, wirtschaftliche Mitglied der Open-Source-Serie DeepSeek-V4: ein Mixture-of-Experts-Modell mit 284B Gesamtparametern und 13B aktivierten, wie sein größeres Geschwistermodell auf mehr als 32T Token vortrainiert.
- Eingabe
- Text $0.138/M
- Ausgabe
- Text $0.275/M
- Cache-Read
- $0.0028/M
- Kontext
- 1M
- vs. GPT-4o
- ~97% günstiger
Benchmarks
Herstellerangaben: Alibaba (Qwen) DeepSeek Google
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.000.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 393.216 |
Prompt Caching
| Modus | automatisch |
|---|---|
| Lebensdauer | kein festes TTL (wird bei Nichtnutzung automatisch geleert) |
Thinking
| Anbieter-Parameter | thinking.type + reasoning_effort |
|---|---|
| Zulässige Werte | thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max) |
| Standardwert | enabled, mit reasoning_effort high; bei manchen komplexen Agent-Anfragen automatisch max gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Die Spur wird in reasoning_content zurückgegeben, und bei einem Turn, in dem das Modell ein Tool aufgerufen hat, muss sie in jedem späteren Turn zurückgegeben werden, sonst wird sie ignoriert. Der Thinking-Modus ignoriert zudem stillschweigend temperature, top_p, presence_penalty und frequency_penalty. DeepSeek veröffentlicht diesen Standard für die eigene API; andere Plattformen, die das Modell hosten, dokumentieren abweichende Standards, prüfen Sie ihn also gegen die Plattform, an die Sie geroutet werden. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text → Text |
|---|---|
| Parameter | 284B gesamt · 13B aktiv MoE |
| Lizenz | MIT |
- MoE mit 284B/13B aktiven Parametern, 1M Kontext, Thinking- und Non-Thinking-Modus
- hybride Sparse Attention, gemischte Präzision FP4+FP8
- die schnelle, sparsame V4-Variante
Ein Prompt, gemessen über das Gateway
DeepSeek V4 Flash bestanden · 3 sentences
When reasoning is enabled, the model generates additional "chain-of-thought" tokens internally before producing the final answer, effectively doubling the total token count per request. Since our billing is based on tokens processed, this directly doubled your usage. Additionally, reasoning often requires more expensive model tiers or higher compute resources, further amplifying the cost increase.
Ausgabe 154 tok (+85 Denken) Latenz 3.1 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
DeepSeek V4 Flash bestanden · 8/8 cases
The bug is that the function counts the number of consecutive equal **pairs** (i.e., `cur` increments for each `i` where `xs[i] == xs[i-1]`), but it should return the **length** of the longest run. For a run of length `L`, the number of pairs is `L-1`, so the result is always one less than the correct value. This causes the function to return 0 for a single‑element list (expected 1) and to undercount runs that end at the last index (e.g., `[1,1]` returns 1 instead of 2). Additionally, runs of length 1 that are not part of any pair (such as a single element at the end of a list) are never considered because `best` is only updated when a pair is found. […]
Ausgabe 2494 tok (+2227 Denken) Latenz 19.4 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
DeepSeek V4 Flash bestanden · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }
Ausgabe 1101 tok (+1054 Denken) Latenz 10.2 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
DeepSeek V4 Flash bestanden · 119 words, 0 banned, 1 question
We're thrilled to introduce Prompt Cache, a new feature for our API Gateway that stores prompt responses from any provider. When a user submits a prompt you've already processed, the system returns the cached result instantly—eliminating redundant API calls and reducing latency. This works across OpenAI, Anthropic, Google, and more, with automatic cache invalidation based on your rules. What does this mean for your budget? Fewer API calls directly lower your monthly spend. Additionally, response times drop by up to 80% for cached prompts, improving user experience. Developers can configure cache duration per provider, set TTLs, and bypass cache when needed. The feature is available now in your gateway dashboard. Start saving time and money with Prompt Cache.
Ausgabe 2039 tok (+1887 Denken) Latenz 15.6 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
DeepSeek V4 Flash in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über DeepSeek V4 Flash
- Es führt das 1M-Token-Kontextfenster der Serie standardmäßig, erreicht maximal 384K Output-Token und unterstützt Non-Thinking- und Thinking-Modi einschließlich höherer Einstellungen für den Reasoning-Aufwand.
- DeepSeek hebt hybride Sparse-Attention-Innovationen hervor, die den Rechenaufwand der Long-Context-Inferenz und die KV-Cache-Kosten gegenüber DeepSeek-V3.2 deutlich senken, bei einer Reasoning-Leistung nahe an V4 Pro zu niedrigerem Preis und geringerer Latenz; die Release Notes gehen weiter und sagen, dass Flash bei einfachen Agent-Aufgaben gleichauf mit Pro liegt, und genau diese Zeile ist bei der Wahl zwischen beiden zu lesen: Pro für wissensintensive und schwere agentische Arbeit, Flash für alles mit hohem Volumen.
- Es ist zudem das Mitglied des Paars mit der höheren Nebenläufigkeit.
- Technisch sind beide identisch zu integrieren: dasselbe thinking-Objekt und dieselben reasoning_effort-Stufen, dasselbe reasoning_content-Feld, das die Gedankenkette trägt, dieselbe Anforderung, dieses Feld bei Turns zurückzugeben, die ein Tool aufgerufen haben, dasselbe Tool Calling mit 128 Funktionen, JSON-Ausgabe und automatisches Prefix-Caching sowie dieselbe FP4/FP8-Mixed-Precision-Verpackung.
- Die Gewichte stehen unter MIT-Lizenz und sind auf DeepSeeks eigenem Model Hub veröffentlicht.
- Synthorai stellt DeepSeek V4 Flash über seinen OpenAI-kompatiblen Endpoint bereit, ohne dass Client-Änderungen nötig sind.
FAQ
Lässt sich die DeepSeek V4 Flash API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.138/M Input-Tokens deckt allein dieses Guthaben rund 905 Requests mit je ~8K Tokens gegen DeepSeek V4 Flash ab.
Worin ist DeepSeek V4 Flash am besten?
284B-Parameter-MoE mit 13B aktivierten; hybride Sparse Attention senkt Long-Context-Kosten; MIT-lizenzierte Gewichte mit 1M-Token-Kontext. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet DeepSeek V4 Flash?
DeepSeek V4 Flash kostet auf Synthorai $0.138 pro Million Input-Tokens und $0.275 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.0028/M abgerechnet.
Unterstützt DeepSeek V4 Flash Prompt-Caching?
Ja, automatisch: Über DeepSeek ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.0028/M statt $0.138/M (ungecacht) abgerechnet (TTL kein festes TTL (wird bei Nichtnutzung automatisch geleert)). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu DeepSeek V4 Flash?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="deepseek-v4-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Ist DeepSeek V4 Flash Open Source?
Ja, die Gewichte sind unter der MIT-Lizenz veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.