Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

DeepSeek V4 Flash

Veröffentlicht 2026-04-24

chatCodeTool-AufrufeReasoningPrompt Caching

DeepSeek V4 Flash ist das schnelle, wirtschaftliche Mitglied der Open-Source-Serie DeepSeek-V4: ein Mixture-of-Experts-Modell mit 284B Gesamtparametern und 13B aktivierten, wie sein größeres Geschwistermodell auf mehr als 32T Token vortrainiert.

Eingabe
Text $0.138/M
Ausgabe
Text $0.275/M
Cache-Read
$0.0028/M
Kontext
1M
vs. GPT-4o
~97% günstiger

Benchmarks

Über dem Durchschnittnur 2 vergleichbar
DeepSeek V4 Flash weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
SWE-Bench Pro max
52.6%
GPQA Diamond max
88.1%
APEX-Agents high
19.1%

Herstellerangaben: Alibaba (Qwen) DeepSeek Google

Preis im Vergleich

Preisposition unter 60 vergleichbaren Modellen

Eingabe$0.138/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Ausgabe$0.275/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Cache-Lesen$0.0028/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 1.000.000
Max. Output (Anbieter-Spezifikation) 393.216

Prompt Caching

Modus automatisch
Lebensdauer kein festes TTL (wird bei Nichtnutzung automatisch geleert)

Thinking

Anbieter-Parameter thinking.type + reasoning_effort
Zulässige Werte thinking.type enabled · disabled; reasoning_effort high · max (low and medium map to high, xhigh maps to max)
Standardwert enabled, mit reasoning_effort high; bei manchen komplexen Agent-Anfragen automatisch max gilt, wenn die Anfrage nichts angibt
Abschaltbar Ja
Thinking-Verhalten Die Spur wird in reasoning_content zurückgegeben, und bei einem Turn, in dem das Modell ein Tool aufgerufen hat, muss sie in jedem späteren Turn zurückgegeben werden, sonst wird sie ignoriert. Der Thinking-Modus ignoriert zudem stillschweigend temperature, top_p, presence_penalty und frequency_penalty. DeepSeek veröffentlicht diesen Standard für die eigene API; andere Plattformen, die das Modell hosten, dokumentieren abweichende Standards, prüfen Sie ihn also gegen die Plattform, an die Sie geroutet werden.
Parameter reasoning_effort
Werte minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt

Modell

Modalitäten Text → Text
Parameter 284B gesamt · 13B aktiv MoE
Lizenz MIT
  • MoE mit 284B/13B aktiven Parametern, 1M Kontext, Thinking- und Non-Thinking-Modus
  • hybride Sparse Attention, gemischte Präzision FP4+FP8
  • die schnelle, sparsame V4-Variante

laut Offizielle DeepSeek-Dokumentation ↗

Ein Prompt, gemessen über das Gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. PRÜFEN genau 3 Sätze

DeepSeek V4 Flash bestanden · 3 sentences

When reasoning is enabled, the model generates additional "chain-of-thought" tokens internally before producing the final answer, effectively doubling the total token count per request. Since our billing is based on tokens processed, this directly doubled your usage. Additionally, reasoning often requires more expensive model tiers or higher compute resources, further amplifying the cost increase.

Ausgabe 154 tok (+85 Denken) Latenz 3.1 s

Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. PRÜFEN Fix besteht die Tests

DeepSeek V4 Flash bestanden · 8/8 cases

The bug is that the function counts the number of consecutive equal **pairs** (i.e., `cur` increments for each `i` where `xs[i] == xs[i-1]`), but it should return the **length** of the longest run. For a run of length `L`, the number of pairs is `L-1`, so the result is always one less than the correct value. This causes the function to return 0 for a single‑element list (expected 1) and to undercount runs that end at the last index (e.g., `[1,1]` returns 1 instead of 2). Additionally, runs of length 1 that are not part of any pair (such as a single element at the end of a list) are never considered because `best` is only updated when a pair is found. […]

Ausgabe 2494 tok (+2227 Denken) Latenz 19.4 s

Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. PRÜFEN gültiges JSON, Schema exakt

DeepSeek V4 Flash bestanden · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }

Ausgabe 1101 tok (+1054 Denken) Latenz 10.2 s

Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. PRÜFEN 120 Wörter, 0 verbotene Wörter

DeepSeek V4 Flash bestanden · 119 words, 0 banned, 1 question

We're thrilled to introduce Prompt Cache, a new feature for our API Gateway that stores prompt responses from any provider. When a user submits a prompt you've already processed, the system returns the cached result instantly—eliminating redundant API calls and reducing latency. This works across OpenAI, Anthropic, Google, and more, with automatic cache invalidation based on your rules. What does this mean for your budget? Fewer API calls directly lower your monthly spend. Additionally, response times drop by up to 80% for cached prompts, improving user experience. Developers can configure cache duration per provider, set TTLs, and bypass cache when needed. The feature is available now in your gateway dashboard. Start saving time and money with Prompt Cache.

Ausgabe 2039 tok (+1887 Denken) Latenz 15.6 s

Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.

DeepSeek V4 Flash in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Über DeepSeek V4 Flash

  • Es führt das 1M-Token-Kontextfenster der Serie standardmäßig, erreicht maximal 384K Output-Token und unterstützt Non-Thinking- und Thinking-Modi einschließlich höherer Einstellungen für den Reasoning-Aufwand.
  • DeepSeek hebt hybride Sparse-Attention-Innovationen hervor, die den Rechenaufwand der Long-Context-Inferenz und die KV-Cache-Kosten gegenüber DeepSeek-V3.2 deutlich senken, bei einer Reasoning-Leistung nahe an V4 Pro zu niedrigerem Preis und geringerer Latenz; die Release Notes gehen weiter und sagen, dass Flash bei einfachen Agent-Aufgaben gleichauf mit Pro liegt, und genau diese Zeile ist bei der Wahl zwischen beiden zu lesen: Pro für wissensintensive und schwere agentische Arbeit, Flash für alles mit hohem Volumen.
  • Es ist zudem das Mitglied des Paars mit der höheren Nebenläufigkeit.
  • Technisch sind beide identisch zu integrieren: dasselbe thinking-Objekt und dieselben reasoning_effort-Stufen, dasselbe reasoning_content-Feld, das die Gedankenkette trägt, dieselbe Anforderung, dieses Feld bei Turns zurückzugeben, die ein Tool aufgerufen haben, dasselbe Tool Calling mit 128 Funktionen, JSON-Ausgabe und automatisches Prefix-Caching sowie dieselbe FP4/FP8-Mixed-Precision-Verpackung.
  • Die Gewichte stehen unter MIT-Lizenz und sind auf DeepSeeks eigenem Model Hub veröffentlicht.
  • Synthorai stellt DeepSeek V4 Flash über seinen OpenAI-kompatiblen Endpoint bereit, ohne dass Client-Änderungen nötig sind.

FAQ

Lässt sich die DeepSeek V4 Flash API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.138/M Input-Tokens deckt allein dieses Guthaben rund 905 Requests mit je ~8K Tokens gegen DeepSeek V4 Flash ab.

Worin ist DeepSeek V4 Flash am besten?

284B-Parameter-MoE mit 13B aktivierten; hybride Sparse Attention senkt Long-Context-Kosten; MIT-lizenzierte Gewichte mit 1M-Token-Kontext. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet DeepSeek V4 Flash?

DeepSeek V4 Flash kostet auf Synthorai $0.138 pro Million Input-Tokens und $0.275 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.0028/M abgerechnet.

Unterstützt DeepSeek V4 Flash Prompt-Caching?

Ja, automatisch: Über DeepSeek ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.0028/M statt $0.138/M (ungecacht) abgerechnet (TTL kein festes TTL (wird bei Nichtnutzung automatisch geleert)). Prompt-Caching-Guide →

Wie erhalte ich Zugang zu DeepSeek V4 Flash?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="deepseek-v4-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Ist DeepSeek V4 Flash Open Source?

Ja, die Gewichte sind unter der MIT-Lizenz veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →