Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

DeepSeek V4 Flash (0731)

Veröffentlicht 2026-07-31

chatCodeReasoningTool-AufrufePrompt Caching

DeepSeek V4 Flash 0731 ist die Juli-2026-Ausgabe von DeepSeeks schneller, günstiger V4-Flash-Linie und löst das frühere V4 Flash ab, statt als Variante daneben zu stehen.

Eingabe
Text $0.44/M
Ausgabe
Text $1.32/M
Cache-Read
$0.044/M
Kontext
1M
vs. GPT-4o
~91% günstiger

Benchmarks

Über dem Durchschnitt10 / 28
DeepSeek V4 Flash (0731) weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
SWE-Bench Pro
56%
Cybergym
76.7%
JobBench
41.3%
GPQA Diamond
89.9%
Agents' Last Exam
25.2%

Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Preis im Vergleich

Preisposition unter 66 vergleichbaren Modellen

Eingabe$0.44/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Ausgabe$1.32/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Cache-Lesen$0.044/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 1.000.000
Max. Output (Anbieter-Spezifikation) 393.216

Prompt Caching

Modus automatisch
Lebensdauer kein festes TTL (wird bei Nichtnutzung automatisch geleert)

Thinking

Parameter reasoning_effort
Werte minimal · low · medium · high akzeptierte Werte je Anbieter

Modell

Modalitäten Text → Text
Parameter 284B gesamt · 13B aktiv MoE
Lizenz MIT
  • July 2026 release of DeepSeek V4 Flash
  • same 284B/13B-active MoE design, gains from a stronger post-training pipeline rather than a new architecture

laut Offizielle DeepSeek-Dokumentation ↗

Ein Prompt, gemessen über das Gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. PRÜFEN genau 3 Sätze

DeepSeek V4 Flash (0731) bestanden · 3 sentences

Enabling reasoning mode prompts the model to generate extensive internal chain-of-thought tokens before answering, often multiplying total token output per query by several times. This directly inflates costs because we are billed per token, and these reasoning tokens are processed at a premium compute tier that carries a higher price per million tokens. However, this spend buys measurably higher accuracy and fewer failed calls, so we are tracking it against specific error-reduction KPIs to ensure the ROI justifies the increase.

Ausgabe 365 tok (+266 Denken) Latenz 5.1 s

Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. PRÜFEN Fix besteht die Tests

DeepSeek V4 Flash (0731) bestanden · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The original bug stems from initializing `cur` to 0 and only incrementing it when adjacent elements are equal, which counts the number of *equal transitions* rather than the actual run length—so every run of length L is reported as L−1, and a single‑element run (with no transitions) yields 0. Moreover, because `best` is updated only inside the equality branch, it never accounts for a run that ends at the last element if that run is longer than any previously seen (though the real issue remains the off‑by‑one). […]

Ausgabe 1268 tok (+1016 Denken) Latenz 14.0 s

Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. PRÜFEN gültiges JSON, Schema exakt

DeepSeek V4 Flash (0731) bestanden · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": null, "guidance": null }

Ausgabe 1119 tok (+1072 Denken) Latenz 12.3 s

Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. PRÜFEN 120 Wörter, 0 verbotene Wörter

DeepSeek V4 Flash (0731) verfehlt · 141 words, 0 banned, 1 question

**Introducing Prompt Cache for API Gateway** We are pleased to announce Prompt Cache, a new feature that stores and reuses identical prompt prefixes across all connected LLM providers. By automatically recognizing repeated requests, this cache reduces token consumption and lowers latency without altering your application logic. Whether you use OpenAI, Anthropic, or open-source models, the cache operates transparently, ensuring consistent behavior while cutting costs. Developers can configure cache TTL and scoping rules via a simple API call, giving you precise control over data freshness and privacy. This feature also minimizes redundant upstream calls, freeing provider rate limits for more critical workloads. Start caching today through the dashboard or CLI, and watch your operational expenses drop significantly. […]

Ausgabe 254 tok (+80 Denken) Latenz 4.4 s

Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.

DeepSeek V4 Flash (0731) in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash-0731",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Über DeepSeek V4 Flash (0731)

  • Architektur und Größe bleiben unverändert - ein Mixture-of-Experts-Modell mit 284B Gesamtparametern und 13B aktiv zur Inferenzzeit - und DeepSeek führt die Verbesserung auf eine deutlich stärkere Post-Training-Pipeline zurück statt auf ein neues Design, mit Schwerpunkt auf agentischen Workflows und Reasoning-Qualität.
  • Alles, was die Linie betrieblich attraktiv machte, bleibt erhalten: das Kontextfenster von 1 Mio.
  • Tokens, 384K maximale Ausgabe, MIT-lizenzierte Gewichte, Function Calling, strukturierte Ausgabe und Streaming.
  • Das Nachdenken ist standardmäßig aktiv und die Spur kommt in reasoning_content zurück, was hier stärker ins Gewicht fällt als bei den meisten Modellen: Bei kurzen Prompts kann die Denkspur den Großteil der Completion-Tokens ausmachen, sodass ein knappes max_tokens-Budget eine leere Antwort liefert, die aufgewendeten Denk-Tokens aber dennoch abgerechnet werden.
  • Planen Sie das ein oder senken Sie die Reasoning-Stärke, bevor Sie das Modell in latenzkritische Pfade einbauen.
  • Ein- und Ausgabe sind reiner Text; Bildeingaben werden nicht unterstützt, kombinieren Sie es daher mit einem Vision-Modell, statt multimodale Nachrichten zu senden.
  • Da sowohl die datierte Ausgabe als auch der undatierte rollierende Name aufrufbar bleiben, fixieren Sie die datierte ID, wenn Sie reproduzierbares Verhalten brauchen.
  • Synthorai stellt das Modell über den OpenAI-kompatiblen Chat-Completions-Endpunkt bereit.

FAQ

Lässt sich die DeepSeek V4 Flash (0731) API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.44/M Input-Tokens deckt allein dieses Guthaben rund 284 Requests mit je ~8K Tokens gegen DeepSeek V4 Flash (0731) ab.

Worin ist DeepSeek V4 Flash (0731) am besten?

284B MoE mit 13B aktiv, MIT-lizenziert; löst das frühere V4 Flash ab; 1 Mio. Kontext, 384K maximale Ausgabe. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet DeepSeek V4 Flash (0731)?

DeepSeek V4 Flash (0731) kostet auf Synthorai $0.44 pro Million Input-Tokens und $1.32 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.044/M abgerechnet.

Unterstützt DeepSeek V4 Flash (0731) Prompt-Caching?

Ja, automatisch: Über DeepSeek ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.044/M statt $0.44/M (ungecacht) abgerechnet (TTL kein festes TTL (wird bei Nichtnutzung automatisch geleert)). Prompt-Caching-Guide →

Wie erhalte ich Zugang zu DeepSeek V4 Flash (0731)?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="deepseek-v4-flash-0731", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Ist DeepSeek V4 Flash (0731) Open Source?

Ja, die Gewichte sind unter der MIT-Lizenz veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →