Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

DeepSeek V4.1 Flash

Veröffentlicht 2026-09-10

chatVisionCodeReasoningTool-AufrufePrompt Caching

DeepSeek V4.1 Flash ist die nächste Ausgabe der schnellen, wirtschaftlichen V4-Flash-Reihe von DeepSeek, und die wichtigste Änderung ist, dass das Modell nativ multimodal ist: Die Modellkarte beschreibt, dass es Bilder und Text nativ verarbeitet und Text autoregressiv erzeugt, sodass visuelle Eingaben kein separates Vision-Modell mehr daneben erfordern.

Eingabe
Text Bild $0.3/M
Ausgabe
Text $1.2/M
Cache-Read
$0.03/M
Kontext
1M
vs. GPT-4o
~94% günstiger

Benchmarks

Über dem DurchschnittKeins besser16 / 194 / 19
DeepSeek V4.1 Flash weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
NL2Repo
64%
Cybergym
kein anderes Modell war besser 88.1%
GPQA Diamond
90.9%
Agents' Last Exam
31.8%
BabyVision with tools
89.6%

Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Preis im Vergleich

Preisposition unter 65 vergleichbaren Modellen

Eingabe$0.3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Ausgabe$1.2/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Cache-Lesen$0.03/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 1.000.000
Max. Output (Anbieter-Spezifikation) 393.216

Prompt Caching

Modus automatisch
Lebensdauer kein festes TTL (wird bei Nichtnutzung automatisch geleert)

Thinking

Parameter reasoning_effort
Werte minimal · low · medium · high akzeptierte Werte je Anbieter

Modell

Modalitäten Text + Bild → Text
Parameter 552B gesamt · 8B prefill / 16B decode aktiv MoE, Causal Encoder-Decoder
Lizenz MIT

Natively multimodal successor to the V4 Flash line: a 552B-parameter MoE on a Causal Encoder-Decoder stack activating 8B parameters per token at prefill and 16B at decode, with the model card recommending a maximum output of at least 256K tokens.

laut Offizielle DeepSeek-Dokumentation ↗

Ein Prompt, gemessen über das Gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. PRÜFEN genau 3 Sätze

DeepSeek V4.1 Flash bestanden · 3 sentences

Enabling reasoning changed the unit economics: the model now spends extra billable tokens internally to “think” before producing the answer, and those reasoning tokens are charged like output tokens even though users never see them. That added token generation—plus longer contexts and occasional retries on harder prompts—roughly doubled our cost per request. We can control this by capping reasoning depth, routing only complex queries to reasoning models, and caching common prompts to bring the bill back down.

Ausgabe 423 tok (+327 Denken) Latenz 14.6 s

Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. PRÜFEN Fix besteht die Tests

DeepSeek V4.1 Flash bestanden · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` is counting equal adjacent pairs, not elements in the current run: every time `xs[i] == xs[i - 1]`, the run length increases by one element, but the first element of the run was never counted, so all runs are undercounted by one. Also, `best` starts at `0`, so single-element inputs return `0` instead of `1`, and a one-element run ending at the last index is missed entirely.

Ausgabe 918 tok (+733 Denken) Latenz 11.4 s

Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. PRÜFEN gültiges JSON, Schema exakt

DeepSeek V4.1 Flash bestanden · 5/5 fields, guidance "withheld pending the Q4 close"

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":"withheld pending the Q4 close"}

Ausgabe 1707 tok (+1667 Denken) Latenz 15.1 s

Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. PRÜFEN 120 Wörter, 0 verbotene Wörter

DeepSeek V4.1 Flash bestanden · 116 words, 0 banned, 1 question

Today we're launching Cross-Provider Prompt Cache for our API gateway. It stores identical prompt requests and their responses across supported model providers, then serves cached results when a match is found. Teams can cut duplicate inference costs, reduce latency, and keep behavior consistent during provider failover. The cache works with configurable TTLs, per-route rules, and cache-key controls, so you decide what is reusable and what must stay fresh. Does your application send the same prompts to multiple providers? Now your gateway can answer many of those calls without another upstream request. Existing observability dashboards show hit rates, saved tokens, and estimated spend reduction. Enable it in the gateway console, set your policy, and start caching today.

Ausgabe 917 tok (+770 Denken) Latenz 9.0 s

Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.

DeepSeek V4.1 Flash in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Über DeepSeek V4.1 Flash

  • Der Entwurf ist ein echter Bruch und keine Nachjustierung.
  • DeepSeek beschreibt eine Causal-Encoder-Decoder-Architektur - einen 40-lagigen Transformer, aufgebaut als 20-lagiger kausaler Encoder gefolgt von einem 20-lagigen Decoder - über einem Mixture-of-Experts-Backbone mit 552B Parametern, das pro Token nur 8B Parameter im Prefill und 16B im Decode aktiviert; diese Aufteilung zielt unmittelbar auf eingabelastige agentische Arbeitslasten.
  • Beim Speicher setzt sich dasselbe Motiv fort: Compressed Sparse Attention 2 zusammen mit FP4-Main-KV-Caching senkt den globalen KV-Cache auf 890 Bytes pro Token, etwa ein Viertel von DeepSeek V4 Flash, während SWA Bounded Replay den persistenten KV-Bedarf auf rund ein Achtel reduziert.
  • Das Kontextfenster reicht bis 1M Token, die Gewichte stehen unter MIT-Lizenz, und Tool-Aufrufe werden unterstützt.
  • Einplanen sollte man vor allem das Reasoning: Die Spur kommt getrennt von der Antwort zurück und kann bei kurzen Prompts fast die gesamten Completion-Token ausmachen, sodass ein zu knappes max_tokens eine leere Antwort liefert, die für die aufgewendeten Denk-Token dennoch voll berechnet wird.
  • Der Reasoning-Aufwand ist einstellbar, und die Modellkarte dokumentiert ihn als kontinuierliche Steuerung statt als eine Handvoll benannter Stufen.
  • Synthorai stellt das Modell über den OpenAI-kompatiblen Chat-Completions-Endpunkt bereit.

FAQ

Lässt sich die DeepSeek V4.1 Flash API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.3/M Input-Tokens deckt allein dieses Guthaben rund 416 Requests mit je ~8K Tokens gegen DeepSeek V4.1 Flash ab.

Worin ist DeepSeek V4.1 Flash am besten?

Nativ multimodal - Bilder und Text als Eingabe; 552B MoE, 8B aktiv im Prefill; 1M Kontext, Gewichte unter MIT-Lizenz. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash kostet auf Synthorai $0.3 pro Million Input-Tokens und $1.2 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.03/M abgerechnet.

Unterstützt DeepSeek V4.1 Flash Prompt-Caching?

Ja, automatisch: Über DeepSeek ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.03/M statt $0.3/M (ungecacht) abgerechnet (TTL kein festes TTL (wird bei Nichtnutzung automatisch geleert)). Prompt-Caching-Guide →

Wie erhalte ich Zugang zu DeepSeek V4.1 Flash?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="deepseek-v4.1-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Ist DeepSeek V4.1 Flash Open Source?

Ja, die Gewichte sind unter der MIT-Lizenz (offizielles Repository im Über-Abschnitt verlinkt) veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →