DeepSeek V4 Pro 0813 ist die Ausgabe der Flaggschiff-Reihe V4 Pro von DeepSeek vom August 2026, und die Modellkarte stellt sie als Nachfolger der Vorschauversion dar und nicht als danebenstehende Variante.
- Eingabe
- Text $1.32/M
- Ausgabe
- Text $3.96/M
- Cache-Lesen
- $0.132/M
- Kontext
- 1M
- vs. GPT-4o
- ~74% günstiger
Benchmarks
Anbieterangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Der Preis im Feld von 68 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Angegeben sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibzugriffe stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (laut Anbieter) | 1.000.000 |
|---|---|
| Max. Ausgabe (laut Anbieter) | 393.216 |
Prompt-Caching
| Modus | automatisch |
|---|---|
| Lebensdauer | kein festes TTL (wird bei Nichtnutzung automatisch geleert) |
Thinking
| Anbieter-Parameter | reasoning_effort |
|---|---|
| Zulässige Werte | the model card documents low · high · max |
| Thinking-Verhalten | The trace returns in reasoning_content and on short prompts can account for the large majority of the completion tokens, so a tight max_tokens budget returns an empty answer that is still billed in full. DeepSeek documents three effort levels for its own API; platforms that host the model may accept a different set, so confirm against the platform you are routed to. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high Parameter des Gateways; maßgeblich ist das Anbieter-Mapping oben |
Modell
| Modalitäten | Text → Text |
|---|---|
| Lizenz | MIT |
August 2026 release of DeepSeek V4 Pro, superseding the preview version with what the model card describes as greatly enhanced agentic capabilities, and shipping with a DSpark speculative decoding module attached. The card states neither a parameter count nor an architecture, so neither is listed here.
Ein Prompt, gemessen über das Gateway
DeepSeek V4 Pro (0813) bestanden · 3 sentences
Enabling reasoning causes the model to generate a hidden chain-of-thought with many additional tokens before producing the final answer, which sharply increases compute consumption per request. Those extra reasoning tokens are billed at the same or higher rates, so total usage doubled even though the volume of final outputs stayed similar. We can control this by adjusting reasoning effort, setting token limits, or routing only complex requests through reasoning mode.
Ausgabe 308 tok (+226 Thinking) Latenz 5.1 s
Befolgen der Anweisung (genau drei Sätze, das lässt sich zählen), Zuschnitt auf die Zielgruppe (Tonfall für einen CFO) und die Abrechnungslücke durch nicht sichtbares Thinking, die die Token-Zähler unten offenlegen.
DeepSeek V4 Pro (0813) bestanden · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` was initialized to `0` and only counted adjacent matching pairs, so a run of length `n` produced `n - 1` (or `0` for a single element) instead of `n`. The code also reset to `0` on a change, when the new run should start at length `1`. Initializing `cur` and `best` to `1` fixes both the single-element case and runs ending at the last index.
Ausgabe 1315 tok (+1130 Thinking) Latenz 16.9 s
Ob der Fix wirklich korrekt ist (er lässt sich ausführen), wie dicht die Erklärung ist und wie sparsam das Modell bei einer klar begrenzten Aufgabe mit Tokens umgeht.
DeepSeek V4 Pro (0813) bestanden · 5/5 fields, guidance null
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":null}
Ausgabe 2155 tok (+2121 Thinking) Latenz 26.0 s
Schema-Treue (keine erfundenen Felder), Anreiz zum Halluzinieren (der Text nennt ausdrücklich keine guidance) und Unterschiede zwischen den Wegen zur strukturierten Ausgabe.
DeepSeek V4 Pro (0813) bestanden · 121 words, 0 banned, 1 question
Introducing cross-provider prompt caching in our API gateway. Send a prompt once, and the gateway stores its computed prefix across Anthropic, OpenAI, and other LLM providers. Subsequent requests with the same prompt hit the cache, cutting latency and token costs while keeping outputs consistent across routing decisions and provider failovers. Teams can route identical prompts between providers without reprocessing shared context or lengthy system instructions. How much could you save on repeated prompt prefixes? The cache respects provider-specific key formats, handles TTLs automatically, and works with streaming and batch requests. Enable it with one configuration flag—no changes to your application code. Available today on all plans. Monitor cache hit rates, token savings, and provider-specific performance metrics in the live dashboard.
Ausgabe 2845 tok (+2694 Thinking) Latenz 25.5 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, genau eine Frage), stilistische Handschrift und Kontrolle über die Länge.
DeepSeek V4 Pro (0813) in 30 Sekunden nutzen
OpenAI-kompatibel: base_url austauschen, SDK behalten. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro-0813",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro-0813",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro-0813",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro-0813",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro-0813")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über DeepSeek V4 Pro (0813)
- DeepSeek führt die Änderung auf deutlich verstärkte agentische Fähigkeiten und auf Leistungsverbesserungen zurück, die das Unternehmen im Produktivbetrieb als besonders ausgeprägt beschreibt; zudem liegt der Ausgabe ein DSpark-Modul für spekulatives Decoding bei.
- Die Modellkarte ist bei den Spezifikationen ungewöhnlich sparsam: Sie nennt weder eine Parameterzahl noch eine Architektur, sodass jede aus der früheren V4 Pro übernommene Angabe für diese Ausgabe als unbestätigt zu behandeln ist.
- Was sie sehr wohl nennt, ist der Betriebsrahmen: MIT-lizenzierte Gewichte, eine empfohlene maximale Ausgabelänge von 384K Token bei den höheren Stufen des Reasoning-Aufwands und ein Parameter reasoning_effort, der mit drei Stufen dokumentiert ist, low, high und max.
- Einplanen muss man vor allem das Reasoning.
- Die Spur kommt in reasoning_content zurück und kann bei kurzen Prompts den weit überwiegenden Teil der Ausgabetoken ausmachen; ein zu knappes max_tokens-Budget liefert deshalb eine leere Antwort, die für die zum Nachdenken verbrauchten Token dennoch voll berechnet wird.
- Planen Sie diesen Spielraum ein oder senken Sie die Stufe, bevor Sie das Modell in einen latenzkritischen Pfad einbauen.
- Die Kosten der Stufe betreffen nicht nur die Ausgabe: Eine höhere Einstellung verlängert die Vorrede, auf der das Modell aufsetzt, sodass dieselbe Nachricht bei hoher Stufe mehr Eingabetoken abrechnet als bei niedriger.
- Das Modell arbeitet ein- und ausgangsseitig ausschließlich mit Text; Bildeingaben werden nicht unterstützt, kombinieren Sie es daher mit einem Vision-Modell, statt multimodale Nachrichten zu senden.
- Da sowohl die datierte Ausgabe als auch der fortlaufende Name aufrufbar bleiben, fixieren Sie die datierte id, wenn Sie reproduzierbares Verhalten brauchen, und rechnen Sie damit, dass der undatierte Name mit der Zeit weiterrückt.
- Synthorai stellt das Modell über den OpenAI-kompatiblen chat-completions-Endpunkt bereit, ohne Änderungen auf Client-Seite.
FAQ
Lässt sich die DeepSeek V4 Pro (0813) API kostenlos testen?
Ja. Neue Konten erhalten 10 Testaufrufe und bis zu $1 Gratisguthaben, ohne Kreditkarte. Bei $1.32/M für Eingabe-Tokens reicht allein dieses Guthaben für rund 94 Anfragen an DeepSeek V4 Pro (0813) mit je ~8K Tokens.
Worin ist DeepSeek V4 Pro (0813) am besten?
Löst die V4-Pro-Vorschau ab; MIT-Lizenz, empfohlene Maximalausgabe 384K; reasoning_effort dokumentiert als low, high und max. Mehr dazu im Über-Abschnitt, der auf den offiziellen Release Notes des Anbieters beruht.
Was kostet DeepSeek V4 Pro (0813)?
DeepSeek V4 Pro (0813) kostet auf Synthorai $1.32 pro Million Eingabe-Tokens und $3.96 pro Million Ausgabe-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattformaufschlag. Gecachte Eingabe-Tokens werden mit $0.132/M abgerechnet.
Unterstützt DeepSeek V4 Pro (0813) Prompt-Caching?
Ja, automatisch: Über DeepSeek ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Eingabe-Tokens werden mit $0.132/M statt $1.32/M (ungecacht) abgerechnet (TTL kein festes TTL (wird bei Nichtnutzung automatisch geleert)). Leitfaden zum Prompt-Caching →
Wie erhalte ich Zugang zu DeepSeek V4 Pro (0813)?
Setzen Sie in Ihrem vorhandenen OpenAI SDK base_url="https://synthorai.io/v1" und model="deepseek-v4-pro-0813", mehr ist nicht nötig. Ein API-Schlüssel gilt für alle Modelle im Gateway.
Ist DeepSeek V4 Pro (0813) Open Source?
Ja, die Gewichte sind unter der MIT-Lizenz (offizielles Repository im Über-Abschnitt verlinkt) veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite stammt aus der oben verlinkten Dokumentation des Anbieters und trägt das Datum, an dem wir ihn geprüft haben. Preise vergleichen wir über den gesamten Katalog. Spezifikationen, die Anbieter unterschiedlich definieren, zeigen wir mit einem Hinweis auf den Unterschied und nicht als Diagramm. Wir messen hier nichts selbst und vergeben keine Bewertungen.