DeepSeek V4 Pro 0813 ist die Ausgabe der Flaggschiff-Reihe V4 Pro von DeepSeek vom August 2026, und die Modellkarte stellt sie als Nachfolger der Vorschauversion dar und nicht als danebenstehende Variante.
- Eingabe
- Text $1.32/M
- Ausgabe
- Text $3.96/M
- Cache-Read
- $0.132/M
- Kontext
- 1M
- vs. GPT-4o
- ~74% günstiger
Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten. Effektiver Input-Preis bei 70 % Cache-Trefferquote:$0.4884/M. Automatisches Disk-KV-Präfix-Caching: Cache-Treffer werden zur vergünstigten Cache-Lese-Rate abgerechnet, ohne Opt-in und ohne Schreibgebühr. Dieser Cache-Lesepreis ist als eigener Preis pro Million veröffentlicht. Keine gesonderte Gebühr für einen Cache-Schreibvorgang.
Preis · Position unter 62 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.000.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 393.216 |
Prompt Caching
| Modus | automatisch |
|---|---|
| Lebensdauer | kein festes TTL (wird bei Nichtnutzung automatisch geleert) |
Thinking
| Anbieter-Parameter | reasoning_effort |
|---|---|
| Zulässige Werte | the model card documents low · high · max |
| Thinking-Verhalten | The trace returns in reasoning_content and on short prompts can account for the large majority of the completion tokens, so a tight max_tokens budget returns an empty answer that is still billed in full. DeepSeek documents three effort levels for its own API; platforms that host the model may accept a different set, so confirm against the platform you are routed to. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways — das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text → Text |
|---|---|
| Lizenz | MIT |
August 2026 release of DeepSeek V4 Pro, superseding the preview version with what the model card describes as greatly enhanced agentic capabilities, and shipping with a DSpark speculative decoding module attached. The card states neither a parameter count nor an architecture, so neither is listed here.
Ein Prompt, gemessen über das Gateway
DeepSeek V4 Pro (0813) bestanden · 3 sentences
Enabling reasoning causes the model to generate a hidden chain-of-thought with many additional tokens before producing the final answer, which sharply increases compute consumption per request. Those extra reasoning tokens are billed at the same or higher rates, so total usage doubled even though the volume of final outputs stayed similar. We can control this by adjusting reasoning effort, setting token limits, or routing only complex requests through reasoning mode.
Ausgabe 308 tok (+226 Denken) Latenz 5.1 s
Befolgen der Anweisung (genau drei Sätze — abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
DeepSeek V4 Pro (0813) bestanden · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` was initialized to `0` and only counted adjacent matching pairs, so a run of length `n` produced `n - 1` (or `0` for a single element) instead of `n`. The code also reset to `0` on a change, when the new run should start at length `1`. Initializing `cur` and `best` to `1` fixes both the single-element case and runs ending at the last index.
Ausgabe 1315 tok (+1130 Denken) Latenz 16.9 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
DeepSeek V4 Pro (0813) bestanden · 5/5 fields, guidance null
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":null}
Ausgabe 2155 tok (+2121 Denken) Latenz 26.0 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
DeepSeek V4 Pro (0813) bestanden · 121 words, 0 banned, 1 question
Introducing cross-provider prompt caching in our API gateway. Send a prompt once, and the gateway stores its computed prefix across Anthropic, OpenAI, and other LLM providers. Subsequent requests with the same prompt hit the cache, cutting latency and token costs while keeping outputs consistent across routing decisions and provider failovers. Teams can route identical prompts between providers without reprocessing shared context or lengthy system instructions. How much could you save on repeated prompt prefixes? The cache respects provider-specific key formats, handles TTLs automatically, and works with streaming and batch requests. Enable it with one configuration flag—no changes to your application code. Available today on all plans. Monitor cache hit rates, token savings, and provider-specific performance metrics in the live dashboard.
Ausgabe 2845 tok (+2694 Denken) Latenz 25.5 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
DeepSeek V4 Pro (0813) in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro-0813",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro-0813",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro-0813",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro-0813",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro-0813")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über DeepSeek V4 Pro (0813)
- DeepSeek führt die Änderung auf deutlich verstärkte agentische Fähigkeiten und auf Leistungsverbesserungen zurück, die das Unternehmen im Produktivbetrieb als besonders ausgeprägt beschreibt; zudem liegt der Ausgabe ein DSpark-Modul für spekulatives Decoding bei.
- Die Modellkarte ist bei den Spezifikationen ungewöhnlich sparsam: Sie nennt weder eine Parameterzahl noch eine Architektur, sodass jede aus der früheren V4 Pro übernommene Angabe für diese Ausgabe als unbestätigt zu behandeln ist.
- Was sie sehr wohl nennt, ist der Betriebsrahmen: MIT-lizenzierte Gewichte, eine empfohlene maximale Ausgabelänge von 384K Token bei den höheren Stufen des Reasoning-Aufwands und ein Parameter reasoning_effort, der mit drei Stufen dokumentiert ist, low, high und max.
- Einplanen muss man vor allem das Reasoning.
- Die Spur kommt in reasoning_content zurück und kann bei kurzen Prompts den weit überwiegenden Teil der Ausgabetoken ausmachen; ein zu knappes max_tokens-Budget liefert deshalb eine leere Antwort, die für die zum Nachdenken verbrauchten Token dennoch voll berechnet wird.
- Planen Sie diesen Spielraum ein oder senken Sie die Stufe, bevor Sie das Modell in einen latenzkritischen Pfad einbauen.
- Die Kosten der Stufe betreffen nicht nur die Ausgabe: Eine höhere Einstellung verlängert die Vorrede, auf der das Modell aufsetzt, sodass dieselbe Nachricht bei hoher Stufe mehr Eingabetoken abrechnet als bei niedriger.
- Das Modell arbeitet ein- und ausgangsseitig ausschließlich mit Text; Bildeingaben werden nicht unterstützt, kombinieren Sie es daher mit einem Vision-Modell, statt multimodale Nachrichten zu senden.
- Da sowohl die datierte Ausgabe als auch der fortlaufende Name aufrufbar bleiben, fixieren Sie die datierte id, wenn Sie reproduzierbares Verhalten brauchen, und rechnen Sie damit, dass der undatierte Name mit der Zeit weiterrückt.
- Synthorai stellt das Modell über den OpenAI-kompatiblen chat-completions-Endpunkt bereit, ohne Änderungen auf Client-Seite.
FAQ
Lässt sich die DeepSeek V4 Pro (0813) API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1.32/M Input-Tokens deckt allein dieses Guthaben rund 94 Requests mit je ~8K Tokens gegen DeepSeek V4 Pro (0813) ab.
Worin ist DeepSeek V4 Pro (0813) am besten?
Löst die V4-Pro-Vorschau ab; MIT-Lizenz, empfohlene Maximalausgabe 384K; reasoning_effort dokumentiert als low, high und max. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet DeepSeek V4 Pro (0813)?
DeepSeek V4 Pro (0813) kostet auf Synthorai $1.32 pro Million Input-Tokens und $3.96 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.132/M abgerechnet.
Unterstützt DeepSeek V4 Pro (0813) Prompt-Caching?
Ja, automatisch: Über DeepSeek ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.132/M statt $1.32/M (ungecacht) abgerechnet (TTL kein festes TTL (wird bei Nichtnutzung automatisch geleert)). Prompt-Caching-Guide →
Wie erhalte ich Zugang zu DeepSeek V4 Pro (0813)?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="deepseek-v4-pro-0813", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Ist DeepSeek V4 Pro (0813) Open Source?
Ja, die Gewichte sind unter der MIT-Lizenz (offizielles Repository im Über-Abschnitt verlinkt) veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.