DeepSeek V4 Pro 0813 est la version d'août 2026 de la gamme phare V4 Pro de DeepSeek, et la fiche du modèle la présente comme remplaçant la version préliminaire plutôt que comme une variante placée à côté d'elle.
- Entrée
- texte $1.32/M
- Sortie
- texte $3.96/M
- Lecture de cache
- $0.132/M
- Contexte
- 1M
- vs GPT-4o
- ~74% moins cher
Prix catalogue du fournisseur : sans majoration de plateforme, paiement à l'usage. Ce sont les prix catalogue officiels. Les clients connectés peuvent voir les prix effectifs incluant les remises de l’espace de travail sur /console/pricing. Prix d'entrée effectif avec 70 % de hits de cache :$0.4884/M. Mise en cache automatique par préfixe KV sur disque : les hits de cache sont facturés au tarif de lecture de cache remisé, sans opt-in ni frais d'écriture. Ce tarif de lecture en cache est publié comme un montant par million distinct. Aucun frais distinct pour une écriture en cache.
Prix · position parmi 62 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Fenêtre de contexte (spécification du fournisseur) | 1 000 000 |
|---|---|
| Sortie max (spéc. fournisseur) | 393 216 |
Mise en cache
| Mode | automatique |
|---|---|
| Durée de vie | pas de TTL fixe (purgé lorsqu'il n'est plus utilisé) |
Raisonnement
| Paramètre du fournisseur | reasoning_effort |
|---|---|
| Valeurs acceptées | the model card documents low · high · max |
| Comportement du raisonnement | The trace returns in reasoning_content and on short prompts can account for the large majority of the completion tokens, so a tight max_tokens budget returns an empty answer that is still billed in full. DeepSeek documents three effort levels for its own API; platforms that host the model may accept a different set, so confirm against the platform you are routed to. |
| Paramètre | reasoning_effort |
| Valeurs | minimal · low · medium · high la surface de paramètres de la passerelle — le mappage fournisseur ci-dessus s'applique |
Modèle
| Modalités | texte → texte |
|---|---|
| Licence | MIT |
August 2026 release of DeepSeek V4 Pro, superseding the preview version with what the model card describes as greatly enhanced agentic capabilities, and shipping with a DSpark speculative decoding module attached. The card states neither a parameter count nor an architecture, so neither is listed here.
Un prompt, mesuré via la passerelle
DeepSeek V4 Pro (0813) réussi · 3 sentences
Enabling reasoning causes the model to generate a hidden chain-of-thought with many additional tokens before producing the final answer, which sharply increases compute consumption per request. Those extra reasoning tokens are billed at the same or higher rates, so total usage doubled even though the volume of final outputs stayed similar. We can control this by adjusting reasoning effort, setting token limits, or routing only complex requests through reasoning mode.
sortie 308 tok (+226 réflexion) latence 5.1 s
Suivi de l'instruction (exactement trois phrases — comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.
DeepSeek V4 Pro (0813) réussi · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` was initialized to `0` and only counted adjacent matching pairs, so a run of length `n` produced `n - 1` (or `0` for a single element) instead of `n`. The code also reset to `0` on a change, when the new run should start at length `1`. Initializing `cur` and `best` to `1` fixes both the single-element case and runs ending at the last index.
sortie 1315 tok (+1130 réflexion) latence 16.9 s
Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.
DeepSeek V4 Pro (0813) réussi · 5/5 fields, guidance null
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":null}
sortie 2155 tok (+2121 réflexion) latence 26.0 s
Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.
DeepSeek V4 Pro (0813) réussi · 121 words, 0 banned, 1 question
Introducing cross-provider prompt caching in our API gateway. Send a prompt once, and the gateway stores its computed prefix across Anthropic, OpenAI, and other LLM providers. Subsequent requests with the same prompt hit the cache, cutting latency and token costs while keeping outputs consistent across routing decisions and provider failovers. Teams can route identical prompts between providers without reprocessing shared context or lengthy system instructions. How much could you save on repeated prompt prefixes? The cache respects provider-specific key formats, handles TTLs automatically, and works with streaming and batch requests. Enable it with one configuration flag—no changes to your application code. Available today on all plans. Monitor cache hit rates, token savings, and provider-specific performance metrics in the live dashboard.
sortie 2845 tok (+2694 réflexion) latence 25.5 s
Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.
Utilisez DeepSeek V4 Pro (0813) en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro-0813",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-pro-0813",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro-0813",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-pro-0813",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-pro-0813")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));À propos de DeepSeek V4 Pro (0813)
- DeepSeek attribue ce changement à des capacités agentiques nettement renforcées et à des gains de performance qu'il décrit comme particulièrement marqués en production ; la version embarque en outre un module de décodage spéculatif DSpark.
- La fiche est exceptionnellement avare en spécifications : elle n'indique ni nombre de paramètres ni architecture, si bien que tout chiffre repris de la V4 Pro précédente doit être considéré comme non confirmé pour cette version.
- Ce qu'elle précise, en revanche, c'est le domaine de fonctionnement : des poids sous licence MIT, une longueur de sortie maximale recommandée de 384K jetons aux niveaux d'effort de raisonnement élevés, et un paramètre reasoning_effort documenté sur trois niveaux, low, high et max.
- C'est le raisonnement qu'il faut anticiper.
- La trace revient dans reasoning_content et, sur des invites courtes, elle peut représenter la grande majorité des jetons de sortie : un budget max_tokens trop serré renverra donc une réponse vide, intégralement facturée pour les jetons consacrés à la réflexion.
- Prévoyez cette marge, ou abaissez le niveau d'effort, avant de câbler le modèle dans un chemin sensible à la latence.
- Le coût de l'effort ne se limite pas à la sortie : monter d'un cran allonge le préambule à partir duquel le modèle travaille, de sorte qu'un même message facture davantage de jetons d'entrée à un réglage élevé qu'à un réglage bas.
- Le modèle est exclusivement textuel en entrée comme en sortie ; l'entrée image n'est pas prise en charge, associez-le donc à un modèle de vision plutôt que d'envoyer des messages multimodaux.
- Comme la version datée et le nom glissant restent tous deux appelables, épinglez l'identifiant daté lorsque vous avez besoin d'un comportement reproductible et attendez-vous à ce que le nom sans date avance avec le temps.
- Synthorai le propose via le point de terminaison chat completions compatible OpenAI, sans modification côté client.
FAQ
Peut-on essayer l'API DeepSeek V4 Pro (0813) gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $1.32/M de tokens en entrée, ce crédit couvre à lui seul environ 94 requêtes de ~8K tokens sur DeepSeek V4 Pro (0813).
Quels sont les points forts de DeepSeek V4 Pro (0813) ?
Remplace la préversion de V4 Pro ; licence MIT, sortie maximale recommandée de 384K ; reasoning_effort documenté en low, high et max. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte DeepSeek V4 Pro (0813) ?
Sur Synthorai, DeepSeek V4 Pro (0813) coûte $1.32 par million de tokens en entrée et $3.96 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.132/M.
DeepSeek V4 Pro (0813) prend-il en charge la mise en cache des prompts ?
Oui, automatiquement : les prompts servis par DeepSeek sont mis en cache sans modification de code. Les tokens d'entrée en cache sont facturés $0.132/M contre $1.32/M hors cache (TTL pas de TTL fixe (purgé lorsqu'il n'est plus utilisé)). Guide de mise en cache des prompts →
Comment obtenir l'accès à DeepSeek V4 Pro (0813) ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="deepseek-v4-pro-0813", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
DeepSeek V4 Pro (0813) est-il open source ?
Oui : les poids sont publiés sous MIT (licence) (dépôt officiel lié dans la section À propos). Ou passez-vous des GPU : la version hébergée ici est au paiement à l'usage, sans infrastructure à exploiter. Exécuter des modèles à poids ouverts →
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.