Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

DeepSeek V4 Pro (0813)

Date de sortie : 2026-08-13

chatCodeRaisonnementAppel d'outilsMise en cache des prompts

DeepSeek V4 Pro 0813 est la version d'août 2026 de la gamme phare V4 Pro de DeepSeek, et la fiche du modèle la présente comme remplaçant la version préliminaire plutôt que comme une variante placée à côté d'elle.

Entrée
texte $1.32/M
Sortie
texte $3.96/M
Lecture de cache
$0.132/M
Contexte
1M
vs GPT-4o
~74% moins cher

Benchmarks

Au-dessus de la moyenneNon dépassé13 / 211 / 21
DeepSeek V4 Pro (0813) autres modèles mesurés moyenne des modèles comparés ★ aucun autre modèle n'a fait mieux
DeepSWE 1.1
62.7%
Cybergym
83.3%
GDPval-AA v2 Elo · 1508-1769 selon Z.ai · 2026-09-04
1590
GPQA Diamond
92.4%
Agents' Last Exam
25.7%

Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Le prix en perspective

Position du prix parmi 68 modèles comparables

Entrée$1.32/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Sortie$3.96/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lecture de cache$0.132/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barre situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises liées au batch, à la région et aux écritures de cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 1 000 000
Sortie max (spéc. fournisseur) 393 216

Mise en cache

Mode automatique
Durée de vie pas de TTL fixe (purgé lorsqu'il n'est plus utilisé)

Réflexion

Paramètre du fournisseur reasoning_effort
Valeurs acceptées the model card documents low · high · max
Comportement de la réflexion The trace returns in reasoning_content and on short prompts can account for the large majority of the completion tokens, so a tight max_tokens budget returns an empty answer that is still billed in full. DeepSeek documents three effort levels for its own API; platforms that host the model may accept a different set, so confirm against the platform you are routed to.
Paramètre reasoning_effort
Valeurs minimal · low · medium · high paramètres exposés par la passerelle ; la correspondance avec ceux du fournisseur, ci-dessus, s'applique

Modèle

Modalités texte → texte
Licence MIT

August 2026 release of DeepSeek V4 Pro, superseding the preview version with what the model card describes as greatly enhanced agentic capabilities, and shipping with a DSpark speculative decoding module attached. The card states neither a parameter count nor an architecture, so neither is listed here.

selon docs officielles DeepSeek ↗

Un prompt, mesuré via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. CRITÈRE exactement 3 phrases

DeepSeek V4 Pro (0813) réussi · 3 sentences

Enabling reasoning causes the model to generate a hidden chain-of-thought with many additional tokens before producing the final answer, which sharply increases compute consumption per request. Those extra reasoning tokens are billed at the same or higher rates, so total usage doubled even though the volume of final outputs stayed similar. We can control this by adjusting reasoning effort, setting token limits, or routing only complex requests through reasoning mode.

sortie 308 tok (+226 réflexion) latence 5.1 s

Le respect de la consigne (exactement trois phrases, ça se compte), l'adaptation au public visé (le registre d'un directeur financier) et l'écart de facturation dû à la réflexion masquée, que révèlent les compteurs de tokens ci-dessous.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. CRITÈRE le correctif passe les tests

DeepSeek V4 Pro (0813) réussi · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` was initialized to `0` and only counted adjacent matching pairs, so a run of length `n` produced `n - 1` (or `0` for a single element) instead of `n`. The code also reset to `0` on a change, when the new run should start at length `1`. Initializing `cur` and `best` to `1` fixes both the single-element case and runs ending at the last index.

sortie 1315 tok (+1130 réflexion) latence 16.9 s

La justesse réelle du correctif (il s'exécute), la densité de l'explication et l'économie de tokens sur une tâche bien délimitée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. CRITÈRE JSON valide, schéma exact

DeepSeek V4 Pro (0813) réussi · 5/5 fields, guidance null

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":null}

sortie 2155 tok (+2121 réflexion) latence 26.0 s

Le respect du schéma (aucun champ inventé), la tentation d'halluciner (le texte indique que la guidance n'est pas communiquée) et les différences entre les mécanismes de sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. CRITÈRE 120 mots, 0 mot interdit

DeepSeek V4 Pro (0813) réussi · 121 words, 0 banned, 1 question

Introducing cross-provider prompt caching in our API gateway. Send a prompt once, and the gateway stores its computed prefix across Anthropic, OpenAI, and other LLM providers. Subsequent requests with the same prompt hit the cache, cutting latency and token costs while keeping outputs consistent across routing decisions and provider failovers. Teams can route identical prompts between providers without reprocessing shared context or lengthy system instructions. How much could you save on repeated prompt prefixes? The cache respects provider-specific key formats, handles TTLs automatically, and works with streaming and batch requests. Enable it with one configuration flag—no changes to your application code. Available today on all plans. Monitor cache hit rates, token savings, and provider-specific performance metrics in the live dashboard.

sortie 2845 tok (+2694 réflexion) latence 25.5 s

Le respect des contraintes (nombre de mots, liste de mots interdits, une seule question), l'empreinte stylistique et la maîtrise de la longueur.

Utilisez DeepSeek V4 Pro (0813) en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro-0813",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

À propos de DeepSeek V4 Pro (0813)

  • DeepSeek attribue ce changement à des capacités agentiques nettement renforcées et à des gains de performance qu'il décrit comme particulièrement marqués en production ; la version embarque en outre un module de décodage spéculatif DSpark.
  • La fiche est exceptionnellement avare en spécifications : elle n'indique ni nombre de paramètres ni architecture, si bien que tout chiffre repris de la V4 Pro précédente doit être considéré comme non confirmé pour cette version.
  • Ce qu'elle précise, en revanche, c'est le domaine de fonctionnement : des poids sous licence MIT, une longueur de sortie maximale recommandée de 384K jetons aux niveaux d'effort de raisonnement élevés, et un paramètre reasoning_effort documenté sur trois niveaux, low, high et max.
  • C'est le raisonnement qu'il faut anticiper.
  • La trace revient dans reasoning_content et, sur des invites courtes, elle peut représenter la grande majorité des jetons de sortie : un budget max_tokens trop serré renverra donc une réponse vide, intégralement facturée pour les jetons consacrés à la réflexion.
  • Prévoyez cette marge, ou abaissez le niveau d'effort, avant de câbler le modèle dans un chemin sensible à la latence.
  • Le coût de l'effort ne se limite pas à la sortie : monter d'un cran allonge le préambule à partir duquel le modèle travaille, de sorte qu'un même message facture davantage de jetons d'entrée à un réglage élevé qu'à un réglage bas.
  • Le modèle est exclusivement textuel en entrée comme en sortie ; l'entrée image n'est pas prise en charge, associez-le donc à un modèle de vision plutôt que d'envoyer des messages multimodaux.
  • Comme la version datée et le nom glissant restent tous deux appelables, épinglez l'identifiant daté lorsque vous avez besoin d'un comportement reproductible et attendez-vous à ce que le nom sans date avance avec le temps.
  • Synthorai le propose via le point de terminaison chat completions compatible OpenAI, sans modification côté client.

FAQ

Peut-on essayer l'API DeepSeek V4 Pro (0813) gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $1.32/M de tokens en entrée, ce crédit couvre à lui seul environ 94 requêtes de ~8K tokens sur DeepSeek V4 Pro (0813).

Quels sont les points forts de DeepSeek V4 Pro (0813) ?

Remplace la préversion de V4 Pro ; licence MIT, sortie maximale recommandée de 384K ; reasoning_effort documenté en low, high et max. La section À propos en donne un aperçu complet, tiré des notes de version du fournisseur.

Combien coûte DeepSeek V4 Pro (0813) ?

Sur Synthorai, DeepSeek V4 Pro (0813) coûte $1.32 par million de tokens en entrée et $3.96 par million de tokens en sortie, soit le tarif public du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.132/M.

DeepSeek V4 Pro (0813) prend-il en charge la mise en cache des prompts ?

Oui, automatiquement : les prompts servis par DeepSeek sont mis en cache sans modification de code. Les tokens d'entrée en cache sont facturés $0.132/M contre $1.32/M hors cache (TTL pas de TTL fixe (purgé lorsqu'il n'est plus utilisé)). Guide de mise en cache des prompts →

Comment obtenir l'accès à DeepSeek V4 Pro (0813) ?

Dans votre SDK OpenAI actuel, indiquez base_url="https://synthorai.io/v1" et model="deepseek-v4-pro-0813", et c'est tout. Une seule clé API donne accès à tous les modèles de la passerelle.

DeepSeek V4 Pro (0813) est-il open source ?

Oui : les poids sont publiés sous licence MIT (dépôt officiel lié dans la section À propos). Vous pouvez aussi vous passer de GPU : la version hébergée ici est facturée à l'usage, sans infrastructure à gérer. Exécuter des modèles à poids ouverts →

Modèles associés

Comparer

Chaque valeur de cette page est reprise de la documentation du fournisseur (lien ci-dessus) et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue. Quand les fournisseurs ne définissent pas une spécification de la même façon, la différence est signalée et la valeur n'est pas mise en graphique. Nous ne mesurons rien ici et nous n'attribuons aucune note.

Obtenez votre clé API Comparez votre coût →