Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

DeepSeek V4.1 Flash

Date de sortie : 2026-09-10

chatVisionCodeRaisonnementAppel d'outilsMise en cache des prompts

DeepSeek V4.1 Flash est la nouvelle version de la gamme V4 Flash de DeepSeek, rapide et économique, et le changement majeur est qu'elle est nativement multimodale : la fiche du modèle indique qu'il traite nativement les images et le texte et génère du texte de façon autorégressive, si bien que l'entrée visuelle n'exige plus de lui adjoindre un modèle de vision distinct.

Entrée
texte image $0.3/M
Sortie
texte $1.2/M
Lecture de cache
$0.03/M
Contexte
1M
vs GPT-4o
~94% moins cher

Benchmarks

Au-dessus de la moyenneAucun meilleur16 / 194 / 19
DeepSeek V4.1 Flash autres modèles mesurés moyenne des modèles comparés aucun autre modèle n'a fait mieux
NL2Repo
64%
Cybergym
aucun autre modèle n'a fait mieux 88.1%
GPQA Diamond
90.9%
Agents' Last Exam
31.8%
BabyVision with tools
89.6%

Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Le prix en contexte

Position du prix parmi 65 modèles comparables

Entrée$0.3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Sortie$1.2/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lecture en cache$0.03/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 1 000 000
Sortie max (spéc. fournisseur) 393 216

Mise en cache

Mode automatique
Durée de vie pas de TTL fixe (purgé lorsqu'il n'est plus utilisé)

Raisonnement

Paramètre reasoning_effort
Valeurs minimal · low · medium · high l'ensemble accepté est celui du fournisseur

Modèle

Modalités texte + image → texte
Paramètres 552B au total · 8B prefill / 16B decode actifs MoE, Causal Encoder-Decoder
Licence MIT

Natively multimodal successor to the V4 Flash line: a 552B-parameter MoE on a Causal Encoder-Decoder stack activating 8B parameters per token at prefill and 16B at decode, with the model card recommending a maximum output of at least 256K tokens.

selon docs officielles DeepSeek ↗

Un prompt, mesuré via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VÉRIFIER exactement 3 phrases

DeepSeek V4.1 Flash réussi · 3 sentences

Enabling reasoning changed the unit economics: the model now spends extra billable tokens internally to “think” before producing the answer, and those reasoning tokens are charged like output tokens even though users never see them. That added token generation—plus longer contexts and occasional retries on harder prompts—roughly doubled our cost per request. We can control this by capping reasoning depth, routing only complex queries to reasoning models, and caching common prompts to bring the bill back down.

sortie 423 tok (+327 réflexion) latence 14.6 s

Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VÉRIFIER le correctif passe les tests

DeepSeek V4.1 Flash réussi · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The bug is that `cur` is counting equal adjacent pairs, not elements in the current run: every time `xs[i] == xs[i - 1]`, the run length increases by one element, but the first element of the run was never counted, so all runs are undercounted by one. Also, `best` starts at `0`, so single-element inputs return `0` instead of `1`, and a one-element run ending at the last index is missed entirely.

sortie 918 tok (+733 réflexion) latence 11.4 s

Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VÉRIFIER JSON valide, schéma exact

DeepSeek V4.1 Flash réussi · 5/5 fields, guidance "withheld pending the Q4 close"

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":11.0,"guidance":"withheld pending the Q4 close"}

sortie 1707 tok (+1667 réflexion) latence 15.1 s

Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VÉRIFIER 120 mots, 0 mot interdit

DeepSeek V4.1 Flash réussi · 116 words, 0 banned, 1 question

Today we're launching Cross-Provider Prompt Cache for our API gateway. It stores identical prompt requests and their responses across supported model providers, then serves cached results when a match is found. Teams can cut duplicate inference costs, reduce latency, and keep behavior consistent during provider failover. The cache works with configurable TTLs, per-route rules, and cache-key controls, so you decide what is reusable and what must stay fresh. Does your application send the same prompts to multiple providers? Now your gateway can answer many of those calls without another upstream request. Existing observability dashboards show hit rates, saved tokens, and estimated spend reduction. Enable it in the gateway console, set your policy, and start caching today.

sortie 917 tok (+770 réflexion) latence 9.0 s

Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.

Utilisez DeepSeek V4.1 Flash en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

À propos de DeepSeek V4.1 Flash

  • La conception constitue une véritable rupture et non un simple réglage.
  • DeepSeek décrit une architecture Causal Encoder-Decoder - un Transformer de 40 couches organisé en un encodeur causal de 20 couches suivi d'un décodeur de 20 couches - sur un backbone Mixture-of-Experts de 552B paramètres qui n'active que 8B paramètres par token lors du prefill et 16B lors du decode, une répartition qui vise directement les charges agentiques à forte entrée.
  • La mémoire suit la même logique : Compressed Sparse Attention 2 associé au cache KV principal en FP4 ramène l'empreinte globale du cache KV à 890 octets par token, soit environ un quart de DeepSeek V4 Flash, tandis que SWA Bounded Replay réduit l'empreinte KV persistante à environ un huitième.
  • La fenêtre de contexte atteint 1M tokens, les poids sont sous licence MIT et l'appel d'outils est pris en charge.
  • C'est le raisonnement qu'il faut budgéter : la trace revient séparément de la réponse et, sur des prompts courts, elle peut représenter la quasi-totalité des tokens de complétion, de sorte qu'un max_tokens trop serré renverra une réponse vide tout en étant intégralement facturée pour les tokens consacrés à la réflexion.
  • L'effort de raisonnement est réglable, et la fiche du modèle le documente comme un contrôle continu plutôt que comme une poignée de niveaux nommés.
  • Synthorai le propose via l'endpoint chat completions compatible OpenAI.

FAQ

Peut-on essayer l'API DeepSeek V4.1 Flash gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $0.3/M de tokens en entrée, ce crédit couvre à lui seul environ 416 requêtes de ~8K tokens sur DeepSeek V4.1 Flash.

Quels sont les points forts de DeepSeek V4.1 Flash ?

Nativement multimodal - images et texte en entrée ; MoE de 552B, 8B actifs au prefill ; contexte de 1M, poids sous licence MIT. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte DeepSeek V4.1 Flash ?

Sur Synthorai, DeepSeek V4.1 Flash coûte $0.3 par million de tokens en entrée et $1.2 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.03/M.

DeepSeek V4.1 Flash prend-il en charge la mise en cache des prompts ?

Oui, automatiquement : les prompts servis par DeepSeek sont mis en cache sans modification de code. Les tokens d'entrée en cache sont facturés $0.03/M contre $0.3/M hors cache (TTL pas de TTL fixe (purgé lorsqu'il n'est plus utilisé)). Guide de mise en cache des prompts →

Comment obtenir l'accès à DeepSeek V4.1 Flash ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="deepseek-v4.1-flash", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

DeepSeek V4.1 Flash est-il open source ?

Oui : les poids sont publiés sous MIT (licence) (dépôt officiel lié dans la section À propos). Ou passez-vous des GPU : la version hébergée ici est au paiement à l'usage, sans infrastructure à exploiter. Exécuter des modèles à poids ouverts →

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →