DeepSeek V4 Flash (0731)
Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten. Effektiver Input-Preis bei 70 % Cache-Trefferquote:$0.088/M. Automatisches Disk-KV-Präfix-Caching: Cache-Treffer werden zur vergünstigten Cache-Lese-Rate abgerechnet, ohne Opt-in und ohne Schreibgebühr.
DeepSeek V4 Flash (0731) in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "deepseek-v4-flash-0731",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-0731",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "deepseek-v4-flash-0731",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("deepseek-v4-flash-0731")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Spezifikationen & Limits
Tokens
- Kontextfenster (Herstellerangabe)
- 1.000.000
- Max. Output (Anbieter-Spezifikation)
- 393.216
Prompt Caching
- Modus
- automatisch
Thinking
- Parameter
- reasoning_effort
- Werte
- minimal · low · medium · high akzeptierte Werte je Anbieter
Modell
- Modalitäten
- Text → Text
- Parameter
- 284B gesamt · 13B aktiv MoE
- Lizenz
- MIT
- July 2026 release of DeepSeek V4 Flash
- same 284B/13B-active MoE design, gains from a stronger post-training pipeline rather than a new architecture
Über DeepSeek V4 Flash (0731)
DeepSeek V4 Flash 0731 ist die Juli-2026-Ausgabe von DeepSeeks schneller, günstiger V4-Flash-Linie und löst das frühere V4 Flash ab, statt als Variante daneben zu stehen.
- Architektur und Größe bleiben unverändert — ein Mixture-of-Experts-Modell mit 284B Gesamtparametern und 13B aktiv zur Inferenzzeit — und DeepSeek führt die Verbesserung auf eine deutlich stärkere Post-Training-Pipeline zurück statt auf ein neues Design, mit Schwerpunkt auf agentischen Workflows und Reasoning-Qualität.
- Alles, was die Linie betrieblich attraktiv machte, bleibt erhalten: das Kontextfenster von 1 Mio.
- Tokens, 384K maximale Ausgabe, MIT-lizenzierte Gewichte, Function Calling, strukturierte Ausgabe und Streaming.
- Das Nachdenken ist standardmäßig aktiv und die Spur kommt in reasoning_content zurück, was hier stärker ins Gewicht fällt als bei den meisten Modellen: Bei kurzen Prompts kann die Denkspur den Großteil der Completion-Tokens ausmachen, sodass ein knappes max_tokens-Budget eine leere Antwort liefert, die aufgewendeten Denk-Tokens aber dennoch abgerechnet werden.
- Planen Sie das ein oder senken Sie die Reasoning-Stärke, bevor Sie das Modell in latenzkritische Pfade einbauen.
- Ein- und Ausgabe sind reiner Text; Bildeingaben werden nicht unterstützt, kombinieren Sie es daher mit einem Vision-Modell, statt multimodale Nachrichten zu senden.
- Da sowohl die datierte Ausgabe als auch der undatierte rollierende Name aufrufbar bleiben, fixieren Sie die datierte ID, wenn Sie reproduzierbares Verhalten brauchen.
- Synthorai stellt das Modell über den OpenAI-kompatiblen Chat-Completions-Endpunkt bereit.
FAQ
Lässt sich die DeepSeek V4 Flash (0731) API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.2/M Input-Tokens deckt allein dieses Guthaben rund 625 Requests mit je ~8K Tokens gegen DeepSeek V4 Flash (0731) ab.
Worin ist DeepSeek V4 Flash (0731) am besten?
284B MoE mit 13B aktiv, MIT-lizenziert; löst das frühere V4 Flash ab; 1 Mio. Kontext, 384K maximale Ausgabe. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet DeepSeek V4 Flash (0731)?
DeepSeek V4 Flash (0731) kostet auf Synthorai $0.2 pro Million Input-Tokens und $0.4 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.04/M abgerechnet.
Unterstützt DeepSeek V4 Flash (0731) Prompt-Caching?
Ja, automatisch: Über DeepSeek ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.04/M statt $0.2/M (ungecacht) abgerechnet. Prompt-Caching-Guide →
Wie erhalte ich Zugang zu DeepSeek V4 Flash (0731)?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="deepseek-v4-flash-0731", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Ist DeepSeek V4 Flash (0731) Open Source?
Ja, die Gewichte sind unter der MIT-Lizenz veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →