Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

DeepSeek V4 Pro vs Gemini 3.7 Flash

vs

Welches Modell wofür

Nehmen Sie gemini-3.7-flash, wenn die Eingabe kein reiner Text ist: Es nimmt neben Text auch Bild, Audio und Video entgegen und ist in diesem Paar bei jedem Tarif die günstigere Seite - $0.75 gegenüber $1.32 bei der Eingabe, $3.75 gegenüber $3.96 bei der Ausgabe und $0.075 gegenüber $0.132 bei Cache-Lesevorgängen. Nehmen Sie deepseek-v4-pro für rein textliche Arbeit mit langen Generierungen, mit 393,216 maximalen Ausgabetokens gegenüber 65,536 und der Möglichkeit, das Denken abzuschalten. Der Kontext ist mit 1,000,000 gegenüber 1,048,576 Tokens praktisch gleichauf, und beide decken Chat, Code, Tools und Reasoning ab.

Benchmarks

Über dem DurchschnittKeins besserDeepSeek V4 Pro5 / 100 / 10Gemini 3.7 Flash17 / 243 / 24
DeepSeek V4 Pro Gemini 3.7 Flash weitere gemessene Modelle Durchschnitt der Vergleichsmodelle ★ kein anderes Modell war besser
SWE-Bench Pro
59%
N/A
BioMysteryBench hard
N/A
43.5%
OSWorld 2.0
N/A
47.9%
Finance Agent v2
N/A
59%
Harvey Lab-AA
N/A
90.7%
Humanity's Last Exam no tools
37.7%
N/A
AutomationBench (v1.0.6)
N/A
52.3%
LVBench
N/A
kein anderes Modell war besser 85.4%

Anbieterangaben: Alibaba (Qwen) Anthropic DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Preise

DeepSeek V4 Pro Gemini 3.7 Flash Δ
Eingabe / 1M Tokens $1.32 $0.75 1.8×
Ausgabe / 1M Tokens $3.96 $3.75 1.1×
Cache-Lesen / 1M Tokens $0.132 $0.075 1.8×
Cache-Schreiben keine gesonderte Gebühr - -

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Eingabepreis pro 1M Tokens aller 76 Chat-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

DeepSeek V4 Pro · $1.32 Gemini 3.7 Flash · $0.75
$0.05 · Qwen3 VL Flash $30 · GPT-5.4 Pro

Fähigkeiten

DeepSeek V4 Pro Gemini 3.7 Flash
Tool-Nutzung ja ja
Thinking-Steuerung konfigurierbar ja, Parameter des Anbieters nicht veröffentlicht
Strukturierte Ausgabe ja ja
Prompt-Caching implizit (automatisch) implizit + explizit
Cache-Lebensdauer no fixed TTL (evicted when unused) nicht veröffentlicht
Mindestlänge des gecachten Präfixes nicht veröffentlicht 4096 Tokens

Spezifikationen

DeepSeek V4 Pro Gemini 3.7 Flash
Eingabemodalitäten Text Text Bild Audio Video
Ausgabemodalitäten Text Text
Veröffentlicht 2026-04-24 2026-08-13
Knowledge-Cutoff - 2026-03
Kontextfenster 1M 1M
Maximale Ausgabe 393K 66K
Thinking-Parameter
  • thinking.type
  • reasoning_effort
-
Zulässige Werte
thinking.type
  • enabled
  • disabled
reasoning_effort
  • high
  • max (low and medium map to high, xhigh maps to max)
-
Standardwert

enabled, with reasoning_effort high

some complex agent requests are automatically set to max

-

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: DeepSeek V4 Pro · Gemini 3.7 Flash

Ein Prompt, beide Modelle, gemessen über das Gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. KRITERIUM genau 3 Sätze

DeepSeek V4 Pro bestanden · 3 sentences

Enabling reasoning causes the model to generate a lengthy internal chain‑of‑thought before it delivers a visible answer, and we are billed for every one of those hidden reasoning tokens just as we are for the final output. In most interactions, the volume of these unseen tokens at least equals the visible response, effectively doubling the total tokens consumed per query. That doubled token consumption translates directly into a doubled per‑query cost, which is why our overall LLM bill doubled.

Ausgabe 641 tok (+545 Thinking) Latenz 11.5 s

Gemini 3.7 Flash bestanden · 3 sentences

Enabling reasoning causes the model to generate a high volume of invisible "thinking tokens" behind the scenes to deliberate and solve complex logic before delivering a final response. Because our vendor bills strictly on token volume, this additional internal computation effectively doubled our billable output per query. In short, our costs increased because we are now paying for the extra compute capacity required to produce significantly higher-accuracy answers.

Ausgabe 878 tok (+799 Thinking) Latenz 6.9 s

Befolgen der Anweisung (genau drei Sätze, das lässt sich zählen), Zuschnitt auf die Zielgruppe (Tonfall für einen CFO) und die Abrechnungslücke durch nicht sichtbares Thinking, die die Token-Zähler unten offenlegen.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. KRITERIUM Fix besteht die Tests

DeepSeek V4 Pro bestanden · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `cur = 0` and only incrementing it when two adjacent elements match, which counts the number of *additional* equal elements rather than the actual run length (which is `cur + 1`). As a result, the returned `best` is always one less than the true longest run—most obviously returning 0 for a single-element list instead of 1. […]

Ausgabe 2418 tok (+2131 Thinking) Latenz 35.6 s

Gemini 3.7 Flash bestanden · 8/8 cases

Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation of the Bug The original function tracked equal adjacent transitions instead of the actual number of elements in a run, causing all non-empty run lengths to be undercounted by one (e.g., returning `0` instead of `1` for single-element lists because the loop never executes, and `1` instead of `2` for pairs). Initializing both `best` and `cur` to `1` (after handling empty inputs) and resetting `cur` to `1` on a mismatch ensures every individual element is counted as a valid run of at least length one.

Ausgabe 1050 tok (+827 Thinking) Latenz 6.4 s

Ob der Fix wirklich korrekt ist (er lässt sich ausführen), wie dicht die Erklärung ist und wie sparsam das Modell bei einer klar begrenzten Aufgabe mit Tokens umgeht.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. KRITERIUM gültiges JSON, Schema exakt

DeepSeek V4 Pro bestanden · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": "eleven and change", "guidance": null }

Ausgabe 1204 tok (+1153 Thinking) Latenz 19.9 s

Gemini 3.7 Flash bestanden · 5/5 fields, guidance "withheld"

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld" } ```

Ausgabe 918 tok (+858 Thinking) Latenz 6.2 s

Schema-Treue (keine erfundenen Felder), Anreiz zum Halluzinieren (der Text nennt ausdrücklich keine guidance) und Unterschiede zwischen den Wegen zur strukturierten Ausgabe.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. KRITERIUM 120 Wörter, 0 verbotene Wörter

DeepSeek V4 Pro keine bewertbare Antwort · no answer text within 16,384 tokens (all of it went to thinking)

Das Modell hat keinen Antworttext geliefert: Das gesamte Token-Budget wurde vom nicht sichtbaren Thinking aufgebraucht.

Ausgabe 8193 tok (+8192 Thinking) Latenz 106.2 s

Gemini 3.7 Flash bestanden · 120 words, 0 banned, 1 question

Why pay twice for identical AI queries simply because you routed them to different model vendors? Today, we introduce Universal Prompt Caching directly within our unified API gateway architecture. This capability stores repeated prompt contexts across OpenAI, Anthropic, and local models, instantly returning stored results to eliminate redundant computation fees. When your application sends an LLM request, the gateway inspects the payload, identifies semantic matches, and returns accurate cached responses in under ten milliseconds. Engineering teams can now slash inference latency by eighty percent while dramatically reducing monthly token expenditures across diverse production deployments. You retain complete privacy control, flexible cache eviction policies, and granular metrics through a single dashboard. Update your routing settings today to accelerate overall system performance.

Ausgabe 2858 tok (+2718 Thinking) Latenz 14.1 s

Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, genau eine Frage), stilistische Handschrift und Kontrolle über die Länge.

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro",
    # model="gemini-3.7-flash",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: DeepSeek V4 Pro oder Gemini 3.7 Flash?

Gemini 3.7 Flash ist bei Eingabe / 1M Tokens günstiger ($0.75 vs. $1.32, Faktor 1.8). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich DeepSeek V4 Pro gegen Gemini 3.7 Flash A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen DeepSeek V4 Pro und Gemini 3.7 Flash Prompt-Caching?

Ja. Beide berechnen Cache-Lesezugriffe günstiger als die normale Eingabe. Workloads mit einem wiederkehrenden, bereits gecachten Präfix kosten deshalb weniger, als die Listenpreise vermuten lassen. Die genauen Preise stehen in den Cache-Zeilen der Preistabelle oben.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen