Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Gemini 3.7 Flash vs Gemini 3.8 Flash

vs

Welches Modell, wann

Nach den vorliegenden Fakten sind diese beiden faktisch austauschbar: gemini-3.7-flash und gemini-3.8-flash berechnen beide $0.75 pro Million Input-Token, $3.75 Output und $0.075 für Cache-Reads, beide bieten einen Kontext von 1048576 Token mit maximal 65536 Output, und beide akzeptieren Text, Bild, Audio und Video als Input mit Text als Output, plus Chat, Vision, Code, Tools und Reasoning. Der einzige aufgeführte Unterschied ist die Generation und das Veröffentlichungsdatum, 2026-08-13 gegenüber 2026-09-02, bei gleichem Knowledge-Cutoff von 2026-03. Verwenden Sie standardmäßig das neuere gemini-3.8-flash für neue Arbeiten und halten Sie gemini-3.7-flash nur dort fest gepinnt, wo Sie Output-Stabilität bei einem bereits getesteten Build benötigen.

Benchmarks

VornÜber dem DurchschnittKeins besserGemini 3.7 Flash017 / 243 / 24Gemini 3.8 Flash1312 / 175 / 17

14 bei beiden gemessen, 1 gleichauf.

Gemini 3.7 Flash Gemini 3.8 Flash weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
DeepSWE 1.1
65.3%
73.7%
BioMysteryBench hard
43.5%
kein anderes Modell war besser 56.5%
OSWorld 2.0 Partial score, batch tool enabled
50.6%
59%
HealthBench Professional
N/A
52.1%
Finance Agent v2
59%
kein anderes Modell war besser 61.4%
Legal Agent Benchmark
8.8%
10%
HLE-Verified
53.6%
kein anderes Modell war besser 54.9%
AutomationBench (v1.0.6)
52.3%
N/A
CharXiv (RQ) no tools
84.5%
kein anderes Modell war besser 86.2%

Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Preise

Gemini 3.7 Flash Gemini 3.8 Flash Δ
Input / 1M Token $0.75 $0.75 =
Output / 1M Token $3.75 $3.75 =
Cache-Read / 1M Token $0.075 $0.075 =

Preise aus dem Live-Katalog zum Zeitpunkt des Builds; jede Modellseite enthält die aktuelle Übersicht.

Wo sie stehen - Eingabepreis pro 1M Tokens über alle 71 Chat-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

$0.05 · Qwen3 VL Flash $30 · GPT-5.4 Pro

Fähigkeiten

Gemini 3.7 Flash Gemini 3.8 Flash
Tool-Nutzung ja ja
Thinking-Kontrolle ja - Regler des Anbieters nicht veröffentlicht ja - Regler des Anbieters nicht veröffentlicht
Strukturierte Ausgabe ja ja
Prompt-Caching implizit + explizit implizit + explizit
Cache-Lebensdauer nicht veröffentlicht nicht veröffentlicht
Minimales gecachtes Präfix 4096 Tokens 4096 Tokens

Spezifikationen

Gemini 3.7 Flash Gemini 3.8 Flash
Input-Modalitäten Text Bild Audio Video Text Bild Audio Video
Ausgabemodalitäten Text Text
Veröffentlicht 2026-08-13 2026-09-02
Wissensgrenze 2026-03 2026-03
Kontextfenster 1M 1M
Maximaler Output 66K 66K

Die Spezifikationen sind aus der Dokumentation der jeweiligen Anbieter übernommen; eine Zeile, die ein Anbieter nicht veröffentlicht, wird weggelassen und nicht abgeleitet. Vollständige Quellen: Gemini 3.7 Flash · Gemini 3.8 Flash

Ein Prompt, beide Modelle - gemessen über das Gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. PRÜFEN genau 3 Sätze

Gemini 3.7 Flash bestanden · 3 sentences

Enabling reasoning causes the model to generate a high volume of invisible "thinking tokens" behind the scenes to deliberate and solve complex logic before delivering a final response. Because our vendor bills strictly on token volume, this additional internal computation effectively doubled our billable output per query. In short, our costs increased because we are now paying for the extra compute capacity required to produce significantly higher-accuracy answers.

Ausgabe 878 tok (+799 Denken) Latenz 6.9 s

Gemini 3.8 Flash bestanden · 3 sentences

When we enabled reasoning, the model began generating hidden "thinking tokens" to work through logic step-by-step before producing a final answer. Because AI vendors bill for every single token processed—visible or not—this internal deliberation dramatically inflated our billable volume per query. In short, while our total number of user requests remained flat, the cost per transaction doubled to buy higher accuracy on complex tasks.

Ausgabe 705 tok (+624 Denken) Latenz 6.4 s

Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. PRÜFEN Fix besteht die Tests

Gemini 3.7 Flash bestanden · 8/8 cases

Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation of the Bug The original function tracked equal adjacent transitions instead of the actual number of elements in a run, causing all non-empty run lengths to be undercounted by one (e.g., returning `0` instead of `1` for single-element lists because the loop never executes, and `1` instead of `2` for pairs). Initializing both `best` and `cur` to `1` (after handling empty inputs) and resetting `cur` to `1` on a mismatch ensures every individual element is counted as a valid run of at least length one.

Ausgabe 1050 tok (+827 Denken) Latenz 6.4 s

Gemini 3.8 Flash bestanden · 8/8 cases

Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` ### Explanation of the Bug The original function counted equal-neighbor transitions rather than the actual items making up each run. Because `cur` started at `0` (and was reset to `0` on mismatches), every run was undercounted by one: single-element lists returned `0` because the loop never executed, and any subsequent run—including those ending at the last index—recorded a count of $N - 1$ instead of $N$. The fix handles empty input upfront, initializes both `cur` and `best` to `1` (since any single element forms a run of length 1), and resets `cur` to `1` whenever a new run begins.

Ausgabe 1393 tok (+1149 Denken) Latenz 10.1 s

Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. PRÜFEN gültiges JSON, Schema exakt

Gemini 3.7 Flash bestanden · 5/5 fields, guidance "withheld"

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld" } ```

Ausgabe 918 tok (+858 Denken) Latenz 6.2 s

Gemini 3.8 Flash bestanden · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": null } ```

Ausgabe 3989 tok (+3932 Denken) Latenz 30.4 s

Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. PRÜFEN 120 Wörter, 0 verbotene Wörter

Gemini 3.7 Flash bestanden · 120 words, 0 banned, 1 question

Why pay twice for identical AI queries simply because you routed them to different model vendors? Today, we introduce Universal Prompt Caching directly within our unified API gateway architecture. This capability stores repeated prompt contexts across OpenAI, Anthropic, and local models, instantly returning stored results to eliminate redundant computation fees. When your application sends an LLM request, the gateway inspects the payload, identifies semantic matches, and returns accurate cached responses in under ten milliseconds. Engineering teams can now slash inference latency by eighty percent while dramatically reducing monthly token expenditures across diverse production deployments. You retain complete privacy control, flexible cache eviction policies, and granular metrics through a single dashboard. Update your routing settings today to accelerate overall system performance.

Ausgabe 2858 tok (+2718 Denken) Latenz 14.1 s

Gemini 3.8 Flash bestanden · 120 words, 0 banned, 1 question

Why pay multiple model providers for the exact same output? Introducing Universal Prompt Cache, our latest API gateway capability engineered to cut compute expenses and drop inference latency. When your application makes a call, the gateway inspects a central memory layer before routing traffic to external LLMs. If an identical query was previously processed by OpenAI, Anthropic, or Mistral, our gateway returns that response immediately. This shared cache eliminates duplicate token fees and insulates your production apps from vendor rate limits or unexpected downtime. Developers can easily customize expiration settings, enforce strict data privacy controls, and configure invalidation logic across every endpoint. Stop wasting your budget on repeated queries. Enable prompt caching in your dashboard to accelerate your pipeline today.

Ausgabe 3833 tok (+3688 Denken) Latenz 21.8 s

Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.

Mit einer Zeile zwischen ihnen wechseln

Beide IDs befinden sich in jedem Tab unten - das hervorgehobene Zeilenpaar ist die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiche Request-Struktur.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gemini-3.7-flash",
    # model="gemini-3.8-flash",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

API-Schlüssel abrufen →

FAQ

Welches ist günstiger, Gemini 3.7 Flash oder Gemini 3.8 Flash?

Sie listen dieselbe input / 1m token ($0.75), daher ist der Preis hier nicht ausschlaggebend - siehe die Spezifikationen und Fähigkeiten unten.

Kann ich Gemini 3.7 Flash gegen Gemini 3.8 Flash ohne zwei Integrationen A/B-testen?

Ja. Beide werden über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel bereitgestellt - der Wechsel ist eine einzeilige Änderung des Modell-Strings, sodass Sie einen Bruchteil des Traffics an jedes Modell leiten und die Rechnungen direkt vergleichen können.

Unterstützen Gemini 3.7 Flash und Gemini 3.8 Flash Prompt-Caching?

Ja - beide berechnen Cache-Reads günstiger als ihre Eingaberate, sodass Warm-Prefix-Workloads weniger kosten, als die Listenpreise vermuten lassen. Die genauen Zeilen für Cache-Reads befinden sich in der obigen Preistabelle.

Verwandte Vergleiche

Aus unseren gemessenen Studien