Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Gemini 3.6 Flash

Veröffentlicht 2026-07-21

chatVisionCodeTool-AufrufePrompt CachingReasoning

Gemini 3.6 Flash ist ein allgemein verfügbares Modell, das Googles Dokumentation als anhaltende Intelligenz auf Frontier-Niveau für das agentische Zeitalter positioniert, optimiert für höhere Geschwindigkeit und geringere Kosten.

Eingabe
Text Bild Video Audio $1.5/M
Ausgabe
Text $7.5/M
Audio-Input
$5/M
Cache-Read
$0.15/M
Kontext
1M
vs. GPT-4o
~70% günstiger
Knowledge Cutoff
2026-03

Benchmarks

Über dem DurchschnittKeins besser5 / 191 / 19
Gemini 3.6 Flash weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
Terminal-Bench 2.1
78%
BioMysteryBench hard
41.2%
OSWorld 2.0
33.8%
GDPval-AA v2 Elo · 1422-1598 laut Google · 2026-08-25
1422
Harvey Lab-AA
85.1%
HLE-Verified
51.2%
AutomationBench
17%
LVBench
84.2%

Herstellerangaben: Alibaba (Qwen) Anthropic DeepSeek Google Moonshot OpenAI Tencent Z.ai

Preis im Vergleich

Preisposition unter 65 vergleichbaren Modellen

Eingabe$1.5/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Ausgabe$7.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Cache-Lesen$0.15/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 1.048.576
Max. Output (Anbieter-Spezifikation) 65.536
Knowledge Cutoff 2026-03

Prompt Caching

Modus automatisch + explizit
Min. Präfix 4.096

Thinking

Anbieter-Parameter thinkingLevel
Zulässige Werte minimal · low · medium · high
Standardwert medium gilt, wenn die Anfrage nichts angibt
Abschaltbar Nein
Thinking-Verhalten Teilt das Thinking-Profil von 3.5 Flash, mit medium als Standard und high als dynamischer Einstellung; Thinking-Token werden als Output-Token abgerechnet, und Thought Signatures sollten über Turns hinweg unverändert zurückgegeben werden.
Parameter reasoning_effort
Werte minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt

Modell

Modalitäten Text + Bild + Video + Audio → Text
  • GA
  • 1.048.576 Token Kontext, 65.536 max. Output
  • Thinking sowie die vollständige Suite eingebauter Tools einschließlich Computer Use
  • offiziell als stärker bei komplexen agentischen und multimodalen Aufgaben positioniert, bei geringerem Tokenverbrauch als 3.5 Flash. Hinweis: temperature/top_p/top_k gelten ab dieser Generation als veraltet und werden ignoriert. Der Knowledge Cutoff stammt aus der DeepMind-Modellkarte (die API-Seite hat die Zeile entfernt): März 2026, wobei die Karte ergänzt, dass einige Domänen weiterhin auf Januar 2025 beschränkt bleiben

laut Offizielle Google-Dokumentation ↗

Ein Prompt, gemessen über das Gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. PRÜFEN genau 3 Sätze

Gemini 3.6 Flash bestanden · 3 sentences

Enabling reasoning causes the model to generate thousands of internal "thinking" tokens behind the scenes to process logic before delivering the final response. Because our vendor bills us for every token generated—including these intermediate processing steps—our billable output volume per query surged significantly. Since output tokens carry a much higher unit cost than input tokens, this jump in processing volume directly doubled our overall spend.

Ausgabe 893 tok (+816 Denken) Latenz 4.7 s

Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. PRÜFEN Fix besteht die Tests

Gemini 3.6 Flash bestanden · 8/8 cases

Here is the fixed function along with an explanation of the bugs: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation The original function initialized `cur` and `best` to `0` and incremented `cur` on matching adjacent items, which meant it was counting identical adjacent *pairs* rather than the total number of *elements* in a run. This caused single-element inputs to skip the loop and return `0` instead of `1`, and undercounted all run lengths by 1 (for example, a run of two items at the end of the list resulted in `cur = 1`). […]

Ausgabe 2034 tok (+1768 Denken) Latenz 10.0 s

Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. PRÜFEN gültiges JSON, Schema exakt

Gemini 3.6 Flash bestanden · 5/5 fields, guidance "withheld"

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld" } ```

Ausgabe 2843 tok (+2783 Denken) Latenz 13.1 s

Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. PRÜFEN 120 Wörter, 0 verbotene Wörter

Gemini 3.6 Flash verfehlt · 60 words, 0 banned, 0 questions

72: reducing 73: your 74: monthly 75: token 76: spend. S6 (21): 77: You 78: can 79: easily 80: set 81: custom 82: expiration 83: rules, 84: configure 85: TTL 86: settings, 87: and 88: manage 89: cache 90: invalidation 91: across 92: all 93: vendors 94: from 95: one 96: centralized 97: dashboard. S7 (23): 98: Start 99: optimizing […]

Ausgabe 4092 tok (+3929 Denken) Latenz 16.3 s

Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.

Gemini 3.6 Flash in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gemini-3.6-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Über Gemini 3.6 Flash

  • Laut Dokumentation liefert es stärkere Leistung bei komplexen agentischen und multimodalen Aufgaben bei geringerem Tokenverbrauch und zu einem niedrigeren Preis als 3.5 Flash.
  • Google hebt Codegenerierung, agentische Ausführung und räumliches Reasoning als Stärken hervor und nennt schnelle agentische Schleifen mit komplexen Coding-Zyklen und Iterationen als das, wofür es sich am besten eignet; die Modellkarte beschreibt es als die Arbeitspferd-Stufe mit besserer Token-Effizienz als 3.5 Flash.
  • Es unterstützt Thinking und die vollständige integrierte Tool-Suite einschließlich Computer Use, Function Calling, strukturierter Ausgaben, Code-Ausführung, Search- und Maps-Grounding, URL-Kontext, File Search, Context-Caching, der Batch API sowie Flex- und Priority-Inferenz.
  • Die Eingabe umfasst Text, Bild, Video und Audio über ein Kontextfenster von 1M Token mit 65.536 Output-Token. thinking_level akzeptiert minimal, low, medium und high und steht standardmäßig auf medium, wobei minimal eine Untergrenze und kein Ausschalter ist.
  • Der Knowledge Cutoff liegt im März 2026.
  • Die Modellseite weist außerdem auf eine API-Änderung hin: temperature, top_p und top_k sind ab dieser Generation veraltet und werden ignoriert, wobei Google warnt, dass künftige Modelle dafür HTTP 400 zurückgeben werden.
  • Synthorai stellt es über seinen OpenAI-kompatiblen Chat-Endpoint bereit.

FAQ

Lässt sich die Gemini 3.6 Flash API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1.5/M Input-Tokens deckt allein dieses Guthaben rund 83 Requests mit je ~8K Tokens gegen Gemini 3.6 Flash ab.

Worin ist Gemini 3.6 Flash am besten?

Frontier-Intelligenz schneller und günstiger; laut Google weniger Tokenverbrauch als 3.5 Flash; 1 Mio. Kontext, Computer Use integriert. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Gemini 3.6 Flash?

Gemini 3.6 Flash kostet auf Synthorai $1.5 pro Million Input-Tokens und $7.5 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.15/M abgerechnet.

Unterstützt Gemini 3.6 Flash Prompt-Caching?

Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.15/M statt $1.5/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 4,096 Tokens, um gecacht zu werden. Prompt-Caching-Guide →

Wie erhalte ich Zugang zu Gemini 3.6 Flash?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="gemini-3.6-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Wo liegt der Knowledge Cutoff von Gemini 3.6 Flash?

Der Knowledge Cutoff von Gemini 3.6 Flash liegt bei 2026-03, laut offizieller Dokumentation des Anbieters (Stand: 2026-07-22).

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →