Gemini 3.6 Flash ist ein allgemein verfügbares Modell, das Googles Dokumentation als anhaltende Intelligenz auf Frontier-Niveau für das agentische Zeitalter positioniert, optimiert für höhere Geschwindigkeit und geringere Kosten.
- Eingabe
- Text Bild Video Audio $1.5/M
- Ausgabe
- Text $7.5/M
- Audio-Input
- $5/M
- Cache-Read
- $0.15/M
- Kontext
- 1M
- vs. GPT-4o
- ~70% günstiger
- Knowledge Cutoff
- 2026-03
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic DeepSeek Google Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Preisposition unter 65 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.048.576 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 65.536 |
| Knowledge Cutoff | 2026-03 |
Prompt Caching
| Modus | automatisch + explizit |
|---|---|
| Min. Präfix | 4.096 |
Thinking
| Anbieter-Parameter | thinkingLevel |
|---|---|
| Zulässige Werte | minimal · low · medium · high |
| Standardwert | medium gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Nein |
| Thinking-Verhalten | Teilt das Thinking-Profil von 3.5 Flash, mit medium als Standard und high als dynamischer Einstellung; Thinking-Token werden als Output-Token abgerechnet, und Thought Signatures sollten über Turns hinweg unverändert zurückgegeben werden. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild + Video + Audio → Text |
|---|
- GA
- 1.048.576 Token Kontext, 65.536 max. Output
- Thinking sowie die vollständige Suite eingebauter Tools einschließlich Computer Use
- offiziell als stärker bei komplexen agentischen und multimodalen Aufgaben positioniert, bei geringerem Tokenverbrauch als 3.5 Flash. Hinweis: temperature/top_p/top_k gelten ab dieser Generation als veraltet und werden ignoriert. Der Knowledge Cutoff stammt aus der DeepMind-Modellkarte (die API-Seite hat die Zeile entfernt): März 2026, wobei die Karte ergänzt, dass einige Domänen weiterhin auf Januar 2025 beschränkt bleiben
Ein Prompt, gemessen über das Gateway
Gemini 3.6 Flash bestanden · 3 sentences
Enabling reasoning causes the model to generate thousands of internal "thinking" tokens behind the scenes to process logic before delivering the final response. Because our vendor bills us for every token generated—including these intermediate processing steps—our billable output volume per query surged significantly. Since output tokens carry a much higher unit cost than input tokens, this jump in processing volume directly doubled our overall spend.
Ausgabe 893 tok (+816 Denken) Latenz 4.7 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
Gemini 3.6 Flash bestanden · 8/8 cases
Here is the fixed function along with an explanation of the bugs: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation The original function initialized `cur` and `best` to `0` and incremented `cur` on matching adjacent items, which meant it was counting identical adjacent *pairs* rather than the total number of *elements* in a run. This caused single-element inputs to skip the loop and return `0` instead of `1`, and undercounted all run lengths by 1 (for example, a run of two items at the end of the list resulted in `cur = 1`). […]
Ausgabe 2034 tok (+1768 Denken) Latenz 10.0 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
Gemini 3.6 Flash bestanden · 5/5 fields, guidance "withheld"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld" } ```
Ausgabe 2843 tok (+2783 Denken) Latenz 13.1 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
Gemini 3.6 Flash verfehlt · 60 words, 0 banned, 0 questions
72: reducing 73: your 74: monthly 75: token 76: spend. S6 (21): 77: You 78: can 79: easily 80: set 81: custom 82: expiration 83: rules, 84: configure 85: TTL 86: settings, 87: and 88: manage 89: cache 90: invalidation 91: across 92: all 93: vendors 94: from 95: one 96: centralized 97: dashboard. S7 (23): 98: Start 99: optimizing […]
Ausgabe 4092 tok (+3929 Denken) Latenz 16.3 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
Gemini 3.6 Flash in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.6-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.6-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.6-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.6-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Gemini 3.6 Flash
- Laut Dokumentation liefert es stärkere Leistung bei komplexen agentischen und multimodalen Aufgaben bei geringerem Tokenverbrauch und zu einem niedrigeren Preis als 3.5 Flash.
- Google hebt Codegenerierung, agentische Ausführung und räumliches Reasoning als Stärken hervor und nennt schnelle agentische Schleifen mit komplexen Coding-Zyklen und Iterationen als das, wofür es sich am besten eignet; die Modellkarte beschreibt es als die Arbeitspferd-Stufe mit besserer Token-Effizienz als 3.5 Flash.
- Es unterstützt Thinking und die vollständige integrierte Tool-Suite einschließlich Computer Use, Function Calling, strukturierter Ausgaben, Code-Ausführung, Search- und Maps-Grounding, URL-Kontext, File Search, Context-Caching, der Batch API sowie Flex- und Priority-Inferenz.
- Die Eingabe umfasst Text, Bild, Video und Audio über ein Kontextfenster von 1M Token mit 65.536 Output-Token. thinking_level akzeptiert minimal, low, medium und high und steht standardmäßig auf medium, wobei minimal eine Untergrenze und kein Ausschalter ist.
- Der Knowledge Cutoff liegt im März 2026.
- Die Modellseite weist außerdem auf eine API-Änderung hin: temperature, top_p und top_k sind ab dieser Generation veraltet und werden ignoriert, wobei Google warnt, dass künftige Modelle dafür HTTP 400 zurückgeben werden.
- Synthorai stellt es über seinen OpenAI-kompatiblen Chat-Endpoint bereit.
FAQ
Lässt sich die Gemini 3.6 Flash API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1.5/M Input-Tokens deckt allein dieses Guthaben rund 83 Requests mit je ~8K Tokens gegen Gemini 3.6 Flash ab.
Worin ist Gemini 3.6 Flash am besten?
Frontier-Intelligenz schneller und günstiger; laut Google weniger Tokenverbrauch als 3.5 Flash; 1 Mio. Kontext, Computer Use integriert. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Gemini 3.6 Flash?
Gemini 3.6 Flash kostet auf Synthorai $1.5 pro Million Input-Tokens und $7.5 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.15/M abgerechnet.
Unterstützt Gemini 3.6 Flash Prompt-Caching?
Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.15/M statt $1.5/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 4,096 Tokens, um gecacht zu werden. Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Gemini 3.6 Flash?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="gemini-3.6-flash", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Wo liegt der Knowledge Cutoff von Gemini 3.6 Flash?
Der Knowledge Cutoff von Gemini 3.6 Flash liegt bei 2026-03, laut offizieller Dokumentation des Anbieters (Stand: 2026-07-22).
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.