Gemini 3 Flash (Preview) ist das Modell, das Googles Dokumentation als das weltweit beste für multimodales Verständnis und als ihr „bislang leistungsstärkstes Modell für agentisches und Vibe-Coding“ beschreibt, gestartet mit dem Versprechen von Frontier-Klasse-Leistung, die es zu einem Bruchteil der Kosten mit größeren Modellen aufnimmt.
- Eingabe
- Text Bild Video Audio $0.5/M
- Ausgabe
- Text $3/M
- Audio-Input
- $1/M
- Cache-Read
- $0.05/M
- Kontext
- 1M
- vs. GPT-4o
- ~90% günstiger
- Knowledge Cutoff
- 2025-01
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance Google MiniMax Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.048.576 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 65.536 |
| Knowledge Cutoff | 2025-01 |
Prompt Caching
| Modus | automatisch + explizit |
|---|---|
| Min. Präfix | 4.096 |
Thinking
| Anbieter-Parameter | thinkingLevel |
|---|---|
| Zulässige Werte | minimal · low · medium · high |
| Standardwert | high gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Nein |
| Thinking-Verhalten | Google gibt an, dass Gemini 3 Flash kein vollständiges Abschalten von Thinking unterstützt, minimal ist also eine Untergrenze und kein Schalter, und Thinking-Token werden bei jeder Anfrage als Output-Token abgerechnet; Thought Signatures sollten zurückgespiegelt werden und sind für Function Calling erforderlich. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild + Video + Audio → Text |
|---|
- Preview-Modell
- 1.048.576 Token Input
- Computer Use unterstützt
- Bildgenerierung wird trotz des Capability-Tags im Gateway NICHT unterstützt
Gemini 3 Flash in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3-flash-preview",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3-flash-preview",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-flash-preview",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3-flash-preview",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3-flash-preview")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Gemini 3 Flash
- Es akzeptiert Text-, Bild-, Video-, Audio- und PDF-Eingaben innerhalb eines Kontextfensters von 1.048.576 Token und erzeugt bis zu 65.536 Output-Token.
- Zu den Fähigkeiten zählen Function Calling, strukturierte Ausgaben, Code-Ausführung, Computer Use, Search- und Maps-Grounding, URL-Kontext, File Search, Context-Caching, die Batch API sowie Flex- und Priority-Inferenz.
- Thinking wird über thinking_level gesteuert, das minimal, low, medium und high akzeptiert und standardmäßig auf high steht, dem teuersten Standard der Familie: Bei jedem Gemini-3-Modell ist minimal eine Untergrenze und kein Ausschalter, sodass Thinking-Token bei jeder Anfrage abgerechnet werden.
- Die Generation führte außerdem Thought Signatures ein, verschlüsselte Spuren des internen Reasonings, die zurückgegeben werden müssen, um die Kontinuität über mehrere Turns zu erhalten, sowie neue Steuerungen für die Medienauflösung; beides ist beim Umstieg von 2.5 Migrationsarbeit und kein optionales Extra.
- Als Preview-Kanal trägt es keine Stabilitätsgarantien; Googles stabiler Nachfolger ist gemini-3.5-flash, dessen Modellseite diese ID als ihren Preview-Alias führt.
- Synthorai bietet es über seine einheitliche OpenAI-kompatible Chat-Completions-Schnittstelle an.
FAQ
Lässt sich die Gemini 3 Flash API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.5/M Input-Tokens deckt allein dieses Guthaben rund 250 Requests mit je ~8K Tokens gegen Gemini 3 Flash ab.
Worin ist Gemini 3 Flash am besten?
Beschrieben als bestes für multimodales Verständnis; hochmodernes Reasoning mit kreativer Coding-Stärke; Unterstützung für Computer Use und Maps-Grounding. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Gemini 3 Flash?
Gemini 3 Flash kostet auf Synthorai $0.5 pro Million Input-Tokens und $3 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.05/M abgerechnet.
Unterstützt Gemini 3 Flash Prompt-Caching?
Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.05/M statt $0.5/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 4,096 Tokens, um gecacht zu werden. Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Gemini 3 Flash?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="gemini-3-flash-preview", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Wo liegt der Knowledge Cutoff von Gemini 3 Flash?
Der Knowledge Cutoff von Gemini 3 Flash liegt bei 2025-01, laut offizieller Dokumentation des Anbieters (Stand: 2026-07-09).
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.