Gemini 3 Flash (preview) è il modello che la documentazione di Google descrive come il migliore al mondo per la comprensione multimodale e come il suo "modello agentico e di vibe-coding più potente finora", lanciato con la promessa di prestazioni di livello frontiera che rivaleggiano con modelli più grandi a una frazione del costo.
- Input
- testo immagine video audio $0.5/M
- Output
- testo $3/M
- Input audio
- $1/M
- Lettura cache
- $0.05/M
- Contesto
- 1M
- vs GPT-4o
- ~90% più economico
- Cutoff di conoscenza
- 2025-01
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
| Cutoff di conoscenza | 2025-01 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 4.096 |
Ragionamento
| Parametro del fornitore | thinkingLevel |
|---|---|
| Valori accettati | minimal · low · medium · high |
| Valore predefinito | high applicato se la richiesta non specifica nulla |
| Disattivabile | No |
| Comportamento del ragionamento | Google afferma che Gemini 3 Flash non supporta la disattivazione completa del thinking, quindi minimal è una soglia minima e non un interruttore, e i token di thinking vengono fatturati come token di output a ogni richiesta; le thought signature vanno restituite e sono obbligatorie per il function calling. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video + audio → testo |
|---|
- Modello in preview
- 1.048.576 token in input
- computer use supportato
- generazione di immagini NON supportata nonostante il tag di capacità del gateway
Usa Gemini 3 Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3-flash-preview",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3-flash-preview",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-flash-preview",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3-flash-preview",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3-flash-preview")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Gemini 3 Flash
- Accetta input di testo, immagini, video, audio e PDF entro una finestra di contesto da 1.048.576 token e produce fino a 65.536 token di output.
- Le capacità includono function calling, output strutturati, esecuzione di codice, computer use, grounding con Search e Maps, contesto da URL, ricerca sui file, caching del contesto, la Batch API e l'inferenza Flex e Priority.
- Il thinking è controllato da thinking_level, che accetta minimal, low, medium e high e ha come predefinito high, il predefinito più costoso della famiglia: su ogni modello Gemini 3 minimal è una soglia minima e non un interruttore di spegnimento, quindi i token di thinking sono fatturati a ogni richiesta.
- La generazione ha introdotto anche le thought signature, tracce cifrate del ragionamento interno che vanno restituite per preservare la continuità multi-turno, insieme a nuovi controlli di risoluzione dei media: entrambi sono lavoro di migrazione e non extra facoltativi quando si sale dalla 2.5.
- Trattandosi di un canale preview non porta garanzie di stabilità; il successore stabile di Google è gemini-3.5-flash, la cui pagina del modello elenca questo ID come proprio alias di preview.
- Synthorai lo offre tramite la sua interfaccia unificata chat completions compatibile OpenAI.
FAQ
L'API di Gemini 3 Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.5/M token in input, quel credito da solo copre circa 250 richieste da ~8K token verso Gemini 3 Flash.
In cosa eccelle Gemini 3 Flash?
Descritto come il migliore per la comprensione multimodale; ragionamento allo stato dell'arte con forza nel creative coding; supporto per computer use e grounding con Maps. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Gemini 3 Flash?
Su Synthorai, Gemini 3 Flash costa $0.5 per milione di token in input e $3 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.05/M.
Gemini 3 Flash supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.05/M contro $0.5/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token. Guida al caching dei prompt →
Come ottengo l'accesso a Gemini 3 Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-3-flash-preview" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Gemini 3 Flash?
Il cutoff di conoscenza di Gemini 3 Flash è 2025-01, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.