Gemini 3.6 Flash è un modello in disponibilità generale che la documentazione di Google posiziona come intelligenza di livello frontiera sostenuta per l'era agentica, ottimizzata per velocità superiore e costo inferiore.
- Input
- testo immagine video audio $1.5/M
- Output
- testo $7.5/M
- Input audio
- $5/M
- Lettura cache
- $0.15/M
- Contesto
- 1M
- vs GPT-4o
- ~70% più economico
- Cutoff di conoscenza
- 2026-03
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic DeepSeek Google Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 65 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
| Cutoff di conoscenza | 2026-03 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 4.096 |
Ragionamento
| Parametro del fornitore | thinkingLevel |
|---|---|
| Valori accettati | minimal · low · medium · high |
| Valore predefinito | medium applicato se la richiesta non specifica nulla |
| Disattivabile | No |
| Comportamento del ragionamento | Condivide il profilo di thinking di 3.5 Flash, con medium di default e high come impostazione dinamica; i token di thinking vengono fatturati come token di output e le thought signature vanno restituite immutate attraverso i turni. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video + audio → testo |
|---|
- GA
- contesto da 1.048.576 token, 65.536 di output massimo
- thinking più l'intera suite di strumenti integrati incluso Computer Use
- posizionato ufficialmente come più forte su compiti agentici e multimodali complessi con un consumo di token inferiore rispetto a 3.5 Flash. Nota: temperature/top_p/top_k sono deprecati e ignorati a partire da questa generazione. Il cutoff di conoscenza proviene dalla model card di DeepMind (la pagina dell'API ha rimosso la riga): marzo 2026, e la card aggiunge che alcuni domini restano limitati a gennaio 2025
Un solo prompt, misurato attraverso il gateway
Gemini 3.6 Flash superato · 3 sentences
Enabling reasoning causes the model to generate thousands of internal "thinking" tokens behind the scenes to process logic before delivering the final response. Because our vendor bills us for every token generated—including these intermediate processing steps—our billable output volume per query surged significantly. Since output tokens carry a much higher unit cost than input tokens, this jump in processing volume directly doubled our overall spend.
out 893 tok (+816 ragionamento) latenza 4.7 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Gemini 3.6 Flash superato · 8/8 cases
Here is the fixed function along with an explanation of the bugs: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation The original function initialized `cur` and `best` to `0` and incremented `cur` on matching adjacent items, which meant it was counting identical adjacent *pairs* rather than the total number of *elements* in a run. This caused single-element inputs to skip the loop and return `0` instead of `1`, and undercounted all run lengths by 1 (for example, a run of two items at the end of the list resulted in `cur = 1`). […]
out 2034 tok (+1768 ragionamento) latenza 10.0 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Gemini 3.6 Flash superato · 5/5 fields, guidance "withheld"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld" } ```
out 2843 tok (+2783 ragionamento) latenza 13.1 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Gemini 3.6 Flash mancato · 60 words, 0 banned, 0 questions
72: reducing 73: your 74: monthly 75: token 76: spend. S6 (21): 77: You 78: can 79: easily 80: set 81: custom 82: expiration 83: rules, 84: configure 85: TTL 86: settings, 87: and 88: manage 89: cache 90: invalidation 91: across 92: all 93: vendors 94: from 95: one 96: centralized 97: dashboard. S7 (23): 98: Start 99: optimizing […]
out 4092 tok (+3929 ragionamento) latenza 16.3 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Gemini 3.6 Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.6-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.6-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.6-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.6-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Gemini 3.6 Flash
- La documentazione afferma che offre prestazioni migliori su compiti agentici e multimodali complessi riducendo al contempo l'uso di token, a un prezzo inferiore rispetto a 3.5 Flash.
- Google segnala come suoi punti di forza la generazione di codice, l'esecuzione agentica e il ragionamento spaziale, e indica come suo uso migliore i loop agentici rapidi che coinvolgono cicli e iterazioni di coding complessi; la model card lo inquadra come il livello da lavoro con un'efficienza sui token migliore di 3.5 Flash.
- Supporta il thinking e l'intera suite di strumenti integrati, inclusi Computer Use, function calling, output strutturati, esecuzione di codice, grounding con Search e Maps, contesto da URL, ricerca sui file, caching del contesto, la Batch API e l'inferenza Flex e Priority.
- L'input copre testo, immagini, video e audio su una finestra di contesto da 1M di token con 65.536 token di output. thinking_level accetta minimal, low, medium e high e ha come predefinito medium, con minimal che è una soglia minima e non un interruttore di spegnimento.
- Il cutoff di conoscenza è marzo 2026.
- La pagina del modello segnala anche una modifica all'API: temperature, top_p e top_k sono deprecati e ignorati da questa generazione in poi, e Google avverte che i modelli futuri restituiranno HTTP 400 per essi.
- Synthorai lo serve tramite il suo endpoint chat compatibile OpenAI.
FAQ
L'API di Gemini 3.6 Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.5/M token in input, quel credito da solo copre circa 83 richieste da ~8K token verso Gemini 3.6 Flash.
In cosa eccelle Gemini 3.6 Flash?
Intelligenza di frontiera più veloce ed economica; uso di token inferiore a 3.5 Flash secondo Google; contesto da 1M, Computer Use integrato. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Gemini 3.6 Flash?
Su Synthorai, Gemini 3.6 Flash costa $1.5 per milione di token in input e $7.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.15/M.
Gemini 3.6 Flash supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.15/M contro $1.5/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token. Guida al caching dei prompt →
Come ottengo l'accesso a Gemini 3.6 Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-3.6-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Gemini 3.6 Flash?
Il cutoff di conoscenza di Gemini 3.6 Flash è 2026-03, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-22).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.