Gemini 3.5 Flash è il modello che il catalogo di Google etichetta come il suo più intelligente per prestazioni di frontiera sostenute su compiti agentici e di coding, descrivendolo come intelligenza ottimizzata per compiti del mondo reale a velocità superiore e costo inferiore e "progettata per l'era agentica", eccellente nel deployment di sub-agent, nei flussi di lavoro multi-step e nei compiti a lungo orizzonte su larga scala.
- Input
- testo immagine video audio $1.5/M
- Output
- testo $9/M
- Input audio
- $5/M
- Lettura cache
- $0.15/M
- Contesto
- 1M
- vs GPT-4o
- ~70% più economico
- Cutoff di conoscenza
- 2025-01
Benchmark
Dati pubblicati dai fornitori: Anthropic Google Moonshot OpenAI
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
| Cutoff di conoscenza | 2025-01 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 4.096 |
Ragionamento
| Parametro del fornitore | thinkingLevel |
|---|---|
| Valori accettati | minimal · low · medium · high |
| Valore predefinito | medium applicato se la richiesta non specifica nulla |
| Disattivabile | No |
| Comportamento del ragionamento | high è l'impostazione dinamica; minimal non garantisce che il thinking sia disattivato, quindi i token di thinking vengono fatturati come token di output a ogni richiesta e le thought signature vanno restituite per la continuità su più turni. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video + audio → testo |
|---|
- 1.048.576 token in input / 65.536 in output
- esecuzione di codice supportata
- computer use in Preview
Un solo prompt, misurato attraverso il gateway
Gemini 3.5 Flash superato · 3 sentences
Reasoning models do not just generate a final answer; they perform a silent, multi-step "thinking" process beforehand to ensure higher accuracy. We are billed for every single one of these invisible reasoning steps (called "thinking tokens"), which drastically increases the computational volume per query. Consequently, while our user activity remained flat, our unit costs doubled because the AI is now doing significantly more backend processing to deliver these higher-quality results.
out 1152 tok (+1065 ragionamento) latenza 7.7 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Gemini 3.5 Flash superato · 8/8 cases
Here is the corrected version of the function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation of the Bug The original code initialized `best` and `cur` to `0` instead of `1` (the minimum run length for any non-empty list), which caused it to count the number of adjacent duplicate *transitions* rather than the actual number of *elements* in a run. This resulted in an off-by-one error for all runs and caused single-element lists to incorrectly return `0`. […]
out 2386 tok (+2110 ragionamento) latenza 12.7 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Gemini 3.5 Flash superato · 5/5 fields, guidance "withheld pending the Q4 close"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld pending the Q4 close" } ```
out 1950 tok (+1885 ragionamento) latenza 12.7 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Gemini 3.5 Flash mancato · 50 words, 0 banned, 0 questions
thought 51: OpenAI, 52: Anthropic, 53: and 54: Cohere. 55: When 56: a 57: client 58: submits 59: a 60: matching 61: request, 62: the 63: gateway 64: retrieves 65: the 66: cached 67: result 68: instantly, 69: slashing 70: latency 71: and 72: reducing 73: your 74: monthly 75: […]
out 4092 tok (+3933 ragionamento) latenza 19.1 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Gemini 3.5 Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.5-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.5-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.5-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.5-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Gemini 3.5 Flash
- La model card di Google indica come usi previsti i flussi di lavoro agentici, i compiti di coding e i processi enterprise di più settimane.
- Accetta input di testo, immagini, video, audio e PDF su una finestra di contesto da 1.048.576 token con 65.536 token di output, restituendo testo.
- Function calling, output strutturati, esecuzione di codice, grounding con Search e Maps, contesto da URL, ricerca sui file, caching del contesto, la Batch API e computer use in preview sono supportati; generazione di immagini, generazione di audio e la Live API no.
- Il thinking si imposta con thinking_level, che accetta minimal, low, medium e high e ha come predefinito medium, un predefinito deliberatamente più economico dell'high usato dai modelli Gemini 3 in preview, anche se minimal è una soglia minima e non un interruttore di spegnimento e fattura comunque i token di ragionamento.
- Le thought signature valgono qui come nel resto della generazione.
- È in disponibilità generale da maggio 2026, e gemini-3-flash-preview è il suo alias di preview; Google ora posiziona 3.6 Flash al di sopra di esso sull'efficienza dei token.
- Synthorai fornisce l'accesso tramite il suo endpoint chat compatibile OpenAI.
FAQ
L'API di Gemini 3.5 Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.5/M token in input, quel credito da solo copre circa 83 richieste da ~8K token verso Gemini 3.5 Flash.
In cosa eccelle Gemini 3.5 Flash?
Prestazioni di frontiera sostenute su compiti agentici; efficace per loop rapidi di coding agentico; supporto per computer use preview e grounding. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Gemini 3.5 Flash?
Su Synthorai, Gemini 3.5 Flash costa $1.5 per milione di token in input e $9 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.15/M.
Gemini 3.5 Flash supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.15/M contro $1.5/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token. Guida al caching dei prompt →
Come ottengo l'accesso a Gemini 3.5 Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-3.5-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Gemini 3.5 Flash?
Il cutoff di conoscenza di Gemini 3.5 Flash è 2025-01, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.