Gemini 3.5 Flash-Lite è un modello multimodale a bassa latenza in disponibilità generale che la documentazione di Google descrive come il modello più veloce e a costo più basso della famiglia 3.5, ottimizzato per un'esecuzione ad alto throughput e basso costo come i compiti dei subagent e il parsing dei documenti.
- Input
- testo immagine video audio $0.3/M
- Output
- testo $2.5/M
- Input audio
- $0.3/M
- Lettura cache
- $0.03/M
- Contesto
- 1M
- vs GPT-4o
- ~94% più economico
- Cutoff di conoscenza
- 2026-03
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 65 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
| Cutoff di conoscenza | 2026-03 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 4.096 |
Ragionamento
| Parametro del fornitore | thinkingLevel |
|---|---|
| Valori accettati | minimal · low · medium · high |
| Valore predefinito | minimal applicato se la richiesta non specifica nulla |
| Disattivabile | No |
| Comportamento del ragionamento | Il valore predefinito è il livello più economico, ma minimal è una soglia minima e non un interruttore di spegnimento, e Google afferma che Flash-Lite non supporta la disattivazione completa del thinking. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video + audio → testo |
|---|
- GA
- contesto da 1.048.576 token, 65.536 di output massimo
- il modello più veloce e a costo più basso della famiglia 3.5, ottimizzato per l'esecuzione ad alto throughput e basso costo (compiti da subagent, parsing di documenti)
- thinking e strumenti integrati incl. Computer Use. Nota: temperature/top_p/top_k sono deprecati e ignorati a partire da questa generazione. Il cutoff di conoscenza proviene dalla model card di DeepMind (la pagina dell'API ha rimosso la riga): marzo 2026, e la card aggiunge che alcuni domini restano limitati a gennaio 2025
Un solo prompt, misurato attraverso il gateway
Gemini 3.5 Flash-Lite superato · 3 sentences
Enabling reasoning forces the model to generate extensive, hidden "chain-of-thought" tokens before answering, effectively multiplying your input and output volume. Because LLM pricing is strictly usage-based per token, processing these invisible reasoning steps alongside your final answers instantly doubled your API costs. To control this spend, we must either restrict reasoning to complex queries or optimize our prompt architecture to reduce token bloat.
out 81 tok latenza 1.9 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Gemini 3.5 Flash-Lite superato · 8/8 cases
Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation The original function suffered from two main counting issues: it initialized `best` and `cur` to `0` instead of `1` (causing a single-element list like `[1]` to return `0` instead of `1`), and it only updated `best` inside the `if` block when a match was found. Because the `max()` update was skipped in the `else` block and after the loop terminated, any run that ended at the final index or occurred as a single isolated element was never captured by `best`. […]
out 251 tok latenza 2.6 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Gemini 3.5 Flash-Lite superato · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
out 58 tok latenza 1.0 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Gemini 3.5 Flash-Lite superato · 115 words, 0 banned, 1 question
Managing multiple LLM providers just got faster and cheaper. Our API gateway now features intelligent prompt caching that spans across OpenAI, Anthropic, and other major AI models. By storing and reusing frequent responses at the edge, this update slashes latency and significantly reduces your overall token costs. You configure the cache rules once, and our routing engine handles the rest behind the scenes. Why pay twice for the exact same answer when your infrastructure can remember it? Developers can deploy this capability instantly with zero code changes to existing applications. Stop wasting valuable compute cycles on duplicate requests today. Upgrade your routing pipeline and experience immediate performance gains across every integrated model you currently use.
out 130 tok latenza 2.0 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Gemini 3.5 Flash-Lite in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.5-flash-lite",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash-lite",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.5-flash-lite",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.5-flash-lite")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Gemini 3.5 Flash-Lite
- La scheda di Google aggiunge a quell'elenco traduzione e classificazione e lo inquadra come il modello a cui rivolgersi quando l'alto throughput è critico, inclusa la ricerca agentica.
- Accetta input di testo, immagini, video e audio su una finestra di contesto da 1M di token con 65.536 token di output, e supporta function calling, output strutturati, esecuzione di codice, grounding con Search e Maps, contesto da URL, ricerca sui file, caching del contesto, la Batch API, l'inferenza Flex e Priority e computer use in preview.
- Il thinking usa thinking_level con minimal, low, medium e high, con predefinito minimal, il predefinito più economico della linea Gemini 3, anche se minimal è una soglia minima e non un interruttore di spegnimento, quindi ogni chiamata porta con sé token di thinking fatturati alla tariffa di output.
- Il cutoff di conoscenza è marzo 2026, con Google che nota come alcuni domini restino limitati a gennaio 2025.
- La pagina del modello segnala anche una modifica all'API: temperature, top_p e top_k sono deprecati e attualmente ignorati, e Google afferma che le generazioni future li rifiuteranno con un HTTP 400, raccomandando al loro posto istruzioni di sistema esplicite.
- Synthorai lo serve tramite il suo endpoint chat compatibile OpenAI.
FAQ
L'API di Gemini 3.5 Flash-Lite si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.3/M token in input, quel credito da solo copre circa 416 richieste da ~8K token verso Gemini 3.5 Flash-Lite.
In cosa eccelle Gemini 3.5 Flash-Lite?
Il più veloce ed economico della famiglia 3.5; per subagenti e parsing ad alto throughput; contesto da 1M, thinking e strumenti integrati. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Gemini 3.5 Flash-Lite?
Su Synthorai, Gemini 3.5 Flash-Lite costa $0.3 per milione di token in input e $2.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.03/M.
Gemini 3.5 Flash-Lite supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.03/M contro $0.3/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token. Guida al caching dei prompt →
Come ottengo l'accesso a Gemini 3.5 Flash-Lite?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-3.5-flash-lite" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Gemini 3.5 Flash-Lite?
Il cutoff di conoscenza di Gemini 3.5 Flash-Lite è 2026-03, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-22).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.