Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Gemini 3.5 Flash-Lite

Rilasciato 2026-07-21

chatVisioneCodiceChiamata di strumentiCaching dei promptRagionamento

Gemini 3.5 Flash-Lite è un modello multimodale a bassa latenza in disponibilità generale che la documentazione di Google descrive come il modello più veloce e a costo più basso della famiglia 3.5, ottimizzato per un'esecuzione ad alto throughput e basso costo come i compiti dei subagent e il parsing dei documenti.

Input
testo immagine video audio $0.3/M
Output
testo $2.5/M
Input audio
$0.3/M
Lettura cache
$0.03/M
Contesto
1M
vs GPT-4o
~94% più economico
Cutoff di conoscenza
2026-03

Benchmark

Sopra la mediaNessuno migliore3 / 71 / 7
Gemini 3.5 Flash-Lite altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
SWE-Bench Pro
54.2%
OSWorld-Verified
74%
GDPval-AA v2 Elo · 642-1171 secondo Google · 2026-08-26
1140
GDM-MRCR v2 (8-needle) 128k (average)
nessun altro modello ha fatto meglio 72.2%
CharXiv (RQ) no tools
74.5%

Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai

Il prezzo nel contesto

Posizione del prezzo tra 65 modelli comparabili

Input$0.3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$2.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.03/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.048.576
Output massimo (specifica del vendor) 65.536
Cutoff di conoscenza 2026-03

Caching prompt

Modalità automatico + esplicito
Prefisso min. 4.096

Ragionamento

Parametro del fornitore thinkingLevel
Valori accettati minimal · low · medium · high
Valore predefinito minimal applicato se la richiesta non specifica nulla
Disattivabile No
Comportamento del ragionamento Il valore predefinito è il livello più economico, ma minimal è una soglia minima e non un interruttore di spegnimento, e Google afferma che Flash-Lite non supporta la disattivazione completa del thinking.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine + video + audio → testo
  • GA
  • contesto da 1.048.576 token, 65.536 di output massimo
  • il modello più veloce e a costo più basso della famiglia 3.5, ottimizzato per l'esecuzione ad alto throughput e basso costo (compiti da subagent, parsing di documenti)
  • thinking e strumenti integrati incl. Computer Use. Nota: temperature/top_p/top_k sono deprecati e ignorati a partire da questa generazione. Il cutoff di conoscenza proviene dalla model card di DeepMind (la pagina dell'API ha rimosso la riga): marzo 2026, e la card aggiunge che alcuni domini restano limitati a gennaio 2025

fonte: documentazione ufficiale Google ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

Gemini 3.5 Flash-Lite superato · 3 sentences

Enabling reasoning forces the model to generate extensive, hidden "chain-of-thought" tokens before answering, effectively multiplying your input and output volume. Because LLM pricing is strictly usage-based per token, processing these invisible reasoning steps alongside your final answers instantly doubled your API costs. To control this spend, we must either restrict reasoning to complex queries or optimize our prompt architecture to reduce token bloat.

out 81 tok latenza 1.9 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

Gemini 3.5 Flash-Lite superato · 8/8 cases

Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation The original function suffered from two main counting issues: it initialized `best` and `cur` to `0` instead of `1` (causing a single-element list like `[1]` to return `0` instead of `1`), and it only updated `best` inside the `if` block when a match was found. Because the `max()` update was skipped in the `else` block and after the loop terminated, any run that ended at the final index or occurred as a single isolated element was never captured by `best`. […]

out 251 tok latenza 2.6 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

Gemini 3.5 Flash-Lite superato · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

out 58 tok latenza 1.0 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

Gemini 3.5 Flash-Lite superato · 115 words, 0 banned, 1 question

Managing multiple LLM providers just got faster and cheaper. Our API gateway now features intelligent prompt caching that spans across OpenAI, Anthropic, and other major AI models. By storing and reusing frequent responses at the edge, this update slashes latency and significantly reduces your overall token costs. You configure the cache rules once, and our routing engine handles the rest behind the scenes. Why pay twice for the exact same answer when your infrastructure can remember it? Developers can deploy this capability instantly with zero code changes to existing applications. Stop wasting valuable compute cycles on duplicate requests today. Upgrade your routing pipeline and experience immediate performance gains across every integrated model you currently use.

out 130 tok latenza 2.0 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa Gemini 3.5 Flash-Lite in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Informazioni su Gemini 3.5 Flash-Lite

  • La scheda di Google aggiunge a quell'elenco traduzione e classificazione e lo inquadra come il modello a cui rivolgersi quando l'alto throughput è critico, inclusa la ricerca agentica.
  • Accetta input di testo, immagini, video e audio su una finestra di contesto da 1M di token con 65.536 token di output, e supporta function calling, output strutturati, esecuzione di codice, grounding con Search e Maps, contesto da URL, ricerca sui file, caching del contesto, la Batch API, l'inferenza Flex e Priority e computer use in preview.
  • Il thinking usa thinking_level con minimal, low, medium e high, con predefinito minimal, il predefinito più economico della linea Gemini 3, anche se minimal è una soglia minima e non un interruttore di spegnimento, quindi ogni chiamata porta con sé token di thinking fatturati alla tariffa di output.
  • Il cutoff di conoscenza è marzo 2026, con Google che nota come alcuni domini restino limitati a gennaio 2025.
  • La pagina del modello segnala anche una modifica all'API: temperature, top_p e top_k sono deprecati e attualmente ignorati, e Google afferma che le generazioni future li rifiuteranno con un HTTP 400, raccomandando al loro posto istruzioni di sistema esplicite.
  • Synthorai lo serve tramite il suo endpoint chat compatibile OpenAI.

FAQ

L'API di Gemini 3.5 Flash-Lite si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.3/M token in input, quel credito da solo copre circa 416 richieste da ~8K token verso Gemini 3.5 Flash-Lite.

In cosa eccelle Gemini 3.5 Flash-Lite?

Il più veloce ed economico della famiglia 3.5; per subagenti e parsing ad alto throughput; contesto da 1M, thinking e strumenti integrati. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Gemini 3.5 Flash-Lite?

Su Synthorai, Gemini 3.5 Flash-Lite costa $0.3 per milione di token in input e $2.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.03/M.

Gemini 3.5 Flash-Lite supporta il caching dei prompt?

Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.03/M contro $0.3/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token. Guida al caching dei prompt →

Come ottengo l'accesso a Gemini 3.5 Flash-Lite?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-3.5-flash-lite" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Qual è il cutoff di conoscenza di Gemini 3.5 Flash-Lite?

Il cutoff di conoscenza di Gemini 3.5 Flash-Lite è 2026-03, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-22).

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →