Gemini 3.1 Flash-Lite (preview) è il canale preview del modello multimodale a bassa latenza ed economico di Google, ottimizzato per compiti leggeri e ad alta frequenza, che Google posiziona come prestazioni di livello frontiera in grado di rivaleggiare con modelli più grandi a una frazione del costo.
- Input
- testo immagine video audio $0.25/M
- Output
- testo $1.5/M
- Input audio
- $0.75/M
- Contesto
- 1M
- vs GPT-4o
- ~95% più economico
- Cutoff di conoscenza
- 2025-01
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
| Cutoff di conoscenza | 2025-01 |
Ragionamento
| Parametro | reasoning_effort |
|---|---|
| Valori | minimal · low · medium · high l'insieme accettato è del provider |
Modello
| Modalità | testo + immagine + video + audio → testo |
|---|
- DEPRECATO: dismesso il 2026-05-25
- migrare a gemini-3.1-flash-lite
- era il primo Flash-Lite della serie Gemini 3
Un solo prompt, misurato attraverso il gateway
Gemini 3.1 Flash-Lite superato · 3 sentences
Enabling reasoning models increases your costs because the system now generates a significantly higher volume of "hidden" chain-of-thought tokens required to process complex logic. Since you are billed for every token produced during this internal deliberation phase, your total output volume has expanded alongside the depth of the analysis. You are essentially paying for the model to "think out loud" before arriving at a final answer, which directly scales your operational expenditure.
out 86 tok latenza 1.4 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Gemini 3.1 Flash-Lite superato · 8/8 cases
### Fixed Code ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` ### Explanation of the Bug The original function failed because it initialized `best` and `cur` to `0` and effectively counted "transitions" (how many times an element matched its predecessor) rather than the total count of elements in a run. By starting at `0`, a single-element list returned `0` instead of `1`, and because `cur` reset to `0` and only incremented when a match was found, the function effectively counted "extra" matches beyond the first element, failing to account for the initial element of any run. […]
out 271 tok latenza 2.0 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Gemini 3.1 Flash-Lite superato · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": null, "guidance": null } ```
out 56 tok latenza 1.3 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Gemini 3.1 Flash-Lite superato · 125 words, 0 banned, 1 question
We are launching a new caching layer for our API gateway that stores LLM responses across multiple providers. By capturing frequently requested prompts, this feature significantly lowers latency and reduces operational costs for your applications. Instead of querying expensive models for repetitive tasks, your system retrieves identical outputs instantly from our high-speed cache. This integration maintains consistency while supporting diverse provider workflows, ensuring your infrastructure remains both efficient and scalable. Are you ready to optimize your token usage and improve response times for every user? Configuration takes only minutes through our existing dashboard. This addition provides a practical strategy to manage API spend without sacrificing performance or quality. […]
out 140 tok latenza 2.3 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Gemini 3.1 Flash-Lite in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.1-flash-lite-preview",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.1-flash-lite-preview",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-flash-lite-preview",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.1-flash-lite-preview",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.1-flash-lite-preview")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Gemini 3.1 Flash-Lite
- Rilasciato a marzo 2026 come primo Flash-Lite della serie Gemini 3, accetta input di testo, immagini, video, audio e PDF entro una finestra di contesto da 1.048.576 token e un limite di output da 65.536 token, e restituisce testo.
- Gli usi raccomandati includono traduzione, trascrizione, estrazione di dati, riassunto e routing dei modelli, la stessa fascia ad alto throughput e sensibile ai costi a cui il livello Lite ha sempre mirato.
- Supporta function calling, output strutturati, esecuzione di codice, grounding con Search e Maps, contesto da URL, ricerca sui file, caching del contesto, la Batch API e l'inferenza Flex e Priority; computer use, la Live API e la generazione di immagini o audio non sono supportati.
- Il thinking si imposta con la stringa thinking_level anziché con un budget numerico e, poiché su Gemini 3 minimal è la soglia minima e non un interruttore di spegnimento, i token di ragionamento sono fatturati a ogni chiamata; le thought signature vanno rimandate indietro per mantenere coerente il ragionamento multi-turno.
- Google ha da allora deprecato questo identificatore di preview e indirizza il lavoro nuovo sul gemini-3.1-flash-lite in disponibilità generale, quindi va trattato come uno snapshot fissato anziché come un obiettivo a lungo termine.
- Synthorai lo rende richiamabile tramite il suo endpoint chat compatibile OpenAI.
FAQ
L'API di Gemini 3.1 Flash-Lite si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.25/M token in input, quel credito da solo copre circa 500 richieste da ~8K token verso Gemini 3.1 Flash-Lite.
In cosa eccelle Gemini 3.1 Flash-Lite?
Prestazioni di classe frontiera a una frazione del costo; livelli di thinking configurabili prima di rispondere; costruito per traduzione, estrazione e routing. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Gemini 3.1 Flash-Lite?
Su Synthorai, Gemini 3.1 Flash-Lite costa $0.25 per milione di token in input e $1.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.
Gemini 3.1 Flash-Lite supporta il caching dei prompt?
Gemini 3.1 Flash-Lite oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →
Come ottengo l'accesso a Gemini 3.1 Flash-Lite?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-3.1-flash-lite-preview" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Gemini 3.1 Flash-Lite?
Il cutoff di conoscenza di Gemini 3.1 Flash-Lite è 2025-01, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.