Gemini 2.5 Flash-Lite è il modello Gemini 2.5 multimodale più efficiente in termini di costo di Google e offre le prestazioni più rapide della famiglia per compiti leggeri e ad alta frequenza come classificazione, estrazione di dati e riassunto.
- Input
- testo immagine video audio $0.1/M
- Output
- testo $0.4/M
- Input audio
- $0.3/M
- Lettura cache
- $0.01/M
- Contesto
- 1M
- vs GPT-4o
- ~98% più economico
- Cutoff di conoscenza
- 2025-01
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
| Cutoff di conoscenza | 2025-01 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 4.096 |
Ragionamento
| Parametro del fornitore | thinkingBudget (generateContent) · thinking_level (Interactions API) |
|---|---|
| Valori accettati | thinkingBudget 512 to 24576, or -1 for dynamic · Interactions API: low, medium, high |
| Valore predefinito | disattivato, e il modello non pensa a meno che non venga impostato un budget applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | L'unico Gemini che esce con il thinking disattivato di default; l'intervallo del budget parte da 512, ma thinkingBudget 0 è comunque valido e mantiene il thinking disattivato, mentre -1 attiva il thinking dinamico. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video + audio → testo |
|---|
- 1.048.576 token in input / 65.536 in output
- input di testo+immagini+video+audio+PDF
- thinking supportato
Un solo prompt, misurato attraverso il gateway
Gemini 2.5 Flash-Lite superato · 3 sentences
Enabling reasoning allows our LLM to perform more complex, multi-step computations, directly increasing the computational resources and time required per query. This enhanced capability, while powerful, inherently consumes more processing power and leads to a proportional rise in our operational costs. Consequently, the doubled bill accurately reflects the significant increase in the LLM's workload and the underlying infrastructure expenses associated with its advanced reasoning functions.
out 80 tok latenza 1.0 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Gemini 2.5 Flash-Lite superato · 8/8 cases
The bug in the `longest_run` function is that it doesn't account for the initial run length of 1 for any element, and it fails to consider a run that might end at the very last element of the list. The `cur` variable is incremented *after* checking for equality, meaning for a single element, it never gets incremented from its initial value of 0. Similarly, if the longest run extends to the end of the list, the `best` variable might not be updated with the final `cur` value. […]
out 728 tok latenza 2.8 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Gemini 2.5 Flash-Lite superato · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
out 58 tok latenza 0.9 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Gemini 2.5 Flash-Lite mancato · 78 words, 0 banned, 1 question
Introducing Enhanced Prompt Caching for our API Gateway! This new capability intelligently stores your prompts, reducing repeated API calls to multiple providers. Significantly cut down latency and optimize your application's performance by leveraging cached responses. How much could this speed boost improve your user experience? Our advanced caching ensures consistency and faster access to information, no matter the underlying service. Experience a more efficient and cost-effective integration strategy. Get started today and see the difference prompt caching makes.
out 97 tok latenza 1.0 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Gemini 2.5 Flash-Lite in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-2.5-flash-lite",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-2.5-flash-lite")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Gemini 2.5 Flash-Lite
- Google indica come suoi usi migliori la classificazione ad alto volume, l'estrazione semplice di dati e le "applicazioni a latenza estremamente bassa in cui budget e velocità sono i vincoli principali", che è anche la linea per sceglierlo al posto di 2.5 Flash.
- Accetta input di testo, immagini, video, audio e PDF con una finestra di contesto da 1.048.576 token e un limite di output da 65.536 token, e restituisce testo.
- Function calling, output strutturati, esecuzione di codice, grounding con Search e Maps, contesto da URL, caching del contesto, la Batch API e l'inferenza Flex e Priority sono tutti supportati; Live API, generazione di immagini e generazione di audio no.
- Il suo comportamento distintivo è il thinking: unico in questa lineup, Flash-Lite arriva con il thinking disattivato di default, quindi non si spende nulla in token di ragionamento se non li si chiede. thinkingBudget accetta da 512 a 24.576 per un'allocazione fissa oppure -1 per il thinking dinamico, e 0 lo mantiene disabilitato, il che conta perché i token di thinking sono fatturati alla tariffa di output.
- La più recente Interactions API di Google esprime lo stesso controllo come stringa thinking_level a low, medium o high.
- Il cutoff di conoscenza è gennaio 2025, e Google non ha pubblicato alcuna data di ritiro per i modelli 2.5 in disponibilità generale.
- Synthorai instrada le richieste verso di esso tramite l'endpoint standard chat completions compatibile OpenAI.
FAQ
L'API di Gemini 2.5 Flash-Lite si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.1/M token in input, quel credito da solo copre circa 1,250 richieste da ~8K token verso Gemini 2.5 Flash-Lite.
In cosa eccelle Gemini 2.5 Flash-Lite?
Il più economico, il più veloce della sua famiglia; thinking opzionale per i problemi più difficili; costruito per classificazione, estrazione e sintesi. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Gemini 2.5 Flash-Lite?
Su Synthorai, Gemini 2.5 Flash-Lite costa $0.1 per milione di token in input e $0.4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.01/M.
Gemini 2.5 Flash-Lite supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.01/M contro $0.1/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token. Guida al caching dei prompt →
Come ottengo l'accesso a Gemini 2.5 Flash-Lite?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-2.5-flash-lite" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Gemini 2.5 Flash-Lite?
Il cutoff di conoscenza di Gemini 2.5 Flash-Lite è 2025-01, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.