Gemini 2.5 Flash-Lite est le modèle multimodal Gemini 2.5 le plus économique de Google, offrant les performances les plus rapides de la famille pour les tâches légères et à haute fréquence telles que la classification, l'extraction de données et le résumé.
- Entrée
- texte image vidéo audio $0.1/M
- Sortie
- texte $0.4/M
- Entrée audio
- $0.3/M
- Lecture de cache
- $0.01/M
- Contexte
- 1M
- vs GPT-4o
- ~98% moins cher
- Coupure des connaissances
- 2025-01
Le prix en contexte
Position du prix parmi 60 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Fenêtre de contexte (spécification du fournisseur) | 1 048 576 |
|---|---|
| Sortie max (spéc. fournisseur) | 65 536 |
| Coupure des connaissances | 2025-01 |
Mise en cache
| Mode | automatique + explicite |
|---|---|
| Préfixe min. | 4 096 |
Raisonnement
| Paramètre du fournisseur | thinkingBudget (generateContent) · thinking_level (Interactions API) |
|---|---|
| Valeurs acceptées | thinkingBudget 512 to 24576, or -1 for dynamic · Interactions API: low, medium, high |
| Valeur par défaut | désactivée: le modèle ne réfléchit pas tant qu'aucun budget n'est défini appliquée si la requête ne précise rien |
| Désactivable | Oui |
| Comportement du raisonnement | Le seul Gemini livré avec la réflexion désactivée par défaut ; la plage de budget commence à 512, mais thinkingBudget 0 reste valide séparément et maintient la réflexion désactivée, tandis que -1 active la réflexion dynamique. |
| Paramètre | reasoning_effort |
| Valeurs | minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique |
Modèle
| Modalités | texte + image + vidéo + audio → texte |
|---|
- Entrée de 1 048 576 tokens / 65 536 en sortie
- entrée texte + image + vidéo + audio + PDF
- réflexion prise en charge
Un prompt, mesuré via la passerelle
Gemini 2.5 Flash-Lite réussi · 3 sentences
Enabling reasoning allows our LLM to perform more complex, multi-step computations, directly increasing the computational resources and time required per query. This enhanced capability, while powerful, inherently consumes more processing power and leads to a proportional rise in our operational costs. Consequently, the doubled bill accurately reflects the significant increase in the LLM's workload and the underlying infrastructure expenses associated with its advanced reasoning functions.
sortie 80 tok latence 1.0 s
Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.
Gemini 2.5 Flash-Lite réussi · 8/8 cases
The bug in the `longest_run` function is that it doesn't account for the initial run length of 1 for any element, and it fails to consider a run that might end at the very last element of the list. The `cur` variable is incremented *after* checking for equality, meaning for a single element, it never gets incremented from its initial value of 0. Similarly, if the longest run extends to the end of the list, the `best` variable might not be updated with the final `cur` value. […]
sortie 728 tok latence 2.8 s
Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.
Gemini 2.5 Flash-Lite réussi · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
sortie 58 tok latence 0.9 s
Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.
Gemini 2.5 Flash-Lite manqué · 78 words, 0 banned, 1 question
Introducing Enhanced Prompt Caching for our API Gateway! This new capability intelligently stores your prompts, reducing repeated API calls to multiple providers. Significantly cut down latency and optimize your application's performance by leveraging cached responses. How much could this speed boost improve your user experience? Our advanced caching ensures consistency and faster access to information, no matter the underlying service. Experience a more efficient and cost-effective integration strategy. Get started today and see the difference prompt caching makes.
sortie 97 tok latence 1.0 s
Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.
Utilisez Gemini 2.5 Flash-Lite en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-2.5-flash-lite",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-2.5-flash-lite")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));À propos de Gemini 2.5 Flash-Lite
- Google désigne comme meilleurs usages la classification à fort volume, l'extraction de données simple et les « applications à latence extrêmement faible où le budget et la vitesse sont les contraintes principales », ce qui est aussi le critère pour le choisir plutôt que 2.5 Flash.
- Il accepte du texte, des images, de la vidéo, de l'audio et des PDF en entrée, avec une fenêtre de contexte de 1 048 576 tokens et une limite de sortie de 65 536 tokens, et renvoie du texte.
- L'appel de fonctions, les sorties structurées, l'exécution de code, l'ancrage Search et Maps, le contexte d'URL, la mise en cache du contexte, la Batch API et l'inférence Flex et Priority sont tous pris en charge ; la Live API, la génération d'images et la génération audio ne le sont pas.
- Son comportement caractéristique est la réflexion : seul dans cette gamme, Flash-Lite est livré avec la réflexion désactivée par défaut, de sorte que rien n'est dépensé en tokens de raisonnement sans demande explicite. thinkingBudget accepte de 512 à 24 576 pour une allocation fixe, ou -1 pour la réflexion dynamique, et 0 la maintient désactivée, ce qui compte puisque les tokens de réflexion sont facturés au tarif de sortie.
- L'Interactions API plus récente de Google exprime le même contrôle sous la forme d'une chaîne thinking_level à low, medium ou high.
- La date limite des connaissances est janvier 2025, et Google n'a publié aucune date de retrait pour les modèles 2.5 en disponibilité générale.
- Synthorai achemine les requêtes vers lui via l'endpoint de chat completions compatible OpenAI standard.
FAQ
Peut-on essayer l'API Gemini 2.5 Flash-Lite gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $0.1/M de tokens en entrée, ce crédit couvre à lui seul environ 1,250 requêtes de ~8K tokens sur Gemini 2.5 Flash-Lite.
Quels sont les points forts de Gemini 2.5 Flash-Lite ?
Le plus économique, le plus rapide de sa famille ; réflexion optionnelle pour les problèmes plus difficiles ; conçu pour la classification, l'extraction et la synthèse. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Gemini 2.5 Flash-Lite ?
Sur Synthorai, Gemini 2.5 Flash-Lite coûte $0.1 par million de tokens en entrée et $0.4 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.01/M.
Gemini 2.5 Flash-Lite prend-il en charge la mise en cache des prompts ?
Oui : la mise en cache automatique est activée par défaut, avec un mode explicite pour des économies garanties. Les tokens d'entrée en cache sont facturés $0.01/M contre $0.1/M hors cache ; les prompts doivent avoir un préfixe stable de 4,096 tokens pour être mis en cache. Guide de mise en cache des prompts →
Comment obtenir l'accès à Gemini 2.5 Flash-Lite ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gemini-2.5-flash-lite", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Quelle est la date de coupure des connaissances de Gemini 2.5 Flash-Lite ?
La date de coupure des connaissances de Gemini 2.5 Flash-Lite est 2025-01, selon la documentation officielle du fournisseur (au 2026-07-09).
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.