Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Gemini 2.5 Flash-Lite

Date de sortie : 2025-07-22

chatVisionCodeAppel d'outilsMise en cache des promptsRaisonnement

Gemini 2.5 Flash-Lite est le modèle multimodal Gemini 2.5 le plus économique de Google, offrant les performances les plus rapides de la famille pour les tâches légères et à haute fréquence telles que la classification, l'extraction de données et le résumé.

Entrée
texte image vidéo audio $0.1/M
Sortie
texte $0.4/M
Entrée audio
$0.3/M
Lecture de cache
$0.01/M
Contexte
1M
vs GPT-4o
~98% moins cher
Coupure des connaissances
2025-01

Le prix en contexte

Position du prix parmi 60 modèles comparables

Entrée$0.1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Sortie$0.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lecture en cache$0.01/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 1 048 576
Sortie max (spéc. fournisseur) 65 536
Coupure des connaissances 2025-01

Mise en cache

Mode automatique + explicite
Préfixe min. 4 096

Raisonnement

Paramètre du fournisseur thinkingBudget (generateContent) · thinking_level (Interactions API)
Valeurs acceptées thinkingBudget 512 to 24576, or -1 for dynamic · Interactions API: low, medium, high
Valeur par défaut désactivée: le modèle ne réfléchit pas tant qu'aucun budget n'est défini appliquée si la requête ne précise rien
Désactivable Oui
Comportement du raisonnement Le seul Gemini livré avec la réflexion désactivée par défaut ; la plage de budget commence à 512, mais thinkingBudget 0 reste valide séparément et maintient la réflexion désactivée, tandis que -1 active la réflexion dynamique.
Paramètre reasoning_effort
Valeurs minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique

Modèle

Modalités texte + image + vidéo + audio → texte
  • Entrée de 1 048 576 tokens / 65 536 en sortie
  • entrée texte + image + vidéo + audio + PDF
  • réflexion prise en charge

selon docs officielles Google ↗

Un prompt, mesuré via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VÉRIFIER exactement 3 phrases

Gemini 2.5 Flash-Lite réussi · 3 sentences

Enabling reasoning allows our LLM to perform more complex, multi-step computations, directly increasing the computational resources and time required per query. This enhanced capability, while powerful, inherently consumes more processing power and leads to a proportional rise in our operational costs. Consequently, the doubled bill accurately reflects the significant increase in the LLM's workload and the underlying infrastructure expenses associated with its advanced reasoning functions.

sortie 80 tok latence 1.0 s

Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VÉRIFIER le correctif passe les tests

Gemini 2.5 Flash-Lite réussi · 8/8 cases

The bug in the `longest_run` function is that it doesn't account for the initial run length of 1 for any element, and it fails to consider a run that might end at the very last element of the list. The `cur` variable is incremented *after* checking for equality, meaning for a single element, it never gets incremented from its initial value of 0. Similarly, if the longest run extends to the end of the list, the `best` variable might not be updated with the final `cur` value. […]

sortie 728 tok latence 2.8 s

Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VÉRIFIER JSON valide, schéma exact

Gemini 2.5 Flash-Lite réussi · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

sortie 58 tok latence 0.9 s

Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VÉRIFIER 120 mots, 0 mot interdit

Gemini 2.5 Flash-Lite manqué · 78 words, 0 banned, 1 question

Introducing Enhanced Prompt Caching for our API Gateway! This new capability intelligently stores your prompts, reducing repeated API calls to multiple providers. Significantly cut down latency and optimize your application's performance by leveraging cached responses. How much could this speed boost improve your user experience? Our advanced caching ensures consistency and faster access to information, no matter the underlying service. Experience a more efficient and cost-effective integration strategy. Get started today and see the difference prompt caching makes.

sortie 97 tok latence 1.0 s

Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.

Utilisez Gemini 2.5 Flash-Lite en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gemini-2.5-flash-lite",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

À propos de Gemini 2.5 Flash-Lite

  • Google désigne comme meilleurs usages la classification à fort volume, l'extraction de données simple et les « applications à latence extrêmement faible où le budget et la vitesse sont les contraintes principales », ce qui est aussi le critère pour le choisir plutôt que 2.5 Flash.
  • Il accepte du texte, des images, de la vidéo, de l'audio et des PDF en entrée, avec une fenêtre de contexte de 1 048 576 tokens et une limite de sortie de 65 536 tokens, et renvoie du texte.
  • L'appel de fonctions, les sorties structurées, l'exécution de code, l'ancrage Search et Maps, le contexte d'URL, la mise en cache du contexte, la Batch API et l'inférence Flex et Priority sont tous pris en charge ; la Live API, la génération d'images et la génération audio ne le sont pas.
  • Son comportement caractéristique est la réflexion : seul dans cette gamme, Flash-Lite est livré avec la réflexion désactivée par défaut, de sorte que rien n'est dépensé en tokens de raisonnement sans demande explicite. thinkingBudget accepte de 512 à 24 576 pour une allocation fixe, ou -1 pour la réflexion dynamique, et 0 la maintient désactivée, ce qui compte puisque les tokens de réflexion sont facturés au tarif de sortie.
  • L'Interactions API plus récente de Google exprime le même contrôle sous la forme d'une chaîne thinking_level à low, medium ou high.
  • La date limite des connaissances est janvier 2025, et Google n'a publié aucune date de retrait pour les modèles 2.5 en disponibilité générale.
  • Synthorai achemine les requêtes vers lui via l'endpoint de chat completions compatible OpenAI standard.

FAQ

Peut-on essayer l'API Gemini 2.5 Flash-Lite gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $0.1/M de tokens en entrée, ce crédit couvre à lui seul environ 1,250 requêtes de ~8K tokens sur Gemini 2.5 Flash-Lite.

Quels sont les points forts de Gemini 2.5 Flash-Lite ?

Le plus économique, le plus rapide de sa famille ; réflexion optionnelle pour les problèmes plus difficiles ; conçu pour la classification, l'extraction et la synthèse. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Gemini 2.5 Flash-Lite ?

Sur Synthorai, Gemini 2.5 Flash-Lite coûte $0.1 par million de tokens en entrée et $0.4 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.01/M.

Gemini 2.5 Flash-Lite prend-il en charge la mise en cache des prompts ?

Oui : la mise en cache automatique est activée par défaut, avec un mode explicite pour des économies garanties. Les tokens d'entrée en cache sont facturés $0.01/M contre $0.1/M hors cache ; les prompts doivent avoir un préfixe stable de 4,096 tokens pour être mis en cache. Guide de mise en cache des prompts →

Comment obtenir l'accès à Gemini 2.5 Flash-Lite ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gemini-2.5-flash-lite", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Quelle est la date de coupure des connaissances de Gemini 2.5 Flash-Lite ?

La date de coupure des connaissances de Gemini 2.5 Flash-Lite est 2025-01, selon la documentation officielle du fournisseur (au 2026-07-09).

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →