Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Gemini 3.1 Flash-Lite

Date de sortie : 2026-03-03

chatVisionCodeAppel d'outilsMise en cache des promptsRaisonnement

Gemini 3.1 Flash-Lite (preview) est le canal de préversion du modèle multimodal économique et à faible latence de Google, optimisé pour les tâches légères et à haute fréquence, que Google positionne comme offrant des performances de niveau frontière rivalisant avec des modèles plus grands pour une fraction du coût.

Entrée
texte image vidéo audio $0.25/M
Sortie
texte $1.5/M
Entrée audio
$0.75/M
Contexte
1M
vs GPT-4o
~95% moins cher
Coupure des connaissances
2025-01

Benchmarks

Au-dessus de la moyenne1 / 7
Gemini 3.1 Flash-Lite autres modèles mesurés moyenne des modèles comparés aucun autre modèle n'a fait mieux
SWE-Bench Pro
38.3%
OSWorld-Verified
54.3%
GDPval-AA v2 Elo · 642-1861
642
GDM-MRCR v2 (8-needle) 128k (average)
60.1%
CharXiv (RQ) no tools
73.2%

Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai

Le prix en contexte

Position du prix parmi 60 modèles comparables

Entrée$0.25/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Sortie$1.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 1 048 576
Sortie max (spéc. fournisseur) 65 536
Coupure des connaissances 2025-01

Raisonnement

Paramètre reasoning_effort
Valeurs minimal · low · medium · high l'ensemble accepté est celui du fournisseur

Modèle

Modalités texte + image + vidéo + audio → texte
  • DÉPRÉCIÉ: arrêté le 2026-05-25
  • migrez vers gemini-3.1-flash-lite
  • c'était le premier Flash-Lite de la série Gemini 3

selon docs officielles Google ↗

Un prompt, mesuré via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VÉRIFIER exactement 3 phrases

Gemini 3.1 Flash-Lite réussi · 3 sentences

Enabling reasoning models increases your costs because the system now generates a significantly higher volume of "hidden" chain-of-thought tokens required to process complex logic. Since you are billed for every token produced during this internal deliberation phase, your total output volume has expanded alongside the depth of the analysis. You are essentially paying for the model to "think out loud" before arriving at a final answer, which directly scales your operational expenditure.

sortie 86 tok latence 1.4 s

Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VÉRIFIER le correctif passe les tests

Gemini 3.1 Flash-Lite réussi · 8/8 cases

### Fixed Code ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` ### Explanation of the Bug The original function failed because it initialized `best` and `cur` to `0` and effectively counted "transitions" (how many times an element matched its predecessor) rather than the total count of elements in a run. By starting at `0`, a single-element list returned `0` instead of `1`, and because `cur` reset to `0` and only incremented when a match was found, the function effectively counted "extra" matches beyond the first element, failing to account for the initial element of any run. […]

sortie 271 tok latence 2.0 s

Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VÉRIFIER JSON valide, schéma exact

Gemini 3.1 Flash-Lite réussi · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": null, "guidance": null } ```

sortie 56 tok latence 1.3 s

Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VÉRIFIER 120 mots, 0 mot interdit

Gemini 3.1 Flash-Lite réussi · 125 words, 0 banned, 1 question

We are launching a new caching layer for our API gateway that stores LLM responses across multiple providers. By capturing frequently requested prompts, this feature significantly lowers latency and reduces operational costs for your applications. Instead of querying expensive models for repetitive tasks, your system retrieves identical outputs instantly from our high-speed cache. This integration maintains consistency while supporting diverse provider workflows, ensuring your infrastructure remains both efficient and scalable. Are you ready to optimize your token usage and improve response times for every user? Configuration takes only minutes through our existing dashboard. This addition provides a practical strategy to manage API spend without sacrificing performance or quality. […]

sortie 140 tok latence 2.3 s

Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.

Utilisez Gemini 3.1 Flash-Lite en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gemini-3.1-flash-lite-preview",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

À propos de Gemini 3.1 Flash-Lite

  • Publié en mars 2026 comme premier Flash-Lite de la série Gemini 3, il accepte du texte, des images, de la vidéo, de l'audio et des PDF en entrée dans une fenêtre de contexte de 1 048 576 tokens avec une limite de sortie de 65 536 tokens, et renvoie du texte.
  • Les usages recommandés incluent la traduction, la transcription, l'extraction de données, le résumé et le routage de modèles, la même bande à fort débit et sensible aux coûts que le palier Lite a toujours visée.
  • Il prend en charge l'appel de fonctions, les sorties structurées, l'exécution de code, l'ancrage Search et Maps, le contexte d'URL, la recherche de fichiers, la mise en cache du contexte, la Batch API et l'inférence Flex et Priority ; l'usage de l'ordinateur, la Live API et la génération d'images ou d'audio ne sont pas pris en charge.
  • La réflexion se règle avec la chaîne thinking_level plutôt qu'avec un budget numérique, et comme minimal est un plancher sur Gemini 3 et non un interrupteur, des tokens de raisonnement sont facturés à chaque appel ; les signatures de pensée doivent être renvoyées pour garder un raisonnement multi-tours cohérent.
  • Google a depuis déprécié cet identifiant de préversion et oriente les nouveaux travaux vers le gemini-3.1-flash-lite en disponibilité générale : traitez-le donc comme un snapshot épinglé plutôt que comme une cible durable.
  • Synthorai le rend appelable via son endpoint de chat compatible OpenAI.

FAQ

Peut-on essayer l'API Gemini 3.1 Flash-Lite gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $0.25/M de tokens en entrée, ce crédit couvre à lui seul environ 500 requêtes de ~8K tokens sur Gemini 3.1 Flash-Lite.

Quels sont les points forts de Gemini 3.1 Flash-Lite ?

Performances de classe frontière à une fraction du coût ; niveaux de réflexion configurables avant de répondre ; conçu pour la traduction, l'extraction et le routage. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Gemini 3.1 Flash-Lite ?

Sur Synthorai, Gemini 3.1 Flash-Lite coûte $0.25 par million de tokens en entrée et $1.5 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.

Gemini 3.1 Flash-Lite prend-il en charge la mise en cache des prompts ?

Gemini 3.1 Flash-Lite n'a pas de remise sur les lectures de cache sur Synthorai aujourd'hui. La mise en cache des prompts s'applique toujours aux autres modèles de la passerelle ; voir la table des prix pour les alternatives compatibles avec le cache. Comparatif de la mise en cache par fournisseur →

Comment obtenir l'accès à Gemini 3.1 Flash-Lite ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gemini-3.1-flash-lite-preview", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Quelle est la date de coupure des connaissances de Gemini 3.1 Flash-Lite ?

La date de coupure des connaissances de Gemini 3.1 Flash-Lite est 2025-01, selon la documentation officielle du fournisseur (au 2026-07-09).

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →