Gemini 3.1 Flash-Lite (preview) est le canal de préversion du modèle multimodal économique et à faible latence de Google, optimisé pour les tâches légères et à haute fréquence, que Google positionne comme offrant des performances de niveau frontière rivalisant avec des modèles plus grands pour une fraction du coût.
- Entrée
- texte image vidéo audio $0.25/M
- Sortie
- texte $1.5/M
- Entrée audio
- $0.75/M
- Contexte
- 1M
- vs GPT-4o
- ~95% moins cher
- Coupure des connaissances
- 2025-01
Benchmarks
Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai
Le prix en contexte
Position du prix parmi 60 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Fenêtre de contexte (spécification du fournisseur) | 1 048 576 |
|---|---|
| Sortie max (spéc. fournisseur) | 65 536 |
| Coupure des connaissances | 2025-01 |
Raisonnement
| Paramètre | reasoning_effort |
|---|---|
| Valeurs | minimal · low · medium · high l'ensemble accepté est celui du fournisseur |
Modèle
| Modalités | texte + image + vidéo + audio → texte |
|---|
- DÉPRÉCIÉ: arrêté le 2026-05-25
- migrez vers gemini-3.1-flash-lite
- c'était le premier Flash-Lite de la série Gemini 3
Un prompt, mesuré via la passerelle
Gemini 3.1 Flash-Lite réussi · 3 sentences
Enabling reasoning models increases your costs because the system now generates a significantly higher volume of "hidden" chain-of-thought tokens required to process complex logic. Since you are billed for every token produced during this internal deliberation phase, your total output volume has expanded alongside the depth of the analysis. You are essentially paying for the model to "think out loud" before arriving at a final answer, which directly scales your operational expenditure.
sortie 86 tok latence 1.4 s
Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.
Gemini 3.1 Flash-Lite réussi · 8/8 cases
### Fixed Code ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` ### Explanation of the Bug The original function failed because it initialized `best` and `cur` to `0` and effectively counted "transitions" (how many times an element matched its predecessor) rather than the total count of elements in a run. By starting at `0`, a single-element list returned `0` instead of `1`, and because `cur` reset to `0` and only incremented when a match was found, the function effectively counted "extra" matches beyond the first element, failing to account for the initial element of any run. […]
sortie 271 tok latence 2.0 s
Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.
Gemini 3.1 Flash-Lite réussi · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": null, "guidance": null } ```
sortie 56 tok latence 1.3 s
Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.
Gemini 3.1 Flash-Lite réussi · 125 words, 0 banned, 1 question
We are launching a new caching layer for our API gateway that stores LLM responses across multiple providers. By capturing frequently requested prompts, this feature significantly lowers latency and reduces operational costs for your applications. Instead of querying expensive models for repetitive tasks, your system retrieves identical outputs instantly from our high-speed cache. This integration maintains consistency while supporting diverse provider workflows, ensuring your infrastructure remains both efficient and scalable. Are you ready to optimize your token usage and improve response times for every user? Configuration takes only minutes through our existing dashboard. This addition provides a practical strategy to manage API spend without sacrificing performance or quality. […]
sortie 140 tok latence 2.3 s
Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.
Utilisez Gemini 3.1 Flash-Lite en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.1-flash-lite-preview",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.1-flash-lite-preview",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-flash-lite-preview",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.1-flash-lite-preview",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.1-flash-lite-preview")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));À propos de Gemini 3.1 Flash-Lite
- Publié en mars 2026 comme premier Flash-Lite de la série Gemini 3, il accepte du texte, des images, de la vidéo, de l'audio et des PDF en entrée dans une fenêtre de contexte de 1 048 576 tokens avec une limite de sortie de 65 536 tokens, et renvoie du texte.
- Les usages recommandés incluent la traduction, la transcription, l'extraction de données, le résumé et le routage de modèles, la même bande à fort débit et sensible aux coûts que le palier Lite a toujours visée.
- Il prend en charge l'appel de fonctions, les sorties structurées, l'exécution de code, l'ancrage Search et Maps, le contexte d'URL, la recherche de fichiers, la mise en cache du contexte, la Batch API et l'inférence Flex et Priority ; l'usage de l'ordinateur, la Live API et la génération d'images ou d'audio ne sont pas pris en charge.
- La réflexion se règle avec la chaîne thinking_level plutôt qu'avec un budget numérique, et comme minimal est un plancher sur Gemini 3 et non un interrupteur, des tokens de raisonnement sont facturés à chaque appel ; les signatures de pensée doivent être renvoyées pour garder un raisonnement multi-tours cohérent.
- Google a depuis déprécié cet identifiant de préversion et oriente les nouveaux travaux vers le gemini-3.1-flash-lite en disponibilité générale : traitez-le donc comme un snapshot épinglé plutôt que comme une cible durable.
- Synthorai le rend appelable via son endpoint de chat compatible OpenAI.
FAQ
Peut-on essayer l'API Gemini 3.1 Flash-Lite gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $0.25/M de tokens en entrée, ce crédit couvre à lui seul environ 500 requêtes de ~8K tokens sur Gemini 3.1 Flash-Lite.
Quels sont les points forts de Gemini 3.1 Flash-Lite ?
Performances de classe frontière à une fraction du coût ; niveaux de réflexion configurables avant de répondre ; conçu pour la traduction, l'extraction et le routage. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Gemini 3.1 Flash-Lite ?
Sur Synthorai, Gemini 3.1 Flash-Lite coûte $0.25 par million de tokens en entrée et $1.5 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.
Gemini 3.1 Flash-Lite prend-il en charge la mise en cache des prompts ?
Gemini 3.1 Flash-Lite n'a pas de remise sur les lectures de cache sur Synthorai aujourd'hui. La mise en cache des prompts s'applique toujours aux autres modèles de la passerelle ; voir la table des prix pour les alternatives compatibles avec le cache. Comparatif de la mise en cache par fournisseur →
Comment obtenir l'accès à Gemini 3.1 Flash-Lite ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gemini-3.1-flash-lite-preview", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Quelle est la date de coupure des connaissances de Gemini 3.1 Flash-Lite ?
La date de coupure des connaissances de Gemini 3.1 Flash-Lite est 2025-01, selon la documentation officielle du fournisseur (au 2026-07-09).
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.