Gemini 3.5 Flash-Lite est un modèle multimodal à faible latence en disponibilité générale que la documentation de Google décrit comme le modèle le plus rapide et le moins coûteux de la famille 3.5, optimisé pour une exécution à fort débit et à faible coût, comme les tâches de sous-agents et l'analyse de documents.
- Entrée
- texte image vidéo audio $0.3/M
- Sortie
- texte $2.5/M
- Entrée audio
- $0.3/M
- Lecture de cache
- $0.03/M
- Contexte
- 1M
- vs GPT-4o
- ~94% moins cher
- Coupure des connaissances
- 2026-03
Benchmarks
Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI Tencent Z.ai
Le prix en contexte
Position du prix parmi 65 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Fenêtre de contexte (spécification du fournisseur) | 1 048 576 |
|---|---|
| Sortie max (spéc. fournisseur) | 65 536 |
| Coupure des connaissances | 2026-03 |
Mise en cache
| Mode | automatique + explicite |
|---|---|
| Préfixe min. | 4 096 |
Raisonnement
| Paramètre du fournisseur | thinkingLevel |
|---|---|
| Valeurs acceptées | minimal · low · medium · high |
| Valeur par défaut | minimal appliquée si la requête ne précise rien |
| Désactivable | Non |
| Comportement du raisonnement | Réglé par défaut sur le niveau le moins cher, mais minimal est un plancher plutôt qu'un interrupteur, et Google indique que Flash-Lite ne prend pas en charge la désactivation complète de la réflexion. |
| Paramètre | reasoning_effort |
| Valeurs | minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique |
Modèle
| Modalités | texte + image + vidéo + audio → texte |
|---|
- GA
- contexte de 1M de tokens, 64K de sortie maximale
- le modèle le plus rapide et le moins cher de la famille 3.5, optimisé pour une exécution à haut débit et à faible coût (tâches de sous-agents, analyse de documents)
- réflexion et outils intégrés, dont Computer Use. À noter: temperature/top_p/top_k sont dépréciés et ignorés à partir de cette génération. La date limite des connaissances provient de la fiche modèle DeepMind (la page API a supprimé la ligne): mars 2026, la fiche ajoutant que certains domaines restent limités à janvier 2025
Un prompt, mesuré via la passerelle
Gemini 3.5 Flash-Lite réussi · 3 sentences
Enabling reasoning forces the model to generate extensive, hidden "chain-of-thought" tokens before answering, effectively multiplying your input and output volume. Because LLM pricing is strictly usage-based per token, processing these invisible reasoning steps alongside your final answers instantly doubled your API costs. To control this spend, we must either restrict reasoning to complex queries or optimize our prompt architecture to reduce token bloat.
sortie 81 tok latence 1.9 s
Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.
Gemini 3.5 Flash-Lite réussi · 8/8 cases
Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation The original function suffered from two main counting issues: it initialized `best` and `cur` to `0` instead of `1` (causing a single-element list like `[1]` to return `0` instead of `1`), and it only updated `best` inside the `if` block when a match was found. Because the `max()` update was skipped in the `else` block and after the loop terminated, any run that ended at the final index or occurred as a single isolated element was never captured by `best`. […]
sortie 251 tok latence 2.6 s
Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.
Gemini 3.5 Flash-Lite réussi · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
sortie 58 tok latence 1.0 s
Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.
Gemini 3.5 Flash-Lite réussi · 115 words, 0 banned, 1 question
Managing multiple LLM providers just got faster and cheaper. Our API gateway now features intelligent prompt caching that spans across OpenAI, Anthropic, and other major AI models. By storing and reusing frequent responses at the edge, this update slashes latency and significantly reduces your overall token costs. You configure the cache rules once, and our routing engine handles the rest behind the scenes. Why pay twice for the exact same answer when your infrastructure can remember it? Developers can deploy this capability instantly with zero code changes to existing applications. Stop wasting valuable compute cycles on duplicate requests today. Upgrade your routing pipeline and experience immediate performance gains across every integrated model you currently use.
sortie 130 tok latence 2.0 s
Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.
Utilisez Gemini 3.5 Flash-Lite en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.5-flash-lite",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash-lite",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.5-flash-lite",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.5-flash-lite")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));À propos de Gemini 3.5 Flash-Lite
- La fiche de Google ajoute la traduction et la classification à cette liste et le présente comme le modèle vers lequel se tourner quand un débit élevé est critique, y compris pour la recherche agentique.
- Il accepte du texte, des images, de la vidéo et de l'audio en entrée dans une fenêtre de contexte de 1M de tokens avec 65 536 tokens de sortie, et prend en charge l'appel de fonctions, les sorties structurées, l'exécution de code, l'ancrage Search et Maps, le contexte d'URL, la recherche de fichiers, la mise en cache du contexte, la Batch API, l'inférence Flex et Priority ainsi que l'usage de l'ordinateur en préversion.
- La réflexion utilise thinking_level avec minimal, low, medium et high, avec minimal par défaut, la valeur par défaut la moins coûteuse de la lignée Gemini 3, même si minimal est un plancher et non un interrupteur : chaque appel porte donc des tokens de réflexion facturés au tarif de sortie.
- La date limite des connaissances est mars 2026, Google notant que certains domaines restent limités à janvier 2025.
- La page modèle signale aussi un changement d'API : temperature, top_p et top_k sont dépréciés et actuellement ignorés, et Google indique que les générations futures les rejetteront avec une erreur HTTP 400, en recommandant des instructions système explicites à leur place.
- Synthorai le sert via son endpoint de chat compatible OpenAI.
FAQ
Peut-on essayer l'API Gemini 3.5 Flash-Lite gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $0.3/M de tokens en entrée, ce crédit couvre à lui seul environ 416 requêtes de ~8K tokens sur Gemini 3.5 Flash-Lite.
Quels sont les points forts de Gemini 3.5 Flash-Lite ?
Le plus rapide et le moins cher de la famille 3.5 ; conçu pour les sous-agents et l'analyse à haut débit ; contexte de 1M, réflexion et outils intégrés. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Gemini 3.5 Flash-Lite ?
Sur Synthorai, Gemini 3.5 Flash-Lite coûte $0.3 par million de tokens en entrée et $2.5 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.03/M.
Gemini 3.5 Flash-Lite prend-il en charge la mise en cache des prompts ?
Oui : la mise en cache automatique est activée par défaut, avec un mode explicite pour des économies garanties. Les tokens d'entrée en cache sont facturés $0.03/M contre $0.3/M hors cache ; les prompts doivent avoir un préfixe stable de 4,096 tokens pour être mis en cache. Guide de mise en cache des prompts →
Comment obtenir l'accès à Gemini 3.5 Flash-Lite ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gemini-3.5-flash-lite", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Quelle est la date de coupure des connaissances de Gemini 3.5 Flash-Lite ?
La date de coupure des connaissances de Gemini 3.5 Flash-Lite est 2026-03, selon la documentation officielle du fournisseur (au 2026-07-22).
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.