Gemini 2.5 Flash-Lite es el modelo multimodal Gemini 2.5 más rentable de Google, que ofrece el rendimiento más rápido de la familia para tareas ligeras de alta frecuencia como la clasificación, la extracción de datos y el resumen.
- Entrada
- texto imagen vídeo audio $0.1/M
- Salida
- texto $0.4/M
- Entrada de audio
- $0.3/M
- Lectura de caché
- $0.01/M
- Contexto
- 1M
- vs GPT-4o
- ~98% más barato
- Corte de conocimiento
- 2025-01
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.048.576 |
|---|---|
| Salida máxima (especificación del proveedor) | 65.536 |
| Corte de conocimiento | 2025-01 |
Caché de prompts
| Modo | automático + explícito |
|---|---|
| Prefijo mín. | 4096 |
Razonamiento
| Parámetro del proveedor | thinkingBudget (generateContent) · thinking_level (Interactions API) |
|---|---|
| Valores admitidos | thinkingBudget 512 to 24576, or -1 for dynamic · Interactions API: low, medium, high |
| Valor por defecto | off, y el modelo no piensa salvo que se fije un presupuesto se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | El único Gemini que sale con el pensamiento desactivado por defecto; el rango del presupuesto empieza en 512, pero thinkingBudget 0 es válido por separado y mantiene el pensamiento desactivado, mientras que -1 activa el pensamiento dinámico. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen + vídeo + audio → texto |
|---|
- 1.048.576 tokens de entrada / 65.536 de salida
- entrada de texto, imagen, vídeo, audio y PDF
- pensamiento admitido
Un prompt, medido a través del gateway
Gemini 2.5 Flash-Lite superado · 3 sentences
Enabling reasoning allows our LLM to perform more complex, multi-step computations, directly increasing the computational resources and time required per query. This enhanced capability, while powerful, inherently consumes more processing power and leads to a proportional rise in our operational costs. Consequently, the doubled bill accurately reflects the significant increase in the LLM's workload and the underlying infrastructure expenses associated with its advanced reasoning functions.
salida 80 tok latencia 1.0 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Gemini 2.5 Flash-Lite superado · 8/8 cases
The bug in the `longest_run` function is that it doesn't account for the initial run length of 1 for any element, and it fails to consider a run that might end at the very last element of the list. The `cur` variable is incremented *after* checking for equality, meaning for a single element, it never gets incremented from its initial value of 0. Similarly, if the longest run extends to the end of the list, the `best` variable might not be updated with the final `cur` value. […]
salida 728 tok latencia 2.8 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Gemini 2.5 Flash-Lite superado · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
salida 58 tok latencia 0.9 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Gemini 2.5 Flash-Lite fallado · 78 words, 0 banned, 1 question
Introducing Enhanced Prompt Caching for our API Gateway! This new capability intelligently stores your prompts, reducing repeated API calls to multiple providers. Significantly cut down latency and optimize your application's performance by leveraging cached responses. How much could this speed boost improve your user experience? Our advanced caching ensures consistency and faster access to information, no matter the underlying service. Experience a more efficient and cost-effective integration strategy. Get started today and see the difference prompt caching makes.
salida 97 tok latencia 1.0 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Gemini 2.5 Flash-Lite en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-2.5-flash-lite",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash-lite",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-2.5-flash-lite",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-2.5-flash-lite")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Gemini 2.5 Flash-Lite
- Google señala como sus mejores usos la clasificación de alto volumen, la extracción simple de datos y las «aplicaciones de latencia extremadamente baja donde el presupuesto y la velocidad son las restricciones principales», que es también el criterio para elegirlo en lugar de 2.5 Flash.
- Acepta entrada de texto, imagen, vídeo, audio y PDF con una ventana de contexto de 1.048.576 tokens y un límite de salida de 65.536 tokens, y devuelve texto.
- Se admiten la llamada a funciones, las salidas estructuradas, la ejecución de código, el grounding de búsqueda y de Maps, el contexto de URL, la caché de contexto, la Batch API y la inferencia Flex y Priority; no se admiten la Live API, la generación de imágenes ni la generación de audio.
- Su comportamiento distintivo es el pensamiento: único en esta gama, Flash-Lite se entrega con el pensamiento desactivado por defecto, así que no se gasta nada en tokens de razonamiento salvo que se pidan. thinkingBudget acepta de 512 a 24.576 para una asignación fija o -1 para pensamiento dinámico, y 0 lo mantiene desactivado, lo que importa porque los tokens de pensamiento se facturan a la tarifa de salida.
- La nueva Interactions API de Google expresa el mismo control como una cadena thinking_level en low, medium o high.
- La fecha de corte de conocimiento es enero de 2025, y Google no ha publicado una fecha de retirada para los modelos 2.5 en disponibilidad general.
- Synthorai enruta las solicitudes hacia él a través del endpoint estándar de chat completions compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Gemini 2.5 Flash-Lite?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.1/M por tokens de entrada, solo ese crédito cubre aproximadamente 1,250 solicitudes de ~8K tokens contra Gemini 2.5 Flash-Lite.
¿En qué destaca Gemini 2.5 Flash-Lite?
El más rentable y rápido de su familia; pensamiento opcional para problemas más difíciles; para clasificación, extracción y resumen. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Gemini 2.5 Flash-Lite?
Gemini 2.5 Flash-Lite cuesta $0.1 por millón de tokens de entrada y $0.4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.01/M.
¿Gemini 2.5 Flash-Lite admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.01/M frente a $0.1/M sin caché; los prompts necesitan un prefijo estable de 4,096 tokens para entrar en caché. Guía de caché de prompts →
¿Cómo obtengo acceso a Gemini 2.5 Flash-Lite?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gemini-2.5-flash-lite" y listo. Una sola clave API cubre todos los modelos del gateway.
¿Cuál es la fecha de corte de conocimiento de Gemini 2.5 Flash-Lite?
La fecha de corte de conocimiento de Gemini 2.5 Flash-Lite es 2025-01, según la documentación oficial del proveedor (a fecha de 2026-07-09).
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.