Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Gemini 2.5 Flash-Lite

Lanzamiento: 2025-07-22

chatVisiónCódigoLlamada a herramientasCaché de promptsRazonamiento

Gemini 2.5 Flash-Lite es el modelo multimodal Gemini 2.5 más rentable de Google, que ofrece el rendimiento más rápido de la familia para tareas ligeras de alta frecuencia como la clasificación, la extracción de datos y el resumen.

Entrada
texto imagen vídeo audio $0.1/M
Salida
texto $0.4/M
Entrada de audio
$0.3/M
Lectura de caché
$0.01/M
Contexto
1M
vs GPT-4o
~98% más barato
Corte de conocimiento
2025-01

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$0.1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$0.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.01/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.048.576
Salida máxima (especificación del proveedor) 65.536
Corte de conocimiento 2025-01

Caché de prompts

Modo automático + explícito
Prefijo mín. 4096

Razonamiento

Parámetro del proveedor thinkingBudget (generateContent) · thinking_level (Interactions API)
Valores admitidos thinkingBudget 512 to 24576, or -1 for dynamic · Interactions API: low, medium, high
Valor por defecto off, y el modelo no piensa salvo que se fije un presupuesto se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento El único Gemini que sale con el pensamiento desactivado por defecto; el rango del presupuesto empieza en 512, pero thinkingBudget 0 es válido por separado y mantiene el pensamiento desactivado, mientras que -1 activa el pensamiento dinámico.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto + imagen + vídeo + audio → texto
  • 1.048.576 tokens de entrada / 65.536 de salida
  • entrada de texto, imagen, vídeo, audio y PDF
  • pensamiento admitido

según documentación oficial de Google ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

Gemini 2.5 Flash-Lite superado · 3 sentences

Enabling reasoning allows our LLM to perform more complex, multi-step computations, directly increasing the computational resources and time required per query. This enhanced capability, while powerful, inherently consumes more processing power and leads to a proportional rise in our operational costs. Consequently, the doubled bill accurately reflects the significant increase in the LLM's workload and the underlying infrastructure expenses associated with its advanced reasoning functions.

salida 80 tok latencia 1.0 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

Gemini 2.5 Flash-Lite superado · 8/8 cases

The bug in the `longest_run` function is that it doesn't account for the initial run length of 1 for any element, and it fails to consider a run that might end at the very last element of the list. The `cur` variable is incremented *after* checking for equality, meaning for a single element, it never gets incremented from its initial value of 0. Similarly, if the longest run extends to the end of the list, the `best` variable might not be updated with the final `cur` value. […]

salida 728 tok latencia 2.8 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

Gemini 2.5 Flash-Lite superado · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

salida 58 tok latencia 0.9 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

Gemini 2.5 Flash-Lite fallado · 78 words, 0 banned, 1 question

Introducing Enhanced Prompt Caching for our API Gateway! This new capability intelligently stores your prompts, reducing repeated API calls to multiple providers. Significantly cut down latency and optimize your application's performance by leveraging cached responses. How much could this speed boost improve your user experience? Our advanced caching ensures consistency and faster access to information, no matter the underlying service. Experience a more efficient and cost-effective integration strategy. Get started today and see the difference prompt caching makes.

salida 97 tok latencia 1.0 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use Gemini 2.5 Flash-Lite en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gemini-2.5-flash-lite",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Acerca de Gemini 2.5 Flash-Lite

  • Google señala como sus mejores usos la clasificación de alto volumen, la extracción simple de datos y las «aplicaciones de latencia extremadamente baja donde el presupuesto y la velocidad son las restricciones principales», que es también el criterio para elegirlo en lugar de 2.5 Flash.
  • Acepta entrada de texto, imagen, vídeo, audio y PDF con una ventana de contexto de 1.048.576 tokens y un límite de salida de 65.536 tokens, y devuelve texto.
  • Se admiten la llamada a funciones, las salidas estructuradas, la ejecución de código, el grounding de búsqueda y de Maps, el contexto de URL, la caché de contexto, la Batch API y la inferencia Flex y Priority; no se admiten la Live API, la generación de imágenes ni la generación de audio.
  • Su comportamiento distintivo es el pensamiento: único en esta gama, Flash-Lite se entrega con el pensamiento desactivado por defecto, así que no se gasta nada en tokens de razonamiento salvo que se pidan. thinkingBudget acepta de 512 a 24.576 para una asignación fija o -1 para pensamiento dinámico, y 0 lo mantiene desactivado, lo que importa porque los tokens de pensamiento se facturan a la tarifa de salida.
  • La nueva Interactions API de Google expresa el mismo control como una cadena thinking_level en low, medium o high.
  • La fecha de corte de conocimiento es enero de 2025, y Google no ha publicado una fecha de retirada para los modelos 2.5 en disponibilidad general.
  • Synthorai enruta las solicitudes hacia él a través del endpoint estándar de chat completions compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Gemini 2.5 Flash-Lite?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.1/M por tokens de entrada, solo ese crédito cubre aproximadamente 1,250 solicitudes de ~8K tokens contra Gemini 2.5 Flash-Lite.

¿En qué destaca Gemini 2.5 Flash-Lite?

El más rentable y rápido de su familia; pensamiento opcional para problemas más difíciles; para clasificación, extracción y resumen. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Gemini 2.5 Flash-Lite?

Gemini 2.5 Flash-Lite cuesta $0.1 por millón de tokens de entrada y $0.4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.01/M.

¿Gemini 2.5 Flash-Lite admite caché de prompts?

Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.01/M frente a $0.1/M sin caché; los prompts necesitan un prefijo estable de 4,096 tokens para entrar en caché. Guía de caché de prompts →

¿Cómo obtengo acceso a Gemini 2.5 Flash-Lite?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gemini-2.5-flash-lite" y listo. Una sola clave API cubre todos los modelos del gateway.

¿Cuál es la fecha de corte de conocimiento de Gemini 2.5 Flash-Lite?

La fecha de corte de conocimiento de Gemini 2.5 Flash-Lite es 2025-01, según la documentación oficial del proveedor (a fecha de 2026-07-09).

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →