Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Gemini 3.7 Flash

Lanzamiento: 2026-08-13

chatVisiónCódigoLlamada a herramientasRazonamientoCaché de prompts

Gemini 3.7 Flash es el modelo Flash más capaz de Google, disponible de forma general desde el 13 de agosto de 2026 y orientado a flujos agénticos y razonamiento multimodal.

Entrada
texto imagen audio vídeo $0.75/M
Salida
texto $3.75/M
Entrada de audio
$0.75/M
Lectura de caché
$0.075/M
Contexto
1M
vs GPT-4o
~85% más barato
Corte de conocimiento
2026-03

Benchmarks

Sobre la mediaNinguno mejor17 / 243 / 24
Gemini 3.7 Flash otros modelos medidos media de los modelos comparados ★ ningún otro modelo puntuó más alto
DeepSWE 1.1
65.3%
BioMysteryBench hard
43.5%
OSWorld 2.0
47.9%
Finance Agent v2
59%
Harvey Lab-AA
90.7%
HLE-Verified
53.6%
AutomationBench (v1.0.6)
52.3%
LVBench
ningún otro modelo puntuó más alto 85.4%

Publicado por los proveedores: Alibaba (Qwen) Anthropic DeepSeek Google Moonshot OpenAI Tencent Z.ai

El precio en contexto

Posición del precio entre 68 modelos comparables

Entrada$0.75/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$3.75/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.075/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.048.576
Salida máxima (especificación del proveedor) 65.536
Corte de conocimiento 2026-03

Caché de prompts

Modo automático + explícito
Prefijo mín. 4096

Razonamiento

Parámetro reasoning_effort
Valores minimal · low · medium · high el conjunto aceptado es del proveedor

Modelo

Modalidades texto + imagen + audio + vídeo → texto
  • Google's most capable Flash model for agentic workflows and multimodal reasoning
  • output price includes thinking tokens, and audio and video input bill at the text rate

según documentación oficial de Google ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

Gemini 3.7 Flash superado · 3 sentences

Enabling reasoning causes the model to generate a high volume of invisible "thinking tokens" behind the scenes to deliberate and solve complex logic before delivering a final response. Because our vendor bills strictly on token volume, this additional internal computation effectively doubled our billable output per query. In short, our costs increased because we are now paying for the extra compute capacity required to produce significantly higher-accuracy answers.

salida 878 tok (+799 pensamiento) latencia 6.9 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

Gemini 3.7 Flash superado · 8/8 cases

Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation of the Bug The original function tracked equal adjacent transitions instead of the actual number of elements in a run, causing all non-empty run lengths to be undercounted by one (e.g., returning `0` instead of `1` for single-element lists because the loop never executes, and `1` instead of `2` for pairs). Initializing both `best` and `cur` to `1` (after handling empty inputs) and resetting `cur` to `1` on a mismatch ensures every individual element is counted as a valid run of at least length one.

salida 1050 tok (+827 pensamiento) latencia 6.4 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

Gemini 3.7 Flash superado · 5/5 fields, guidance "withheld"

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld" } ```

salida 918 tok (+858 pensamiento) latencia 6.2 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

Gemini 3.7 Flash superado · 120 words, 0 banned, 1 question

Why pay twice for identical AI queries simply because you routed them to different model vendors? Today, we introduce Universal Prompt Caching directly within our unified API gateway architecture. This capability stores repeated prompt contexts across OpenAI, Anthropic, and local models, instantly returning stored results to eliminate redundant computation fees. When your application sends an LLM request, the gateway inspects the payload, identifies semantic matches, and returns accurate cached responses in under ten milliseconds. Engineering teams can now slash inference latency by eighty percent while dramatically reducing monthly token expenditures across diverse production deployments. You retain complete privacy control, flexible cache eviction policies, and granular metrics through a single dashboard. Update your routing settings today to accelerate overall system performance.

salida 2858 tok (+2718 pensamiento) latencia 14.1 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use Gemini 3.7 Flash en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gemini-3.7-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de Gemini 3.7 Flash

  • Acepta texto, imágenes, audio y vídeo y devuelve texto, de modo que una sola llamada puede razonar a la vez sobre una captura, una grabación y una indicación, sin encadenar varios modelos.
  • Dos detalles de precio hacen que el presupuesto sea especialmente sencillo.
  • Primero, **no hay escalón por longitud de contexto**: una indicación de 900.000 tokens cuesta lo mismo por token que una de 900, así que el trabajo de contexto largo no se encarece a mitad de camino.
  • Segundo, **tampoco hay recargo por modalidad**: la entrada de audio y vídeo se factura a la tarifa del texto, lo contrario de lo habitual en precios multimodales, lo que elimina el motivo típico para submuestrear los medios antes de enviarlos.
  • El precio de salida **incluye los tokens de pensamiento**, de modo que una respuesta con mucho razonamiento se factura sobre la traza completa y no solo sobre el texto visible; tenlo en cuenta al fijar la salida máxima.
  • La caché de contexto cuesta alrededor de una décima parte de la tarifa de entrada, más un cargo de almacenamiento por hora, así que fijar un prefijo estable compensa en bucles de agente.
  • El anclaje con la Búsqueda de Google incluye un cupo mensual compartido por la familia Gemini 3.
  • Synthorai lo ofrece a través del endpoint de chat completions compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Gemini 3.7 Flash?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.75/M por tokens de entrada, solo ese crédito cubre aproximadamente 166 solicitudes de ~8K tokens contra Gemini 3.7 Flash.

¿En qué destaca Gemini 3.7 Flash?

Nivel Flash más capaz para trabajo agéntico; entrada de texto, imagen, audio y vídeo; sin escalón de contexto ni recargo de modalidad. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Gemini 3.7 Flash?

Gemini 3.7 Flash cuesta $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.075/M.

¿Gemini 3.7 Flash admite caché de prompts?

Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.075/M frente a $0.75/M sin caché; los prompts necesitan un prefijo estable de 4,096 tokens para entrar en caché. Guía de caché de prompts →

¿Cómo obtengo acceso a Gemini 3.7 Flash?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gemini-3.7-flash" y listo. Una sola clave API cubre todos los modelos del gateway.

¿Cuál es la fecha de corte de conocimiento de Gemini 3.7 Flash?

La fecha de corte de conocimiento de Gemini 3.7 Flash es 2026-03, según la documentación oficial del proveedor (a fecha de 2026-08-15).

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →