Gemini 3.7 Flash es el modelo Flash más capaz de Google, disponible de forma general desde el 13 de agosto de 2026 y orientado a flujos agénticos y razonamiento multimodal.
- Entrada
- texto imagen audio vídeo $0.75/M
- Salida
- texto $3.75/M
- Entrada de audio
- $0.75/M
- Lectura de caché
- $0.075/M
- Contexto
- 1M
- vs GPT-4o
- ~85% más barato
- Corte de conocimiento
- 2026-03
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic DeepSeek Google Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 68 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.048.576 |
|---|---|
| Salida máxima (especificación del proveedor) | 65.536 |
| Corte de conocimiento | 2026-03 |
Caché de prompts
| Modo | automático + explícito |
|---|---|
| Prefijo mín. | 4096 |
Razonamiento
| Parámetro | reasoning_effort |
|---|---|
| Valores | minimal · low · medium · high el conjunto aceptado es del proveedor |
Modelo
| Modalidades | texto + imagen + audio + vídeo → texto |
|---|
- Google's most capable Flash model for agentic workflows and multimodal reasoning
- output price includes thinking tokens, and audio and video input bill at the text rate
Un prompt, medido a través del gateway
Gemini 3.7 Flash superado · 3 sentences
Enabling reasoning causes the model to generate a high volume of invisible "thinking tokens" behind the scenes to deliberate and solve complex logic before delivering a final response. Because our vendor bills strictly on token volume, this additional internal computation effectively doubled our billable output per query. In short, our costs increased because we are now paying for the extra compute capacity required to produce significantly higher-accuracy answers.
salida 878 tok (+799 pensamiento) latencia 6.9 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Gemini 3.7 Flash superado · 8/8 cases
Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation of the Bug The original function tracked equal adjacent transitions instead of the actual number of elements in a run, causing all non-empty run lengths to be undercounted by one (e.g., returning `0` instead of `1` for single-element lists because the loop never executes, and `1` instead of `2` for pairs). Initializing both `best` and `cur` to `1` (after handling empty inputs) and resetting `cur` to `1` on a mismatch ensures every individual element is counted as a valid run of at least length one.
salida 1050 tok (+827 pensamiento) latencia 6.4 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Gemini 3.7 Flash superado · 5/5 fields, guidance "withheld"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld" } ```
salida 918 tok (+858 pensamiento) latencia 6.2 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Gemini 3.7 Flash superado · 120 words, 0 banned, 1 question
Why pay twice for identical AI queries simply because you routed them to different model vendors? Today, we introduce Universal Prompt Caching directly within our unified API gateway architecture. This capability stores repeated prompt contexts across OpenAI, Anthropic, and local models, instantly returning stored results to eliminate redundant computation fees. When your application sends an LLM request, the gateway inspects the payload, identifies semantic matches, and returns accurate cached responses in under ten milliseconds. Engineering teams can now slash inference latency by eighty percent while dramatically reducing monthly token expenditures across diverse production deployments. You retain complete privacy control, flexible cache eviction policies, and granular metrics through a single dashboard. Update your routing settings today to accelerate overall system performance.
salida 2858 tok (+2718 pensamiento) latencia 14.1 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Gemini 3.7 Flash en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.7-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.7-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.7-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.7-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Gemini 3.7 Flash
- Acepta texto, imágenes, audio y vídeo y devuelve texto, de modo que una sola llamada puede razonar a la vez sobre una captura, una grabación y una indicación, sin encadenar varios modelos.
- Dos detalles de precio hacen que el presupuesto sea especialmente sencillo.
- Primero, **no hay escalón por longitud de contexto**: una indicación de 900.000 tokens cuesta lo mismo por token que una de 900, así que el trabajo de contexto largo no se encarece a mitad de camino.
- Segundo, **tampoco hay recargo por modalidad**: la entrada de audio y vídeo se factura a la tarifa del texto, lo contrario de lo habitual en precios multimodales, lo que elimina el motivo típico para submuestrear los medios antes de enviarlos.
- El precio de salida **incluye los tokens de pensamiento**, de modo que una respuesta con mucho razonamiento se factura sobre la traza completa y no solo sobre el texto visible; tenlo en cuenta al fijar la salida máxima.
- La caché de contexto cuesta alrededor de una décima parte de la tarifa de entrada, más un cargo de almacenamiento por hora, así que fijar un prefijo estable compensa en bucles de agente.
- El anclaje con la Búsqueda de Google incluye un cupo mensual compartido por la familia Gemini 3.
- Synthorai lo ofrece a través del endpoint de chat completions compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Gemini 3.7 Flash?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.75/M por tokens de entrada, solo ese crédito cubre aproximadamente 166 solicitudes de ~8K tokens contra Gemini 3.7 Flash.
¿En qué destaca Gemini 3.7 Flash?
Nivel Flash más capaz para trabajo agéntico; entrada de texto, imagen, audio y vídeo; sin escalón de contexto ni recargo de modalidad. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Gemini 3.7 Flash?
Gemini 3.7 Flash cuesta $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.075/M.
¿Gemini 3.7 Flash admite caché de prompts?
Sí: el caché automático viene activado por defecto, con un modo explícito para ahorros garantizados. Los tokens de entrada en caché se facturan a $0.075/M frente a $0.75/M sin caché; los prompts necesitan un prefijo estable de 4,096 tokens para entrar en caché. Guía de caché de prompts →
¿Cómo obtengo acceso a Gemini 3.7 Flash?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gemini-3.7-flash" y listo. Una sola clave API cubre todos los modelos del gateway.
¿Cuál es la fecha de corte de conocimiento de Gemini 3.7 Flash?
La fecha de corte de conocimiento de Gemini 3.7 Flash es 2026-03, según la documentación oficial del proveedor (a fecha de 2026-08-15).
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.