Claude Sonnet 5 vs Gemini 3.7 Flash
Cuál usar y cuándo — veredicto seleccionado, no una tabla de benchmarks
gemini-3.7-flash queda unas 2.7x por debajo de claude-sonnet-5 tanto en entrada como en salida ($0.75 frente a $2 de entrada, $3.75 frente a $10 de salida, con lecturas de caché a $0.075 frente a $0.2), y acepta audio y vídeo junto a texto e imágenes, así que elígelo para trabajo barato de gran volumen o entrada de medios mixtos sobre una ventana de 1048576 tokens. Escoge claude-sonnet-5 cuando necesites generaciones largas, ya que su salida máxima de 128000 tokens es unas dos veces los 65536 del modelo Flash, o cuando su capacidad de pensamiento — desactivable por petición — encaje con tus necesidades de control. Las ventanas de contexto son equivalentes, en torno al millón de tokens en ambos casos.
Precios
| Claude Sonnet 5 | Gemini 3.7 Flash | Δ | |
|---|---|---|---|
| Entrada / 1M tokens | $2 | $0.75 | 2.7× |
| Salida / 1M tokens | $10 | $3.75 | 2.7× |
| Lectura de caché / 1M tokens | $0.2 | $0.075 | 2.7× |
| Escritura en caché | 1.25x (5m) / 2x (1h) | — | — |
Tarifas del catálogo en vivo en el momento de la compilación; la página de cada modelo incluye la ficha actualizada.
Dónde se sitúan — precio de entrada por 1M de tokens en todos los 63 modelos de chat en esta unidad de facturación (escala logarítmica)
Capacidades
| Claude Sonnet 5 | Gemini 3.7 Flash | |
|---|---|---|
| Uso de herramientas | sí | sí |
| Control de pensamiento | configurable | sí — el proveedor no publica el control |
| Salida estructurada | sí | sí |
| Caché de prompt | explícito (marcas el prefijo) | implícito + explícito |
| Tiempo de vida de la caché | 5m default, 1h option | no publicado |
| Prefijo mínimo en caché | 1024 tokens | 4096 tokens |
Especificaciones
| Claude Sonnet 5 | Gemini 3.7 Flash | |
|---|---|---|
| Modalidades de entrada | texto imagen | texto imagen audio vídeo |
| Modalidades de salida | texto | texto |
| Lanzamiento | 2026-06-30 | 2026-08-13 |
| Límite de conocimiento | 2026-01 | — |
| Ventana de contexto | 1M | 1M |
| Salida máxima | 128K | 66K |
| Parámetro de pensamiento |
| — |
| Valores aceptados | thinking.type
effort
"enabled" returns 400 | — |
| Predeterminado | thinking on (adaptive) effort
| — |
Las especificaciones se transcriben de la documentación de cada proveedor; si un proveedor no publica una fila, se omite en lugar de inferirse. Fuentes completas: Claude Sonnet 5 · Gemini 3.7 Flash
Un prompt, ambos modelos — medido a través del gateway
Claude Sonnet 5 superado · 3 sentences
Reasoning mode works by having the model generate extended internal "thinking" steps before producing its final answer, and since we're billed on total tokens, that hidden reasoning text adds significantly to what we pay for—even though you never see it in the output. This is different from simply getting longer visible responses; the model is essentially "showing its work" behind the scenes, and complex prompts can trigger thousands of extra reasoning tokens per request. The upside is improved accuracy on complex tasks, but if we want to control costs, we should selectively enable reasoning only for queries that truly need it, rather than applying it universally.
salida 194 tok latencia 4.3 s
Gemini 3.7 Flash superado · 3 sentences
Enabling reasoning causes the model to generate a high volume of invisible "thinking tokens" behind the scenes to deliberate and solve complex logic before delivering a final response. Because our vendor bills strictly on token volume, this additional internal computation effectively doubled our billable output per query. In short, our costs increased because we are now paying for the extra compute capacity required to produce significantly higher-accuracy answers.
salida 878 tok (+799 pensamiento) latencia 6.9 s
Seguimiento de la instrucción (exactamente tres frases — contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Claude Sonnet 5 superado · 8/8 cases
## The Bug The function has two related off-by-one issues rooted in the same cause: `cur` and `best` are initialized to `0` instead of `1`, treating run lengths as the number of *matches* between adjacent elements rather than the number of *elements* in the run. This means a single-element input never enters the loop (since `range(1, 1)` is empty) and returns `0` instead of the correct answer of `1`. It also means that for any input, the run length is undercounted by exactly one — a run of 3 equal elements only produces 2 "match" increments, so `best` ends up as 2 instead of 3. The claim that it "misses runs that end at the last index" is actually a symptom of this same undercount: the logic does update `best` correctly on every iteration (including the last), but because it's counting matches instead of elements, the final reported value is always one less than the true longest run. […]
salida 536 tok latencia 7.1 s
Gemini 3.7 Flash superado · 8/8 cases
Here is the corrected function: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ### Explanation of the Bug The original function tracked equal adjacent transitions instead of the actual number of elements in a run, causing all non-empty run lengths to be undercounted by one (e.g., returning `0` instead of `1` for single-element lists because the loop never executes, and `1` instead of `2` for pairs). Initializing both `best` and `cur` to `1` (after handling empty inputs) and resetting `cur` to `1` on a mismatch ensures every individual element is counted as a valid run of at least length one.
salida 1050 tok (+827 pensamiento) latencia 6.4 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Claude Sonnet 5 superado · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11.5, "guidance": null } ```
salida 348 tok latencia 5.3 s
Gemini 3.7 Flash superado · 5/5 fields, guidance "withheld"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": null, "guidance": "withheld" } ```
salida 918 tok (+858 pensamiento) latencia 6.2 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Claude Sonnet 5 superado · 123 words, 0 banned, 1 question
## Introducing Cross-Provider Prompt Caching We're rolling out a new caching layer for our API gateway that works across every major LLM provider you connect through it. Instead of resending identical prompts and paying full price each time, the gateway recognizes repeated requests and serves cached responses in milliseconds—regardless of whether you're routing to OpenAI, Anthropic, or Google. What does this mean for your bill and your latency? Both drop, often significantly, especially for teams running high-volume, repetitive workloads like customer support bots or batch content generation. The cache is configurable per route, with adjustable TTLs and invalidation rules, so you stay in control of freshness versus cost. Available now for all Pro and Enterprise plans. Check your dashboard to enable it today.
salida 259 tok latencia 4.8 s
Gemini 3.7 Flash superado · 120 words, 0 banned, 1 question
Why pay twice for identical AI queries simply because you routed them to different model vendors? Today, we introduce Universal Prompt Caching directly within our unified API gateway architecture. This capability stores repeated prompt contexts across OpenAI, Anthropic, and local models, instantly returning stored results to eliminate redundant computation fees. When your application sends an LLM request, the gateway inspects the payload, identifies semantic matches, and returns accurate cached responses in under ten milliseconds. Engineering teams can now slash inference latency by eighty percent while dramatically reducing monthly token expenditures across diverse production deployments. You retain complete privacy control, flexible cache eviction policies, and granular metrics through a single dashboard. Update your routing settings today to accelerate overall system performance.
salida 2858 tok (+2718 pensamiento) latencia 14.1 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Cambia entre ellos con una línea
Ambos IDs están en cada pestaña a continuación — el par de líneas resaltadas es la única edición. Mismo endpoint, misma clave, misma estructura de solicitud.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-sonnet-5",
# model="gemini-3.7-flash", # descomenta esta línea, comenta la de arriba
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-sonnet-5",
// model: "gemini-3.7-flash", // descomenta esta línea, comenta la de arriba
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-5",
# "model": "gemini-3.7-flash", # descomenta esta línea, comenta la de arriba
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-sonnet-5",
// Model: "gemini-3.7-flash", // descomenta esta línea, comenta la de arriba
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-sonnet-5")
// .model("gemini-3.7-flash") // descomenta esta línea, comenta la de arriba
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Preguntas frecuentes
¿Cuál es más barato, Claude Sonnet 5 o Gemini 3.7 Flash?
Gemini 3.7 Flash es más barato en entrada / 1m tokens ($0.75 vs $2, con una diferencia de 2.7×). Otras filas pueden indicar lo contrario — la tabla anterior muestra la ficha completa, y el costo real depende de su combinación.
¿Puedo hacer pruebas A/B de Claude Sonnet 5 frente a Gemini 3.7 Flash sin dos integraciones?
Sí. Ambos se sirven a través del mismo endpoint compatible con OpenAI con una clave API — el cambio es una modificación de una línea en la cadena del modelo, por lo que puede enrutar una fracción del tráfico a cada uno y comparar las facturas directamente.
¿Admiten Claude Sonnet 5 y Gemini 3.7 Flash caché de prompts?
Sí — ambos cobran las lecturas en caché por debajo de su tarifa de entrada, por lo que las cargas de trabajo con prefijo caliente cuestan menos de lo que sugieren las tarifas de lista. Las filas exactas de lectura en caché están en la tabla de precios de arriba.