Claude Sonnet 4.6 es la generación que llevó la capacidad de gran contexto al nivel Sonnet: frente a Sonnet 4.5 amplía la ventana de contexto de 200K a 1M tokens, duplica la salida máxima a 128K tokens y añade el pensamiento adaptativo junto al pensamiento extendido.
- Entrada
- texto imagen $3/M
- Salida
- texto $15/M
- Lectura de caché
- $0.3/M
- Contexto
- 1M
- vs GPT-4o
- ~40% más barato
- Corte de conocimiento
- 2025-08
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 128.000 |
| Corte de conocimiento | 2025-08 |
| Datos de entrenamiento hasta | 2026-01 conocimiento hasta 2025-08 |
Caché de prompts
| Modo | explícito (requiere activación) |
|---|---|
| Prefijo mín. | 1024 |
| Duración | 5 min por defecto, 1 hora opcional |
| Coste de escritura | 1.25x (5m) / 2x (1h) |
Razonamiento
| Parámetro del proveedor | thinking.type + output_config.effort (budget_tokens still accepted, deprecated) |
|---|---|
| Valores admitidos | thinking.type adaptive · enabled (deprecated) · disabled; effort low · medium · high · max (no xhigh) |
| Valor por defecto | pensamiento off; effort high se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | El pensamiento adaptativo se intercala automáticamente entre llamadas a herramientas sin cabecera beta; en el modo manual "enabled" la cabecera interleaved-thinking-2025-05-14 sigue funcionando pero está obsoleta; los bloques de pensamiento de los turnos anteriores se conservan en el contexto y se facturan como entrada. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen → texto |
|---|
- Contexto de 1M tokens en GA con precio estándar desde el 2026-03-13
- hasta 300k tokens de salida en la Batch API con la cabecera beta output-300k-2026-03-24
Un prompt, medido a través del gateway
Claude Sonnet 4.6 superado · 3 sentences
Here is a three-sentence explanation for a CFO: Reasoning models "think out loud" by generating a long internal chain of thought before producing the final answer, and every token in that thinking process is billed at the same rate as the output you actually see. This means a single user request that previously cost 500 tokens of output may now cost 5,000 tokens once the hidden reasoning steps are counted, multiplying cost per call by roughly 5-10x depending on task complexity. To control this, we can cap reasoning depth, route simpler tasks back to non-reasoning models, and audit which use cases actually require that level of accuracy to ensure we are only paying the premium where it delivers measurable business value.
salida 156 tok latencia 4.9 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Claude Sonnet 4.6 superado · 8/8 cases
## The Bug There are two related off-by-one errors: 1. **`cur` starts at `0` instead of `1`** — a single matching pair increments `cur` to `1`, which correctly represents a run of 2, but a single-element list (or any non-repeating list) leaves `cur = 0` and `best = 0`, when the answer should be `1`. 2. **`best` is only updated inside the `if` branch** — a run that ends at the last index is captured correctly *in that branch*, but the initialization problem means the baseline "every element is a run of at least 1" is never established. The root cause is that **`cur` tracks the number of *consecutive equal pairs*, not the length of the run**. Switching to tracking run length directly (starting `cur = 1`, updating `best` on *every* iteration including the `else` branch reset) fixes both issues. […]
salida 685 tok latencia 12.2 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Claude Sonnet 4.6 superado · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3 (September quarter)", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
salida 67 tok latencia 1.3 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Claude Sonnet 4.6 superado · 121 words, 0 banned, 1 question
**Introducing Prompt Caching Across Providers** Managing AI costs gets complicated when identical prompts hit multiple providers repeatedly, burning through tokens unnecessarily. Today, we're launching cross-provider prompt caching in our API gateway — a feature that stores prompt responses and serves cached results regardless of which underlying model handles your request. Here's how it works: when your application sends a repeated prompt, the gateway checks its cache first, returning stored outputs in milliseconds rather than forwarding requests to OpenAI, Anthropic, or any connected provider. Why pay for the same generation twice? With configurable TTL settings and cache-key customization, teams processing high-volume or repetitive workloads will see immediate latency improvements and measurable cost reductions starting on day one. Available now on all paid plans.
salida 177 tok latencia 5.4 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Claude Sonnet 4.6 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-sonnet-4-6",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-sonnet-4-6",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-4-6",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-sonnet-4-6",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-sonnet-4-6")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Claude Sonnet 4.6
- Anthropic lo lanzó como su modelo equilibrado, que combina velocidad e inteligencia para tareas cotidianas, con un mejor rendimiento en búsqueda agéntica consumiendo menos tokens, y la ventana de 1M está en disponibilidad general con precio estándar en lugar de restringida a beta.
- Mantiene el perfil de latencia rápida de Sonnet y el precio de $3/$15 por millón de tokens, con entrada visual y uso de herramientas en todo momento, y cumple los requisitos para la beta de salida ampliada de 300K de la Batch API.
- El esfuerzo cubre de low a max pero no xhigh; aunque el parámetro por defecto es high, Anthropic recomienda explícitamente fijarlo en este modelo para evitar latencias inesperadas, y sugiere medium como valor práctico por defecto.
- El pensamiento extendido sigue funcionando pero está obsoleto en favor del adaptativo, y ninguno de los dos tipos de pensamiento se rechaza de plano.
- Aquí el prefill del mensaje del asistente devuelve un error, mientras que los parámetros de muestreo distintos de los predeterminados todavía se toleran.
- Esa restricción llega con Sonnet 5.
- Usa el tokenizador antiguo, así que los recuentos de tokens siguen siendo comparables con los de modelos anteriores.
- Anthropic ahora lo lista como modelo heredado superado por Claude Sonnet 5.
- A través del endpoint compatible con OpenAI de Synthorai encaja sin cambios en cualquier integración de estilo GPT existente.
Preguntas frecuentes
¿Se puede probar gratis la API de Claude Sonnet 4.6?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $3/M por tokens de entrada, solo ese crédito cubre aproximadamente 41 solicitudes de ~8K tokens contra Claude Sonnet 4.6.
¿En qué destaca Claude Sonnet 4.6?
Contexto ampliado de 200K a 1M tokens; salida máxima duplicada a 128K tokens; pensamiento adaptativo con precio inalterado de $3/$15. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Claude Sonnet 4.6?
Claude Sonnet 4.6 cuesta $3 por millón de tokens de entrada y $15 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.3/M.
¿Claude Sonnet 4.6 admite caché de prompts?
Sí, requiere activación: marque los prefijos estables con puntos de corte cache_control. Los tokens de entrada en caché se facturan a $0.3/M frente a $3/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL 5 min por defecto, 1 hora opcional). Guía de caché de prompts →
¿Cómo obtengo acceso a Claude Sonnet 4.6?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="claude-sonnet-4-6" y listo. Una sola clave API cubre todos los modelos del gateway.
¿Cuál es la fecha de corte de conocimiento de Claude Sonnet 4.6?
La fecha de corte de conocimiento de Claude Sonnet 4.6 es 2025-08, según la documentación oficial del proveedor (a fecha de 2026-07-09).
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.