Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Claude Sonnet 4.6

Lançado em 2026-02-17

chatCódigoRaciocínioChamada de ferramentasVisãoCache de prompts

O Claude Sonnet 4.6 é a geração que trouxe capacidade de grande contexto ao nível Sonnet: em relação ao Sonnet 4.5, ele expande a janela de contexto de 200K para 1M tokens, dobra a saída máxima para 128K tokens e adiciona o raciocínio adaptativo (adaptive thinking) junto ao raciocínio estendido.

Entrada
texto imagem $3/M
Saída
texto $15/M
Leitura de cache
$0.3/M
Contexto
1M
vs GPT-4o
~40% mais barato
Corte de conhecimento
2025-08

Benchmarks

Acima da médiaapenas 2 comparáveis
Claude Sonnet 4.6 outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
Terminal Bench 2.0 Terminus 2, max
59.1%
OSWorld-Verified
72.5%
GDPval-AA v2 Elo, max · 1606-1633
1633
MMMLU max
89.3%
MCP-Atlas max
61.3%
MMMU-Pro no tools, max
74.5%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$15/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.3/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 128.000
Corte de conhecimento 2025-08
Dados de treinamento até 2026-01 conhecimento até 2025-08

Cache de prompts

Modo explícito (opt-in)
Prefixo mín. 1.024
Duração 5 min por padrão, 1 hora opcional
Custo de escrita 1.25x (5m) / 2x (1h)

Raciocínio

Parâmetro do fornecedor thinking.type + output_config.effort (budget_tokens still accepted, deprecated)
Valores aceites thinking.type adaptive · enabled (deprecated) · disabled; effort low · medium · high · max (no xhigh)
Valor predefinido raciocínio desativado; effort high aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O raciocínio adaptativo se intercala automaticamente entre chamadas de ferramentas sem beta header; no modo manual "enabled" o header interleaved-thinking-2025-05-14 ainda funciona, mas está depreciado; os blocos de raciocínio dos turnos anteriores permanecem no contexto e são cobrados como entrada.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto + imagem → texto
  • Contexto de 1M tokens em GA com preço padrão desde 2026-03-13
  • até 300k tokens de saída na Batch API com o beta header output-300k-2026-03-24

conforme documentação oficial da Anthropic ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

Claude Sonnet 4.6 passou · 3 sentences

Here is a three-sentence explanation for a CFO: Reasoning models "think out loud" by generating a long internal chain of thought before producing the final answer, and every token in that thinking process is billed at the same rate as the output you actually see. This means a single user request that previously cost 500 tokens of output may now cost 5,000 tokens once the hidden reasoning steps are counted, multiplying cost per call by roughly 5-10x depending on task complexity. To control this, we can cap reasoning depth, route simpler tasks back to non-reasoning models, and audit which use cases actually require that level of accuracy to ensure we are only paying the premium where it delivers measurable business value.

saída 156 tok latência 4.9 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

Claude Sonnet 4.6 passou · 8/8 cases

## The Bug There are two related off-by-one errors: 1. **`cur` starts at `0` instead of `1`** — a single matching pair increments `cur` to `1`, which correctly represents a run of 2, but a single-element list (or any non-repeating list) leaves `cur = 0` and `best = 0`, when the answer should be `1`. 2. **`best` is only updated inside the `if` branch** — a run that ends at the last index is captured correctly *in that branch*, but the initialization problem means the baseline "every element is a run of at least 1" is never established. The root cause is that **`cur` tracks the number of *consecutive equal pairs*, not the length of the run**. Switching to tracking run length directly (starting `cur = 1`, updating `best` on *every* iteration including the `else` branch reset) fixes both issues. […]

saída 685 tok latência 12.2 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

Claude Sonnet 4.6 passou · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "Q3 (September quarter)", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

saída 67 tok latência 1.3 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

Claude Sonnet 4.6 passou · 121 words, 0 banned, 1 question

**Introducing Prompt Caching Across Providers** Managing AI costs gets complicated when identical prompts hit multiple providers repeatedly, burning through tokens unnecessarily. Today, we're launching cross-provider prompt caching in our API gateway — a feature that stores prompt responses and serves cached results regardless of which underlying model handles your request. Here's how it works: when your application sends a repeated prompt, the gateway checks its cache first, returning stored outputs in milliseconds rather than forwarding requests to OpenAI, Anthropic, or any connected provider. Why pay for the same generation twice? With configurable TTL settings and cache-key customization, teams processing high-volume or repetitive workloads will see immediate latency improvements and measurable cost reductions starting on day one. Available now on all paid plans.

saída 177 tok latência 5.4 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o Claude Sonnet 4.6 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-sonnet-4-6",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o Claude Sonnet 4.6

  • A Anthropic o lançou como seu modelo balanceado combinando velocidade e inteligência para tarefas do dia a dia, com desempenho aprimorado de busca agêntica consumindo menos tokens, e a janela de 1M está em disponibilidade geral com preço padrão em vez de restrita a beta.
  • Ele mantém o perfil de latência rápida do Sonnet e o preço de $3/$15 por milhão de tokens, com entrada de visão e uso de ferramentas por toda parte, e se qualifica para o beta estendido de 300K de saída da Batch API.
  • O esforço cobre de low até max, mas não xhigh; embora o parâmetro assuma high por padrão, a Anthropic recomenda explicitamente defini-lo neste modelo para evitar latência inesperada, e sugere medium como o padrão prático.
  • O raciocínio estendido ainda funciona, mas está obsoleto em favor do adaptativo, e nenhum dos tipos de raciocínio é rejeitado de imediato.
  • O prefill da mensagem do assistente retorna um erro aqui, enquanto os parâmetros de amostragem fora do padrão ainda são tolerados.
  • Essa restrição chega com o Sonnet 5.
  • Ele usa o tokenizador mais antigo, então as contagens de tokens permanecem comparáveis às de modelos anteriores.
  • A Anthropic agora o lista como modelo legado superado pelo Claude Sonnet 5.
  • Pelo endpoint compatível com OpenAI da Synthorai, ele entra em qualquer integração existente no estilo GPT sem alterações.

Perguntas frequentes

A API do Claude Sonnet 4.6 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $3/M de tokens de entrada, só esse crédito já cobre cerca de 41 requisições de ~8K tokens ao Claude Sonnet 4.6.

Em que o Claude Sonnet 4.6 é melhor?

Contexto expandido de 200K para 1M tokens; saída máxima dobrada para 128K tokens; raciocínio adaptativo com preço inalterado de $3/$15. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Claude Sonnet 4.6?

Na Synthorai, o Claude Sonnet 4.6 custa $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.3/M.

O Claude Sonnet 4.6 suporta cache de prompts?

Sim, por opt-in: marque prefixos estáveis com breakpoints de cache_control. Tokens de entrada em cache são cobrados a $0.3/M, contra $3/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL 5 min por padrão, 1 hora opcional). Guia de cache de prompts →

Como obtenho acesso ao Claude Sonnet 4.6?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="claude-sonnet-4-6" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Qual é o corte de conhecimento do Claude Sonnet 4.6?

O corte de conhecimento do Claude Sonnet 4.6 é 2025-08, segundo a documentação oficial do fornecedor (verificado em 2026-07-09).

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →