O Claude Sonnet 5 é a próxima geração da família Sonnet da Anthropic (“a melhor combinação de velocidade e inteligência”), posicionado como uma atualização de capacidade drop-in sobre o Sonnet 4.6, com os maiores ganhos em código e tarefas agênticas.
- Entrada
- texto imagem $2/M
- Saída
- texto $10/M
- Leitura de cache
- $0.2/M
- Contexto
- 1M
- vs GPT-4o
- ~60% mais barato
- Corte de conhecimento
- 2026-01
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) Anthropic DeepSeek Google Moonshot OpenAI Tencent
O preço em contexto
Posição do preço entre 60 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.000.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 128.000 |
| Corte de conhecimento | 2026-01 |
Cache de prompts
| Modo | explícito (opt-in) |
|---|---|
| Prefixo mín. | 1.024 |
| Duração | 5 min por padrão, 1 hora opcional |
| Custo de escrita | 1.25x (5m) / 2x (1h) |
Raciocínio
| Parâmetro do fornecedor | thinking.type "adaptive" + output_config.effort |
|---|---|
| Valores aceites | thinking.type adaptive · disabled; effort low · medium · high · xhigh · max; "enabled" returns 400 |
| Valor predefinido | raciocínio ativado (adaptive); effort high aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Comportamento do raciocínio | O raciocínio fica ativo sem nenhuma configuração, e thinking {type "disabled"} é aceito em qualquer nível de effort, ao contrário do Opus 5; display tem padrão "omitted"; os blocos de raciocínio dos turnos anteriores permanecem no contexto e são cobrados como entrada. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto + imagem → texto |
|---|
- Preço introdutório de $2/$10 por MTok até 2026-08-31
- contexto de 1M
- raciocínio adaptativo ativado por padrão
- novo tokenizador (~30% mais tokens)
- parâmetros de amostragem fora do padrão retornam 400
- sem Priority Tier
conforme documentação oficial da Anthropic ↗
Um prompt, medido pelo gateway
Claude Sonnet 5 passou · 3 sentences
Reasoning mode works by having the model generate extended internal "thinking" steps before producing its final answer, and since we're billed on total tokens, that hidden reasoning text adds significantly to what we pay for—even though you never see it in the output. This is different from simply getting longer visible responses; the model is essentially "showing its work" behind the scenes, and complex prompts can trigger thousands of extra reasoning tokens per request. The upside is improved accuracy on complex tasks, but if we want to control costs, we should selectively enable reasoning only for queries that truly need it, rather than applying it universally.
saída 194 tok latência 4.3 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
Claude Sonnet 5 passou · 8/8 cases
## The Bug The function has two related off-by-one issues rooted in the same cause: `cur` and `best` are initialized to `0` instead of `1`, treating run lengths as the number of *matches* between adjacent elements rather than the number of *elements* in the run. This means a single-element input never enters the loop (since `range(1, 1)` is empty) and returns `0` instead of the correct answer of `1`. It also means that for any input, the run length is undercounted by exactly one — a run of 3 equal elements only produces 2 "match" increments, so `best` ends up as 2 instead of 3. The claim that it "misses runs that end at the last index" is actually a symptom of this same undercount: the logic does update `best` correctly on every iteration (including the last), but because it's counting matches instead of elements, the final reported value is always one less than the true longest run. […]
saída 536 tok latência 7.1 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
Claude Sonnet 5 passou · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11.5, "guidance": null } ```
saída 348 tok latência 5.3 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
Claude Sonnet 5 passou · 123 words, 0 banned, 1 question
## Introducing Cross-Provider Prompt Caching We're rolling out a new caching layer for our API gateway that works across every major LLM provider you connect through it. Instead of resending identical prompts and paying full price each time, the gateway recognizes repeated requests and serves cached responses in milliseconds—regardless of whether you're routing to OpenAI, Anthropic, or Google. What does this mean for your bill and your latency? Both drop, often significantly, especially for teams running high-volume, repetitive workloads like customer support bots or batch content generation. The cache is configurable per route, with adjustable TTLs and invalidation rules, so you stay in control of freshness versus cost. Available now for all Pro and Enterprise plans. Check your dashboard to enable it today.
saída 259 tok latência 4.8 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o Claude Sonnet 5 em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-sonnet-5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-sonnet-5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-sonnet-5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-sonnet-5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o Claude Sonnet 5
- A Anthropic o enquadra para geração de código, análise de dados, criação de conteúdo, entendimento visual e uso agêntico de ferramentas, e como a opção para trabalho que precisa de mais que o Sonnet 4.6 sem passar para um modelo de classe Opus.
- Ele chega com uma janela de contexto de 1M tokens por padrão, 128K de saída máxima, raciocínio adaptativo (adaptive thinking) ativado por padrão com controle de nível de esforço, um novo tokenizador, entrada de visão e o conjunto completo de ferramentas do Claude; o preço introdutório vale até 31 de agosto de 2026.
- A janela de 1M é ao mesmo tempo o padrão e o máximo (não há variante de contexto menor), e o esforço alcança xhigh, que nenhum outro modelo fora da linha Opus oferece, com medium descrito como aproximadamente comparável ao Sonnet 4.6 em esforço high.
- Três mudanças de comportamento importam na migração.
- O novo tokenizador produz cerca de 30% mais tokens para o mesmo texto, o que muda as contagens de uso, os orçamentos de saída e o custo por requisição sem qualquer mudança de API.
- Os parâmetros de amostragem fora do padrão agora retornam um erro, uma restrição vista antes apenas no Opus 4.7 e posteriores.
- E é o primeiro modelo de nível Sonnet com salvaguardas de cibersegurança em tempo real, em que uma requisição recusada volta como uma resposta bem-sucedida contendo uma razão de parada de recusa em vez de um erro.
- Na Synthorai, o Claude Sonnet 5 responde na mesma API compatível com OpenAI que todos os outros modelos do catálogo.
Perguntas frequentes
A API do Claude Sonnet 5 é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $2/M de tokens de entrada, só esse crédito já cobre cerca de 62 requisições de ~8K tokens ao Claude Sonnet 5.
Em que o Claude Sonnet 5 é melhor?
Maiores ganhos em código e tarefas agênticas; janela de contexto de 1M tokens por padrão; atualização de capacidade drop-in a partir do Sonnet 4.6. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Claude Sonnet 5?
Na Synthorai, o Claude Sonnet 5 custa $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.2/M.
O Claude Sonnet 5 suporta cache de prompts?
Sim, por opt-in: marque prefixos estáveis com breakpoints de cache_control. Tokens de entrada em cache são cobrados a $0.2/M, contra $2/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL 5 min por padrão, 1 hora opcional). Guia de cache de prompts →
Como obtenho acesso ao Claude Sonnet 5?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="claude-sonnet-5" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Qual é o corte de conhecimento do Claude Sonnet 5?
O corte de conhecimento do Claude Sonnet 5 é 2026-01, segundo a documentação oficial do fornecedor (verificado em 2026-07-09).
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.