Novo tokenizer do Claude Sonnet 5: 41% mais tokens por prompt
Conteúdo
O claude-sonnet-5 já está disponível no gateway da Synthorai e, por enquanto, custa pouco: $2 / $10 por milhão de tokens de entrada / saída, 2.5× menos que o Opus 4.8 e abaixo do Sonnet 4.6. Aproveite enquanto dura. Esse é o preço promocional até 31 de agosto de 2026; em 1º de setembro, o preço volta para $3 / $15, o mesmo valor de tabela do Sonnet 4.6.
Para quem usa cache com a linha Claude, o contrato de caching e TTL é totalmente compatível. O custo exige mais atenção por causa da forma como o Sonnet 5 conta tokens. Ele usa um novo tokenizer que transforma o mesmo texto em inglês em cerca de 41% mais tokens de entrada do que o Sonnet 4.6. A cobrança e os limites são calculados pela quantidade de tokens. O preço de tabela conta apenas metade da história.
TL;DR
- O Claude Sonnet 5 custa $2/$10 por milhão de tokens de entrada/saída até 31 de agosto de 2026; em 1º de setembro, volta para $3/$15, o mesmo preço de tabela do Sonnet 4.6.
- Um texto idêntico gera 2,245 tokens no Sonnet 5 contra 1,594 no Sonnet 4.6: 41% a mais, exatamente a mesma contagem do Opus 4.8.
- Com o preço padrão, o mesmo prompt em inglês custa cerca de 41% mais no Sonnet 5 do que no Sonnet 4.6.
- O caching permanece igual, com cerca de 90% de desconto nas leituras; uma chamada com cache aquecido custou $0.0017, contra $0.0043 no Opus 4.8.
Antes mesmo de considerar mudanças no código ou diferenças de qualidade, a nova contagem de tokens afeta:
- Custo por prompt. Com o preço padrão, o mesmo prompt em inglês custa cerca de 41% mais do que no Sonnet 4.6, pois um texto idêntico é cobrado como mais tokens pelo mesmo preço unitário.
- Todas as estimativas baseadas em tokens. Um orçamento por chamada ou uma contagem feita por um tokenizer local e dimensionada para o 4.6 fica cerca de 40% abaixo do valor real no Sonnet 5. Meça o
usageem produção; não dependa de uma estimativa local. - Folga na janela de contexto. O mesmo documento consome cerca de 41% mais da janela. Chamadas com contexto longo e RAG passam a comportar menos texto real por requisição.
- Rate limits. Para a mesma carga de trabalho, um limite de tokens por minuto é consumido cerca de 41% mais rápido, reduzindo o throughput.
- Elegibilidade para cache, com uma pequena vantagem. Fica mais fácil ultrapassar o mínimo de 1,024 tokens. Um prefixo que ficava pouco abaixo do limite no 4.6 pode passar a ser armazenável em cache no Sonnet 5.
O restante deste artigo apresenta medições para cada ponto: preço, economia do caching e mudança na contagem de tokens.
Preços, caching, TTL e contagens de tokens medidos em
https://synthorai.io/pelo endpoint Anthropic-native/v1/messagesem 2026-07-01. Os preços por token foram calculados a partir do custo informado emusageem chamadas reais; os preços promocional e padrão e o encerramento da promoção em 31 de agosto vêm do anúncio da Anthropic. Reproduza as medições com seu próprio prompt antes de citar os números.
Disponibilidade
import os
from anthropic import Anthropic
anth = Anthropic(
api_key=os.environ["SYNTHORAI_KEY"],
base_url="https://synthorai.io/", # SDK appends /v1/messages
)
msg = anth.messages.create(
model="claude-sonnet-5", # the only line that changes
max_tokens=512,
system=[
{"type": "text", "text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}},
],
messages=[{"role": "user", "content": question}],
)
print(msg.usage) # cache_creation_input_tokens, cache_read_input_tokens, cost
Troque o campo model e nada muda no fluxo de caching. O funcionamento do cache_control está no tutorial de caching; a arquitetura que justifica a existência do cache está na Parte 1 da série.
Preço: barato agora, de volta ao valor do Sonnet 4.6 em setembro
Preços por token no gateway, calculados a partir do custo informado em usage em chamadas simples, sem cache:
| Modelo | Entrada ($/M) | Saída ($/M) |
|---|---|---|
claude-sonnet-5 (promoção, até 31 de ago.) | $2.00 | $10.00 |
claude-sonnet-5 (padrão, a partir de 1º de set.) | $3.00 | $15.00 |
claude-sonnet-4-6 | $3.00 | $15.00 |
claude-opus-4-8 | $5.00 | $25.00 |
O preço promocional oferece um desconto real. Em relação ao Opus 4.8, essa vantagem continua depois da promoção: mesmo no preço padrão de $3 / $15, o Sonnet 5 permanece mais barato que o Opus. Como os dois usam o mesmo tokenizer, conforme detalhado abaixo, a comparação é direta nos dois preços.
Em relação ao Sonnet 4.6, o desconto é temporário. Em 1º de setembro, o preço de tabela será idêntico. Qualquer plano baseado na premissa de que “o Sonnet 5 é mais barato que o 4.6” deixa de valer com o fim da promoção. Como mostra a próxima seção, com preços por token iguais, o Sonnet 5 custa mais para processar o mesmo texto.
Não publicamos benchmarks de capacidade que não executamos. Cabe à sua avaliação determinar se a qualidade do Sonnet 5 justifica o custo adicional em relação ao 4.6.
Caching e TTL: compatibilidade direta
O contrato de caching é idêntico ao restante da linha Claude. Executamos uma sequência de escrita a frio e leitura com cache aquecido usando um prefixo estável de 2.2K tokens. A mensagem do usuário variou a cada chamada para impedir que um cache no nível da resposta contaminasse o resultado. Custo por chamada com cache aquecido, no preço promocional atual:
| Modelo | Chamada a frio (escrita no cache) | Chamada aquecida (leitura do cache) | Fria → aquecida |
|---|---|---|---|
claude-sonnet-5 (promoção) | $0.0069 | $0.0017 | 4.0× |
claude-sonnet-4-6 | $0.0079 | $0.0024 | 3.3× |
claude-opus-4-8 | $0.0172 | $0.0043 | 4.0× |
As mesmas regras da linha Opus continuam valendo:
- Desconto de leitura ≈ 90%. Uma leitura com cache aquecido custa cerca de 10% do preço de entrada, de acordo com a economia documentada pela Anthropic de “até 90%” para leituras em cache. O investimento se paga já no primeiro hit.
- O TTL de 1 hora funciona da mesma forma. O Sonnet 5 aceita
cache_control: {"type": "ephemeral", "ttl": "1h"}, e o objetousagecontinua separando os grupos:cache_creation.ephemeral_5m_input_tokenseephemeral_1h_input_tokens. O custo adicional da escrita com TTL de 1 hora é de cerca de 2× em relação a uma chamada sem cache, contra cerca de 1.25× para uma escrita de 5 minutos. As leituras permanecem em ≈10%, independentemente do TTL.
Os valores das chamadas aquecidas na tabela usam o preço promocional. A partir de 1º de setembro, multiplique os valores do Sonnet 5 por 1.5× ($2 → $3 na entrada, $10 → $15 na saída). Uma chamada aquecida do Sonnet 5 que hoje custa $0.0017 passará a custar cerca de $0.0026 em setembro. Ainda ficará abaixo dos $0.0043 do Opus 4.8, mas não abaixo do Sonnet 4.6.
A diferença na contagem de tokens
O reajuste de setembro tem impacto duplo. O mesmo texto de system prompt gera cerca de 41% mais tokens de entrada no Sonnet 5 do que no Sonnet 4.6.
| Modelo | Tokens de entrada (texto idêntico) | Custo de entrada no preço padrão |
|---|---|---|
claude-sonnet-4-6 | 1,594 | $0.0048 |
claude-sonnet-5 | 2,245 | $0.0067 |
claude-opus-4-8 | 2,245 | $0.0112 |
O mesmo prompt em inglês gera 2,245 tokens no Sonnet 5, exatamente a quantidade informada pelo Opus 4.8 e bem acima dos 1,594 do Sonnet 4.6. O Sonnet 5 foi lançado com o tokenizer mais recente, adotado pela linha Opus a partir do 4.7.
Combinando preço e contagem de tokens, o resultado fica claro:
- Durante o período promocional, o aumento de 41% na quantidade de tokens é compensado pelo preço 33% menor ($2 contra $3). Assim, o mesmo prompt sem cache custa aproximadamente o mesmo que no 4.6, e as chamadas aquecidas ficam mais baratas graças ao desconto na saída.
- A partir de 1º de setembro, o preço por token será igual ao do 4.6, mas a contagem não. O mesmo prompt em inglês custará cerca de 41% mais no Sonnet 5 do que no Sonnet 4.6 ($0.0067 contra $0.0048 para este prefixo), pois um texto idêntico é contado como mais tokens pelo mesmo preço unitário.
Na comparação com o Opus 4.8, esse problema não existe: o tokenizer é o mesmo (2,245 = 2,245). Portanto, o Sonnet 5 é diretamente mais barato tanto no preço promocional (2.5×) quanto no preço padrão (1.67×).
Faça o orçamento com base na fatura de setembro, não na de julho: o preço por token aumenta 1.5× em 1º de setembro, e a contagem maior de tokens já está em vigor. Leia também cache_creation_input_tokens / cache_read_input_tokens na resposta real, em vez de confiar em um tokenizer local que talvez ainda use o vocabulário antigo.
Sonnet 5 vs Opus 4.8: vantagem duradoura
Essa é a comparação que o lançamento muda de forma permanente. O Sonnet 5 e o Opus 4.8 usam o mesmo tokenizer. Para qualquer prompt, as contagens de tokens são idênticas e a diferença de custo vem apenas do preço: 2.5× mais barato no preço promocional e 1.67× mais barato no preço padrão, tanto em chamadas frias quanto aquecidas, na entrada e na saída. Uma chamada com cache aquecido custa hoje $0.0017 contra $0.0043; mesmo em setembro, será aproximadamente $0.0026 contra $0.0043.
Em um loop de agente com alto volume e caching, no qual o prefixo se repete a cada chamada, essa diferença se acumula. A decisão segue o processo habitual: execute sua própria avaliação. Se o Sonnet 5 atingir o nível de qualidade necessário, os custos no gateway continuam favorecendo o modelo mesmo após agosto. Caso contrário, basta alterar um campo model para usar o Opus 4.8 com o mesmo código de caching.
Checklist de migração
- ✅ O código de caching pode ser reutilizado sem alterações. Marcadores de
cache_control, quantidade de breakpoints,ttl: "1h"e nomes dos campos deusagesão idênticos aos da linha Opus. - ✅ As opções de TTL permanecem iguais. 5m para cargas de trabalho em tempo real ou por sessão; 1h para cargas em rajadas ou agentes com pausas.
- ✅ A economia dos descontos permanece igual. ≈90% na leitura, ≈1.25× na escrita (5m) e ≈2× na escrita (1h).
- ⚠️ Inclua 1º de setembro no orçamento. O preço promocional termina em 31 de agosto; o Sonnet 5 passa para $3 / $15. Modele o aumento de 1.5× antes que ele entre em vigor.
- ⚠️ Meça novamente as contagens de tokens se estiver migrando do 4.6 ou anterior. O mesmo texto gera cerca de 41% mais tokens no Sonnet 5. Com o preço padrão, isso torna o mesmo prompt mais caro do que no 4.6, não mais barato.
- ⚠️ Use o objeto
usageda chamada real. Leia*_input_tokensecostna resposta, não em uma estimativa armazenada da geração anterior.
Conclusão
O Sonnet 5 oferece uma boa relação custo-benefício por tempo limitado. Em relação ao Opus 4.8, ele continua 1.67–2.5× mais barato e permite reaproveitar o fluxo de caching sem alterações. Isso o torna o primeiro modelo a avaliar para qualquer carga do Opus em que a qualidade não seja crítica. Em relação ao Sonnet 4.6, a vantagem se resume ao desconto promocional: em 1º de setembro, os preços por token se igualam, e o novo tokenizer faz o mesmo prompt custar mais. Aproveite o desconto, mas dimensione o orçamento com os valores de setembro e confirme as contagens de tokens no objeto usage real antes de assumir compromissos com a área financeira.
Para o guia completo de caching, consulte a série sobre prompt caching, começando por Como funcionam KV Cache e TTL e pelo tutorial prático em Python.
Perguntas frequentes
O Sonnet 5 é mais barato que o Sonnet 4.6? Apenas durante o período promocional. Até 31 de agosto de 2026, ele custa $2 / $10, contra $3 / $15 do 4.6. A partir de 1º de setembro, passa a custar $3 / $15, o mesmo preço. Como o mesmo texto também gera cerca de 41% mais tokens no Sonnet 5, com o preço padrão o mesmo prompt custa mais do que no 4.6.
Quando termina o preço promocional? Em 31 de agosto de 2026, conforme o anúncio da Anthropic. Em 1º de setembro, o preço passa para $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída.
Quanto o Sonnet 5 é mais barato que o Opus 4.8? 2.5× no preço promocional e 1.67× no preço padrão, tanto na entrada quanto na saída. Os dois usam o mesmo tokenizer, portanto as contagens de tokens são iguais e a diferença vem exclusivamente do preço em ambos os períodos.
Preciso alterar meu código de cache_control?
Não. A sintaxe dos marcadores, o limite de breakpoints e as opções de TTL são idênticos aos da linha Opus. Altere o campo model e nada mais. Leituras aquecidas custam ≈10% do preço de entrada; a escrita com TTL de 1 hora custa ≈2× em relação a uma chamada sem cache, e a de 5 minutos, ≈1.25×.
O Sonnet 5 substitui diretamente o Opus 4.8? Nos aspectos de caching, TTL e custo, a migração é trivial, e o Sonnet 5 é mais barato nos dois preços. Para qualidade, execute sua própria avaliação; não publicamos benchmarks de capacidade que não executamos. Consulte o model card da Anthropic para informações sobre a qualidade do modelo.
Verificação: preços, caching, TTL e contagens de tokens medidos em https://synthorai.io/ em 2026-07-01 pelo endpoint Anthropic-native /v1/messages, em um único tenant. Os preços por token foram calculados a partir do custo em usage em chamadas simples; o custo por chamada é a mediana de uma pequena amostra com um prefixo de 2.2K tokens em cache e reflete o preço promocional atual. O preço promocional e seu encerramento em 31 de agosto de 2026 vêm do anúncio do Sonnet 5 pela Anthropic; as proporções de desconto e custo adicional foram verificadas com a documentação de Prompt Caching da Anthropic. Seus números variam conforme o prompt, a região e a carga.