Claude Opus 5 vs Opus 4.8, em números: mesmo preço, custo 3x maior
Conteúdo
- Quais são as diferenças entre Opus 5, Opus 4.8 e Fable 5 como plataformas?
- Quanto custa o Opus 5 com a configuração padrão em comparação ao Opus 4.8?
- Para onde vai o custo adicional?
- O que a opção de raciocínio realmente faz?
- O adicional de 3x também aparece em cargas de agentes?
- O Opus 5 realmente custa metade do Fable 5?
- Contexto, cache e tokenizer: o que mais verificamos?
- FAQ
Claude Opus 5 e Claude Opus 4.8 cobram os mesmos $5 por milhão de tokens de entrada e $25 por milhão de saída. Mesmo assim, nos mesmos prompts, a configuração padrão do Opus 5 custou 3.1x mais. O motivo é o raciocínio adaptativo: o Opus 5 raciocina por padrão, cobra esse processamento como saída e não mostra seu conteúdo. Uma única opção na requisição elimina a diferença e iguala os custos. O Fable 5, mesmo sendo maior, não aceita essa opção. O Opus 5 entrou em GA em 2026-07-24, apresentado como uma alternativa com inteligência no nível do Fable 5 pela metade do preço por token. Se a conta realmente cai pela metade depende quase por completo dessa escolha.
TL;DR
- Com a configuração padrão, o Opus 5 cobrou 3.1x mais que o Opus 4.8, apesar do mesmo preço, em nossa matriz de cinco tarefas; entre 42-95% dos tokens de saída foram gastos com raciocínio oculto.
thinking: {"type": "disabled"}colocou o Opus 5 em paridade exata com o 4.8 (384 contra 384 tokens de saída), sem perda de acurácia; o Fable 5 rejeita esse parâmetro.- Em tráfego de agentes, o adicional cai para +33%, com cenários de tools e batch próximos da paridade: o raciocínio adaptativo quase não é acionado em loops de tools.
- A janela de contexto de 1M é real (a informação-alvo foi recuperada com 969,950 tokens), e o limite mínimo do cache é de 512 tokens, metade dos 1,024 do 4.8.
Quais são as diferenças entre Opus 5, Opus 4.8 e Fable 5 como plataformas?
Antes de analisar os custos em detalhe, vale situar os três níveis atuais do Claude em dois eixos: preços e formato das requisições. A comparação abaixo mostra os modelos lado a lado. Os itens medidos estão identificados; os demais vêm da documentação dos modelos:
| Opus 4.8 | Opus 5 | Fable 5 | |
|---|---|---|---|
| Preço de tabela (entrada/saída por M) | $5 / $25 | $5 / $25 | $10 / $50 |
| Comportamento padrão do raciocínio | desativado, salvo quando solicitado | adaptativo, ativado (medido) | sempre ativado |
thinking: disabled | aceito, independentemente do effort | aceito com effort high ou inferior | rejeitado com 400 (medido) |
| Níveis de effort | low-max, padrão high | low-max, padrão high (custos medidos abaixo) | low-max, padrão high |
| Conteúdo do raciocínio retornado | n/a por padrão | nunca (medido) | nunca |
| Limite mínimo do cache | 1,024 tokens | 512 tokens (medido) | 512 tokens |
| Janela de contexto | 1M | 1M, padrão e máximo (informação-alvo com 969,950 tokens, medido abaixo) | 1M |
| Prefill do assistant | rejeitado | rejeitado, com erro 400 específico (medido) | rejeitado |
| Modo rápido | disponível (research preview) | disponível, $10/$50 | não oferecido |
| Fallbacks em recusas | funciona como destino padrão de fallback | fallbacks, incluindo o novo modo "default" (beta) | introduzidos aqui (listas explícitas) |
| Retenção de dados | opções padrão | opções padrão | retenção de 30 dias obrigatória |
Três linhas merecem contexto. A de thinking: disabled é uma armadilha de migração: no Opus 5, essa opção está vinculada ao effort e, segundo a documentação, só é aceita com high ou inferior. No 4.8, as duas configurações eram independentes. Scripts de migração devem considerar a versão. A linha do modo rápido prepara uma comparação importante mais adiante: o Opus 5 nesse modo custa exatamente o mesmo que a tabela do Fable 5. Portanto, escolher entre “Opus 5 rápido” e “Fable 5 padrão” é uma troca direta entre velocidade e capacidade com os mesmos preços por token. Já a retenção traz uma vantagem discreta para compliance: o Opus 5 oferece inteligência de nível Fable sem a exigência de retenção por 30 dias do Fable 5.
Há ainda dois pontos que não cabem bem na tabela. A Anthropic documenta casos-limite com o raciocínio desativado, como chamadas de tools aparecendo ocasionalmente no texto visível e vazamento de tags internas. Não encontramos nenhum dos dois em 84 chamadas sem raciocínio na suíte de agentes medida abaixo. Ainda assim, a orientação reforça a regra de roteamento: mantenha o raciocínio ativado em rotas que usam muitas tools, pois nelas o custo adicional já é pequeno. Além disso, a alteração de tools no meio da conversa, recurso beta do Opus 5, permite adicionar ou remover tools entre turnos sem invalidar o prompt cache. Isso preserva a economia de prefixos em cache que fundamenta nosso guia de prompt caching para sessões longas de agentes.
Quanto custa o Opus 5 com a configuração padrão em comparação ao Opus 4.8?
3.1x mais pelo mesmo trabalho e com a mesma tabela de preços. Executamos os três níveis atuais do Claude em uma matriz de cinco tarefas (n=3 por célula, prompts com salt), usando as configurações padrão e a Messages API nativa. Incluímos o Fable 5 como referência:
| Tarefa | Opus 5 padrão | Opus 4.8 | Fable 5 | Acurácia |
|---|---|---|---|---|
| Aritmética trivial | 12 | 3 | 12 | 3/3 todos |
| Resposta factual em uma linha | 40 | 6 | 11 | 3/3 todos |
| Função de código pequena | 70 | 38 | 44 | — |
| Problema textual com várias etapas | 152 | 102 | 52 | 3/3 todos |
| Parágrafo de 120 palavras | 1,031 | 236 | 264 | — |
| Total de tokens de saída (custo por conjunto) | 1,305 ($0.03427) | 384 ($0.01120) | 383 ($0.02233) |
As respostas foram as mesmas, e os preços são iguais aos do 4.8, mas a conta foi três vezes maior. O Opus 4.8 só raciocina quando isso é solicitado. O Opus 5 vem com raciocínio adaptativo ativado, e esses tokens são cobrados pela tarifa integral de saída de $25/M.
A coluna do Fable 5 traz um resultado contraintuitivo: apesar de ter o dobro das tarifas ($10/$50), ele cobrou 35% menos em valores absolutos do que o Opus 5 padrão. O Fable 5 concluiu as mesmas tarefas com 383 tokens de saída, enquanto o Opus 5 usou 1,305. Os três modelos têm o mesmo effort padrão documentado (high), portanto a diferença está na calibração do raciocínio, não na configuração. Dois mecanismos explicam os números. Primeiro, um modelo mais capaz precisa deliberar menos para ter confiança em uma resposta fácil: no problema textual, o Fable 5 usou 52 tokens contra 152 do Opus 5; no parágrafo, foram 264 contra 1,031. Segundo, uma das principais capacidades do Opus 5 é escalar o compute em tempo de inferência, convertendo deliberação adicional em mais qualidade para problemas difíceis. A calibração padrão aplica esse seguro a todas as requisições, inclusive às que não precisam dele. Em tráfego simples, você paga por um seguro que não usa; na maior parte dos casos, o Fable 5 opta por não fazer esse gasto.
Para onde vai o custo adicional?
Para um raciocínio cujo conteúdo você não consegue ler. Ao comparar os tokens de saída cobrados com o texto visível da resposta, entre 42-95% do gasto de saída do Opus 5 padrão correspondeu a raciocínio oculto. Ele é acionado até em perguntas que não precisam disso: a resposta a 17*23 usou 11 tokens de raciocínio para entregar uma resposta de 1 token, e a tarefa de escrever 120 palavras gastou aproximadamente 806 dos 1,031 tokens de saída deliberando. O conteúdo do raciocínio nunca é retornado, nem como resumo nem como trace. Isso coloca o Opus 5 no extremo mais fechado do espectro de visibilidade que mapeamos em nosso estudo sobre a anatomia do consumo de tokens, junto com o Fable 5. A decomposição de uso mostra a quantidade, mas não o conteúdo pelo qual você pagou.
O que a opção de raciocínio realmente faz?
Ela faz o custo do Opus 5 ficar igual ao do Opus 4.8. Ao enviar thinking: {"type": "disabled"}, o consumo de raciocínio caiu para zero em todas as tarefas. Os totais ficaram em paridade exata com o 4.8: 384 tokens de saída contra 384, e $0.01130 contra $0.01120 por conjunto:
| Configuração | Tokens de saída (conjunto) | Custo (conjunto) | vs Opus 4.8 | Acurácia (3 tarefas verificáveis) |
|---|---|---|---|---|
Opus 5 padrão (= effort high) | 1,305 | $0.03427 | 3.1x | 9/9 |
| Opus 5, effort low | 1,019 | $0.02720 | 2.4x | 9/9 |
| Opus 5, effort medium | 1,167 | $0.03089 | 2.8x | 9/9 |
| Opus 5, effort high explícito | 1,514 | $0.03956 | 3.5x | 9/9 |
| Opus 5, effort xhigh | 1,633 | $0.04262 | 3.8x | 8/8 |
| Opus 5, effort max | 1,569 | $0.04093 | 3.7x | 9/9 |
| Opus 5, raciocínio desativado | 384 | $0.01130 | 1.0x | 9/9 |
Opus 4.8 padrão (= effort high, sem raciocínio) | 384 | $0.01120 | 1.0x | 9/9 |
Fable 5 padrão (= effort high, raciocínio sempre ativado) | 383 | $0.02233 | 2.0x | 9/9 |
Primeiro, um esclarecimento sobre os rótulos: todos os modelos da tabela documentam o mesmo padrão da API, effort high, e a Anthropic afirma que definir high explicitamente é idêntico a omitir o parâmetro. Ainda assim, os testes com o padrão implícito e com high explícito diferiram em 16%. Isso é variação entre execuções na tarefa de escrita, a célula mais instável de todos os batches que executamos, e não uma diferença real. Considere essas duas linhas como a mesma configuração medida duas vezes. O que distingue os três padrões não é o nível de effort, mas o comportamento do raciocínio nesse nível: nenhum no 4.8, adaptativo e econômico no Fable 5, adaptativo e agressivo no Opus 5.
Dois pontos se destacam. Primeiro, o controle de effort é uma escala de qualidade, não um botão de custo. A escala em si, de low a max, não é nova; o 4.8 aceita os mesmos valores. Porém, em tarefas tão simples, cada nível acima de low apenas aumenta a deliberação sem alterar a acurácia. O xhigh chegou a uma conta 3.8x maior que a do 4.8. Os níveis superiores servem para escalar o compute em tempo de inferência em problemas realmente difíceis, algo que uma matriz básica de cinco tarefas não consegue exercitar. Ela consegue, porém, mostrar o impacto no custo: nenhum nível dessa escala leva de volta à paridade com o 4.8. Só a desativação faz isso, reduzindo o custo em 67% em relação ao padrão. Segundo, essa opção existe: o Fable 5 rejeita thinking: {"type": "disabled"} com um erro 400. Portanto, trata-se de um diferencial real do Opus 5, não de uma característica comum à família. O mesmo objeto thinking funciona nas duas interfaces do gateway, /v1/messages e a compatível com OpenAI, /v1/chat/completions. Nesta última, as execuções com o recurso desativado informam zero reasoning_tokens em completion_tokens_details:
{"model": "claude-opus-5", "thinking": {"type": "disabled"}}
Há uma ressalva: nossas tarefas verificáveis envolvem recuperação de informações e problemas de uma única etapa. A acurácia continuou em 9/9 com o raciocínio desativado, inclusive no problema textual com várias etapas. O raciocínio adaptativo existe justamente para trabalhos agentic mais difíceis. Portanto, decida por rota, seguindo a mesma regra que adotamos para Kimi K3 e Gemini 3.6 Flash: desative em extração, formatação e chamadas de uma única etapa; mantenha o padrão quando suas avaliações mostrarem que o raciocínio justifica o custo.
O adicional de 3x também aparece em cargas de agentes?
Não, e essa diferença é relevante. Em nossa suíte de cenários de agentes, com loops de tools, RAG, tooling, batch e chats longos, totalizando 50 episódios por configuração, o Opus 5 padrão custou apenas 33% mais que o Opus 4.8, e não 210%. Os cenários baseados em tools ficaram próximos da paridade, entre 1.01-1.22x. Nesses casos, o raciocínio adaptativo é realmente adaptativo: foram cerca de 88 tokens de raciocínio por chamada nos loops de agentes, contra 806 em um prompt isolado de escrita. O ponto fora da curva é o chat longo, com 1.58x, onde ainda compensa desativar o recurso, reduzindo para 1.22x. Em function calling, o custo adicional de raciocínio foi zero: com a configuração padrão, uma requisição de chamada de tool retornou 52 tokens de saída sem nenhum raciocínio associado, o mesmo orçamento que um modelo sem raciocínio usaria.
Na prática, a divisão deve ser feita pelo formato do tráfego, não pelo modelo: completions isoladas e chamadas no formato de chat carregam o adicional padrão de 3x e se beneficiam da desativação; tráfego de agentes com uso intenso de tools geralmente não precisa dela.
O Opus 5 realmente custa metade do Fable 5?
Só depois de desativar o raciocínio. Por token, sim: $5/$25 contra $10/$50 do Fable 5. Na prática, em nossa matriz de tarefas isoladas, o Opus 5 padrão cobrou $0.03427 por conjunto, contra $0.02233 do Fable 5. Isso representa 53% a mais em valores absolutos, porque o Fable 5 concluiu as mesmas tarefas com 383 tokens de saída, contra 1,305 do Opus 5. Com o raciocínio desativado, os $0.01130 do Opus 5 ficam quase exatamente na metade da conta do Fable 5. A promessa do lançamento se concretiza por meio de um parâmetro que o próprio Fable 5 não aceita.
Contexto, cache e tokenizer: o que mais verificamos?
A janela de 1M é real, e os erros são explícitos. Uma informação-alvo colocada no início de um prompt com 969,950 tokens foi recuperada corretamente em 39 segundos. Já um prompt com 1,010,221 tokens retornou claramente prompt is too long: … > 1000000 maximum, em vez de ser truncado silenciosamente.
O limite mínimo do cache caiu pela metade. A Anthropic documenta um prefixo cacheável mínimo de 512 tokens no Opus 5 e no Fable 5, contra 1,024 no Opus 4.8 e no Sonnet 5. Nossa varredura confirmou esse comportamento: prefixos próximos de 511 tokens nunca entraram no cache, enquanto os de 547 tokens foram armazenados de forma consistente. Leituras em cache custam $0.50/M (0.1x), escritas custam 1.25x, com TTL de 5 minutos. Agora é possível colocar system prompts mais curtos em cache, o que faz diferença em rotas de alto QPS.
O tokenizer não mudou entre Opus 5, Opus 4.8, Fable 5 e Sonnet 5. As contagens de tokens foram idênticas em nossas amostras multilíngues e de código. Portanto, os orçamentos por idioma e as estimativas de tamanho dos prompts continuam válidos, sem necessidade de recalibração.
FAQ
É possível desativar o raciocínio no Claude Opus 5?
Sim, com effort high ou inferior; segundo a documentação, combiná-lo com xhigh ou max retorna um erro 400. Em nossos testes, os tokens de raciocínio caíram para zero e o custo ficou em paridade com o Opus 4.8, com 384 tokens de saída contra 384 na matriz. Esse comportamento é específico do Opus 5: o Fable 5 rejeita o mesmo parâmetro com qualquer nível de effort, retornando 400. O controle de effort, de low a max, também funciona, mas nunca chega à paridade: em nossa matriz, variou de -21% com low a +24% com xhigh, em relação ao padrão.
Por que minha conta do Opus 5 é maior que a do Opus 4.8 se os preços de tabela são iguais?
Porque o Opus 5 raciocina por padrão, e esse processamento é cobrado como saída a $25/M. Em prompts isolados, entre 42-95% da saída cobrada correspondeu a raciocínio oculto em nossas medições; uma multiplicação de dois dígitos usou 11 tokens de raciocínio para produzir uma resposta de 1 token. Consulte reasoning_tokens na decomposição de uso para medir essa proporção em seu próprio tráfego e desative o raciocínio nas rotas que não precisam dele.
Cargas de agentes devem desativar o raciocínio no Opus 5?
Normalmente, não. Em nossa suíte de agentes, o custo padrão ficou apenas +33% acima do Opus 4.8, com cenários de tools e batch próximos da paridade, porque o raciocínio adaptativo quase não é acionado em loops de tools. A exceção são sessões longas no formato de chat, que chegaram a 1.58x e ainda se beneficiam da desativação. Meça a composição do seu próprio tráfego: o custo adicional está nas completions isoladas, não nas chamadas de tools.
Medido entre 2026-07-25 e 2026-07-27 nos modelos claude-opus-5, claude-opus-4-8 e claude-fable-5 por meio do gateway da Synthorai: matriz de cinco tarefas e ablação de effort/desativação executadas em um único batch canônico (n=3 por célula, prompts com salt, Messages API nativa); números de agentes obtidos em uma suíte de cenários com 150 episódios; testes de contexto e cache realizados com recuperação de informação-alvo e varreduras de prefixos; linhas sobre o formato da API (prefill, aceitação da desativação) verificadas por requisições diretas. As contagens de acurácia usam tarefas com uma única resposta verificável. Preços e comportamentos podem mudar; valide-os com seus próprios registros de uso.