Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT-6 Astra: max custa 2.3x low com respostas idênticas

Conteúdo
  1. Como o GPT-6 Astra se sai nos benchmarks?
  2. Quais valores de reasoning_effort o GPT-6 Astra aceita?
  3. none desativa o raciocínio? E disabled?
  4. O que max entrega além de low?
  5. O GPT-6 Astra custa 2.5x o GPT-5.6 Sol por resposta?
  6. Um JSON schema ou uma tool call aumenta o custo de raciocínio?
  7. É possível ler o raciocínio pelo qual você paga?
  8. O que permanece igual ao GPT-5.6?
  9. Como a Synthorai trata esse parâmetro
  10. FAQ

No GPT-6 Astra, reasoning_effort: "max" custa 2.3x o valor de low e produz a mesma resposta em todas as 11 tarefas verificadas. A única configuração que altera a precisão é none, que falha em 17 de 33 execuções (11 tarefas, 3 execuções cada). reasoning_effort é o parâmetro da requisição que define quanto raciocínio oculto o modelo faz antes de responder. Esse trabalho é cobrado como reasoning tokens pela tarifa de output, e os valores ordenados de none a max formam a escala medida neste post. A escala real não corresponde à documentação: a validação da própria API anuncia sete valores, mas um deles (minimal) é rejeitado em todos os modelos, enquanto outro que nem aparece na lista (disabled) é aceito no Astra e não desativa nada. Isso muda a leitura dos benchmarks de lançamento da OpenAI, divulgados como “o máximo em qualquer nível de esforço”: o resultado do ranking vem do nível mais caro da escala.

TL;DR

  • O GPT-6 Astra aceita sete valores de reasoning_effort, incluindo none e disabled; a documentação lista cinco e afirma que none não é compatível.
  • none é o único valor que zera os reasoning tokens e falha em 17 de 33 tarefas verificadas; todos os demais níveis acertam 33 de 33.
  • disabled consome 243 reasoning tokens contra 151 de low e custa 54% mais por resposta correta, com a mesma precisão.
  • Pelo preço de tabela, o GPT-6 Astra custa 1.57x o GPT-5.6 Sol por resposta correta em low e 2.57x em max, em tarefas que ambos resolvem corretamente.

Como o GPT-6 Astra se sai nos benchmarks?

Ele fica à frente em tarefas no estilo agent, nas quais o modelo opera ferramentas em loop, muitas vezes em um terminal. Fica atrás do Claude Fable 5.1 no Humanity’s Last Exam e no Artificial Analysis Intelligence Index, um agregado independente de dez avaliações. Todos os resultados foram divulgados no nível de esforço que obteve a maior pontuação. A tabela abaixo vem da página de lançamento da OpenAI e mantém as colunas comparativas escolhidas pela empresa:

BenchmarkO que avaliaGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Terminal-Bench 4.0tarefas de agent em um terminal57.9%37.3%55.8%52.6%
Terminal-Bench Science 0.1fluxos de pesquisa com código64.6%22.4%52.6%30.0%
FrontierMath Tier 4 (v2)matemática em nível de pesquisa97.6%83.0%87.8%73.2%
ARC-AGI-3resolução de novos ambientes de quebra-cabeça99.9%7.8%não informado30.2%
Humanity’s Last Exam, com ferramentasperguntas elaboradas por especialistas de várias áreas57.2%não informado65.0%63.6%
Artificial Analysis Intelligence Index v4.1.1agregado de dez avaliações61.260.965.763.1

Três pontos precisam ser considerados junto com as vitórias:

  • Na linha do Humanity’s Last Exam, o Astra fica 7.8 pontos atrás do Fable 5.1. Esse resultado aparece na tabela, mas não é mencionado no texto.
  • Na linha do Artificial Analysis, o Astra fica atrás do Claude Fable 5.1, Claude Opus 5 e Claude Fable 5 na própria tabela da OpenAI. No ranking v4.2 atual, o Fable 5.1 tem 57 pontos e o Astra 55, ocupando o primeiro e o terceiro lugar.
  • Segundo a OpenAI, os resultados de segurança cibernética foram obtidos “sem as proteções de produção”; o modelo disponibilizado “recusará” tarefas de exploração de vulnerabilidades com prova de conceito.

A frase abaixo das tabelas liga diretamente os benchmarks à cobrança: “As pontuações das avaliações são o máximo em qualquer nível de esforço.” O ranking do Artificial Analysis lista cada modelo uma vez por configuração de esforço. O Astra em xhigh marca 54 pontos, contra 55 em max. O restante deste post calcula o preço desse ponto.

Quais valores de reasoning_effort o GPT-6 Astra aceita?

Sete, mas não são os mesmos anunciados pela API: um valor anunciado é rejeitado em todos os modelos, enquanto um valor aceito não é divulgado em lugar nenhum. A página do modelo lista low, medium, high, xhigh e max, além de afirmar que o modelo “não aceita o nível de raciocínio none”. A API contradiz a documentação duas vezes e a si mesma uma vez.

Ao enviar um valor inválido, a primeira validação, que verifica o formato da requisição antes de envolver qualquer modelo, responde com a mesma lista de valores permitidos no GPT-6 Astra e no GPT-5.6 Sol:

Invalid value: '__invalid__'. Supported values are: 'none', 'minimal', 'low', 'medium', 'high', 'xhigh', and 'max'.

Ao testar cada valor, uma segunda validação, específica do modelo, rejeita alguns dos valores anunciados pela primeira. O status 200 indica que a requisição foi processada; 400 indica rejeição:

ValorNa lista anunciadaGPT-6 AstraGPT-5.6 Sol
nonesim200200
minimalsim400, “not supported with the ‘gpt-6-astra-2026-09-03’ model”400, mesma resposta
disablednão200400
de low a maxsim200200

Portanto, none funciona embora a documentação diga o contrário, minimal é anunciado e rejeitado em todos os casos, e disabled só é aceito no Astra sem aparecer em nenhuma lista. As mensagens de erro também revelam a versão datada para a qual o alias gpt-6-astra aponta atualmente: gpt-6-astra-2026-09-03.

none desativa o raciocínio? E disabled?

none desativa e é o único valor que faz isso. disabled é um nível normal com um nome enganoso. Primeiro calculamos as respostas de 11 tarefas por busca exaustiva em nossa própria máquina, eliminando a possibilidade de erro no gabarito. As tarefas incluíam uma regra aplicada 40 vezes seguidas, um problema de contagem com três restrições, uma mochila, uma conversão de base, 7 elevado a 222 módulo 1000 e outras seis tarefas mais curtas. Depois, executamos cada tarefa nos sete níveis de esforço, ou seis no Sol, que rejeita disabled, com 3 execuções por tarefa e nível, usando um endpoint compatível com a API OpenAI Chat Completions. Estes foram os resultados das cinco tarefas mais difíceis no GPT-6 Astra:

esforçoprecisãomédia de reasoning tokenscusto por chamadacusto por resposta correta
none20% (3 de 15)0$0.00086$0.0043
disabled100%243$0.01311$0.0131
low100%151$0.00851$0.0085
medium100%159$0.00890$0.0089
high100%203$0.01110$0.0111
xhigh100%279$0.01491$0.0149
max100%370$0.01946$0.0195

O custo por resposta correta é o gasto de cada combinação de tarefa e esforço dividido pelo número de execuções corretas. Com 20% de acerto, são necessárias cinco execuções pagas para obter uma resposta correta. A queda acontece em um único nível. De low para cima, ambos os modelos acertaram 33 de 33 nas 11 tarefas; none acertou 16 de 33 no Astra e 21 de 33 no Sol. Na tarefa de aplicação iterada de uma função, o Astra retornou três números errados diferentes em três execuções. Não há uma perda gradual de qualidade que permita ajuste fino: ou o raciocínio está ativo, ou o modelo está chutando.

disabled é a armadilha. Ele consome mais reasoning tokens do que low, medium ou high e custa 54% mais por resposta correta do que low, com os mesmos 100% de precisão. Apenas xhigh e max custam mais por resposta correta do que a configuração cujo nome sugere que o raciocínio está desativado.

Gráfico de barras dos reasoning tokens por chamada do GPT-6 Astra em sete valores de reasoning_effort e cinco tarefas com várias etapas: none com 0 tokens e 20% de acerto, disabled com 243 tokens marcado como a armadilha e 54% acima de low, low com 151 tokens marcado como o piso, medium com 159, high com 203, xhigh com 279 e max com 370, a 2.3x o custo de low para as mesmas respostas; todos os níveis a partir de low têm 100% de acerto

O que max entrega além de low?

Nada nestas tarefas, embora custe 2.3x mais: $0.01946 por chamada contra $0.00851, ambos com 100% de acerto. Os reasoning tokens sobem de 151 em low para 370 em max, todos cobrados pela tarifa de $50 por milhão de tokens de saída.

Esse é o número que deve ser comparado à tabela de benchmarks. Divulgar “o máximo em qualquer nível de esforço” significa usar o nível que obteve a melhor pontuação em cada avaliação. No ranking independente, o melhor resultado do Astra vem de max, um ponto acima de xhigh; em nossa medição, esse nível custa 1.3x o anterior. Em uma carga parecida com os benchmarks de lançamento, o esforço adicional pode compensar. Em uma carga parecida com a nossa, não compensa. Para descobrir em qual caso sua carga se encaixa, comece medindo suas próprias tarefas em low.

O GPT-6 Astra custa 2.5x o GPT-5.6 Sol por resposta?

Em low, não: custa 1.57x. Em max, sim: custa 2.57x. O preço de tabela é o valor por token publicado na página do próprio fornecedor. O Astra custa $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída, enquanto o Sol custa $4 e $20, respectivamente. Os valores vêm das páginas da OpenAI para o Astra e o Sol, consultadas em 2026-09-07. Portanto, a diferença de tabela é 2.5x tanto na entrada quanto na saída. A [página de comparação entre GPT-5.6 Sol e GPT-6 Astra](/compare/models/gpt-5-6-sol-vs-gpt-6-astra/) mantém os preços atuais do catálogo. O custo por resposta correta foi calculado a partir da contagem de tokens e desses preços de tabela nas 11 tarefas. Ambos os modelos acertaram 33 de 33 de low para cima:

esforçoGPT-6 Astra por resposta corretaGPT-5.6 Sol por resposta corretaproporção
low$0.00560$0.003561.57x
medium$0.00618$0.003731.66x
high$0.00741$0.004001.85x
xhigh$0.01005$0.004432.27x
max$0.01349$0.005252.57x

Nos níveis mais baixos, o Astra usa menos reasoning tokens do que o Sol para chegar à mesma resposta: 91 contra 158 por chamada nas 11 tarefas em low. É nesse ponto que a diferença de preço diminui. O consumo do Astra cresce mais rapidamente nos níveis seguintes, chegando a 249 contra 242 em max; nesse nível, a diferença por resposta alcança toda a diferença do preço de tabela.

A conclusão é restrita a este cenário: ambos os modelos acertam 100% de low para cima, então este conjunto não diferencia a capacidade dos modelos. Ele mede apenas o preço de uma resposta que ambos acertam, variando de 1.6x a 2.6x com um único parâmetro. A página de lançamento da OpenAI aponta a direção oposta em tarefas de agent: no Terminal-Bench 4.0, o custo estimado de API por tarefa foi “aproximadamente 9% e 63% menor” do que no Sol e no Fable 5.1. Um modelo que resolve mais tarefas com menos tokens pode sair mais barato apesar do maior preço por token. São cargas diferentes, e a configuração de esforço determina a cobrança em ambas.

Um JSON schema ou uma tool call aumenta o custo de raciocínio?

Em low, não; em medium, sim. Enviamos uma tarefa de uma etapa, somar 2 horas e 37 minutos a 08:15, de três formas: sem estrutura adicional, dentro de um JSON schema estrito em response_format, no qual a resposta precisa ser um JSON compatível com o formato fornecido, e como uma tool call forçada, com tool_choice fixado em uma função para obrigar o modelo a responder chamando-a. Testamos quatro níveis de esforço, com 3 execuções em cada combinação. A tabela mostra a média de reasoning tokens do GPT-6 Astra, a participação deles no total de tokens de saída cobrados e o custo por chamada:

formatononelowmediumhigh
sem estrutura0, $0.000850, $0.0008418 (67% da saída), $0.0018524 (73%), $0.00217
JSON schema0, $0.001414 (23%), $0.0016521 (57%), $0.0025726 (62%), $0.00282
tool call forçada0, $0.001960, $0.001975 (18%), $0.0022320 (47%), $0.00307

Gráfico de barras agrupadas dos reasoning tokens do GPT-6 Astra em uma tarefa trivial enviada sem estrutura, com JSON schema e como uma tool call forçada, nos níveis none, low, medium e high: zero tokens em none e low para todos os formatos, exceto os 4 tokens do schema em low, seguidos de 18 a 26 tokens em medium e high, com o raciocínio chegando a 57 a 73% dos tokens de saída

low pode chegar a zero: em uma tarefa sem etapas, não consome reasoning tokens e custa o mesmo que none. No conjunto com várias etapas acima, usa de 16 a 345 tokens por tarefa e mantém a precisão onde none falha. Por isso, low é o piso. A estrutura da resposta não é o custo principal: em low, um schema ou uma tool call adiciona de 0 a 4 reasoning tokens. Em medium, o raciocínio representa de 57 a 67% dos tokens de saída na chamada sem estrutura e no schema, além de 18% na tool call, mesmo em uma tarefa que não exige raciocínio. Dentro do schema, a mesma extração custa 1.6x mais em medium do que em low; sem estrutura, custa 2.2x mais. O guia de custos do GPT-5.6 publicado em julho encontrou o mesmo fator nessa família. O Sol varia menos: são 0 reasoning tokens sem estrutura e no schema em todos os níveis, além de 14 a 18 tokens na tool call forçada a partir de medium.

É possível ler o raciocínio pelo qual você paga?

Em uma das duas interfaces de API da OpenAI. O endpoint mais antigo, Chat Completions, e o endpoint mais recente, Responses, aceitam o mesmo modelo e fazem a mesma cobrança. Estes foram os resultados da mesma pergunta em medium, com 3 execuções em cada interface:

Interfacereasoning tokens cobradostexto de raciocínio retornado
/v1/chat/completions76, 75, 120nenhum; a mensagem contém apenas role e content
/v1/responses com reasoning.summary: "auto"62, 62, 116um item reasoning com um resumo de 277 a 352 caracteres

As contagens de tokens ficam dentro da variação normal, então a cobrança é a mesma. A única diferença é a possibilidade de ver o raciocínio pelo qual você pagou. Com tokens de saída a $50 por milhão, essa diferença depende do endpoint. A documentação também direciona o uso de ferramentas para Responses (“GPT-6 Astra aceita Chat Completions, mas tool calling exige Responses”). Portanto, cargas que usam ferramentas obrigatoriamente passam pela interface que expõe o resumo.

O que permanece igual ao GPT-5.6?

A maior parte do contrato. Resultados medidos:

  • Tokenizer. O mesmo texto de 900 palavras gerou 1,017 tokens de prompt no GPT-6 Astra, GPT-5.6 Sol, GPT-5.6 Luna, GPT-5.5, GPT-5.4 e GPT-5.2. As medições de tamanho de prompt feitas na família 5.x continuam válidas no Astra; não é necessário recalcular.
  • Parâmetros. temperature retorna 400 tanto no Astra quanto no Sol (“not supported with this model”), assim como top_p e logprobs; response_format com um JSON schema estrito produz uma resposta válida no schema em ambos; max_tokens abaixo de 16 é rejeitado nos dois.
  • max no Sol. Em julho, reasoning_effort: "max" retornava 400 no GPT-5.6 Sol via Chat Completions. Agora ele é aceito, e o Sol acertou 33 de 33 nesse nível.

Segundo a documentação, sem medição neste teste: a janela de contexto é de 1,050,000 tokens, com entrada máxima de 922,000 e saída máxima de 128,000; prompts acima de 272K tokens de entrada são cobrados a 2x as tarifas de entrada e cache, o mesmo limite usado pela família GPT-5.6 e o mesmo mecanismo que medimos entre fornecedores; leituras de cache custam $1 por milhão e gravações custam $12.50, com um novo parâmetro prompt_cache_options.ttl: "30m" substituindo prompt_cache_retention. O Fast mode, opção paga que segundo a OpenAI entrega até 2x a velocidade, custa 2x o preço padrão.

Como a Synthorai trata esse parâmetro

O gateway repassa reasoning_effort sem alterações, inclusive os valores ausentes da documentação. O registro de uso de cada requisição mantém reasoning_tokens em um campo próprio, ao lado de completion_tokens e do custo cobrado. Todas as tabelas acima foram construídas com esses dados: o esforço usado na requisição, o raciocínio consumido e o custo, disponíveis por requisição em vez de reconstruídos a partir de um total mensal.

FAQ

O GPT-6 Astra aceita reasoning_effort none?

Sim. A documentação diz que não, mas a API aceita esse valor no GPT-6 Astra e no GPT-5.6 Sol. Ele também é o único valor que retorna zero reasoning tokens. No entanto, falhou em 17 de 33 execuções no conjunto de tarefas verificadas. Portanto, serve para consultas e transformações, não para tarefas com várias etapas.

O que reasoning_effort disabled faz no GPT-6 Astra?

Ele raciocina. disabled é aceito no GPT-6 Astra e rejeitado no GPT-5.6 Sol. Não aparece em nenhuma lista documentada ou anunciada e consumiu 243 reasoning tokens por chamada no conjunto difícil, contra 151 de low, com precisão idêntica. Trate-o como um alias caro para um nível intermediário, não como um botão para desligar o raciocínio.

Qual reasoning_effort devo usar como padrão no GPT-6 Astra?

low. No GPT-6 Astra, ele não consumiu reasoning tokens em uma tarefa de uma etapa e usou de 16 a 345 tokens por tarefa nas tarefas com várias etapas. Acertou 33 de 33, enquanto none acertou 16, e max custou 2.3x mais para produzir as mesmas respostas. Só aumente o nível de uma chamada específica quando uma avaliação com suas próprias tarefas mostrar mudança nos resultados. Defina o valor explicitamente em todas as chamadas e leia a contagem de raciocínio no bloco de uso:

resp = client.chat.completions.create(
    model="gpt-6-astra",
    reasoning_effort="low",
    messages=[{"role": "user", "content": prompt}],
)
print(resp.usage.completion_tokens_details.reasoning_tokens)

Medição realizada em 2026-09-07 por uma interface Chat Completions compatível com a OpenAI, além do endpoint Responses na comparação de visibilidade: 11 tarefas com gabaritos calculados localmente por força bruta, 7 valores de esforço, 3 execuções por combinação nos dois modelos, prompts com salt (um sufixo exclusivo em cada requisição para impedir que a resposta venha do cache) e custo obtido da contabilização de uso de cada requisição. Os resultados dos benchmarks vêm da tabela de lançamento da OpenAI e do ranking do Artificial Analysis, ambos consultados no mesmo dia. O custo por resposta correta em comparação com o GPT-5.6 Sol foi calculado com as contagens de tokens e o preço de tabela documentado de cada modelo.

Relacionado: controles de raciocínio em 13 modelos, guia de custos do GPT-5.6, custo do Claude Opus 5, faixas de preço para contexto longo, custo de gravação no prompt cache.

← Voltar ao blog