GPT-6 Astra: max custa 2.3x low com respostas idênticas
Conteúdo
- Como o GPT-6 Astra se sai nos benchmarks?
- Quais valores de reasoning_effort o GPT-6 Astra aceita?
- none desativa o raciocínio? E disabled?
- O que max entrega além de low?
- O GPT-6 Astra custa 2.5x o GPT-5.6 Sol por resposta?
- Um JSON schema ou uma tool call aumenta o custo de raciocínio?
- É possível ler o raciocínio pelo qual você paga?
- O que permanece igual ao GPT-5.6?
- Como a Synthorai trata esse parâmetro
- FAQ
No GPT-6 Astra, reasoning_effort: "max" custa 2.3x o valor de low e produz a mesma resposta em todas as 11 tarefas verificadas. A única configuração que altera a precisão é none, que falha em 17 de 33 execuções (11 tarefas, 3 execuções cada). reasoning_effort é o parâmetro da requisição que define quanto raciocínio oculto o modelo faz antes de responder. Esse trabalho é cobrado como reasoning tokens pela tarifa de output, e os valores ordenados de none a max formam a escala medida neste post. A escala real não corresponde à documentação: a validação da própria API anuncia sete valores, mas um deles (minimal) é rejeitado em todos os modelos, enquanto outro que nem aparece na lista (disabled) é aceito no Astra e não desativa nada. Isso muda a leitura dos benchmarks de lançamento da OpenAI, divulgados como “o máximo em qualquer nível de esforço”: o resultado do ranking vem do nível mais caro da escala.
TL;DR
- O GPT-6 Astra aceita sete valores de
reasoning_effort, incluindononeedisabled; a documentação lista cinco e afirma quenonenão é compatível. noneé o único valor que zera os reasoning tokens e falha em 17 de 33 tarefas verificadas; todos os demais níveis acertam 33 de 33.disabledconsome 243 reasoning tokens contra 151 delowe custa 54% mais por resposta correta, com a mesma precisão.- Pelo preço de tabela, o GPT-6 Astra custa 1.57x o GPT-5.6 Sol por resposta correta em
lowe 2.57x emmax, em tarefas que ambos resolvem corretamente.
Como o GPT-6 Astra se sai nos benchmarks?
Ele fica à frente em tarefas no estilo agent, nas quais o modelo opera ferramentas em loop, muitas vezes em um terminal. Fica atrás do Claude Fable 5.1 no Humanity’s Last Exam e no Artificial Analysis Intelligence Index, um agregado independente de dez avaliações. Todos os resultados foram divulgados no nível de esforço que obteve a maior pontuação. A tabela abaixo vem da página de lançamento da OpenAI e mantém as colunas comparativas escolhidas pela empresa:
| Benchmark | O que avalia | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | tarefas de agent em um terminal | 57.9% | 37.3% | 55.8% | 52.6% |
| Terminal-Bench Science 0.1 | fluxos de pesquisa com código | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 (v2) | matemática em nível de pesquisa | 97.6% | 83.0% | 87.8% | 73.2% |
| ARC-AGI-3 | resolução de novos ambientes de quebra-cabeça | 99.9% | 7.8% | não informado | 30.2% |
| Humanity’s Last Exam, com ferramentas | perguntas elaboradas por especialistas de várias áreas | 57.2% | não informado | 65.0% | 63.6% |
| Artificial Analysis Intelligence Index v4.1.1 | agregado de dez avaliações | 61.2 | 60.9 | 65.7 | 63.1 |
Três pontos precisam ser considerados junto com as vitórias:
- Na linha do Humanity’s Last Exam, o Astra fica 7.8 pontos atrás do Fable 5.1. Esse resultado aparece na tabela, mas não é mencionado no texto.
- Na linha do Artificial Analysis, o Astra fica atrás do Claude Fable 5.1, Claude Opus 5 e Claude Fable 5 na própria tabela da OpenAI. No ranking v4.2 atual, o Fable 5.1 tem 57 pontos e o Astra 55, ocupando o primeiro e o terceiro lugar.
- Segundo a OpenAI, os resultados de segurança cibernética foram obtidos “sem as proteções de produção”; o modelo disponibilizado “recusará” tarefas de exploração de vulnerabilidades com prova de conceito.
A frase abaixo das tabelas liga diretamente os benchmarks à cobrança: “As pontuações das avaliações são o máximo em qualquer nível de esforço.” O ranking do Artificial Analysis lista cada modelo uma vez por configuração de esforço. O Astra em xhigh marca 54 pontos, contra 55 em max. O restante deste post calcula o preço desse ponto.
Quais valores de reasoning_effort o GPT-6 Astra aceita?
Sete, mas não são os mesmos anunciados pela API: um valor anunciado é rejeitado em todos os modelos, enquanto um valor aceito não é divulgado em lugar nenhum. A página do modelo lista low, medium, high, xhigh e max, além de afirmar que o modelo “não aceita o nível de raciocínio none”. A API contradiz a documentação duas vezes e a si mesma uma vez.
Ao enviar um valor inválido, a primeira validação, que verifica o formato da requisição antes de envolver qualquer modelo, responde com a mesma lista de valores permitidos no GPT-6 Astra e no GPT-5.6 Sol:
Invalid value: '__invalid__'. Supported values are: 'none', 'minimal', 'low', 'medium', 'high', 'xhigh', and 'max'.
Ao testar cada valor, uma segunda validação, específica do modelo, rejeita alguns dos valores anunciados pela primeira. O status 200 indica que a requisição foi processada; 400 indica rejeição:
| Valor | Na lista anunciada | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|
none | sim | 200 | 200 |
minimal | sim | 400, “not supported with the ‘gpt-6-astra-2026-09-03’ model” | 400, mesma resposta |
disabled | não | 200 | 400 |
de low a max | sim | 200 | 200 |
Portanto, none funciona embora a documentação diga o contrário, minimal é anunciado e rejeitado em todos os casos, e disabled só é aceito no Astra sem aparecer em nenhuma lista. As mensagens de erro também revelam a versão datada para a qual o alias gpt-6-astra aponta atualmente: gpt-6-astra-2026-09-03.
none desativa o raciocínio? E disabled?
none desativa e é o único valor que faz isso. disabled é um nível normal com um nome enganoso. Primeiro calculamos as respostas de 11 tarefas por busca exaustiva em nossa própria máquina, eliminando a possibilidade de erro no gabarito. As tarefas incluíam uma regra aplicada 40 vezes seguidas, um problema de contagem com três restrições, uma mochila, uma conversão de base, 7 elevado a 222 módulo 1000 e outras seis tarefas mais curtas. Depois, executamos cada tarefa nos sete níveis de esforço, ou seis no Sol, que rejeita disabled, com 3 execuções por tarefa e nível, usando um endpoint compatível com a API OpenAI Chat Completions. Estes foram os resultados das cinco tarefas mais difíceis no GPT-6 Astra:
| esforço | precisão | média de reasoning tokens | custo por chamada | custo por resposta correta |
|---|---|---|---|---|
none | 20% (3 de 15) | 0 | $0.00086 | $0.0043 |
disabled | 100% | 243 | $0.01311 | $0.0131 |
low | 100% | 151 | $0.00851 | $0.0085 |
medium | 100% | 159 | $0.00890 | $0.0089 |
high | 100% | 203 | $0.01110 | $0.0111 |
xhigh | 100% | 279 | $0.01491 | $0.0149 |
max | 100% | 370 | $0.01946 | $0.0195 |
O custo por resposta correta é o gasto de cada combinação de tarefa e esforço dividido pelo número de execuções corretas. Com 20% de acerto, são necessárias cinco execuções pagas para obter uma resposta correta. A queda acontece em um único nível. De low para cima, ambos os modelos acertaram 33 de 33 nas 11 tarefas; none acertou 16 de 33 no Astra e 21 de 33 no Sol. Na tarefa de aplicação iterada de uma função, o Astra retornou três números errados diferentes em três execuções. Não há uma perda gradual de qualidade que permita ajuste fino: ou o raciocínio está ativo, ou o modelo está chutando.
disabled é a armadilha. Ele consome mais reasoning tokens do que low, medium ou high e custa 54% mais por resposta correta do que low, com os mesmos 100% de precisão. Apenas xhigh e max custam mais por resposta correta do que a configuração cujo nome sugere que o raciocínio está desativado.
O que max entrega além de low?
Nada nestas tarefas, embora custe 2.3x mais: $0.01946 por chamada contra $0.00851, ambos com 100% de acerto. Os reasoning tokens sobem de 151 em low para 370 em max, todos cobrados pela tarifa de $50 por milhão de tokens de saída.
Esse é o número que deve ser comparado à tabela de benchmarks. Divulgar “o máximo em qualquer nível de esforço” significa usar o nível que obteve a melhor pontuação em cada avaliação. No ranking independente, o melhor resultado do Astra vem de max, um ponto acima de xhigh; em nossa medição, esse nível custa 1.3x o anterior. Em uma carga parecida com os benchmarks de lançamento, o esforço adicional pode compensar. Em uma carga parecida com a nossa, não compensa. Para descobrir em qual caso sua carga se encaixa, comece medindo suas próprias tarefas em low.
O GPT-6 Astra custa 2.5x o GPT-5.6 Sol por resposta?
Em low, não: custa 1.57x. Em max, sim: custa 2.57x. O preço de tabela é o valor por token publicado na página do próprio fornecedor. O Astra custa $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída, enquanto o Sol custa $4 e $20, respectivamente. Os valores vêm das páginas da OpenAI para o Astra e o Sol, consultadas em 2026-09-07. Portanto, a diferença de tabela é 2.5x tanto na entrada quanto na saída. A [página de comparação entre GPT-5.6 Sol e GPT-6 Astra](/compare/models/gpt-5-6-sol-vs-gpt-6-astra/) mantém os preços atuais do catálogo. O custo por resposta correta foi calculado a partir da contagem de tokens e desses preços de tabela nas 11 tarefas. Ambos os modelos acertaram 33 de 33 de low para cima:
| esforço | GPT-6 Astra por resposta correta | GPT-5.6 Sol por resposta correta | proporção |
|---|---|---|---|
low | $0.00560 | $0.00356 | 1.57x |
medium | $0.00618 | $0.00373 | 1.66x |
high | $0.00741 | $0.00400 | 1.85x |
xhigh | $0.01005 | $0.00443 | 2.27x |
max | $0.01349 | $0.00525 | 2.57x |
Nos níveis mais baixos, o Astra usa menos reasoning tokens do que o Sol para chegar à mesma resposta: 91 contra 158 por chamada nas 11 tarefas em low. É nesse ponto que a diferença de preço diminui. O consumo do Astra cresce mais rapidamente nos níveis seguintes, chegando a 249 contra 242 em max; nesse nível, a diferença por resposta alcança toda a diferença do preço de tabela.
A conclusão é restrita a este cenário: ambos os modelos acertam 100% de low para cima, então este conjunto não diferencia a capacidade dos modelos. Ele mede apenas o preço de uma resposta que ambos acertam, variando de 1.6x a 2.6x com um único parâmetro. A página de lançamento da OpenAI aponta a direção oposta em tarefas de agent: no Terminal-Bench 4.0, o custo estimado de API por tarefa foi “aproximadamente 9% e 63% menor” do que no Sol e no Fable 5.1. Um modelo que resolve mais tarefas com menos tokens pode sair mais barato apesar do maior preço por token. São cargas diferentes, e a configuração de esforço determina a cobrança em ambas.
Um JSON schema ou uma tool call aumenta o custo de raciocínio?
Em low, não; em medium, sim. Enviamos uma tarefa de uma etapa, somar 2 horas e 37 minutos a 08:15, de três formas: sem estrutura adicional, dentro de um JSON schema estrito em response_format, no qual a resposta precisa ser um JSON compatível com o formato fornecido, e como uma tool call forçada, com tool_choice fixado em uma função para obrigar o modelo a responder chamando-a. Testamos quatro níveis de esforço, com 3 execuções em cada combinação. A tabela mostra a média de reasoning tokens do GPT-6 Astra, a participação deles no total de tokens de saída cobrados e o custo por chamada:
| formato | none | low | medium | high |
|---|---|---|---|---|
| sem estrutura | 0, $0.00085 | 0, $0.00084 | 18 (67% da saída), $0.00185 | 24 (73%), $0.00217 |
| JSON schema | 0, $0.00141 | 4 (23%), $0.00165 | 21 (57%), $0.00257 | 26 (62%), $0.00282 |
| tool call forçada | 0, $0.00196 | 0, $0.00197 | 5 (18%), $0.00223 | 20 (47%), $0.00307 |
low pode chegar a zero: em uma tarefa sem etapas, não consome reasoning tokens e custa o mesmo que none. No conjunto com várias etapas acima, usa de 16 a 345 tokens por tarefa e mantém a precisão onde none falha. Por isso, low é o piso. A estrutura da resposta não é o custo principal: em low, um schema ou uma tool call adiciona de 0 a 4 reasoning tokens. Em medium, o raciocínio representa de 57 a 67% dos tokens de saída na chamada sem estrutura e no schema, além de 18% na tool call, mesmo em uma tarefa que não exige raciocínio. Dentro do schema, a mesma extração custa 1.6x mais em medium do que em low; sem estrutura, custa 2.2x mais. O guia de custos do GPT-5.6 publicado em julho encontrou o mesmo fator nessa família. O Sol varia menos: são 0 reasoning tokens sem estrutura e no schema em todos os níveis, além de 14 a 18 tokens na tool call forçada a partir de medium.
É possível ler o raciocínio pelo qual você paga?
Em uma das duas interfaces de API da OpenAI. O endpoint mais antigo, Chat Completions, e o endpoint mais recente, Responses, aceitam o mesmo modelo e fazem a mesma cobrança. Estes foram os resultados da mesma pergunta em medium, com 3 execuções em cada interface:
| Interface | reasoning tokens cobrados | texto de raciocínio retornado |
|---|---|---|
/v1/chat/completions | 76, 75, 120 | nenhum; a mensagem contém apenas role e content |
/v1/responses com reasoning.summary: "auto" | 62, 62, 116 | um item reasoning com um resumo de 277 a 352 caracteres |
As contagens de tokens ficam dentro da variação normal, então a cobrança é a mesma. A única diferença é a possibilidade de ver o raciocínio pelo qual você pagou. Com tokens de saída a $50 por milhão, essa diferença depende do endpoint. A documentação também direciona o uso de ferramentas para Responses (“GPT-6 Astra aceita Chat Completions, mas tool calling exige Responses”). Portanto, cargas que usam ferramentas obrigatoriamente passam pela interface que expõe o resumo.
O que permanece igual ao GPT-5.6?
A maior parte do contrato. Resultados medidos:
- Tokenizer. O mesmo texto de 900 palavras gerou 1,017 tokens de prompt no GPT-6 Astra, GPT-5.6 Sol, GPT-5.6 Luna, GPT-5.5, GPT-5.4 e GPT-5.2. As medições de tamanho de prompt feitas na família 5.x continuam válidas no Astra; não é necessário recalcular.
- Parâmetros.
temperatureretorna 400 tanto no Astra quanto no Sol (“not supported with this model”), assim comotop_pelogprobs;response_formatcom um JSON schema estrito produz uma resposta válida no schema em ambos;max_tokensabaixo de 16 é rejeitado nos dois. maxno Sol. Em julho,reasoning_effort: "max"retornava 400 no GPT-5.6 Sol via Chat Completions. Agora ele é aceito, e o Sol acertou 33 de 33 nesse nível.
Segundo a documentação, sem medição neste teste: a janela de contexto é de 1,050,000 tokens, com entrada máxima de 922,000 e saída máxima de 128,000; prompts acima de 272K tokens de entrada são cobrados a 2x as tarifas de entrada e cache, o mesmo limite usado pela família GPT-5.6 e o mesmo mecanismo que medimos entre fornecedores; leituras de cache custam $1 por milhão e gravações custam $12.50, com um novo parâmetro prompt_cache_options.ttl: "30m" substituindo prompt_cache_retention. O Fast mode, opção paga que segundo a OpenAI entrega até 2x a velocidade, custa 2x o preço padrão.
Como a Synthorai trata esse parâmetro
O gateway repassa reasoning_effort sem alterações, inclusive os valores ausentes da documentação. O registro de uso de cada requisição mantém reasoning_tokens em um campo próprio, ao lado de completion_tokens e do custo cobrado. Todas as tabelas acima foram construídas com esses dados: o esforço usado na requisição, o raciocínio consumido e o custo, disponíveis por requisição em vez de reconstruídos a partir de um total mensal.
FAQ
O GPT-6 Astra aceita reasoning_effort none?
Sim. A documentação diz que não, mas a API aceita esse valor no GPT-6 Astra e no GPT-5.6 Sol. Ele também é o único valor que retorna zero reasoning tokens. No entanto, falhou em 17 de 33 execuções no conjunto de tarefas verificadas. Portanto, serve para consultas e transformações, não para tarefas com várias etapas.
O que reasoning_effort disabled faz no GPT-6 Astra?
Ele raciocina. disabled é aceito no GPT-6 Astra e rejeitado no GPT-5.6 Sol. Não aparece em nenhuma lista documentada ou anunciada e consumiu 243 reasoning tokens por chamada no conjunto difícil, contra 151 de low, com precisão idêntica. Trate-o como um alias caro para um nível intermediário, não como um botão para desligar o raciocínio.
Qual reasoning_effort devo usar como padrão no GPT-6 Astra?
low. No GPT-6 Astra, ele não consumiu reasoning tokens em uma tarefa de uma etapa e usou de 16 a 345 tokens por tarefa nas tarefas com várias etapas. Acertou 33 de 33, enquanto none acertou 16, e max custou 2.3x mais para produzir as mesmas respostas. Só aumente o nível de uma chamada específica quando uma avaliação com suas próprias tarefas mostrar mudança nos resultados. Defina o valor explicitamente em todas as chamadas e leia a contagem de raciocínio no bloco de uso:
resp = client.chat.completions.create(
model="gpt-6-astra",
reasoning_effort="low",
messages=[{"role": "user", "content": prompt}],
)
print(resp.usage.completion_tokens_details.reasoning_tokens)
Medição realizada em 2026-09-07 por uma interface Chat Completions compatível com a OpenAI, além do endpoint Responses na comparação de visibilidade: 11 tarefas com gabaritos calculados localmente por força bruta, 7 valores de esforço, 3 execuções por combinação nos dois modelos, prompts com salt (um sufixo exclusivo em cada requisição para impedir que a resposta venha do cache) e custo obtido da contabilização de uso de cada requisição. Os resultados dos benchmarks vêm da tabela de lançamento da OpenAI e do ranking do Artificial Analysis, ambos consultados no mesmo dia. O custo por resposta correta em comparação com o GPT-5.6 Sol foi calculado com as contagens de tokens e o preço de tabela documentado de cada modelo.
Relacionado: controles de raciocínio em 13 modelos, guia de custos do GPT-5.6, custo do Claude Opus 5, faixas de preço para contexto longo, custo de gravação no prompt cache.