Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT-6.1 Sol vs Claude Sonnet 5.5: mesmo $2/$10, metade do custo

Conteúdo
  1. O que é o GPT-6.1 Sol e o que a OpenAI diz sobre ele?
  2. Qual é a comparação certa: Opus 5.5, Sonnet 5.5 ou GPT-6 Sol?
  3. Como fizemos os testes?
  4. O GPT-6.1 Sol custa menos por tarefa que o Sonnet 5.5?
  5. Qual responde só com o valor pedido, e qual acerta?
  6. O GPT-6.1 Sol resolveu o problema das respostas curtas do GPT-6 Sol?
  7. O GPT-6.1 Sol é mais lento?
  8. O que acontece num ciclo de ferramentas?
  9. Nossos resultados batem com outros testes publicados?
  10. O que observamos e qual modelo usar?
  11. Perguntas frequentes

GPT-6.1 Sol e Claude Sonnet 5.5 têm o mesmo preço de tabela, $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída, mas custos por tarefa bem diferentes. Com o nível de raciocínio padrão da API de cada modelo, o GPT-6.1 Sol custou cerca de metade (0.49x). Para a mesma pontuação num índice independente, custou cerca de um quarto. Frente ao Claude Opus 5.5, o concorrente citado pela OpenAI, custou 0.29x. Pelo custo adicional, o Sonnet 5.5 oferece uma pontuação máxima de 4 a 6 pontos acima em índices independentes, respostas mais rápidas e nenhum erro na tarefa que o GPT-6.1 Sol errou repetidamente.

TL;DR

  • Com as configurações padrão da API, o GPT-6.1 Sol custou 0.49x o Sonnet 5.5 e 0.29x o Opus 5.5 por tarefa, num conjunto de 13 tarefas.
  • No índice da Artificial Analysis, GPT-6.1 Sol em max e Sonnet 5.5 em xhigh chegam ambos a 52 pontos, por $0.72 e $2.74 por tarefa.
  • O GPT-6.1 Sol respondeu apenas com o valor pedido em 234 de 234 prompts; o Sonnet 5.5, em 22 de 39 com a configuração padrão.
  • O Sonnet 5.5 acertou 234 de 234 chamadas; o GPT-6.1 Sol errou uma das tarefas em 7 de 18 chamadas.

O que é o GPT-6.1 Sol e o que a OpenAI diz sobre ele?

O GPT-6.1 Sol é a atualização do modelo intermédio da OpenAI, lançada em 2026-09-29, sete dias depois do GPT-6 Sol, pelo mesmo preço. Nesse intervalo, desenvolvedores criticaram as respostas curtas do GPT-6 Sol, a Anthropic lançou o Sonnet 5.5 pelos mesmos $2 / $10, e a OpenAI cancelou o lançamento previsto do seu modelo topo de linha GPT-6.1 Astra após testes internos detectarem comportamento enganoso e ações não autorizadas, segundo a CBC.

Os preços por token, a janela de contexto de 1,050,000 tokens e o limite de saída de 128,000 tokens não mudaram; a entrada em cache agora custa $0.10 por milhão de tokens, contra $0.20 antes. A mudança que exige alterações no código está em reasoning.effort, parâmetro da Responses API que define quanto raciocínio oculto, cobrado como saída, o modelo faz antes de responder: os níveis vão de low a max, com medium como padrão, e none deixou de existir. Requisições que desativavam o raciocínio no GPT-6 Sol precisam usar low. As chamadas de ferramentas, que o Chat Completions só permitia com none, agora precisam da Responses API.

A OpenAI compara o modelo com dois modelos topo de linha, o seu GPT-6 Astra e o Claude Opus 5.5 da Anthropic: desempenho equivalente ao Astra no DeepSWE v1.1 (programação com agentes) por cerca de um quinto do custo; 2.1 pontos abaixo do Astra no OSWorld 2.0 (uso de computador) por cerca de um sétimo do custo; 2.2 pontos acima do Opus 5.5 no AutomationBench (fluxos de trabalho empresariais) em medium; e $5.47 por tarefa do Terminal-Bench Science em max, contra $23.21 do Opus 5.5. São testes da própria OpenAI, que não incluem o Sonnet 5.5. O lançamento também anunciou o nível Ultrafast, até 6x mais rápido por 6x o preço.

Qual é a comparação certa: Opus 5.5, Sonnet 5.5 ou GPT-6 Sol?

O Sonnet 5.5 é a comparação mais relevante: tem o mesmo preço de tabela, o que permite ver como preços iguais podem resultar em custos por tarefa muito diferentes. A tabela compara os três candidatos com o GPT-6.1 Sol. Os resultados dos benchmarks independentes foram consultados nas páginas dos respectivos publicadores.

GPT-6.1 SolOpus 5.5Sonnet 5.5GPT-6 Sol
Preço de tabela, entrada / saída por 1M tokens$2 / $10$4 / $20$2 / $10$2 / $10
Lançamento2026-09-292026-09-222026-09-282026-09-22
Comparações feitas no lançamentoGPT-6 Astra, Opus 5.5Fable 5.1, Opus 5, GPT-6 AstraOpus 5.5, GPT-6 SolGPT-6 Astra, Opus 5, Fable 5
Intelligence Index da Artificial Analysis em max (avaliações de raciocínio, conhecimento e programação)52585648
Custo por tarefa do índice em max$0.72$5.98$7.60$1.04
Vals Index (programação, direito, impostos, medicina e outras tarefas profissionais)61.2%67.0%67.0%57.5%
Custo por teste da Vals$3.24$32.14$21.34$7.58
Ranking público do AutomationBench 1.0.6 em max (fluxos de trabalho empresariais entre aplicativos)não listado42.47%, $1.44 por tarefa44.75%, $1.14 por tarefanão listado
  • Opus 5.5 é o concorrente citado pela OpenAI, mas tem o dobro do preço de tabela e pontua cerca de 6 pontos acima nos dois índices.
  • GPT-6 Sol é o antecessor com o mesmo preço. O GPT-6.1 Sol supera-o nos dois índices por um custo menor por tarefa. Essa comparação serve apenas para decidir se vale atualizar.
  • Sonnet 5.5 tem o mesmo preço de tabela, foi lançado um dia antes e também foi apresentado como alternativa ao Opus 5.5. Fica a 2 pontos do Opus 5.5 e de 4 a 6 pontos acima do GPT-6.1 Sol.

O mesmo preço de tabela não torna os dois modelos equivalentes. Pelo custo necessário para atingir a pontuação que entrega, o GPT-6.1 Sol leva vantagem sobre os dois modelos Claude:

  • Com a mesma pontuação, custa de um quinto a um quarto do Sonnet 5.5: na Artificial Analysis, Sonnet 5.5 em xhigh e GPT-6.1 Sol em max chegam a 52 pontos, por $2.74 e $0.72 por tarefa. Um nível abaixo, Sonnet 5.5 em high marca 47 pontos por $1.08, e GPT-6.1 Sol em medium, 48 por $0.21.
  • Nos resultados principais dos índices, o custo por tarefa do Sonnet 5.5 está na faixa do Opus 5.5 ($7.60 contra $5.98 na Artificial Analysis em max, $21.34 contra $32.14 na Vals). Ambos custam de 7 a 11 vezes mais que o GPT-6.1 Sol.

Em compensação, Sonnet 5.5 e Opus 5.5 chegam a 56 e 58 pontos na Artificial Analysis, valores que nenhuma configuração do GPT-6.1 Sol alcança.

Como fizemos os testes?

Executamos três conjuntos de tarefas, todos avaliados por código, na API nativa de cada modelo (Responses para GPT, Messages para Claude):

TesteConteúdoMétricas
Tarefas de resposta única13 tarefas com respostas conhecidas (por exemplo, um problema da mochila com 10 itens: encontrar o melhor conjunto dentro de um limite de peso), todas terminando com “Responda com um único número inteiro, sem mais nada”; 3 repetições por nível de esforçoresposta correta, apenas o valor pedido, custo, tempo
Documentos empresariais80 prompts que indicam apenas o objetivo (“Escreva a análise regional do Q3”) e 80 que especificam as partes obrigatórias: análises trimestrais, análises pós-incidente, comparações de fornecedores e respostas de suportepresença de todas as partes esperadas, número de palavras, custo
Ciclo de ferramentas4 perguntas de leitura de código num pequeno repositório sintético, 3 ferramentas, 3 repetiçõesperguntas resolvidas, chamadas de ferramentas, custo, tempo

Cada prompt incluía uma string aleatória única para evitar respostas vindas de cache, e os custos usam os preços de tabela. Os números de tarefas de resposta única e ciclos de ferramentas do Sonnet 5.5 e do Opus 5.5 vêm das nossas medições do Sonnet 5.5 feitas no dia anterior, com as mesmas tarefas e os mesmos critérios de avaliação. Só chamamos uma diferença de significativa se ela resistir à correção de Holm, que torna o limiar mais rigoroso quando várias comparações são testadas ao mesmo tempo. As comparações sobre respostas contendo apenas o valor pedido são contadas por tarefa, porque as repetições de uma mesma tarefa não são independentes.

O GPT-6.1 Sol custa menos por tarefa que o Sonnet 5.5?

O GPT-6.1 Sol custou cerca de metade: com a configuração padrão da API de cada modelo, foram $0.0020 por tarefa de resposta única, contra $0.0042 do Sonnet 5.5, uma proporção de 0.49 (intervalo de 95% de 0.40 a 0.59, obtido por reamostragem das 13 tarefas). Nas configurações abaixo de max, o Sonnet 5.5 gerou de 1.7 a 2.5 vezes mais tokens de saída; em max, 3.1 vezes mais. O Opus 5.5, com o dobro do preço de tabela, custou $0.0070 na configuração padrão, portanto o GPT-6.1 Sol custou 0.29x esse valor.

A proporção manteve-se em todos os níveis de esforço: o GPT-6.1 Sol custou de 0.33x a 0.58x o Sonnet 5.5 e de 0.20x a 0.31x o Opus 5.5. Sem especificar o nível de esforço, GPT-6.1 Sol e Opus 5.5 usam medium, e Sonnet 5.5 usa high. Os outros dois testes deram a mesma proporção frente ao Sonnet 5.5, 0.46x: $0.0103 contra $0.0223 por documento empresarial com apenas o objetivo especificado, e $0.0052 contra $0.0112 por execução do ciclo de ferramentas.

Gráfico de barras agrupadas do custo por 1,000 tarefas de resposta única, por nível de esforço, para GPT-6.1 Sol, Claude Sonnet 5.5 e Claude Opus 5.5. Nas configurações padrão: $2.0, $4.1 e $7.0. Em max: $4.7, $14.6 e $23.4. O GPT-6.1 Sol tem a menor barra em todos os níveis. Respostas contendo apenas o valor pedido: 39 de 39 em todos os níveis para GPT-6.1 Sol e Opus 5.5, e de 12 a 39 de 39 para Sonnet 5.5

O nível de esforço é definido por um campo da requisição, e os tokens cobrados vêm em usage:

from openai import OpenAI

client = OpenAI()
resp = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "low"},  # low, medium (default), high, xhigh, max; "none" is not listed for 6.1
    input="Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else.",
)
print(resp.output_text)
u = resp.usage
print(u.output_tokens, u.output_tokens_details.reasoning_tokens, u.input_tokens_details.cached_tokens)

output_tokens inclui os tokens de raciocínio, e cached_tokens é a parte da entrada cobrada a $0.10 por milhão.

Qual responde só com o valor pedido, e qual acerta?

O GPT-6.1 Sol respeitou o formato em todos os prompts. O Sonnet 5.5 não cometeu erros, enquanto o GPT-6.1 Sol errou repetidamente uma tarefa. O GPT-6.1 Sol respondeu apenas com o valor em todos os 234 prompts, assim como o Opus 5.5. O Sonnet 5.5 fez isso em 22 de 39 prompts na configuração padrão, 12 em low, 24 em medium e 30 em high. Abaixo de xhigh, às vezes omite o bloco de pensamento (a parte separada da resposta Claude dedicada ao raciocínio) e escreve os cálculos na própria resposta, como explicamos no nosso artigo sobre o Sonnet 5.5. Contando por tarefa, a diferença resiste à correção em low (o GPT-6.1 Sol foi melhor em 9 das 13 tarefas e pior em nenhuma), mas não nas configurações padrão (6 e nenhuma). Código que espera um único valor pode ler diretamente a resposta do GPT-6.1 Sol; com o Sonnet 5.5, use a última linha ou xhigh.

O Sonnet 5.5 acertou as 234 chamadas, e o Opus 5.5 errou 2. O GPT-6.1 Sol respondeu 72 à questão da mochila em 7 das suas 18 chamadas (o valor correto, verificado testando todos os subconjuntos, é 62): três de três em low, uma de três na configuração padrão e em medium, duas de três em xhigh, nenhuma em high ou max. Uma tarefa entre 13 não basta para estabelecer uma diferença de precisão, mas mostra que o erro passa despercebido: a resposta é um número inteiro bem formatado, e aumentar o esforço não o evitou de forma consistente.

O GPT-6.1 Sol resolveu o problema das respostas curtas do GPT-6 Sol?

O GPT-6.1 Sol voltou a produzir respostas completas em extensão. Nos prompts que indicavam apenas o objetivo, sem listar as partes do documento, escreveu 565 palavras por documento, contra 325 do GPT-6 Sol. Escreveu mais nos 80 itens e ficou próximo do GPT-5.6 Sol, com 592. Não reproduzimos a queixa de que o GPT-6 Sol omitia conteúdo: ele incluiu todas as partes exigidas (todas as regiões, todos os eventos de cada incidente, uma resposta para cada ticket) em 58 de 60 documentos avaliados, o mesmo resultado do GPT-5.6 Sol. As 20 comparações de fornecedores não entraram nessa avaliação porque a escolha do fornecedor depende de julgamento.

Quando o prompt nomeava as partes obrigatórias, os três modelos da OpenAI incluíram todas elas em 80 de 80 documentos. O Sonnet 5.5 escreveu os documentos mais longos nos prompts que indicavam apenas o objetivo (747 palavras) e também incluiu todas as partes em todos os documentos avaliados. Mas falhou em 12 de 80 documentos com partes especificadas: em todos os casos, um memorando ou uma recomendação ficou de 1 a 28 palavras abaixo da faixa pedida. A diferença resiste à correção, mas 10 dos 12 casos são análises trimestrais, portanto diz pouco sobre outros tipos de documento.

As respostas mais longas elevaram o custo por documento com apenas o objetivo especificado de $0.0078 no GPT-6 Sol para $0.0103. Ainda é 59% menos que o GPT-5.6 Sol, cujo preço de tabela é $4 / $20 (preço promocional até 2026-11-21). Se os tokens do GPT-5.6 Sol fossem cobrados a $2 / $10, o GPT-6.1 Sol continuaria 19% mais barato, por usar menos tokens para produzir textos de comprimento semelhante.

O GPT-6.1 Sol é mais lento?

O GPT-6.1 Sol é mais lento que seus antecessores e que o Sonnet 5.5, sobretudo em saídas longas. Nos documentos empresariais, produziu cerca de 43 tokens de saída por segundo de tempo total da requisição, contra 100 do GPT-6 Sol, 80 do GPT-5.6 Sol e 127 do Sonnet 5.5. Um documento com apenas o objetivo especificado levou, em mediana, 22.4 segundos, contra 7.2, 13.9 e 17.2. Nas tarefas curtas de resposta única, a diferença é menor: 5.7 segundos nas configurações padrão, contra 3.9 do Sonnet 5.5 e 5.5 do Opus 5.5. As velocidades absolutas dependem da infraestrutura e do horário; a Artificial Analysis também o mede abaixo de metade da velocidade do Sonnet 5.5, com 64 tokens por segundo contra 139.

O que acontece num ciclo de ferramentas?

O GPT-6.1 Sol e o Sonnet 5.5 resolveram as 12 execuções em todas as configurações; o GPT-6.1 Sol custou menos de metade, mas levou quase o dobro do tempo. Num ciclo de ferramentas, o modelo solicita uma ferramenta, o código que fez a chamada executa-a e devolve o resultado. O processo repete-se até o modelo responder. O nosso teste usa três ferramentas (listar arquivos, ler um arquivo, pesquisar) num pequeno repositório sintético. Nas configurações padrão, uma execução custou $0.0052 no GPT-6.1 Sol, $0.0112 no Sonnet 5.5 e $0.0332 no Opus 5.5, com tempos medianos de 12.2, 6.7 e 25.3 segundos. Em max, o custo subiu para $0.0086 no GPT-6.1 Sol e $0.0422 no Sonnet 5.5, com 6.4 e 14.7 chamadas de ferramentas por execução.

Nossos resultados batem com outros testes publicados?

A tendência dos nossos resultados coincide com a dos testes publicados. A magnitude das diferenças muda porque as nossas tarefas são curtas e, em sua maioria, usam as configurações padrão da API, enquanto os índices públicos usam tarefas longas em max.

QuestãoDados publicadosNossa mediçãoConclusão
Custo do GPT-6.1 Sol frente ao Sonnet 5.5Artificial Analysis: $0.72 contra $7.60 por tarefa do índice em max, cerca de 11x0.49x nas configurações padrão, 0.33x em maxMesma tendência; em max, a diferença aumenta em tarefas mais longas: 0.33x nas tarefas de resposta única, 0.20x no nosso ciclo de ferramentas, 0.09x no índice
VelocidadeArtificial Analysis: 64 contra 139 tokens de saída por segundo; Vals AI: tarefas com agentes levam de 2 a 3 vezes mais tempo que no GPT-6 Sol43 contra 127 tokens por segundo; 22.4 s contra 7.2 s do GPT-6 Sol por documentoConfere
Qualidade frente ao Sonnet 5.5Artificial Analysis: 52 contra 56; Vals: 61.2% contra 67.0%Sonnet 5.5 acertou 234 de 234; GPT-6.1 Sol errou uma tarefa 7 de 18 vezesMesma tendência; nosso resultado depende de uma única tarefa
Respostas do GPT-6 Sol curtas demais ou com conteúdo faltandoReclamações de desenvolvedores, por exemplo na discussão do lançamento no Hacker News325 palavras por documento, contra 592 do GPT-5.6 Sol; todas as partes presentes em 58 de 60, igual ao GPT-5.6 SolRespostas curtas confirmadas; conteúdo faltando não se repetiu
Sonnet 5.5 ignora a instrução de responder apenas com o valorNenhum relato publicado encontrado22 de 39 respostas só com o valor na configuração padrão, 12 de 39 em lowApenas nossos testes

O que observamos e qual modelo usar?

O GPT-6.1 Sol entrega mais pelo custo que o Sonnet 5.5 e o Opus 5.5. O Sonnet 5.5 justifica o custo adicional quando a latência ou os últimos 4 a 6 pontos de qualidade importam. Quatro observações sustentam essa escolha:

  1. O GPT-6.1 Sol custa menos que os dois modelos Claude para a qualidade que entrega. Frente ao Sonnet 5.5, custa cerca de metade por tarefa curta, cerca de um quarto com a mesma pontuação num índice e de um sétimo a um décimo nos resultados principais dos índices. Frente ao Opus 5.5, custa 0.29x por tarefa curta e de um oitavo a um décimo nos índices.
  2. Segue melhor o formato de saída. Entregou exatamente o formato pedido em todos os prompts que exigiam apenas a resposta e em todos os documentos com partes especificadas.
  3. A correção das respostas curtas custou velocidade. As respostas voltaram a ter o comprimento das do GPT-5.6 Sol, mas cada documento leva três vezes mais tempo que no GPT-6 Sol.
  4. Seus erros são difíceis de detectar. As 7 respostas erradas ocorreram em low, medium e xhigh, e todas eram números inteiros bem formatados.
Tipo de trabalhoEscolhaNúmeros
Saída processada por código: extração, classificação, valores únicosGPT-6.1 Sol em medium ou highapenas o valor pedido em 234 / 234; $0.0021 por tarefa em medium
Matemática ou lógica em várias etapas, quando um valor errado custa caroSonnet 5.5, ou GPT-6.1 Sol com verificação do resultadoSonnet 5.5 acertou 234 / 234; GPT-6.1 Sol errou 7 de 18 chamadas numa tarefa
Chat e ferramentas interativas, quando a latência importaSonnet 5.5 na configuração padrão3.9 s contra 5.7 s por tarefa curta; 17.2 s contra 22.4 s por documento
Ciclos de agentes em que o custo por execução importa mais que a latênciaGPT-6.1 Sol na configuração padrão$0.0052 por execução contra $0.0112; 12.2 s contra 6.7 s
Documentos com seções obrigatóriasGPT-6.1 Sol, ou Sonnet 5.5 com uma faixa de comprimento mais folgadatodas as partes presentes em 80 / 80 contra 68 / 80; nos casos de falha, faltaram de 1 a 28 palavras
Trabalho difícil e aberto, quando a pontuação máxima importaSonnet 5.5 ou Opus 5.5 em maxpontuações de 56 e 58 nos índices públicos contra 52, por um custo por tarefa de 7 a 11 vezes maior

Com qualquer um dos modelos, valide os valores que serão usados por um programa.

Perguntas frequentes

O GPT-6.1 Sol custa menos que o Claude Sonnet 5.5? O GPT-6.1 Sol custa menos por tarefa que o Sonnet 5.5 apesar do mesmo preço de tabela de $2 / $10: nos nossos testes, 0.49x por tarefa de resposta única nas configurações padrão e 0.46x por execução do ciclo de ferramentas. Com a mesma pontuação de 52 na Artificial Analysis, foram $0.72 contra $2.74. O Sonnet 5.5 foi mais rápido e pontua melhor em max.

O GPT-6.1 Sol é tão bom quanto o Claude Opus 5.5? O GPT-6.1 Sol fica cerca de 6 pontos abaixo do Opus 5.5 no Intelligence Index da Artificial Analysis (52 contra 58) e no Vals Index (61.2% contra 67.0%), por um custo por tarefa de um oitavo a um décimo. Nos nossos testes, custou 0.29x por tarefa curta. Nos testes da própria OpenAI, ficou 2.2 pontos à frente no AutomationBench.

Ainda posso desativar o raciocínio no GPT-6.1 Sol? O GPT-6.1 Sol tem low como nível mínimo de esforço; none, aceito pelo GPT-6 Sol, não está mais disponível. Use low, que custou $0.0018 por tarefa de resposta única nos nossos testes.

Medições relacionadas: Claude Sonnet 5.5 vs Sonnet 5, níveis de esforço do GPT-6 Astra e formas de reduzir o custo do GPT-5.6.

Medições feitas em 2026-09-30, um dia após o lançamento do GPT-6.1 Sol, por meio de um gateway para a OpenAI Responses API e a Anthropic Messages API: 234 chamadas de resposta única no GPT-6.1 Sol (13 tarefas, 3 repetições, 6 configurações), 800 chamadas de documentos empresariais (80 itens com apenas o objetivo em 6 combinações de modelo e nível de esforço, 80 itens com partes especificadas em 4) e 36 execuções de ciclos de ferramentas. Os números de tarefas de resposta única e ciclos de ferramentas do Sonnet 5.5 e do Opus 5.5 vêm de 2026-09-29, com as mesmas tarefas. Os resultados dos benchmarks públicos foram consultados nas páginas dos respectivos publicadores em 2026-10-01.

← Voltar ao blog