Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT-6 Astra

Lançado em 2026-09-03

chatVisãoCódigoChamada de ferramentasRaciocínioCache de prompts

GPT-6 Astra e o carro-chefe GPT-6 da OpenAI e o primeiro modelo desta geracao exposto na API.

Entrada
texto imagem $10/M
Saída
texto $50/M
Leitura de cache
$1/M
Contexto
1.1M
Corte de conhecimento
2026-04

Prompts acima de 272K tokens: toda a requisição é cobrada a $20/M de entrada · $75/M de saída

Benchmarks

Acima da médiaapenas 4 comparáveis
GPT-6 Astra outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
HealthBench
58.1%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic OpenAI

O preço em contexto

Posição do preço entre 65 modelos comparáveis

Entrada$10/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$50/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$1/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.050.000
Saída máxima (especificação do fornecedor) 128.000
Corte de conhecimento 2026-04

Cache de prompts

Modo automático
Prefixo mín. 1.024
Duração 5-10 min, até 1 hora

Raciocínio

Parâmetro do fornecedor reasoning.effort
Valores aceites none · low · medium · high · xhigh · max
Valor predefinido medium aplicado quando o pedido nada indica
Pode ser desativado Sim
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto + imagem → texto
  • OpenAI's GPT-6 flagship. Upstream exposes only the suffixed gpt-6-astra id
  • there is no bare gpt-6 alias. 1.05M context / 128k max output (the output ceiling is the value upstream itself reports when asked for more). Prompts over 272k input tokens move the whole request onto the long-context rate. Two upstream restrictions carry over from the GPT-5.6 family: temperature accepts only its default, and function tools cannot be combined with reasoning on Chat Completions

conforme documentação oficial da OpenAI ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

GPT-6 Astra passou · 3 sentences

Enabling reasoning makes the model do more work per request, often generating internal reasoning tokens that are billed even though they do not appear in the final answer. If traffic, model choice, and pricing stayed the same, those extra tokens likely explain why our bill doubled—not longer answers or more users. We should verify the usage breakdown, then reserve higher reasoning levels for tasks where improved results justify the added cost.

saída 283 tok (+196 pensamento) latência 17.2 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

GPT-6 Astra passou · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The original code counts equal adjacent pairs rather than items, so every nonempty run is undercounted by one: a single-element input returns `0`, and a run of three equal items returns `2`. Starting and resetting `cur` to `1` counts the first item of each run, while the empty-input check preserves a result of `0`. Updating `best` after each iteration includes runs ending at the last index without needing a final flush; the original also updated during trailing runs, but undercounted them.

saída 321 tok (+131 pensamento) latência 13.5 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

GPT-6 Astra passou · 5/5 fields, guidance "Formal guidance is withheld pending the "

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": null, "growth_pct": "eleven and change", "guidance": "Formal guidance is withheld pending the Q4 close." }

saída 329 tok (+267 pensamento) latência 16.9 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

GPT-6 Astra passou · 120 words, 0 banned, 1 question

Introducing Cross Provider Prompt Cache, a new API gateway feature that reuses eligible prompt content across supported AI providers. Why pay to process the same context every time? Configure caching once at the gateway, then route requests between models while keeping shared instructions, reference material, and conversation prefixes ready for reuse. Caching controls let teams set expiration windows, isolate tenants, and exclude sensitive content. Cache analytics show hit rates, estimated savings, and latency trends, helping developers tune performance with confidence. Existing routing policies continue to work, so adoption fits your current architecture. Start with a single application, measure the results, and expand as needed. Available today in the dashboard and API, with documentation and examples to guide your first deployment.

saída 665 tok (+516 pensamento) latência 19.3 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o GPT-6 Astra em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o GPT-6 Astra

  • O fornecedor publica apenas o identificador com sufixo gpt-6-astra: nao existe um alias gpt-6 simples para servir de alternativa.
  • Combina uma janela de contexto de 1.050.000 tokens com 128K tokens de saida maxima, um teto confirmado pela propria API, que rejeita pedidos maiores indicando o limite explicito, e aceita entrada de texto e imagem, com saidas estruturadas, streaming, ferramentas, cache de prompts e batch.
  • O preco e dividido por comprimento de contexto: prompts com ate 272K tokens de entrada sao cobrados pela tarifa de contexto curto e, acima disso, todo o pedido passa para a tarifa de contexto longo, com cerca do dobro na entrada e 1,5x na saida.
  • Vale antecipar duas restricoes herdadas da familia GPT-5.6: temperature aceita apenas o valor padrao e ferramentas de funcao nao podem ser combinadas com raciocinio no Chat Completions; use a API Responses ou desative o raciocinio.
  • A Synthorai serve o GPT-6 Astra pela mesma API compativel com OpenAI do restante da frota.

Perguntas frequentes

A API do GPT-6 Astra é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $10/M de tokens de entrada, só esse crédito já cobre cerca de 12 requisições de ~8K tokens ao GPT-6 Astra.

Em que o GPT-6 Astra é melhor?

O carro-chefe GPT-6 da OpenAI, exposto apenas como gpt-6-astra; 1,05M de contexto e teto de 128K confirmado pela propria API; Tarifas de contexto curto e longo separadas em 272K tokens. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GPT-6 Astra?

Na Synthorai, o GPT-6 Astra custa $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $1/M.

O GPT-6 Astra suporta cache de prompts?

Sim, automaticamente: prompts servidos pela OpenAI entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $1/M, contra $10/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL 5-10 min, até 1 hora). Guia de cache de prompts →

Como obtenho acesso ao GPT-6 Astra?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="gpt-6-astra" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Qual é o corte de conhecimento do GPT-6 Astra?

O corte de conhecimento do GPT-6 Astra é 2026-04, segundo a documentação oficial do fornecedor (verificado em 2026-09-07).

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →