GPT-6 Astra e o carro-chefe GPT-6 da OpenAI e o primeiro modelo desta geracao exposto na API.
- Entrada
- texto imagem $10/M
- Saída
- texto $50/M
- Leitura de cache
- $1/M
- Contexto
- 1.1M
- Corte de conhecimento
- 2026-04
Prompts acima de 272K tokens: toda a requisição é cobrada a $20/M de entrada · $75/M de saída
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) Anthropic OpenAI
O preço em contexto
Posição do preço entre 65 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.050.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 128.000 |
| Corte de conhecimento | 2026-04 |
Cache de prompts
| Modo | automático |
|---|---|
| Prefixo mín. | 1.024 |
| Duração | 5-10 min, até 1 hora |
Raciocínio
| Parâmetro do fornecedor | reasoning.effort |
|---|---|
| Valores aceites | none · low · medium · high · xhigh · max |
| Valor predefinido | medium aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto + imagem → texto |
|---|
- OpenAI's GPT-6 flagship. Upstream exposes only the suffixed gpt-6-astra id
- there is no bare gpt-6 alias. 1.05M context / 128k max output (the output ceiling is the value upstream itself reports when asked for more). Prompts over 272k input tokens move the whole request onto the long-context rate. Two upstream restrictions carry over from the GPT-5.6 family: temperature accepts only its default, and function tools cannot be combined with reasoning on Chat Completions
conforme documentação oficial da OpenAI ↗
Um prompt, medido pelo gateway
GPT-6 Astra passou · 3 sentences
Enabling reasoning makes the model do more work per request, often generating internal reasoning tokens that are billed even though they do not appear in the final answer. If traffic, model choice, and pricing stayed the same, those extra tokens likely explain why our bill doubled—not longer answers or more users. We should verify the usage breakdown, then reserve higher reasoning levels for tasks where improved results justify the added cost.
saída 283 tok (+196 pensamento) latência 17.2 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
GPT-6 Astra passou · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The original code counts equal adjacent pairs rather than items, so every nonempty run is undercounted by one: a single-element input returns `0`, and a run of three equal items returns `2`. Starting and resetting `cur` to `1` counts the first item of each run, while the empty-input check preserves a result of `0`. Updating `best` after each iteration includes runs ending at the last index without needing a final flush; the original also updated during trailing runs, but undercounted them.
saída 321 tok (+131 pensamento) latência 13.5 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
GPT-6 Astra passou · 5/5 fields, guidance "Formal guidance is withheld pending the "
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": null, "growth_pct": "eleven and change", "guidance": "Formal guidance is withheld pending the Q4 close." }
saída 329 tok (+267 pensamento) latência 16.9 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
GPT-6 Astra passou · 120 words, 0 banned, 1 question
Introducing Cross Provider Prompt Cache, a new API gateway feature that reuses eligible prompt content across supported AI providers. Why pay to process the same context every time? Configure caching once at the gateway, then route requests between models while keeping shared instructions, reference material, and conversation prefixes ready for reuse. Caching controls let teams set expiration windows, isolate tenants, and exclude sensitive content. Cache analytics show hit rates, estimated savings, and latency trends, helping developers tune performance with confidence. Existing routing policies continue to work, so adoption fits your current architecture. Start with a single application, measure the results, and expand as needed. Available today in the dashboard and API, with documentation and examples to guide your first deployment.
saída 665 tok (+516 pensamento) latência 19.3 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o GPT-6 Astra em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gpt-6-astra",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gpt-6-astra",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gpt-6-astra",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gpt-6-astra")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o GPT-6 Astra
- O fornecedor publica apenas o identificador com sufixo gpt-6-astra: nao existe um alias gpt-6 simples para servir de alternativa.
- Combina uma janela de contexto de 1.050.000 tokens com 128K tokens de saida maxima, um teto confirmado pela propria API, que rejeita pedidos maiores indicando o limite explicito, e aceita entrada de texto e imagem, com saidas estruturadas, streaming, ferramentas, cache de prompts e batch.
- O preco e dividido por comprimento de contexto: prompts com ate 272K tokens de entrada sao cobrados pela tarifa de contexto curto e, acima disso, todo o pedido passa para a tarifa de contexto longo, com cerca do dobro na entrada e 1,5x na saida.
- Vale antecipar duas restricoes herdadas da familia GPT-5.6: temperature aceita apenas o valor padrao e ferramentas de funcao nao podem ser combinadas com raciocinio no Chat Completions; use a API Responses ou desative o raciocinio.
- A Synthorai serve o GPT-6 Astra pela mesma API compativel com OpenAI do restante da frota.
Perguntas frequentes
A API do GPT-6 Astra é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $10/M de tokens de entrada, só esse crédito já cobre cerca de 12 requisições de ~8K tokens ao GPT-6 Astra.
Em que o GPT-6 Astra é melhor?
O carro-chefe GPT-6 da OpenAI, exposto apenas como gpt-6-astra; 1,05M de contexto e teto de 128K confirmado pela propria API; Tarifas de contexto curto e longo separadas em 272K tokens. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o GPT-6 Astra?
Na Synthorai, o GPT-6 Astra custa $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $1/M.
O GPT-6 Astra suporta cache de prompts?
Sim, automaticamente: prompts servidos pela OpenAI entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $1/M, contra $10/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL 5-10 min, até 1 hora). Guia de cache de prompts →
Como obtenho acesso ao GPT-6 Astra?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="gpt-6-astra" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Qual é o corte de conhecimento do GPT-6 Astra?
O corte de conhecimento do GPT-6 Astra é 2026-04, segundo a documentação oficial do fornecedor (verificado em 2026-09-07).
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.