Chat Completions
POST /v1/chat/completions
Cria uma resposta do modelo para a conversa de chat fornecida. Compatível com a API OpenAI Chat Completions.
Corpo da requisição
| Parâmetro | Tipo | Descrição |
|---|---|---|
model* | string | ID do modelo a usar (ex.: gpt-5.4, qwen3.5-flash, gemini-2.5-flash). |
messages* | array | Lista de mensagens da conversa. Cada item tem um papel e um conteúdo. |
stream | boolean | Se true, retorna um fluxo de eventos SSE. Padrão: false. |
temperature | number | Temperatura de amostragem 0–2. Mais alta = mais aleatório. Padrão: 1. |
max_tokens | integer | Máximo de tokens a gerar. Limite dependente do modelo. |
top_p | number | Probabilidade de amostragem nucleus. 0–1. Padrão: 1. |
stop | string[] | Até 4 sequências em que a geração será interrompida. |
n | integer | Número de opções de completação a gerar. Padrão: 1. |
Exemplo de requisição
POST /v1/chat/completions
Authorization: Bearer YOUR_API_KEY
{
"model": "gpt-5.4-mini",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "What is the capital of France?"}
],
"temperature": 0.7,
"max_tokens": 256
} Exemplo de resposta
{
"id": "chatcmpl-abc123",
"object": "chat.completion",
"created": 1714000000,
"model": "qwen3.5-flash",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "The capital of France is Paris."
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 26,
"completion_tokens": 9,
"total_tokens": 35
}
} Este endpoint roteia para todos os provedores por trás do gateway — escolha um model na model price comparison para comparar os preços por token lado a lado.