Chat Completions
POST /v1/chat/completions
Erstellt eine Modellantwort für die angegebene Chat-Konversation. Kompatibel mit der OpenAI Chat Completions API.
Anfragetext
| Parameter | Typ | Beschreibung |
|---|---|---|
model* | string | ID des zu verwendenden Modells (z. B. gpt-5.4, qwen3.5-flash, gemini-2.5-flash). |
messages* | array | Liste der Nachrichten in der Konversation. Jedes Element hat eine Rolle und einen Inhalt. |
stream | boolean | Bei true wird ein Stream von SSE-Ereignissen zurückgegeben. Standard: false. |
temperature | number | Sampling-Temperatur 0–2. Höher = zufälliger. Standard: 1. |
max_tokens | integer | Maximale Anzahl der zu generierenden Tokens. Modellabhängige Obergrenze. |
top_p | number | Nucleus-Sampling-Wahrscheinlichkeit. 0–1. Standard: 1. |
stop | string[] | Bis zu 4 Sequenzen, bei denen die Generierung stoppt. |
n | integer | Anzahl der zu generierenden Vervollständigungsoptionen. Standard: 1. |
Beispielanfrage
POST /v1/chat/completions
Authorization: Bearer YOUR_API_KEY
{
"model": "gpt-5.4-mini",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "What is the capital of France?"}
],
"temperature": 0.7,
"max_tokens": 256
} Beispielantwort
{
"id": "chatcmpl-abc123",
"object": "chat.completion",
"created": 1714000000,
"model": "qwen3.5-flash",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "The capital of France is Paris."
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 26,
"completion_tokens": 9,
"total_tokens": 35
}
} Dieser Endpunkt routet zu jedem Anbieter hinter dem Gateway — wählen Sie ein model im model price comparison, um die Token-Preise nebeneinander zu vergleichen.