Kimi K3 ist Moonshots bisher leistungsfähigstes Flaggschiff-Modell und mit 2.8 Billionen Parametern das, was seine Dokumentation das weltweit erste Open-Source-Modell in der Drei-Billionen-Parameter-Klasse nennt.
- Eingabe
- Text Bild Video $3/M
- Ausgabe
- Text $15/M
- Cache-Read
- $0.3/M
- Kontext
- 1M
- vs. GPT-4o
- ~40% günstiger
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Preisposition unter 65 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.048.576 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 1.048.576 |
Prompt Caching
| Modus | automatisch |
|---|
Thinking
| Anbieter-Parameter | reasoning_effort (top-level; the thinking object is not accepted) |
|---|---|
| Zulässige Werte | low · high · max |
| Standardwert | max gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Nein |
| Thinking-Verhalten | K3 denkt immer, regeln Sie es daher mit low herunter, statt es abzuschalten; bei Multi-Turn- und Tool-Calling-Turns muss die vollständige Assistant-Nachricht einschließlich reasoning_content und tool_calls zurückgegeben werden, und ein Wechsel des effort mitten in der Sitzung entwertet Treffer im Präfix-Cache. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild + Video → Text |
|---|---|
| Parameter | 2.8T gesamt · 104B aktiv MoE: Kimi Delta Attention (KDA) + Attention Residuals, 16 von 896 Experten pro Token aktiv |
| Lizenz | Kimi K3 License |
Der Thinking-Modus ist immer aktiv: Reasoning lässt sich nicht abschalten, sondern nur über die Effort-Stufen (low / high / max) herunterregeln. max_completion_tokens steht standardmäßig auf 131.072 und lässt sich auf die vollen 1.048.576 anheben. Context-Caching läuft automatisch, ohne Cache-id, TTL oder zusätzlichen Parameter, und greift, sobald der Prompt der vorherigen Anfrage 256 Token überschreitet. Offene Gewichte (MXFP4-Gewichte / MXFP8-Aktivierungen, quantisierungsbewusstes Training) sind unter der Kimi K3 License auf Hugging Face veröffentlicht.
Ein Prompt, gemessen über das Gateway
Kimi K3 bestanden · 3 sentences
Reasoning models don't just answer questions—they "think" first, generating long internal chains of step-by-step logic before producing a response. Those hidden thinking steps are billed as output tokens (the most expensive kind, typically 3–5x the price of input tokens), and a single query can generate thousands of them even when the visible answer is only a paragraph long. So you're paying for dramatically more compute per request: the bill doubled because the model does far more work behind the scenes, not because usage increased.
Ausgabe 755 tok (+637 Denken) Latenz 20.8 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
Kimi K3 bestanden · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The bug is a fencepost error: `cur` counts *matching adjacent pairs* rather than *items in the run*, because it starts at 0 and only increments when `xs[i] == xs[i - 1]`. A run of length L contains L−1 equal pairs, so every run was undercounted by exactly one. For a single-element list (a run of length 1) the loop never runs and the function returns 0 instead of 1; likewise any run ending at the last index — e.g. the two `2`s in `[1, 2, 2]` — reported 1 instead of 2, making it look like no run existed at all. […]
Ausgabe 1837 tok (+1547 Denken) Latenz 47.2 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
Kimi K3 bestanden · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
Ausgabe 924 tok (+863 Denken) Latenz 25.9 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
Kimi K3 bestanden · 120 words, 0 banned, 1 question
Meet Prompt Cache, a new API gateway capability that stores prompt responses and serves them across OpenAI, Anthropic, Google, and Azure endpoints. It matches requests by model, prompt hash, tools, temperature, and tenant policy, so repeated work returns fast while sensitive contexts stay isolated. Teams set TTLs, stale rules, encryption scopes, and bypass flags per route. Analytics show hit rate, latency saved, token spend avoided, and drift risk by provider. What changes for developers? Keep one integration, add cache headers, and watch fallback logic respect consent, residency, and audit needs. During rollout, canary keys compare fresh answers with cached copies before promotion. Prompt Cache cuts vendor calls, steadies p95 latency, and gives platform owners controls for cost, quality, and compliance.
Ausgabe 1527 tok (+1354 Denken) Latenz 37.9 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
Kimi K3 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k3",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k3",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k3")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Kimi K3
- Die Architektur verbindet Kimi Delta Attention, einen hybriden linearen Attention-Mechanismus, mit Attention Residuals und treibt die Mixture-of-Experts-Sparsity über das Stable-LatentMoE-Framework weiter, indem sie 16 von 896 Experten aktiviert; Moonshot schreibt diesen Änderungen rund die 2,5-fache Gesamt-Skalierungseffizienz von K2 zu.
- Es bringt natives visuelles Verständnis und ein Kontextfenster von 1M Token mit und zielt auf Frontier-Intelligenz-Szenarien einschließlich langfristigem Coding, Wissensarbeit und Reasoning: lange Engineering-Aufgaben mit minimaler Aufsicht durchhalten, über große Codebasen hinweg arbeiten, Terminal-Tools steuern sowie Screenshots und visuelles Feedback in Spieleentwicklung, Frontend-Engineering und CAD-Workflows nutzen.
- Thinking ist hier nicht optional.
- K3 führt immer Reasoning aus, und die einzige Steuerung ist das Top-Level-Feld reasoning_effort mit low, high oder max, das standardmäßig auf max steht, sodass ein latenzsensibles Deployment es explizit heruntersetzen muss.
- Mehrere weitere Grenzen sollten einprogrammiert werden: max_completion_tokens steht standardmäßig auf 131.072 gegenüber einer Obergrenze von 1.048.576, Sampling-Parameter sind fest und sollten aus Anfragen weggelassen werden, die vollständige Assistant-Nachricht muss bei Multi-Turn- und Tool-Calling-Turns unverändert zurückgegeben werden, und die Bildeingabe lehnt öffentliche Bild-URLs zugunsten von base64 oder einer hochgeladenen Dateireferenz ab.
- Context-Caching erfolgt automatisch ohne Cache-ID, TTL oder zusätzlichen Parameter und greift, sobald der Prompt der vorherigen Anfrage 256 Token überschreitet; die Preise sind flach ohne Staffelung nach Kontextlänge.
- Strukturierte Ausgaben, Partial-Mode-Prefills und dynamisches Laden von Tools werden unterstützt, und die Gewichte sind unter der Kimi K3 License veröffentlicht.
- Synthorai macht Kimi K3 über seinen OpenAI-kompatiblen Chat-Completions-Endpoint aufrufbar.
FAQ
Lässt sich die Kimi K3 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $3/M Input-Tokens deckt allein dieses Guthaben rund 41 Requests mit je ~8K Tokens gegen Kimi K3 ab.
Worin ist Kimi K3 am besten?
Erstes Open-Source-Modell in der Drei-Billionen-Parameter-Klasse; natives visuelles Verständnis mit einem Kontextfenster von 1M Token; führt immer Reasoning aus, reasoning_effort standardmäßig auf max. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Kimi K3?
Kimi K3 kostet auf Synthorai $3 pro Million Input-Tokens und $15 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.3/M abgerechnet.
Unterstützt Kimi K3 Prompt-Caching?
Ja, automatisch: Über Moonshot ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.3/M statt $3/M (ungecacht) abgerechnet. Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Kimi K3?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="kimi-k3", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Ist Kimi K3 Open Source?
Ja, die Gewichte sind unter der Kimi K3 License (offizielles Repository im Über-Abschnitt verlinkt) veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.