Kimi K2.5 ist Moonshot AIs quelloffenes, nativ multimodales agentisches Modell, gebaut durch kontinuierliches Vortraining auf rund 15T gemischten visuellen und Text-Token auf Basis von Kimi-K2-Base.
- Eingabe
- Text Bild Video $0.574/M
- Ausgabe
- Text $3.011/M
- Cache-Read
- $0.115/M
- Kontext
- 262K
- vs. GPT-4o
- ~89% günstiger
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 256.000 |
|---|
Prompt Caching
| Modus | automatisch |
|---|
Thinking
| Anbieter-Parameter | thinking.type |
|---|---|
| Zulässige Werte | enabled · disabled |
| Standardwert | enabled auf Moonshots eigener Plattform; zu beachten ist, dass Alibaba Model Studio seine Bereitstellung dieses Modells mit standardmäßig abgeschaltetem Thinking dokumentiert gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Die Spur wird in reasoning_content zurückgegeben, zählt gegen max_tokens und wird immer vor content gestreamt; Preserved Thinking wird nicht unterstützt, doch historisches reasoning_content sollte in messages erhalten bleiben, sonst verliert das Modell den Reasoning-Kontext. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text + Bild + Video → Text |
|---|---|
| Parameter | 1T gesamt · 32B aktiv MoE |
| Lizenz | Modified-MIT |
- MoE mit 1T/32B aktiven Parametern, 256K Kontext, nativ multimodal (MoonViT-Encoder, Bild- und Videoeingabe), Instant- und Thinking-Modus, Agent Swarm mit bis zu 100 Subagenten
- native INT4-Quantisierung
Ein Prompt, gemessen über das Gateway
Kimi K2.5 bestanden · 3 sentences
Enabling reasoning causes the model to perform extended internal deliberation, generating substantially more tokens per query than standard responses. Each reasoning chain consumes compute credits equivalent to multiple regular completions, and user query volume remained constant while per-query costs multiplied. The doubling reflects usage of a more expensive capability tier, not an operational error or billing anomaly.
Ausgabe 67 tok Latenz 1.9 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
Kimi K2.5 bestanden · 8/8 cases
The bug has two causes: the loop starts at index 1 and `cur` counts *additional* matching elements rather than the run length itself, so a single element run returns 0 instead of 1, and runs ending at the final element aren't properly captured because `best` is only updated inside the loop when elements match—meaning if the last run is just one element or if `cur` was never updated for the final position, the correct value gets lost. To fix this, initialize `best` and `cur` to 1 (since every run has at least one element), start the loop at 1, keep the same logic for incrementing `cur` when elements match and resetting otherwise, and update `best` after both branches or at the end to ensure the last run is considered. […]
Ausgabe 250 tok Latenz 5.0 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
Kimi K2.5 bestanden · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
Ausgabe 51 tok Latenz 1.6 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
Kimi K2.5 bestanden · 113 words, 0 banned, 1 question
**Announcing Prompt Cache: One Store, Every Provider** Stop rewriting the same prompts for different AI platforms. Our new API gateway feature stores your prompts in a unified cache, making them instantly available across OpenAI, Anthropic, Google, and more. Switch providers without touching your prompt library. Compare outputs side-by-side using identical inputs. Your team maintains one source of truth while gaining the flexibility to route requests wherever performance or pricing demands. Version history tracks every edit. Access controls keep sensitive prompts secure. And with sub-10ms retrieval times, latency won't slow you down. Why maintain separate prompt libraries when one intelligent cache does it all? Prompt Cache is available today for Enterprise and Scale plans.
Ausgabe 141 tok Latenz 3.3 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
Kimi K2.5 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k2.5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k2.5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k2.5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k2.5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Kimi K2.5
- Sein Mixture-of-Experts-Design summiert sich auf 1T Parameter mit 32B aktivierten (384 Experten, acht pro Token geroutet plus einer geteilt), ergänzt den 400M-Parameter-Vision-Encoder MoonViT und unterstützt einen Kontext von 256K.
- Gegenüber Kimi K2 führt es Vision-Language-Verständnis, Codegenerierung aus visuellen Spezifikationen und Agent Swarm ein und geht damit von der Einzelagenten-Ausführung zu koordiniertem, schwarmartigem Betrieb über, mit Thinking- und Instant-Modus; Moonshots Launch-Beitrag beschreibt Schwärme von bis zu 100 Sub-Agenten, die über bis zu 1.500 Tool-Aufrufe hinweg arbeiten.
- Moonshot benennt die Workloads, für die es das gebaut hat: Dokumentenerzeugung und -konvertierung, Erstellung von Folien, Tabellenformeln und -analysen, den Bau von Websites aus visuellen Entwürfen sowie Deep Research mit Berichtssynthese.
- Die Modi sind ein Parameter, keine eigene Modell-ID: Thinking ist standardmäßig aktiviert, und der Instant-Modus ist deaktiviertes Thinking, wobei das Reasoning in reasoning_content zurückkommt und gegen max_tokens gerechnet wird.
- Anders als bei Moonshots späteren Coding-Modellen trägt es Reasoning nicht über Turns hinweg: Erhaltenes Thinking wird hier nicht unterstützt.
- Function Calling, Partial-Mode-Prefills, JSON- und JSON-Schema-Antworten sowie automatisches Prompt-Caching sind alle verfügbar, und Moonshot liefert native INT4-Quantisierung.
- Die Gewichte kommen unter einer Modified-MIT-Lizenz, deren einzige Ergänzung eine Namensnennungspflicht für sehr große kommerzielle Deployments ist.
- Synthorai macht Kimi K2.5 über seine OpenAI-kompatible API-Oberfläche aufrufbar.
FAQ
Lässt sich die Kimi K2.5 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.574/M Input-Tokens deckt allein dieses Guthaben rund 217 Requests mit je ~8K Tokens gegen Kimi K2.5 ab.
Worin ist Kimi K2.5 am besten?
Vision-Language-Verständnis und Code aus visuellen Spezifikationen; Agent Swarm für koordinierten Multi-Agent-Betrieb; 1T-Parameter-MoE unter Modified-MIT-Lizenz. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Kimi K2.5?
Kimi K2.5 kostet auf Synthorai $0.574 pro Million Input-Tokens und $3.011 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.115/M abgerechnet.
Unterstützt Kimi K2.5 Prompt-Caching?
Ja, automatisch: Über Moonshot ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.115/M statt $0.574/M (ungecacht) abgerechnet. Prompt-Caching-Guide →
Wie erhalte ich Zugang zu Kimi K2.5?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="kimi-k2.5", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Ist Kimi K2.5 Open Source?
Ja, die Gewichte sind unter der Modified-MIT-Lizenz (offizielles Repository im Über-Abschnitt verlinkt) veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.