Kimi K2.5 è il modello agentico open-source e nativamente multimodale di Moonshot AI, costruito tramite pre-addestramento continuo su circa 15T token misti visivi e testuali a partire da Kimi-K2-Base.
- Input
- testo immagine video $0.574/M
- Output
- testo $3.011/M
- Lettura cache
- $0.115/M
- Contesto
- 262K
- vs GPT-4o
- ~89% più economico
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 256.000 |
|---|
Caching prompt
| Modalità | automatico |
|---|
Ragionamento
| Parametro del fornitore | thinking.type |
|---|---|
| Valori accettati | enabled · disabled |
| Valore predefinito | enabled sulla piattaforma di Moonshot; da notare che Alibaba Model Studio documenta il proprio deployment di questo modello con il thinking disattivato di default applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La traccia viene restituita in reasoning_content, che rientra nel conteggio di max_tokens e viene sempre trasmessa in streaming prima di content; il Preserved Thinking non è supportato, ma il reasoning_content storico va mantenuto nei messaggi, altrimenti il modello perde il contesto di ragionamento. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video → testo |
|---|---|
| Parametri | 1T totali · 32B attivi MoE |
| Licenza | Modified-MIT |
- MoE da 1T con 32B attivi, contesto da 256K, multimodale nativo (encoder MoonViT, input di immagini e video), modalità instant + thinking, Agent Swarm fino a 100 sub-agent
- quantizzazione INT4 nativa
Un solo prompt, misurato attraverso il gateway
Kimi K2.5 superato · 3 sentences
Enabling reasoning causes the model to perform extended internal deliberation, generating substantially more tokens per query than standard responses. Each reasoning chain consumes compute credits equivalent to multiple regular completions, and user query volume remained constant while per-query costs multiplied. The doubling reflects usage of a more expensive capability tier, not an operational error or billing anomaly.
out 67 tok latenza 1.9 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Kimi K2.5 superato · 8/8 cases
The bug has two causes: the loop starts at index 1 and `cur` counts *additional* matching elements rather than the run length itself, so a single element run returns 0 instead of 1, and runs ending at the final element aren't properly captured because `best` is only updated inside the loop when elements match—meaning if the last run is just one element or if `cur` was never updated for the final position, the correct value gets lost. To fix this, initialize `best` and `cur` to 1 (since every run has at least one element), start the loop at 1, keep the same logic for incrementing `cur` when elements match and resetting otherwise, and update `best` after both branches or at the end to ensure the last run is considered. […]
out 250 tok latenza 5.0 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Kimi K2.5 superato · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
out 51 tok latenza 1.6 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Kimi K2.5 superato · 113 words, 0 banned, 1 question
**Announcing Prompt Cache: One Store, Every Provider** Stop rewriting the same prompts for different AI platforms. Our new API gateway feature stores your prompts in a unified cache, making them instantly available across OpenAI, Anthropic, Google, and more. Switch providers without touching your prompt library. Compare outputs side-by-side using identical inputs. Your team maintains one source of truth while gaining the flexibility to route requests wherever performance or pricing demands. Version history tracks every edit. Access controls keep sensitive prompts secure. And with sub-10ms retrieval times, latency won't slow you down. Why maintain separate prompt libraries when one intelligent cache does it all? Prompt Cache is available today for Enterprise and Scale plans.
out 141 tok latenza 3.3 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Kimi K2.5 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k2.5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k2.5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k2.5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k2.5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Kimi K2.5
- Il suo design Mixture-of-Experts totalizza 1T di parametri con 32B attivati (384 esperti, otto instradati per token più uno condiviso), aggiunge l'encoder visivo MoonViT da 400M di parametri e supporta un contesto da 256K.
- Rispetto a Kimi K2 introduce la comprensione visione-linguaggio, la generazione di codice da specifiche visive e Agent Swarm, passando dall'esecuzione a singolo agent a un funzionamento coordinato in stile sciame, con modalità sia thinking sia instant; il post di lancio di Moonshot descrive sciami di un massimo di 100 sub-agent al lavoro attraverso fino a 1.500 chiamate agli strumenti.
- Moonshot nomina i carichi di lavoro per cui lo ha costruito: generazione e conversione di documenti, creazione di slide, formule e analisi su fogli di calcolo, costruzione di siti web a partire da design visivi e ricerca approfondita con sintesi di report.
- Le modalità sono un parametro, non un id di modello separato: il thinking è attivo per impostazione predefinita e la modalità instant è il thinking disattivato, con il ragionamento restituito in reasoning_content e conteggiato su max_tokens.
- A differenza dei successivi modelli di coding di Moonshot, non porta il ragionamento da un turno all'altro: qui il thinking preservato non è supportato.
- Function calling, prefill in partial mode, risposte JSON e con schema JSON e caching automatico dei prompt sono tutti disponibili, e Moonshot distribuisce una quantizzazione INT4 nativa.
- I pesi sono rilasciati sotto una licenza Modified MIT la cui unica aggiunta è un requisito di attribuzione per i deployment commerciali molto grandi.
- Synthorai rende Kimi K2.5 richiamabile tramite la sua superficie API compatibile OpenAI.
FAQ
L'API di Kimi K2.5 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.574/M token in input, quel credito da solo copre circa 217 richieste da ~8K token verso Kimi K2.5.
In cosa eccelle Kimi K2.5?
Comprensione visione-linguaggio e codice da specifiche visive; agent swarm per un'operazione multi-agente coordinata; MoE da 1T di parametri sotto licenza Modified MIT. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Kimi K2.5?
Su Synthorai, Kimi K2.5 costa $0.574 per milione di token in input e $3.011 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.115/M.
Kimi K2.5 supporta il caching dei prompt?
Sì, in automatico: i prompt serviti da Moonshot vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.115/M contro $0.574/M senza cache. Guida al caching dei prompt →
Come ottengo l'accesso a Kimi K2.5?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="kimi-k2.5" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Kimi K2.5 è open source?
Sì: i pesi sono pubblicati sotto Modified-MIT License (repository ufficiale linkato nella sezione «Informazioni»). Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.