Kimi K3 è il modello di punta più capace di Moonshot fino ad oggi e, con 2.8T di parametri, quello che la sua documentazione definisce il primo modello open-source al mondo nella classe dei 3T di parametri.
- Input
- testo immagine video $3/M
- Output
- testo $15/M
- Lettura cache
- $0.3/M
- Contesto
- 1M
- vs GPT-4o
- ~40% più economico
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 65 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 1.048.576 |
Caching prompt
| Modalità | automatico |
|---|
Ragionamento
| Parametro del fornitore | reasoning_effort (top-level; the thinking object is not accepted) |
|---|---|
| Valori accettati | low · high · max |
| Valore predefinito | max applicato se la richiesta non specifica nulla |
| Disattivabile | No |
| Comportamento del ragionamento | K3 ragiona sempre, quindi riducilo con low invece di disattivarlo; il messaggio completo dell'assistente, incluso reasoning_content e tool_calls, deve essere restituito nei turni multi-turno e con chiamate a strumenti, e cambiare effort a metà sessione invalida gli hit della cache di prefisso. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video → testo |
|---|---|
| Parametri | 2.8T totali · 104B attivi MoE con Kimi Delta Attention (KDA) + Attention Residuals, 16 esperti su 896 attivi per token |
| Licenza | Kimi K3 License |
La modalità thinking è sempre attiva: il ragionamento non può essere disattivato, solo ridotto tramite i livelli di effort (low / high / max). max_completion_tokens vale 131.072 di default e può essere portato fino a 1.048.576. Il caching del contesto è automatico, senza id di cache, TTL o parametri aggiuntivi, e si attiva quando il prompt della richiesta precedente supera i 256 token. Pesi aperti (pesi MXFP4 / attivazioni MXFP8, quantization-aware training) pubblicati su Hugging Face sotto la Kimi K3 License.
Un solo prompt, misurato attraverso il gateway
Kimi K3 superato · 3 sentences
Reasoning models don't just answer questions—they "think" first, generating long internal chains of step-by-step logic before producing a response. Those hidden thinking steps are billed as output tokens (the most expensive kind, typically 3–5x the price of input tokens), and a single query can generate thousands of them even when the visible answer is only a paragraph long. So you're paying for dramatically more compute per request: the bill doubled because the model does far more work behind the scenes, not because usage increased.
out 755 tok (+637 ragionamento) latenza 20.8 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Kimi K3 superato · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The bug is a fencepost error: `cur` counts *matching adjacent pairs* rather than *items in the run*, because it starts at 0 and only increments when `xs[i] == xs[i - 1]`. A run of length L contains L−1 equal pairs, so every run was undercounted by exactly one. For a single-element list (a run of length 1) the loop never runs and the function returns 0 instead of 1; likewise any run ending at the last index — e.g. the two `2`s in `[1, 2, 2]` — reported 1 instead of 2, making it look like no run existed at all. […]
out 1837 tok (+1547 ragionamento) latenza 47.2 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Kimi K3 superato · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
out 924 tok (+863 ragionamento) latenza 25.9 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Kimi K3 superato · 120 words, 0 banned, 1 question
Meet Prompt Cache, a new API gateway capability that stores prompt responses and serves them across OpenAI, Anthropic, Google, and Azure endpoints. It matches requests by model, prompt hash, tools, temperature, and tenant policy, so repeated work returns fast while sensitive contexts stay isolated. Teams set TTLs, stale rules, encryption scopes, and bypass flags per route. Analytics show hit rate, latency saved, token spend avoided, and drift risk by provider. What changes for developers? Keep one integration, add cache headers, and watch fallback logic respect consent, residency, and audit needs. During rollout, canary keys compare fresh answers with cached copies before promotion. Prompt Cache cuts vendor calls, steadies p95 latency, and gives platform owners controls for cost, quality, and compliance.
out 1527 tok (+1354 ragionamento) latenza 37.9 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Kimi K3 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k3",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k3",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k3")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Kimi K3
- L'architettura abbina Kimi Delta Attention, un meccanismo di attenzione lineare ibrida, ad Attention Residuals, e spinge oltre la sparsità Mixture-of-Experts tramite il framework Stable LatentMoE, attivando 16 esperti su 896; Moonshot attribuisce a queste modifiche circa 2,5 volte l'efficienza di scaling complessiva di K2.
- Porta comprensione visiva nativa e una finestra di contesto da 1M di token, ed è rivolto a scenari di intelligenza di frontiera tra cui coding a lungo orizzonte, lavoro di conoscenza e ragionamento: sostenere lunghi compiti di ingegneria con supervisione minima, lavorare su codebase estese, pilotare strumenti da terminale e usare screenshot e feedback visivo nello sviluppo di giochi, nell'ingegneria frontend e nei flussi di lavoro CAD.
- Qui il thinking non è opzionale.
- K3 ragiona sempre, e l'unico controllo è il campo di primo livello reasoning_effort a low, high o max, il cui valore predefinito è max, quindi un deployment sensibile alla latenza deve abbassarlo esplicitamente.
- Vale la pena tenere conto nel codice di altri limiti: max_completion_tokens ha un valore predefinito di 131.072 contro un tetto di 1.048.576, i parametri di campionamento sono fissi e vanno omessi dalle richieste, il messaggio assistant completo deve essere restituito invariato nei turni multi-turno e di tool calling, e l'input di vision rifiuta gli URL pubblici di immagini a favore di base64 o del riferimento a un file caricato.
- Il caching del contesto è automatico, senza cache id, TTL o parametri aggiuntivi, e si attiva quando il prompt della richiesta precedente supera i 256 token, e il prezzo è piatto senza scaglioni per lunghezza di contesto.
- Output strutturato, prefill in partial mode e caricamento dinamico degli strumenti sono supportati, e i pesi sono pubblicati sotto la Kimi K3 License.
- Synthorai rende Kimi K3 richiamabile tramite il suo endpoint chat completions compatibile OpenAI.
FAQ
L'API di Kimi K3 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $3/M token in input, quel credito da solo copre circa 41 richieste da ~8K token verso Kimi K3.
In cosa eccelle Kimi K3?
Primo modello open-source nella classe dei 3T di parametri; comprensione visiva nativa con finestra di contesto da 1M di token; ragionamento sempre attivo, con reasoning_effort predefinito a max. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Kimi K3?
Su Synthorai, Kimi K3 costa $3 per milione di token in input e $15 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.3/M.
Kimi K3 supporta il caching dei prompt?
Sì, in automatico: i prompt serviti da Moonshot vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.3/M contro $3/M senza cache. Guida al caching dei prompt →
Come ottengo l'accesso a Kimi K3?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="kimi-k3" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Kimi K3 è open source?
Sì: i pesi sono pubblicati sotto Kimi K3 License (repository ufficiale linkato nella sezione «Informazioni»). Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.