Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Kimi K3

chatCodeRaisonnementAppel d'outilsVisionMise en cache des prompts

Kimi K3 est le modèle phare le plus performant de Moonshot à ce jour et, avec 2 800 milliards de paramètres, ce que sa documentation appelle le premier modèle open source au monde de la classe des trois mille milliards de paramètres.

Entrée
texte image vidéo $3/M
Sortie
texte $15/M
Lecture de cache
$0.3/M
Contexte
1M
vs GPT-4o
~40% moins cher

Benchmarks

Au-dessus de la moyenneAucun meilleur51 / 6213 / 62
Kimi K3 autres modèles mesurés moyenne des modèles comparés aucun autre modèle n'a fait mieux
Terminal-Bench 2.1
88.3%
OSWorld-Verified
84.8%
Cybergym
80%
Finance Agent v2
54.4%
Harvey Lab-AA
aucun autre modèle n'a fait mieux 94.6%
GPQA Diamond
93.5%
BrowseComp
aucun autre modèle n'a fait mieux 91.2%
Video-MME (w. sub)
aucun autre modèle n'a fait mieux 90%

Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Le prix en contexte

Position du prix parmi 65 modèles comparables

Entrée$3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Sortie$15/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lecture en cache$0.3/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 1 048 576
Sortie max (spéc. fournisseur) 1 048 576

Mise en cache

Mode automatique

Raisonnement

Paramètre du fournisseur reasoning_effort (top-level; the thinking object is not accepted)
Valeurs acceptées low · high · max
Valeur par défaut max appliquée si la requête ne précise rien
Désactivable Non
Comportement du raisonnement K3 raisonne toujours: réduisez donc avec low plutôt que de désactiver ; le message assistant complet, y compris reasoning_content et tool_calls, doit être renvoyé sur les tours multi-tours et d'appel d'outils, et changer d'effort en cours de session invalide les hits du cache de préfixe.
Paramètre reasoning_effort
Valeurs minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique

Modèle

Modalités texte + image + vidéo → texte
Paramètres 2.8T au total · 104B actifs MoE: Kimi Delta Attention (KDA) et Attention Residuals, 16 experts actifs sur 896 par token
Licence Kimi K3 License

Le mode réflexion est toujours actif: le raisonnement ne peut pas être désactivé, seulement réduit via les niveaux d'effort (low / high / max). max_completion_tokens vaut 131 072 par défaut et peut être porté à 1 048 576. La mise en cache du contexte est automatique, sans id de cache, TTL ni paramètre supplémentaire, et s'enclenche dès que le prompt de la requête précédente dépasse 256 tokens. Poids ouverts (poids MXFP4 / activations MXFP8, entraînement tenant compte de la quantification) publiés sur Hugging Face sous la licence Kimi K3.

selon docs officielles Moonshot ↗

Un prompt, mesuré via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VÉRIFIER exactement 3 phrases

Kimi K3 réussi · 3 sentences

Reasoning models don't just answer questions—they "think" first, generating long internal chains of step-by-step logic before producing a response. Those hidden thinking steps are billed as output tokens (the most expensive kind, typically 3–5x the price of input tokens), and a single query can generate thousands of them even when the visible answer is only a paragraph long. So you're paying for dramatically more compute per request: the bill doubled because the model does far more work behind the scenes, not because usage increased.

sortie 755 tok (+637 réflexion) latence 20.8 s

Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VÉRIFIER le correctif passe les tests

Kimi K3 réussi · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The bug is a fencepost error: `cur` counts *matching adjacent pairs* rather than *items in the run*, because it starts at 0 and only increments when `xs[i] == xs[i - 1]`. A run of length L contains L−1 equal pairs, so every run was undercounted by exactly one. For a single-element list (a run of length 1) the loop never runs and the function returns 0 instead of 1; likewise any run ending at the last index — e.g. the two `2`s in `[1, 2, 2]` — reported 1 instead of 2, making it look like no run existed at all. […]

sortie 1837 tok (+1547 réflexion) latence 47.2 s

Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VÉRIFIER JSON valide, schéma exact

Kimi K3 réussi · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

sortie 924 tok (+863 réflexion) latence 25.9 s

Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VÉRIFIER 120 mots, 0 mot interdit

Kimi K3 réussi · 120 words, 0 banned, 1 question

Meet Prompt Cache, a new API gateway capability that stores prompt responses and serves them across OpenAI, Anthropic, Google, and Azure endpoints. It matches requests by model, prompt hash, tools, temperature, and tenant policy, so repeated work returns fast while sensitive contexts stay isolated. Teams set TTLs, stale rules, encryption scopes, and bypass flags per route. Analytics show hit rate, latency saved, token spend avoided, and drift risk by provider. What changes for developers? Keep one integration, add cache headers, and watch fallback logic respect consent, residency, and audit needs. During rollout, canary keys compare fresh answers with cached copies before promotion. Prompt Cache cuts vendor calls, steadies p95 latency, and gives platform owners controls for cost, quality, and compliance.

sortie 1527 tok (+1354 réflexion) latence 37.9 s

Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.

Utilisez Kimi K3 en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

À propos de Kimi K3

  • L'architecture associe Kimi Delta Attention, un mécanisme d'attention linéaire hybride, à des Attention Residuals, et pousse plus loin la parcimonie Mixture-of-Experts via le framework Stable LatentMoE, en activant 16 experts sur 896 ; Moonshot crédite ces changements d'environ 2,5 fois l'efficacité de mise à l'échelle globale de K2.
  • Il embarque la compréhension visuelle native et une fenêtre de contexte de 1M de tokens, et vise les scénarios d'intelligence de frontière, dont le codage à long horizon, le travail de connaissance et le raisonnement : soutenir de longues tâches d'ingénierie avec une supervision minimale, travailler sur de grandes bases de code, piloter des outils en terminal, et exploiter des captures d'écran et des retours visuels dans le développement de jeux, l'ingénierie front-end et les workflows de CAO.
  • La réflexion n'est pas optionnelle ici.
  • K3 raisonne toujours, et le seul contrôle est le champ de premier niveau reasoning_effort à low, high ou max, dont la valeur par défaut est max : un déploiement sensible à la latence doit donc l'abaisser explicitement.
  • Plusieurs autres limites méritent d'être prises en compte dans le code : max_completion_tokens vaut 131 072 par défaut contre un plafond de 1 048 576, les paramètres d'échantillonnage sont figés et devraient être omis des requêtes, le message assistant complet doit être renvoyé inchangé sur les tours multi-tours et d'appel d'outils, et l'entrée visuelle refuse les URL d'images publiques au profit du base64 ou d'une référence de fichier téléversé.
  • La mise en cache du contexte est automatique, sans identifiant de cache, sans TTL ni paramètre supplémentaire, et s'enclenche dès que le prompt de la requête précédente dépasse 256 tokens ; la tarification est plate, sans palier selon la longueur de contexte.
  • La sortie structurée, les préremplissages en mode partiel et le chargement dynamique d'outils sont pris en charge, et les poids sont publiés sous la licence Kimi K3.
  • Synthorai rend Kimi K3 appelable via son endpoint de chat completions compatible OpenAI.

FAQ

Peut-on essayer l'API Kimi K3 gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $3/M de tokens en entrée, ce crédit couvre à lui seul environ 41 requêtes de ~8K tokens sur Kimi K3.

Quels sont les points forts de Kimi K3 ?

Premier modèle open source de la classe des trois mille milliards de paramètres ; compréhension visuelle native avec une fenêtre de contexte de 1M de tokens ; raisonne toujours, reasoning_effort valant max par défaut. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Kimi K3 ?

Sur Synthorai, Kimi K3 coûte $3 par million de tokens en entrée et $15 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.3/M.

Kimi K3 prend-il en charge la mise en cache des prompts ?

Oui, automatiquement : les prompts servis par Moonshot sont mis en cache sans modification de code. Les tokens d'entrée en cache sont facturés $0.3/M contre $3/M hors cache. Guide de mise en cache des prompts →

Comment obtenir l'accès à Kimi K3 ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="kimi-k3", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Kimi K3 est-il open source ?

Oui : les poids sont publiés sous Kimi K3 License (dépôt officiel lié dans la section À propos). Ou passez-vous des GPU : la version hébergée ici est au paiement à l'usage, sans infrastructure à exploiter. Exécuter des modèles à poids ouverts →

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →