新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Kimi K3

chatコードリーズニングツール呼び出し画像入力プロンプトキャッシュ

Kimi K3 は Moonshot のこれまでで最も高性能なフラッグシップモデルであり、2.8 兆パラメータで、ドキュメントは世界初の 3 兆パラメータ級のオープンソースモデルと呼んでいます。

入力
テキスト 画像 動画 $3/M
出力
テキスト $15/M
キャッシュ読み取り
$0.3/M
コンテキスト
1M
GPT-4o 比
約 40% 割安

ベンチマーク

平均超え他モデル以上51 / 6213 / 62
Kimi K3 測定された他モデル 測定対象の平均 他モデルに上回られていない
Terminal-Bench 2.1
88.3%
OSWorld-Verified
84.8%
Cybergym
80%
Finance Agent v2
54.4%
Harvey Lab-AA
他モデルに上回られていない 94.6%
GPQA Diamond
93.5%
BrowseComp
他モデルに上回られていない 91.2%
Video-MME (w. sub)
他モデルに上回られていない 90%

ベンダー公表: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

価格の位置づけ

同種 65 モデル中の料金の位置

入力$3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
出力$15/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
キャッシュ読み取り$0.3/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

トークン

コンテキストウィンドウ(ベンダー仕様) 1,048,576
最大出力(ベンダー仕様) 1,048,576

プロンプトキャッシュ

キャッシュ方式 自動

思考

ベンダー側パラメータ reasoning_effort (top-level; the thinking object is not accepted)
指定可能な値 low · high · max
デフォルト max リクエストで未指定の場合に適用
無効化の可否 非対応
思考の挙動 K3 は常に推論するため、オフにするのではなく low で下げてください。マルチターンおよびツール呼び出しのターンでは、reasoning_content と tool_calls を含むアシスタントメッセージ全体を返送する必要があり、セッション途中でエフォートを切り替えるとプレフィックスキャッシュのヒットが無効になります。
パラメータ reasoning_effort
minimal · low · medium · high ゲートウェイ側のパラメータ面——上のベンダーマッピングが適用されます

モデル

モダリティ テキスト + 画像 + 動画 → テキスト
パラメータ数 合計 2.8T · アクティブ 104B MoE。Kimi Delta Attention (KDA) と Attention Residuals を採用し、896 エキスパート中 16 がトークンごとにアクティブ
ライセンス Kimi K3 License
  • 思考モードは常時オンです。
  • 推論は無効化できず、エフォートレベル(low / high / max)で下げることしかできません。
  • max_completion_tokens のデフォルトは 131,072 で、上限の 1,048,576 まで引き上げられます。
  • コンテキストキャッシュは自動で、キャッシュ id も TTL も追加パラメータも不要で、直前のリクエストのプロンプトが 256 トークンを超えると有効になります。
  • オープンウェイト(MXFP4 のウェイト / MXFP8 のアクティベーション、量子化を考慮した学習)は Kimi K3 License の下で Hugging Face に公開されています。

出典:Moonshot 公式ドキュメント ↗

1つのプロンプト — ゲートウェイ経由で測定

プロンプト Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. チェック ちょうど 3 文

Kimi K3 パス · 3 sentences

Reasoning models don't just answer questions—they "think" first, generating long internal chains of step-by-step logic before producing a response. Those hidden thinking steps are billed as output tokens (the most expensive kind, typically 3–5x the price of input tokens), and a single query can generate thousands of them even when the visible answer is only a paragraph long. So you're paying for dramatically more compute per request: the bill doubled because the model does far more work behind the scenes, not because usage increased.

出力 755 tok (+637 思考) レイテンシ 20.8 s

指示追従(ちょうど三文 — 数えられる)、読み手に合わせた調整(CFO 向けの語り口)、そして下のトークン計から見える隠れた思考の課金ギャップ。

プロンプト This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. チェック 修正がテストを通る

Kimi K3 パス · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The bug is a fencepost error: `cur` counts *matching adjacent pairs* rather than *items in the run*, because it starts at 0 and only increments when `xs[i] == xs[i - 1]`. A run of length L contains L−1 equal pairs, so every run was undercounted by exactly one. For a single-element list (a run of length 1) the loop never runs and the function returns 0 instead of 1; likewise any run ending at the last index — e.g. the two `2`s in `[1, 2, 2]` — reported 1 instead of 2, making it look like no run existed at all. […]

出力 1837 tok (+1547 思考) レイテンシ 47.2 s

修正が実際に正しいか(実行可能か)、説明の密度、そして範囲の限られたタスクでのトークン効率。

プロンプト Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. チェック 妥当な JSON、スキーマ厳密

Kimi K3 パス · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

出力 924 tok (+863 思考) レイテンシ 25.9 s

スキーマ遵守(フィールドをでっち上げない)、ハルシネーション圧(guidance は明示的に保留されている)、そして構造化出力の経路の違い。

プロンプト Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. チェック 120 語、禁止語 0

Kimi K3 パス · 120 words, 0 banned, 1 question

Meet Prompt Cache, a new API gateway capability that stores prompt responses and serves them across OpenAI, Anthropic, Google, and Azure endpoints. It matches requests by model, prompt hash, tools, temperature, and tenant policy, so repeated work returns fast while sensitive contexts stay isolated. Teams set TTLs, stale rules, encryption scopes, and bypass flags per route. Analytics show hit rate, latency saved, token spend avoided, and drift risk by provider. What changes for developers? Keep one integration, add cache headers, and watch fallback logic respect consent, residency, and audit needs. During rollout, canary keys compare fresh answers with cached copies before promotion. Prompt Cache cuts vendor calls, steadies p95 latency, and gives platform owners controls for cost, quality, and compliance.

出力 1527 tok (+1354 思考) レイテンシ 37.9 s

制約の遵守(語数の上限、禁止語リスト、唯一の疑問文)、文体の指紋、そして長さの制御。

30 秒で Kimi K3 を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Kimi K3 について

  • アーキテクチャはハイブリッド線形アテンション機構である Kimi Delta Attention と Attention Residuals を組み合わせ、Stable LatentMoE フレームワークによって Mixture-of-Experts のスパース性をさらに推し進め、896 個のエキスパートのうち 16 個を活性化します。
  • Moonshot はこれらの変更により全体のスケーリング効率が K2 の約 2.5 倍になったとしています。
  • ネイティブの視覚理解と 1M トークンのコンテキストウィンドウを備え、長期のコーディング、ナレッジワーク、推論を含むフロンティア知能のシナリオを対象とします。
  • 最小限の監督で長いエンジニアリングタスクを継続し、大規模なコードベースにまたがって作業し、ターミナルツールを駆動し、ゲーム開発、フロントエンドエンジニアリング、CAD のワークフローでスクリーンショットと視覚的フィードバックを利用します。
  • ここでは思考は任意ではありません。
  • K3 は常に推論し、唯一の制御はトップレベルの reasoning_effort フィールドで low、high、max のいずれかを取り、既定は max です。
  • そのため、レイテンシに敏感なデプロイでは明示的に下げる必要があります。
  • ほかにもコードで考慮すべき制限がいくつかあります。
  • max_completion_tokens は 1,048,576 の上限に対して既定が 131,072 であること、サンプリングパラメータは固定でリクエストから省くべきであること、マルチターンおよびツール呼び出しのターンではアシスタントメッセージ全体を変更せずに返す必要があること、そして視覚入力は公開画像 URL を受け付けず base64 またはアップロード済みファイルの参照を用いることです。
  • コンテキストキャッシュは自動で、キャッシュ ID も TTL も追加パラメータもなく、直前のリクエストのプロンプトが 256 トークンを超えると有効になり、価格はコンテキスト長による段階分けのないフラットな体系です。
  • 構造化出力、partial モードのプレフィル、動的なツール読み込みに対応し、ウェイトは Kimi K3 License の下で公開されています。
  • Synthorai は Kimi K3 を OpenAI 互換の chat completions エンドポイント経由で呼び出せるようにします。

よくある質問

Kimi K3 API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。入力 $3/M で計算すると、このクレジットだけで Kimi K3 に対して約 41 回の ~8K トークンのリクエストを送れます。

Kimi K3 は何が得意ですか?

3 兆パラメータ級で初のオープンソースモデル、ネイティブの視覚理解と 1M トークンのコンテキストウィンドウ、常に推論し、reasoning_effort の既定は max。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

Kimi K3 の料金はいくらですか?

Synthorai 上の Kimi K3 は入力 100 万トークンあたり $3、出力 100 万トークンあたり $15 です。ベンダー定価のままで、プラットフォーム手数料はありません。キャッシュ済み入力トークンは $0.3/M で課金されます。

Kimi K3 はプロンプトキャッシュに対応していますか?

はい、自動で有効です。Moonshot 経由のプロンプトはコード変更なしでキャッシュされます。キャッシュ済み入力トークンは $0.3/M(未キャッシュは $3/M)で課金されます。 プロンプトキャッシュガイド →

Kimi K3 を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="kimi-k3" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

Kimi K3 はオープンソースですか?

はい。ウェイトは Kimi K3 License(公式リポジトリへのリンクは「このモデルについて」セクション参照) で公開されています。GPU を用意する必要もありません。ここでホストされる版は従量課金で、自前のインフラ運用は不要です。 オープンウェイトモデルの実行について →

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →