Kimi K3 API 實測價格:關閉「永遠開啟」的推理
目錄
Kimi K3 的文件聲稱無法關閉思考模式,而且 reasoning_effort 只接受 "max"。但根據我們的實測,API 其實也接受 "none",而且確實有效:同一個極簡問題,使用預設推理時要花 $0.00179,關閉後只要 $0.000285,相差 6.3 倍。K3 於 2026-07-16 上線,輸入每百萬個 token 要 $3,輸出則要 $15。這是中國實驗室至今推出過最昂貴的牌價,與 Claude Sonnet 5 相同。輸出價格這麼高時,模型預設消耗的推理 token 才是帳單主體,因此有必要弄清楚這個文件未記載的關閉方式。
TL;DR
- 在預設設定下,Kimi K3 有 69-93% 的輸出 token 花在推理上;一篇 120 字的段落計費 2,289 個輸出 token,成本為 $0.0346。
- 儘管文件聲稱不支援,API 仍接受
reasoning_effort: "none",並讓簡單查詢的成本降至六分之一;但多步驟算術題的正確率也從 3/3 降到 0/6。 - Kimi K3 的 prompt cache 約從 256 個 prefix token 開始命中,以 256 個 token 為區塊,讀取費率為 $0.30/M。
- 中文是 K3 最便宜的 CJK 語言:每 100 個字的淨 token 數為 52,低於 GLM-5.2 與 DeepSeek 的 58。
以下資料皆於 2026-07-20 使用 kimi-k3 實測。該模型已在 Synthorai 閘道上線,價格與 Moonshot 牌價相同。重複測試的 prompt 都加入了 salt,以避開回應快取;行為相關結論也透過另一條獨立請求路徑交叉驗證。每個數字都有原始 usage 紀錄可供核對。
Kimi K3 預設每次回答要花多少錢?
我們測試的所有任務類型,帳單都以推理成本為主,連完全不需要推理的任務也不例外。各類任務使用預設設定時,每次回答的結果如下:
| 任務 | 輸出 token | 推理占比 | 每次回答成本 |
|---|---|---|---|
| 極簡算術(17×23) | 99 | 84% | $0.0018 |
| 單句事實問答 | 80 | 79% | $0.0015 |
| 小型程式函式 | 119 | 69% | $0.0009 |
| 多步驟文字題 | 139 | 87% | $0.0025 |
| 120 字段落 | 2,289 | 93% | $0.0346 |

這張圖的重點在於模型之間的差異:GPT-5.6 會動態調整推理強度,極簡問題與事實問答不使用任何思考 token,數學與寫作任務則占 65-70%;Claude Sonnet 5 預設關閉思考;GLM-5.2 的相對推理占比甚至高於 K3。但 GLM 的輸出價格為 $4.40/M,K3 則是 $15/M。因此,同一道 17×23 的題目,在 GLM-5.2 上計費 $0.00078、GPT-5.6 為 $0.00027、Sonnet 5 為 $0.0001,K3 則要 $0.0018。輸出越長,差距越大:同一篇 120 字段落,在 K3 上花費 $0.0346,GLM-5.2 為 $0.0186、GPT-5.6 為 $0.0072、Sonnet 5 為 $0.0024。這組測試中最普通的任務,成本就相差 15 倍。K3 的推理占比與其他中國推理模型相近,但實際金額並不相近。
預設模式還有兩項成本要納入預算。第一,思考模式會在每次請求中加入約 67 個 token 的隱藏前置內容。同一個單字訊息,開啟推理時計費 86 個 prompt token,關閉時則是 19 個。這就是早期測試者發現的「隱藏 system prompt」,關閉推理後也會一併消失。第二,K3 目前速度偏慢。考慮上線首週的服務狀況,我們的極簡問題在開啟推理時,端到端約需 19-24 秒;關閉後則為 3-8 秒。除了費用,也要把延遲納入預算。
可以關閉 Kimi K3 的推理嗎?
可以,儘管文件不是這麼寫。官方 API 參考文件 表示 K3「永遠啟用思考」,且 reasoning_effort 只接受 "max"。實際上,endpoint 接受 "none"、"low"、"medium" 與 "high",不會回傳錯誤,而且確實會套用。我們也透過另一條獨立請求路徑確認了相同行為。在多步驟文字題上,這個調整確實有效,但粒度很粗:
reasoning_effort | 推理 token(平均) | 正確率 |
|---|---|---|
none | 0 | 0/6 |
low | 78 | 3/3 |
medium | 94 | 3/3 |
high | 105 | 3/3 |
max / 預設 | 100-121 | 3/3 |
有兩點很明顯。首先,中間設定差異不大:在這項任務上,low 到 max 的 token 數接近,正確率也完全相同,所以真正有意義的是開或關。其次,none 會讓能力驟降。要求 K3 簡短回答多步驟算術題時,6 次全部答錯,而且答案各不相同,並非同一種系統性錯誤。如果沒有強制要求簡短格式,模型有時會忽略精簡指示,直接在可見答案中寫出計算步驟。結果雖然正確,但 token 只是從推理欄位移到文字欄位,並未消失。
延遲的變化沒有 token 數顯示的那麼大。我們以各種 effort 設定串流處理同一道題目,首位元組時間落在 6-24 秒,各設定的區間高度重疊。即使是完全不用思考的 none,仍要等待 12-13 秒。以這種任務規模來看,首個 token 的等待時間主要受服務端影響。這個調整真正改變的是首位元組與第一個答案 token 之間的間隔,也就是使用者必須等待的思考階段。
實務上的結論很直接:對檢索、格式轉換或單步驟任務而言,none 確實能降低成本;只要任務需要中間步驟,它就可能造成嚴重問題。目前沒有任何文件保證這個參數會持續可用。請把它視為實測行為,在自己的 usage 欄位中驗證,並預期文件更新後,它可能被正式納入或移除。
Agent 工作負載應該在什麼情況下保留推理?
我們用 K3 跑了 5 種 agent 型情境,分別測試預設設定與 reasoning_effort: "none"。兩種設定使用完全相同的簡單任務,而且全部通過:
| 情境 | 思考占比(預設) | 使用 none 的成本 | 使用 none 的 TTFT |
|---|---|---|---|
| 工具呼叫迴圈 | 8% | −10% | −35% |
| RAG 問答 | 71% | −37% | −53% |
| 結構化工具操作 | 29% | −16% | −31% |
| 批次擷取 | 80% | −15% | −11% |
| 長對話(15 輪) | 34% | −13% | −25% |
第一列出乎意料:K3 在工具呼叫迴圈中,即使使用預設設定也幾乎不思考,推理占比只有 8%,因此沒有多少節省空間。模型會把工具選擇當成直覺反應,而不是需要推敲的工作。真正能省下成本的,是思考占比高但流程機械化的任務,例如 RAG 查詢與批次擷取。這類工作最不該負擔固定且永遠開啟的推理成本。至於確實需要多步驟規劃的 agent,前一節的正確率斷崖仍然適用;請保留推理並支付相應的 token 成本。
儘管單次呼叫的波動很大,規模放大後,延遲差異確實存在。這些情境在預設設定下要 10-19 秒才出現第一個 token,使用 none 則縮短為 8-13 秒;有實質內容的輸出,生成速度中位數為每秒 35 個 token。即使把上線首週的服務狀況納入考量,這組數字目前仍比較適合非同步與批次工作,而非對話式用途。
把推理內容傳回去,會再次按輸入計費嗎?
會,而且逐 token 計費。Kimi 的文件要求在訊息歷史中原封不動保留每個 assistant 輪次的 reasoning_content。我們實測了這項要求的成本:第二輪若連同第一輪的 chain of thought 一起送出,會計費 599 個 prompt token;相同請求若不附上該內容,則是 198 個。兩者相差 401 個 token,幾乎完全吻合第一輪的 402 個推理 token。也就是說,保留的思考內容會在後續每次請求中,以完整的 $3/M 輸入費率重新計費。對話越長,每一輪都會再次支付先前累積的推理內容。
但刪掉它不一定比較便宜。缺少先前的 chain of thought 時,K3 會從頭重新推理後續問題,第二輪的推理 token 增加 31%,從 343 升至 449。輸入價格是 $3/M,輸出則為 $15/M。在我們的測試中,保留 CoT 的總成本反而較低,因此文件的建議不只對品質有利,成本上也成立。真正有效的節省方式,是下一節提到的 prompt cache。保留的歷史紀錄是穩定的 prefix,而穩定 prefix 暖機後就不再以原價計費。
Kimi K3 會快取 prompt 嗎?最低需要多少 token?
K3 的 prompt cache 會自動啟用,而且門檻很低。約有 256 個共用 prefix token 時就會開始命中,並以 256 個 token 為區塊增加。一個 303-token 的 prompt 會快取 256 個 token;153-token 的 prompt 即使多次重試也從未命中。快取輸入的價格為 $0.30/M,相較於新輸入的 $3/M,固定折扣 90%。我們發出的所有呼叫都沒有額外的快取寫入費。首次命中前需要 2 到 5 次相同呼叫來暖機,因此單次重試無法證明快取是否可用;應該連續測量數次。
相比之下,這個門檻只有 OpenAI 文件所列 1,024-token 下限的四分之一,但區塊大小也比我們在其他服務測得的 64-token 粒度更粗。快取生命週期採 best-effort,而不是固定 TTL。我們的測試中,快取項目閒置 4 分鐘與 15 分鐘後仍然有效,但有一次閒置 8 分鐘卻未命中。因此應將到期視為受負載影響的淘汰行為,並在每次呼叫中確認快取 token 的拆分。另一項需要計算的價格特性是:價目表對 1M-token context window 採固定費率,沒有長 context 分級。一個用滿的 context window,每次呼叫的新輸入成本為 $3.00;prefix 暖機後則降至 $0.30。大型 context 工作負載能否成立,取決於快取的程度遠高於牌價。如果流量會重複使用數百個 token 的 system prompt,K3 的快取早在多數供應商尚未達到啟用門檻時就會生效。相關機制與如何從 usage 驗證命中,可參考我們的 prompt 快取指南與快取最低門檻實測。
Kimi K3 的中文真的比較貴嗎?
不會。相較於同類模型,K3 的 tokenizer 處理中文最有效率。這也回答了上線首週反覆出現的疑問。以下是語意一致的段落,在扣除封裝開銷後,每 100 個字元的淨 token 數:
| 模型 | en | zh | ja | ko | hi | Python |
|---|---|---|---|---|---|---|
| kimi-k3 | 19.7 | 51.9 | 87.5 | 83.2 | 62.8 | 26.5 |
| glm-5.2 | 19.7 | 58.4 | 75.7 | 76.9 | 91.3 | 25.6 |
| deepseek-v4-flash | 19.7 | 58.4 | 70.6 | 69.2 | 60.7 | 26.7 |
| claude-sonnet-5 | 32.3 | 114.3 | 94.1 | 106.3 | 70.9 | 41.1 |
K3 處理每 100 個中文字需要 52 個 token,比 GLM-5.2 與 DeepSeek 少 11%,也不到 Sonnet 5 的一半。K3 表現較弱的是日文,token 用量比其他開放權重模型高 16-24%。我們也確認了同系列模型使用的 tokenizer 並未改變:K3、K2.7-code 與 K2.5 在全部 23 組對齊樣本中,都產生完全相同的 token 數。因此,為 K2 制定的各語言預算可直接沿用。tokenizer 密度與 token 單價如何共同影響 9 種語言的成本,請參考我們的各語言最便宜 LLM 實測。
常見問題
Kimi K3 的開放權重何時發布?
Moonshot 承諾會在 2026 年 7 月 27 日前,以 Modified MIT 授權完整釋出權重。截至本文發布時,K3 仍只能透過 API 使用。「史上最大的開放權重模型」目前是一項承諾,還不是可用的下載連結。這些權重未來加入開放權重生態系後,其快取行為可參考開放權重 LLM 的 prompt 快取整理。
Kimi K3 相較於 K2 系列,實際新增了什麼?
從帳單來看,我們實測到 3 項差異:價格、永遠開啟的思考,以及沒有其他變化。K3 的價格為 $3/$15,K2.7-code 則是 $0.95/$4,漲幅為 3.2-3.75 倍。K2.5 完全不進行推理,K2.7-code 則提供開關。K3、K2.7-code 與 K2.5 的 tokenizer,在我們全部 23 組對齊樣本中逐位元組完全相同,因此 K2 時期制定的 token 預算可直接沿用。規格方面,根據 Moonshot 的說法:新模型採用 2.8T 參數的 MoE 架構,包含 896 個 expert,每個 token 啟用 16 個,並搭配 Kimi Delta Attention;context window 從 K2.7-code 的 256K 提升到 1M token,且原生支援圖片輸入。我們實測的是計費宣稱,不是架構宣稱。
Kimi K3 支援結構化輸出嗎?
支援。我們的測試中,使用 json_schema 的 response_format 會回傳有效且符合 schema 的物件。但底層仍會進行推理:該次擷取呼叫總共用了 97 個輸出 token,其中 66 個是推理 token。因此,受 schema 約束的呼叫與其他任務一樣會支付思考成本,除非同時設定 reasoning_effort: "none"。
關閉推理會改變可見內容嗎?
會。使用預設設定時,K3 會在 reasoning_content 中回傳完整的 chain of thought,而且文件建議在多輪歷史中原封不動傳回。使用 reasoning_effort: "none" 後,這個欄位會完全消失,約 67-token 的思考前置內容也不再計入 prompt 帳單。
於 2026-07-20 使用 kimi-k3 實測,採上線首週牌價(輸入 $3/M、快取 $0.30/M、輸出 $15/M)。重複 prompt 均加入 salt,以避開回應層級快取;正確率統計採用具有單一可驗證答案的任務;行為相關結論也已透過另一條獨立請求路徑重現。隨著版本逐漸成熟,價格與行為都可能改變。採用本文任何數字前,請先用自己的 usage 紀錄驗證。