新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
Kimi K3 API 實測價格:關閉「永遠開啟」的推理

Kimi K3 API 實測價格:關閉「永遠開啟」的推理

目錄
  1. Kimi K3 預設每次回答要花多少錢?
  2. 可以關閉 Kimi K3 的推理嗎?
  3. Agent 工作負載應該在什麼情況下保留推理?
  4. 把推理內容傳回去,會再次按輸入計費嗎?
  5. Kimi K3 會快取 prompt 嗎?最低需要多少 token?
  6. Kimi K3 的中文真的比較貴嗎?
  7. 常見問題

Kimi K3 的文件聲稱無法關閉思考模式,而且 reasoning_effort 只接受 "max"。但根據我們的實測,API 其實也接受 "none",而且確實有效:同一個極簡問題,使用預設推理時要花 $0.00179,關閉後只要 $0.000285,相差 6.3 倍。K3 於 2026-07-16 上線,輸入每百萬個 token 要 $3,輸出則要 $15。這是中國實驗室至今推出過最昂貴的牌價,與 Claude Sonnet 5 相同。輸出價格這麼高時,模型預設消耗的推理 token 才是帳單主體,因此有必要弄清楚這個文件未記載的關閉方式。

TL;DR

  • 在預設設定下,Kimi K3 有 69-93% 的輸出 token 花在推理上;一篇 120 字的段落計費 2,289 個輸出 token,成本為 $0.0346。
  • 儘管文件聲稱不支援,API 仍接受 reasoning_effort: "none",並讓簡單查詢的成本降至六分之一;但多步驟算術題的正確率也從 3/3 降到 0/6。
  • Kimi K3 的 prompt cache 約從 256 個 prefix token 開始命中,以 256 個 token 為區塊,讀取費率為 $0.30/M。
  • 中文是 K3 最便宜的 CJK 語言:每 100 個字的淨 token 數為 52,低於 GLM-5.2 與 DeepSeek 的 58。

以下資料皆於 2026-07-20 使用 kimi-k3 實測。該模型已在 Synthorai 閘道上線,價格與 Moonshot 牌價相同。重複測試的 prompt 都加入了 salt,以避開回應快取;行為相關結論也透過另一條獨立請求路徑交叉驗證。每個數字都有原始 usage 紀錄可供核對。

Kimi K3 預設每次回答要花多少錢?

我們測試的所有任務類型,帳單都以推理成本為主,連完全不需要推理的任務也不例外。各類任務使用預設設定時,每次回答的結果如下:

任務輸出 token推理占比每次回答成本
極簡算術(17×23)9984%$0.0018
單句事實問答8079%$0.0015
小型程式函式11969%$0.0009
多步驟文字題13987%$0.0025
120 字段落2,28993%$0.0346

各任務的輸出 token 推理占比:kimi-k3 全面落在 69-93%,glm-5.2 為 95-99%,gpt-5.6 在簡單任務上為零、困難任務上為 65-70%,claude-sonnet-5 預設為零。

這張圖的重點在於模型之間的差異:GPT-5.6 會動態調整推理強度,極簡問題與事實問答不使用任何思考 token,數學與寫作任務則占 65-70%;Claude Sonnet 5 預設關閉思考;GLM-5.2 的相對推理占比甚至高於 K3。但 GLM 的輸出價格為 $4.40/M,K3 則是 $15/M。因此,同一道 17×23 的題目,在 GLM-5.2 上計費 $0.00078、GPT-5.6 為 $0.00027、Sonnet 5 為 $0.0001,K3 則要 $0.0018。輸出越長,差距越大:同一篇 120 字段落,在 K3 上花費 $0.0346,GLM-5.2 為 $0.0186、GPT-5.6 為 $0.0072、Sonnet 5 為 $0.0024。這組測試中最普通的任務,成本就相差 15 倍。K3 的推理占比與其他中國推理模型相近,但實際金額並不相近。

預設模式還有兩項成本要納入預算。第一,思考模式會在每次請求中加入約 67 個 token 的隱藏前置內容。同一個單字訊息,開啟推理時計費 86 個 prompt token,關閉時則是 19 個。這就是早期測試者發現的「隱藏 system prompt」,關閉推理後也會一併消失。第二,K3 目前速度偏慢。考慮上線首週的服務狀況,我們的極簡問題在開啟推理時,端到端約需 19-24 秒;關閉後則為 3-8 秒。除了費用,也要把延遲納入預算。

可以關閉 Kimi K3 的推理嗎?

可以,儘管文件不是這麼寫。官方 API 參考文件 表示 K3「永遠啟用思考」,且 reasoning_effort 只接受 "max"。實際上,endpoint 接受 "none""low""medium""high",不會回傳錯誤,而且確實會套用。我們也透過另一條獨立請求路徑確認了相同行為。在多步驟文字題上,這個調整確實有效,但粒度很粗:

reasoning_effort推理 token(平均)正確率
none00/6
low783/3
medium943/3
high1053/3
max / 預設100-1213/3

有兩點很明顯。首先,中間設定差異不大:在這項任務上,lowmax 的 token 數接近,正確率也完全相同,所以真正有意義的是開或關。其次,none 會讓能力驟降。要求 K3 簡短回答多步驟算術題時,6 次全部答錯,而且答案各不相同,並非同一種系統性錯誤。如果沒有強制要求簡短格式,模型有時會忽略精簡指示,直接在可見答案中寫出計算步驟。結果雖然正確,但 token 只是從推理欄位移到文字欄位,並未消失。

延遲的變化沒有 token 數顯示的那麼大。我們以各種 effort 設定串流處理同一道題目,首位元組時間落在 6-24 秒,各設定的區間高度重疊。即使是完全不用思考的 none,仍要等待 12-13 秒。以這種任務規模來看,首個 token 的等待時間主要受服務端影響。這個調整真正改變的是首位元組與第一個答案 token 之間的間隔,也就是使用者必須等待的思考階段。

實務上的結論很直接:對檢索、格式轉換或單步驟任務而言,none 確實能降低成本;只要任務需要中間步驟,它就可能造成嚴重問題。目前沒有任何文件保證這個參數會持續可用。請把它視為實測行為,在自己的 usage 欄位中驗證,並預期文件更新後,它可能被正式納入或移除。

Agent 工作負載應該在什麼情況下保留推理?

我們用 K3 跑了 5 種 agent 型情境,分別測試預設設定與 reasoning_effort: "none"。兩種設定使用完全相同的簡單任務,而且全部通過:

情境思考占比(預設)使用 none 的成本使用 none 的 TTFT
工具呼叫迴圈8%−10%−35%
RAG 問答71%−37%−53%
結構化工具操作29%−16%−31%
批次擷取80%−15%−11%
長對話(15 輪)34%−13%−25%

第一列出乎意料:K3 在工具呼叫迴圈中,即使使用預設設定也幾乎不思考,推理占比只有 8%,因此沒有多少節省空間。模型會把工具選擇當成直覺反應,而不是需要推敲的工作。真正能省下成本的,是思考占比高但流程機械化的任務,例如 RAG 查詢與批次擷取。這類工作最不該負擔固定且永遠開啟的推理成本。至於確實需要多步驟規劃的 agent,前一節的正確率斷崖仍然適用;請保留推理並支付相應的 token 成本。

儘管單次呼叫的波動很大,規模放大後,延遲差異確實存在。這些情境在預設設定下要 10-19 秒才出現第一個 token,使用 none 則縮短為 8-13 秒;有實質內容的輸出,生成速度中位數為每秒 35 個 token。即使把上線首週的服務狀況納入考量,這組數字目前仍比較適合非同步與批次工作,而非對話式用途。

把推理內容傳回去,會再次按輸入計費嗎?

會,而且逐 token 計費。Kimi 的文件要求在訊息歷史中原封不動保留每個 assistant 輪次的 reasoning_content。我們實測了這項要求的成本:第二輪若連同第一輪的 chain of thought 一起送出,會計費 599 個 prompt token;相同請求若不附上該內容,則是 198 個。兩者相差 401 個 token,幾乎完全吻合第一輪的 402 個推理 token。也就是說,保留的思考內容會在後續每次請求中,以完整的 $3/M 輸入費率重新計費。對話越長,每一輪都會再次支付先前累積的推理內容。

但刪掉它不一定比較便宜。缺少先前的 chain of thought 時,K3 會從頭重新推理後續問題,第二輪的推理 token 增加 31%,從 343 升至 449。輸入價格是 $3/M,輸出則為 $15/M。在我們的測試中,保留 CoT 的總成本反而較低,因此文件的建議不只對品質有利,成本上也成立。真正有效的節省方式,是下一節提到的 prompt cache。保留的歷史紀錄是穩定的 prefix,而穩定 prefix 暖機後就不再以原價計費。

Kimi K3 會快取 prompt 嗎?最低需要多少 token?

K3 的 prompt cache 會自動啟用,而且門檻很低。約有 256 個共用 prefix token 時就會開始命中,並以 256 個 token 為區塊增加。一個 303-token 的 prompt 會快取 256 個 token;153-token 的 prompt 即使多次重試也從未命中。快取輸入的價格為 $0.30/M,相較於新輸入的 $3/M,固定折扣 90%。我們發出的所有呼叫都沒有額外的快取寫入費。首次命中前需要 2 到 5 次相同呼叫來暖機,因此單次重試無法證明快取是否可用;應該連續測量數次。

相比之下,這個門檻只有 OpenAI 文件所列 1,024-token 下限的四分之一,但區塊大小也比我們在其他服務測得的 64-token 粒度更粗。快取生命週期採 best-effort,而不是固定 TTL。我們的測試中,快取項目閒置 4 分鐘與 15 分鐘後仍然有效,但有一次閒置 8 分鐘卻未命中。因此應將到期視為受負載影響的淘汰行為,並在每次呼叫中確認快取 token 的拆分。另一項需要計算的價格特性是:價目表對 1M-token context window 採固定費率,沒有長 context 分級。一個用滿的 context window,每次呼叫的新輸入成本為 $3.00;prefix 暖機後則降至 $0.30。大型 context 工作負載能否成立,取決於快取的程度遠高於牌價。如果流量會重複使用數百個 token 的 system prompt,K3 的快取早在多數供應商尚未達到啟用門檻時就會生效。相關機制與如何從 usage 驗證命中,可參考我們的 prompt 快取指南快取最低門檻實測

Kimi K3 的中文真的比較貴嗎?

不會。相較於同類模型,K3 的 tokenizer 處理中文最有效率。這也回答了上線首週反覆出現的疑問。以下是語意一致的段落,在扣除封裝開銷後,每 100 個字元的淨 token 數:

模型enzhjakohiPython
kimi-k319.751.987.583.262.826.5
glm-5.219.758.475.776.991.325.6
deepseek-v4-flash19.758.470.669.260.726.7
claude-sonnet-532.3114.394.1106.370.941.1

K3 處理每 100 個中文字需要 52 個 token,比 GLM-5.2 與 DeepSeek 少 11%,也不到 Sonnet 5 的一半。K3 表現較弱的是日文,token 用量比其他開放權重模型高 16-24%。我們也確認了同系列模型使用的 tokenizer 並未改變:K3、K2.7-code 與 K2.5 在全部 23 組對齊樣本中,都產生完全相同的 token 數。因此,為 K2 制定的各語言預算可直接沿用。tokenizer 密度與 token 單價如何共同影響 9 種語言的成本,請參考我們的各語言最便宜 LLM 實測

常見問題

Kimi K3 的開放權重何時發布?

Moonshot 承諾會在 2026 年 7 月 27 日前,以 Modified MIT 授權完整釋出權重。截至本文發布時,K3 仍只能透過 API 使用。「史上最大的開放權重模型」目前是一項承諾,還不是可用的下載連結。這些權重未來加入開放權重生態系後,其快取行為可參考開放權重 LLM 的 prompt 快取整理

Kimi K3 相較於 K2 系列,實際新增了什麼?

從帳單來看,我們實測到 3 項差異:價格、永遠開啟的思考,以及沒有其他變化。K3 的價格為 $3/$15,K2.7-code 則是 $0.95/$4,漲幅為 3.2-3.75 倍。K2.5 完全不進行推理,K2.7-code 則提供開關。K3、K2.7-code 與 K2.5 的 tokenizer,在我們全部 23 組對齊樣本中逐位元組完全相同,因此 K2 時期制定的 token 預算可直接沿用。規格方面,根據 Moonshot 的說法:新模型採用 2.8T 參數的 MoE 架構,包含 896 個 expert,每個 token 啟用 16 個,並搭配 Kimi Delta Attention;context window 從 K2.7-code 的 256K 提升到 1M token,且原生支援圖片輸入。我們實測的是計費宣稱,不是架構宣稱。

Kimi K3 支援結構化輸出嗎?

支援。我們的測試中,使用 json_schemaresponse_format 會回傳有效且符合 schema 的物件。但底層仍會進行推理:該次擷取呼叫總共用了 97 個輸出 token,其中 66 個是推理 token。因此,受 schema 約束的呼叫與其他任務一樣會支付思考成本,除非同時設定 reasoning_effort: "none"

關閉推理會改變可見內容嗎?

會。使用預設設定時,K3 會在 reasoning_content 中回傳完整的 chain of thought,而且文件建議在多輪歷史中原封不動傳回。使用 reasoning_effort: "none" 後,這個欄位會完全消失,約 67-token 的思考前置內容也不再計入 prompt 帳單。

於 2026-07-20 使用 kimi-k3 實測,採上線首週牌價(輸入 $3/M、快取 $0.30/M、輸出 $15/M)。重複 prompt 均加入 salt,以避開回應層級快取;正確率統計採用具有單一可驗證答案的任務;行為相關結論也已透過另一條獨立請求路徑重現。隨著版本逐漸成熟,價格與行為都可能改變。採用本文任何數字前,請先用自己的 usage 紀錄驗證。

← 返回部落格