Kimi K3 API 定價實測:關掉那個「永遠開著」的推理
目錄
Kimi K3 的文件說推理無法關閉,而且 reasoning_effort 只接受 "max"。但實測下來,API 照樣接受 "none",而且真的有效:同一個微不足道的問題,用預設推理要花 $0.00179,關掉後只要 $0.000285,差了 6.3 倍。K3 於 2026-07-16 上線,輸入每百萬 token 收費 $3、輸出每百萬 token 收費 $15,是中國實驗室推出過最貴的定價,跟 Claude Sonnet 5 標價一樣。在這個輸出價位下,模型預設花掉的推理 token 就是你的帳單,所以這個文件沒寫的關閉開關,值得搞清楚它到底怎麼運作。
TL;DR
- Kimi K3 在預設設定下,會把 69% 到 93% 的輸出 token 花在推理上;一段 120 字的段落被計了 2,289 個輸出 token,$0.0346。
- 儘管文件說不行,
reasoning_effort: "none"其實會被接受,讓我們的簡單查詢成本降低 6.3 倍,但多步驟算術的正確率從 3/3 掉到 0/6。 - Kimi K3 的 prompt cache 大約從 256 token 的前綴開始命中,以 256 token 為區塊,讀取費率為 $0.30/M。
- 中文是 K3 最便宜的 CJK 語言:每 100 個字 52 個淨 token,低於 GLM-5.2 和 DeepSeek 的 58。
以下所有數據都是在 2026-07-20 針對 kimi-k3 測得的,它已在 Synthorai 閘道上以 Moonshot 的標價上線。我們對重複的 prompt 加了鹽值以避開回應快取,並在第二條獨立的請求路徑上交叉驗證了這些行為結論。每個數字背後都有原始用量紀錄佐證。
Kimi K3 預設情況下每則回答要花多少錢?
不論我們送出什麼類型的任務,帳單都被 reasoning 佔掉大半,連完全用不到 reasoning 的任務也一樣。以下是預設設定下每則回答的花費:
| 任務 | 輸出 token 數 | reasoning 佔比 | 每則回答花費 |
|---|---|---|---|
| 簡單算術(17×23) | 99 | 84% | $0.0018 |
| 事實類一句話回答 | 80 | 79% | $0.0015 |
| 小型程式函式 | 119 | 69% | $0.0009 |
| 多步驟文字題 | 139 | 87% | $0.0025 |
| 120 字段落 | 2,289 | 93% | $0.0346 |

這張圖的重點在於跨模型的對比:GPT-5.6 會自適應地判斷是否 reasoning(簡單題和事實題上的思考 token 為零,數學題和寫作題則是 65-70%),Claude Sonnet 5 出廠時思考功能是關閉的,而 GLM-5.2 就相對比例來說想得比 K3 更深。但 GLM 的輸出價格是 $4.40/M,K3 是 $15/M,所以同樣一題 17×23,GLM-5.2 收 $0.00078,GPT-5.6 收 $0.00027,Sonnet 5 收 $0.0001,K3 則收 $0.0018。輸出愈長,差距愈大:同一段 120 字段落在 K3 上要 $0.0346,GLM-5.2 是 $0.0186,GPT-5.6 是 $0.0072,Sonnet 5 是 $0.0024,這組任務裡最普通的一項就拉開了 15 倍差距。稅率跟其他中國 reasoning 模型差不多,但稅單金額不同。
還有兩個預設模式下需要納入預算考量的事實。第一,思考模式會在每個請求裡塞進約 67 個 token 的隱藏前置內容:同樣一則只有一個單字的訊息,開啟 reasoning 時計費 86 個 prompt token,關掉則是 19 個。這就是早期測試者注意到的「隱藏 system prompt」,reasoning 一關它就消失。第二,K3 目前很慢:我們的簡單題呼叫在開啟 reasoning 時端到端約需 19-24 秒,關掉則是 3-8 秒,含上線首週的服務狀況。除了錢,延遲也要一起算進預算。
可以關掉 Kimi K3 的推理嗎?
可以,儘管文件說不行。官方 API 參考文件寫著 K3「始終啟用思考」,而且 reasoning_effort 只接受 "max"。但實際測試時,端點接受了 "none"、"low"、"medium" 和 "high",沒有報錯,也確實照做了,我們還在另一條獨立的請求路徑上驗證出相同的行為。在多步驟的文字應用題上,這個開關確實有效,只是分得很粗:
reasoning_effort | 推理 token(平均) | 正確率 |
|---|---|---|
none | 0 | 0/6 |
low | 78 | 3/3 |
medium | 94 | 3/3 |
high | 105 | 3/3 |
max / 預設 | 100-121 | 3/3 |
有兩點值得留意。中間各檔的表現很接近:low 到 max 在這個任務上換來的 token 數量差不多,正確率也完全一樣,所以真正有意義的切換其實是二元的。另外,none 存在明顯的懸崖:被迫用簡短方式回答多步驟算術題時,K3 六次全錯,而且錯得五花八門,不是同一種系統性錯誤。當我們不強制簡短格式時,模型有時會無視簡潔要求,改在可見的答案裡逐步推導:結果是對的,但 token 只是從 reasoning 欄位移到了 text 欄位,並沒有真的消失。
延遲的變化比 token 數量看起來的要小。用 streaming 對同一題跑各個 effort 等級,首字節時間落在 6-24 秒,各等級的區間大幅重疊;就連沒東西可想的 none 也要等 12-13 秒,可見在這個任務規模下,服務本身才是首字節時間的主因。這個開關真正改變的,是首字節到第一個答案 token 之間的間隔,也就是使用者要乾等的思考階段。
實務上的結論:對於檢索、格式化或單步驟的任務,none 是一個實打實的成本槓桿;但對任何需要中間步驟的任務,它就是個坑。文件沒有保證這個參數會一直有效;把它當成實測出來的行為,在自己的 usage 欄位裡驗證,並且要有心理準備:等文件更新時,它可能被正式支援,也可能被移除。
在 agent 工作負載中,推理什麼時候該保持開啟?
我們讓 K3 跑過五種 agent 型態的情境各兩次,一次用預設值,一次用 reasoning_effort: "none",任務都是兩種設定都能完整通過的相同簡單任務:
| 情境 | 思考佔比(預設) | 用 none 的成本 | 用 none 的 TTFT |
|---|---|---|---|
| 工具呼叫迴圈 | 8% | −10% | −35% |
| RAG 回答 | 71% | −37% | −53% |
| 結構化工具使用 | 29% | −16% | −31% |
| 批次抽取 | 80% | −15% | −11% |
| 長對話(15 輪) | 34% | −13% | −25% |
意外的是第一列:在工具呼叫迴圈中,即使用預設設定,K3 也幾乎不思考(佔比 8%),所以能省的空間很小;模型把選擇工具當成反射動作,而不是深思熟慮。省下的成本集中在思考佔比高、任務又很機械的地方(RAG 查詢和批次抽取),而這正是一個固定的、永遠開啟的「稅」最不該存在的地方。對於真正多步驟的 agent 規劃,前一節的正確率懸崖同樣適用;把推理開著,該花的 token 就花。
在規模化的情況下,延遲效應是真實存在的,儘管單次呼叫的數值波動很大:在這些情境中,預設設定下第一個 token 在 10-19 秒抵達,用 none 則是 8-13 秒,而實質輸出的生成速度中位數為每秒 35 個 token。這些數字(包含發布首週的服務狀況在內)比起今天任何對話式的場景,更適合非同步和批次型態。
回傳的 reasoning 內容會被當作 input 再次計費嗎?
會,一個 token 都不少。Kimi 的文件要求你把每一輪 assistant 回應的 reasoning_content 原封不動保留在對話歷史裡。我們實測過這個成本:第二輪請求帶上第一輪的思考鏈時,prompt token 計了 599 個;同一個請求拿掉思考鏈後只計 198 個。兩者相差 401 個 token,幾乎正好等於第一輪的 402 個 reasoning token。這代表保留下來的思考內容會以完整的 $3/M input 費率重新進入之後的每一個請求,長對話每一輪都要為累積的 reasoning 重新付費。
不過丟掉它也不見得比較便宜。沒有先前的思考鏈時,K3 會把後續問題從頭重新推理一次:第二輪的 reasoning token 增加了 31%(從 343 漲到 449)。以 input $3/M 對比 output $15/M 來算,在我們的測試裡保留 CoT 反而是整體較便宜的選擇,所以文件的建議不只在品質上成立,成本上也站得住腳。真正能省錢的槓桿是下一節要談的 prompt cache:保留下來的歷史是一段穩定的前綴,而穩定前綴不再以全價計費。
Kimi K3 會快取 prompt 嗎?從多少 token 開始?
K3 的 prompt cache 是自動的,門檻很低:命中大約從 256 個共用前綴 token 開始,以 256 個 token 為單位往上遞增(一個 303 token 的 prompt 快取了 256 個;一個 153 token 的 prompt 在多次重試中從未快取)。快取的 input 以 $0.30/M 計費,比起 $3/M 的新鮮費率是固定 90% 的折扣,而且我們發出的每一個請求都沒有 cache-write 的額外費用。暖機需要兩到五次相同的呼叫才會出現第一次命中,所以單次重試無法證明任何結論;要多測幾次。
作為對照,這個門檻是 OpenAI 文件標示的 1,024 token 下限的四分之一,區塊大小也比我們在別處實測的 64 token 粒度來得粗。存活時間是盡力而為,而非固定的 TTL:我們測試中的快取項目在閒置 4 分鐘和 15 分鐘後仍然存活,但有一次 8 分鐘的間隔卻沒命中,所以把到期視為隨負載變動的淘汰,並在每一次呼叫都驗證快取的比例。還有一項值得算一下的定價事實:1M token 的 context window 採統一定價,價目表上沒有長 context 的分級。塞滿的 window 每次呼叫要 $3.00 的新鮮 input,前綴暖了之後則是 $0.30,所以大 context 的工作負載能不能撐下去,靠的是快取,遠比靠標價來得重要。如果你的流量會重複用到哪怕只有幾百 token 的 system prompt,K3 的快取就會生效,而多數供應商在這個量級根本還沒開始快取。命中的運作機制以及如何從 usage 驗證命中,都寫在我們的 prompt caching 指南 和快取最低門檻實測研究裡。
Kimi K3 處理中文真的比較貴嗎?
不會。相對於同類模型,中文正是 K3 tokenizer 效率最高的語言,這也回答了發表週討論中反覆出現的一個問題。以下是語意對齊文本每 100 個字元的淨 token 數,已扣除封裝開銷:
| Model | en | zh | ja | ko | hi | Python |
|---|---|---|---|---|---|---|
| kimi-k3 | 19.7 | 51.9 | 87.5 | 83.2 | 62.8 | 26.5 |
| glm-5.2 | 19.7 | 58.4 | 75.7 | 76.9 | 91.3 | 25.6 |
| deepseek-v4-flash | 19.7 | 58.4 | 70.6 | 69.2 | 60.7 | 26.7 |
| claude-sonnet-5 | 32.3 | 114.3 | 94.1 | 106.3 | 70.9 | 41.1 |
K3 中文每 100 字元計 52 個 token,比 GLM-5.2 和 DeepSeek 低 11%,不到 Sonnet 5 的一半。它的弱項是日文,比其他 open-weight 模型多付 16-24%。我們也確認整個系列的 tokenizer 沒變:K3、K2.7-code 和 K2.5 在全部 23 個對齊樣本上算出來的 token 數完全相同,所以為 K2 建立的各語言預算可以直接沿用。tokenizer 密度如何與跨九種語言的單價相互疊加,我們在各語言最便宜 LLM 研究中有詳細分析。
FAQ
Kimi K3 的 open weights 什麼時候釋出?
Moonshot 已承諾在 2026 年 7 月 27 日前以 Modified MIT 授權釋出完整權重;截至本文發布時,K3 仍僅提供 API。「史上最大開放權重模型」的說法目前只是一項承諾,尚未成為可下載的連結。這些權重即將加入的開放權重生態系中,快取如何運作的相關說明,可參閱開放權重 LLM 的提示快取。
跟 K2 系列相比,K3 真正的新東西是什麼?
從帳單來看,我們量到三件事:價格(K3 的 $3/$15 對比 K2.7-code 的 $0.95/$4,漲了 3.2-3.75 倍)、常駐 thinking(K2.5 完全不會推理,K2.7-code 則有開關),除此之外沒別的了:K3、K2.7-code 和 K2.5 的 tokenizer 在我們全部 23 個對齊樣本上都是逐位元組相同的,所以 K2 時代的 token 預算可以直接沿用。從規格表來看,依 Moonshot 的說法:全新的 2.8T 參數 MoE(896 個 expert,每個 token 啟用 16 個)搭配 Kimi Delta Attention、1M token 的 context window(K2.7-code 是 256K),以及原生圖片輸入。我們驗證的是帳單方面的說法,不是架構方面的。
Kimi K3 支援 structured output 嗎?
支援。在我們的測試中,帶 json_schema 的 response_format 回傳了符合 schema 的有效物件。要注意底下仍會跑推理:那次抽取呼叫的 97 個輸出 token 裡有 66 個是 reasoning,所以受 schema 約束的呼叫跟其他一切一樣要付 thinking 稅,除非你同時設定 reasoning_effort: "none"。
關掉推理會改變你能看到的內容嗎?
會。預設設定下,K3 會在 reasoning_content 裡回傳完整的思考鏈,文件建議在多輪對話歷史中原樣傳回。設定 reasoning_effort: "none" 後這個欄位會完全消失,那約 67 個 token 的 thinking 前言也會一併從你的 prompt 帳單上消失。
測試於 2026-07-20,使用 kimi-k3,採發表週的公告價(輸入 $3/M、快取 $0.30/M、輸出 $15/M)。重複的 prompt 加了 salt 以避開回應層級的快取;準確率統計採用有單一可驗證答案的任務;行為方面的說法在第二條獨立的請求路徑上重現過。隨著版本成熟,價格與行為可能變動;在依賴本文任何數字之前,請對照你自己的 usage 紀錄自行驗證。