Qwen 3.8 Max API 定價:16 個思考 token 勝過關閉思考
目錄
Qwen 3.8 Max 每百萬個輸入 token 收費 $2,輸出則為 $6,但 API 看似提供的最低成本設定,並不是最便宜又可靠的選擇。使用 reasoning_effort: "none" 關閉思考後,我們的兩步算術題正確率從 4/4 降至 1/6;只要將思考預算硬性限制在 16 個 token,就能恢復到 6/6,而且平均輸出 token 比預設值少五分之一。上線當週充斥著各種能力宣稱,卻幾乎沒有可供驗證的資料:沒有 model card、沒有公開 benchmark 表格,評估結果也僅供內部使用。Hacker News 很快就指出了這個問題。計費行為則不同,任何有 API key 的人都能實測。我們在上線首日透過 Synthorai 閘道測試了 qwen3.8-max:涵蓋介面接受的所有思考控制項、各設定產生的推理成本、隱式快取的最低門檻與建立延遲、宣稱的 1M context,以及從 Qwen 3.7 延續下來的行為。
TL;DR
- qwen3.8-max 的七種
reasoning_effort值,實測只對應四種行為:關閉、上限 4,096 個 token、上限 16,384 個 token,以及無上限。 thinking_budget精確到單一 token:要求 16 個 token,計量結果就是 16;上限為 262,144。- 關閉思考後,兩步數學題的正確率降至 1/6;設定 16 個 token 的預算則以更低成本拿到 6/6。
- 隱式快取可在 0.3 秒內建立,讀取價格為 $0.25/1M;但 prompt 不到約 4,300 個 token 時完全不會快取。
- 輸入上限精確,超過就直接報錯:關閉思考時為 991,808,開啟思考時為 983,616。
Qwen 3.8 Max 的思考控制項實際上做了什麼?
實際生效的參數有三個,但不是文件列出的那三個。第三方文件描述的 reasoning_effort 只有三種值:low、medium、xhigh,預設為 xhigh。我們實測的介面接受七種:none、minimal、low、medium、high、xhigh 與 max;傳入無效值時,錯誤訊息會原樣列出這份允許清單。此外,原生的 thinking_budget(1 至 262,144 的正整數)與 enable_thinking(布林值)也會傳給供應商,由供應商自行驗證。預算若設為 0 或 262,145,API 會回傳 400,並在訊息中標明範圍。
在一般任務中,各個 effort 等級幾乎無法區分。無論是簡單問答、兩步數學題,還是中等難度的組合問題,low、medium、high、xhigh 與預設值消耗的推理 token 都落在同一個波動區間,看不出差異。只有遇到需要思考數萬個 token 的任務,差距才會浮現。在一道不受限時會消耗 45,129 個推理 token 的質數計數問題上,各等級終於開始觸及上限:
| 設定 | 深度任務的推理 token | 正確? |
|---|---|---|
| 預設(省略) | 45,129 | 是 |
minimal | 4,096(精確上限) | 否 |
low | 4,096(精確上限) | 否 |
medium | 16,384(精確上限) | 否 |
high | 44,348(未觸及上限) | 是 |
xhigh | 38,029(未觸及上限) | 是 |
max | 35,300(未觸及上限) | 是 |
最符合所有觀察結果的模型是:每個 effort 等級都是預設的思考預算上限,七個名稱實際只對應四種行為。第一種是關閉,none 與 enable_thinking: false 的行為完全相同。Minimal 與 low 共用 4,096 個 token 的上限。Medium 將上限提高四倍至 16,384。High、xhigh、max 與預設值屬於第四級:在這項任務中都沒有觸及上限,各次執行消耗 35K 至 45K 個 token,這是此類深度下的正常波動。如果最高三個等級確實有差異,分界必然在 45K 個思考 token 以上,遠超過多數正式環境流量會達到的深度;文件所稱預設值為 xhigh,也符合我們的所有實測結果。差異非常明確:所有觸及上限的執行都答錯,所有未受限的執行都答對。低於上限時,各等級行為完全相同,因此日常流量下這個調整選項像是沒有作用。超過上限後,思考會在任務中途遭到截斷。若需要明確上限,不要使用預設等級,直接設定 thinking_budget;下一節會詳細拆解這個參數。
thinking_budget 實際上如何運作?
它會精確限制到單一 token;它是上限,不是配額;而且設定中等大小的上限,甚至可能比完全不設限更貴。thinking_budget 是 DashScope 的原生整數參數,範圍為 1 至 262,144,文件記載的預設值是 131,072,並且沿用自開放權重的 Qwen3 系列。它設定單次呼叫可用的推理 token 上限。傳入 0 或 262,145 時,API 會回傳 400,並在訊息中標明範圍。只要未達上限,行為就不會改變:對一個自然思考量只有數百個 token 的任務設定 8,192,實際消耗為 331 與 485,與未設定預算完全相同。觸及上限時,控制精確到單一 token:預算設為 16、64 與 256 時,每次執行都會剛好在 16、64 與 256 個 token 停止推理。
真正有意思的是觸及上限後的行為。模型不會放棄任務,而是停止推理,改在可見答案中完成剩餘工作。對一道中等難度的組合問題(計算 2x12 網格的骨牌鋪法數),所有預算都答對,但 token 總量與直覺預期不同:
| 預算 | 已用推理 token | 完成 token 總量 |
|---|---|---|
| 未設定(預設) | 226-303 | 234-311 |
| 16 | 16(精確) | 368-406 |
| 64 | 64(精確) | 399-408 |
| 256 | 256(精確) | 776-787 |
| 8,192 | 331-485(未觸及上限) | 339-493 |
這條曲線並非單調變化。設定 256 個 token 的預算,比完全不設預算貴 2.5 倍:模型先用掉額度開始一段推理,在思考途中遭到截斷,接著又在可見輸出中逐步重新推導答案。最小預算反而優於中等預算,因為 16 個 token 根本不夠展開任何推理,模型會直接輸出精簡的可見解題過程。由此可得三個規則。第一,極小預算確實能控制淺層至中等深度任務的成本:我們的兩步數學題測試中,16 個 token 拿到 6/6,完成 token 總量為 98-161;預設值則為 126-207。第二,不要把中等大小的上限套用到深度未知的流量。這正好落在無效區間:上限會截斷真正的推理,導致同一份工作付兩次成本(前述深度任務中的 4,096 與 16,384 兩列,就是放大後的同一種失敗,而且答案也錯了)。第三,預算一旦生效,輸出形式也會改變:受限的執行會在答案中列出推導過程。如果解析器只接受單一結果,就必須注意這點。
上線首日的文件有多少經得起實測?
大約一半。由於這次上線目前沒有其他內容能獨立驗證,這些差異值得公開。以下所有數字都來自我們自己的計量與探測:
| 文件宣稱 | 實測結果 |
|---|---|
| 輸入上限:991,808(不思考)/983,616(思考) | 精確;超出上限時回傳 400,並標明限制 |
thinking_budget 範圍:最大 262,144 的正整數 | 精確;0 與 262,145 都會遭到拒絕 |
| 每 1M 的牌價為輸入 $2/輸出 $6 | 每次呼叫的計量結果都精確符合至小數點後四位 |
| 快取讀取使用 0.25x credits | 精確:$0.25/1M,寫入不加價 |
reasoning_effort 值:low、medium、xhigh | 錯誤:接受七種值,其中包含完全關閉思考 |
| 最大輸出為 131.07K,「兩種模式皆相同」 | 兩邊都錯:關閉思考時,max_tokens 超過 65,536 就會遭到拒絕;開啟思考時,我們測到 393,216 仍可接受 |
多輪用戶端「必須原樣回傳 reasoning_content」 | 未強制執行:省略或竄改歷史內容都能接受 |
| 「支援 context caching」(無細節) | 確實存在,但關鍵規格未寫入文件:約 4.3K 的最低門檻、15-45 分鐘的存續時間 |
整體模式顯示,計費面最可靠:所有會決定費用的機制都很精確,也如實強制執行;參數文件則落後於介面的實際行為。
關閉思考真的能省錢嗎?
它確實能減少 token,但會犧牲正確率,而且只差兩行設定就有更好的取捨。我們用可明確驗證答案的兩步算術題進行批次測試:1850 箱貨物,每箱 24 個零件,已出貨 75%,其中 3,120 個送達。預設設定得到 4/4,每次呼叫使用 126-207 個完成 token。reasoning_effort: "none" 只輸出 4-5 個 token,但正確率降至 1/6。同一個 prompt 改用 thinking_budget: 16 後,以 98-161 個完成 token 拿到 6/6。在這類任務中,它比預設值更便宜,正確率也沒有損失。單步算術即使使用 none 仍為 3/3,因此查詢與單步轉換可安全使用關閉開關;多步驟工作才會崩潰。這不是 3.8 的退步:qwen3.7-max 關閉思考後,在相同批次中也只有 3/6。
預算章節提到的無效區間,在困難任務上可直接換算成金額。深度質數計數任務使用 low 預設值時,先耗盡 4,096 個思考 token,又在可見輸出中花了 13,882 個 token 逐一檢查候選值,最後仍答錯:錯誤答案花費 $0.11;預設設定的正確答案則為 $0.27。困難任務完全關閉思考時,也會出現相同機制:3.8 與 3.7 都在可見答案中輸出了 13-15K 個 token 的枚舉過程;各只執行一次,其中一個得到正確數量,另一個則少算了一個質數。在推理途中觸及預算上限,可能同時提高總成本並降低品質。已知任務較淺時才限制思考;深度任務則應讓模型完整思考。
1M-token context window 是真的嗎?
實際上是,而且限制精確、透明。關閉思考時,API 接受最多 991,808 個輸入 token;開啟思考時則為 983,616。兩項限制都會明確報錯:過大的要求會遭到拒絕並回傳 400,訊息中會標明確切上限,不會悄悄截斷文件。我們測試的所有大小,包括 161K、677K 與 919K 個 token,都能成功找回埋藏資訊,並在 11 至 63 秒內逐字回傳預先植入的 override code。一筆 919K-token 的要求按牌價約為 $1.84,因此這個 context window 確實可用,但使用完整視窗應是經過考量的設計決策,而非預設做法。
隱式快取能帶來什麼效果?最低門檻在哪裡?
這是我們測過建立速度最快的快取,但最低門檻異常高。重複送出加鹽的 6,103-token prompt 後,僅隔 0.3 秒的下一次要求就命中快取;不像 Gemini 需要數十秒才能建立快取,這裡不需要特別處理暖機時間。未重新寫入的情況下,+5 與 +15 分鐘仍然命中,到了 +45 分鐘則已失效,因此靜置後的有效時間介於 15 至 45 分鐘。讀取價格為每百萬個 token $0.25,即輸入價格的 0.125x;寫入不加價。折扣會自動反映在 cached_tokens 欄位與計量成本中。
真正的限制是最低門檻。4,221-token 的 prompt 從未命中,4,360-token 的 prompt 則會命中,而且第一次命中一律剛好為 4,096 個 token。Prompt 少於約 4.3K 個 token 時,這個快取等同不存在。這與 Claude 最低只需 1,024 個 token,以及 Kimi K3 的小區塊自動快取形成鮮明對比。超過門檻後,命中量以 128-token 區塊量化;我們觀察到 4,096、8,320、12,544 與 16,768。不過已預熱前綴的涵蓋率介於 51% 至 96%,因此估算成本時,應假設長前綴大部分能享有折扣,而不是全部。
結構化輸出與工具呼叫也要支付推理成本嗎?
預設要付,但這兩類任務最適合削減推理成本。嚴格的 json_schema 輸出可以正常運作,而且確實有強制格式:相同的擷取任務若不提供 schema,回傳結果會包在 Markdown code fence 中。使用預設設定時,擷取四個 invoice 欄位會先消耗 252 個推理 token,再輸出 57 個 JSON token。改用 reasoning_effort: "none" 後,只需 54 個 token 就能產生有效且正確的 JSON,成本降低 5.7 倍;thinking_budget: 16 則介於兩者之間。工具選擇也有相同行為:關閉思考後,模型仍能呼叫正確的函式,token 數只有預設值的三分之一。單步擷取與路由正是適合安全關閉思考的任務形態;輸出價格為 $6/1M,長期累積的節省相當可觀。
Agent 開發者還要注意一項計費細節:API 會在 reasoning_content 中回傳完整思維鏈,文件要求多輪用戶端將它原樣傳回。實際上並未強制執行。我們分別以包含、略過及刻意竄改推理內容的方式重播對話,三者都能接受,短鏈任務的正確率也不受影響。重播的推理內容會按一般輸入 token 計費,因此在長鏈任務尚未顯示品質損失前,多輪流量省略這段內容確實能節省成本。
Qwen 3.7 延續了哪些特性?又改了什麼?
Tokenizer 沒有變更,既有的 token 預算可以直接沿用。相同的英文、中文、日文與程式碼語料,在 qwen3.8-max、qwen3.7-max、qwen3.7-plus、qwen3.6-flash 與 qwen3.5-flash 上得到完全相同的 token 數,因此我們在各語言 tokenizer 研究中的每種語言成本規劃可直接沿用。
有兩項變更。第一,3.8-max 有同系列其他模型沒有的固定 prompt 額外開銷:同一則只有一個字元的訊息,在 3.8-max 上計為 49 個 prompt token,其他所有受測 Qwen 模型則是 11 個,相當於每次呼叫固定多出 38 個 token。對長 prompt 而言可以忽略,但對短小且高頻的要求,所占比例就很明顯。第二,思考功能不再是模式切換,而是隨時可用,並提供上述七級調整選項與精確預算參數;3.7 的控制方式較粗略。預覽期間曾流傳兩種計價方案,因此需要澄清:Token Plan 訂閱方案每月 $6 至 $68,離峰時段另有大幅折扣,但那是 Alibaba 自家應用程式的價格,不適用於 API。使用 API 時,費率仍是 $2/$6;本次研究中的每次呼叫,閘道計量結果都精確符合牌價至小數點後四位。
常見問題
Qwen 3.8 Max 可以關閉思考嗎?
可以完全關閉:reasoning_effort: "none"(或 enable_thinking: false)會徹底消除推理 token。請只用於單步工作。在我們的兩步算術批次中,關閉思考的正確率只有 1/6;設定 16 個 token 的 thinking_budget 則以相當或更低的 token 數拿到 6/6。因此,多步驟流量的最低設定應是小額預算,而不是直接關閉。
Qwen 3.8 Max 快取的最低 prompt 大小是多少?
實測約為 4,300 個 token:4,221-token 的 prompt 從未命中,4,360-token 的 prompt 則會命中,而且第一次命中一律剛好是 4,096 個 token。低於門檻就沒有任何折扣;高於門檻後,讀取價格為 $0.25/1M,寫入不加價,完成預熱 0.3 秒後即可讀取。
Qwen 3.8 Max 支援 reasoning_effort 嗎?
接受七種值:none、minimal、low、medium、high、xhigh、max。不過各等級實際上是思考預算上限,只有當任務的思考量超過上限時才會產生差異。若需要可預測的控制,請直接設定 thinking_budget:它會精確限制到單一 token,不接受 0,最大值為 262,144。目前不同用戶端工具對支援哪些等級仍有不同說法;上述清單是上線首日介面實際接受的值。
多輪對話一定要回傳 reasoning_content 嗎?
文件說必須回傳,但 API 不會檢查。我們的測試中,省略甚至竄改推理歷史都不會報錯,短鏈任務的正確率也沒有下降;重播推理內容則會按一般輸入計費。在自家評估尚未發現長鏈品質下降前,省略重播是合理的成本控制手段。
於 2026-08-03 透過 Synthorai 閘道實測 qwen3.8-max,比較組為 qwen3.7-max、qwen3.7-plus、qwen3.6-flash、qwen3.5-flash。測試包含:調整值接受度、無效值及 max_tokens 邊界探測;使用自然消耗 45K 個 token 的深度任務觸發 effort 上限;使用固定且可驗證答案的批次測量正確率斷崖(每組 n=4-6,均加鹽);間隔 2-3 秒的加鹽快取配對與多段等待時間測試;161K-919K 個 token 的資訊定位與溢位探測;以及四份相同語料的 tokenizer 計數。金額來自閘道計量器依牌價記錄的實際計費成本(每 1M 為 $2/$6)。預覽期間的折扣、費率與行為都可能變動,請以自己的使用紀錄再次確認。