2026 最佳 Flash LLM API:GLM 最划算,Gemini 3.8 最強
目錄
2026 年 9 月該選哪款 Flash 級 LLM API,取決於你的需求:GLM 5.3 Flash 每一美元能換到最高的基準分數,Gemini 3.8 Flash 綜合能力最強,也是處理音訊與影片的首選,Claude Sonnet 5 最少捏造答案,但價格最高,Seed 2.0 Mini 則是通過所有實測項目的最低價模型。本文所稱的 Flash 級,是各供應商旗下體積較小、速度較快的模型。我們評估了 16 款模型,結果顯示每家供應商的現役模型都優於上一代小型模型。接下來會從牌價、快取價格、輸入類型、思考控制、獨立基準、每項任務成本,以及正式環境中容易出問題的地方,比較其中 9 款現役模型。
TL;DR
- 升級到各供應商的現役模型:Claude Sonnet 5、GPT-5.6 Terra 與 Gemini 3.8 Flash 的每 token 價格雖高於 Haiku 4.5、GPT-5.4 mini 與 Gemini 3.5 Flash-Lite,但每個正確答案的成本低 2.5 到 3.9 倍。
- 最划算:GLM 5.3 Flash,Artificial Analysis 指數為 41.9,每項任務成本 $0.25。
- 綜合能力與多模態最強:Gemini 3.8 Flash。
- 最少捏造答案:Claude Sonnet 5,但每項任務成本最高。
- 最便宜:Seed 2.0 Mini,價格為 $0.10 / $0.40。
這 9 款模型差在哪裡?我們怎麼測?
價格與功能資料來自供應商頁面,基準成績取自使用同一套測試框架評估所有模型的獨立排行榜。我們自己的測試只用來判斷是否達到採用門檻,不做排名。排行榜包括 Artificial Analysis(AA)Intelligence Index v4.3 及其非幻覺率(模型選擇拒答而非猜測的頻率)、LiveBench、Vals Index,以及 Arena 的文字與 WebDev 投票分數。我們的測試包含 11 道可核對數值答案的題目,例如數字計數、質數加總、網格路徑、硬幣找零、模冪、背包問題等,每題執行 3 次。另外還有 5 個不存在的公司、研究機構、城鎮、合金與獎項問題,再逐一完整閱讀回答,判斷模型會拒答還是捏造。本文所稱的思考,是模型在作答前產生的推理 token。這些 token 依輸出計費,並透過 reasoning_effort 等欄位逐次設定。每款模型都以預設值及其支援的所有思考設定執行。
| 模型 | AA 指數 | AA 非幻覺率 | LiveBench | Vals Index | Arena 文字 / WebDev | 我們的測試:預設 / 最佳 | 預設時捏造 |
|---|---|---|---|---|---|---|---|
| GPT-5.6 Terra | max 時 42.3 | 12.1 | 77.9 | 59.6 | 1466 / 1521 | 31 / 33 | 5 題中 2 題 |
| GLM 5.3 Flash | 41.9 | 72.4 | 71.6 | 47.2 | 1475 / 1607 | 31 / 31 | 5 題中 0 題 |
| Gemini 3.8 Flash | high 時 41.2 | 44.8 | 75.8 | 62.3 | 1493 / 1568 | 32 / 33 | 5 題中 0 題 |
| Qwen3.8 Flash | 39.9 | 54.7 | 76.2 | 未列出 | 未列出 / 1635 | 33 / 33 | 5 題中 2 題 |
| DeepSeek V4.1 Flash | max 時 39.5 | 3.5 | 81.1 | 57.9 | 未列出 / 1614 | 33 / 33 | 5 題中 4 題 |
| Claude Sonnet 5 | max 時 38.4 | 60.6 | 76.0 | 59.6 | 1461 / 1537 | 33 / 33 | 5 題中 0 題 |
| GPT-5.6 Luna | max 時 37.5 | 7.4 | 73.6 | 59.9 | 1453 / 1519 | 31 / 32 | 5 題中 4 題 |
| Hy3 | 25.8 | 25.9 | 未列出 | 未列出 | 1456 / 1513 | 33 / 33 | 5 題中 0 題 |
| Seed 2.0 Mini | 未列出 | 未列出 | 未列出 | 未列出 | 未列出 | 33 / 33 | 5 題中 0 題 |
資料來源,讀取日期為 2026-09-17:Artificial Analysis、LiveBench、Vals Index、Arena 文字排行榜及 Arena WebDev 排行榜。Arena 採用類似 Elo 的評分,20 分差距不大。Qwen3.8 Flash 在榜上列為 Qwen3.8-Flash-Next,也就是該 API 背後的開放權重模型。測量於 2026-09-16 與 17 進行,其中兩款模型在第二天重新執行,用來確認跨日結果可比較。
沒有任何模型在所有排行榜都領先:Terra 的指數最高,DeepSeek 在 LiveBench 居首,Gemini 3.8 Flash 拿下 Vals 與 Arena 文字榜第一,Qwen3.8 Flash 則領先 Arena WebDev。AA 非幻覺率與我們 5 道虛構問題的結果一致,都能看出哪些模型偏好猜答案:DeepSeek V4.1 Flash、Luna 與 Terra 很少拒答,GLM 5.3 Flash 與 Sonnet 5 通常會拒答。Seed 2.0 Mini 沒有任何獨立評分,因此我們的測試是目前唯一的依據。
哪些供應商的模型算 Flash?該升級到最新款嗎?
各供應商最新的小型模型都算,而且都該升級。Google、DeepSeek、Alibaba、Z.ai、ByteDance 與 Tencent 會將自家模型標成 Flash、Mini,或只提供一款低價模型。Anthropic 當代產品線是 Fable、Opus 與 Sonnet,而 Haiku 4.5 已落後一個世代(2025 年 10 月推出,最早於 2026 年 10 月 15 日退役),因此本文將 Claude Sonnet 5 視為 Claude 的 Flash 級模型。OpenAI 文件則把 GPT-5.6 Terra 對應到舊有 mini 級別,GPT-5.6 Luna 對應到 nano。Sonnet 5($2 / $10)與 Terra($2 / $12)的每 token 價格是其餘 7 款的數倍,因此在下方另列為獨立價格帶。
我們也評估了 4 家供應商的上一代小型模型,並以每個正確答案的成本評分:將 33 次執行的總花費除以正確答案數。若模型只有一半答對,每個答案的成本就會加倍。每組比較都是現役模型勝出。TL;DR 提到的 3 組比較中,新模型的每 token 價格雖然較高,每個正確答案卻更便宜:
- Claude Sonnet 5 優於 Claude Haiku 4.5。Haiku 必須開到最高思考設定才得到 32 / 33;Sonnet 5 在所有啟用思考的設定下都得到 33 / 33,而且在最便宜的
max設定下,每個正確答案成本低 2.9 倍。兩者都拒答全部 5 道虛構問題。 - GPT-5.6 Terra 優於 GPT-5.4 mini。Mini 預設只得到 9 / 33,必須調到
high才能得到 33 / 33;Terra 在low就得到 33 / 33,成本低 2.5 倍。Terra 捏造了 2 個答案,mini 則拒答全部 5 題。 - Gemini 3.8 Flash 優於 Gemini 3.5 Flash-Lite 與 Gemini 3.7 Flash。相較 Flash-Lite,每個正確答案成本低 3.9 倍,而且對 Flash-Lite 作答的 3 道虛構問題都選擇拒答。Flash-Lite 只在單步擷取任務中仍有使用空間。相較 3.7 Flash,兩者牌價相同,3.8 每次呼叫約貴 10%,因此升級換到的是能力,不是成本節省。
- GPT-5.6 Luna 優於 GPT-5.4 nano,兩者同樣得到 31 / 33,但 Luna 每個正確答案的成本約只有三分之一;Qwen3.8 Flash 也優於 Qwen3.6 Flash 與 Qwen3.5 Flash,後兩者的思考量約多 10 倍,每個正確答案成本高 6 到 27 倍。
本文其餘部分只討論這 9 款現役模型。
這 9 款模型要多少錢?
依輸出牌價可分成 3 個價格帶。長條顯示各模型在最佳設定下,每個正確答案的實測成本,因此牌價便宜但思考量大的模型也會反映在圖上。標籤同時列出牌價與快取讀取價格,也就是重複 prompt 前綴的成本占輸入價格的比例。
價格帶不太能預測實際帳單:GPT-5.6 Terra 位於最高價格帶,每個正確答案卻比 Gemini 3.8 Flash 便宜,也只比 Seed 2.0 Mini 高約四分之一。模型使用的思考量,對成本的影響不亞於牌價。價格也經常調整,並隨時間與地區而異:Google 的 3.x Flash 價格將在 2027 年 1 月 1 日加倍(Gemini 3.8 Flash 調為 $1.50 / $7.50);DeepSeek 在平日 UTC 01:00 到 04:00 及 06:00 到 10:00 以半價計費;OpenAI 在 7 月將 GPT-5.6 Luna 降價 80%;Qwen3.8 Flash 在 Alibaba 新加坡區以外便宜 19% 到 25%。測試期間另有 3 款現役小型模型尚未在 Synthorai 提供,因此未納入實測:Mistral Small 4($0.15 / $0.60)、StepFun Step 3.7 Flash($0.20 / $1.15)與 Amazon Nova 2 Lite($0.30 / $2.50)。
各模型支援哪些輸入?思考可以關閉嗎?
9 款模型中有 8 款支援圖片,4 款支援影片,2 款支援音訊。Hy3 是 Tencent 的 Hunyuan 3,只能讀取文字。最後一欄表示使用嚴格 schema 執行發票 JSON 擷取時,8 次執行中有幾次回傳正確值。
| 模型 | 輸入 | Context / 最大輸出 | 開放權重 | 可關閉思考 | 預設思考 | Schema JSON |
|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 文字、圖片 | 1M / 128K | 否 | 是 | adaptive、high | 透過 tool call,8/8 |
| GPT-5.6 Terra | 文字、圖片 | 1.05M / 128K | 否 | 是 | medium | 8/8 |
| Gemini 3.8 Flash | 文字、圖片、音訊、影片、PDF | 1M / 64K | 否 | 否 | medium | 8/8 |
| GPT-5.6 Luna | 文字、圖片 | 1.05M / 128K | 否 | 是 | medium | 8/8 |
| DeepSeek V4.1 Flash | 文字、圖片 | 1M / 384K | MIT | 是 | high | 僅 json_object,8/8 |
| Seed 2.0 Mini | 文字、圖片、音訊、影片 | 256K / 128K | 否 | 是 | medium | 8/8 |
| Qwen3.8 Flash | 文字、圖片、影片 | 1M / 128K | Qwen 授權 | 是 | xhigh | 3/8,整數錯誤 |
| GLM 5.3 Flash | 文字、圖片、影片、檔案 | 1M / 128K | MIT | 否 | max | 僅 json_object,8/8 |
| Hy3 | 文字 | 256K / 128K | Apache 2.0 | 是 | high | 僅 json_object,7/8 |
「透過 tool call」表示 schema 是以工具輸入傳入,並強制 Claude 呼叫該工具。「僅 json_object」表示嚴格 schema 在我們的請求路徑中無法正確回傳,改用 {"type": "json_object"},並在 prompt 中指定欄位名稱後才成功。需要音訊輸入可選 Gemini 3.8 Flash 或 Seed 2.0 Mini;需要超過 128K 的輸出可選 DeepSeek V4.1 Flash;需要自行託管權重則可選 DeepSeek、GLM、Hy3 或 Qwen3.8 Flash。
整項任務要多少錢,而不只是每 token 價格?
一次呼叫的成本,取決於價格乘上模型自行決定使用的 token 數量。在這個級別中,後者的變動比前者更大。最公平的公開指標,是 Artificial Analysis 執行一項指數任務的成本,其中包含思考 token。目前 9 款模型中有 8 款提供這項資料。
GLM 5.3 Flash 的分數與 GPT-5.6 Terra 相差不到 0.5 分,但每項任務成本只有五分之一。Qwen3.8 Flash 的牌價與 GLM 幾乎相同,每項任務卻貴 50%,原因是跑完整個指數時,Qwen 輸出了 2.4 億個 token,GLM 則是 1.8 億個。Claude Sonnet 5 在 max 下每項任務成本為 $5.09,預設 high 則為 $1.79,多花這筆成本換到 6 點指數分數。我們的單次呼叫也呈現相同現象:Seed 2.0 Mini 的牌價低於 Qwen3.8 Flash,每個正確答案卻貴 3.4 倍,因為每項任務的思考 token 中位數為 2,810,Qwen 則是 530。
快取讀取成本占輸入價格的比例,DeepSeek 為 2%,Google、OpenAI、Anthropic 與 Alibaba 約為 10%,Z.ai 與 ByteDance 為 20%,Tencent 為 25%。對 agent 與 RAG 流量而言,也就是檢索增強生成,每次都把擷取到的文件貼入 prompt,快取讀取價格就是帳單關鍵:一段快取的 100K-token 前綴,每次呼叫在 DeepSeek V4.1 Flash 上只要 $0.0006,在 Sonnet 5 或 Terra 上則是 $0.02。OpenRouter 報告指出,V4.1 Flash 上線後某一天提供的 token 中,有 90% 是快取讀取(貼文)。批次方案會在數小時內回覆,並將 Gemini 3.8 Flash、GPT-5.6 Luna、Terra 與 Sonnet 5 的價格減半;Qwen3.8 Flash、GLM 5.3 Flash 與 Hy3 沒有批次方案。
該選哪款 Flash 模型?
重視性價比選 GLM 5.3 Flash,重視能力與多模態輸入選 Gemini 3.8 Flash,要求最少捏造答案選 Claude Sonnet 5,追求最低價格選 Seed 2.0 Mini。
| 問題 | 建議 | 原因 |
|---|---|---|
| 最划算 | GLM 5.3 Flash | 指數 41.9,僅次於 Terra,每項任務 $0.25;9 款中非幻覺率最高(72.4);$0.15 / $0.50;支援圖片、影片與檔案輸入;MIT 權重 |
| 綜合能力最強 | Gemini 3.8 Flash | 在 9 款中領先 Vals 與 Arena 文字榜;指數只比 Terra 低 1.1 分,每項任務成本低 11%;在 low 得到 33 / 33,並拒答所有虛構問題 |
| 多模態最佳 | Gemini 3.8 Flash | 支援音訊、影片與 PDF 輸入,音訊按文字價格計費;schema JSON 8 / 8 |
| 捏造最少且速度快 | Claude Sonnet 5 | 所有啟用思考的設定都是 33 / 33,開啟與關閉思考時都拒答全部 5 道虛構問題,2.2 秒產生第一個答案 token;每項任務最貴,適合捏造答案的代價高於呼叫成本的情境 |
| 最便宜 | Seed 2.0 Mini | $0.10 / $0.40;預設得到 33 / 33,schema JSON 8 / 8,拒答全部 5 道虛構問題,支援音訊與影片輸入 |
另外 3 款模型各因一項缺點未獲選。GPT-5.6 Terra 的指數最高,在 low 下得到 33 / 33,每個正確答案成本為 $0.00199,但輸出價格高達每百萬 token $12,仍捏造了 5 題中的 2 題。DeepSeek V4.1 Flash 在 LiveBench 居首,快取也最便宜,但只能讀取文字與圖片,開啟思考時捏造了 5 題中的 4 題。Qwen3.8 Flash 在我們的測試中,以最低成本拿到滿分,每個正確答案只要 $0.00046,Arena WebDev 也排名第一,但它捏造了 2 個答案,在嚴格 schema 下寫出錯誤整數,而且產生 400 字說明花了將近 3 分鐘。
不要只選一款模型,應該依請求路由:答案可核對的封閉式任務,交給通過測試的最低價模型(GLM 5.3 Flash、Qwen3.8 Flash、Hy3);開放式事實問題,交給願意拒答的模型(GLM 5.3 Flash、Sonnet 5、Gemini 3.8 Flash);長時間 agent 任務,則使用預算內能力最強的模型。
哪些 Flash 模型在預設設定下不合格?
9 款中有 2 款,但只要把開放式問題送到會拒答的設定,就能通過。採用門檻以模型出廠預設設定判定:任務至少答對 30 / 33,5 道虛構問題最多捏造 2 題。
| 模型 | 預設表現 | 調整方式 | 調整後 |
|---|---|---|---|
| DeepSeek V4.1 Flash | 捏造 5 題中的 4 題(「50 名員工」、「1790 °C」、把 Simpsons 角色當成獎項得主) | 開放式問題關閉思考 | 5 題全部拒答,但任務只得到 21 / 33,因此只把開放式問題送到這個設定 |
| GPT-5.6 Luna | 捏造 5 題中的 4 題(「約 20 名員工」、「1974」、「1,400 °C」) | 開放式問題關閉思考 | 拒答 5 題中的 4 題,但任務只得到 7 / 33,因此採用相同路由方式 |
GPT-5.6 Terra 與 Qwen3.8 Flash 剛好踩在門檻上,各自捏造 2 個答案。Terra 的答案包括「0 名員工」與「約 1,455 °C」,因此處理開放式問題時也應採用相同方式。
Flash 模型夠用嗎?還是需要更大型的模型?
有明確邊界的工作,Flash 已經夠用。在較短的 agent 基準中,模型會在 shell 內操作真實程式碼儲存庫。DeepSeek V4.1 Flash 在 Terminal-Bench 2.1(90.6 對 87.9)與 DeepSWE(74.2 對 62.7)都勝過 DeepSeek V4 Pro。Gemini 3.8 Flash 在 Terminal-Bench 2.1 得到 89.4,也高於 Claude Opus 5 的 89.1。9 款模型在我們的雙輪 tool calling 迴圈中,都是 3 次成功 3 次。
長時間任務與長 context 的差距仍然明顯。在 Terminal-Bench 4.0 中,Google 自己的表格顯示 Gemini 3.8 Flash 得到 19.1,Opus 5 則是 51.8。OpenAI 的多針檢索測試使用 512K 到 1M token,GPT-5.6 Luna 得到 41.3,GPT-5.6 Terra 則是 72.5。擁有 1M context window,不代表最小型模型能可靠回憶全部 1M token。Flash 模型適合擷取、分類、短工具步驟,以及形態已知的程式碼修改;長時間 agent 任務的規劃,以及針對超長文件的問題,仍應交給更大型的模型。
Flash 模型上正式環境後,最常壞在哪裡?
問題通常出在預設值與請求格式,而不是模型能力。
- 有 2 款模型無法關閉思考。我們嘗試的所有關閉設定,都讓 Gemini 3.8 Flash 與 GLM 5.3 Flash 回傳 400。
- 預設值分布在兩個極端。GLM 5.3 Flash 預設為
max,Qwen3.8 Flash 預設為xhigh(Alibaba 文件)。在我們的 5 道虛構問題中,Qwen3.8 Flash 使用的推理 token 中位數為 11,680。Google 會把思考 token 計入max_output_tokens,因此上限設得太緊,可能收到遭截斷甚至空白的答案,卻仍然會計費(思考指南)。 - Claude 使用自己的控制參數。Claude Sonnet 5 透過
output_config.effort設定思考深度,並拒絕舊版budget_tokens(effort 文件);它不支援reasoning_effort。 - 工具迴圈必須把推理內容送回去。DeepSeek 的思考模式要求帶上前幾輪的
reasoning_content(思考模式),Gemini 則會在 function-call part 附加 thought signature。重新建構訊息歷史的 framework 會遺失這兩者。 - 嚴格 JSON 的行為不一致。Qwen3.8 Flash 會遵守 schema 型別,卻在 8 次執行中的 5 次寫出錯誤整數(例如
-561994的明細項目)。Qwen、GLM、Hy3 與 DeepSeek 應使用json_object,並在 prompt 中指定欄位名稱;Claude 則使用 tool call。 - 思考會改變模型是否誠實。DeepSeek V4.1 Flash 開啟思考時捏造 5 題中的 4 題,關閉後一題也沒有。
- 模型 ID 會移動。自 9 月 10 日起,
deepseek-v4-flash已改為提供 V4.1 Flash(價格);Claude Haiku 4.5 最早可能於 10 月 15 日退役(棄用資訊)。若有日期版本,應固定使用,例如seed-2-0-mini-260428。 - 開放權重模型在第三方託管環境的表現不一。DeepSeek、GLM、Qwen 與 Hy3 由多家供應商提供,各自採用不同的量化方式與快取行為。9 月曾發現一家轉售商把付費請求導向較便宜的模型(Hacker News)。請將供應商回覆與模型原廠 API 的結果互相比對。
速度主要取決於預設思考設定,而不是模型大小。以下是 2026-09-17 使用各模型預設設定,以串流方式產生 400 字說明的結果,每款執行 3 次:
| 模型、預設設定 | 第一個答案 token | 總時間 | 每秒輸出 token |
|---|---|---|---|
| Claude Sonnet 5 | 2.2 s | 10.5 s | 70 |
| Gemini 3.8 Flash | 10.7 s | 14.3 s | 114 |
| GPT-5.6 Luna | 24.9 s | 26.1 s | 89 |
| GPT-5.6 Terra | 33.3 s | 34.2 s | 63 |
| GLM 5.3 Flash | 36.7 s | 39.3 s | 128 |
| DeepSeek V4.1 Flash | 40.4 s | 40.6 s | 158 |
| Seed 2.0 Mini | 61.3 s | 61.5 s | 81 |
| Hy3 | 123.0 s | 134.5 s | 35 |
| Qwen3.8 Flash | 159.9 s | 165.8 s | 72 |
每秒 token 數會把整次呼叫中的推理與答案一併計入。Sonnet 5 的 adaptive thinking 在寫作任務上沒有耗費思考 token,能立即開始作答;Qwen3.8 Flash 則使用了中位數 10,697 個推理 token,因此開放式 prompt 可能讓一款能低價處理封閉式任務的模型跑上好幾分鐘。
在 OpenAI 相容請求中,只要用一個欄位設定思考強度,思考用量則會回傳在 usage:
from openai import OpenAI
client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
r = client.chat.completions.create(
model="gemini-3.8-flash", # or glm-5.3-flash, gpt-5.6-terra, ...
reasoning_effort="low",
max_tokens=32768,
messages=[{"role": "user", "content": "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer."}],
)
u = r.usage
print(r.choices[0].message.content, u.completion_tokens, u.completion_tokens_details.reasoning_tokens)
Claude Sonnet 5 則要把相同請求送到 Messages API,並設定 output_config: {"effort": "low"}。
Synthorai 如何處理這些差異
上述每款模型都能透過同一個 endpoint,以單一 model ID 呼叫,支援 OpenAI 相容或 Anthropic 相容格式。模型比較頁面可並排比較任意兩款模型的價格、快取、輸入類型、context 與供應商基準。9 款模型的最新價格都列在模型價格比較頁面。
常見問題
Claude Sonnet 5 算 Flash 模型嗎? Anthropic 並未稱它為 Flash,但它是 Claude 當代產品線中最小的模型,因為 Claude Haiku 4.5 發布於 2025 年 10 月,且最早可能在 2026 年 10 月 15 日退役。Claude Sonnet 5 的價格是 $2 / $10,高於 Haiku 的 $1 / $5,但在我們的測試中,每個正確答案成本低 2.9 倍。
Gemini Flash API 免費嗎? Gemini 3.8 Flash 在 Google AI Studio 提供免費方案,但 Google 會使用免費方案內容改進其產品(價格),而服務歐洲經濟區、瑞士或英國使用者的應用程式只能使用付費服務(條款)。付費方案在 2026 年 12 月 31 日前為 $0.75 / $3.75,之後調為 $1.50 / $7.50。
該用 Gemini Flash 還是 Flash-Lite? 除非所有請求都是單步擷取,否則應選 Gemini 3.8 Flash。它在 Artificial Analysis 指數得到 41.2,Gemini 3.5 Flash-Lite 只有 23;在我們的測試中,每個正確答案成本低 3.9 倍;Flash-Lite 對 5 道虛構問題回答了 3 題,3.8 Flash 則全部拒答。Flash-Lite 的價格是 $0.30 / $2.50,約 4 秒即可作答。
該選 GPT-5.6 Luna 還是 GPT-5.6 Terra?
大量請求選 GPT-5.6 Luna,高難度推理選 GPT-5.6 Terra。Luna 的價格是 $0.20 / $1.20,預設得到 31 / 33,每個正確答案成本為 $0.00030;Terra 的價格是 $2 / $12,在 low 得到 33 / 33,每個正確答案成本為 $0.00199,並擁有 9 款模型中最高的指數分數。兩者在預設設定下都會捏造答案,Luna 是 5 題中的 4 題,Terra 是 2 題。
哪款 Flash 模型最適合寫程式? Qwen3.8 Flash、DeepSeek V4.1 Flash 與 GLM 5.3 Flash 在 Arena WebDev 領先,分數分別為 1635、1614 與 1607。DeepSeek 在 LiveBench 的 agentic coding 類別居首,得到 77.3;DeepSeek 與 Claude Sonnet 5 則在 Vals 的 Vibe Code Bench 領先,分數分別為 84.7 與 81.3。
相關文章:DeepSeek V4.1 Flash API 成本、GLM 5.3 API 成本、Gemini 3.7 Flash API 成本、跨供應商的 prompt 快取比較、依使用情境選擇最佳 LLM。