工程部落格
我們在打造 LLM API 閘道過程中遇到的真實工程問題。
GLM 5.2 Reasoning Effort:實測只要設對,成本就能降到 1/20
同一份程式答案,正確設定推理強度僅花費 $0.0031,GLM 5.2 採用不設上限的預設值則需 $0.062,前者成本低 20 倍、速度快 30 倍。本文比較兩種設定的差異,並說明如何依不同程式設計工作調整 reasoning effort,避免不必要的推理成本與等待時間。
Claude Fable 5 無法在 ZDR 下執行:強制保留資料 30 天
ZDR 組織呼叫 claude-fable-5 時會收到 400 錯誤:Claude API、Bedrock、Vertex 與 Foundry 均無法選擇退出。本文說明這對 HIPAA/COPPA 的影響,以及如何透過路由解決。
LLM 提示快取完整指南(2026):輸入成本降低 50-90%
解析 Claude、GPT、Gemini 與 DeepSeek 的提示快取運作方式,說明如何重複使用提示前綴,將輸入成本降低 50-90%,並讓首個權杖產生時間(TTFT)加快 3-10 倍。內容涵蓋快取架構、各供應商機制與差異比較,以及可實作的 Python 程式碼範例。
-
Claude Opus 5 與 Opus 4.8 實測:定價相同,費用相差 3 倍
Opus 5 與 Opus 4.8 都採用每百萬輸入/輸出權杖 $5/$25 的費率,但在開箱預設設定下執行完全相同的任務,Opus 5 的實際帳單卻高出 3.1 倍。本文逐項追查額外成本流向,並說明哪一個設定開關能縮小差距,讓兩款模型的費用回到相近水準。
-
語音轉文字 API:14 個模型,每分鐘 $0.002 到 $0.016
單一閘道整合 14 個語音轉文字 API,逐一比較每分鐘費率與即時串流支援情況,並將按 token 計費的 gpt-4o 音訊轉錄換算為可直接對照的每分鐘成本;另納入多數評比未涵蓋的中國 ASR 低價級距,方便檢視不同計費模式與地區方案的實際差異。
-
Gemini 3.6 Flash:實測思考檔位,成本相差 30 倍
Gemini 3.6 Flash 會對使用者看不見的推理內容計費,僅調整一項請求設定,就可能讓相同任務的成本相差最多 30 倍。本文實測五種任務類型,比較各設定下的推理用量與實際費用,並說明帳單數字背後容易忽略的限制與成本風險。
-
Seedance API 定價實測:完整推導影片權杖公式
實測 Seedance 依 W×H×(24s+1)/1024 計算影片權杖,並精確推導到單一權杖。720p 實際以 1248×704 解析度計費;4K 雖採用較低的權杖費率,但因解析度增加,每秒成本仍是 720p 的 2.1 倍。
-
GPT-5.6 提示詞指南:兩個預設值讓費用變成 1.5 倍與 10 倍
GPT-5.6 的預設設定成本偏高:省略 reasoning_effort 時,計費為設為「none」的 1.5 倍;未標記的固定前綴成本更達快取讀取的 10 倍。本文整理經實測的請求結構指南,說明如何明確設定推理強度、標記可快取前綴,並比較不同請求形式的費用差異。
-
Kimi K3 API 實測價格:關閉「永遠開啟」的推理
Kimi K3 文件聲稱無法停用推理,但將 reasoning_effort 設為 'none' 確實有效,可讓簡單查詢的成本降至原本六分之一。實測並比較不同推理強度設定、快取最低門檻,以及 9 種語言各自的費率,釐清文件說法與實際 API 行為的差異。
-
GPT Realtime API 定價:說話成本是聆聽的 4 倍(實測)
gpt-realtime-2.1 聆聽費用為每分鐘 0.019 美元,說話費用為每分鐘 0.077 美元;靜音期間不計費,快取重播成本僅為原價的 1/80。本文整理實測每分鐘費率、快取運作機制,並比較不同聆聽、說話與靜音時間組合的情境成本。
-
LLM 權杖用量:為什麼 4 個權杖的答案會按 217 個權杖計費
實測 GPT-5.6、Claude Fable 5、Qwen3.7-max 與另外五個模型家族,共八個家族的用量與計費資料,發現推理內容占輸出費用最大比重。本文逐一解析各項用量欄位的定義與判讀方式,並說明如何設定上限,避免推理用量超出預期。
-
提示詞快取最低門檻:文件低估了 1.4–2.4 倍
各家供應商會公布提示詞快取生效所需的最低 token 數。跨多個 LLM 系列實測顯示,自動快取實際需要的提示詞長度是官方文件門檻的 1.4–2.4 倍,不能只依標示值估算;相較之下,Claude 的明確快取門檻可精確符合文件規格。
-
GPT-5.6 成本指南:Prompt caching 省 90%,以及 reasoning effort 的影響
實測 GPT-5.6 的兩項成本控制因素:明確設定 breakpoint 後,已快取的輸入僅按標準費率的 10% 計費;若未傳送 reasoning_effort 參數,費用則為設為 none 時的 1.5 倍,兩者都會直接影響 API 使用成本。
-
你的語言用哪個 LLM 最便宜?實測 tokenizer 成本
GPT-5.5 對歐洲語言計入的 token 最少,中文以 Kimi 最省,日文則是 DeepSeek;Claude Fable 5、Opus 4.8 與 Sonnet 5 的用量高出 1.2-2.3x。本文提供實測結果。
-
Claude Fable 5 用於 Agent:工具呼叫遭拒、成本與 GLM 5.2 比較
以五種 Agent 工作負載比較 Claude Fable 5、glm-5.2、opus-4-8 與 sonnet-5,分析工具呼叫途中遭拒、適應性思考機制,以及成本如何因工作負載形態產生 5 至 15 倍差距,呈現各模型在不同 Agent 任務下的效能與成本變化。
-
LangChain 提示詞快取:真正能命中快取的設定方式
LangChain 最方便的語法會默默停用 Claude 的提示詞快取。本文以實測說明修正方式:改用內容區塊設定 cache_control、調整變數在提示詞中的位置,並正確讀取 usage 欄位,確認快取是否命中及 Token 使用量,避免因語法選擇而失去快取效益。
-
Claude Sonnet 5 的新 tokenizer:相同 prompt 多出 41% token
Claude Sonnet 5 採用新的 tokenizer,同一段文字轉換後的 token 數比 Sonnet 4.6 多出約 41%,因此即使輸入內容完全相同,也會提高閘道上的計費成本與預算用量,並可能改變請求是否符合快取資格及其判定結果。
-
Agent 迴圈中的 GLM 5.2 工具呼叫:「OpenAI 相容」沒說清楚的事
GLM 5.2 支援 OpenAI 工具呼叫 API,但回應文字會與工具呼叫一同傳送,推理內容也直接顯示於同一輪對話。本文逐項比較其訊息格式、工具呼叫流程與推理呈現方式,並說明它和 OpenAI、Anthropic 模型在 API 相容性及回應結構上的具體差異。
-
語音轉文字 API 成本:用同一組音訊實測 7 個模型
以同一組多語音訊透過單一閘道測試 7 個語音轉文字模型,每分鐘成本介於 $0.0020 至 $0.0164,最高費率是最低費率的 8.2 倍。比較結果顯示,模型間的主要差異並非準確度,而是處理相同音訊時的計費成本。
-
圖片生成 API 成本:5 個模型實測比較($0.006–$0.039)
5 個圖片模型採用相同提示詞,透過單一閘道進行實測比較;預設設定下,每張圖片成本介於 $0.006 至 $0.039。另檢視品質參數對費用的影響,其中一個模型僅調整 quality 設定,單張帳單便可相差 36 倍,呈現模型、預設值與品質選項之間的實際成本差異。
-
開放權重 LLM 快取:成效為何取決於供應商運氣
對開放權重 LLM 而言,推論引擎已解決提示詞快取,但請求經路由分散後,快取命中率與效益可能失效。本文以 DeepSeek、Qwen、Kimi 的實測結果,整理從模型、推論引擎到路由機制的五層架構圖,逐層比較快取在哪裡建立、如何被共用,以及路由為何會破壞既有快取。
-
Claude Fable 5 快取:相同機制,帳單卻是 Opus 4.6 的 2.9 倍
Claude Fable 5 已在 Synthorai 上線。本文實測提示詞快取、TTL、權杖化與使用成本,並與 Opus 4.6、4.8 比較;其快取合約維持相同,但採用新版權杖化器,實際帳單金額約為 Opus 系列的 2.9 倍。
-
供應商漂移:預設路由如何推高 LLM 成本
多供應商閘道採用預設路由時,相同請求會被分散至不同上游,而各上游使用彼此獨立、互不共享的快取,導致重複內容無法沿用既有結果。原本可直接命中的請求因路由分流而再次執行,快取命中率大幅下降,並增加各供應商的重複運算、權杖用量與整體帳單成本。
-
你的 LLM 閘道有沒有謊報快取?5 分鐘完成稽核
閘道可能回報快取命中,實際計費卻仍按完整原價收取。只要一支腳本,五分鐘內即可同時稽核DeepSeek的自動快取與Claude的標記式快取,交叉比對快取命中回報、請求計費及兩種快取機制的結果,確認命中後是否確實套用快取價格,避免只顯示命中卻未降低費用。
-
Synthorai 上的 Claude Opus 4.8:快取與 TTL 對比 4.7/4.6
Claude Opus 4.8 已在 Synthorai 上線。本文實測提示快取與 TTL 行為,並與 Opus 4.7、4.6 逐項比較,整理哪些設定與結果可沿用,以及 tokenizer 變更後必須重新檢查的項目與差異。
-
依使用情境選擇最佳 LLM(2026):聊天、RAG 與 Agent 成本矩陣
聊天、RAG 還是 AI 代理?在效能達標的前提下選出成本最低的模型,並以 15 步代理任務、每日 10 萬次查詢的 RAG 為例,估算實際模型用量與費用;再透過決策矩陣比較三種應用模式的成本、效能與適用情境,協助依工作負載做出選擇。
-
Python LLM 提示詞快取:可直接執行的程式碼教學
透過 Synthorai 的 OpenAI 相容閘道,實測 Claude、GPT-5、Gemini 2.5、DeepSeek-v4 與 Qwen3 共五款模型的提示詞快取成本節省,並依真實請求比較 usage.cost 與首個權杖回應時間(TTFT),呈現各模型的實際費用與延遲差異。
-
哪家 LLM 提示詞快取最便宜?5 家供應商比較(2026)
並列實測 Claude、GPT-5.x、Gemini、DeepSeek 與 Qwen 的五種快取設計,比較顯式與自動快取、5 分鐘與 1 小時 TTL,以及快取讀取費率。各模型讀取成本為原價的 0.1x 至 0.5x,可直接看出保存時間、觸發方式與費率差異。
-
LLM 提示詞快取如何運作:KV Cache 與 TTL 詳解
深入解析 LLM 提示詞快取的運作方式:說明 Transformer 注意力機制如何重用前綴提示詞的 Key/Value 張量,避免重複計算;並拆解記憶體容量與運算成本如何影響快取 TTL,以及 K/V 重用為何能降低推論費用、縮短首個 Token 產生時間(TTFT)。