工程部落格
我們在打造多模態 AI 閘道過程中遇到的真實工程問題。
從這裡開始
GLM 5.2 Reasoning Effort:實測只要設對,成本就能降到 1/20
同一份程式答案,正確設定推理強度僅花費 $0.0031,GLM 5.2 採用不設上限的預設值則需 $0.062,前者成本低 20 倍、速度快 30 倍。本文比較兩種設定的差異,並說明如何依不同程式設計工作調整 reasoning effort,避免不必要的推理成本與等待時間。
Claude Fable 5 無法在 ZDR 下執行:強制保留資料 30 天
ZDR 組織呼叫 claude-fable-5 時會收到 400 錯誤:Claude API、Bedrock、Vertex 與 Foundry 均無法選擇退出。本文說明這對 HIPAA/COPPA 的影響,以及如何透過路由解決。
LLM 提示快取完整指南(2026):輸入成本降低 50-90%
解析 Claude、GPT、Gemini 與 DeepSeek 的提示快取運作方式,說明如何重複使用提示前綴,將輸入成本降低 50-90%,並讓首個權杖產生時間(TTFT)加快 3-10 倍。內容涵蓋快取架構、各供應商機制與差異比較,以及可實作的 Python 程式碼範例。
全部文章45
-
GPT-6 Astra 推理強度:max 同答案,成本是 low 的 2.3x
針對 11 個已驗證任務的實測:none 在 33 次執行中失敗 17 次,disabled 並未停用推理,max 的成本是 low 的 2.3 倍,Astra 每個正確答案的成本是 GPT-5.6 Sol 的 1.6 倍。
-
LLM API 速率限制:比較 13 家供應商,2 個 SDK 不重試 429
整理 13 個 LLM API 與雲端平台的速率限制差異,逐一比較 RPM、TPM 各自納入哪些權杖、哪些服務會回傳用量與限流標頭,並解析 HTTP 429 可能代表的四種情況,以及兩個遇到 429 後完全不會自動重試的 SDK,協助判斷配額、節流與重試行為。
-
長上下文定價最高差 6.7x,閘道頁面卻不顯示
透過單一聚合商實測 9 個分級定價模型:請求超過頁面未揭露的門檻後,最高按頁面價格的 6.7 倍計費,另有一個 endpoint 按標價的 1.25 倍計費。本文比對頁面與帳單,整理各家分級規則,並給出讓請求留在門檻內的設定。
-
AI API 計費單位:從權杖到 PTU 小時的 17 種計量方式
同一筆 API 費用可能採用 17 種計量方式,涵蓋權杖、字元、分鐘、GB-day、token-hour 與 PTU-hour。本文逐一解析各單位的換算、用量彙整與帳單核對方式,並整理計費程式常見陷阱,協助避免單位混用、時間區間誤判及儲存或運算用量重複計費。
-
翻譯最佳 LLM:9 個模型、9 種語言,成本相差 400 倍
9 個 LLM、9 種語言、8,455 次盲測判定:gpt-5.6-sol 在 9 種語言中的 7 種領先,gemini-3.7-flash 在韓文打平、義大利文勝出;每 100 萬字元成本從 $0.26 到 $104。
-
LLM 資料保留與 ZDR:誰能讀取你的提示詞
API 供應商通常約 30 天後刪除日誌,但追蹤 SaaS、向量記憶與閘道主控台可能持續保留提示詞,直到你手動刪除。本文釐清零資料保留(ZDR)實際涵蓋哪些供應商端資料、哪些第三方工具不適用,以及 API 日誌刪除與應用程式資料留存的差異。
-
LLM 結構化輸出實測:12 個 API 中 4 個回傳正確格式、錯誤值
實測 12 個大型語言模型(LLM)API 的結構化輸出:所有回應均產生 100% 符合 schema 的 JSON,但其中 4 個模型開啟思考模式後仍填入錯誤值。同一筆 API 請求的計費量差異顯著,從 30 到 4,959 個提示詞元(prompt token)不等。
-
哪些 API 會標記 AI 內容?16 款實測對照 10 項法規
實測 16 款生成式 API 對照 10 項標記法規:7 款嵌入 C2PA,4 款嵌入中國標籤,沒有任何一款同時具備兩者。所有音訊與影片輸出皆未含標記,影像經縮放後也沒有任何 C2PA manifest 能保留,顯示格式支援與後製耐受性均有明顯缺口。
-
語音代理 API 成本:10 分鐘通話要 $0.04 至 $0.57
逐段實測語音通話成本:STT 每分鐘 $0.002-0.006、TTS 每音訊分鐘 $0.004-0.034,並納入 LLM 每回合對話與 GPT Realtime 費用。以每通電話為單位,比較 STT、LLM、TTS 串接架構與端對端語音對語音架構的完整定價差異。
-
實測 DeepSeek V4 Pro GA 與 Preview:思考量少 18-62%
以相同任務比較 deepseek-v4-pro-0813 與 Preview 預覽版本:新版使用的推理 token 減少 18-62%,並修正推理失控後固定耗盡 8,192 token 的問題;然而,面對無法確定的內容時,原本會回答「我不知道」的行為也消失了。
-
Gemini 3.7 Flash API 實測:任務成本比 3.6 低 2.5-8 倍
gemini-3.7-flash 上線首日實測:12 月 31 日前享半價,思考量較 3.6 減少 26% 至 77%,且取消思考關閉選項;預填測試回傳 400 錯誤。不同任務的帳單成本降低至原本的 1/2.5 至 1/8,並整理新舊模型在思考用量、控制功能與 API 行為上的差異。
-
一張圖片算幾個權杖?15 個 API 實測:6 到 1,298
同一個 64px 圖示在 GPT-5.6 僅計為 6 個權杖,在 ByteDance Seed 卻計為 1,298 個,相差逾 216 倍。比較三種計費方式與三條失準的文件規則後可見,實際花費由各模型的權杖計價費率決定,而非圖片尺寸或內容本身。
-
LLM 思考控制實測:13 個模型如何接受、忽略或強制執行
reasoning_effort 與 thinking_budget 在 13 個 LLM API 中的表現:三家供應商會嚴格按照 token 執行預算,其他則默默忽略它們,設定上限為 16 可能會燒掉 97。
-
Web 搜尋與網頁擷取 API:運作方式與 $0.01 的實際成本
解析伺服器端 Web 搜尋與網頁擷取的計費方式:每次收取 $0.01,另將 1,500 至 3,100 個搜尋結果 token 注入內容,並依所用模型的 token 費率計價;若對話進入第二輪,系統可能再次執行搜尋,因此會新增搜尋費用與結果 token 成本。
-
實測 Qwen-Image 3.0 API:$0.03 一張圖生成 9 個場景
首日實測 qwen-image-3.0:每張圖片收費 $0.03,即使提示詞長達 5,000 token 也不另計費;同一張圖完成真正的九合一組合並非噱頭,但生成細小文字時,連文字本身都可能出現拼字錯誤,呈現模型在成本、長提示詞與文字準確度上的差異。
-
DeepSeek V4 Flash API 成本:思考模式會破壞嚴格 JSON
0731 模型首日實測:輸入/輸出牌價分別為 $0.14/$0.28,快取以 1,024-token 為一頁;另發現思考模式搭配嚴格 json_schema 時會造成整數損毀,13 次測試中有 8 次出錯,失敗率約 61.5%。
-
Qwen 3.8 Max API 定價:16 個思考 token 勝過關閉思考
qwen3.8-max 上線首日實測,定價為輸入/輸出每百萬 token 2/6 美元;effort 旋鈕實際控制的是預算上限。關閉思考後,正確率驟降至原本的 1/6;只要補上 16 個 token 的思考預算,就能修復這項準確率崩跌問題。
-
MCP 工具額外成本實測:26 個工具,每次呼叫 $0.03
每次呼叫都會將所有 MCP 工具重新計入輸入 token,並按完整工具定義重複計費:Claude 上一個小型工具占 401 個 token,GitHub 伺服器每次呼叫成本為 0.03 美元;不同模型系列的 token 用量差距可達 2.7 倍,工具越多,每次請求累積的輸入成本也越高。
-
Prompt 快取寫入成本:1.25x 溢價何時划算?
同一套實測 AI agent、同一種進階方案,RAG 工作負載成本增加 6%,批次處理則節省 83%。差異取決於讀取與寫入的比例;可在帳單產生前先量測實際讀寫比,判斷應用屬於 RAG 或批次情境,並估算成本增減與方案是否划算。
-
Claude Opus 5 與 Opus 4.8 實測:定價相同,費用相差 3 倍
Opus 5 與 Opus 4.8 都採用每百萬輸入/輸出權杖 $5/$25 的費率,但在開箱預設設定下執行完全相同的任務,Opus 5 的實際帳單卻高出 3.1 倍。本文逐項追查額外成本流向,並說明哪一個設定開關能縮小差距,讓兩款模型的費用回到相近水準。
-
語音轉文字 API:14 個模型,每分鐘 $0.002 到 $0.016
單一閘道整合 14 個語音轉文字 API,逐一比較每分鐘費率與即時串流支援情況,並將按 token 計費的 gpt-4o 音訊轉錄換算為可直接對照的每分鐘成本;另納入多數評比未涵蓋的中國 ASR 低價級距,方便檢視不同計費模式與地區方案的實際差異。
-
Gemini 3.6 Flash:實測思考檔位,成本相差 30 倍
Gemini 3.6 Flash 會對使用者看不見的推理內容計費,僅調整一項請求設定,就可能讓相同任務的成本相差最多 30 倍。本文實測五種任務類型,比較各設定下的推理用量與實際費用,並說明帳單數字背後容易忽略的限制與成本風險。
-
Seedance API 定價實測:完整推導影片權杖公式
實測 Seedance 依 W×H×(24s+1)/1024 計算影片權杖,並精確推導到單一權杖。720p 實際以 1248×704 解析度計費;4K 雖採用較低的權杖費率,但因解析度增加,每秒成本仍是 720p 的 2.1 倍。
-
GPT-5.6 提示詞指南:兩個預設值讓費用變成 1.5 倍與 10 倍
GPT-5.6 的預設設定成本偏高:省略 reasoning_effort 時,計費為設為「none」的 1.5 倍;未標記的固定前綴成本更達快取讀取的 10 倍。本文整理經實測的請求結構指南,說明如何明確設定推理強度、標記可快取前綴,並比較不同請求形式的費用差異。
-
Kimi K3 API 實測價格:關閉「永遠開啟」的推理
Kimi K3 文件聲稱無法停用推理,但將 reasoning_effort 設為 'none' 確實有效,可讓簡單查詢的成本降至原本六分之一。實測並比較不同推理強度設定、快取最低門檻,以及 9 種語言各自的費率,釐清文件說法與實際 API 行為的差異。
-
GPT Realtime API 定價:說話成本是聆聽的 4 倍(實測)
gpt-realtime-2.1 聆聽費用為每分鐘 0.019 美元,說話費用為每分鐘 0.077 美元;靜音期間不計費,快取重播成本僅為原價的 1/80。本文整理實測每分鐘費率、快取運作機制,並比較不同聆聽、說話與靜音時間組合的情境成本。
-
LLM 權杖用量:為什麼 4 個權杖的答案會按 217 個權杖計費
實測 GPT-5.6、Claude Fable 5、Qwen3.7-max 與另外五個模型家族,共八個家族的用量與計費資料,發現推理內容占輸出費用最大比重。本文逐一解析各項用量欄位的定義與判讀方式,並說明如何設定上限,避免推理用量超出預期。
-
提示詞快取最低門檻:文件低估了 1.4-2.4 倍
各家供應商會公布提示詞快取生效所需的最低 token 數。跨多個 LLM 系列實測顯示,自動快取實際需要的提示詞長度是官方文件門檻的 1.4-2.4 倍,不能只依標示值估算;相較之下,Claude 的明確快取門檻可精確符合文件規格。
-
GPT-5.6 成本指南:Prompt caching 省 90%,以及 reasoning effort 的影響
實測 GPT-5.6 的兩項成本控制因素:明確設定 breakpoint 後,已快取的輸入僅按標準費率的 10% 計費;若未傳送 reasoning_effort 參數,費用則為設為 none 時的 1.5 倍,兩者都會直接影響 API 使用成本。
-
你的語言用哪個 LLM 最便宜?實測 tokenizer 成本
GPT-5.5 對歐洲語言計入的 token 最少,中文以 Kimi 最省,日文則是 DeepSeek;Claude Fable 5、Opus 4.8 與 Sonnet 5 的用量高出 1.2-2.3x。本文提供實測結果。
-
Claude Fable 5 用於 Agent:工具呼叫遭拒、成本與 GLM 5.2 比較
以五種 Agent 工作負載比較 Claude Fable 5、glm-5.2、opus-4-8 與 sonnet-5,分析工具呼叫途中遭拒、適應性思考機制,以及成本如何因工作負載形態產生 5 至 15 倍差距,呈現各模型在不同 Agent 任務下的效能與成本變化。
-
LangChain 提示詞快取:真正能命中快取的設定方式
LangChain 最方便的語法會默默停用 Claude 的提示詞快取。本文以實測說明修正方式:改用內容區塊設定 cache_control、調整變數在提示詞中的位置,並正確讀取 usage 欄位,確認快取是否命中及 Token 使用量,避免因語法選擇而失去快取效益。
-
Claude Sonnet 5 的新 tokenizer:相同 prompt 多出 41% token
Claude Sonnet 5 採用新的 tokenizer,同一段文字轉換後的 token 數比 Sonnet 4.6 多出約 41%,因此即使輸入內容完全相同,也會提高閘道上的計費成本與預算用量,並可能改變請求是否符合快取資格及其判定結果。
-
Agent 迴圈中的 GLM 5.2 工具呼叫:「OpenAI 相容」沒說清楚的事
GLM 5.2 支援 OpenAI 工具呼叫 API,但回應文字會與工具呼叫一同傳送,推理內容也直接顯示於同一輪對話。本文逐項比較其訊息格式、工具呼叫流程與推理呈現方式,並說明它和 OpenAI、Anthropic 模型在 API 相容性及回應結構上的具體差異。
-
語音轉文字 API 成本:用同一組音訊實測 7 個模型
以同一組多語音訊透過單一閘道測試 7 個語音轉文字模型,每分鐘成本介於 $0.0020 至 $0.0164,最高費率是最低費率的 8.2 倍。比較結果顯示,模型間的主要差異並非準確度,而是處理相同音訊時的計費成本。
-
圖片生成 API 成本:5 個模型實測比較($0.006-$0.039)
5 個圖片模型採用相同提示詞,透過單一閘道進行實測比較;預設設定下,每張圖片成本介於 $0.006 至 $0.039。另檢視品質參數對費用的影響,其中一個模型僅調整 quality 設定,單張帳單便可相差 36 倍,呈現模型、預設值與品質選項之間的實際成本差異。
-
開放權重 LLM 快取:成效為何取決於供應商運氣
對開放權重 LLM 而言,推論引擎已解決提示詞快取,但請求經路由分散後,快取命中率與效益可能失效。本文以 DeepSeek、Qwen、Kimi 的實測結果,整理從模型、推論引擎到路由機制的五層架構圖,逐層比較快取在哪裡建立、如何被共用,以及路由為何會破壞既有快取。
-
Claude Fable 5 快取:相同機制,帳單卻是 Opus 4.6 的 2.9 倍
Claude Fable 5 已在 Synthorai 上線。本文實測提示詞快取、TTL、權杖化與使用成本,並與 Opus 4.6、4.8 比較;其快取合約維持相同,但採用新版權杖化器,實際帳單金額約為 Opus 系列的 2.9 倍。
-
供應商漂移:預設路由如何推高 LLM 成本
多供應商閘道採用預設路由時,相同請求會被分散至不同上游,而各上游使用彼此獨立、互不共享的快取,導致重複內容無法沿用既有結果。原本可直接命中的請求因路由分流而再次執行,快取命中率大幅下降,並增加各供應商的重複運算、權杖用量與整體帳單成本。
-
你的 LLM 閘道有沒有謊報快取?5 分鐘完成稽核
閘道可能回報快取命中,實際計費卻仍按完整原價收取。只要一支腳本,五分鐘內即可同時稽核DeepSeek的自動快取與Claude的標記式快取,交叉比對快取命中回報、請求計費及兩種快取機制的結果,確認命中後是否確實套用快取價格,避免只顯示命中卻未降低費用。
-
Synthorai 上的 Claude Opus 4.8:快取與 TTL 對比 4.7/4.6
Claude Opus 4.8 已在 Synthorai 上線。本文實測提示快取與 TTL 行為,並與 Opus 4.7、4.6 逐項比較,整理哪些設定與結果可沿用,以及 tokenizer 變更後必須重新檢查的項目與差異。
-
依使用情境選擇最佳 LLM(2026):聊天、RAG 與 Agent 成本矩陣
聊天、RAG 還是 AI 代理?在效能達標的前提下選出成本最低的模型,並以 15 步代理任務、每日 10 萬次查詢的 RAG 為例,估算實際模型用量與費用;再透過決策矩陣比較三種應用模式的成本、效能與適用情境,協助依工作負載做出選擇。
-
Python LLM 提示詞快取:可直接執行的程式碼教學
透過 Synthorai 的 OpenAI 相容閘道,實測 Claude、GPT-5、Gemini 2.5、DeepSeek-v4 與 Qwen3 共五款模型的提示詞快取成本節省,並依真實請求比較 usage.cost 與首個權杖回應時間(TTFT),呈現各模型的實際費用與延遲差異。
-
哪家 LLM 提示詞快取最便宜?5 家供應商比較(2026)
並列實測 Claude、GPT-5.x、Gemini、DeepSeek 與 Qwen 的五種快取設計,比較顯式與自動快取、5 分鐘與 1 小時 TTL,以及快取讀取費率。各模型讀取成本為原價的 0.1x 至 0.5x,可直接看出保存時間、觸發方式與費率差異。
-
LLM 提示詞快取如何運作:KV Cache 與 TTL 詳解
深入解析 LLM 提示詞快取的運作方式:說明 Transformer 注意力機制如何重用前綴提示詞的 Key/Value 張量,避免重複計算;並拆解記憶體容量與運算成本如何影響快取 TTL,以及 K/V 重用為何能降低推論費用、縮短首個 Token 產生時間(TTFT)。
該主題下暫無文章。