AI API 計費單位:從權杖到 PTU 小時的 17 種計量方式
目錄
AI API 至少使用 17 種不同單位計量用量:文字權杖、推理權杖、快取權杖、媒體輸入權杖、即時音訊權杖、字元、媒體分鐘數與秒數、輸出物件、請求、頁數、GPU 秒、容器小時、GB-day、token-hour、PTU-hour、訓練權杖,以及合成額度。只要產品使用一種以上的模態,成本估算就必須在多種單位之間換算,而預算最常錯在換算規則。本文整理每一種單位、計量方式,以及各自容易踩到的坑。
TL;DR
- AI API 至少使用 17 種不同單位計費,分成四層:用量、時間與容量、費率調整,以及合成包裝單位。
- 一分鐘音訊有兩種計費方式:專用語音轉文字服務每音訊分鐘收取 $0.0020 至 $0.0164,或由 gpt-realtime-2.1 按每聽到 100 ms 計 1 個音訊權杖。
- 光是儲存就有兩種計量方式:OpenAI file search 每 GB-day 收取 $0.10;Gemini 上下文快取每百萬權杖每小時收取 $0.50。
- 費率調整不會改變單位:batch 半價,DeepSeek 離峰再減半,限定美國區域的 Claude 推論費用為 1.1x。
AI API 使用哪些單位計費?
共有 17 種,以下章節依序介紹:用量單位(1 至 10)、時間與容量單位(11 至 16),以及合成包裝單位(17)。另外還有一層費率調整,只改變價格,不改變單位。下表可作為索引,每一列都連到深入說明。
| # | 單位 | 使用情境 | 容易踩到的坑 |
|---|---|---|---|
| 1 | 文字權杖 | 所有聊天 API | 同一段文字在不同 tokenizer 下的數量不同;tokenizer 換代後可能產生約多 30% 的權杖 |
| 2 | 推理權杖 | 推理模型 | 看不到的輸出也要計費;部分答案中占比達 88% 至 99.3% |
| 3 | 快取權杖 | Prompt caching | 寫入加價依 TTL 而定,讀取有折扣,而且各供應商都有最低門檻 |
| 4 | 媒體輸入權杖 | 圖像、音訊、PDF 輸入 | 同一張圖有三種換算方式;PDF 按圖像費率計費 |
| 5 | 即時音訊權杖 | 語音對語音 | 每聽到 100 ms 計 1 個權杖,每說出 50 ms 計 1 個權杖 |
| 6 | 字元 | TTS、防護機制 | 以每音訊分鐘計算,中文語音比英文便宜 3 至 7 倍 |
| 7 | 媒體分鐘數/秒數 | 語音轉文字、影片與音樂生成 | 準確率近似的模型之間,每音訊分鐘價差達 8 倍 |
| 8 | 輸出物件 | 圖像生成、人工評估 | 解析度相同時,調整品質參數可讓單張圖成本相差 36 倍 |
| 9 | 請求 | 網頁搜尋、grounding、file search | 每次搜尋 $0.01,另加注入的權杖,按模型輸入費率計費 |
| 10 | 頁數 | OCR、文件 AI | Mistral 每 1,000 頁計費,另可套用 batch 與快取折扣 |
| 11 | GPU 秒 | Serverless 模型託管 | 費率取決於顯示卡,從 $0.000225/s(T4)到 $0.001525/s(H100) |
| 12 | 容器/工作階段小時 | 程式碼執行、代管代理 | 最低計費 5 分鐘,預先載入檔案也會計費,即使工具從未執行 |
| 13 | GB-day | 檔案與向量儲存 | 免費 1 GB 後,每 GB-day 收取 $0.10 |
| 14 | Token-hour | 上下文快取儲存 | Gemini 每百萬權杖每小時收取 $0.50,2027 年將加倍 |
| 15 | PTU/model-unit 小時 | 預先配置容量 | 快取權杖不占容量;輸出權杖的容量權重高於輸入 |
| 16 | 訓練權杖 | 微調 | Epoch 會放大帳單;部分模型改按小時計費,每小時 $100 |
| 17 | 額度/CCU | 市集、訂閱方案 | 套在實際費率表上的換算係數;AWS Marketplace 上 100 CCU = $1.00 |
哪些單位用來計算實際用量?
17 種單位中有 10 種屬於用量單位。只要服務被使用,計量器就會累加,而不同模態各自選了不同的計量對象。
權杖類(單位 1 至 5)。 文字權杖是基準,但並不是單一固定單位。不同模型家族使用不同 tokenizer,因此同一段文字會算出不同數量。Anthropic 也明確指出,4.7 及後續版本的 tokenizer 對同一段文字產生的權杖數,比前一代多約 30%。推理權杖屬於通常看不到的輸出權杖;我們曾測得一個只有 10 個權杖的答案,實際計費 81 個權杖,其中 88% 是推理權杖。快取權杖按操作與快取存活時間(TTL)定價:Claude API 的 5 分鐘快取寫入費率為基礎輸入的 1.25x,1 小時寫入為 2x,讀取則為 0.1x。媒體輸入會依各供應商的公式換算成權杖:[同一張 1024x1024 圖像,在 GPT-5.6、Gemini 與 Claude 上分別計為 693、1,089 與 1,372 個權杖](/zh-TW/blog/image-input-token-cost/)。Gemini 對音訊的計量方式為每秒 25 個權杖,720p 影片則為每秒 5,792 個權杖,PDF 也按圖像權杖費率計費。即時語音另有自己的權杖:gpt-realtime-2.1 的計費方式是每 100 ms 使用者語音正好計 1 個音訊權杖,每 50 ms 模型語音計 1 個。
字元與時間(單位 6 和 7)。 文字轉語音(TTS)按字元計費,OpenAI 的價格為每百萬字元 $15 至 $30。因此,以每音訊分鐘計算時,中文語音比英文便宜 3 至 7 倍:相同說話時間需要的字元較少。Bedrock 的防護機制另定義了自己的字元單位,也就是最多 1,000 個字元的「text unit」。專用語音轉文字模型按音訊分鐘計費,我們測試的模型價格介於每分鐘 $0.0020 至 $0.0164;影片生成依解析度按秒計費;Gemini 則按歌曲為音樂定價。
物件、請求與頁數(單位 8 至 10)。 圖像生成會依品質層級按張計費,或按輸出權杖計費,兩種方式存在成本交叉點:輸出低於約 1,000 個權杖時,按權杖較便宜;超過後則是固定單張價格較划算。伺服器端工具按請求計費:我們測試的三個介面中,網頁搜尋每次都是 $0.01,搜尋結果之後還會再次算成輸入權杖,每次搜尋為 1,500 至 3,100 個。Gemini 的搜尋 grounding(允許模型在請求期間查詢 Google Search)還有額度門檻:每月前 5,000 次免費,之後每 1,000 次 $14。OCR 按頁計費。Bedrock 的模型評估則每個完成人工任務收取 $0.21,是這 17 種單位中唯一以人工任務計價的項目。
哪些單位改按時間或容量計費?
有 6 種單位是針對資源占用計費,不論是否真的有權杖流量。成本估算最容易漏掉這一層,因為程式什麼都沒做時,計量器仍可能持續累加。
- GPU 秒。 Serverless 託管服務依硬體類別計算模型執行時間。以 Replicate 為例,T4 每秒 $0.000225,H100 每秒 $0.001525。這個單位計算的是顯示卡,不是輸出內容。
- 容器與工作階段小時。 Anthropic 的程式碼執行服務在每月 1,550 個免費小時後,每容器小時收取 $0.05,每次執行最低計費 5 分鐘;OpenAI code interpreter 則依記憶體容量,按 20 分鐘工作階段計費,從 1 GB 的 $0.03 到 64 GB 的 $1.92。Claude 的代管代理每工作階段小時收取 $0.08,以毫秒計量,且只計算執行中的時間。
- GB-day 與 token-hour。 同一種儲存概念有兩種計量方式。OpenAI file search 儲存空間在免費 1 GB 後,每 GB-day 收取 $0.10;Gemini 明確式上下文快取的儲存費為每百萬權杖每小時 $0.50,2027 年將提高到 $1.00。忘記刪除的快取,就像多訂了一個自己都不知道的訂閱服務。
- PTU-hour 與 model unit。 預先配置容量不論流量多寡,都按單位小時計費。Azure 的 provisioned throughput unit(PTU)是與模型無關的配額,但不同模型有各自的最低部署規模。輸出權杖消耗的容量多於輸入權杖,快取權杖則完全不占容量,因此提高快取命中率可減少所需的 PTU 數量。Bedrock 也提供同類方案,稱為 model unit,需承諾使用 1 個月或 6 個月。
- 訓練權杖。 微調費用依訓練資料權杖數乘上 epoch 數計算,但也有按實際時間計費的例外。部分 OpenAI 模型的價格是每訓練小時 $100。
哪些因素只改變費率,不改變單位?
有 7 個因素會改變單位價格,但不會改變單位本身:batch 層級、服務層級、時間、上下文長度、地理位置、品質參數,以及免費額度。若計費程式每個模型只存一個價格,這 7 種情況都會算錯,因為同一個權杖會依處理方式、時間與地點套用不同價格。
| 調整因素 | 影響 | 範例 |
|---|---|---|
| Batch 層級 | 輸入與輸出減價 50% | Anthropic 與 OpenAI 的 batch API;Mistral OCR 也適用 |
| 服務層級 | 以較高價格換取速度 | OpenAI fast tier 為標準費率的 2x;flex tier 則有折扣 |
| 時間 | 離峰折扣 | DeepSeek:離峰價格是尖峰的一半;工作日尖峰時段為 UTC 01:00-04:00 與 06:00-10:00 |
| 上下文長度 | 超過門檻後費率跳升 | Gemini 費率會在 prompt 超過 200k 個權杖時提高;Claude 4.6+ 在完整 1M 上下文視窗內維持固定費率 |
| 地理位置 | 資料駐留加價 | Claude inference_geo: "us" 對所有權杖類別套用 1.1x;Bedrock 與 Google Cloud 上 Claude 模型的區域端點,比全球端點加價 10% |
| 品質參數 | 單位相同,用量不同 | 對一張 1024x1024 圖像調整 gpt-image 品質,會產生 196 至 7,024 個計費權杖 |
| 免費額度 | 超過門檻後費率跳升 | Grounding:每月 5,000 次免費請求;程式碼執行:每月 1,550 個免費小時 |
這些乘數可以疊加。Anthropic 明確指出,快取乘數可同時搭配 batch 折扣與資料駐留加價,因此一個經過快取、batch 處理,且限定美國區域的權杖,會一次套用三個係數。
什麼是額度與 CCU?
它們是包在實際計量單位外層的合成單位,適合需要在發票上合併成單一項目的情境。Claude 透過 AWS 或 Azure Marketplace 計費時,系統會先依一般單位價格換算成美元,再按每美元 100 個 Claude Consumption Units 的比例轉成 CCU。折扣會反映為較少的 CCU 用量,而不是降低每個 CCU 的價格。訂閱型產品也會用額度做同樣的事,甚至同一家公司的不同產品邊界也可能採用不同單位:ElevenLabs 的訂閱方案按額度計量,但明確表示 API 用量以美元計費,不使用額度。看到合成單位時,應先確認底層使用哪一種用量或容量計量方式,以及換算比例。
哪些進位規則與最低計費最容易踩坑?
這些是各種量化規則。由於它們分散在不同文件中,這裡統一整理:
- 程式碼執行容器的最低計費時間為 5 分鐘。只要請求中包含檔案,即使工具從未被呼叫,也會計入執行時間。
- Code interpreter 工作階段依 RAM 層級,以 20 分鐘為一個計費區塊。
- 即時語音每個音訊權杖量化為聽到 100 ms/說出 50 ms;啟用伺服器端語音活動偵測(VAD)時,60 秒靜音費用為零,而模型說話 2 秒後取消,仍會計費 4 秒。
- 圖像生成設定
n=4時,prompt 會重複計費 4 次;這個介面不支援 prompt caching。 - 影片權杖公式中會額外加 1 幀,而且編碼尺寸與標示尺寸不同:720p 會按 1248x704 計費。
- Prompt cache 設有各供應商自己的最低可快取長度;低於門檻時,仍要支付寫入加價,卻不會快取任何內容。
- 防護機制的 text unit 每 1,000 個字元無條件進位。
- 工具定義在工具被呼叫前就算輸入權杖:Anthropic 的工具使用系統 prompt 會依模型與工具選擇增加 286 至 804 個權杖,完整的電腦操作工具組則會增加約 4,500 個。
如何跨單位比較成本?
統一換算成每次使用者互動的美元成本,因為所有計量單位都能轉換成這個基準。
我們的語音代理研究就是這樣比較:串接式架構分別按音訊分鐘(STT)、權杖(LLM)與字元(TTS)計費,每對話分鐘成本為 $0.0037 至 $0.025;gpt-realtime-2.1 則是 $0.057,mini 版本為 $0.016。換算成同一單位後,就能直接比較即時架構的溢價與低延遲帶來的效益。這套方法適用於所有場景:先選定一次互動,例如一張客服工單、一份文件或一分鐘對話;接著以每一段流程的原生單位計量,套用當前費率後再比較。直接拿 $/1M tokens 和 $/audio-minute 相比,兩者根本不是同一類單位;改用 $/interaction 後,就只是算術問題。
閘道如何統一這些單位?
Synthorai 的做法是在請求發生時完成計價,並同時保留原生單位與美元金額。每次請求都會產生一筆用量紀錄,其中包含原生計量值(依類別拆分的權杖、秒數、字元、請求次數)、解析後的價格版本,以及計算出的成本。因此,每一筆發票明細都能反向拆解成單位乘以費率。這和 CCU 在市集邊界執行的換算相同,只是改成逐筆紀錄處理,而且保留可檢查性。這套設計也能搭配零保留模式:用量紀錄只需要計量值與內容雜湊,不需要保存 payload。上游調整價格時,價格版本會固定每筆歷史紀錄當時採用的費率表。如此一來,月底對帳是稽核,不是爭論。
常見問題
音訊權杖和文字權杖相同嗎?
不同。即時音訊權杖是獨立的計量單位,也有獨立價格。在 gpt-realtime-2.1 上,聽取語音每 100 ms 計 1 個權杖,輸出語音每 50 ms 計 1 個權杖,換算後為每分鐘聽取 $0.0192、每分鐘說話 $0.0768。即使在同一個模型內,音訊與文字仍使用不同的費率表。
為什麼同一張圖在不同供應商上會算出不同的權杖數?
因為換算方式不同,不是圖像不同。Patch 公式、設有上限的 tile,以及固定費用目前同時存在。同一張 1024x1024 圖像,在 GPT-5.6 上計為 693 個權杖、Gemini 為 1,089 個、Claude 為 1,372 個,而且檔案格式或內容完全不會改變權杖數。
快取權杖算輸入權杖嗎?
兩者分開計量,並依操作定價。快取寫入費率高於基礎輸入,Claude API 依 TTL 分別為 1.25x 或 2x;讀取則有 0.1x 折扣。對預先配置容量而言,這項差異有雙重影響:快取權杖不消耗 PTU 容量,因此快取不只降低帳單,也能減少必須預留的容量。
語音按字元計費還是按分鐘計費比較便宜?
取決於語言。按字元計費的 TTS 會讓中文語音以每音訊分鐘計算時,比英文便宜 3 至 7 倍,因為中文用較少字元就能表達更多語音內容;按分鐘計費則不受語言影響。語音轉文字方面,我們測試的按分鐘計費模型在乾淨語音上的準確率相近,價格介於每音訊分鐘 $0.0020 至 $0.0164。
本文引用的單位定義與費率,來自 2026-08-30 取得的供應商定價頁面,以及文中連結的實測研究。價格會變動,單位結構通常變得較慢,但在把任何數字寫入計費程式前,仍應先確認連結中的原始資料。
相關實測研究:權杖組成、prompt caching、快取最低門檻、圖像輸入權杖、圖像生成、語音轉文字、語音辨識、即時語音、影片生成、網頁搜尋、語音代理、tokenizer、各語言成本。