新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
AI API 計費單位:從權杖到 PTU 小時的 17 種計量方式

AI API 計費單位:從權杖到 PTU 小時的 17 種計量方式

目錄
  1. AI API 使用哪些單位計費?
  2. 哪些單位用來計算實際用量?
  3. 哪些單位改按時間或容量計費?
  4. 哪些因素只改變費率,不改變單位?
  5. 什麼是額度與 CCU?
  6. 哪些進位規則與最低計費最容易踩坑?
  7. 如何跨單位比較成本?
  8. 閘道如何統一這些單位?
  9. 常見問題

AI API 至少使用 17 種不同單位計量用量:文字權杖、推理權杖、快取權杖、媒體輸入權杖、即時音訊權杖、字元、媒體分鐘數與秒數、輸出物件、請求、頁數、GPU 秒、容器小時、GB-day、token-hour、PTU-hour、訓練權杖,以及合成額度。只要產品使用一種以上的模態,成本估算就必須在多種單位之間換算,而預算最常錯在換算規則。本文整理每一種單位、計量方式,以及各自容易踩到的坑。

TL;DR

  • AI API 至少使用 17 種不同單位計費,分成四層:用量、時間與容量、費率調整,以及合成包裝單位。
  • 一分鐘音訊有兩種計費方式:專用語音轉文字服務每音訊分鐘收取 $0.0020 至 $0.0164,或由 gpt-realtime-2.1 按每聽到 100 ms 計 1 個音訊權杖。
  • 光是儲存就有兩種計量方式:OpenAI file search 每 GB-day 收取 $0.10;Gemini 上下文快取每百萬權杖每小時收取 $0.50。
  • 費率調整不會改變單位:batch 半價,DeepSeek 離峰再減半,限定美國區域的 Claude 推論費用為 1.1x。

AI API 使用哪些單位計費?

共有 17 種,以下章節依序介紹:用量單位(1 至 10)、時間與容量單位(11 至 16),以及合成包裝單位(17)。另外還有一層費率調整,只改變價格,不改變單位。下表可作為索引,每一列都連到深入說明。

AI API 計費單位全覽:十種用量單位,從文字權杖到頁數;六種時間與容量單位,從 GPU 秒到訓練權杖;以額度和 CCU 作為合成包裝單位;側邊另列 batch 折扣、免費額度門檻等費率調整

#單位使用情境容易踩到的坑
1文字權杖所有聊天 API同一段文字在不同 tokenizer 下的數量不同;tokenizer 換代後可能產生約多 30% 的權杖
2推理權杖推理模型看不到的輸出也要計費;部分答案中占比達 88% 至 99.3%
3快取權杖Prompt caching寫入加價依 TTL 而定,讀取有折扣,而且各供應商都有最低門檻
4媒體輸入權杖圖像、音訊、PDF 輸入同一張圖有三種換算方式;PDF 按圖像費率計費
5即時音訊權杖語音對語音每聽到 100 ms 計 1 個權杖,每說出 50 ms 計 1 個權杖
6字元TTS、防護機制以每音訊分鐘計算,中文語音比英文便宜 3 至 7 倍
7媒體分鐘數/秒數語音轉文字、影片與音樂生成準確率近似的模型之間,每音訊分鐘價差達 8 倍
8輸出物件圖像生成、人工評估解析度相同時,調整品質參數可讓單張圖成本相差 36 倍
9請求網頁搜尋、grounding、file search每次搜尋 $0.01,另加注入的權杖,按模型輸入費率計費
10頁數OCR、文件 AIMistral 每 1,000 頁計費,另可套用 batch 與快取折扣
11GPU 秒Serverless 模型託管費率取決於顯示卡,從 $0.000225/s(T4)到 $0.001525/s(H100)
12容器/工作階段小時程式碼執行、代管代理最低計費 5 分鐘,預先載入檔案也會計費,即使工具從未執行
13GB-day檔案與向量儲存免費 1 GB 後,每 GB-day 收取 $0.10
14Token-hour上下文快取儲存Gemini 每百萬權杖每小時收取 $0.50,2027 年將加倍
15PTU/model-unit 小時預先配置容量快取權杖不占容量;輸出權杖的容量權重高於輸入
16訓練權杖微調Epoch 會放大帳單;部分模型改按小時計費,每小時 $100
17額度/CCU市集、訂閱方案套在實際費率表上的換算係數;AWS Marketplace 上 100 CCU = $1.00

哪些單位用來計算實際用量?

17 種單位中有 10 種屬於用量單位。只要服務被使用,計量器就會累加,而不同模態各自選了不同的計量對象。

權杖類(單位 1 至 5)。 文字權杖是基準,但並不是單一固定單位。不同模型家族使用不同 tokenizer,因此同一段文字會算出不同數量。Anthropic 也明確指出,4.7 及後續版本的 tokenizer 對同一段文字產生的權杖數,比前一代多約 30%。推理權杖屬於通常看不到的輸出權杖;我們曾測得一個只有 10 個權杖的答案,實際計費 81 個權杖,其中 88% 是推理權杖。快取權杖按操作與快取存活時間(TTL)定價:Claude API 的 5 分鐘快取寫入費率為基礎輸入的 1.25x,1 小時寫入為 2x,讀取則為 0.1x。媒體輸入會依各供應商的公式換算成權杖:[同一張 1024x1024 圖像,在 GPT-5.6、Gemini 與 Claude 上分別計為 693、1,089 與 1,372 個權杖](/zh-TW/blog/image-input-token-cost/)。Gemini 對音訊的計量方式為每秒 25 個權杖,720p 影片則為每秒 5,792 個權杖,PDF 也按圖像權杖費率計費。即時語音另有自己的權杖:gpt-realtime-2.1 的計費方式是每 100 ms 使用者語音正好計 1 個音訊權杖,每 50 ms 模型語音計 1 個

字元與時間(單位 6 和 7)。 文字轉語音(TTS)按字元計費,OpenAI 的價格為每百萬字元 $15 至 $30。因此,以每音訊分鐘計算時,中文語音比英文便宜 3 至 7 倍:相同說話時間需要的字元較少。Bedrock 的防護機制另定義了自己的字元單位,也就是最多 1,000 個字元的「text unit」。專用語音轉文字模型按音訊分鐘計費,我們測試的模型價格介於每分鐘 $0.0020 至 $0.0164;影片生成依解析度按秒計費;Gemini 則按歌曲為音樂定價。

物件、請求與頁數(單位 8 至 10)。 圖像生成會依品質層級按張計費,或按輸出權杖計費,兩種方式存在成本交叉點:輸出低於約 1,000 個權杖時,按權杖較便宜;超過後則是固定單張價格較划算。伺服器端工具按請求計費:我們測試的三個介面中,網頁搜尋每次都是 $0.01,搜尋結果之後還會再次算成輸入權杖,每次搜尋為 1,500 至 3,100 個。Gemini 的搜尋 grounding(允許模型在請求期間查詢 Google Search)還有額度門檻:每月前 5,000 次免費,之後每 1,000 次 $14。OCR 按頁計費。Bedrock 的模型評估則每個完成人工任務收取 $0.21,是這 17 種單位中唯一以人工任務計價的項目。

哪些單位改按時間或容量計費?

有 6 種單位是針對資源占用計費,不論是否真的有權杖流量。成本估算最容易漏掉這一層,因為程式什麼都沒做時,計量器仍可能持續累加。

哪些因素只改變費率,不改變單位?

有 7 個因素會改變單位價格,但不會改變單位本身:batch 層級、服務層級、時間、上下文長度、地理位置、品質參數,以及免費額度。若計費程式每個模型只存一個價格,這 7 種情況都會算錯,因為同一個權杖會依處理方式、時間與地點套用不同價格。

調整因素影響範例
Batch 層級輸入與輸出減價 50%AnthropicOpenAI 的 batch API;Mistral OCR 也適用
服務層級以較高價格換取速度OpenAI fast tier 為標準費率的 2x;flex tier 則有折扣
時間離峰折扣DeepSeek:離峰價格是尖峰的一半;工作日尖峰時段為 UTC 01:00-04:00 與 06:00-10:00
上下文長度超過門檻後費率跳升Gemini 費率會在 prompt 超過 200k 個權杖時提高;Claude 4.6+ 在完整 1M 上下文視窗內維持固定費率
地理位置資料駐留加價Claude inference_geo: "us"所有權杖類別套用 1.1x;Bedrock 與 Google Cloud 上 Claude 模型的區域端點,比全球端點加價 10%
品質參數單位相同,用量不同對一張 1024x1024 圖像調整 gpt-image 品質,會產生 196 至 7,024 個計費權杖
免費額度超過門檻後費率跳升Grounding:每月 5,000 次免費請求;程式碼執行:每月 1,550 個免費小時

這些乘數可以疊加。Anthropic 明確指出,快取乘數可同時搭配 batch 折扣與資料駐留加價,因此一個經過快取、batch 處理,且限定美國區域的權杖,會一次套用三個係數。

什麼是額度與 CCU?

它們是包在實際計量單位外層的合成單位,適合需要在發票上合併成單一項目的情境。Claude 透過 AWS 或 Azure Marketplace 計費時,系統會先依一般單位價格換算成美元,再按每美元 100 個 Claude Consumption Units 的比例轉成 CCU。折扣會反映為較少的 CCU 用量,而不是降低每個 CCU 的價格。訂閱型產品也會用額度做同樣的事,甚至同一家公司的不同產品邊界也可能採用不同單位:ElevenLabs 的訂閱方案按額度計量,但明確表示 API 用量以美元計費,不使用額度。看到合成單位時,應先確認底層使用哪一種用量或容量計量方式,以及換算比例。

哪些進位規則與最低計費最容易踩坑?

這些是各種量化規則。由於它們分散在不同文件中,這裡統一整理:

如何跨單位比較成本?

統一換算成每次使用者互動的美元成本,因為所有計量單位都能轉換成這個基準。

單次語音通話流程圖:串接式架構以音訊分鐘計算語音轉文字、以權杖計算 LLM、以字元計算文字轉語音,每對話分鐘合計 $0.0037 至 $0.025;即時架構只按音訊權杖計費,成本為 $0.016 至 $0.057 我們的語音代理研究就是這樣比較:串接式架構分別按音訊分鐘(STT)、權杖(LLM)與字元(TTS)計費,每對話分鐘成本為 $0.0037 至 $0.025;gpt-realtime-2.1 則是 $0.057,mini 版本為 $0.016。換算成同一單位後,就能直接比較即時架構的溢價與低延遲帶來的效益。這套方法適用於所有場景:先選定一次互動,例如一張客服工單、一份文件或一分鐘對話;接著以每一段流程的原生單位計量,套用當前費率後再比較。直接拿 $/1M tokens 和 $/audio-minute 相比,兩者根本不是同一類單位;改用 $/interaction 後,就只是算術問題。

閘道如何統一這些單位?

Synthorai 的做法是在請求發生時完成計價,並同時保留原生單位與美元金額。每次請求都會產生一筆用量紀錄,其中包含原生計量值(依類別拆分的權杖、秒數、字元、請求次數)、解析後的價格版本,以及計算出的成本。因此,每一筆發票明細都能反向拆解成單位乘以費率。這和 CCU 在市集邊界執行的換算相同,只是改成逐筆紀錄處理,而且保留可檢查性。這套設計也能搭配零保留模式:用量紀錄只需要計量值與內容雜湊,不需要保存 payload。上游調整價格時,價格版本會固定每筆歷史紀錄當時採用的費率表。如此一來,月底對帳是稽核,不是爭論。

常見問題

音訊權杖和文字權杖相同嗎?

不同。即時音訊權杖是獨立的計量單位,也有獨立價格。在 gpt-realtime-2.1 上,聽取語音每 100 ms 計 1 個權杖,輸出語音每 50 ms 計 1 個權杖,換算後為每分鐘聽取 $0.0192、每分鐘說話 $0.0768。即使在同一個模型內,音訊與文字仍使用不同的費率表。

為什麼同一張圖在不同供應商上會算出不同的權杖數?

因為換算方式不同,不是圖像不同。Patch 公式、設有上限的 tile,以及固定費用目前同時存在。同一張 1024x1024 圖像,在 GPT-5.6 上計為 693 個權杖、Gemini 為 1,089 個、Claude 為 1,372 個,而且檔案格式或內容完全不會改變權杖數。

快取權杖算輸入權杖嗎?

兩者分開計量,並依操作定價。快取寫入費率高於基礎輸入,Claude API 依 TTL 分別為 1.25x 或 2x;讀取則有 0.1x 折扣。對預先配置容量而言,這項差異有雙重影響:快取權杖不消耗 PTU 容量,因此快取不只降低帳單,也能減少必須預留的容量。

語音按字元計費還是按分鐘計費比較便宜?

取決於語言。按字元計費的 TTS 會讓中文語音以每音訊分鐘計算時,比英文便宜 3 至 7 倍,因為中文用較少字元就能表達更多語音內容;按分鐘計費則不受語言影響。語音轉文字方面,我們測試的按分鐘計費模型在乾淨語音上的準確率相近,價格介於每音訊分鐘 $0.0020 至 $0.0164

本文引用的單位定義與費率,來自 2026-08-30 取得的供應商定價頁面,以及文中連結的實測研究。價格會變動,單位結構通常變得較慢,但在把任何數字寫入計費程式前,仍應先確認連結中的原始資料。

相關實測研究:權杖組成prompt caching快取最低門檻圖像輸入權杖圖像生成語音轉文字語音辨識即時語音影片生成網頁搜尋語音代理tokenizer各語言成本

← 返回部落格