新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。
AI API の課金単位:token から PTU-hour まで 17 種類

AI API の課金単位:token から PTU-hour まで 17 種類

目次
  1. AI API はどの単位で課金するのか?
  2. 消費量を数える単位はどれか?
  3. 時間やキャパシティを借りる単位はどれか?
  4. 単位を変えずに単価を変える要素は何か?
  5. Credit と CCU とは何か?
  6. 問題になりやすい丸め規則と最低課金は?
  7. 異なる単位のコストをどう比較するか?
  8. Gateway は 17 種類の単位をどう正規化するか?
  9. FAQ

AI API の利用量は少なくとも 17 種類の単位で計測される。text token、reasoning token、cached token、media-input token、realtime audio token、文字数、メディアの分数や秒数、出力オブジェクト数、リクエスト数、ページ数、GPU-second、container-hour、GB-day、token-hour、PTU-hour、training token、synthetic credit だ。複数のモダリティを扱うプロダクトでは、コスト見積もりのためにいくつもの単位を換算する必要がある。予算が狂う原因は、この換算ルールにある。本記事では、すべての単位について計測方法と注意点を整理する。

TL;DR

  • AI API の課金単位は少なくとも 17 種類あり、消費量、時間とキャパシティ、料金補正、synthetic wrapper の 4 レイヤーに分かれる。
  • 1 分の音声にも 2 種類の課金方法がある。文字起こし専用モデルでは audio-minute あたり $0.0020 から $0.0164、gpt-realtime-2.1 では聞き取った音声 100 ms あたり 1 audio token だ。
  • ストレージだけでも計測単位は 2 種類ある。OpenAI の file search は GB-day あたり $0.10、Gemini の context caching は 100 万 token-hour あたり $0.50 だ。
  • modifier は単位ではなく単価を変える。batch は半額、DeepSeek のオフピークはさらに半額、米国内に固定した Claude の推論は 1.1x になる。

AI API はどの単位で課金するのか?

17 種類ある。以下のセクションと同じ順序で、消費量単位が 1 から 10、時間とキャパシティの単位が 11 から 16、synthetic wrapper が 17 だ。これとは別に、単位を変えずに単価だけを変える modifier レイヤーがある。次の表を索引として使える。各行から詳細解説へ移動できる。

AI API の課金単位をまとめた図。text token からページまでの 10 種類の消費量単位、GPU-second から training token までの 6 種類の時間およびキャパシティ単位、synthetic wrapper としての credit と CCU、batch 割引から無料枠終了時の料金変化までを示す modifier のサイドパネル

#単位使われる場所注意点
1Text tokenすべての chat API同じテキストでも tokenizer によって数が異なる。tokenizer の世代が変わると約 30% 多くなる場合がある
2Reasoning tokenthinking model見えない出力にも課金される。回答によっては全体の 88 から 99.3%を占める
3Cached tokenprompt cachingTTL 別の書き込み割増、読み取り割引、provider ごとの最小値がある
4Media-input token画像、音声、PDF の入力同じ画像に 3 種類の変換方式があり、PDF は画像レートで課金される
5Realtime audio token音声対話聞き取りは 100 ms あたり 1 token、発話は 50 ms あたり 1 token
6文字数TTS、guardrail中国語音声は audio-minute あたり英語より 3 から 7x 安い
7メディアの分数または秒数音声認識、動画生成、音楽生成精度がほぼ同じモデル間でも audio-minute あたり 8x の価格差がある
8出力オブジェクト数画像生成、人手評価解像度が同じでも品質設定だけで画像 1 枚の料金が 36x 変わる
9リクエスト数Web 検索、grounding、file search検索 1 回あたり $0.01 に加え、挿入された tokenがモデルの入力単価で課金される
10ページ数OCR、document AIMistral は 1,000 ページ単位で課金し、さらに batch と cache の割引が適用される
11GPU-secondserverless model hostGPU によって単価が異なる。T4 は $0.000225/s、H100 は $0.001525/s
12Container-hour または session-hourコード実行、managed agentツールが実行されなくても最低 5 分、ファイルの preload から課金される
13GB-dayファイルおよび vector storage無料の 1 GB を超えると $0.10 per GB-day
14Token-hourcontext-cache storageGemini は 100 万 token-hour あたり $0.50で課金し、2027 年には 2 倍になる
15PTU-hour または model-unit hourprovisioned capacitycached token はキャパシティを消費しない。output は input より負荷が大きい
16Training tokenfine-tuningepoch 数が料金に乗算される。一部のモデルは代わりに1 時間あたり $100で課金される
17Credit または CCUmarketplace、subscription実際の料金表に係数をかけた単位。AWS Marketplace では 100 CCU = $1.00

消費量を数える単位はどれか?

17 種類のうち 10 種類は消費量単位だ。サービスを使うたびにメーターが進み、モダリティごとに数える対象が異なる。

Token 系の単位(1 から 5)。 基本になるのは text token だが、単一の単位ではない。モデルファミリーごとに tokenizer が異なるため、同じテキストでも課金対象の token 数が変わる。Anthropic の説明では、4.7 以降の tokenizer は同じテキストに対して旧世代より約 30% 多く token を生成する。Reasoning token は通常ユーザーから見えない output token だ。10 token の回答に対して 81 token が課金されるケースを計測したところ、その 88% が reasoning だった。Cached token は操作と cache の有効期間(TTL)によって単価が変わる。Claude API では、5 分の cache write は base input の 1.25x、1 時間の write は 2x、read は 0.1xだ。メディア入力は provider 固有の式で token に変換される。同じ 1024x1024 の画像でも、GPT-5.6 では 693 token、Gemini では 1,089 token、Claude では 1,372 token が課金される。Gemini は音声を毎秒 25 token、720p 動画を毎秒 5,792 tokenとして計算し、PDF には画像 token の単価を適用する。realtime 音声には専用の token がある。gpt-realtime-2.1ユーザー音声 100 ms ごとに正確に 1 audio token、モデル音声 50 ms ごとに 1 audio tokenを課金する。

文字数と時間(6 と 7)。 Text-to-speech(TTS)は文字単位で課金される。OpenAI の価格は100 万文字あたり $15 から $30だ。このため、中国語音声は audio-minute あたり英語より 3 から 7x 安い。同じ発話時間でも必要な文字数が少ないからだ。Bedrock の guardrail は独自の文字単位を定義しており、最大 1,000 文字を 1 “text unit”とする。文字起こし専用モデルは audio-minute 単位で課金される。計測したモデルでは audio-minute あたり $0.0020 から $0.0164だった。動画生成は解像度別に秒単位で課金され、Gemini の音楽生成は曲単位で課金される。

オブジェクト、リクエスト、ページ(8 から 10)。 画像生成は tier 別の画像単位、または output token 単位で課金される。どちらが安いかは途中で逆転する。output token が約 1,000 未満なら token 単位が有利で、それを超えると画像 1 枚の固定料金が有利になる。サーバー側ツールはリクエスト単位で課金される。計測した 3 種類の API では Web 検索 1 回あたり $0.01で、検索結果はさらに input token として課金される。検索 1 回あたり 1,500 から 3,100 token だ。Gemini の search grounding は、モデルがリクエスト処理中に Google Search を実行できる機能で、無料枠の形にも特徴がある。月 5,000 リクエストまでは無料で、その後は 1,000 リクエストあたり $14だ。OCR はページ単位で課金される。Bedrock のモデル評価は完了した人手タスク 1 件あたり $0.21で課金される。この一覧で人を単位にする唯一のケースだ。

時間やキャパシティを借りる単位はどれか?

6 種類の単位は、token が流れているかどうかに関係なく、リソースを確保している時間に対して課金する。コードが何もしていない間もメーターが動くため、このレイヤーはコスト見積もりで特に見落とされやすい。

単位を変えずに単価を変える要素は何か?

単位を変えずに価格だけを変える要素は 7 つある。batch tier、service tier、時間帯、context length、地域、品質設定、無料枠だ。モデルごとに単価を 1 つだけ保存する課金実装では、これらをすべて誤る。同じ token でも処理方法、時間、場所によって価格が変わるからだ。

Modifier影響
Batch tierinput と output が 50% 割引AnthropicOpenAI の batch API。Mistral OCR も対象
Service tier高速処理に割増料金OpenAI の fast tier は標準単価の 2x。flex tier は割引
時間帯オフピーク割引DeepSeek はオフピークがピークの半額。平日の 01:00-04:00 と 06:00-10:00 UTC がピーク
Context length閾値を超えると単価が変わるGemini はprompt token が 200k を超えると単価が上がる。Claude 4.6 以降は1M window 全体で定額
地域data residency の割増Claude の inference_geo: "us"すべての token category で 1.1x。Bedrock と Google Cloud の Claude モデルでは、regional endpoint が global より 10% 高い
品質設定同じ単位でも消費量が変わるgpt-image は品質設定により、1024x1024 の画像 1 枚で課金 token が 196 から 7,024 まで変わる
無料枠閾値を超えると単価が変わるGrounding は月 5,000 リクエスト、コード実行は月 1,550 時間まで無料

倍率は重ねて適用される。Anthropic のドキュメントでは、caching の倍率に batch 割引と residency の割増が組み合わされる。そのため cached、batched、US-pinned の 1 token には 3 つの係数が同時に適用される。

Credit と CCU とは何か?

実際の計測単位を覆う synthetic wrapper で、請求書を 1 項目にまとめるために使われる。Claude を AWS または Azure Marketplace 経由で利用すると、通常の単価で使用量をドル換算した後、1 ドルあたり 100 Claude Consumption Units に変換される。割引は CCU の単価を下げるのではなく、計測される CCU 数を減らす形で反映される。subscription 製品の credit も同じ仕組みだが、同じ企業の中でも境界が分かれる場合がある。ElevenLabs は subscription plan を credit で計測する一方、API 利用料は credit ではなく米ドルで請求されると明記している。synthetic unit を見たら、その下でどの消費量またはキャパシティのメーターが動き、どの換算率が使われるかを確認する必要がある。

問題になりやすい丸め規則と最低課金は?

量子化ルールは別々のドキュメントに分散しているため、ここにまとめる。

異なる単位のコストをどう比較するか?

ユーザー操作 1 回あたりのドル額に正規化する。すべてのメーターを共通の単位に変換できる唯一の方法だ。

1 回の音声通話のフロー図。cascade 構成では音声認識を audio-minute、LLM を token、text-to-speech を文字数で課金し、会話 1 分あたり合計 $0.0037 から $0.025。realtime 構成は audio token のみで課金され、$0.016 から $0.057 音声 agent の調査でもこの方法を使った。audio-minute(STT)、token(LLM)、文字数(TTS)で課金される cascade 構成は、会話 1 分あたり $0.0037 から $0.025 だった。gpt-realtime-2.1 は $0.057、mini は $0.016だ。これにより realtime の割増料金と latency の改善を同じ数値で比較できる。この手順は他のケースにも使える。support ticket 1 件、document 1 件、会話 1 分など、まず interaction を決める。次に各処理を本来の単位で計測し、その時点の単価を適用してから比較する。$/1M tokens と $/audio-minute を直接比較しても意味はない。$/interaction なら単純な算数になる。

Gateway は 17 種類の単位をどう正規化するか?

Synthorai ではリクエスト処理時に料金を確定し、ドル額とともに元の単位を保持する。各リクエストから 1 件の usage record を生成し、元のメーター値(category 別の token、秒数、文字数、リクエスト数)、適用した price version、計算済みのコストを保存する。これにより、請求明細をいつでも単位と単価の積に分解できる。Marketplace の境界で CCU が行う換算と同じだが、record 単位で処理し、後から検証できる形で残す。この設計は zero-retention modeとも両立する。usage record に必要なのはメーター値と content hash であり、payload は不要だ。upstream の価格が変わっても、price version により各 historical record に適用した料金表を特定できる。この性質があるからこそ、月末の照合を議論ではなく監査にできる。

FAQ

Audio token と text token は同じか?

異なる。Realtime audio token は独立したメーターで、単価も別だ。gpt-realtime-2.1 では 1 token が聞き取り音声 100 ms または発話音声 50 ms を表し、聞き取りは 1 分あたり $0.0192、発話は 1 分あたり $0.0768になる。同じモデル内でも audio と text には別々の料金表がある。

同じ画像でも provider によって token 数が違うのはなぜか?

画像ではなく変換方式が異なるからだ。patch 式、上限付き tile、固定料金が併存している。同じ 1024x1024 の画像でも、GPT-5.6 では 693 token、Gemini では 1,089 token、Claude では 1,372 token だった。ファイル形式や画像内容を変えても token 数は 1 つも変わらなかった。

Cached token は input token に含まれるか?

別の単位として計測され、操作ごとに単価が設定される。cache write は base input より割高で、Claude API では TTL に応じて 1.25x または 2x になる。read は 0.1x だ。provisioned capacity では、この区別が料金とキャパシティの両方に影響する。cached token は PTU capacity を消費しないため、caching によって料金だけでなく予約すべきキャパシティも減らせる。

音声では文字単位と分単位のどちらが安いか?

言語によって異なる。文字単位の TTS では、中国語音声は audio-minute あたり英語より 3 から 7x 安い。中国語は少ない文字数でより多くの内容を発話できるからだ。分単位の料金は言語に左右されない。計測した文字起こしモデルは、クリーンな音声に対する精度がほぼ同じでも audio-minute あたり $0.0020 から $0.0164だった。

単位の定義と料金は、2026-08-30 に取得した provider の料金ページ、および本文中でリンクした独自計測結果に基づく。価格は変わりやすく、単位の構造は比較的変わりにくい。それでも課金コードに数値を組み込む前に、リンク先の情報を確認してほしい。

関連する計測記事:token の内訳prompt cachingcache の最小値画像入力 token画像生成文字起こし音声認識realtime 音声動画生成Web 検索音声 agenttokenizer言語別コスト

← ブログに戻る