画像 1 枚は何 token?15 API で 6〜1,298 を実測
目次
同じ 1024x1024 画像でも、入力 token 数は GPT-5.6 で 693、Qwen 3.8 Max で 988、Gemini で 1,089、Claude で 1,372 になる。各 provider の入力単価を掛けると、15 の vision model における画像 1 枚の料金は $0.00005 から $0.0137 まで開く。この差は image tokenizer よりも、ほぼ各 model の入力単価で決まる。画像の課金ルールを公開している vendor は 5 社あるが、実測値はそのうち 3 社のルールと一致しなかった。本稿は、text tokenizer の調査を画像入力に広げたものだ。ローカルで生成した同じ PNG を catalog 内の全 vision model に送り、画像ありの prompt token 数から画像なしの値を引いて画像コストを求めた。対象は 6 種類のサイズ、5 種類の aspect ratio、3 種類の内容、3 種類の file format、1〜4 枚の画像 stack である。
TL;DR
- 1024x1024 の画像 1 枚は、GPT-5.6 で 693 token、Gemini で 1,089、Claude で 1,372。料金は $0.00005(qwen3-vl-flash)から $0.0137(claude-fable-5)。
- 方式は 3 種類。patch 式(Qwen は (side/32)²+2 と完全一致)、上限付き tile(GPT は 693 で頭打ち)、固定料金(Gemini は thumbnail を含む全サイズで 1,089)。
- 公開ルールのうち 3 つが実測と一致しない。Claude の flagship は 1,568px ではなく約 1,920px で downscale され、Gemini は docs の 258 ではなく一律 1,089、Qwen の grid は 28px ではなく 32px だった。
- file format と画像内容では token 数が 1 つも変わらなかった。課金を決めるのは geometry だけだ。
各 vendor は画像の課金方法をどう説明しているか
7 family のうち 5 つはルールを公開しているが、そのうち 3 つは実測と一致しない。以下の表に本稿の要点をまとめた。以降の各 section では、docs との食い違いを示す測定結果か、docs にまったく書かれていないコスト特性を扱う。
| Family | docs の説明 | 実測結果 |
|---|---|---|
| OpenAI | 32px patch と model ごとの patch 上限(docs) | 特性は一致。64px で 6 token、上限は 693 token |
| Anthropic | (w x h)/750、長辺が 1,568px を超えると downscale(docs) | 512〜1,024px では式と完全一致。1,568 の上限が当てはまるのは Haiku だけで、flagship は約 1,920px まで課金が増える |
| 384px 以下は 258 token、それより大きい画像は 768px tile ごとに 258(docs) | 64px の icon を含めて、全サイズで一律 1,089。測定した API surface では、docs にある media_resolution の指定方法はどれも動作しなかった | |
| Alibaba | 28x28px ごとに 1 token、最低 4(docs) | qwen3-vl では 32px grid が token 単位で一致((side/32)²+2)。下限 66、上限 1,600px |
| Moonshot | token 数は動的、式は非公開、最大 4K の画像に対応(docs) | 一貫して二次関数的に増加。3,072px(11,674 token)まで上限は見つからなかった |
| MiniMax / ByteDance | 公開された式は見つからなかった | 二次関数的に増え、2,048px で上限。画像 1 枚あたり一律 1,298 |
右列には明確な共通点がある。公開ルールはいずれも geometry、つまり patch、tile、除数を基準にしている。geometry は測れるため、実際に測定した。両列が食い違えば、予算 spreadsheet にもその誤差が入る。Claude flagship の pipeline を docs 記載の 1,568px 上限で見積もると、大きな画像の予算が約 45% 不足する。Gemini の thumbnail を 258 token と見込んだ pipeline は、すべての icon でその 4.2 倍を支払うことになる。
画像 1 枚は何 token か
今回の matrix では、model とサイズに応じて 6〜5,486 token だった。ただし token 数だけでは請求額の半分しか分からない。以下は同じ 1024x1024 PNG を catalog 内の全 vision model に送り、各 model の入力単価を適用した結果だ。
| Model | Token(1024²) | 英文換算の概算語数 | model の 1K token あたり入力価格に対する倍率 | 入力単価 /1M | 画像 1 枚の料金 |
|---|---|---|---|---|---|
| qwen3-vl-flash | 1,026 | 約 770 | 1.03x | $0.05 | $0.00005 |
| qwen3-vl-plus | 1,026 | 約 770 | 1.03x | $0.20 | $0.0002 |
| minimax-m3 | 1,371 | 約 1,030 | 1.37x | $0.30 | $0.0004 |
| Dola-Seed-2.0-pro | 1,298 | 約 970 | 1.30x | $0.50 | $0.0006 |
| gpt-5.6-luna | 693 | 約 520 | 0.69x | $1.00 | $0.0007 |
| gemini-3.7-flash | 1,089 | 約 820 | 1.09x | $0.75 | $0.0008 |
| claude-haiku-4-5 | 1,373 | 約 1,030 | 1.37x | $1.00 | $0.0014 |
| gemini-3.6-flash | 1,089 | 約 820 | 1.09x | $1.50 | $0.0016 |
| qwen3.8-max | 988 | 約 740 | 0.99x | $2.00 | $0.0020 |
| gemini-3.1-pro-preview | 1,089 | 約 820 | 1.09x | $2.00 | $0.0022 |
| claude-sonnet-5 | 1,372 | 約 1,030 | 1.37x | $2.00 intro | $0.0027 |
| kimi-k3 | 1,379 | 約 1,030 | 1.38x | $3.00 | $0.0041 |
| claude-opus-5 | 1,372 | 約 1,030 | 1.37x | $5.00 | $0.0069 |
| claude-fable-5 | 1,372 | 約 1,030 | 1.37x | $10.00 | $0.0137 |
ここから 3 つのことが分かる。第 1 に、画像は文字どおり文章並みの token を消費する。1 token を英単語 0.75 語として換算すると、1024px の画像 1 枚で 520〜1,030 語の文書と同じ context budget を使う。画像の多い会話が text だけの場合より早く context window と予算を使い切るのはこのためだ。第 2 に、料金差の大半は単価で決まる。token 数は 693〜1,379 と 2 倍以内に収まるため、どの model でも画像 1 枚の料金は、その model の入力 1,000 token あたり価格の 0.69〜1.38 倍になる。料金列はほぼ各 model の入力単価を反映している。第 3 に、同じ family は完全に同じ tokenizer を共有している。qwen3-vl の 2 build、GPT-5.6 の 2 variant、Gemini の 3 model、Claude の 4 model は、すべての正方形画像で同一またはほぼ同一の値を返した。text での測定と同じく、1 family につき 1 tokenizer という構造だ。
画像の token 数は何で決まるか
料金を変える要因は 5 つあり、一般に影響すると考えられている 3 つの要因は無関係だった。以降は、以下の各行を詳しく検証する。
| 要因 | 影響 | 適用先 |
|---|---|---|
| 課金方式 | patch 式、上限付き tile、固定料金 | 下記の方式表 |
| 解像度(面積) | 主因。おおむね二次関数的に増加 | 固定料金の 2 model を除くすべて |
| Downscale 上限 | 上限を超えた pixel は課金されない | 1,600px(Qwen)、約 1,920px(Claude flagship)、1,568px(Haiku)、693-token 上限(GPT)。Kimi には上限なし |
| Aspect ratio | 二次的な影響。bounding grid は細長い画像を高く課金し、長辺上限を超える極端な形状では安くなる | GPT は 3:1 で +84%、8:1 で −11%。Haiku は 8:1 で −71% |
| 画像数 | 完全な加算で、volume discount なし | 全 15 model |
| 内容(写真、text、空白) | 影響なし | 測定した全 model |
| File format(PNG、JPEG、WebP) | 影響なし | 測定した全 model |
| byte 単位の file size | 影響なし | 測定した全 model |
下の 3 項は、どちらの説もよく見かけるため明記しておく。今回の matrix では、圧縮率や画像の複雑さを料金に反映する API は 1 つもなかった。geometry を入力すると token 数が決まる。
3 種類の課金方式とは
patch 式、上限付き tile、固定料金の 3 種類で、小さな画像の料金は大きく異なる。64px から 2,048px まで 6 段階の正方形画像を測定した。
| Model | 64px | 128px | 256px | 512px | 1,024px | 2,048px | 方式 |
|---|---|---|---|---|---|---|---|
| qwen3-vl(両方) | 66 | 66 | 66 | 258 | 1,026 | 2,502 | patch:(side/32)²+2、最小 8x8、上限 1,600px |
| qwen3.8-max | 28 | 28 | 28 | 220 | 988 | 2,464 | patch、下限は小さい |
| gpt-5.6(両方) | 6 | 21 | 78 | 309 | 693 | 693 | tile、上限 693 |
| gemini(全 3 model) | 1,089 | 1,089 | 1,089 | 1,089 | 1,089 | 1,089 | 全サイズ一律の固定料金 |
| Dola-Seed-2.0-pro | 1,298 | 1,298 | 1,298 | 1,298 | 1,298 | 1,298 | 全サイズ一律の固定料金 |
| kimi-k3 | 17 | 33 | 108 | 369 | 1,379 | 5,486 | 二次関数的、確認できた上限なし |
| minimax-m3 | 18 | 27 | 102 | 363 | 1,371 | 5,186 | 二次関数的、2,048px で上限 |
| claude(全 4 model) | 12 | 28 | 103 | 364 | 1,372 | 4,764 | (w x h)/750、downscale 上限あり |

Qwen の式は予算計算に使えるほど正確だ。1,024px の正方形は (1024/32)² + 2 = 1,026 となり、token 単位で実測値と一致した。最小値は padding 後の 8x8 patch、つまり 66 token で、downscale 上限は 1,600px だ。1,600〜1,920px はすべて 2,502 だった。GPT は 693 まで tile 単位で増え、それ以上にはならない。1,024px と 2,048px の画像は同じ料金だ。固定料金の 2 model は thumbnail workload で問題になる。Gemini は 64px の icon でも 1,089 token で、downscale 後の 4K screenshot と変わらない。Seed は 1,298 だ。一方、Kimi K3 は他 model の上限を超えても増え続けた。3,072px の正方形は 11,674 token で、今回の matrix で downscale を確認できなかった唯一の model だった。
Downscale の境界は正確にはどこか
Kimi 以外の全 family は、課金前に大きな画像を resize する。ただし境界は docs の記載ではなく、実測値に表れる位置にある。特に Claude の境界は、claude-sonnet-5 以上では実際の料金に直結するため詳しく見ておく。1,568px は 3,139 token、1,728px は 3,847、1,920px は 4,764 で、ここで頭打ちになる。2,048px と 2,304px も 4,764 だった。flagship 3 model は、docs にある上限を約 45% 超えた範囲まで実際の pixel に課金する。claude-haiku-4-5 だけは docs どおりに動く。upload pipeline を制御できるなら、encoding 前に各 model の実測上限まで resize するとよい。境界を超えた pixel は Kimi では追加課金され、他では黙って破棄される。大きすぎる upload は bandwidth を使うだけで、何も得られない。
形状、内容、file format で料金は変わるか
形状による差は、測定した範囲では 2 つの要因ですべて説明できる。model が 面積と bounding grid のどちらを数えるか、そして 長辺の downscale threshold がどこにあるかだ。file size は関係しない。内容と format でも、どの model でも値は変わらなかった。512px の単色画像、noise field、text page はすべて同じ料金で、同じ画像を 243KB の PNG、176KB の JPEG、174KB の WebP にしても同じだった。
要因を切り分けるため、面積を 1 megapixel に固定して形状だけを横長にした。
| Model | 1:1 | 2:1 | 3:1 | 4:1 | 8:1(長辺 2,896px) |
|---|---|---|---|---|---|
| gpt-5.6(両方) | 693 | 1,271 | 1,278 | 1,230 | 616 |
| claude flagship 3 model | 1,372 | 1,355 | 1,411 | 1,409 | 1,107 |
| claude-haiku-4-5 | 1,373 | 1,356 | 1,068 | 788 | 396 |
| minimax-m3 | 1,371 | 1,352 | 1,410 | 1,298 | 650 |
| kimi-k3 | 1,379 | 1,361 | 1,417 | 1,415 | 1,361 |
| qwen3-vl(両方) | 1,026 | 1,037 | 992 | 1,026 | 992 |
| gemini(全 3 model) | 1,089 | 1,081 | 1,083 | 1,056 | 1,034 |
| Dola-Seed-2.0-pro | 1,298 | 1,277 | 1,304 | 1,298 | 1,315 |
各行は、この 2 要因に沿って読める。Qwen、Kimi、Gemini、Seed はほぼ一定で、形状による加算はなく、面積だけか固定料金で決まる。bounding grid で課金するのは GPT だけだ。同じ pixel 数でも細長い画像は最大 84% 高くなる。ただし 8:1 で長辺上限を超えると、downscale によってこの増加分が消える。結果は 616 token で、正方形より安い。downscale threshold を持つ family でも、各 model の境界で同じ反転が起きる。Haiku は 3:1 から安くなる。長辺 1,774 が上限 1,568 を超えるため、1,068、788、396 と下がる。Claude flagship は 8:1 で初めて下がる。長辺 2,896 が約 1,920px の境界を超え、1,107 になる。MiniMax も 8:1 で長辺が 2,048 を超え、650 になる。横長の文書や screenshot を扱う場合、GPT では細長い画像を自前で分割または downscale するとよい。Haiku では、極端に細長い画像が Claude の中で最も安い pixel になる。
画像入力コストを実際に下げる方法
効果の大きい順に 3 つある。第 1 に、model の上限まで resize する。downscale 境界を超えたすべての pixel は、上限のない Kimi では課金され、他では無駄になる。第 2 に、GPT で detail: "low" を使う。512px では何も変わらず、どの設定でも 309 だが、2,048px では low が 309 token に固定され、high または auto の 693 より 55% 安い。今回、request ごとに指定できる画像設定として機能したのはこれだけだった。第 3 に、workload に合う方式を選ぶ。固定料金の model(Gemini、Seed)は thumbnail や icon には向かないが、常に大きな scan を扱う場合には適している。patch や tile 方式は小さな画像をサイズ相応に課金する。64px の icon は GPT で 6 token、Kimi で 17 token だ。
複数画像を 1 request にまとめても discount はない。1 枚、2 枚、4 枚の copy を同じ message に入れたところ、全 15 model で完全な加算になり、各 copy に 1 枚分の料金がかかった。固定料金方式では特に影響が大きい。256px の thumbnail 4 枚を 1 つの Gemini request に入れると、画像だけで 4,356 token になる。同じ 4 枚を qwen3-vl-flash に送ると 264 token だ。
FAQ
1024x1024 の画像は何 token ですか?
同じ PNG の実測値は、GPT-5.6 で 693、Qwen 3.8 Max で 988、qwen3-vl で 1,026、Gemini で 1,089、ByteDance Seed で 1,298、MiniMax で 1,371、Claude で 1,372、Kimi K3 で 1,379。token 数の差は 2 倍だが、適用単価のほうが重要だ。料金は $0.00005(qwen3-vl-flash)から $0.0137(claude-fable-5)になる。
画像の file format や圧縮率で token コストは変わりますか?
測定した全 model で変わらなかった。同じ 512px 画像を PNG(243KB)、JPEG(176KB)、WebP(174KB)にしても token 数は同じで、単色、noise、text が密な内容でも同一だった。課金は pixel 寸法だけで決まる。圧縮は token ではなく bandwidth のために行う。
detail: "low" で画像 token を減らせますか?
GPT-5.6 では減らせるが、小さな画像の threshold を超えた場合だけだ。2,048px の画像は low で 309 token、high または auto で 693 となり、55% 安くなる。512px では 3 設定すべてが 309 だった。今回の matrix では、request ごとの画像コスト設定が機能した model は他になかった。
複数の画像を 1 request にまとめると安くなりますか?
ならない。同じ画像を 1 枚、2 枚、4 枚送ると、すべての model で完全に加算され、各画像に満額がかかった。batching で減るのは request overhead と latency であり、画像 token ではない。固定料金の model(Gemini、Seed)では、多数の小さな画像を 1 request にまとめる構成が最も高くなる。
2026-08-13/14 に Synthorai gateway 経由で 17 model(vision 15、text-only control 2)を測定。正確な寸法でローカル生成した PNG を使用し、画像ありの prompt token 数から salt 付きの同一 text baseline を引いて画像コストを算出した。測定項目は 6 段階のサイズ(64〜2,048px)、3,072px までの境界 probe、6 種類の 1MP aspect shape(1:1〜8:1 と縦長 1:4)、3 種類の内容、PNG/JPEG/WebP、GPT の detail low/high/auto、1/2/4 枚の画像 stack、全 model での code-word 視認確認。料金は実測 token 数に、測定日時点で各 model page に掲載されていた入力単価を掛けたもの(Sonnet 5 は $2 の introductory rate)。vision の課金ルールは予告なく変わる。個別の値を前提にする前に、size ladder を再実行してほしい。