一张图算多少 token?同一图标实测 15 个 API:6 到 1,298
目录
同一张 1024x1024 图片,在 GPT-5.6 上计为 693 个输入 token,在 Qwen 3.8 Max 上是 988 个,在 Gemini 上是 1,089 个,在 Claude 上是 1,372 个。按各家输入费率计算,15 个视觉模型的单图成本从 $0.00005 到 $0.0137,这个差距几乎完全来自各模型的输入费率,而不是图片 tokenizer。五家厂商公布了图片计费规则,其中三家的规则与我们的实测结果不符。本文是文本 tokenizer 实测的图片篇:我们将本地生成的同一批 PNG 发送给目录中的每个视觉模型,通过“带图 prompt token 数减去不带图 prompt token 数”得到图片成本,并覆盖六种尺寸、五种宽高比、三类内容、三种文件格式,以及每次一到四张图片的组合。
TL;DR
- 一张 1024x1024 图片:GPT-5.6 为 693 个 token,Gemini 为 1,089 个,Claude 为 1,372 个;成本从 $0.00005(qwen3-vl-flash)到 $0.0137(claude-fable-5)。
- 三种计费方式:patch 公式(Qwen 严格符合 (side/32)²+2)、设有上限的 tile 计费(GPT 到 693 后不再增加),以及固定费用(Gemini 无论尺寸都收 1,089 个 token,缩略图也一样)。
- 三条公开规则未通过实测:Claude 旗舰模型约在 1,920px 而非 1,568px 开始缩放;Gemini 文档写 258 个 token,实测固定为 1,089;Qwen 使用 32px 网格,而不是 28px。
- 文件格式和内容对 token 数完全没有影响:计费只看几何尺寸。
各家文档如何说明图片计费?
七个模型家族中有五个公布了规则,其中三家的实测结果与文档不符。下表浓缩了全文;后续各节要么给出分歧的实测证据,要么分析文档完全没有提到的成本规律:
| 模型家族 | 文档说明 | 实测结果 |
|---|---|---|
| OpenAI | 使用 32px patch,每个模型有各自的 patch 预算(文档) | 曲线形态一致:64px 为 6 个 token,硬上限为 693 个 token |
| Anthropic | (w x h)/750,长边超过 1,568px 后缩放(文档) | 512-1,024px 时公式完全吻合;1,568 上限只适用于 Haiku,旗舰模型会继续计费到约 1,920px |
| 不超过 384px 的图片计 258 个 token,更大图片按每个 768px tile 计 258 个(文档) | 所有尺寸固定为 1,089 个 token,包括 64px 图标;在我们测试的接口上,文档所述 media_resolution 参数没有任何一种写法能生效 | |
| Alibaba | 每个 28x28px 计一个 token,最少 4 个(文档) | qwen3-vl 使用 32px 网格,可精确拟合为 ((side/32)²+2),下限 66,上限尺寸 1,600px |
| Moonshot | 动态计算 token,未公布公式,支持最大 4K 图片(文档) | 结果稳定:按二次曲线增长,测试到 3,072px 仍未发现上限(11,674 个 token) |
| MiniMax / ByteDance | 未找到公开公式 | MiniMax 按二次曲线增长,2,048px 封顶;ByteDance 每张固定 1,298 个 token |
右侧一列呈现出一个明确规律:公开规则都围绕几何尺寸展开,包括 patch、tile 和除数。几何尺寸可以直接测量,所以我们逐项做了验证。文档与实测不一致时,预算表也会随之出错:如果 Claude 旗舰模型按文档中的 1,568px 上限估算,大图预算会低估约 45%;如果 Gemini 流水线预期缩略图只收 258 个 token,实际每个图标都要支付其 4.2 倍。
一张图片要消耗多少 token?
在我们的测试矩阵中,单图为 6 到 5,486 个 token,具体取决于模型和尺寸,而 token 数只决定了账单的一半。下表展示了同一张 1024x1024 PNG 在目录中每个视觉模型上的结果,并按各模型输入费率换算成本:
| 模型 | Token(1024²) | 约合英文单词数 | 相当于该模型每千 token 价格的倍数 | 输入费率 /1M | 每张图片成本 |
|---|---|---|---|---|---|
| qwen3-vl-flash | 1,026 | ≈770 | 1.03x | $0.05 | $0.00005 |
| qwen3-vl-plus | 1,026 | ≈770 | 1.03x | $0.20 | $0.0002 |
| minimax-m3 | 1,371 | ≈1,030 | 1.37x | $0.30 | $0.0004 |
| Dola-Seed-2.0-pro | 1,298 | ≈970 | 1.30x | $0.50 | $0.0006 |
| gpt-5.6-luna | 693 | ≈520 | 0.69x | $1.00 | $0.0007 |
| gemini-3.7-flash | 1,089 | ≈820 | 1.09x | $0.75 | $0.0008 |
| claude-haiku-4-5 | 1,373 | ≈1,030 | 1.37x | $1.00 | $0.0014 |
| gemini-3.6-flash | 1,089 | ≈820 | 1.09x | $1.50 | $0.0016 |
| qwen3.8-max | 988 | ≈740 | 0.99x | $2.00 | $0.0020 |
| gemini-3.1-pro-preview | 1,089 | ≈820 | 1.09x | $2.00 | $0.0022 |
| claude-sonnet-5 | 1,372 | ≈1,030 | 1.37x | $2.00 首发价 | $0.0027 |
| kimi-k3 | 1,379 | ≈1,030 | 1.38x | $3.00 | $0.0041 |
| claude-opus-5 | 1,372 | ≈1,030 | 1.37x | $5.00 | $0.0069 |
| claude-fable-5 | 1,372 | ≈1,030 | 1.37x | $10.00 | $0.0137 |
可以得出三点。第一,“一图千言”在账单上是字面成立的:按每个 token 对应 0.75 个英文单词计算,一张 1024px 图片占用的上下文预算相当于一篇 520 到 1,030 词的文档。这正是图片较多的对话比纯文本更快耗尽上下文窗口和预算的原因。第二,美元列几乎完全由费率决定:token 数只相差不到 2 倍(693 到 1,379),因此在任何模型上,一张图的成本都相当于该模型每千输入 token 价格的 0.69 到 1.38 倍;美元一列基本上只是各模型输入费率的复述。第三,同一家族的模型使用完全相同的 tokenizer:两个 qwen3-vl 版本、两个 GPT-5.6 版本、三个 Gemini 模型和四个 Claude 模型,在每个正方形图片尺寸上返回的结果都相同或近乎相同。这与我们在文本测试中发现的模式一致:每个家族共用一个 tokenizer。
哪些因素决定图片的 token 成本?
有五个因素会改变账单,另有三个通常被认为会影响成本的因素其实毫无作用。后文每一节都会深入分析下表中的一项:
| 因素 | 影响 | 适用范围 |
|---|---|---|
| 计费方式 | patch 公式、设上限的 tile 计费或固定费用 | 见下方计费方式表 |
| 分辨率(面积) | 最主要的因素,大致按二次曲线增长 | 除两个固定费用模型外的所有模型 |
| 缩放上限 | 超过上限的像素不再计费 | 1,600px(Qwen)、约 1,920px(Claude 旗舰模型)、1,568px(Haiku)、693 个 token 上限(GPT);Kimi 无上限 |
| 宽高比 | 次要影响:边界网格会让长条图更贵,而长边上限会让极端比例更便宜 | GPT 在 3:1 时增加 84%,到 8:1 时反而减少 11%;Haiku 在 8:1 时减少 71% |
| 图片数量 | 严格线性累加,没有批量折扣 | 全部 15 个模型 |
| 内容(照片、文字或空白) | 无影响 | 实测的每个模型 |
| 文件格式(PNG/JPEG/WebP) | 无影响 | 实测的每个模型 |
| 文件字节数 | 无影响 | 实测的每个模型 |
最后三个因素需要特别说明,因为两类误解都很常见:在这组 API 中,没有任何一个会根据压缩率或图片内容复杂度计费。输入几何尺寸,输出 token 数。
三种图片计费方式是什么?
三种方式分别是 patch 公式、设有上限的 tile 计费和固定费用。它们对小图的定价差异很大。我们按六档尺寸测试了边长从 64px 到 2,048px 的正方形图片:
| 模型 | 64px | 128px | 256px | 512px | 1,024px | 2,048px | 计费方式 |
|---|---|---|---|---|---|---|---|
| qwen3-vl(两个版本) | 66 | 66 | 66 | 258 | 1,026 | 2,502 | patch:(side/32)²+2,最小 8x8,上限 1,600px |
| qwen3.8-max | 28 | 28 | 28 | 220 | 988 | 2,464 | patch,下限更低 |
| gpt-5.6(两个版本) | 6 | 21 | 78 | 309 | 693 | 693 | tile,硬上限 693 |
| gemini(三个模型) | 1,089 | 1,089 | 1,089 | 1,089 | 1,089 | 1,089 | 固定费用,尺寸不限 |
| Dola-Seed-2.0-pro | 1,298 | 1,298 | 1,298 | 1,298 | 1,298 | 1,298 | 固定费用,尺寸不限 |
| kimi-k3 | 17 | 33 | 108 | 369 | 1,379 | 5,486 | 二次曲线,未发现上限 |
| minimax-m3 | 18 | 27 | 102 | 363 | 1,371 | 5,186 | 二次曲线,2,048px 封顶 |
| claude(四个模型) | 12 | 28 | 103 | 364 | 1,372 | 4,764 | (w x h)/750,设有缩放上限 |

Qwen 的公式足够精确,可以直接用于预算:1,024px 正方形图片计为 (1024/32)² + 2 = 1,026 个 token,实测一枚 token 不差。其最小值会填充到 8x8 个 patch(66),缩放上限为 1,600px(从 1,600 到 1,920px 的实测结果均为 2,502)。GPT 按 tile 计费,达到 693 后不再增加:1,024px 和 2,048px 图片成本相同。对缩略图流量来说,固定费用最容易踩坑:Gemini 对 64px 图标收取 1,089 个 token,与缩放后的 4K 截图完全相同;Seed 则固定收取 1,298 个。另一端,Kimi K3 超过其他模型的上限后仍继续增长:3,072px 正方形图片计为 11,674 个 token,是测试矩阵中唯一未观察到缩放行为的模型。
缩放边界具体在哪里?
除 Kimi 外,每个模型家族都会在计费前缩放大图,但实际边界应以计量结果为准,而不是文档。Claude 的边界值得单独说明,因为它会直接影响 claude-sonnet-5 及更高价模型的实际成本:1,568px 计 3,139 个 token,1,728px 计 3,847 个,1,920px 计 4,764 个,到此封顶(2,048px 和 2,304px 同样计 4,764 个)。三个旗舰模型会一直按真实像素计费到约 1,920px 才封顶,比按文档上限做的预算多出约 45% 的 token;claude-haiku-4-5 是唯一符合文档的模型。如果上传流水线可控,编码前就把图片缩放到各模型的实测上限:超出边界的像素要么额外计费(Kimi),要么被静默丢弃(其余模型),过大的上传只是在消耗带宽。
图片形状、内容或文件格式会改变账单吗?
我们测到的所有形状差异都可以由两个因素解释,而且都与文件大小无关:模型是按面积还是边界网格计数,以及它的长边缩放阈值在哪里。内容和格式则完全没有影响:在实测的每个模型上,512px 的纯色图、噪声图和文字页面计费完全相同;同一张图片保存为 243KB 的 PNG、176KB 的 JPEG 和 174KB 的 WebP,结果也完全一致。
变量测试将面积固定为一百万像素,仅改变图片形状:
| 模型 | 1:1 | 2:1 | 3:1 | 4:1 | 8:1(长边 2,896px) |
|---|---|---|---|---|---|
| gpt-5.6(两个版本) | 693 | 1,271 | 1,278 | 1,230 | 616 |
| claude 三个旗舰模型 | 1,372 | 1,355 | 1,411 | 1,409 | 1,107 |
| claude-haiku-4-5 | 1,373 | 1,356 | 1,068 | 788 | 396 |
| minimax-m3 | 1,371 | 1,352 | 1,410 | 1,298 | 650 |
| kimi-k3 | 1,379 | 1,361 | 1,417 | 1,415 | 1,361 |
| qwen3-vl(两个版本) | 1,026 | 1,037 | 992 | 1,026 | 992 |
| gemini(三个模型) | 1,089 | 1,081 | 1,083 | 1,056 | 1,034 |
| Dola-Seed-2.0-pro | 1,298 | 1,277 | 1,304 | 1,298 | 1,315 |
结合前述两个因素来看各行结果。Qwen、Kimi、Gemini 和 Seed 基本不受形状影响:它们只看面积,或直接收取固定费用。GPT 是唯一按边界网格计费的模型。同样像素数量的长条图,成本最高可比正方形高 84%;但当宽高比达到 8:1 并越过长边上限后,缩放会抵消这部分溢价,只需 616 个 token,反而比正方形更便宜。其他设有缩放阈值的模型,也会在各自边界处出现同样的转折:Haiku 从 3:1 开始降价(长边 1,774 超过其 1,568 上限,依次计 1,068、788 和 396);Claude 旗舰模型直到 8:1 才降价(2,896 超过其约 1,920px 的边界,计 1,107);MiniMax 也在 8:1 时超过 2,048 上限,降至 650。对于宽文档和截图流量,实际策略很明确:使用 GPT 时,应自行拆分或缩小长条图;使用 Haiku 时,极端宽高比反而能得到 Claude 中最低的像素价格。
哪些手段能真正降低图片输入成本?
按效果排序有三种。第一,缩放到模型上限:超过缩放边界的每个像素,在 Kimi 上都会继续计费,因为它没有上限;在其他模型上则全部浪费。第二,在 GPT 上使用 detail: "low":512px 时没有区别,三种设置都是 309 个 token;但在 2,048px 时,low 会将成本固定为 309 个 token,而 high 或 auto 为 693,减少 55%。这也是我们在所有模型中发现的唯一可按请求设置的图片成本参数。第三,让计费方式匹配工作负载:固定费用模型(Gemini、Seed)不适合缩略图和图标流量,却适合尺寸始终较大的扫描件;patch 和 tile 模型会按小图的实际尺寸计费(64px 图标在 GPT 上是 6 个 token,在 Kimi 上是 17 个)。
任何模型都不提供多图折扣:在同一条消息中放入 1、2、4 份相同图片时,全部 15 个模型都严格线性累加,每份都按单图全价计费。固定费用模型受此影响最明显:一次 Gemini 请求中放入四张 256px 缩略图,需要 4,356 个图片 token;同样四张图在 qwen3-vl-flash 上只需 264 个。
常见问题
一张 1024x1024 图片需要多少 token?
对同一张 PNG 的实测结果如下:GPT-5.6 为 693,Qwen 3.8 Max 为 988,qwen3-vl 为 1,026,Gemini 为 1,089,ByteDance Seed 为 1,298,MiniMax 为 1,371,Claude 为 1,372,Kimi K3 为 1,379。不到 2 倍的 token 差距不如费率影响大:实际成本从 $0.00005(qwen3-vl-flash)到 $0.0137(claude-fable-5)。
图片文件格式或压缩率会影响 token 成本吗?
不会。在我们实测的每个模型上,同一张 512px 图片保存为 PNG(243KB)、JPEG(176KB)和 WebP(174KB)时,token 数完全相同;纯色、噪声和文字密集内容的计费也一致。计费只取决于像素尺寸;压缩可以节省带宽,但不能节省 token。
detail: "low" 能减少图片 token 吗?
在 GPT-5.6 上可以,但只有图片超过小图阈值时才有效:2,048px 图片在 low 下计 309 个 token,在 high 或 auto 下计 693 个,减少 55%;512px 时三种设置均为 309。测试矩阵中的其他模型都没有提供可用的按请求图片成本参数。
把多张图片批量放进一个请求会更便宜吗?
不会。在每个模型上,同一张图片放入 1、2、4 份时,成本都严格线性累加,每张按全价计费。批量请求能减少请求开销和延迟,但不能减少图片 token。对固定费用模型(Gemini、Seed)来说,在一个请求中放入许多小图反而是成本最高的用法。
测试于 2026-08-13/14 通过 Synthorai gateway 完成,共覆盖 17 个模型(15 个视觉模型和 2 个纯文本对照模型):使用本地按精确尺寸生成的 PNG,通过“带图 prompt token 数减去加入随机盐值的同文本基线”计算图片成本;尺寸阶梯覆盖六档(64-2,048px),边界探测最高到 3,072px,测试六种面积为 1MP 的宽高比(从 1:1 到 8:1,另含 1:4 竖图)、三类内容、PNG/JPEG/WebP、GPT 上的 detail low/high/auto、1/2/4 张图片堆叠,并在每个模型上通过代码词识别检查图片是否可见。金额按测试日期各模型页面所列输入费率乘以实测 token 数计算(Sonnet 5 使用 $2 首发价)。视觉计费规则可能随时调整;依赖任何单项数据前,请重新运行尺寸阶梯测试。