🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。
一张图算多少 token?同一图标实测 15 个 API:6 到 1,298

一张图算多少 token?同一图标实测 15 个 API:6 到 1,298

目录
  1. 各家文档如何说明图片计费?
  2. 一张图片要消耗多少 token?
  3. 哪些因素决定图片的 token 成本?
  4. 三种图片计费方式是什么?
  5. 缩放边界具体在哪里?
  6. 图片形状、内容或文件格式会改变账单吗?
  7. 哪些手段能真正降低图片输入成本?
  8. 常见问题

同一张 1024x1024 图片,在 GPT-5.6 上计为 693 个输入 token,在 Qwen 3.8 Max 上是 988 个,在 Gemini 上是 1,089 个,在 Claude 上是 1,372 个。按各家输入费率计算,15 个视觉模型的单图成本从 $0.00005 到 $0.0137,这个差距几乎完全来自各模型的输入费率,而不是图片 tokenizer。五家厂商公布了图片计费规则,其中三家的规则与我们的实测结果不符。本文是文本 tokenizer 实测的图片篇:我们将本地生成的同一批 PNG 发送给目录中的每个视觉模型,通过“带图 prompt token 数减去不带图 prompt token 数”得到图片成本,并覆盖六种尺寸、五种宽高比、三类内容、三种文件格式,以及每次一到四张图片的组合。

TL;DR

  • 一张 1024x1024 图片:GPT-5.6 为 693 个 token,Gemini 为 1,089 个,Claude 为 1,372 个;成本从 $0.00005(qwen3-vl-flash)到 $0.0137(claude-fable-5)。
  • 三种计费方式:patch 公式(Qwen 严格符合 (side/32)²+2)、设有上限的 tile 计费(GPT 到 693 后不再增加),以及固定费用(Gemini 无论尺寸都收 1,089 个 token,缩略图也一样)。
  • 三条公开规则未通过实测:Claude 旗舰模型约在 1,920px 而非 1,568px 开始缩放;Gemini 文档写 258 个 token,实测固定为 1,089;Qwen 使用 32px 网格,而不是 28px。
  • 文件格式和内容对 token 数完全没有影响:计费只看几何尺寸。

各家文档如何说明图片计费?

七个模型家族中有五个公布了规则,其中三家的实测结果与文档不符。下表浓缩了全文;后续各节要么给出分歧的实测证据,要么分析文档完全没有提到的成本规律:

模型家族文档说明实测结果
OpenAI使用 32px patch,每个模型有各自的 patch 预算(文档曲线形态一致:64px 为 6 个 token,硬上限为 693 个 token
Anthropic(w x h)/750,长边超过 1,568px 后缩放(文档512-1,024px 时公式完全吻合;1,568 上限只适用于 Haiku,旗舰模型会继续计费到约 1,920px
Google不超过 384px 的图片计 258 个 token,更大图片按每个 768px tile 计 258 个(文档所有尺寸固定为 1,089 个 token,包括 64px 图标;在我们测试的接口上,文档所述 media_resolution 参数没有任何一种写法能生效
Alibaba每个 28x28px 计一个 token,最少 4 个(文档qwen3-vl 使用 32px 网格,可精确拟合为 ((side/32)²+2),下限 66,上限尺寸 1,600px
Moonshot动态计算 token,未公布公式,支持最大 4K 图片(文档结果稳定:按二次曲线增长,测试到 3,072px 仍未发现上限(11,674 个 token)
MiniMax / ByteDance未找到公开公式MiniMax 按二次曲线增长,2,048px 封顶;ByteDance 每张固定 1,298 个 token

右侧一列呈现出一个明确规律:公开规则都围绕几何尺寸展开,包括 patch、tile 和除数。几何尺寸可以直接测量,所以我们逐项做了验证。文档与实测不一致时,预算表也会随之出错:如果 Claude 旗舰模型按文档中的 1,568px 上限估算,大图预算会低估约 45%;如果 Gemini 流水线预期缩略图只收 258 个 token,实际每个图标都要支付其 4.2 倍。

一张图片要消耗多少 token?

在我们的测试矩阵中,单图为 6 到 5,486 个 token,具体取决于模型和尺寸,而 token 数只决定了账单的一半。下表展示了同一张 1024x1024 PNG 在目录中每个视觉模型上的结果,并按各模型输入费率换算成本:

模型Token(1024²)约合英文单词数相当于该模型每千 token 价格的倍数输入费率 /1M每张图片成本
qwen3-vl-flash1,026≈7701.03x$0.05$0.00005
qwen3-vl-plus1,026≈7701.03x$0.20$0.0002
minimax-m31,371≈1,0301.37x$0.30$0.0004
Dola-Seed-2.0-pro1,298≈9701.30x$0.50$0.0006
gpt-5.6-luna693≈5200.69x$1.00$0.0007
gemini-3.7-flash1,089≈8201.09x$0.75$0.0008
claude-haiku-4-51,373≈1,0301.37x$1.00$0.0014
gemini-3.6-flash1,089≈8201.09x$1.50$0.0016
qwen3.8-max988≈7400.99x$2.00$0.0020
gemini-3.1-pro-preview1,089≈8201.09x$2.00$0.0022
claude-sonnet-51,372≈1,0301.37x$2.00 首发价$0.0027
kimi-k31,379≈1,0301.38x$3.00$0.0041
claude-opus-51,372≈1,0301.37x$5.00$0.0069
claude-fable-51,372≈1,0301.37x$10.00$0.0137

可以得出三点。第一,“一图千言”在账单上是字面成立的:按每个 token 对应 0.75 个英文单词计算,一张 1024px 图片占用的上下文预算相当于一篇 520 到 1,030 词的文档。这正是图片较多的对话比纯文本更快耗尽上下文窗口和预算的原因。第二,美元列几乎完全由费率决定:token 数只相差不到 2 倍(693 到 1,379),因此在任何模型上,一张图的成本都相当于该模型每千输入 token 价格的 0.69 到 1.38 倍;美元一列基本上只是各模型输入费率的复述。第三,同一家族的模型使用完全相同的 tokenizer:两个 qwen3-vl 版本、两个 GPT-5.6 版本、三个 Gemini 模型和四个 Claude 模型,在每个正方形图片尺寸上返回的结果都相同或近乎相同。这与我们在文本测试中发现的模式一致:每个家族共用一个 tokenizer。

哪些因素决定图片的 token 成本?

有五个因素会改变账单,另有三个通常被认为会影响成本的因素其实毫无作用。后文每一节都会深入分析下表中的一项:

因素影响适用范围
计费方式patch 公式、设上限的 tile 计费或固定费用见下方计费方式表
分辨率(面积)最主要的因素,大致按二次曲线增长除两个固定费用模型外的所有模型
缩放上限超过上限的像素不再计费1,600px(Qwen)、约 1,920px(Claude 旗舰模型)、1,568px(Haiku)、693 个 token 上限(GPT);Kimi 无上限
宽高比次要影响:边界网格会让长条图更贵,而长边上限会让极端比例更便宜GPT 在 3:1 时增加 84%,到 8:1 时反而减少 11%;Haiku 在 8:1 时减少 71%
图片数量严格线性累加,没有批量折扣全部 15 个模型
内容(照片、文字或空白)无影响实测的每个模型
文件格式(PNG/JPEG/WebP)无影响实测的每个模型
文件字节数无影响实测的每个模型

最后三个因素需要特别说明,因为两类误解都很常见:在这组 API 中,没有任何一个会根据压缩率或图片内容复杂度计费。输入几何尺寸,输出 token 数。

三种图片计费方式是什么?

三种方式分别是 patch 公式、设有上限的 tile 计费和固定费用。它们对小图的定价差异很大。我们按六档尺寸测试了边长从 64px 到 2,048px 的正方形图片:

模型64px128px256px512px1,024px2,048px计费方式
qwen3-vl(两个版本)6666662581,0262,502patch:(side/32)²+2,最小 8x8,上限 1,600px
qwen3.8-max2828282209882,464patch,下限更低
gpt-5.6(两个版本)62178309693693tile,硬上限 693
gemini(三个模型)1,0891,0891,0891,0891,0891,089固定费用,尺寸不限
Dola-Seed-2.0-pro1,2981,2981,2981,2981,2981,298固定费用,尺寸不限
kimi-k317331083691,3795,486二次曲线,未发现上限
minimax-m318271023631,3715,186二次曲线,2,048px 封顶
claude(四个模型)12281033641,3724,764(w x h)/750,设有缩放上限

八个模型家族的输入 token 数随图片尺寸变化的折线图:Kimi 和 MiniMax 在 2,048px 时陡增至 5,000 个 token 以上,Claude 紧随其后达到 4,764,两个 Qwen 曲线上升至约 2,500,GPT-5.6 在 693 处变为水平线,而 Gemini 和 ByteDance Seed 分别保持在 1,089 和 1,298,所有尺寸收费相同

Qwen 的公式足够精确,可以直接用于预算:1,024px 正方形图片计为 (1024/32)² + 2 = 1,026 个 token,实测一枚 token 不差。其最小值会填充到 8x8 个 patch(66),缩放上限为 1,600px(从 1,600 到 1,920px 的实测结果均为 2,502)。GPT 按 tile 计费,达到 693 后不再增加:1,024px 和 2,048px 图片成本相同。对缩略图流量来说,固定费用最容易踩坑:Gemini 对 64px 图标收取 1,089 个 token,与缩放后的 4K 截图完全相同;Seed 则固定收取 1,298 个。另一端,Kimi K3 超过其他模型的上限后仍继续增长:3,072px 正方形图片计为 11,674 个 token,是测试矩阵中唯一未观察到缩放行为的模型。

缩放边界具体在哪里?

除 Kimi 外,每个模型家族都会在计费前缩放大图,但实际边界应以计量结果为准,而不是文档。Claude 的边界值得单独说明,因为它会直接影响 claude-sonnet-5 及更高价模型的实际成本:1,568px 计 3,139 个 token,1,728px 计 3,847 个,1,920px 计 4,764 个,到此封顶(2,048px 和 2,304px 同样计 4,764 个)。三个旗舰模型会一直按真实像素计费到约 1,920px 才封顶,比按文档上限做的预算多出约 45% 的 token;claude-haiku-4-5 是唯一符合文档的模型。如果上传流水线可控,编码前就把图片缩放到各模型的实测上限:超出边界的像素要么额外计费(Kimi),要么被静默丢弃(其余模型),过大的上传只是在消耗带宽。

图片形状、内容或文件格式会改变账单吗?

我们测到的所有形状差异都可以由两个因素解释,而且都与文件大小无关:模型是按面积还是边界网格计数,以及它的长边缩放阈值在哪里。内容和格式则完全没有影响:在实测的每个模型上,512px 的纯色图、噪声图和文字页面计费完全相同;同一张图片保存为 243KB 的 PNG、176KB 的 JPEG 和 174KB 的 WebP,结果也完全一致。

变量测试将面积固定为一百万像素,仅改变图片形状:

模型1:12:13:14:18:1(长边 2,896px)
gpt-5.6(两个版本)6931,2711,2781,230616
claude 三个旗舰模型1,3721,3551,4111,4091,107
claude-haiku-4-51,3731,3561,068788396
minimax-m31,3711,3521,4101,298650
kimi-k31,3791,3611,4171,4151,361
qwen3-vl(两个版本)1,0261,0379921,026992
gemini(三个模型)1,0891,0811,0831,0561,034
Dola-Seed-2.0-pro1,2981,2771,3041,2981,315

结合前述两个因素来看各行结果。Qwen、Kimi、Gemini 和 Seed 基本不受形状影响:它们只看面积,或直接收取固定费用。GPT 是唯一按边界网格计费的模型。同样像素数量的长条图,成本最高可比正方形高 84%;但当宽高比达到 8:1 并越过长边上限后,缩放会抵消这部分溢价,只需 616 个 token,反而比正方形更便宜。其他设有缩放阈值的模型,也会在各自边界处出现同样的转折:Haiku 从 3:1 开始降价(长边 1,774 超过其 1,568 上限,依次计 1,068、788 和 396);Claude 旗舰模型直到 8:1 才降价(2,896 超过其约 1,920px 的边界,计 1,107);MiniMax 也在 8:1 时超过 2,048 上限,降至 650。对于宽文档和截图流量,实际策略很明确:使用 GPT 时,应自行拆分或缩小长条图;使用 Haiku 时,极端宽高比反而能得到 Claude 中最低的像素价格。

哪些手段能真正降低图片输入成本?

按效果排序有三种。第一,缩放到模型上限:超过缩放边界的每个像素,在 Kimi 上都会继续计费,因为它没有上限;在其他模型上则全部浪费。第二,在 GPT 上使用 detail: "low":512px 时没有区别,三种设置都是 309 个 token;但在 2,048px 时,low 会将成本固定为 309 个 token,而 highauto 为 693,减少 55%。这也是我们在所有模型中发现的唯一可按请求设置的图片成本参数。第三,让计费方式匹配工作负载:固定费用模型(Gemini、Seed)不适合缩略图和图标流量,却适合尺寸始终较大的扫描件;patch 和 tile 模型会按小图的实际尺寸计费(64px 图标在 GPT 上是 6 个 token,在 Kimi 上是 17 个)。

任何模型都不提供多图折扣:在同一条消息中放入 1、2、4 份相同图片时,全部 15 个模型都严格线性累加,每份都按单图全价计费。固定费用模型受此影响最明显:一次 Gemini 请求中放入四张 256px 缩略图,需要 4,356 个图片 token;同样四张图在 qwen3-vl-flash 上只需 264 个。

常见问题

一张 1024x1024 图片需要多少 token?

对同一张 PNG 的实测结果如下:GPT-5.6 为 693,Qwen 3.8 Max 为 988,qwen3-vl 为 1,026,Gemini 为 1,089,ByteDance Seed 为 1,298,MiniMax 为 1,371,Claude 为 1,372,Kimi K3 为 1,379。不到 2 倍的 token 差距不如费率影响大:实际成本从 $0.00005(qwen3-vl-flash)到 $0.0137(claude-fable-5)。

图片文件格式或压缩率会影响 token 成本吗?

不会。在我们实测的每个模型上,同一张 512px 图片保存为 PNG(243KB)、JPEG(176KB)和 WebP(174KB)时,token 数完全相同;纯色、噪声和文字密集内容的计费也一致。计费只取决于像素尺寸;压缩可以节省带宽,但不能节省 token。

detail: "low" 能减少图片 token 吗?

在 GPT-5.6 上可以,但只有图片超过小图阈值时才有效:2,048px 图片在 low 下计 309 个 token,在 highauto 下计 693 个,减少 55%;512px 时三种设置均为 309。测试矩阵中的其他模型都没有提供可用的按请求图片成本参数。

把多张图片批量放进一个请求会更便宜吗?

不会。在每个模型上,同一张图片放入 1、2、4 份时,成本都严格线性累加,每张按全价计费。批量请求能减少请求开销和延迟,但不能减少图片 token。对固定费用模型(Gemini、Seed)来说,在一个请求中放入许多小图反而是成本最高的用法。

测试于 2026-08-13/14 通过 Synthorai gateway 完成,共覆盖 17 个模型(15 个视觉模型和 2 个纯文本对照模型):使用本地按精确尺寸生成的 PNG,通过“带图 prompt token 数减去加入随机盐值的同文本基线”计算图片成本;尺寸阶梯覆盖六档(64-2,048px),边界探测最高到 3,072px,测试六种面积为 1MP 的宽高比(从 1:1 到 8:1,另含 1:4 竖图)、三类内容、PNG/JPEG/WebP、GPT 上的 detail low/high/auto、1/2/4 张图片堆叠,并在每个模型上通过代码词识别检查图片是否可见。金额按测试日期各模型页面所列输入费率乘以实测 token 数计算(Sonnet 5 使用 $2 首发价)。视觉计费规则可能随时调整;依赖任何单项数据前,请重新运行尺寸阶梯测试。

← 返回博客