🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。
图像生成 API 成本:5 个模型对比($0.006–$0.039)

图像生成 API 成本:5 个模型对比($0.006–$0.039)

目录
  1. 图像模型有哪些差异
  2. 实测结果
  3. 选择规则
  4. 为什么这些数据可信
  5. 结论
  6. 常见问题
  7. 资料来源

我们给一个原本面向文本 LLM 的网关加入了图像生成功能,并实测了 4 个影响成本的变量:模型、分辨率、图像数量和质量。影响最大的是质量。大多数图像 API 都提供这个参数,但调用方通常不会修改默认值。分辨率、prompt cache 和批量生成的影响,远小于大多数人的预期。

TL;DR

  • gpt-image 的 quality 参数在分辨率相同时能让账单相差约 36 倍:1024x1024 下,low/medium/high 分别计费 196 / 1,756 / 7,024 个输出 token($0.0060 / $0.053 / $0.211)。
  • 模型选择能带来 6.4 倍的成本差异:gpt-image-2 低质量下每张 $0.0060,gemini-2.5-flash-image 则为 $0.0387。
  • 分辨率影响很小:从 1024x1024 提升到 2048x2048,gpt-image-2 的单图成本只增加了一倍。
  • 图像生成不支持 prompt cache,n=4 还会把 prompt 重复计费 4 次;输出低于约 1,000 个 token 时按 token 计费更划算,高于这个值则固定单图价格更划算。

图像模型有哪些差异

图像模型不能直接互换。它们在多个方面都有差异,其中只有计费方式直接关系到价格。当前可用模型概览如下:

系列计费方式quality 参数批量 n>1分辨率
gpt-image(OpenAI)按 tokenlow/med/high最高约 2K
gemini-image(Google)按 token✗ 每次调用 1 张1K(gemini-3:最高 4K)
qwen-image / wan2.7(Alibaba)固定单图价格512²–2048²
seedream(BytePlus)固定单图价格✗ 每次调用 1 张≥1920²(4.5/5.0)

如果把一个模型的行为套到另一个模型上,以下差异很容易造成问题:

  • 计费方式。 分为按 token(gpt-imagegemini)和固定单图价格(qwenwanseedream)。这是决定账单的核心因素,下一节会详细分析。
  • quality 参数。 只有 gpt-image 提供这个参数(low/medium/high)。Gemini 通过模型档位(flashpro)或 image_size 调整生成质量;固定单图价格的模型没有类似参数。仅这一个参数就能让账单相差约 36×,因此它是最主要的成本杠杆,下文会给出实测结果。
  • 并非所有模型都支持批量生成(n>1)。 gpt-imageqwenwan 可以在一次调用中返回多张图。所有 Gemini 和 Seedream 图像模型每次调用只能生成一张图:传入 n=2 会返回 400,因此需要自行发起 N 个请求并编排批处理。
  • 分辨率限制各不相同。 gemini-2.5-flash-image 最高只支持 1K(1 MP),gemini-3 则可达到 2K/4K(从 1K 提升到 4K 时,账单约增加一倍)。Seedream 4.5/5.0 要求分辨率至少约为 1920²,低于该值会直接拒绝。qwen-image 支持 512²–2048²。更高的分辨率不一定可用,也不一定允许通过降低分辨率来省钱。
  • 控制参数和图生图能力不同。 只有部分模型支持 seednegative_promptguidance_scale。编辑时允许使用的参考图数量也不同,最少为 3 张(gemini-2.5),最多为 16 张(gpt-image)。

quality 参数还有一个不直观的特点。对 gpt-image 来说,输出 token 是计费单位,并不代表最终文件的大小。OpenAI 根据公开的(quality × size)费率表确定 token 数量。例如,gpt-image-1 在 1024² 下,low / medium / high 分别对应 272 / 1,056 / 4,160 个 token。因此,token 数量由 quality 决定,而不是根据返回的字节数计算。我们的实测也验证了这一点:同一个 prompt 在 1024² 下分别使用 3 个质量档位,得到的都是 1024×1024 PNG,文件大小也都约为 0.9 MB,但计费 token 分别为 196、1,756 和 7,024。分辨率相同,字节大小也相近,成本却相差 36×。费用取决于渲染工作量,而不是像素数量,所以应以 usage 为准,不能只看输出结果。

这些模型都不支持 prompt cache,而这通常是人们首先想到的省钱方式。图像生成是无状态的:没有对话或 KV 状态可以复用,usage 对象也没有 cache 字段。后面的实测还会说明,批量生成同样不会共享 prompt。缓存是 chat 的能力,不适用于图像生成,因此不能靠它降低图像生成成本。


实测结果

我们通过网关实际生成图像,统一使用电商产品图风格的 prompt,再根据返回的 usage 和各模型公开费率计算成本。以下 5 个结论分别来自独立测试。

1. 成本来自图像,不是 prompt。 在文生图中(输入 prompt,输出图像),97–100% 的费用来自输出 token:一次 1024² 的 gpt-image-2 生成会产生 21 个输入 token 和 196 个输出 token(约 $0.0001 加 $0.0059);gemini-2.5-flash-image 的输入为 10 个 token。文本 prompt 的费用几乎可以忽略。但如果输入的是图像,例如通过图生图执行“把这个杯子改成蓝色”,输入 token 会大幅增加:

模型文生图输入图生图输入(1 张参考图)输出
gpt-image-2(low)21 tok1,043 tok196 tok
gemini-2.5-flash-image10 tok1,297 tok1,290 tok

输入会增加 50–130×,而且与参考图数量呈线性关系。在 gpt-image-2 的实测中,1、2、3 张参考图分别对应 1,043、2,068 和 3,093 个输入 token,每增加一张参考图约增加 1,025 个 token。低质量模式下,输入 token 数量甚至是生成输出的 5 倍。无论是生成图像还是提供图像,成本都来自图像,而不是 prompt。本文后续只讨论文生图;完整的图生图成本分析会另行发布。

2. 模型选择能带来 6× 的成本差异。 相同的 1024² 请求,使用默认质量:

模型计费方式单图成本
gpt-image-2token · quality 参数$0.0060
gpt-image-1-minitoken · quality 参数$0.0085
seedream-4-0单次请求固定价格$0.030
qwen-image-2.0单次请求固定价格$0.035
gemini-2.5-flash-imagetoken · 无 quality 参数$0.0387

最便宜和最贵的方案相差 6.4×,差异完全来自各模型生成的输出 token 数量。

3. 分辨率几乎不影响成本。gpt-image-2 从 1024² 提升到 2048² 后,单图成本仍大致处于同一量级($0.0060 到 $0.0121);输出 token 并不与像素数量成正比。无论请求什么尺寸,gemini-2.5-flash-image 都返回相同的 1,290 个 token,因为它只支持 1K,size 只会改变宽高比。(gemini-3 图像模型确实支持 image_size,从 1K 提升到 4K 时成本约增加一倍;但本文测试的 2.5-flash-image 不支持。)固定单图价格的模型按定义就不受分辨率影响。到这里,按 token 计费的模型看起来很难被超越。

4. 质量决定成本交叉点。gpt-image-2 的各质量档位进行测试:

quality1024²2048²
low$0.0060(196 tok)$0.0121(397 tok)
medium$0.053(1,756 tok)$0.107(3,568 tok)
high$0.211(7,024 tok)$0.428(14,272 tok)

从 low 提升到 medium,输出 token 约增加 9×;从 low 提升到 high,则约增加 36×。低质量下,按 token 计费的模型最便宜;到了 medium 或 high,其成本会超过固定单图价格($0.03–0.035)。按计算结果,交叉点约为 1,000 个输出 token($0.03 ÷ $30/M):low 低于这个值,medium 高于这个值。这也修正了我们此前的结论。“按 token 计费始终最便宜”只是因为当时测试的是默认 low 质量。

同一 prompt 分别使用 gpt-image-2 的 low、medium 和 high 质量渲染:3 张清晰度相同的 1024² 产品图,标注的输出 token 分别为 196 / 1,756 / 7,024,成本分别为 $0.006 / $0.053 / $0.215。

同一个 prompt,gpt-image-2,1024²。low / medium / high 分别计费 196 / 1,756 / 7,024 个输出 token,即 $0.006 / $0.053 / $0.215:分辨率相同,成本却相差 36×。对于这类背景干净的产品图,3 个档位很难看出差别,因此最便宜的档位通常已经足够。应根据任务设置 quality,不要一律默认使用 high

5. 多张图之间无法共享 prompt。 在一次调用中生成 n 张图,并不能摊薄 prompt 成本。gpt-image-2 会将其重复计费 N 次:n=4 时,输入 token 从 28 增加到 112;使用较长的品牌 prompt 时,则从 499 增加到 1,996。n=1n=4 的单图成本完全相同。图像生成既没有缓存,也没有其他 prompt 成本共享机制。每张输出图都要单独付费,prompt 也会逐张重新计费。


选择规则

对于文生图,真正决定成本的是质量,而不是通常认为的其他因素:

  • 低质量 / 草稿 / 缩略图: 选择带 quality 参数、按 token 计费的模型(gpt-image,约 $0.006–0.012)。在最高约 2K 的范围内,无论什么分辨率都最便宜。
  • 中高质量: 选择单次请求固定价格的模型(seedream / qwen,$0.03–0.035)。按 token 计费的成本会快速上升(我们的实测范围为 $0.05–0.43),而固定单图价格不仅更便宜,也不受质量影响。
  • gemini(默认 1K 下约 $0.039)很少是成本最优解。 低质量下,gpt-image 更便宜;中高质量下,单次请求固定价格的模型更便宜。它没有 quality 参数;选择 Pro 档位或更高的 image_size 是为了输出质量,而不是价格。
  • 同一质量档位内,分辨率带来的成本差异约为 2×, 不足以改变模型选择。质量才会改变结论。
  • n>1、缓存和批量生成都不会降低单图成本。 没有任何可共享的内容。
  • 图生图默认选择固定单图价格。 参考图属于输入,只有按 token 计费的模型会对此额外收费(每张约 1,025 个 token);固定单图价格的模型不会额外收费。编辑场景通常应优先选择 seedream / qwen。只有使用少量参考图进行低质量编辑时,gpt-image 仍然更便宜(约 5 张参考图时会超过固定单图价格);一旦提高质量或增加参考图数量,它就会失去成本优势。

电商是最典型的例子。假设要为目录中的每件商品生成产品图,每次都发送相同的长品牌 prompt,并认为缓存重复 prompt 能省钱。这个思路有两个问题:成本本来就不在 prompt,而在图像;图像生成也根本没有缓存。实际产品图通常需要 medium 或更高质量,因此应选择固定单图价格的模型。无论 prompt 重复多少次,这类模型都更便宜,成本也更可预测。

开头提到的能力限制仍可能改变最终选择,包括每次调用只能生成一张图、分辨率上下限、数据驻留要求,以及模型是否提供 seednegative_promptguidance_scale 等参数。先按成本选型,再确认能力是否满足需求。


为什么这些数据可信

这些数字来自各厂商真实返回的 usage,并按公开费率计算,不是估算值。我们的网关对图像生成采用无会话计费:只有返回 2xx 才结算,生成失败绝不收费;产生费用前会按最坏情况预检成本;如果响应中缺少 usage,则按成本上限计费,而不是默认为 $0。原则和我们处理其他模型时一致:应验证真实成本,而不是直接相信厂商给出的数字。我们在审计网关是否虚报缓存时也采用了同样的方法。


结论

图像生成看起来只是又一个 endpoint,但计费单位已经变了。对文生图来说,真正影响成本的不是 prompt(没有缓存,也无法在批量生成中共享),也不是分辨率,而是质量:低质量时 gpt-image 最便宜,中高质量时固定单图价格的模型(seedream / qwen)更划算,交叉点约为 1,000 个输出 token。应明确设置质量,选择与之匹配的模型,并核对实际成本。从生成转向编辑、开始输入参考图时,需要重新计算,因为输入图像也会成为主要成本。


常见问题

prompt cache 能降低图像生成成本吗? 不能。图像生成是无状态的:usage 对象中没有 cache 字段,批量生成也会对每张图重新计算 prompt 费用。成本来自输出图像,而不是文本。

按 token 计费和按图计费,哪个更便宜? 取决于质量。对于低质量或草稿,选择带 quality 参数的模型,例如 gpt-image(约 $0.006–0.012)。对于中高质量,选择固定单图价格的模型,例如 seedream/qwen($0.03–0.035),因为按 token 计费的成本会快速上升。图生图更适合固定单图价格:这类模型不会对参考图额外收费,而按 token 计费的模型每张参考图约增加 1,025 个 token。


资料来源

所有信息均于 2026-06-19 核验。本文不构成财务建议;据此决策前请确认最新价格。

← 返回博客