实测 Qwen-Image 3.0 API:$0.03 一张图生成 9 个场景
目录
Qwen-Image 3.0 每张输出图像收费 $0.03,低于上一代的 $0.035,而且 prompt 免费。实测中,约 5,000 token 的 prompt 和只有 11 个英文单词的 prompt 计费完全相同。仅这一点就让它和按 token 计费的竞品拉开了差距,也让模型最吸引眼球的能力真正有了成本优势:要求它在 3x3 网格中生成 9 个不同场景,9 个都能得到,却只按一张图计费。我们在 qwen-image-3.0 接入商业 API 的当天做了测试,因为发布时既没有价目表、基准测试和权重,也没有技术报告。本文实测了计费方式、九图合一、10 像素文字能力(包括日文小字争议)、4,500 token 的 prompt 窗口,并比较了它与上一代模型及其他图像生成模型的差异。
TL;DR
- qwen-image-3.0 每张输出图像收费 $0.03,低于上一代的 $0.035;我们测试的所有 prompt 长度均不计费。
- “一次生成 9 张图”确实可行,但形式是单张九宫格图像:9 个场景全部生成,只按一张图计费;API batch 上限为 n=4。
- 按要求生成的小字是弱项:英文脚注连续 3 次全部拼错;模型自行创作的文字则很清晰。
- 生成速度很慢:标准请求耗时 58-85 秒,而 qwen-image-2.0 只需 10 秒;长 prompt 最慢达到 241 秒。
Qwen-Image 3.0 到底如何计费?
按输出图像数量和分辨率档位计费,prompt 免费。每个响应都返回图像数量和档位的 usage 信息,而不是 token 字段:1024x1024 或其他宽高比的同档请求按 1K 档的一张图计费,2048x2048 请求按 2K 档计费,usage 中完全不计算 prompt。我们用同一场景分别发送了 11 个英文单词的 prompt,以及预计为 1,000、4,200 和 5,000 token 的填充 prompt,每次计费都完全相同。DashScope 在发布一周后公布的价目表与这一计费方式完全一致:qwen-image-3.0 在两个档位均为每张输出图像 $0.03;编辑流程中的输入图像每张 $0.003;输出面积以 2,250,000 像素为档位分界线。只有 pro SKU 会区分档位价格:1K 档输出 $0.04,2K 档输出 $0.075。更意外的是价格走向:$0.03 低于 qwen-image-2.0 的 $0.035。能力升级的同时反而降价,而发布前普遍预计它会采用溢价定价。
它与按 token 计费的图像 API 有根本区别。gpt-image-2 同时收取 prompt token 和输出图像 token 的费用,而且输出 token 并不稳定:同一个 11 个英文单词的 prompt,一次计入 215 个输出 token,另一次计入 744 个,相同请求的计量成本相差 3.5 倍。按图固定计费不存在这种波动,预估多少就支付多少。我们此前的五模型图像成本研究贯穿的正是同一个权衡:按图计费很平淡,但预算管理需要的正是这种平淡。
“一次生成 9 张图”是真的吗?
是真的,但不是这句话通常让人想到的形式,而且实际形式更省钱。API 的 batch 参数不接受大于 4 的值(n must be between 1 and 4),因此无法一次调用得到 9 个独立文件。发布演示展示的其实是构图能力:要求模型在一张图里排出包含 9 个不同场景的 3x3 网格,它可以做到。我们的测试要求生成黄昏灯塔、国际象棋对局、一碗拉面、纸鹤、地铁站台、雨中仙人掌、小提琴、雪狐和热气球:

9 个场景全部正确,每个格子都完整连贯,并且只按一张图计费:整张图 $0.03,折合每个可用格子 $0.0033。Alibaba 自己的演示把同一机制用得更激进,在单个网格中放入 9 张完整的信息图,其中还包含文字和公式。如果工作流需要的是缩略图、情绪板或方案合集,而不是 9 个独立文件,这确实能节省成本:一次固定价格的生成可以替代 9 次生成,而把网格裁成单图只需一行代码。
10 像素文字放大后还能看吗?
一半可以,而失败的恰好是可能真正上线的那一半。官方声称模型能渲染小至 10 像素的文字。从版面能力看,模型甚至超出预期:我们测试的规格说明页包含模型自行添加的侧栏、接口示意图、包装内容列表和安全认证标识,以及几十个小标签。这些文字都能看清,拼写也全部正确。问题出在唯一一段要求它逐字生成的内容上。我们指定的脚注是 “All measurements at 25 degrees Celsius”,连续 3 次分别生成了 “Celkaus”“Celuse” 和 “Celsue”。3 次全错,而且错误都出现在页面字号最小的文字中。

日文也有同样的问题,这也验证了发布首周的一项争议:独立测试指出,与官方演示相比,日文小字看起来“有些不自然”,我们的测试复现了这一现象。3 次日文标签测试都要求生成两行存储警告文字,其中 1 次完全正确,1 次有一个字符变形,另 1 次直接替换了两个字符(読 变成了 認,保管 变成了 保宜),但其余极简标签设计没有问题:

规律很稳定,也很具体:模型自己创作的文字很清晰;要求它转写指定文字时,字形才容易出错。一次中文 prompt 测试从另一个角度印证了这一点。模型没有收到标签文字要求,却自行给 3 个箱子加上了“加急”“普通”“存档”,所有汉字都完全正确:

在我们测试的所有语言中,模型自行创作的文字都很可靠。用于样机、故事板和版式稿时,其文字渲染能力确实达到了生产可用水平。但如果指定字符串绝对不能出错,例如合规声明、规格数值或法律条款,就必须逐字校对,或者生成后再叠加真实排版文字。
4,500 token 的 prompt 窗口实际有什么用?
空间更大,而且免费,但代价是等待时间。这个版本的核心能力是可接收更多指令:prompt 长度达到上一代的 4.5 倍。我们的接受上限测试没有撞到硬限制:预计为 4,200 甚至 5,000 token 的填充 prompt 都能正常接受,没有报错。至少在我们找到的边界附近,文档所述上限并不会触发错误,而且按图计费意味着这些 token 都不会增加费用。长 prompt 增加的是延迟,而且波动明显:标准短 prompt 的生成耗时为 58-85 秒;两次 1,000 token 测试分别耗时 85 秒和 120 秒;4,200 token 测试耗时 241 秒;5,000 token 测试却只用了 88 秒。整体趋势是 prompt 越长耗时越久,但方差很大。使用这个窗口时,需要预留的是时间,而不是预算。
它在图像生成模型中处于什么位置?
它是目录中最慢的模型,而且差距很大。这正是“实用,而不只追求好看”这一定位所付出的实际代价。以下是同一天使用相同 prompt 对各模型的计时结果:
| 模型 | 每张图耗时(2 次测试) | 计费方式 | 每张图标价 |
|---|---|---|---|
| qwen-image-2.0 | 9.8 / 10.2 | 按图 | $0.035 |
| qwen-image-2.0-pro | 13.4 / 14.2 | 按图 | $0.075 |
| wan2.7-image | 20.4 / 23.0 | 按图 | - |
| seedream-5-0 | 30.8 / 34.1 | 按图 | - |
| gpt-image-2 | 32.3 / 35.1 | 按 token | 实测 $0.007-$0.023 |
| qwen-image-3.0 | 通常为 58-85 | 按图 | $0.03 |
这里有两点需要说明。第一,上一代并未过时:qwen-image-2.0 的生成速度是 3.0 的 6 倍。对大批量简单素材而言,吞吐量优势仍然更重要。3.0 多花的时间主要换来了复杂版式、大量文字和高密度指令处理能力,这些是 2.0 无法胜任的。第二,Alibaba 目前同时提供两条图像生成产品线:Qwen-Image,以及通义万相系列的 wan2.7-image。后者速度快 3 倍。如果已经在 Alibaba 生态内,需求重点是视觉效果而不是文档生成,也应该把另一条产品线纳入比较。
当前容量仍处于 beta 初期,部署计划必须考虑这一点。测试进行到大约十几次生成后,我们遇到了上游限流;免费档的相关报告也提到,连续调用会遇到同样的 429 错误。通常这里应该放一张基准测试表,但这次发布没有提供基准测试、权重或技术报告,价目表也到发布一周后才出现,因此大部分宣传点都没有官方材料可供核验。上文结果均来自我们自己的计量和测试。不同服务商的单图价格可能不同,应以第一张账单为准,而不是依赖第三方猜测。
常见问题
Qwen-Image 3.0 每张图多少钱?
按 DashScope 公布的价格,两个分辨率档位的输出图像均为每张 $0.03;输入图像(编辑流程)每张 $0.003;无论长度如何,文本 prompt 都不计费。这低于 qwen-image-2.0 的 $0.035。pro SKU 会区分档位:1K 档输出 $0.04,2K 档输出 $0.075。
Qwen-Image 3.0 真的能一次生成 9 张图吗?
如果指的是一张图中的 9 个场景,可以。3x3 网格 prompt 能清晰生成全部 9 个指定场景,并且只按一张 1K 档图像计费。如果指 API batch,则不行:n 上限为 4,batch 中的每张图都会分别计费。需要的是联络表式输出而不是独立文件时,网格形式成本最低。
Qwen-Image 3.0 的小字能用于生产环境吗?
模型自行创作的文字可以。在我们的测试中,模型生成的英文、中文和日文标签与文案都正确。指定文字则不行:要求逐字生成的英文脚注连续 3 次全部拼错,3 次日文测试中也有 2 次至少改错了一个字符。指定小字必须校对,或者后期使用真实字体叠加。
我应该从 Qwen-Image 2.0 升级吗?
只有在任务超出 2.0 能力时才需要升级,例如复杂版式、文档式页面、包含多个部分的长指令,以及图内文字。相同的按图计费模式下,2.0 生成标准场景约需 10 秒,3.0 则需 58-85 秒,因此重视吞吐量的工作负载应继续使用 2.0。3.0 更适合作为高指令密度生成任务的专用模型,而不是直接替代 2.0。
测试时间为 2026-08-05 至 2026-08-06,使用 Synthorai gateway,并在 qwen-image-3.0 接入该商业路由的当天开始测试(当时尚未提供 -pro 档位)。测试项目包括计费方式与尺寸档位、batch 上限与网格构图、长 prompt 接受上限阶梯测试(按词数估算,填充长度为 1,000 / 4,200 / 5,000 token;图像 API 不返回 prompt token 数量)、中文和日文 prompt、多轮小字渲染,以及同一天使用相同 prompt 对目录中 6 个模型进行计时。文中展示的生成图像均为未经编辑的原始测试输出。金额采用 DashScope 在发布一周后公布的价目表,其 usage 计费结构与我们的实测一致;gpt-image-2 的单图价格区间来自我们此前图像研究中实测的 token 数量,并按已核实的费率计算。随着 beta 版本逐渐成熟,模型行为可能发生变化。