Qwen-Image 3.0 API 실측: $0.03 한 장에 장면 9개
목차
Qwen-Image 3.0의 출력 이미지당 비용은 $0.03이다. 이전 모델의 $0.035보다 저렴하고, prompt에는 요금이 붙지 않는다. 테스트에서는 약 5,000-token prompt도 단어 11개짜리 prompt와 정확히 같은 금액이 청구됐다. 이 차이 하나만으로도 token 기반 과금 모델과 확실히 구분된다. 가장 눈에 띄는 기능도 실제 비용 절감으로 이어진다. 3x3 grid에 서로 다른 장면 9개를 요청하면 모두 생성되며, 이미지 한 장으로 과금된다. qwen-image-3.0이 상용 API 경로에 추가된 당일 바로 검증했다. 출시 당시에는 요금표, benchmark, weights, 기술 보고서가 하나도 없었기 때문이다. 과금 방식, 9-in-1 기능, 10-pixel 텍스트 성능과 일본어 작은 글씨 논란, 4,500-token prompt window를 확인하고, 이전 모델 및 나머지 이미지 생성 모델과 비교했다.
TL;DR
- qwen-image-3.0은 출력 이미지당 $0.03으로, 이전 모델의 $0.035보다 저렴하다. 테스트한 범위에서는 prompt 길이와 관계없이 요금이 없었다.
- “한 번에 이미지 9개”는 단일 이미지 grid 형태로 실제 동작한다. 장면 9개가 모두 생성됐고 이미지 한 장으로 과금됐다. API batch 상한은 n=4다.
- 지정한 작은 글씨가 약점이다. 영어 테스트 3회 모두 각주에 오타가 났지만, 모델이 직접 만든 텍스트는 깔끔했다.
- 생성 속도는 느리다. 일반 prompt에서 58-85초로, qwen-image-2.0의 10초보다 훨씬 오래 걸렸다. 긴 prompt에서는 241초까지 늘어났다.
Qwen-Image 3.0은 실제로 어떻게 과금될까?
해상도 tier에 따라 이미지 단위로 과금되며, prompt는 무료다. 모든 응답의 usage block에는 token 필드 대신 이미지 수와 tier가 기록된다. 1024x1024 또는 종횡비만 바꾼 요청은 1K tier 이미지 한 장으로, 2048x2048 요청은 2K tier 이미지 한 장으로 과금된다. usage 계산 어디에도 prompt는 반영되지 않는다. 같은 장면을 단어 11개짜리 prompt와 token 수가 각각 1,000, 4,200, 5,000 정도로 추정되는 filler prompt로 요청했는데, 매번 청구액이 같았다. 출시 주간이 지난 뒤 DashScope가 공개한 요금표도 이 구조와 정확히 일치한다. qwen-image-3.0은 두 tier 모두 출력 이미지당 $0.03이고, 편집 작업의 입력 이미지는 장당 $0.003이다. tier 경계는 출력 면적 2,250,000 pixels다. pro SKU만 tier별 가격이 다르다. 1K급 출력은 $0.04, 2K는 $0.075다. 더 눈에 띄는 점은 가격 방향이다. 기능은 개선됐는데 qwen-image-2.0의 $0.035보다 낮은 $0.03으로 출시됐다. 모두가 premium 가격을 예상했던 출시에서 오히려 가격을 내렸다.
token 기반 이미지 API와는 과금 구조 자체가 다르다. gpt-image-2는 prompt token과 출력 이미지 token을 함께 과금하며, 출력 token 수도 일정하지 않다. 단어 11개짜리 동일한 prompt가 한 번은 출력 token 215개, 다른 한 번은 744개로 청구됐다. 같은 요청인데 계량 비용이 3.5배 차이 났다. 이미지당 고정 가격에는 이런 변동이 없다. 예상한 금액 그대로 지불한다. 5개 모델의 비용을 비교한 이전 분석에서도 같은 trade-off가 나타났다. 이미지당 과금은 단순하고, 예산 관리에서는 단순함이 장점이다.
”한 번에 이미지 9개”는 실제로 가능할까?
가능하다. 다만 문구에서 예상하는 방식은 아니며, 비용 면에서는 실제 방식이 더 유리하다. API의 batch parameter는 4를 초과하면 거부한다(n must be between 1 and 4). 따라서 한 번의 호출로 파일 9개를 따로 받을 수는 없다. 출시 demo가 보여준 방식은 구도 구성이다. 이미지 한 장 안의 3x3 grid에 서로 다른 장면 9개를 요청하면 모델이 그대로 생성한다. 테스트에서는 해 질 녘의 등대, 체스 경기, 라멘 한 그릇, 종이학, 지하철 승강장, 빗속의 선인장, 바이올린, 북극여우, 열기구를 요청했다.

9개 장면이 모두 일관성 있게 생성됐고 이미지 한 장으로 과금됐다. sheet 한 장이 $0.03, 사용할 수 있는 cell 하나당 $0.0033이다. Alibaba의 demo는 같은 방식을 더 복잡하게 활용해, 텍스트와 수식이 포함된 완성형 infographic 9개를 grid 하나에 담았다. 작업에 독립된 파일 9개가 아니라 thumbnail, mood board, option sheet가 필요하다면 실제로 비용을 줄일 수 있다. 고정 가격 생성 한 번으로 9번을 대체하고, grid 분할은 crop 한 줄이면 끝난다.
10-pixel 텍스트는 확대해도 읽을 수 있을까?
절반은 가능하다. 하지만 실패하는 쪽이 실제 배포에 필요한 부분이다. 공식 주장은 10 pixels 크기까지 텍스트를 표현할 수 있다는 것이다. layout 수준에서는 기대 이상이었다. spec sheet 테스트 결과에는 모델이 자체적으로 만든 sidebar, port diagram, 구성품 row, security badge와 작은 label 수십 개가 들어갔다. 모두 읽을 수 있었고 철자도 정확했다. 문제는 그대로 입력해 준 문자열 하나에서 발생했다. “All measurements at 25 degrees Celsius”라는 각주를 정확히 넣으라고 했지만, 3회 실행에서 각각 “Celkaus”, “Celuse”, “Celsue”로 생성됐다. 3회 모두 틀렸고, 오류는 매번 페이지에서 가장 작은 글씨에 있었다.

일본어도 같은 양상을 보였다. 출시 주간에 제기된 논란도 이 결과로 확인된다. 독립 테스트에서는 공식 demo와 달리 일본어 작은 글씨가 “다소 부자연스럽다”고 보고했는데, 테스트에서도 재현됐다. 두 줄짜리 보관 경고문을 지정한 일본어 label 테스트 3회 중 하나만 완전히 정확했다. 한 번은 글자 하나가 깨졌고, 나머지 한 번은 글자 두 개가 다른 글자로 바뀌었다(読이 認으로, 保管이 保宜로 변경). 나머지 부분은 흠잡을 데 없는 미니멀한 label이었다.

양상은 일관되고 오류 지점도 유난히 명확하다. 모델이 직접 작성한 텍스트는 정확하지만, 지정한 문자열을 그대로 옮겨야 할 때 glyph가 깨진다. 중국어 prompt 테스트에서는 반대 상황이 이를 뒷받침했다. 별도로 요청하지 않았는데 모델이 상자 label 3개(加急, 普通, 存档)를 직접 만들었고, hanzi가 모두 정확했다.

테스트한 모든 언어에서 모델이 직접 작성한 텍스트는 안정적이었다. mockup, storyboard, layout comp 용도라면 텍스트 표현 품질은 실제 production에 쓸 수 있는 수준이다. compliance notice, spec 값, 법적 문구처럼 지정한 문자열이 정확해야 한다면 모든 glyph를 교정하거나, 생성 후 실제 텍스트를 합성해야 한다.
4,500-token prompt window로 무엇을 할 수 있을까?
추가 비용 없이 더 많은 지시를 넣을 수 있지만, 시간은 더 든다. 이번 release의 핵심 기능은 이전 세대보다 4.5배 긴 prompt를 지원한다는 점이다. 단계별 수용 한계를 테스트했지만 명확한 제한은 찾지 못했다. token 수가 각각 4,200과 5,000 정도로 추정되는 filler prompt도 오류 없이 받아들였다. 확인한 범위에서는 문서상 상한에 도달해도 error로 막히지 않았고, 이미지당 과금 방식이라 추가 요금도 없었다. 대신 긴 prompt는 latency를 늘렸고 편차도 컸다. 일반적인 짧은 prompt는 58-85초가 걸렸다. 1,000-token 테스트 2회는 각각 85초와 120초, 4,200-token 테스트는 241초, 5,000-token 테스트는 88초였다. 전체적으로 늘어나는 경향은 있지만 편차가 크다. 이 window를 사용할 때는 비용이 아니라 전체 소요 시간을 고려해야 한다.
이미지 생성 모델 중 어느 위치일까?
catalog에서 압도적으로 가장 느리다. “예쁜 것보다 쓸모 있는 것”이라는 positioning의 현실적인 대가다. 같은 날 동일한 prompt로 전체 lineup의 시간을 측정했다.
| Model | 이미지당 소요 시간, 초(2회) | 과금 방식 | 이미지당 정가 |
|---|---|---|---|
| qwen-image-2.0 | 9.8 / 10.2 | 이미지당 | $0.035 |
| qwen-image-2.0-pro | 13.4 / 14.2 | 이미지당 | $0.075 |
| wan2.7-image | 20.4 / 23.0 | 이미지당 | - |
| seedream-5-0 | 30.8 / 34.1 | 이미지당 | - |
| gpt-image-2 | 32.3 / 35.1 | token당 | $0.007-$0.023 실측 |
| qwen-image-3.0 | 일반적으로 58-85 | 이미지당 | $0.03 |
비교할 때 두 가지를 고려해야 한다. 첫째, 이전 모델이 쓸모없어진 것은 아니다. qwen-image-2.0은 6분의 1 정도의 시간에 생성한다. 단순한 asset을 대량으로 만들 때는 여전히 처리량에서 유리하다. 3.0은 2.0이 처리하기 어려운 복잡한 layout, 많은 텍스트, 세밀한 지시가 필요한 작업에서 긴 생성 시간만큼의 가치가 있다. 둘째, Alibaba는 현재 Qwen-Image와 Tongyi Wanxiang 계열의 wan2.7-image를 함께 운영한다. sibling 모델이 3배 빠르다. 문서가 아니라 시각적 완성도를 위해 Alibaba 생태계를 사용한다면 다른 line도 비교해야 한다.
아직 beta 단계라 capacity도 충분하지 않다. rollout 계획에 반드시 반영해야 한다. 테스트 중 약 12장을 연속 생성한 뒤 upstream rate quota에 걸렸다. free tier 관련 보고에서도 연속 호출 시 같은 429 제한이 확인됐다. 일반적인 benchmark 표 대신 검증 조건을 밝혀 둔다. 출시 시점에는 benchmark, weights, 기술 보고서가 없었고, 요금표도 출시 주간이 지난 뒤에야 공개됐다. 따라서 대부분의 주장을 대조할 공식 자료가 없다. 위 결과는 모두 직접 측정하고 테스트한 값이다. provider에 따라 이미지당 요금은 달라질 수 있다. 제3자의 추정치가 아니라 첫 invoice에서 실제 금액을 확인해야 한다.
자주 묻는 질문
Qwen-Image 3.0의 이미지당 비용은 얼마인가?
DashScope가 공개한 요금 기준으로 두 해상도 tier 모두 출력 이미지당 $0.03이다. 입력 이미지가 있는 편집 작업은 장당 $0.003이며, 텍스트 prompt는 길이에 관계없이 과금되지 않는다. qwen-image-2.0의 $0.035보다 저렴하다. pro SKU는 tier별로 가격이 다르다. 1K급 출력은 $0.04, 2K는 $0.075다.
Qwen-Image 3.0으로 정말 한 번에 이미지 9개를 생성할 수 있나?
이미지 한 장으로는 가능하다. 3x3 grid prompt에서 요청한 장면 9개가 모두 구분되게 생성됐고, 1K tier 이미지 한 장으로 과금됐다. API batch로는 불가능하다. n 상한은 4이며, batch의 각 이미지는 별도로 과금된다. 독립된 파일보다 contact sheet 형태가 필요하다면 grid 방식이 비용 면에서 유리하다.
Qwen-Image 3.0의 작은 글씨를 production에서 사용할 수 있나?
모델이 직접 작성하는 텍스트라면 가능하다. 테스트에서는 영어, 중국어, 일본어 모두 모델이 만든 label과 문구가 정확하게 생성됐다. 지정한 문자열에는 적합하지 않다. 정확히 입력해 준 각주가 영어 테스트 3회 모두 잘못 생성됐고, 일본어 테스트도 3회 중 2회에서 최소 한 글자가 바뀌었다. 지정한 작은 글씨는 반드시 교정하거나 실제 글꼴로 합성해야 한다.
Qwen-Image 2.0에서 upgrade해야 할까?
2.0으로 처리할 수 없는 작업에만 필요하다. 복잡한 layout, 문서 형태의 page, 여러 부분으로 구성된 긴 지시, 이미지 안의 텍스트가 여기에 해당한다. 같은 이미지당 과금 구조에서 2.0은 일반 장면을 약 10초 만에 생성하지만 3.0은 58-85초가 걸린다. 처리량이 중요한 workload라면 2.0을 유지하는 편이 낫다. 3.0은 범용 대체재가 아니라 복잡한 지시가 필요한 생성 작업용 specialist로 봐야 한다.
2026-08-05부터 2026-08-06까지 qwen-image-3.0이 상용 경로에 추가된 당일 Synthorai gateway를 통해 측정했다. 당시 -pro tier는 아직 제공되지 않았다. 과금 구조와 size tier, batch 상한과 grid 구성, 긴 prompt 수용 단계, 중국어 및 일본어 prompt, 반복 실행한 작은 텍스트, catalog 모델 6종의 당일 동일 prompt 실행 시간을 검증했다. filler 길이는 단어 수를 기준으로 1,000 / 4,200 / 5,000 tokens로 추정했다. images API는 prompt token 수를 반환하지 않는다. 표시된 생성 이미지는 편집하지 않은 테스트 출력물이다. 금액은 출시 주간이 지난 뒤 공개된 DashScope 요금표를 사용했으며, 직접 측정한 usage 과금 구조와 일치한다. gpt-image-2의 이미지당 비용 범위는 이전 이미지 연구에서 검증한 요율에 실측 token 수를 적용한 값이다. beta가 안정화되면서 동작은 달라질 수 있다.