이미지 생성 API 비용: 5개 모델 비교($0.006–$0.039)
텍스트 LLM용으로 만든 gateway에 이미지 생성을 추가하고, 모델, 해상도, 이미지 수, 품질이라는 4가지 변수가 비용에 미치는 영향을 측정했다. 가장 큰 변수는 대부분의 이미지 API가 제공하지만 호출하는 쪽에서는 기본값으로 두기 쉬운 품질 설정이다. 해상도, prompt caching, batching의 영향은 예상보다 훨씬 작다.
TL;DR
- gpt-image의
quality설정은 같은 해상도에서도 비용을 약 36배 바꾼다. 1024x1024에서 low/medium/high의 청구 대상 output token은 196 / 1,756 / 7,024개이며, 비용은 $0.0060 / $0.053 / $0.211이다. - 모델 선택에 따라 비용이 6.4배 달라진다. low quality의 gpt-image-2는 이미지당 $0.0060이고, gemini-2.5-flash-image는 $0.0387이다.
- 해상도의 영향은 작다. gpt-image-2를 1024x1024에서 2048x2048로 올려도 이미지당 비용은 2배만 증가했다.
- 이미지 생성에는 prompt caching이 없고,
n=4이면 prompt도 4번 청구된다. output token이 약 1,000개 미만이면 token당 과금이, 그 이상이면 이미지당 정액 과금이 유리하다.
이미지 생성 모델별 차이
이미지 생성 모델은 서로 그대로 교체할 수 있는 대상이 아니다. 여러 측면에서 차이가 나며, 그중 가격과 직접 관련된 것은 과금 방식뿐이다. 현재 제공 중인 모델을 간단히 정리하면 다음과 같다.
| 제품군 | 과금 | quality 설정 | Batch n>1 | 해상도 |
|---|---|---|---|---|
gpt-image (OpenAI) | token당 | ✓ low/med/high | ✓ | 최대 ≈2K |
gemini-image (Google) | token당 | ✗ | ✗ 호출당 1개 | 1K (gemini-3: 최대 4K) |
qwen-image / wan2.7 (Alibaba) | 이미지당 정액 | ✗ | ✓ | 512²–2048² |
seedream (BytePlus) | 이미지당 정액 | ✗ | ✗ 호출당 1개 | ≥1920² (4.5/5.0) |
모든 모델이 비슷하게 동작한다고 가정하면 다음 차이에서 문제가 생긴다.
- 과금 방식. token당 과금(
gpt-image,gemini)과 이미지당 정액 과금(qwen,wan,seedream)으로 나뉜다. 최종 비용을 결정하는 기준이며, 다음 섹션에서 자세히 다룬다. quality설정.quality를 제공하는 모델은gpt-image뿐이며, 값은low/medium/high다. Gemini는 모델 등급(flash부터pro)이나image_size로 품질을 조정한다. 정액 과금 모델에는 이런 설정이 없다. 이 설정 하나로 비용이 약 36× 바뀌므로 가장 큰 비용 변수다.- 모든 모델이 Batch(
n>1)를 지원하지는 않는다.gpt-image,qwen,wan은 한 번의 호출로 여러 이미지를 반환한다. Gemini와 Seedream의 모든 이미지 모델은 호출당 이미지가 1개다.n=2를 보내면400이 반환되므로 N개의 요청을 직접 보내고 batch를 구성해야 한다. - 해상도 제한에는 상한과 하한이 있다.
gemini-2.5-flash-image는 1K(1 MP)가 상한이지만,gemini-3는 2K/4K까지 지원하며 1K에서 4K로 올리면 비용이 약 2배가 된다. Seedream 4.5/5.0은 약 1920²가 최저 해상도이며, 그보다 작으면 거부한다.qwen-image는 512²–2048² 범위에서 동작한다. 더 높은 해상도를 항상 사용할 수 있는 것은 아니며, 비용을 줄이려고 해상도를 낮추는 것도 항상 가능하지는 않다. - 제어 설정과 이미지 변환 기능도 다르다.
seed,negative_prompt,guidance_scale은 일부 모델만 지원한다. 편집에 사용할 수 있는 참조 이미지 수도gemini-2.5의 3개부터gpt-image의 16개까지 차이가 난다.
quality에는 직관적이지 않은 특성이 하나 있다. gpt-image의 output token은 과금 단위이지, 반환되는 파일의 크기를 나타내는 값이 아니다. OpenAI는 공개된 (quality × size)별 요율표를 사용해 token 수를 정한다. gpt-image-1의 1024² 기준 low / medium / high는 272 / 1,056 / 4,160 token이다. 따라서 token 수는 반환된 byte가 아니라 quality에 따라 결정된다. 직접 확인한 결과도 같았다. 동일한 prompt를 1024²로 세 가지 품질에서 생성했더니 모두 같은 1024×1024 PNG가 반환됐고, 파일 크기도 약 0.9 MB로 비슷했다. 하지만 청구된 token은 각각 196, 1,756, 7,024개였다. 해상도와 byte 크기는 같은데 비용은 36× 차이 났다. pixel 수가 아니라 rendering 작업량에 비용을 내는 구조이므로, 결과물만 보고 추정하지 말고 usage를 확인해야 한다.
이 모델들은 모두 prompt caching을 지원하지 않는다. 비용을 줄일 때 흔히 먼저 떠올리는 방법이지만 이미지 생성에는 적용되지 않는다. 이미지 생성은 stateless이므로 재사용할 대화나 KV state가 없고, usage 객체에도 cache 관련 필드가 없다. 아래 측정 결과처럼 batch에서도 prompt를 공유하지 않는다. caching은 chat 기능이지 이미지 기능이 아니다. 따라서 prompt caching으로 이미지 생성 비용을 줄일 수 있다는 가정은 성립하지 않는다.
직접 측정한 결과
동일한 전자상거래 상품용 prompt를 사용해 gateway에서 실제로 이미지를 생성했다. 반환된 usage와 각 모델의 공개 요율을 기준으로 비용을 계산했다. 각각 별도로 측정한 5가지 결과다.
1. 비용을 만드는 것은 prompt가 아니라 이미지다. 텍스트로 이미지를 생성할 때, 즉 prompt를 입력하고 이미지를 출력할 때 비용의 97–100%는 output token이다. 1024² gpt-image-2 생성에는 input 21 token과 output 196 token이 사용되며, 비용은 각각 약 $0.0001과 $0.0059다. gemini-2.5-flash-image의 input은 10 token이다. 작성한 prompt 비용은 반올림 오차 수준이다. 다만 prompt가 텍스트이기 때문에 그렇다. 대신 이미지를 입력하면, 예를 들어 “이 머그잔을 파란색으로 바꿔 줘”와 같은 이미지 변환에서는 input token이 크게 늘어난다.
| 모델 | t2i input | i2i input (참조 1개) | Output |
|---|---|---|---|
gpt-image-2 (low) | 21 tok | 1,043 tok | 196 tok |
gemini-2.5-flash-image | 10 tok | 1,297 tok | 1,290 tok |
input은 50–130× 증가하며, 참조 이미지 수에 비례해 선형으로 늘어난다. gpt-image-2에서는 참조 이미지가 하나 추가될 때마다 약 1,025 token이 늘었다. 참조 이미지 1개, 2개, 3개에서 측정한 값은 각각 1,043, 2,068, 3,093이었다. low quality에서는 이 input token이 생성된 output token보다 5배 많다. 생성하든 직접 입력하든 비용을 만드는 것은 이미지이며, prompt는 아니다. 이 글의 나머지 내용은 텍스트 기반 이미지 생성만 다룬다. 이미지 변환의 비용 구조는 별도 글에서 자세히 다룰 예정이다.
2. 모델 선택에 따라 비용이 6× 달라진다. 동일한 1024² 요청을 기본 품질로 실행했다.
| 모델 | 과금 | 이미지당 비용 |
|---|---|---|
gpt-image-2 | token · quality 설정 | $0.0060 |
gpt-image-1-mini | token · quality 설정 | $0.0085 |
seedream-4-0 | 요청당 정액 | $0.030 |
qwen-image-2.0 | 요청당 정액 | $0.035 |
gemini-2.5-flash-image | token · quality 설정 없음 | $0.0387 |
가장 저렴한 경로와 가장 비싼 경로의 차이는 6.4×다. 각 모델이 생성하는 output token 수만으로 발생한 차이다.
3. 해상도에 따른 비용 차이는 작다. gpt-image-2를 1024²에서 2048²까지 측정했을 때 이미지당 비용은 $0.0060에서 $0.0121로 약 2배만 증가했다. output token은 pixel 수에 비례하지 않는다. gemini-2.5-flash-image는 어떤 크기를 요청해도 동일하게 1,290 token을 반환했다. 1K만 지원하며 size는 화면 비율만 바꾸기 때문이다. (gemini-3 이미지 등급은 image_size를 반영하며, 1K에서 4K로 올리면 비용이 약 2배가 된다. 하지만 여기서 비용을 측정한 2.5-flash-image에는 해당하지 않는다.) 이미지당 정액 과금 모델은 정의상 해상도에 따라 비용이 달라지지 않는다. 여기까지 보면 token당 과금 모델이 가장 유리해 보인다.
4. 품질에 따라 유리한 과금 방식이 바뀐다. gpt-image-2를 품질별로 측정했다.
| quality | 1024² | 2048² |
|---|---|---|
| low | $0.0060 (196 tok) | $0.0121 (397 tok) |
| medium | $0.053 (1,756 tok) | $0.107 (3,568 tok) |
| high | $0.211 (7,024 tok) | $0.428 (14,272 tok) |
output token은 low에서 medium으로 올리면 약 9×, low에서 high로 올리면 약 36× 증가한다. low quality에서는 token당 과금 모델이 가장 저렴하다. medium이나 high에서는 이미지당 정액 가격인 $0.03–0.035를 넘어선다. 손익분기점은 계산상 약 1,000 output token이다($0.03 ÷ $30/M). low는 그보다 적고, medium은 많다. 이 결과로 기존 결론도 수정했다. “token당 과금이 항상 가장 저렴하다”는 결론은 기본값인 low quality만 테스트해서 나온 결과였다.

같은 prompt와 gpt-image-2, 1024²를 사용했다. low / medium / high의 청구 대상 output token은 196 / 1,756 / 7,024개이고, 비용은 $0.006 / $0.053 / $0.215다. 해상도가 같아도 비용은 36× 차이 난다. 이처럼 깔끔한 상품 사진은 세 결과를 구분하기 어려워 가장 저렴한 등급으로도 충분한 경우가 많다. high를 기본값처럼 사용하지 말고 작업에 맞게 quality를 설정해야 한다.
5. 여러 이미지가 prompt를 공유할 수는 없다. 한 번의 호출로 n개 이미지를 생성해도 prompt 비용이 분산되지 않는다. gpt-image-2는 prompt를 N번 청구한다. n=4로 설정하자 input token이 28에서 112로 증가했고, 긴 brand prompt는 499에서 1,996으로 늘었다. n=1과 n=4의 이미지당 비용은 같았다. caching도 없으므로 이미지 생성에서 prompt 비용을 공유할 방법은 없다. 출력 이미지마다 비용을 내며, prompt도 매번 다시 청구된다.
선택 기준
텍스트 기반 이미지 생성에서는 흔히 생각하는 요소가 아니라 품질이 선택을 결정한다.
- Low / 초안 / thumbnail 품질: 품질 설정이 있는 token 과금 모델(
gpt-image, 약 $0.006–0.012)이 적합하다. 약 2K 이하의 모든 해상도에서 가장 저렴하다. - Medium / high 품질: 요청당 정액 모델(
seedream/qwen, $0.03–0.035)이 적합하다. 측정 결과 token당 과금은 $0.05–0.43까지 빠르게 증가했다. 정액 모델은 더 저렴하고 품질에 따라 비용도 달라지지 않는다. gemini는 기본 1K에서 약 $0.039로, 비용만 보면 최적의 선택인 경우가 드물다. low quality에서는gpt-image보다 비싸고, medium과 high에서는 요청당 정액 모델보다 비싸다.quality설정도 없다. 이 모델의 Pro 등급이나 더 높은image_size는 가격이 아니라 출력 품질 때문에 선택하게 된다.- 같은 품질 등급에서 해상도에 따른 비용 차이는 약 2×다. 모델 선택을 뒤집을 정도는 아니다. 품질은 선택을 바꾼다.
n>1, caching, batching으로는 이미지당 비용을 줄일 수 없다. 공유되는 항목이 없다.- 이미지 변환은 기본적으로 이미지당 정액 모델을 선택한다. 참조 이미지는 input이며, 이에 추가 비용을 청구하는 것은 token당 과금 모델뿐이다. 참조 이미지 하나당 약 1,025 token이 추가된다. 정액 모델은 참조 이미지를 무료로 포함한다. 편집에서는 대체로
seedream/qwen이 유리하다.gpt-image가 더 저렴한 경우는 참조 이미지가 적은 low quality 편집뿐이다. 참조 이미지가 약 5개면 정액 가격을 넘고, 품질이나 참조 이미지 수가 증가하면 불리해진다.
전자상거래가 가장 명확한 사례다. catalog의 모든 상품에 동일한 긴 brand prompt를 보내 상품 사진을 생성하고, 반복되는 prompt를 caching하면 비용이 줄어들 것이라고 가정해 보자. 이 방법은 두 가지 이유로 통하지 않는다. 애초에 비용을 만드는 것은 prompt가 아니라 이미지이며, 이미지 생성에는 caching도 없다. 실제 상품 이미지는 medium quality 이상인 경우가 많으므로 이미지당 정액 모델이 적합하다. prompt가 얼마나 반복되든 더 저렴하고 비용도 예측하기 쉽다.
첫 섹션에서 다룬 기능 제약 때문에 비용 기준의 선택이 달라질 수도 있다. 호출당 이미지가 1개인 모델, 해상도 상한과 하한, 데이터 저장 위치 제한, 모델이 제공하는 설정(seed, negative_prompt, guidance_scale)을 확인해야 한다. 비용으로 먼저 고른 다음 필요한 기능을 지원하는지 확인하면 된다.
이 수치를 신뢰할 수 있는 이유
이 수치는 추정값이 아니다. 실제 usage와 각 vendor의 공개 요율로 계산했다. gateway의 이미지 과금에는 session이 없다. 2xx 응답일 때만 정산하므로 생성에 실패하면 과금하지 않는다. 비용이 발생하기 전에 최대 예상 금액을 미리 검사하며, 응답에 usage가 없으면 $0로 처리하지 않고 상한액을 청구한다. 원칙은 다른 기능과 같다. vendor가 전달한 수치를 그대로 믿지 말고 실제 비용을 검증해야 한다. gateway의 cache 정보가 거짓인지 감사할 때도 같은 방법을 사용했다.
결론
이미지 생성은 겉으로는 또 하나의 endpoint처럼 보이지만 과금 단위가 다르다. 텍스트 기반 이미지 생성에서 핵심 변수는 prompt도 아니고 해상도도 아니다. prompt caching과 batch 공유는 지원되지 않는다. 핵심은 품질이다. low에서는 gpt-image가 가장 저렴하고, medium과 high에서는 이미지당 정액 모델인 seedream / qwen이 유리하다. 손익분기점은 약 1,000 output token이다. 품질을 작업에 맞게 명시하고, 그에 맞는 모델을 선택한 뒤 비용을 확인해야 한다. 생성에서 편집으로 넘어가 참조 이미지를 입력하게 되면 계산을 다시 해야 한다. 이때는 input 이미지가 비용의 중심이 된다.
FAQ
Prompt caching으로 이미지 생성 비용을 줄일 수 있나?
아니다. 이미지 생성은 stateless다. usage 객체에 cache 필드가 없고, batching에서도 이미지마다 prompt를 다시 청구한다. 비용을 만드는 것은 텍스트가 아니라 출력 이미지다.
Token당 과금과 이미지당 과금 중 어느 쪽이 더 저렴한가?
품질에 따라 다르다. low나 초안 품질에서는 gpt-image처럼 quality 설정이 있는 모델이 약 $0.006–0.012로 저렴하다. medium이나 high에서는 이미지당 정액인 seedream/qwen이 $0.03–0.035로 유리하다. token당 비용이 빠르게 증가하기 때문이다. 이미지 변환에서는 정액 모델이 더 유리하다. 정액 모델은 참조 이미지를 무료로 포함하지만, token당 과금 모델은 참조 이미지 하나당 약 1,025 token을 추가로 청구한다.
출처
- OpenAI: 이미지 생성 API
- OpenAI: gpt-image token당 요금
- Google: Gemini API 요금제(이미지 output token)
- OpenAI: Prompt caching(이미지 생성에 적용되지 않는 이유)
모든 내용은 2026-06-19에 확인했다. 재무 자문이 아니며, 비용 산정에 사용하기 전에 현재 요금을 확인해야 한다.