이미지 1장은 몇 token일까? 15개 API에서 6~1,298
목차
같은 1024x1024 이미지의 입력 비용은 GPT-5.6에서 693 token, Qwen 3.8 Max에서 988 token, Gemini에서 1,089 token, Claude에서 1,372 token이다. 각 provider의 입력 단가를 적용하면 15개 vision model에서 이미지 한 장당 비용은 $0.00005부터 $0.0137까지 벌어진다. 이 차이는 image tokenizer보다 model별 입력 단가에서 거의 전부 발생한다. 이미지 과금 규칙을 공개한 vendor는 5곳인데, 실제 계측값은 그중 3곳의 규칙과 맞지 않았다. 이 글은 text tokenizer 조사의 이미지 편이다. 로컬에서 생성한 동일한 PNG를 catalog의 모든 vision model에 전송하고, 이미지 포함 prompt token에서 이미지 없는 prompt token을 빼 이미지 비용을 구했다. 크기 6종, 종횡비 5종, 콘텐츠 유형 3종, 파일 형식 3종, 이미지 1~4장 묶음을 측정했다.
TL;DR
- 1024x1024 이미지 한 장은 GPT-5.6에서 693 token, Gemini에서 1,089 token, Claude에서 1,372 token이다. 비용은 $0.00005 (qwen3-vl-flash)부터 $0.0137 (claude-fable-5)까지다.
- 과금 방식은 3가지다. patch 공식(Qwen: 정확히 (side/32)²+2), 상한이 있는 tile 방식(GPT는 693에서 멈춤), 정액제(Gemini는 thumbnail을 포함해 모든 크기에서 1,089)다.
- 문서에 나온 규칙 중 3개가 계측 결과와 맞지 않았다. Claude flagship은 1,568px가 아니라 ≈1,920px에서 downscale하고, Gemini는 문서의 258 대신 1,089를 정액으로 청구하며, Qwen의 grid는 28px가 아니라 32px다.
- 파일 형식과 콘텐츠는 token을 단 하나도 바꾸지 않았다. 과금은 geometry로만 결정된다.
Vendor 문서에서 설명하는 이미지 과금 방식
7개 family 중 5개가 규칙을 공개했지만, 그중 3개는 실제 계측 결과와 맞지 않았다. 아래 표가 이 글의 요약이다. 이후 모든 section은 문서와 측정값이 다른 근거이거나, 문서에서 전혀 다루지 않은 비용 동작을 설명한다.
| Family | 문서 내용 | 측정 결과 |
|---|---|---|
| OpenAI | 32px patch와 model별 patch budget 사용 (문서) | 형태는 일치: 64px에서 6 token, 693 token에서 고정 |
| Anthropic | (w x h)/750, 긴 변이 1,568px를 넘으면 downscale (문서) | 512~1,024px에서 공식과 정확히 일치. 1,568 상한은 Haiku에만 적용되고, flagship은 ≈1,920px까지 계속 과금 |
| 384px 이하 이미지는 258 token, 더 크면 768px tile당 258 token (문서) | 모든 크기에서 1,089로 고정, 64px 아이콘도 동일. 문서에 나온 media_resolution 설정은 측정한 API surface에서 어떤 표기로도 동작하지 않음 | |
| Alibaba | 28x28px당 1 token, 최소 4 (문서) | qwen3-vl에서는 32px grid가 token 단위로 정확히 일치((side/32)²+2), 최솟값 66, 상한 1,600px |
| Moonshot | 동적 token, 공개 공식 없음, 최대 4K 이미지 지원 (문서) | 일관된 결과: 2차 함수 형태로 증가하며 3,072px까지 상한 없음(11,674 token) |
| MiniMax / ByteDance | 확인 가능한 공개 공식 없음 | 2,048px 상한까지 2차 함수 형태로 증가. 이미지당 1,298로 고정 |
오른쪽 열에는 뚜렷한 공통점이 있다. 문서의 규칙은 모두 geometry, 즉 patch, tile, divisor를 기준으로 한다. geometry는 계측할 수 있으므로 직접 측정했다. 두 열이 다르면 예산 spreadsheet도 그대로 틀어진다. 문서에 나온 1,568px 상한을 기준으로 Claude flagship pipeline의 예산을 잡으면 큰 이미지 비용을 약 45% 적게 추산하게 된다. Gemini thumbnail을 258 token으로 예상했다면 모든 아이콘에서 그 4.2배를 내게 된다.
이미지 한 장의 token 비용
측정 matrix에서 이미지 한 장은 model과 크기에 따라 6~5,486 token이었다. 하지만 token 수는 청구액의 절반만 설명한다. 아래 표는 동일한 1024x1024 PNG를 catalog의 모든 vision model에 넣고, 각 model의 입력 단가를 적용한 결과다.
| Model | Token (1024²) | 영어 텍스트 환산 | Model의 token 1K개당 입력 가격 대비 | 입력 단가 /1M | 이미지당 비용 |
|---|---|---|---|---|---|
| qwen3-vl-flash | 1,026 | ≈770단어 | 1.03x | $0.05 | $0.00005 |
| qwen3-vl-plus | 1,026 | ≈770단어 | 1.03x | $0.20 | $0.0002 |
| minimax-m3 | 1,371 | ≈1,030단어 | 1.37x | $0.30 | $0.0004 |
| Dola-Seed-2.0-pro | 1,298 | ≈970단어 | 1.30x | $0.50 | $0.0006 |
| gpt-5.6-luna | 693 | ≈520단어 | 0.69x | $1.00 | $0.0007 |
| gemini-3.7-flash | 1,089 | ≈820단어 | 1.09x | $0.75 | $0.0008 |
| claude-haiku-4-5 | 1,373 | ≈1,030단어 | 1.37x | $1.00 | $0.0014 |
| gemini-3.6-flash | 1,089 | ≈820단어 | 1.09x | $1.50 | $0.0016 |
| qwen3.8-max | 988 | ≈740단어 | 0.99x | $2.00 | $0.0020 |
| gemini-3.1-pro-preview | 1,089 | ≈820단어 | 1.09x | $2.00 | $0.0022 |
| claude-sonnet-5 | 1,372 | ≈1,030단어 | 1.37x | $2.00 출시 특가 | $0.0027 |
| kimi-k3 | 1,379 | ≈1,030단어 | 1.38x | $3.00 | $0.0041 |
| claude-opus-5 | 1,372 | ≈1,030단어 | 1.37x | $5.00 | $0.0069 |
| claude-fable-5 | 1,372 | ≈1,030단어 | 1.37x | $10.00 | $0.0137 |
여기서 세 가지를 읽을 수 있다. 첫째, 이 환산값은 말 그대로 비용에 반영된다. 영어는 token당 0.75단어로 잡을 때 1024px 이미지 한 장이 5201,030단어짜리 문서만큼 context budget을 차지한다. 이미지가 많은 대화에서 context window와 예산이 텍스트보다 훨씬 빨리 소진되는 이유다. 둘째, 달러 비용은 거의 전적으로 단가가 결정한다. token 수는 6931,379로 2배 안에 몰려 있다. 따라서 어떤 model이든 이미지 한 장은 해당 model의 입력 token 1,000개 가격 대비 0.69x~1.38x다. 결국 달러 열은 대부분 각 model의 입력 단가를 다시 보여준다. 셋째, family 내부에서는 tokenizer를 그대로 공유한다. qwen3-vl 두 build, GPT-5.6 두 variant, Gemini 3종, Claude 4종은 모든 정사각형 이미지에서 동일하거나 거의 동일한 값을 반환했다. 텍스트에서 측정한 family당 tokenizer 하나 패턴과 같다.
이미지 token 수를 결정하는 요인
비용을 바꾸는 요인은 5개이고, 흔히 영향을 준다고 생각하는 3개는 아무 효과가 없었다. 이후 내용은 아래 표의 각 행을 자세히 분석한다.
| 요인 | 영향 | 적용 대상 |
|---|---|---|
| 과금 방식 | patch 공식, 상한이 있는 tile, 정액제 | 아래 과금 방식 표 |
| 해상도(면적) | 가장 큰 요인, 대략 2차 함수 형태 | 정액제 2종을 제외한 모든 model |
| Downscale 상한 | 상한을 넘는 pixel은 과금하지 않음 | 1,600px (Qwen), ≈1,920px (Claude flagship), 1,568px (Haiku), 693 token 상한(GPT). Kimi는 상한 없음 |
| 종횡비 | 2차 요인. bounding grid는 긴 strip에 더 많이 과금하고, 긴 변 상한을 넘으면 오히려 할인됨 | GPT는 3:1에서 +84% 후 8:1에서 -11%. Haiku는 8:1에서 -71% |
| 이미지 수 | 정확히 합산되며 volume discount 없음 | 15개 model 전체 |
| 콘텐츠(사진, 텍스트, 빈 이미지) | 영향 없음 | 측정한 모든 model |
| 파일 형식(PNG/JPEG/WebP) | 영향 없음 | 측정한 모든 model |
| 파일 크기(byte) | 영향 없음 | 측정한 모든 model |
영향이 없었던 3개 항목은 따로 짚을 필요가 있다. 두 가지 잘못된 통념이 모두 퍼져 있기 때문이다. 이 matrix의 어떤 API도 압축률이나 이미지 복잡도를 과금에 반영하지 않았다. geometry를 넣으면 token이 나온다.
세 가지 과금 방식
과금 방식은 patch 공식, 상한이 있는 tile, 정액제 3가지다. 작은 이미지의 가격은 방식에 따라 완전히 달라진다. 64px부터 2,048px까지 6단계로 측정했다.
| Model | 64px | 128px | 256px | 512px | 1,024px | 2,048px | 방식 |
|---|---|---|---|---|---|---|---|
| qwen3-vl (둘 다) | 66 | 66 | 66 | 258 | 1,026 | 2,502 | patch: (side/32)²+2, 최소 8x8, 상한 1,600px |
| qwen3.8-max | 28 | 28 | 28 | 220 | 988 | 2,464 | patch, 더 낮은 최솟값 |
| gpt-5.6 (둘 다) | 6 | 21 | 78 | 309 | 693 | 693 | tile, 693에서 고정 |
| gemini (3종 전체) | 1,089 | 1,089 | 1,089 | 1,089 | 1,089 | 1,089 | 크기와 무관한 정액제 |
| Dola-Seed-2.0-pro | 1,298 | 1,298 | 1,298 | 1,298 | 1,298 | 1,298 | 크기와 무관한 정액제 |
| kimi-k3 | 17 | 33 | 108 | 369 | 1,379 | 5,486 | 2차 함수 형태, 확인된 상한 없음 |
| minimax-m3 | 18 | 27 | 102 | 363 | 1,371 | 5,186 | 2차 함수 형태, 2,048px에서 상한 |
| claude (4종 전체) | 12 | 28 | 103 | 364 | 1,372 | 4,764 | (w x h)/750, downscale 상한 |

Qwen 공식은 예산 산정에 그대로 써도 될 만큼 정확하다. 1,024px 정사각형은 (1024/32)² + 2 = 1,026으로, token 단위까지 일치했다. 최소 8x8 patch(66)로 padding되며 downscale 상한은 1,600px다. 1,600~1,920px 구간은 모두 정확히 2,502로 측정됐다. GPT는 693까지 tile로 과금하고 그 이상 올라가지 않는다. 1,024px 이미지와 2,048px 이미지의 비용이 같다. 정액제 2종은 thumbnail traffic에서 함정이 된다. Gemini는 64px 아이콘에도 1,089 token을 청구하며, downscale 후 4K screenshot과 비용이 같다. Seed는 1,298이다. 반대편에서는 Kimi K3가 다른 model의 상한을 지나서도 계속 증가했다. 3,072px 정사각형이 11,674 token이었고, matrix에서 downscale을 확인하지 못한 유일한 model이었다.
정확한 downscale 경계
Kimi를 제외한 모든 family는 과금 전에 큰 이미지를 resize한다. 경계는 문서가 아니라 계측값을 따라야 한다. Claude 경계는 claude-sonnet-5 이상에서 실제 비용에 직접 영향을 주므로 자세히 볼 필요가 있다. 1,568px는 3,139 token, 1,728px는 3,847 token, 1,920px는 4,764 token이며 여기서 멈춘다. 2,048px와 2,304px도 4,764다. flagship 3종은 문서에 나온 상한보다 약 45% 많은 실제 pixel에 계속 과금한다. claude-haiku-4-5만 문서대로 동작한다. 업로드 pipeline을 제어할 수 있다면 encoding 전에 각 model의 측정 상한으로 resize해야 한다. 경계를 넘는 pixel은 Kimi에서는 추가 과금되고, 나머지에서는 조용히 버려진다. 지나치게 큰 이미지는 bandwidth만 쓰고 얻는 것은 없다.
형태, 콘텐츠, 파일 형식이 비용에 미치는 영향
측정한 형태별 차이는 두 요인만으로 모두 설명된다. model이 면적을 세는지, bounding grid를 세는지, 그리고 긴 변의 downscale threshold가 어디인지다. 파일 크기는 관계없다. 콘텐츠와 형식은 어느 model에서도 아무 차이를 만들지 않았다. 512px 단색 이미지, noise field, 텍스트 페이지는 측정한 모든 model에서 같은 비용이 나왔다. 같은 이미지를 243KB (PNG), 176KB (JPEG), 174KB (WebP)로 전송해도 결과는 같았다.
요인 측정에서는 면적을 1 megapixel로 고정하고 형태만 길게 늘렸다.
| Model | 1:1 | 2:1 | 3:1 | 4:1 | 8:1 (긴 변 2,896px) |
|---|---|---|---|---|---|
| gpt-5.6 (둘 다) | 693 | 1,271 | 1,278 | 1,230 | 616 |
| claude flagship 3종 | 1,372 | 1,355 | 1,411 | 1,409 | 1,107 |
| claude-haiku-4-5 | 1,373 | 1,356 | 1,068 | 788 | 396 |
| minimax-m3 | 1,371 | 1,352 | 1,410 | 1,298 | 650 |
| kimi-k3 | 1,379 | 1,361 | 1,417 | 1,415 | 1,361 |
| qwen3-vl (둘 다) | 1,026 | 1,037 | 992 | 1,026 | 992 |
| gemini (3종 전체) | 1,089 | 1,081 | 1,083 | 1,056 | 1,034 |
| Dola-Seed-2.0-pro | 1,298 | 1,277 | 1,304 | 1,298 | 1,315 |
각 행을 두 요인에 맞춰 보면 된다. Qwen, Kimi, Gemini, Seed는 평평하다. 순수 면적 기준이거나 고정 요금이라 형태 항목이 없다. GPT만 bounding grid로 과금한다. 같은 pixel 수라도 긴 strip에는 최대 84%를 더 청구한다. 하지만 8:1에서 긴 변 제한을 넘으면 downscale로 이 추가 비용이 사라진다. 결과는 616 token으로 정사각형보다 저렴하다. downscale threshold가 있는 family는 각 model의 경계에서 같은 전환을 보인다. Haiku는 3:1부터 할인된다. 긴 변 1,774가 1,568 상한을 넘어 1,068이 되고, 이후 788, 396으로 내려간다. Claude flagship은 8:1에서만 할인된다. 2,896가 약 1,920px 경계를 넘어 1,107이 된다. MiniMax도 8:1에서 2,048 상한을 넘어 650이 된다. 가로로 긴 문서와 screenshot traffic에서는 GPT에 보내기 전에 strip을 나누거나 downscale하는 편이 낫다. Haiku에서는 극단적인 형태의 pixel이 Claude 중 가장 저렴하게 처리된다.
이미지 입력 비용을 실제로 줄이는 방법
효과가 큰 순서대로 3가지다. 첫째, model의 상한에 맞춰 resize한다. downscale 경계를 넘는 모든 pixel은 Kimi에서는 과금되고, 다른 model에서는 버려진다. 둘째, GPT에서 detail: "low"를 사용한다. 512px에서는 어느 설정이든 309로 차이가 없다. 하지만 2,048px에서는 low가 309 token으로 고정되고, high나 auto의 693보다 55% 저렴하다. 전체 model 중 요청별로 이미지 비용을 조정할 수 있었던 유일한 설정이다. 셋째, workload에 맞는 과금 방식을 고른다. 정액제 model인 Gemini와 Seed는 thumbnail이나 아이콘 traffic에 부적합하고, 크기가 일정하게 큰 scan에는 적합하다. patch와 tile model은 작은 이미지에 비례해 과금한다. 64px 아이콘은 GPT에서 6 token, Kimi에서 17 token이다.
여러 이미지를 한 요청에 넣어도 할인은 없다. 15개 model 모두 동일한 이미지 1장, 2장, 4장을 한 message에 넣었을 때 각 이미지의 단일 비용이 정확히 합산됐다. 정액제 방식에서 이 계산은 특히 불리하다. Gemini 요청 하나에 256px thumbnail 4장을 넣으면 이미지 token만 4,356이고, qwen3-vl-flash에서는 같은 4장이 264다.
FAQ
1024x1024 이미지는 몇 token인가?
같은 PNG를 측정한 결과 GPT-5.6은 693, Qwen 3.8 Max는 988, qwen3-vl은 1,026, Gemini는 1,089, ByteDance Seed는 1,298, MiniMax는 1,371, Claude는 1,372, Kimi K3는 1,379였다. token 수가 2배 차이 나는 것보다 적용 단가가 더 중요하다. 달러 비용은 $0.00005 (qwen3-vl-flash)부터 $0.0137 (claude-fable-5)까지다.
이미지 파일 형식이나 압축률이 token 비용에 영향을 주나?
측정한 모든 model에서 영향이 없었다. 같은 512px 이미지를 PNG (243KB), JPEG (176KB), WebP (174KB)로 보내도 token 수는 같았다. 단색, noise, 텍스트가 많은 콘텐츠도 동일했다. 과금은 pixel dimensions로만 결정된다. 압축은 bandwidth를 줄이기 위해 사용해야 하며 token 비용은 줄이지 못한다.
detail: "low"로 이미지 token을 줄일 수 있나?
GPT-5.6에서는 가능하지만 작은 이미지 threshold를 넘을 때만 효과가 있다. 2,048px 이미지는 low에서 309 token, high나 auto에서 693 token으로 55% 줄어든다. 512px에서는 세 설정 모두 309였다. matrix의 다른 어떤 model도 요청별 이미지 비용을 조절하는 동작 가능한 설정을 제공하지 않았다.
여러 이미지를 한 요청으로 묶으면 더 저렴한가?
아니다. 모든 model에서 동일한 이미지 1장, 2장, 4장의 비용이 정확히 합산됐고, 이미지마다 전체 가격이 적용됐다. batching은 request overhead와 latency를 줄일 뿐 이미지 token은 줄이지 못한다. 정액제 model인 Gemini와 Seed에서는 작은 이미지를 여러 장 넣은 요청이 가장 비싼 형태다.
2026-08-13/14에 Synthorai gateway를 통해 17개 model(vision 15개, text-only control 2개)을 측정했다. 정확한 dimensions로 로컬에서 생성한 PNG를 사용했고, 이미지가 포함된 prompt token에서 salted same-text baseline을 빼 이미지 비용을 구했다. 6단계 크기(642,048px), 3,072px까지의 boundary probe, 1MP 종횡비 6종(1:18:1 및 1:4 세로형), 콘텐츠 유형 3종, PNG/JPEG/WebP, GPT의 detail low/high/auto, 이미지 1/2/4장 묶음을 측정했고, 모든 model에서 code-word 식별도 확인했다. 달러 금액은 측정일에 각 model page에 표시된 입력 단가에 측정 token을 곱했다(Sonnet 5는 $2 출시 특가 적용). Vision 과금 규칙은 예고 없이 바뀔 수 있다. 특정 표의 수치에 의존하기 전에 size ladder를 다시 실행해야 한다.