신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.
AI API 과금 단위 17가지: token부터 PTU-hour까지

AI API 과금 단위 17가지: token부터 PTU-hour까지

목차
  1. AI API는 어떤 단위로 과금하나요?
  2. 사용량은 어떤 단위로 계산하나요?
  3. 시간이나 용량을 빌릴 때는 어떤 단위를 사용하나요?
  4. 단위는 그대로 두고 요율만 바꾸는 요소는 무엇인가요?
  5. Credit와 CCU는 무엇인가요?
  6. 어떤 반올림 규칙과 최소 과금이 문제를 일으키나요?
  7. 서로 다른 단위의 비용은 어떻게 비교하나요?
  8. Gateway에서 17가지 단위를 정규화하는 방법
  9. FAQ

AI API는 사용량을 최소 17가지 단위로 측정합니다. text token, reasoning token, cached token, media-input token, realtime audio token, 문자, 미디어 재생 시간, 출력 객체, 요청, 페이지, GPU-second, container-hour, GB-day, token-hour, PTU-hour, training token, 합성 credit입니다. 둘 이상의 modality를 사용하는 제품의 비용을 추산하려면 여러 단위를 서로 환산해야 합니다. 예산이 틀어지는 지점도 대부분 이 환산 규칙입니다. 이 글에서는 각 단위의 측정 방식과 주의할 점을 모두 정리합니다.

TL;DR

  • AI API의 과금 단위는 최소 17가지이며, 소비량, 시간 및 용량, 요율 modifier, 합성 wrapper의 네 계층으로 나뉩니다.
  • 오디오 1분은 두 가지 방식으로 과금됩니다. 전용 음성 인식은 audio-minute당 $0.0020에서 $0.0164이고, gpt-realtime-2.1은 들은 음성 100 ms당 audio token 1개를 과금합니다.
  • 저장 공간도 두 단위로 측정합니다. OpenAI file search는 GB-day당 $0.10, Gemini context caching은 시간당 100만 token에 $0.50입니다.
  • modifier는 단위가 아니라 요율을 바꿉니다. batch는 반값이고, DeepSeek 비혼잡 시간대에는 다시 절반으로 낮아지며, 미국으로 고정한 Claude inference는 1.1x입니다.

AI API는 어떤 단위로 과금하나요?

아래 섹션 순서대로 17가지입니다. 소비량 단위 1번부터 10번, 시간 및 용량 단위 11번부터 16번, 합성 wrapper 17번이 있습니다. 단위는 그대로 두고 요율만 바꾸는 modifier 계층도 별도로 존재합니다. 아래 표에서 전체 단위를 확인할 수 있으며, 각 행은 상세 설명으로 연결됩니다.

AI API 과금 단위 전체 지도: text token부터 페이지까지 소비량 단위 10가지, GPU-second부터 training token까지 시간 및 용량 단위 6가지, 합성 wrapper인 credit와 CCU, batch 할인부터 무료 할당량 임계점까지의 요율 modifier

#단위사용되는 곳주의할 점
1Text token모든 chat API같은 텍스트도 tokenizer마다 개수가 다르며, tokenizer 세대가 바뀌면 token이 약 30% 늘어날 수 있음
2Reasoning token추론 모델사용자에게 보이지 않는 출력도 과금되며, 일부 답변에서는 88%에서 99.3%를 차지함
3Cached tokenPrompt cachingTTL에 따른 쓰기 할증, 읽기 할인, provider별 최소 길이
4Media-input tokenvision, audio, PDF 입력이미지 하나에 적용되는 세 가지 환산 방식, PDF는 이미지 요율로 과금
5Realtime audio token음성 간 실시간 대화들은 음성 100 ms당 1 token, 출력 음성 50 ms당 1 token
6문자TTS, guardrailaudio-minute 기준으로 중국어 음성은 영어보다 3배에서 7배 저렴함
7미디어 분/초음성 인식, 비디오 및 음악 생성정확도가 거의 같은 모델 사이에서도 audio-minute당 가격 차이가 8배
8출력 객체이미지 생성, 사람 평가해상도가 같아도 품질 설정 하나로 이미지 한 장의 비용이 36배 달라짐
9요청웹 검색, grounding, file search검색당 $0.01에 주입된 token 비용 추가, 주입된 token은 모델의 입력 요율 적용
10페이지OCR, document AIMistral은 1,000페이지 단위로 과금하며 batch와 cache 할인도 적용
11GPU-secondServerless 모델 hostGPU 종류에 따라 요율이 다름, $0.000225/s (T4)에서 $0.001525/s (H100)
12Container/session-hour코드 실행, managed agent도구가 실행되지 않아도 최소 5분과 파일 preload 시간이 과금됨
13GB-day파일 및 vector 저장 공간무료 1 GB를 초과하면 GB-day당 $0.10
14Token-hourContext-cache 저장 공간Gemini는 시간당 100만 token에 $0.50, 2027년에는 2배로 인상
15PTU/model-unit hourProvisioned capacityCached token은 용량을 사용하지 않음, 출력이 입력보다 더 많은 용량 소비
16Training tokenFine-tuningepoch 수만큼 비용이 늘어나며, 일부 모델은 대신 시간당 $100 과금
17Credit/CCUMarketplace, subscription실제 요금표에 배수를 적용한 단위이며, AWS Marketplace에서는 100 CCU = $1.00

사용량은 어떤 단위로 계산하나요?

17가지 중 10가지는 소비량 단위입니다. 서비스를 사용할 때마다 meter가 올라가며, modality마다 측정 대상이 다릅니다.

Token 계열 단위 1번부터 5번. Text token이 기준이지만 하나의 고정 단위는 아닙니다. 모델 계열마다 tokenizer가 달라 같은 텍스트도 과금되는 token 수가 다릅니다. Anthropic 문서에 따르면 4.7 이상에서 사용하는 tokenizer는 같은 텍스트를 이전 세대보다 약 30% 많은 token으로 만듭니다. Reasoning token은 대개 사용자가 볼 수 없는 output token입니다. 10-token 답변에 81개 token이 과금된 사례를 측정했으며, 그중 reasoning이 88%였습니다. Cached token은 연산 종류와 cache 수명인 TTL에 따라 가격이 달라집니다. Claude API에서는 5분 cache 쓰기가 기본 입력의 1.25x, 1시간 쓰기가 2x, 읽기가 0.1x입니다. 미디어 입력은 provider별 공식에 따라 token으로 환산됩니다. 1024x1024 이미지 한 장은 GPT-5.6에서 693개, Gemini에서 1,089개, Claude에서 1,372개 token으로 각각 과금됩니다. Gemini는 오디오를 초당 25 token, 720p 비디오를 초당 5,792 token으로 계산하며, PDF에는 image token 요율을 적용합니다. 실시간 음성은 별도의 token을 사용합니다. gpt-realtime-2.1사용자 음성 100 ms당 audio token 1개, 모델 음성 50 ms당 1개를 정확히 과금합니다.

문자와 시간, 단위 6번과 7번. Text-to-speech (TTS)는 문자 수로 과금됩니다. OpenAI 요금은 100만 문자당 $15에서 $30입니다. 이 때문에 중국어 음성은 audio-minute 기준으로 영어보다 3배에서 7배 저렴합니다. 같은 발화 시간에 필요한 문자 수가 더 적기 때문입니다. Bedrock guardrail은 “text unit”을 최대 1,000자로 정의해 자체 문자 단위로 사용합니다. 전용 음성 인식 모델은 audio-minute 단위로 과금되며, 측정한 모델의 범위는 $0.0020에서 $0.0164였습니다. 비디오 생성은 해상도별 초 단위로 과금하고, Gemini는 곡 단위로 음악 가격을 책정합니다.

객체, 요청, 페이지, 단위 8번부터 10번. 이미지 생성은 tier별 이미지 수 또는 output token 수로 과금하며, 두 방식의 비용은 특정 지점에서 역전됩니다. output token이 약 1,000개 미만이면 token 기반 과금이 유리하고, 그 이상이면 이미지당 정액 과금이 유리합니다. 서버 측 도구는 요청당 과금됩니다. 측정한 세 가지 서비스 모두 웹 검색 비용이 검색당 $0.01이었고, 검색 결과는 input token으로 다시 과금됩니다. 검색당 1,500개에서 3,100개 token입니다. 모델이 요청 처리 중 Google Search를 조회하게 하는 Gemini search grounding에는 별도의 무료 할당량이 있습니다. 월 5,000건까지 무료이고, 이후에는 1,000건당 $14입니다. OCR은 페이지 단위로 과금됩니다. Bedrock 모델 평가는 사람이 완료한 작업당 $0.21을 청구합니다. 이 목록에서 사람 수를 기준으로 하는 유일한 단위입니다.

시간이나 용량을 빌릴 때는 어떤 단위를 사용하나요?

6개 단위는 token 처리 여부와 관계없이 리소스를 점유한 시간에 따라 과금됩니다. 코드가 아무 작업도 하지 않는 동안에도 meter가 돌아가므로 비용 추산에서 가장 자주 빠지는 계층입니다.

단위는 그대로 두고 요율만 바꾸는 요소는 무엇인가요?

단위를 바꾸지 않고 가격만 바꾸는 요소는 7가지입니다. batch tier, service tier, 시간대, context 길이, 지역, 품질 설정, 무료 할당량입니다. 모델당 가격을 하나만 저장하는 과금 코드는 이 모든 경우를 잘못 계산합니다. 같은 token도 처리 방식, 시간, 지역에 따라 가격이 달라지기 때문입니다.

Modifier영향예시
Batch tier입력과 출력 50% 할인AnthropicOpenAI batch API, Mistral OCR에도 적용
Service tier속도 향상에 할증OpenAI fast tier는 standard 요율의 2x, flex tier는 할인
시간대비혼잡 시간대 할인DeepSeek는 비혼잡 요율이 혼잡 요율의 절반이며, 평일 01:00-04:00 및 06:00-10:00 UTC가 혼잡 시간대
Context 길이특정 임계점에서 요율 변경Gemini 요율은 prompt token이 200k를 넘으면 상승, Claude 4.6+는 전체 1M window에 동일 요율 적용
지역데이터 상주 지역 할증Claude inference_geo: "us"모든 token 범주에 1.1x 적용, Bedrock과 Google Cloud의 Claude 모델 regional endpoint는 global보다 10% 할증
품질 설정단위는 같지만 소비량이 달라짐gpt-image에서 1024x1024 이미지 한 장은 품질에 따라 과금 token이 196개에서 7,024개로 달라짐
무료 할당량임계점에서 유료 전환Grounding은 월 5,000건 무료, code execution은 월 1,550시간 무료

배수는 중첩됩니다. Anthropic 문서에 따르면 caching 배수에는 batch 할인과 데이터 상주 지역 할증이 함께 적용됩니다. 따라서 cache를 사용하고 batch로 처리하며 미국에 고정한 token 하나에는 세 가지 계수가 동시에 붙습니다.

Credit와 CCU는 무엇인가요?

실제 meter를 감싼 합성 단위로, 청구서에 하나의 항목만 표시해야 할 때 사용합니다. AWS 또는 Azure Marketplace를 통해 Claude를 사용하면 일반 단위 요율로 사용 금액을 계산한 뒤 1달러당 100 Claude Consumption Units로 변환합니다. 할인은 CCU 가격을 낮추는 방식이 아니라 측정되는 CCU 수를 줄이는 방식으로 반영됩니다. Subscription 제품도 credit으로 같은 방식을 사용합니다. 한 회사 안에서도 경계가 다를 수 있습니다. ElevenLabs는 subscription plan을 credit으로 측정하지만, API 사용량은 credit이 아닌 미국 달러로 과금된다고 명시합니다. 합성 단위를 사용한다면 그 아래에 어떤 소비량 또는 용량 meter가 있고, 환산율이 얼마인지 확인해야 합니다.

어떤 반올림 규칙과 최소 과금이 문제를 일으키나요?

각기 다른 문서에 흩어진 양자화 규칙을 한곳에 모았습니다.

서로 다른 단위의 비용은 어떻게 비교하나요?

모든 meter를 환산할 수 있는 유일한 공통 단위인 사용자 interaction당 비용으로 정규화해야 합니다.

한 번의 음성 통화 흐름도: cascade stack은 음성 인식을 audio-minute, LLM을 token, text-to-speech를 문자로 과금해 대화 1분당 총 $0.0037에서 $0.025가 들고, realtime stack은 audio token만 과금해 $0.016에서 $0.057가 발생함 음성 agent 연구에서도 이 방식을 사용했습니다. Audio-minute로 과금되는 음성 인식, token으로 과금되는 LLM, 문자로 과금되는 TTS를 조합한 cascade stack은 대화 1분당 $0.0037에서 $0.025였습니다. gpt-realtime-2.1은 $0.057, mini는 $0.016이었습니다. 이처럼 하나의 비교 가능한 수치로 realtime의 추가 비용과 latency 개선 효과를 함께 평가할 수 있습니다. 다른 사례에도 같은 절차를 적용할 수 있습니다. 먼저 support ticket, 문서, 대화 1분처럼 interaction을 정합니다. 각 처리 단계를 고유 단위로 측정하고 현재 요율을 적용한 뒤 비교합니다. $/1M token과 $/audio-minute를 직접 비교하면 범주 자체가 다릅니다. $/interaction 비교는 단순 계산으로 끝납니다.

Gateway에서 17가지 단위를 정규화하는 방법

Synthorai는 요청 처리 시점에 가격을 계산하고, 금액과 함께 원래 단위를 보관합니다. 모든 요청은 하나의 usage record를 생성합니다. 여기에는 단위별 원시 측정값, 즉 범주별 token, 초, 문자, 요청 수와 적용된 가격 version, 계산된 비용이 들어갑니다. 따라서 invoice 항목을 언제든 단위와 요율의 곱으로 다시 분해할 수 있습니다. Marketplace 경계에서 CCU가 수행하는 환산을 record마다 적용하고 검증 가능하게 보관하는 방식입니다. zero-retention mode와도 함께 사용할 수 있습니다. Usage record에는 meter 값과 content hash만 있으면 되며 payload는 필요하지 않습니다. Upstream 가격이 바뀌어도 price version이 과거 record에 적용된 요금표를 고정합니다. 이 속성 덕분에 월말 정산은 논쟁이 아니라 감사 가능한 검증 과정이 됩니다.

FAQ

Audio token과 text token은 같은 단위인가요?

아닙니다. Realtime audio token은 별도 요율이 적용되는 별개의 단위입니다. gpt-realtime-2.1에서는 token 하나가 들은 음성 100 ms 또는 출력 음성 50 ms를 포함합니다. 이를 분당 비용으로 환산하면 듣기는 $0.0192, 말하기는 $0.0768입니다. 하나의 모델 안에서도 audio와 text meter에는 별도 요금표가 적용됩니다.

같은 이미지인데 provider마다 token 수가 다른 이유는 무엇인가요?

이미지가 아니라 환산 방식이 다르기 때문입니다. Patch 공식, 상한이 있는 tile 방식, 고정 요금 방식이 함께 사용됩니다. 1024x1024 이미지 한 장은 GPT-5.6에서 693개, Gemini에서 1,089개, Claude에서 1,372개 token으로 측정됐습니다. 파일 형식이나 이미지 내용은 token 수를 전혀 바꾸지 않았습니다.

Cached token도 input token에 포함되나요?

별도 단위로 측정되며 연산 종류에 따라 가격이 다릅니다. Cache 쓰기는 기본 입력보다 비쌉니다. Claude API에서는 TTL에 따라 1.25x 또는 2x입니다. 읽기는 0.1x로 할인됩니다. Provisioned capacity에서는 이 차이가 두 번 영향을 줍니다. Cached token은 PTU 용량을 사용하지 않기 때문에, caching을 적용하면 비용과 예약해야 할 용량이 모두 줄어듭니다.

음성은 문자당 과금과 분당 과금 중 어느 쪽이 더 저렴한가요?

언어에 따라 다릅니다. 문자당 과금하는 TTS에서는 중국어가 더 적은 문자로 더 많은 음성을 담기 때문에 audio-minute 기준으로 영어보다 3배에서 7배 저렴합니다. 분당 요금은 언어와 무관합니다. 음성 인식의 경우 측정한 분당 과금 모델은 깨끗한 음성에서 정확도가 거의 같았고, audio-minute당 $0.0020에서 $0.0164였습니다.

단위 정의와 요율은 2026-08-30에 조회한 provider 가격 페이지와 본문에 연결된 자체 측정 연구를 기준으로 했습니다. 가격은 자주 바뀌고 단위 구조는 비교적 천천히 바뀝니다. 과금 코드에 수치를 반영하기 전 연결된 원문을 확인하세요.

관련 측정 연구: token 구성 분석, prompt caching, cache 최소 길이, 이미지 입력 token, 이미지 생성, 음성 인식, 음성 텍스트 변환, 실시간 음성, 비디오 생성, 웹 검색, 음성 agent, tokenizer, 언어별 비용.

← 블로그로 돌아가기