Claude Sonnet 5의 새 토크나이저: 같은 prompt에서 token 41% 증가
목차
claude-sonnet-5를 이제 Synthorai gateway에서 사용할 수 있습니다. 현재 가격은 입력 / 출력 token 100만 개당 $2 / $10로, Opus 4.8보다 2.5배 저렴하고 Sonnet 4.6보다도 낮습니다. 다만 이 가격은 오래가지 않습니다. 2026년 8월 31일까지 적용되는 출시 기념 가격이며, 9월 1일부터는 Sonnet 4.6과 같은 $3 / $15로 돌아갑니다.
Claude 계열에서 cache를 사용 중이라면 caching 방식과 TTL 조건은 그대로 적용됩니다. 비용은 다시 계산해야 합니다. Sonnet 5의 token 계산 방식이 달라졌기 때문입니다. 새 토크나이저는 같은 영어 텍스트를 Sonnet 4.6보다 약 41% 많은 입력 token으로 변환합니다. 비용과 한도 모두 token 수를 기준으로 하므로, 표시된 단가만으로 실제 비용을 판단해서는 안 됩니다.
TL;DR
- Claude Sonnet 5의 입력 / 출력 token 100만 개당 가격은 2026년 8월 31일까지 $2/$10입니다. 9월 1일부터는 Sonnet 4.6과 같은 $3/$15로 돌아갑니다.
- 같은 텍스트가 Sonnet 5에서는 2,245 tokens, Sonnet 4.6에서는 1,594 tokens로 계산됩니다. Sonnet 5가 41% 많으며, Opus 4.8과는 정확히 같습니다.
- 정상 가격 기준으로 같은 영어 prompt의 비용은 Sonnet 5가 Sonnet 4.6보다 약 41% 높습니다.
- Caching 방식은 그대로이며, 읽기 비용은 약 90% 할인됩니다. 측정 결과 warm cache turn은 $0.0017로, Opus 4.8의 $0.0043보다 저렴했습니다.
코드 변경이나 품질 평가를 제외하더라도, token 수 변화는 다음 항목에 영향을 줍니다.
- Prompt당 비용. 정상 가격에서는 같은 영어 prompt가 Sonnet 4.6보다 약 41% 비쌉니다. token당 가격은 같지만 동일한 텍스트가 더 많은 token으로 청구되기 때문입니다.
- 모든 token 기반 추정치. 4.6이나 로컬 토크나이저를 기준으로 잡은 호출당 예산은 Sonnet 5에서 약 40% 부족합니다. 로컬 추정값이 아니라 실제
usage를 측정해야 합니다. - Context window 여유 공간. 같은 문서가 window를 약 41% 더 차지하므로, long-context와 RAG 호출에서 요청당 처리할 수 있는 실제 텍스트가 줄어듭니다.
- Rate limit. 동일한 workload에서도 분당 token 한도가 약 41% 빠르게 소진되어 throughput이 감소합니다.
- Cache 적용 조건, 작은 장점. 최소 1,024-token 조건을 넘기기 쉬워집니다. 4.6에서 기준에 약간 못 미쳤던 prefix도 Sonnet 5에서는 cache 대상이 될 수 있습니다.
이 글에서는 가격, caching 비용 구조, token 수 변화를 실제 측정값으로 살펴봅니다.
가격, caching, TTL, token 수는 2026-07-01에
https://synthorai.io/의 Anthropic-native/v1/messages를 대상으로 측정했습니다. Token당 가격은 실제 호출의usage비용에서 산출했으며, 출시 기념 가격과 정상 가격, 8월 31일 종료 일정은 Anthropic 발표를 기준으로 했습니다. 수치를 인용하기 전에 각자의 prompt로 다시 측정하세요.
사용 방법
import os
from anthropic import Anthropic
anth = Anthropic(
api_key=os.environ["SYNTHORAI_KEY"],
base_url="https://synthorai.io/", # SDK appends /v1/messages
)
msg = anth.messages.create(
model="claude-sonnet-5", # the only line that changes
max_tokens=512,
system=[
{"type": "text", "text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}},
],
messages=[{"role": "user", "content": question}],
)
print(msg.usage) # cache_creation_input_tokens, cache_read_input_tokens, cost
model 필드만 바꾸면 되며 caching 경로는 그대로 유지됩니다. cache_control의 동작 방식은 caching 튜토리얼에서, cache가 필요한 아키텍처상의 이유는 시리즈 1편에서 설명합니다.
가격: 지금은 저렴하지만 9월부터 Sonnet 4.6과 동일
Gateway의 token당 가격입니다. 일반 호출, 즉 cache를 사용하지 않은 호출의 usage 비용에서 산출했습니다.
| 모델 | 입력 ($/M) | 출력 ($/M) |
|---|---|---|
claude-sonnet-5 (출시 기념, 8월 31일까지) | $2.00 | $10.00 |
claude-sonnet-5 (정상 가격, 9월 1일부터) | $3.00 | $15.00 |
claude-sonnet-4-6 | $3.00 | $15.00 |
claude-opus-4-8 | $5.00 | $25.00 |
출시 기념 가격은 실제로 저렴합니다. Opus 4.8과 비교하면 장기적으로도 이점이 있습니다. 정상 가격인 $3 / $15에서도 Sonnet 5가 더 저렴합니다. 두 모델은 토크나이저도 공유하므로, 아래에서 설명하듯 두 가격 모두에서 직접 비교하기 쉽습니다.
Sonnet 4.6과 비교했을 때 할인은 일시적입니다. 9월 1일부터 표시 가격이 같아지므로, 현재 가격을 근거로 세운 “Sonnet 5가 4.6보다 저렴하다”는 계획은 프로모션과 함께 끝납니다. 다음 섹션에서 보듯 단가가 같아지면 동일한 텍스트의 실제 비용은 Sonnet 5가 더 높습니다.
직접 실행하지 않은 성능 benchmark는 공개하지 않습니다. Sonnet 5의 품질이 4.6보다 높은 비용을 정당화하는지는 각자의 eval로 판단해야 합니다.
Caching과 TTL: 그대로 교체 가능
Caching 조건은 다른 Claude 계열과 같습니다. 매 호출마다 사용자 메시지만 바꾸고, 고정된 2.2K-token prefix를 사용해 cold write와 warm read를 연속으로 실행했습니다. Response-level cache가 결과에 영향을 주지 않도록 구성했습니다. 다음은 현재 출시 기념 가격 기준 warm turn당 비용입니다.
| 모델 | Cold turn (cache write) | Warm turn (cache read) | Cold → warm |
|---|---|---|---|
claude-sonnet-5 (출시 기념) | $0.0069 | $0.0017 | 4.0× |
claude-sonnet-4-6 | $0.0079 | $0.0024 | 3.3× |
claude-opus-4-8 | $0.0172 | $0.0043 | 4.0× |
Opus 계열과 동일한 조건이 적용됩니다.
- 읽기 비용 약 90% 할인. Warm cache read 비용은 입력 가격의 약 10%입니다. Anthropic 문서의 cache read 비용 “최대 90%” 절감과 일치합니다. 한 번만 적중해도 손익분기점을 넘습니다.
- 1시간 TTL도 동일하게 동작. Sonnet 5에서
cache_control: {"type": "ephemeral", "ttl": "1h"}이 허용되며,usage객체도 이전과 같이cache_creation.ephemeral_5m_input_tokens와ephemeral_1h_input_tokens로 분리됩니다. 1시간 cache write 비용은 cache 미사용 대비 약 2배이고, 5분 write는 약 1.25배입니다. 읽기는 TTL과 관계없이 약 10%입니다.
표의 warm turn 비용은 출시 기념 가격 기준입니다. 9월 1일부터 Sonnet 5의 수치에 1.5배를 곱해야 합니다. 입력은 $2에서 $3, 출력은 $10에서 $15로 오릅니다. 현재 $0.0017인 Sonnet 5 warm turn은 9월에 약 $0.0026이 됩니다. 여전히 Opus 4.8의 $0.0043보다는 낮지만, Sonnet 4.6보다는 더 이상 낮지 않습니다.
Token 수의 함정
9월 가격 인상의 영향이 더 커지는 이유입니다. 같은 system text가 Sonnet 5에서는 Sonnet 4.6보다 약 41% 많은 입력 token으로 계산됩니다.
| 모델 | 입력 tokens (동일한 텍스트) | 정상 가격 기준 입력 비용 |
|---|---|---|
claude-sonnet-4-6 | 1,594 | $0.0048 |
claude-sonnet-5 | 2,245 | $0.0067 |
claude-opus-4-8 | 2,245 | $0.0112 |
같은 영어 prompt가 Sonnet 5에서는 2,245 tokens로 계산됩니다. Opus 4.8과 정확히 같고, Sonnet 4.6의 1,594보다 훨씬 많습니다. Sonnet 5에는 Opus 계열이 4.7부터 사용한 새 토크나이저가 적용되었습니다.
가격과 token 수를 함께 보면 결론은 명확합니다.
- 출시 기념 기간에는 token 수가 41% 증가하지만 단가가 33% 낮아 $2 대 $3이므로, 같은 uncached prompt의 비용은 4.6과 비슷합니다. 할인된 출력 가격 덕분에 warm turn은 더 저렴합니다.
- 9월 1일부터는 단가가 4.6과 같아져도 token 수는 같아지지 않습니다. 같은 영어 prompt의 비용은 Sonnet 5가 Sonnet 4.6보다 약 41% 높습니다. 이 prefix 기준으로 $0.0067 대 $0.0048입니다. 동일한 텍스트를 같은 token당 가격으로 계산하더라도 token 수 자체가 더 많기 때문입니다.
Opus 4.8과 비교할 때는 이런 문제가 없습니다. 토크나이저가 같아 token 수도 동일합니다. 2,245 = 2,245이므로 Sonnet 5는 출시 기념 가격에서 2.5배, 정상 가격에서 1.67배 저렴합니다.
예산은 7월이 아니라 9월 가격을 기준으로 잡아야 합니다. 9월 1일부터 token당 단가가 1.5배 오르며, token 수 증가는 이미 현재 가격에도 반영되어 있습니다. 예전 vocabulary를 사용하는 로컬 토크나이저 대신 실제 응답의 cache_creation_input_tokens / cache_read_input_tokens를 확인하세요.
Sonnet 5와 Opus 4.8 비교: 장기적으로 유지되는 이점
이번 출시로 장기적인 변화가 생긴 비교입니다. Sonnet 5와 Opus 4.8은 토크나이저를 공유하므로 모든 prompt에서 token 수가 같습니다. 비용 차이는 전적으로 단가에서 발생합니다. Cold turn, warm turn, 입력, 출력 모두 출시 기념 가격에서는 2.5배, 정상 가격에서는 1.67배 저렴합니다. 현재 warm cached turn은 $0.0017 대 $0.0043입니다. 9월에도 약 $0.0026 대 $0.0043입니다.
매 turn마다 prefix가 반복되는 대규모 caching agent loop에서는 이 차이가 누적됩니다. 판단 기준은 평소와 같습니다. 직접 eval을 실행해 Sonnet 5가 품질 기준을 통과한다면 gateway 비용상 장기적으로 유리합니다. 이 이점은 8월 이후에도 유지됩니다. 기준을 통과하지 못해도 동일한 caching 코드에서 model 필드만 바꾸면 Opus 4.8을 사용할 수 있습니다.
Migration checklist
- ✅ Caching 코드를 그대로 사용할 수 있습니다.
cache_controlmarker, breakpoint 수,ttl: "1h",usage필드 이름이 모두 Opus 계열과 같습니다. - ✅ TTL 선택 기준도 같습니다. 실시간 또는 session workload에는 5m, 간헐적 호출이나 중간에 대기하는 agent workload에는 1h를 사용합니다.
- ✅ 할인 구조도 같습니다. 읽기는 약 90% 할인, write는 5m에서 약 1.25배, 1h에서 약 2배입니다.
- ⚠️ 예산에 9월 1일을 반영하세요. 출시 기념 가격은 8월 31일에 끝나며, Sonnet 5는 $3 / $15로 오릅니다. 실제 적용 전에 1.5배 인상을 모델링하세요.
- ⚠️ Token 수를 다시 측정하세요. 4.6 또는 이전 버전에서 이전하는 경우 특히 필요합니다. 같은 텍스트가 Sonnet 5에서는 약 41% 많은 token으로 계산됩니다. 정상 가격에서는 같은 prompt가 4.6보다 저렴한 것이 아니라 더 비쌉니다.
- ⚠️ 실제
usage객체를 기준으로 판단하세요. 구세대 모델에서 저장한 추정값이 아니라 응답의*_input_tokens와cost를 읽으세요.
결론
Sonnet 5는 기간 한정으로 특히 좋은 가격을 제공합니다. Opus 4.8과 비교하면 caching 경로를 그대로 유지하면서 1.67–2.5배 저렴합니다. 품질이 핵심 제약이 아닌 Opus workload라면 가장 먼저 eval할 모델입니다. Sonnet 4.6과 비교했을 때의 이점은 출시 기념 할인뿐입니다. 9월 1일부터 가격이 4.6과 같아지고, 새 토크나이저 때문에 같은 prompt의 실제 비용은 오히려 더 높아집니다. 할인은 활용하되 예산은 9월 가격을 기준으로 잡으세요. 재무팀에 수치를 전달하기 전에 실제 usage 객체로 token 수를 확인해야 합니다.
전체 caching 적용 방법은 KV Cache와 TTL의 동작 방식으로 시작하는 prompt caching 시리즈와 실행 가능한 Python 튜토리얼을 참고하세요.
FAQ
Sonnet 5가 Sonnet 4.6보다 저렴한가요? 출시 기념 기간에만 저렴합니다. 2026년 8월 31일까지는 $2 / $10이며, 4.6은 $3 / $15입니다. 9월 1일부터는 같은 $3 / $15가 적용됩니다. 같은 텍스트가 Sonnet 5에서 약 41% 많은 token으로 계산되므로, 정상 가격에서는 같은 prompt의 비용이 4.6보다 높습니다.
출시 기념 가격은 언제 끝나나요? Anthropic 발표에 따르면 2026년 8월 31일에 끝납니다. 9월 1일부터 입력 token 100만 개당 $3, 출력 token 100만 개당 $15가 적용됩니다.
Sonnet 5는 Opus 4.8보다 얼마나 저렴한가요? 입력과 출력 모두 출시 기념 가격에서는 2.5배, 정상 가격에서는 1.67배 저렴합니다. 두 모델은 토크나이저를 공유하므로 token 수가 같고, 두 가격 모두에서 차이는 전적으로 단가에서 발생합니다.
cache_control 코드를 변경해야 하나요?
아니요. Marker 문법, breakpoint 한도, TTL 옵션이 Opus 계열과 같습니다. model 필드만 바꾸면 됩니다. Warm read 비용은 입력 가격의 약 10%입니다. 1시간 write 비용은 cache 미사용 대비 약 2배, 5분 write는 약 1.25배입니다.
Sonnet 5는 Opus 4.8을 그대로 대체할 수 있나요? Caching, TTL, 비용 측면에서는 migration이 간단하며 두 가격 모두에서 더 저렴합니다. 품질은 직접 eval해야 합니다. 실행하지 않은 성능 benchmark는 공개하지 않습니다. 모델 품질 관련 내용은 Anthropic의 model card를 참고하세요.
검증: 가격, caching, TTL, token 수는 2026-07-01에 단일 tenant에서 Anthropic-native /v1/messages 경로를 통해 https://synthorai.io/를 대상으로 측정했습니다. Token당 가격은 일반 호출의 usage 비용에서 산출했습니다. Turn당 비용은 2.2K-token cached prefix를 사용한 소규모 표본의 중앙값이며, 현재 출시 기념 가격을 반영합니다. 출시 기념 가격과 2026년 8월 31일 종료 일정은 Anthropic의 Sonnet 5 발표를 기준으로 했으며, 할인 및 할증 비율은 Anthropic Prompt Caching 문서와 대조했습니다. 실제 수치는 prompt, region, load에 따라 달라질 수 있습니다.