Claude Sonnet 5.5 vs Sonnet 5: 같은 가격, 작업당 비용 80% 절감
목차
Claude Sonnet 5.5 와 Claude Sonnet 5 의 token 가격은 입력 100 만 token 당 $2, 출력 100 만 token 당 $10 로 같다. 따라서 비용 차이는 전적으로 token 사용량에서 나온다. API 기본값으로 13 개 single-shot 작업을 실행한 결과, 작업당 비용은 Sonnet 5.5 가 $0.0041, Sonnet 5 가 $0.021 로 Sonnet 5.5 쪽이 80% 낮았다. 두 모델 모두 모든 작업을 맞혔다. 문제는 출력 형식이었다. xhigh 미만에서는 Sonnet 5.5 가 hidden reasoning 을 생략하고 풀이 과정을 응답에 직접 쓰는 경우가 있었다. prompt 에 답만 출력하라고 명시해도 마찬가지였다.
TL;DR
- API 기본값에서 작업당 비용은 Sonnet 5.5 가 $0.0041, Sonnet 5 가 $0.021 이었으며, 두 모델 모두 39 회 호출을 전부 맞혔다.
- Sonnet 5.5 비용은
low,medium,high에서 거의 같았다.max비용은 기본값의 3.5 배였다. xhigh미만에서 Sonnet 5.5 는 답만 요구한 156 개 prompt 중 68 개 응답에 풀이 과정을 포함했다. system prompt 로도 해결되지 않았다.- 질문 4 개로 구성된 tool loop 에서
max로 실행한 Sonnet 5.5 비용은 회당 $0.042 로, 기본값의 Opus 5.5 비용인 $0.033 보다 높았다.
Anthropic 은 2026-09-28 에 Sonnet 5.5 를 출시하면서 Sonnet 5 보다 30% 빠르고 “작업당 비용을 최대 30% 절감”한다고 밝혔다. 우리는 출시 다음 날 직접 측정했다.
Claude Sonnet 5.5 에서 무엇이 바뀌었나?
가격은 그대로지만 thinking 제어 방식과 여러 요청 parameter 가 바뀌었다. Sonnet 5.5 는 adaptive thinking 을 사용한다. 답변 전에 hidden reasoning 을 얼마나 수행할지 모델이 직접 결정하며, 이때 사용한 reasoning token 은 출력으로 과금된다. 제어에는 effort 를 사용한다. Messages API 에서는 output_config.effort 로 지정하며, low 부터 max 까지 5 단계가 있다. API 기본값은 high 다.
| Sonnet 5.5 | Sonnet 5 | Opus 5.5 | |
|---|---|---|---|
| 출시일 | 2026-09-28 | 2026-06-30 | 2026-09-22 |
| 입력 / 출력, token 100 만 개당 | $2 / $10 | $2 / $10 | $4 / $20 |
| Cache read, token 100 만 개당 | $0.20 | $0.20 | $0.20 |
| Context window / 최대 출력 | 1M / 128K | 1M / 128K | 1M / 128K |
| 지식 기준일, 공개된 월 기준 | 2026 년 6 월 | 2026 년 1 월 | 2026 년 6 월 |
| API 기본 effort | high | high | medium |
| 가장 낮은 thinking 설정 | between_tools (high 이하) | disabled | 끌 수 없음. thinking 이 항상 활성화됨 |
| Cache 가능한 최소 prompt | 512 tokens | 1,024 tokens | 512 tokens |
Sonnet 5 의 $2 / $10 는 출시 당시 도입 가격이었지만, 현재 Anthropic 가격 페이지에는 정식 가격으로 표시된다. 예정됐던 $3 / $15 인상은 시행되지 않았다.
마이그레이션 가이드에 따르면 다음 요청은 Sonnet 5 에서 동작했지만 Sonnet 5.5 에서는 HTTP 400 을 반환한다.
thinking: {"type": "disabled"}. 대신thinking: {"type": "between_tools"}를 사용한다. 첫 답변 전 reasoning 을 끄는 설정이며high이하에서만 허용된다.- 강제 tool 사용, 즉
tool_choice를any또는 특정 tool 로 지정하는 방식.auto를 유지하고 tool 을 언제 사용해야 하는지 prompt 에 명시한다. - 수동 thinking budget 인
budget_tokens, 기본값이 아닌temperature,top_p,top_k, 모델 응답의 시작 부분을 미리 넣는 prefilled assistant turn. - 2026-08-31 이후 생성된 계정에서 system prompt, tool 또는 이전 message 를 변경한 뒤 Sonnet 5.5 thinking block 을 재전송하는 방식.
- Claude API 와 Google Cloud 의 구형
computer_20251124computer use tool.
오류가 발생하지 않는 변경점도 있다. 모델이 tool 호출 사이에 작성하는 짧은 메모는 이제 thinking block 으로 전달된다. 기본 표시 설정에서는 내용이 비어 있으므로 이를 streaming 하던 interface 에 아무 내용도 나타나지 않는다.
출시 benchmark 결과는 어떤가?
Anthropic 자체 표를 보면 Sonnet 5.5 는 token 가격이 절반이면서도 Opus 5.5 와 몇 점 차이에 불과하며, Sonnet 5 보다 크게 앞선다.
| Benchmark, 측정 대상 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0, terminal 에서의 agent coding | 70.6% | 10.3% | 66.4% (xhigh) | 보고 없음 |
| CursorBench 4.0, editor 에서의 coding | 55.5% | 34.1% | 57.8% | 보고 없음 |
| GDPval-AA v2.1, 지식 노동 문서와 Elo 평점, 높을수록 우수 | 1844 | 1449 | 1846 | 1487 |
| OSWorld 2.1, computer use 와 부분 점수 | 80.1% | 57.0% | 81.8% | 보고 없음 |
| Humanity’s Last Exam, tool 사용 | 64.5% | 54.9% | 67.7% | 보고 없음 |
Artificial Analysis는 비용 측면의 문제도 지적한다. max effort 의 Sonnet 5.5 는 Intelligence Index 에서 56 점을 받아 max 의 Opus 5.5 보다 2 점 낮았다. 하지만 작업당 약 193K output token 을 사용했다. 지금까지 측정된 모델 중 가장 많고, max 의 Opus 5.5 또는 Sonnet 5 보다 약 60% 많다. Index 작업당 비용은 약 $7.60 이었다.
어떻게 측정했나?
정답이 정해진 single-shot 작업 13 개를 세 모델에 보냈다. 하나의 prompt 에 하나의 응답을 받았고 tool 은 사용하지 않았다. 60 미만 소수의 합, 1 부터 500 까지 숫자 7 의 개수처럼 짧은 문제 8 개와 10 개 항목 knapsack, 막힌 칸이 있는 8x8 grid 의 경로 수, 13 의 1,001 제곱을 10,007 로 나눈 나머지처럼 여러 단계의 계산이 필요한 문제 5 개였다. 모든 정답은 local 에서 brute force 로 구했다. 각 prompt 는 “정수 하나만 답하고 다른 내용은 쓰지 마세요.”로 끝냈다. API 기본값과 5 개 effort 단계에서 각 작업을 3 회씩 실행해 총 702 회 호출했으며, native Messages API 를 사용했다. Cache 응답을 막기 위해 각 prompt 에 고유한 random string 을 넣었다. 비용은 Anthropic 정가로 계산했다. 최종 답의 정오와 응답에 답만 포함됐는지를 각각 평가했다.
정확도만으로는 모델을 구분할 수 없었다. Sonnet 5.5 는 234 회 호출을 모두 맞혔고, Sonnet 5 는 응답이 돌아온 233 회를 모두 맞혔다. 나머지 1 회는 server error 였다. Opus 5.5 는 low 에서 1 개, 기본값에서 1 개를 틀렸다.
Sonnet 5.5 는 작업당 비용이 Sonnet 5 보다 낮은가?
기본값에서 Sonnet 5.5 비용은 Sonnet 5 보다 80% 낮았다. low, medium, high 에서는 77% 에서 78% 낮았다. Output token 을 약 5 분의 1 만 사용했기 때문이다. 정가는 같으므로 비용 절감분은 전부 token 효율에서 나온다. Sonnet 5 는 모든 effort 단계에서 작업당 약 1,800 에서 2,100 token 을 사용했다. Sonnet 5.5 는 xhigh 전까지 약 400 token 을 사용했다.
| 전체 13 개 작업, 작업당 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| API 기본값 | $0.0041 (396 tokens) | $0.0212 (2,105) | $0.0070 (334) |
low | $0.0043 (409) | $0.0184 (1,817) | $0.0065 (309) |
medium | $0.0040 (383) | $0.0180 (1,780) | $0.0082 (393) |
high | $0.0043 (416) | $0.0188 (1,858) | $0.0088 (421) |
xhigh | $0.0059 (574) | $0.0202 (2,001) | $0.0105 (507) |
max | $0.0146 (1,438) | $0.0193 (1,909) | $0.0234 (1,149) |
Token 수는 reasoning 을 포함한 호출당 평균 output token 이다. 어려운 작업 5 개에서 기본값 기준 절감률은 84% 로, $0.0057 대 $0.0348 이었다. 전체 transcript 를 매 turn 다시 전송해 input token 이 비용 대부분을 차지하는 tool loop 에서는 8% 였다. 따라서 Anthropic 의 “최대 30%“라는 설명은 이런 single prompt 작업에는 보수적이지만, 이번처럼 짧은 loop 에는 후한 수치다.
작업이 13 개뿐이라 기본값에서의 80% 절감 폭은 범위가 넓다. 작업을 재표본추출한 95% 구간은 66%~85% 낮은 수준이며, low 부터 xhigh 까지 모든 설정에서 하한이 50% 를 넘었다.
Effort 단계별 비용은 얼마인가?
Sonnet 5.5 에서 low, medium, high 비용은 모두 작업당 약 $0.0042 였다. 이번 측정에서는 기본값인 high 를 사용해도 추가 비용이 들지 않았다. xhigh 비용은 약 40% 높았고 max 는 기본값의 3.5 배였다. max 의 Sonnet 5.5 는 작업당 $0.0146 로, 기본값의 Opus 5.5 비용인 $0.0070 의 2 배였다. 정확도는 더 높아지지 않았다.
비용이 일정한 구간이 모든 workload 에서 유지되지는 않는다. 더 긴 DevOps 작업을 측정한 다른 테스트 결과에서는 high 가 medium 보다 output token 을 약 2 배 사용했다. Effort 의 영향이 큰 workload 라면 각 단계를 직접 측정해야 한다.
Sonnet 5.5 는 왜 답변에 풀이 과정을 쓰는가?
xhigh 미만에서 Sonnet 5.5 는 thinking block 을 항상 사용하지 않는다. Thinking block 을 생략하면 응답 본문에서 reasoning 을 수행한다. Thinking block 은 모델의 reasoning 을 담는 별도 응답 영역이다. 기본값에서는 내부 text 가 비어 있으며, 실제 답변은 뒤따르는 text block 에 들어간다.
Sonnet 5.5 응답 234 개 중 thinking block 이 있었던 166 개는 모두 답만 출력했다. Thinking block 이 없었던 68 개는 모두 풀이 과정을 먼저 썼다. 예를 들어 “09:47 + 3:46 = 13:33 … + 1:39 = 15:40”을 쓴 뒤 “15:40”을 출력했다. 최종 답은 매번 맞았지만 prompt 에서 요구한 형식은 아니었다.
| 답만 포함한 응답 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| API 기본값 | 22 / 39 | 38 / 39 | 38 / 39 |
low | 12 / 39 | 37 / 39 | 38 / 39 |
medium | 24 / 39 | 37 / 39 | 39 / 39 |
high | 30 / 39 | 38 / 39 | 39 / 39 |
xhigh | 39 / 39 | 35 / 38 | 39 / 39 |
max | 39 / 39 | 37 / 39 | 39 / 39 |
이 현상은 작업 단위로 나타난다. 해당 작업에서는 Sonnet 5.5 가 3 번의 반복 모두에서 풀이 과정을 썼다. 예외는 기본값의 작업 하나로, 3 번 중 2 번이었다. 13 개 작업 중 low 에서 9 개, 기본값에서 6 개, medium 에서 5 개, high 에서 3 개(모두 짧은 산수 문제)에서 이런 일이 있었다. 작업 단위로 세면 작업이 13 개뿐이라 어떤 차이도 Holm 보정을 통과하지 못한다. 따라서 이 수치는 이번에 관찰한 결과로 읽고, 계획에 쓸 수 있는 발생률로 보지 않는 것이 좋다. Sonnet 5 의 실패 양상은 달랐다. 정답을 굵게 표시한 뒤 짧은 설명을 붙였다. xhigh 행의 호출 수가 38 회인 이유는 server error 1 회 때문이다.
“최종 결과만” 출력하고 모든 풀이는 내부에서 처리하라는 system prompt 도 효과가 없었다. Sonnet 5.5 가 답만 출력한 횟수는 low 의 짧은 작업 24 개 중 8 개, medium 에서는 24 개 중 9 개였다. System prompt 가 없을 때는 각각 6 개와 9 개였다. xhigh 에서는 매번 thinking block 과 답만 출력해 문제가 해결됐다. 비용은 low 에서 high 까지의 단계보다 약 40% 높았다. 모델 출력을 parsing 하는 code 라면 다음 방법을 쓸 수 있다.
- 한 줄에 답만 있어야 한다면
xhigh로 실행한다. - 또는 마지막 non-empty line 에서 답을 읽는다. 이번 68 개 사례에서는 모두 정답이었다.
- Anthropic structured output 으로 응답을 schema 에 맞게 제한할 수도 있다. 이 방식은 테스트하지 않았다.
import anthropic
client = anthropic.Anthropic()
prompt = "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else."
resp = client.messages.create(
model="claude-sonnet-5-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # low, medium, high (API default), xhigh, max
messages=[{"role": "user", "content": prompt}],
)
text = "".join(block.text for block in resp.content if block.type == "text")
lines = text.strip().splitlines()
answer = lines[-1] if lines else None # below xhigh, working can precede the answer
print(answer, resp.usage.output_tokens) # output_tokens includes the reasoning
Tool loop 에서는 어떤 결과가 나왔나?
기본값, low, medium 의 Sonnet 5.5 는 code 분석 질문 4 개로 구성된 loop 를 매번 해결했으며 비용은 약 $0.011 이었다. Opus 5.5 비용의 3 분의 1 수준이다. max 에서는 tool 호출이 3 배로 늘어 Opus 5.5 보다 비쌌다. 각 모델에는 작은 synthetic codebase 를 대상으로 동작하는 tool 3 개를 제공했다. 파일 목록 조회, 파일 읽기, 검색 tool 이며, 각 답을 찾으려면 여러 파일에서 3 회에서 6 회 조회해야 한다.
| Tool loop, 각각 12 회 실행 | 해결 | Turn 중앙값 | 실행당 tool 호출 | 실행당 비용 | Wall time 중앙값 |
|---|---|---|---|---|---|
| Sonnet 5.5, 기본값 | 12 / 12 | 3 | 4.8 | $0.0112 | 6.7 s |
Sonnet 5.5, low | 12 / 12 | 3 | 4.9 | $0.0112 | 7.4 s |
Sonnet 5.5, medium | 12 / 12 | 3 | 5.1 | $0.0113 | 6.8 s |
Sonnet 5.5, max | 12 / 12 | 4 | 14.7 | $0.0422 | 20.1 s |
| Opus 5.5, 기본값 | 12 / 12 | 4 | 5.3 | $0.0332 | 25.3 s |
| Sonnet 5, 기본값 | 11 / 12 | 3.5 | 4.2 | $0.0122 | 15.8 s |
VentureBeat가 보도한 고객 평가에서는 Sonnet 5 보다 tool 호출이 줄었다고 한다. Lovable 에서는 3 분의 1 감소했다. 이번 loop 는 그 차이를 확인하기에는 너무 짧았다. Sonnet 5.5 는 실행당 4.8 회, Sonnet 5 는 4.2 회 호출했다. Sonnet 5.5 비용은 8% 낮았고 완료 시간은 절반 미만이었다.
Sonnet 5.5 는 더 빠른가?
더 빨리 끝난 주된 이유는 출력량이 적었기 때문이다. 기본값에서 single-shot 작업당 wall time, 즉 요청 전송부터 전체 응답 수신까지 걸린 시간의 중앙값은 Sonnet 5.5 가 3.9 초, Sonnet 5 가 8.1 초, Opus 5.5 가 5.5 초였다. Wall time 기준 초당 output token 은 두 Sonnet 이 각각 88 과 91 로 비슷했다. Sonnet 5.5 의 대기 시간이 절반인 이유는 token 생성 속도가 아니라 출력 token 수가 5 분의 1 이기 때문이다. 어려운 작업에서는 5.8 초와 21.0 초로 차이가 벌어졌다.
Sonnet 5 의 token budget 을 그대로 쓸 수 있는가?
Sonnet 5 에 맞춰 둔 컨텍스트 예산과 max_tokens 상한은 그대로 써도 될 것이다. Anthropic 의 마이그레이션 가이드는 Sonnet 5.5 가 같은 tokenizer 를 쓴다고 밝히며, 우리가 시험한 고정 텍스트 4 개(영어 문단, Python 코드, JSON 도구 인수, 중국어 문단)는 두 모델과 Opus 5.5 에서 모두 같은 token 수가 나왔다. 예를 들어 영어는 1,270 token, 중국어는 493 token 이었다. Sonnet 5.5 와 Opus 5.5 는 요청마다 2 token 이 고정으로 더 붙는다. 도구를 쓰는 요청은 입력이 조금 저렴해진다. Anthropic 가격 페이지에 따르면 숨겨진 도구 사용 시스템 프롬프트는 Sonnet 5.5 에서 286 token, Sonnet 5 에서 354 token 이다.
어떤 모델을 선택해야 하나?
대부분의 Sonnet 5 workload 는 전환하는 편이 낫다. 남은 결정은 effort 단계다.
| Workload | 주의할 점 | 권장 설정 | 수치 |
|---|---|---|---|
| Code 로 parsing 하는 출력: 추출, 분류, 단일 값 | xhigh 미만에서 풀이 과정이 응답에 포함됨 | Sonnet 5.5 를 xhigh 로 사용하거나 medium 에서 마지막 line 을 parsing | 답만 출력한 비율은 xhigh 에서 39 / 39, medium 에서 24 / 39. xhigh 비용은 약 40% 높음 |
| Chat 과 사용자에게 노출되는 text | Latency 와 비용 | Sonnet 5.5 를 medium 으로 사용 | 작업당 $0.0040, 중앙값 3.9 s |
| Tool 을 사용하는 agent loop | max 에서 tool 호출 증가 | Sonnet 5.5 기본값 또는 medium 사용. Sonnet 5.5 를 max 로 올리기 전에 Opus 5.5 로 전환 | 기본값에서 실행당 $0.011, max 에서 $0.042, Opus 5.5 에서 $0.033 |
| Thinking 을 끄거나 tool 사용을 강제하는 Sonnet 5 code | 모델 교체 후 HTTP 400 | between_tools (high 이하)와 tool_choice: auto | Anthropic 마이그레이션 가이드 |
어떤 effort 단계를 사용하든 code 에 두 가지 검사를 넣어야 한다. 응답 형식이 parser 의 예상과 맞는지 확인하고, 요청별 output token 상한을 둬야 한다. Single prompt 에서 max 는 작업당 비용을 3.5 배, loop 에서는 tool 호출을 3 배 늘렸다.
FAQ
Sonnet 5.5 는 Opus 5.5 보다 저렴한가?
기본값에서 Sonnet 5.5 는 Opus 5.5 보다 single-shot 작업당 비용이 41% 낮았고, tool-loop 실행당 비용은 3 분의 1 이었다. max 에서는 순서가 바뀐다. Sonnet 5.5 비용은 single-shot 작업에서 Opus 5.5 기본값의 2 배였고, tool-loop 실행당 비용은 27% 높았다.
Sonnet 5.5 에서 어떤 effort 단계를 써야 하나?
이번 작업에서 Sonnet 5.5 비용은 low, medium, high 모두 비슷했다. 범위는 $0.0040 에서 $0.0043 이었다. Chat 과 tool loop 는 medium 으로 시작하는 것이 무난하다. Code 가 응답에서 값 하나만 parsing 한다면 xhigh 를 사용한다. max 비용은 기본값의 3.5 배였다.
Sonnet 5.5 에서도 thinking 을 끌 수 있는가?
Sonnet 5.5 는 thinking: {"type": "disabled"} 요청에 HTTP 400 을 반환한다. 대신 thinking: {"type": "between_tools"} 를 보내면 된다. low, medium, high effort 에서 사용할 수 있다.
관련 측정 결과: Claude Opus 5.5 와 Opus 5 비교, Claude Sonnet 5 tokenizer, 업체별 thinking 제어 방식.
측정일은 출시 다음 날인 2026-09-29 이며, Anthropic Messages API 로 연결되는 gateway 를 사용했다. 정답을 채점한 single-shot 호출 702 회, 출력 형식 system instruction 테스트 48 회, tool-loop 실행 72 회, 모델별 고정 text 4 개의 token 수를 측정했다. Single-shot 호출은 brute force 로 정답을 구한 작업 13 개, 3 회 반복, 6 개 effort 설정, 3 개 모델로 구성했다. Tool loop 는 여러 단계를 거치는 질문 4 개, 3 회 반복, 6 개 설정으로 구성했다. Prompt 에 고유값을 추가했으며 비용은 Anthropic 정가로 계산했다.