신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Claude Sonnet 5.5 vs Sonnet 5: 같은 가격, 작업당 비용 80% 절감

목차
  1. Claude Sonnet 5.5 에서 무엇이 바뀌었나?
  2. 출시 benchmark 결과는 어떤가?
  3. 어떻게 측정했나?
  4. Sonnet 5.5 는 작업당 비용이 Sonnet 5 보다 낮은가?
  5. Effort 단계별 비용은 얼마인가?
  6. Sonnet 5.5 는 왜 답변에 풀이 과정을 쓰는가?
  7. Tool loop 에서는 어떤 결과가 나왔나?
  8. Sonnet 5.5 는 더 빠른가?
  9. Sonnet 5 의 token budget 을 그대로 쓸 수 있는가?
  10. 어떤 모델을 선택해야 하나?
  11. FAQ

Claude Sonnet 5.5 와 Claude Sonnet 5 의 token 가격은 입력 100 만 token 당 $2, 출력 100 만 token 당 $10 로 같다. 따라서 비용 차이는 전적으로 token 사용량에서 나온다. API 기본값으로 13 개 single-shot 작업을 실행한 결과, 작업당 비용은 Sonnet 5.5 가 $0.0041, Sonnet 5 가 $0.021 로 Sonnet 5.5 쪽이 80% 낮았다. 두 모델 모두 모든 작업을 맞혔다. 문제는 출력 형식이었다. xhigh 미만에서는 Sonnet 5.5 가 hidden reasoning 을 생략하고 풀이 과정을 응답에 직접 쓰는 경우가 있었다. prompt 에 답만 출력하라고 명시해도 마찬가지였다.

TL;DR

  • API 기본값에서 작업당 비용은 Sonnet 5.5 가 $0.0041, Sonnet 5 가 $0.021 이었으며, 두 모델 모두 39 회 호출을 전부 맞혔다.
  • Sonnet 5.5 비용은 low, medium, high 에서 거의 같았다. max 비용은 기본값의 3.5 배였다.
  • xhigh 미만에서 Sonnet 5.5 는 답만 요구한 156 개 prompt 중 68 개 응답에 풀이 과정을 포함했다. system prompt 로도 해결되지 않았다.
  • 질문 4 개로 구성된 tool loop 에서 max 로 실행한 Sonnet 5.5 비용은 회당 $0.042 로, 기본값의 Opus 5.5 비용인 $0.033 보다 높았다.

Anthropic 은 2026-09-28 에 Sonnet 5.5 를 출시하면서 Sonnet 5 보다 30% 빠르고 “작업당 비용을 최대 30% 절감”한다고 밝혔다. 우리는 출시 다음 날 직접 측정했다.

Claude Sonnet 5.5 에서 무엇이 바뀌었나?

가격은 그대로지만 thinking 제어 방식과 여러 요청 parameter 가 바뀌었다. Sonnet 5.5 는 adaptive thinking 을 사용한다. 답변 전에 hidden reasoning 을 얼마나 수행할지 모델이 직접 결정하며, 이때 사용한 reasoning token 은 출력으로 과금된다. 제어에는 effort 를 사용한다. Messages API 에서는 output_config.effort 로 지정하며, low 부터 max 까지 5 단계가 있다. API 기본값은 high 다.

Sonnet 5.5Sonnet 5Opus 5.5
출시일2026-09-282026-06-302026-09-22
입력 / 출력, token 100 만 개당$2 / $10$2 / $10$4 / $20
Cache read, token 100 만 개당$0.20$0.20$0.20
Context window / 최대 출력1M / 128K1M / 128K1M / 128K
지식 기준일, 공개된 월 기준2026 년 6 월2026 년 1 월2026 년 6 월
API 기본 efforthighhighmedium
가장 낮은 thinking 설정between_tools (high 이하)disabled끌 수 없음. thinking 이 항상 활성화됨
Cache 가능한 최소 prompt512 tokens1,024 tokens512 tokens

Sonnet 5 의 $2 / $10 는 출시 당시 도입 가격이었지만, 현재 Anthropic 가격 페이지에는 정식 가격으로 표시된다. 예정됐던 $3 / $15 인상은 시행되지 않았다.

마이그레이션 가이드에 따르면 다음 요청은 Sonnet 5 에서 동작했지만 Sonnet 5.5 에서는 HTTP 400 을 반환한다.

  • thinking: {"type": "disabled"}. 대신 thinking: {"type": "between_tools"} 를 사용한다. 첫 답변 전 reasoning 을 끄는 설정이며 high 이하에서만 허용된다.
  • 강제 tool 사용, 즉 tool_choice 를 any 또는 특정 tool 로 지정하는 방식. auto 를 유지하고 tool 을 언제 사용해야 하는지 prompt 에 명시한다.
  • 수동 thinking budget 인 budget_tokens, 기본값이 아닌 temperature, top_p, top_k, 모델 응답의 시작 부분을 미리 넣는 prefilled assistant turn.
  • 2026-08-31 이후 생성된 계정에서 system prompt, tool 또는 이전 message 를 변경한 뒤 Sonnet 5.5 thinking block 을 재전송하는 방식.
  • Claude API 와 Google Cloud 의 구형 computer_20251124 computer use tool.

오류가 발생하지 않는 변경점도 있다. 모델이 tool 호출 사이에 작성하는 짧은 메모는 이제 thinking block 으로 전달된다. 기본 표시 설정에서는 내용이 비어 있으므로 이를 streaming 하던 interface 에 아무 내용도 나타나지 않는다.

출시 benchmark 결과는 어떤가?

Anthropic 자체 표를 보면 Sonnet 5.5 는 token 가격이 절반이면서도 Opus 5.5 와 몇 점 차이에 불과하며, Sonnet 5 보다 크게 앞선다.

Benchmark, 측정 대상Sonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Terminal-Bench 4.0, terminal 에서의 agent coding70.6%10.3%66.4% (xhigh)보고 없음
CursorBench 4.0, editor 에서의 coding55.5%34.1%57.8%보고 없음
GDPval-AA v2.1, 지식 노동 문서와 Elo 평점, 높을수록 우수1844144918461487
OSWorld 2.1, computer use 와 부분 점수80.1%57.0%81.8%보고 없음
Humanity’s Last Exam, tool 사용64.5%54.9%67.7%보고 없음

Artificial Analysis는 비용 측면의 문제도 지적한다. max effort 의 Sonnet 5.5 는 Intelligence Index 에서 56 점을 받아 max 의 Opus 5.5 보다 2 점 낮았다. 하지만 작업당 약 193K output token 을 사용했다. 지금까지 측정된 모델 중 가장 많고, max 의 Opus 5.5 또는 Sonnet 5 보다 약 60% 많다. Index 작업당 비용은 약 $7.60 이었다.

어떻게 측정했나?

정답이 정해진 single-shot 작업 13 개를 세 모델에 보냈다. 하나의 prompt 에 하나의 응답을 받았고 tool 은 사용하지 않았다. 60 미만 소수의 합, 1 부터 500 까지 숫자 7 의 개수처럼 짧은 문제 8 개와 10 개 항목 knapsack, 막힌 칸이 있는 8x8 grid 의 경로 수, 13 의 1,001 제곱을 10,007 로 나눈 나머지처럼 여러 단계의 계산이 필요한 문제 5 개였다. 모든 정답은 local 에서 brute force 로 구했다. 각 prompt 는 “정수 하나만 답하고 다른 내용은 쓰지 마세요.”로 끝냈다. API 기본값과 5 개 effort 단계에서 각 작업을 3 회씩 실행해 총 702 회 호출했으며, native Messages API 를 사용했다. Cache 응답을 막기 위해 각 prompt 에 고유한 random string 을 넣었다. 비용은 Anthropic 정가로 계산했다. 최종 답의 정오와 응답에 답만 포함됐는지를 각각 평가했다.

정확도만으로는 모델을 구분할 수 없었다. Sonnet 5.5 는 234 회 호출을 모두 맞혔고, Sonnet 5 는 응답이 돌아온 233 회를 모두 맞혔다. 나머지 1 회는 server error 였다. Opus 5.5 는 low 에서 1 개, 기본값에서 1 개를 틀렸다.

Sonnet 5.5 는 작업당 비용이 Sonnet 5 보다 낮은가?

기본값에서 Sonnet 5.5 비용은 Sonnet 5 보다 80% 낮았다. low, medium, high 에서는 77% 에서 78% 낮았다. Output token 을 약 5 분의 1 만 사용했기 때문이다. 정가는 같으므로 비용 절감분은 전부 token 효율에서 나온다. Sonnet 5 는 모든 effort 단계에서 작업당 약 1,800 에서 2,100 token 을 사용했다. Sonnet 5.5 는 xhigh 전까지 약 400 token 을 사용했다.

전체 13 개 작업, 작업당Sonnet 5.5Sonnet 5Opus 5.5
API 기본값$0.0041 (396 tokens)$0.0212 (2,105)$0.0070 (334)
low$0.0043 (409)$0.0184 (1,817)$0.0065 (309)
medium$0.0040 (383)$0.0180 (1,780)$0.0082 (393)
high$0.0043 (416)$0.0188 (1,858)$0.0088 (421)
xhigh$0.0059 (574)$0.0202 (2,001)$0.0105 (507)
max$0.0146 (1,438)$0.0193 (1,909)$0.0234 (1,149)

Effort 설정별 작업당 비용을 1,000 개 작업당 달러로 나타낸 그룹형 막대 chart. Claude Sonnet 5.5: 기본값 4.1, low 4.3, medium 4.0, high 4.3, xhigh 5.9, max 14.6. Claude Opus 5.5: 기본값 7.0, low 6.5, medium 8.2, high 8.8, xhigh 10.5, max 23.4. Claude Sonnet 5: 기본값 21.2, low 18.4, medium 18.0, high 18.8, xhigh 20.2, max 19.3

Token 수는 reasoning 을 포함한 호출당 평균 output token 이다. 어려운 작업 5 개에서 기본값 기준 절감률은 84% 로, $0.0057 대 $0.0348 이었다. 전체 transcript 를 매 turn 다시 전송해 input token 이 비용 대부분을 차지하는 tool loop 에서는 8% 였다. 따라서 Anthropic 의 “최대 30%“라는 설명은 이런 single prompt 작업에는 보수적이지만, 이번처럼 짧은 loop 에는 후한 수치다.

작업이 13 개뿐이라 기본값에서의 80% 절감 폭은 범위가 넓다. 작업을 재표본추출한 95% 구간은 66%~85% 낮은 수준이며, low 부터 xhigh 까지 모든 설정에서 하한이 50% 를 넘었다.

Effort 단계별 비용은 얼마인가?

Sonnet 5.5 에서 low, medium, high 비용은 모두 작업당 약 $0.0042 였다. 이번 측정에서는 기본값인 high 를 사용해도 추가 비용이 들지 않았다. xhigh 비용은 약 40% 높았고 max 는 기본값의 3.5 배였다. max 의 Sonnet 5.5 는 작업당 $0.0146 로, 기본값의 Opus 5.5 비용인 $0.0070 의 2 배였다. 정확도는 더 높아지지 않았다.

비용이 일정한 구간이 모든 workload 에서 유지되지는 않는다. 더 긴 DevOps 작업을 측정한 다른 테스트 결과에서는 high 가 medium 보다 output token 을 약 2 배 사용했다. Effort 의 영향이 큰 workload 라면 각 단계를 직접 측정해야 한다.

Sonnet 5.5 는 왜 답변에 풀이 과정을 쓰는가?

xhigh 미만에서 Sonnet 5.5 는 thinking block 을 항상 사용하지 않는다. Thinking block 을 생략하면 응답 본문에서 reasoning 을 수행한다. Thinking block 은 모델의 reasoning 을 담는 별도 응답 영역이다. 기본값에서는 내부 text 가 비어 있으며, 실제 답변은 뒤따르는 text block 에 들어간다.

Sonnet 5.5 응답 234 개 중 thinking block 이 있었던 166 개는 모두 답만 출력했다. Thinking block 이 없었던 68 개는 모두 풀이 과정을 먼저 썼다. 예를 들어 “09:47 + 3:46 = 13:33 … + 1:39 = 15:40”을 쓴 뒤 “15:40”을 출력했다. 최종 답은 매번 맞았지만 prompt 에서 요구한 형식은 아니었다.

답만 포함한 응답Sonnet 5.5Sonnet 5Opus 5.5
API 기본값22 / 3938 / 3938 / 39
low12 / 3937 / 3938 / 39
medium24 / 3937 / 3939 / 39
high30 / 3938 / 3939 / 39
xhigh39 / 3935 / 3839 / 39
max39 / 3937 / 3939 / 39

이 현상은 작업 단위로 나타난다. 해당 작업에서는 Sonnet 5.5 가 3 번의 반복 모두에서 풀이 과정을 썼다. 예외는 기본값의 작업 하나로, 3 번 중 2 번이었다. 13 개 작업 중 low 에서 9 개, 기본값에서 6 개, medium 에서 5 개, high 에서 3 개(모두 짧은 산수 문제)에서 이런 일이 있었다. 작업 단위로 세면 작업이 13 개뿐이라 어떤 차이도 Holm 보정을 통과하지 못한다. 따라서 이 수치는 이번에 관찰한 결과로 읽고, 계획에 쓸 수 있는 발생률로 보지 않는 것이 좋다. Sonnet 5 의 실패 양상은 달랐다. 정답을 굵게 표시한 뒤 짧은 설명을 붙였다. xhigh 행의 호출 수가 38 회인 이유는 server error 1 회 때문이다.

“최종 결과만” 출력하고 모든 풀이는 내부에서 처리하라는 system prompt 도 효과가 없었다. Sonnet 5.5 가 답만 출력한 횟수는 low 의 짧은 작업 24 개 중 8 개, medium 에서는 24 개 중 9 개였다. System prompt 가 없을 때는 각각 6 개와 9 개였다. xhigh 에서는 매번 thinking block 과 답만 출력해 문제가 해결됐다. 비용은 low 에서 high 까지의 단계보다 약 40% 높았다. 모델 출력을 parsing 하는 code 라면 다음 방법을 쓸 수 있다.

  • 한 줄에 답만 있어야 한다면 xhigh 로 실행한다.
  • 또는 마지막 non-empty line 에서 답을 읽는다. 이번 68 개 사례에서는 모두 정답이었다.
  • Anthropic structured output 으로 응답을 schema 에 맞게 제한할 수도 있다. 이 방식은 테스트하지 않았다.
import anthropic

client = anthropic.Anthropic()
prompt = "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else."
resp = client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=16000,
    output_config={"effort": "xhigh"},  # low, medium, high (API default), xhigh, max
    messages=[{"role": "user", "content": prompt}],
)
text = "".join(block.text for block in resp.content if block.type == "text")
lines = text.strip().splitlines()
answer = lines[-1] if lines else None  # below xhigh, working can precede the answer
print(answer, resp.usage.output_tokens)  # output_tokens includes the reasoning

Tool loop 에서는 어떤 결과가 나왔나?

기본값, low, medium 의 Sonnet 5.5 는 code 분석 질문 4 개로 구성된 loop 를 매번 해결했으며 비용은 약 $0.011 이었다. Opus 5.5 비용의 3 분의 1 수준이다. max 에서는 tool 호출이 3 배로 늘어 Opus 5.5 보다 비쌌다. 각 모델에는 작은 synthetic codebase 를 대상으로 동작하는 tool 3 개를 제공했다. 파일 목록 조회, 파일 읽기, 검색 tool 이며, 각 답을 찾으려면 여러 파일에서 3 회에서 6 회 조회해야 한다.

Tool loop, 각각 12 회 실행해결Turn 중앙값실행당 tool 호출실행당 비용Wall time 중앙값
Sonnet 5.5, 기본값12 / 1234.8$0.01126.7 s
Sonnet 5.5, low12 / 1234.9$0.01127.4 s
Sonnet 5.5, medium12 / 1235.1$0.01136.8 s
Sonnet 5.5, max12 / 12414.7$0.042220.1 s
Opus 5.5, 기본값12 / 1245.3$0.033225.3 s
Sonnet 5, 기본값11 / 123.54.2$0.012215.8 s

VentureBeat가 보도한 고객 평가에서는 Sonnet 5 보다 tool 호출이 줄었다고 한다. Lovable 에서는 3 분의 1 감소했다. 이번 loop 는 그 차이를 확인하기에는 너무 짧았다. Sonnet 5.5 는 실행당 4.8 회, Sonnet 5 는 4.2 회 호출했다. Sonnet 5.5 비용은 8% 낮았고 완료 시간은 절반 미만이었다.

Sonnet 5.5 는 더 빠른가?

더 빨리 끝난 주된 이유는 출력량이 적었기 때문이다. 기본값에서 single-shot 작업당 wall time, 즉 요청 전송부터 전체 응답 수신까지 걸린 시간의 중앙값은 Sonnet 5.5 가 3.9 초, Sonnet 5 가 8.1 초, Opus 5.5 가 5.5 초였다. Wall time 기준 초당 output token 은 두 Sonnet 이 각각 88 과 91 로 비슷했다. Sonnet 5.5 의 대기 시간이 절반인 이유는 token 생성 속도가 아니라 출력 token 수가 5 분의 1 이기 때문이다. 어려운 작업에서는 5.8 초와 21.0 초로 차이가 벌어졌다.

Sonnet 5 의 token budget 을 그대로 쓸 수 있는가?

Sonnet 5 에 맞춰 둔 컨텍스트 예산과 max_tokens 상한은 그대로 써도 될 것이다. Anthropic 의 마이그레이션 가이드는 Sonnet 5.5 가 같은 tokenizer 를 쓴다고 밝히며, 우리가 시험한 고정 텍스트 4 개(영어 문단, Python 코드, JSON 도구 인수, 중국어 문단)는 두 모델과 Opus 5.5 에서 모두 같은 token 수가 나왔다. 예를 들어 영어는 1,270 token, 중국어는 493 token 이었다. Sonnet 5.5 와 Opus 5.5 는 요청마다 2 token 이 고정으로 더 붙는다. 도구를 쓰는 요청은 입력이 조금 저렴해진다. Anthropic 가격 페이지에 따르면 숨겨진 도구 사용 시스템 프롬프트는 Sonnet 5.5 에서 286 token, Sonnet 5 에서 354 token 이다.

어떤 모델을 선택해야 하나?

대부분의 Sonnet 5 workload 는 전환하는 편이 낫다. 남은 결정은 effort 단계다.

Workload주의할 점권장 설정수치
Code 로 parsing 하는 출력: 추출, 분류, 단일 값xhigh 미만에서 풀이 과정이 응답에 포함됨Sonnet 5.5 를 xhigh 로 사용하거나 medium 에서 마지막 line 을 parsing답만 출력한 비율은 xhigh 에서 39 / 39, medium 에서 24 / 39. xhigh 비용은 약 40% 높음
Chat 과 사용자에게 노출되는 textLatency 와 비용Sonnet 5.5 를 medium 으로 사용작업당 $0.0040, 중앙값 3.9 s
Tool 을 사용하는 agent loopmax 에서 tool 호출 증가Sonnet 5.5 기본값 또는 medium 사용. Sonnet 5.5 를 max 로 올리기 전에 Opus 5.5 로 전환기본값에서 실행당 $0.011, max 에서 $0.042, Opus 5.5 에서 $0.033
Thinking 을 끄거나 tool 사용을 강제하는 Sonnet 5 code모델 교체 후 HTTP 400between_tools (high 이하)와 tool_choice: autoAnthropic 마이그레이션 가이드

어떤 effort 단계를 사용하든 code 에 두 가지 검사를 넣어야 한다. 응답 형식이 parser 의 예상과 맞는지 확인하고, 요청별 output token 상한을 둬야 한다. Single prompt 에서 max 는 작업당 비용을 3.5 배, loop 에서는 tool 호출을 3 배 늘렸다.

FAQ

Sonnet 5.5 는 Opus 5.5 보다 저렴한가? 기본값에서 Sonnet 5.5 는 Opus 5.5 보다 single-shot 작업당 비용이 41% 낮았고, tool-loop 실행당 비용은 3 분의 1 이었다. max 에서는 순서가 바뀐다. Sonnet 5.5 비용은 single-shot 작업에서 Opus 5.5 기본값의 2 배였고, tool-loop 실행당 비용은 27% 높았다.

Sonnet 5.5 에서 어떤 effort 단계를 써야 하나? 이번 작업에서 Sonnet 5.5 비용은 low, medium, high 모두 비슷했다. 범위는 $0.0040 에서 $0.0043 이었다. Chat 과 tool loop 는 medium 으로 시작하는 것이 무난하다. Code 가 응답에서 값 하나만 parsing 한다면 xhigh 를 사용한다. max 비용은 기본값의 3.5 배였다.

Sonnet 5.5 에서도 thinking 을 끌 수 있는가? Sonnet 5.5 는 thinking: {"type": "disabled"} 요청에 HTTP 400 을 반환한다. 대신 thinking: {"type": "between_tools"} 를 보내면 된다. low, medium, high effort 에서 사용할 수 있다.

관련 측정 결과: Claude Opus 5.5 와 Opus 5 비교, Claude Sonnet 5 tokenizer, 업체별 thinking 제어 방식.

측정일은 출시 다음 날인 2026-09-29 이며, Anthropic Messages API 로 연결되는 gateway 를 사용했다. 정답을 채점한 single-shot 호출 702 회, 출력 형식 system instruction 테스트 48 회, tool-loop 실행 72 회, 모델별 고정 text 4 개의 token 수를 측정했다. Single-shot 호출은 brute force 로 정답을 구한 작업 13 개, 3 회 반복, 6 개 effort 설정, 3 개 모델로 구성했다. Tool loop 는 여러 단계를 거치는 질문 4 개, 3 회 반복, 6 개 설정으로 구성했다. Prompt 에 고유값을 추가했으며 비용은 Anthropic 정가로 계산했다.

← 블로그로 돌아가기