GPT-6.1 Sol vs Claude Sonnet 5.5: 같은 $2/$10, 작업당 비용 절반
목차
GPT-6.1 Sol과 Claude Sonnet 5.5의 정가는 같다. 입력 token 100만 개당 $2, 출력 token 100만 개당 $10이다. 하지만 작업당 비용은 크게 다르다. 각 모델의 API 기본 effort 설정에서 GPT-6.1 Sol은 비용이 약 절반(0.49x)이었고, 독립 평가 지수에서 같은 점수를 맞추면 약 4분의 1이었다. OpenAI가 경쟁 상대로 지목한 Claude Opus 5.5와 비교하면 0.29x였다. Sonnet 5.5는 비용이 더 드는 대신 독립 평가 지수의 최고 점수가 4-6점 높고 응답이 빠르다. GPT-6.1 Sol이 한 문제를 반복해서 틀린 반면 Sonnet 5.5는 틀리지 않았다.
TL;DR
- API 기본 설정에서 13개 작업의 작업당 비용은 GPT-6.1 Sol이 Sonnet 5.5의 0.49x, Opus 5.5의 0.29x였다.
- Artificial Analysis에서 GPT-6.1 Sol의
max와 Sonnet 5.5의xhigh는 모두 52점이었다. 작업당 비용은 각각 $0.72, $2.74였다. - GPT-6.1 Sol은 234개 prompt 모두에서 요청한 값만 답했다. Sonnet 5.5는 기본 설정에서 39개 중 22개였다.
- Sonnet 5.5는 234번 호출 모두 정답이었다. GPT-6.1 Sol은 한 문제에서 18번 중 7번 틀렸다.
GPT-6.1 Sol은 어떤 모델이고, OpenAI는 무엇을 주장하나?
GPT-6.1 Sol은 OpenAI의 중간급 모델 업데이트로, 같은 가격의 GPT-6 Sol보다 7일 늦은 2026-09-29에 출시됐다. 그 사이 개발자들은 GPT-6 Sol의 짧은 답변을 비판했고, Anthropic은 같은 $2 / $10 가격으로 Sonnet 5.5를 출시했다. OpenAI는 내부 테스트에서 기만 행위와 무단 행동이 발견되자 출시 예정이던 플래그십 GPT-6.1 Astra를 취소했다. CBC 보도에 나온 내용이다.
Token 가격, 1,050,000-token context window, 128,000-token 출력 한도는 그대로다. 캐시된 입력 가격은 token 100만 개당 $0.20에서 $0.10으로 내려갔다. 기존 코드를 수정해야 하는 부분은 reasoning.effort다. 답변 전 내부 추론의 양을 정하는 Responses API 파라미터이며, 이 추론도 출력으로 과금된다. 설정은 low부터 max까지이고 기본값은 medium이며, none은 없어졌다. GPT-6 Sol에서 추론을 껐던 요청은 low로 바꿔야 한다. Chat Completions에서 none일 때만 허용됐던 tool 호출은 이제 Responses API를 써야 한다.
OpenAI는 자체 플래그십 GPT-6 Astra와 Anthropic의 Claude Opus 5.5를 비교 상대로 내세운다. 에이전트형 코딩 평가인 DeepSWE v1.1에서는 Astra와 같은 수준에 비용은 약 5분의 1, 컴퓨터 사용 평가인 OSWorld 2.0에서는 Astra보다 2.1점 낮지만 비용은 약 7분의 1이라고 한다. 비즈니스 워크플로 평가인 AutomationBench에서는 medium에서 Opus 5.5보다 2.2점 높고, Terminal-Bench Science 작업당 비용은 max에서 $5.47로 Opus 5.5의 $23.21보다 낮다. 모두 OpenAI 자체 테스트 결과이며, Sonnet 5.5는 비교 대상에 없다. 출시 발표에는 가격과 속도가 모두 최대 6x인 Ultrafast tier도 포함됐다.
비교 대상은 Opus 5.5, Sonnet 5.5, GPT-6 Sol 중 무엇인가?
Sonnet 5.5가 적절한 비교 대상이다. 정가가 같은 대안이고, 같은 정가만으로는 실제 비용을 알 수 없기 때문이다. 아래 표는 GPT-6.1 Sol과 세 모델을 나란히 비교한다. 독립 벤치마크 결과는 각 평가 기관의 페이지에서 확인했다.
| GPT-6.1 Sol | Opus 5.5 | Sonnet 5.5 | GPT-6 Sol | |
|---|---|---|---|---|
| 정가, 입력 / 출력 token 100만 개당 | $2 / $10 | $4 / $20 | $2 / $10 | $2 / $10 |
| 출시일 | 2026-09-29 | 2026-09-22 | 2026-09-28 | 2026-09-22 |
| 출시 당시 비교 대상 | GPT-6 Astra, Opus 5.5 | Fable 5.1, Opus 5, GPT-6 Astra | Opus 5.5, GPT-6 Sol | GPT-6 Astra, Opus 5, Fable 5 |
max에서의 Artificial Analysis Intelligence Index (추론, 지식, 코딩 평가) | 52 | 58 | 56 | 48 |
max에서 지수 작업당 비용 | $0.72 | $5.98 | $7.60 | $1.04 |
| Vals Index (코딩, 법률, 세무, 의료 등 전문 업무) | 61.2% | 67.0% | 67.0% | 57.5% |
| Vals 테스트당 비용 | $3.24 | $32.14 | $21.34 | $7.58 |
max에서 AutomationBench 1.0.6 공개 순위표 (앱 간 비즈니스 워크플로) | 목록에 없음 | 42.47%, 작업당 $1.44 | 44.75%, 작업당 $1.14 | 목록에 없음 |
- Opus 5.5는 OpenAI가 지목한 경쟁 모델이다. 하지만 정가는 두 배이고 두 지수에서 점수도 약 6점 높다.
- GPT-6 Sol은 정가가 같은 전작이다. GPT-6.1 Sol은 두 지수 모두에서 더 높은 점수를 더 낮은 작업당 비용으로 낸다. 이 비교로 판단할 수 있는 것은 업그레이드 여부뿐이다.
- Sonnet 5.5는 정가가 같고 하루 먼저 출시됐으며, 마찬가지로 Opus 5.5를 비교 대상으로 내세웠다. 점수는 Opus 5.5와 2점 이내이고 GPT-6.1 Sol보다 4-6점 높다.
정가가 같다고 두 모델의 비용 대비 성능까지 같은 것은 아니다. GPT-6.1 Sol은 달성한 점수 대비 비용에서 두 Claude 모델보다 앞선다.
- 같은 점수로 비교하면, GPT-6.1 Sol의 비용은 Sonnet 5.5의 5분의 1에서 4분의 1 수준이다. Artificial Analysis에서 Sonnet 5.5의
xhigh와 GPT-6.1 Sol의max는 모두 52점이며, 작업당 비용은 각각 $2.74와 $0.72다. 한 단계 낮추면 Sonnet 5.5의high는 47점에 $1.08, GPT-6.1 Sol의medium은 48점에 $0.21이다. - 대표 지수 결과에서는, Sonnet 5.5의 작업당 비용이 Opus 5.5와 비슷한 범위다. Artificial Analysis의
max에서는 $7.60 대 $5.98, Vals에서는 $21.34 대 $32.14다. 둘 다 GPT-6.1 Sol보다 7-11배 비싸다.
대신 Sonnet 5.5와 Opus 5.5는 Artificial Analysis에서 각각 56점과 58점에 도달한다. GPT-6.1 Sol은 어떤 설정에서도 그 점수를 내지 못한다.
어떻게 테스트했나?
각 모델의 자체 API(GPT는 Responses, Claude는 Messages)로 세 종류의 작업을 실행했다. 채점은 모두 코드로 했다.
| 테스트 | 구성 | 측정 항목 |
|---|---|---|
| 단일 요청 작업 | 정답이 있는 13개 작업(예: 무게 제한 안에서 최적의 항목 조합을 찾는 10개 항목 배낭 문제). 각 prompt는 “Reply with a single integer, nothing else”로 끝나며 effort 설정마다 3회 반복 | 정답 여부, 값만 답했는지, 비용, 시간 |
| 업무 문서 | 문서 종류만 지시하는 prompt 80개(“Write the Q3 regional review”)와 필수 항목까지 명시한 prompt 80개. 분기 리뷰, 장애 사후 분석, 공급업체 비교, 지원 답변 포함 | 필수 항목 누락 여부, 단어 수, 비용 |
| Tool loop | 작은 가상 코드베이스에 관한 코드 읽기 질문 4개, tool 3개, 3회 반복 | 해결한 질문 수, tool 호출 수, 비용, 시간 |
캐시 응답이 섞이지 않도록 모든 prompt에 고유한 무작위 문자열을 넣었고, 비용은 정가로 계산했다. Sonnet 5.5와 Opus 5.5의 단일 요청 및 tool loop 수치는 하루 전 같은 작업과 채점기로 진행한 Sonnet 5.5 측정에서 가져왔다. 차이는 여러 비교를 동시에 할 때 판정 기준을 강화하는 Holm 보정을 통과한 경우에만 유의미하다고 봤다. 값만 답했는지는 작업 단위로 비교했다. 같은 작업의 반복 실행은 서로 독립적이지 않기 때문이다.
GPT-6.1 Sol의 작업당 비용은 Sonnet 5.5보다 낮은가?
GPT-6.1 Sol의 비용은 약 절반이었다. 각 모델의 API 기본 설정에서 단일 요청 작업당 $0.0020, Sonnet 5.5는 $0.0042로, 비율은 0.49였다(13개 작업을 재표본 추출한 95% 구간 0.40-0.59). Sonnet 5.5는 max 미만 설정에서 출력 token을 1.7-2.5배, max에서는 3.1배 더 썼다. 정가가 두 배인 Opus 5.5의 기본 설정 비용은 $0.0070이어서, GPT-6.1 Sol의 비용은 그 0.29x였다.
모든 effort 설정에서 GPT-6.1 Sol의 비용은 Sonnet 5.5의 0.33x-0.58x, Opus 5.5의 0.20x-0.31x였다. effort를 지정하지 않으면 GPT-6.1 Sol과 Opus 5.5는 medium, Sonnet 5.5는 high로 실행된다. 나머지 두 테스트에서도 Sonnet 5.5 대비 비율은 똑같이 0.46x였다. 문서 종류만 지시한 업무 문서는 건당 $0.0103 대 $0.0223, tool loop는 실행당 $0.0052 대 $0.0112였다.
Effort는 요청 필드 하나로 설정하고, 과금 대상 token은 usage에서 확인할 수 있다.
from openai import OpenAI
client = OpenAI()
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "low"}, # low, medium (default), high, xhigh, max; "none" is not listed for 6.1
input="Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else.",
)
print(resp.output_text)
u = resp.usage
print(u.output_tokens, u.output_tokens_details.reasoning_tokens, u.input_tokens_details.cached_tokens)
output_tokens에는 추론 token이 포함된다. cached_tokens는 입력 중 100만 개당 $0.10이 적용되는 부분이다.
누가 “답만”이라는 형식을 지키고, 누가 정답을 맞혔나?
GPT-6.1 Sol은 모든 prompt에서 형식을 지켰다. 반면 Sonnet 5.5는 GPT-6.1 Sol이 반복해서 틀린 문제에서도 오답이 없었다. GPT-6.1 Sol과 Opus 5.5는 각각 234개 prompt 모두에 값만 답했다. Sonnet 5.5는 기본 설정에서 39개 중 22개, low에서 12개, medium에서 24개, high에서 30개였다. Sonnet 5.5 분석 글에서 설명했듯이, xhigh 미만에서는 사고 블록(Claude 응답에서 추론을 담는 별도 부분)을 생략하고 풀이 과정을 답변에 쓰기도 한다. 작업 단위로 비교하면 low에서는 보정 후에도 차이가 유의미했다(GPT-6.1 Sol이 13개 중 9개 작업에서 더 좋고, 더 나쁜 작업은 없음). 기본 설정에서는 그렇지 않았다(6개에서 더 좋고, 더 나쁜 작업은 없음). 단일 값을 파싱하는 코드는 GPT-6.1 Sol의 응답을 그대로 읽으면 된다. Sonnet 5.5는 마지막 줄을 가져오거나 xhigh를 쓰는 편이 낫다.
Sonnet 5.5는 234번 호출 모두 정답이었고, Opus 5.5는 2번 틀렸다. GPT-6.1 Sol은 배낭 문제에서 18번 중 7번 72라고 답했다. 모든 부분집합을 확인한 정답은 62다. low에서 3번 중 3번, 기본 설정과 medium에서 각각 3번 중 1번, xhigh에서 3번 중 2번 틀렸고 high와 max에서는 틀리지 않았다. 13개 중 한 문제만으로 정확도 차이를 확정할 수는 없다. 다만 오류가 드러나지 않는다는 점은 확인된다. 응답은 형식에 맞는 정수였고, effort를 높여도 오류가 안정적으로 사라지지 않았다.
GPT-6.1 Sol은 GPT-6 Sol의 짧은 답변 문제를 해결했나?
GPT-6.1 Sol은 다시 충분한 길이로 답한다. 문서 이름만 주고 구성 요소는 지정하지 않은 prompt에서 문서당 565단어를 썼다. GPT-6 Sol의 325단어보다 길었고, 80개 항목 모두에서 더 길었다. GPT-5.6 Sol의 592단어와 비슷하다. GPT-6 Sol이 내용을 빠뜨린다는 불만은 재현되지 않았다. 채점 대상 문서 60개 중 58개에서 모든 지역과 장애 이벤트를 다루고 모든 티켓에 답해 완전성을 충족했다. GPT-5.6 Sol과 같은 결과다. 공급업체 비교 20개는 어느 업체가 적합한지 판단이 필요한 문제라 채점하지 않았다.
필수 항목을 prompt에 명시하면 OpenAI 모델 세 개 모두 80개 중 80개에서 빠짐없이 작성했다. Sonnet 5.5는 문서 종류만 지시했을 때 가장 긴 문서(747단어)를 썼고 채점 대상 문서도 모두 완전했다. 하지만 필수 항목을 명시한 경우에는 80개 중 12개에서 요청한 분량보다 1-28단어 짧은 메모나 추천문을 썼다. 보정 후에도 유의미한 차이지만, 12개 중 10개가 분기 리뷰여서 다른 문서에 일반화하기는 어렵다.
답변이 길어지면서 문서 종류만 지시한 경우의 문서당 비용은 GPT-6 Sol의 $0.0078에서 $0.0103으로 올랐다. 그래도 정가가 $4 / $20인 GPT-5.6 Sol보다 59% 낮다. GPT-5.6 Sol에는 2026-11-21까지 프로모션 가격이 적용된다. GPT-5.6 Sol의 token 사용량을 $2 / $10으로 다시 계산해도 GPT-6.1 Sol이 19% 저렴하다. 같은 길이의 문서를 더 적은 token으로 쓰기 때문이다.
GPT-6.1 Sol은 더 느린가?
GPT-6.1 Sol은 이전 모델과 Sonnet 5.5보다 느리며, 긴 출력에서 차이가 특히 크다. 업무 문서에서는 전체 요청 시간 기준 초당 출력 token이 약 43개였다. GPT-6 Sol은 100개, GPT-5.6 Sol은 80개, Sonnet 5.5는 127개였다. 문서 종류만 지시한 경우 문서당 소요 시간 중간값은 22.4초로, 비교 모델은 각각 7.2초, 13.9초, 17.2초였다. 짧은 단일 요청 작업에서는 차이가 작았다. 기본 설정에서 5.7초였고, Sonnet 5.5는 3.9초, Opus 5.5는 5.5초였다. 절대 속도는 호스트와 시간대에 따라 달라진다. Artificial Analysis에서도 초당 64 token으로 Sonnet 5.5의 139 token보다 절반 이하로 측정됐다.
Tool loop에서는 어떻게 달랐나?
GPT-6.1 Sol과 Sonnet 5.5는 모든 설정에서 12번의 실행을 모두 해결했다. GPT-6.1 Sol은 비용이 절반 미만인 대신 시간이 거의 두 배 걸렸다. Tool loop에서는 모델이 tool을 요청하면 호출 코드가 이를 실행해 결과를 돌려주고, 모델이 답할 때까지 반복한다. 이번 테스트는 작은 가상 코드베이스에 파일 목록 조회, 파일 읽기, 검색 tool 3개를 사용했다. 기본 설정에서 실행당 비용은 GPT-6.1 Sol $0.0052, Sonnet 5.5 $0.0112, Opus 5.5 $0.0332였고, 소요 시간 중간값은 각각 12.2초, 6.7초, 25.3초였다. max에서는 GPT-6.1 Sol이 $0.0086, Sonnet 5.5가 $0.0422로 올랐고 실행당 tool 호출 수는 각각 6.4회와 14.7회였다.
다른 공개 테스트와 결과가 일치하나?
결과의 방향은 공개 테스트와 일치한다. 차이의 크기는 다르다. 우리 작업은 짧고 대부분 API 기본 설정에서 실행한 반면, 공개 지수는 max에서 긴 작업을 평가하기 때문이다.
| 질문 | 다른 곳의 공개 결과 | 우리 측정값 | 판단 |
|---|---|---|---|
| Sonnet 5.5 대비 GPT-6.1 Sol의 비용 | Artificial Analysis: max에서 지수 작업당 $0.72 대 $7.60, 약 11x | 기본 설정에서 0.49x, max에서 0.33x | 방향은 같다. max에서는 작업이 길수록 격차가 커진다. 단일 요청 0.33x, 이번 tool loop 0.20x, 지수 0.09x |
| 속도 | Artificial Analysis: 초당 출력 token 64개 대 139개. Vals AI: 에이전트형 작업은 GPT-6 Sol보다 2-3배 오래 걸림 | 초당 token 43개 대 127개. 문서당 22.4초 대 GPT-6 Sol의 7.2초 | 일치 |
| Sonnet 5.5 대비 품질 | Artificial Analysis 52 대 56, Vals 61.2% 대 67.0% | Sonnet 5.5는 234번 중 234번 정답, GPT-6.1 Sol은 한 문제에서 18번 중 7번 오답 | 방향은 같지만, 우리 결과는 한 문제에 근거함 |
| GPT-6 Sol의 답변이 너무 짧거나 내용이 빠짐 | Hacker News 출시 게시물 등에서 나온 개발자 불만 | 문서당 325단어 대 GPT-5.6 Sol의 592단어. 완전한 문서는 60개 중 58개로 GPT-5.6 Sol과 같음 | 짧은 답변은 확인됐지만, 내용 누락은 재현되지 않음 |
| Sonnet 5.5가 “답만” 지시를 무시함 | 공개 보고를 찾지 못함 | 기본 설정에서 값만 답한 횟수 39번 중 22번, low에서 39번 중 12번 | 이번 측정에서만 확인 |
무엇을 관찰했고, 어떤 모델을 써야 하나?
GPT-6.1 Sol은 Sonnet 5.5와 Opus 5.5보다 비용 대비 성능이 좋다. 지연 시간이 중요하거나 품질의 마지막 4-6점이 필요할 때는 Sonnet 5.5에 더 지불할 만하다. 판단 근거는 네 가지다.
- GPT-6.1 Sol은 달성한 품질 대비 비용에서 두 Claude 모델보다 앞선다. Sonnet 5.5와 비교하면 짧은 작업당 비용은 약 절반, 같은 지수 점수에서는 약 4분의 1, 대표 지수 결과에서는 7분의 1에서 10분의 1이다. Opus 5.5와 비교하면 짧은 작업당 0.29x, 지수에서는 8분의 1에서 10분의 1이다.
- 출력 형식을 더 잘 지킨다. 답만 요구한 모든 prompt와 필수 항목을 명시한 모든 문서에서 요청대로 답했다.
- 짧은 답변을 고친 대신 속도가 느려졌다. 답변 길이는 GPT-5.6 Sol 수준으로 돌아왔지만, 문서당 소요 시간은 GPT-6 Sol의 세 배다.
- 오류를 발견하기 어렵다. 7번의 오답은
low,medium,xhigh에서 나왔고, 모두 형식에 맞는 정수였다.
| 작업 유형 | 선택 | 근거 수치 |
|---|---|---|
| 코드로 출력을 파싱하는 추출, 분류, 단일 값 작업 | medium 또는 high의 GPT-6.1 Sol | 값만 답한 횟수 234 / 234. medium에서 작업당 $0.0021 |
| 잘못된 값의 비용이 큰 다단계 수학 또는 논리 문제 | Sonnet 5.5, 또는 결과 검증을 붙인 GPT-6.1 Sol | Sonnet 5.5 정답 234 / 234. GPT-6.1 Sol은 한 문제의 18번 호출 중 7번 오답 |
| 지연 시간이 중요한 채팅과 대화형 tool | 기본 설정의 Sonnet 5.5 | 짧은 작업당 3.9초 대 5.7초. 문서당 17.2초 대 22.4초 |
| 지연 시간보다 실행당 비용이 중요한 에이전트 loop | 기본 설정의 GPT-6.1 Sol | 실행당 $0.0052 대 $0.0112. 12.2초 대 6.7초 |
| 필수 섹션이 있는 문서 | GPT-6.1 Sol, 또는 요청 분량에 여유를 둔 Sonnet 5.5 | 완전한 문서 80 / 80 대 68 / 80. 누락된 문서는 요청 분량보다 1-28단어 짧음 |
| 최고 점수가 중요한 어려운 개방형 작업 | max의 Sonnet 5.5 또는 Opus 5.5 | 공개 지수 점수 56, 58 대 52. 작업당 비용은 7-11배 |
어느 모델을 쓰든 프로그램이 실제로 사용하는 값은 검증해야 한다.
FAQ
GPT-6.1 Sol은 Claude Sonnet 5.5보다 저렴한가?
GPT-6.1 Sol과 Sonnet 5.5의 정가는 모두 $2 / $10이지만 GPT-6.1 Sol의 작업당 비용이 낮다. 이번 테스트에서 각 모델의 기본 설정 기준 단일 요청 작업당 0.49x, tool loop 실행당 0.46x였고, Artificial Analysis에서 같은 52점을 낸 설정에서는 $0.72 대 $2.74였다. Sonnet 5.5는 더 빠르고 max에서 점수가 높다.
GPT-6.1 Sol은 Claude Opus 5.5만큼 좋은가? GPT-6.1 Sol은 Opus 5.5보다 Artificial Analysis Intelligence Index에서 약 6점 낮고(52 대 58), Vals Index에서도 낮다(61.2% 대 67.0%). 작업당 비용은 8분의 1에서 10분의 1 수준이고, 이번 테스트의 짧은 작업에서는 0.29x였다. OpenAI 자체 테스트에서는 AutomationBench에서 2.2점 앞섰다.
GPT-6.1 Sol에서 추론을 완전히 끌 수 있나?
GPT-6.1 Sol이 지원하는 가장 낮은 effort는 low다. GPT-6 Sol에서 허용하던 none은 없어졌다. low를 사용하면 된다. 이번 테스트에서 단일 요청 작업당 비용은 $0.0018이었다.
관련 측정: Claude Sonnet 5.5와 Sonnet 5 비교, GPT-6 Astra의 effort 단계별 결과, GPT-5.6 비용 조절 방법.
GPT-6.1 Sol 출시 하루 뒤인 2026-09-30에 OpenAI Responses API와 Anthropic Messages API로 연결되는 게이트웨이를 통해 측정했다. GPT-6.1 Sol의 단일 요청 호출은 234번(13개 작업, 3회 반복, 6개 설정), 업무 문서 호출은 800번(문서 종류만 지시한 항목 80개를 모델 및 effort 조합 6개에서, 필수 항목을 명시한 항목 80개를 조합 4개에서 실행), tool loop 실행은 36번이었다. Sonnet 5.5와 Opus 5.5의 단일 요청 및 tool loop 수치는 같은 작업으로 2026-09-29에 측정했다. 공개 벤치마크 수치는 2026-10-01에 각 평가 기관 페이지에서 확인했다.