GPT-6 Luna vs GPT-5.6 Luna: 가격 절반, 글 길이도 절반
목차
GPT-6 Luna는 공개 벤치마크에서 GPT-5.6 Luna와 비슷한 점수를 낸다(Artificial Analysis Intelligence Index 38점 vs 37점). 작업당 비용은 약 절반이다. 차이는 작성하는 글에 있다. 프롬프트에 목표만 적으면(“3분기 리뷰를 작성해 줘”) GPT-6 Luna가 작성한 비즈니스 문서 80개의 단어 수는 GPT-5.6 Luna의 0.55배였다. 요청받은 항목을 빠뜨린 것은 아니다. 필수 항목을 명시하면 두 모델의 문서 완성도는 비슷했다. 목표만 적은 프롬프트에서 GPT-6 Luna가 더 자주 빠뜨린 세부 사항은 장애 지속 시간 하나였다.
TL;DR
- Artificial Analysis에서
maxeffort 기준 GPT-6 Luna는 38점, GPT-5.6 Luna는 37점이다. 작업당 비용은 각각 $0.07, $0.18이다. - 목표만 적은 프롬프트에서 문서당 단어 수는 GPT-6 Luna가 384개, GPT-5.6 Luna가 703개였다.
- 목표만 적은 장애 사후 분석 문서 20개 중 GPT-6 Luna는 9개에서 장애 지속 시간을 빠뜨렸고, GPT-5.6 Luna는 2개에서 빠뜨렸다.
- 필수 항목을 명시하면 완성된 문서는 GPT-6 Luna가 80개 중 74개, GPT-5.6 Luna가 69개였다. 1,000건당 비용은 각각 $0.81, $1.61이었다.
벤치마크에서 GPT-6 Luna와 GPT-5.6 Luna는 얼마나 다른가?
일반 벤치마크에서 GPT-6 Luna는 GPT-5.6 Luna와 비슷한 성적을 내면서 작업당 비용은 48%-61% 낮다. 두 모델의 차이는 평가 기준표(rubric)로 채점하는 문서에서만 나타난다. 점수에는 reasoning effort 설정이 붙는다. 이는 답변 전 모델이 얼마나 추론할지 정하는 API 설정으로, none부터 max까지 있으며 기본값은 medium이다. 아래 수치는 2026-10-02에 각 게시 기관의 페이지에서 확인했다.
| GPT-6 Luna | GPT-5.6 Luna | |
|---|---|---|
| 출시일 | 2026-09-22 | 2026-07-09 |
| 정가, 입력 / 출력 토큰 1M개당 | $0.10 / $0.50 | $0.20 / $1.20 |
| Artificial Analysis Intelligence Index v4.3.2, max 기준(지식, 추론, 코딩, 에이전트 작업, 비즈니스 문서 작업 등 평가 10개) | 38 | 37 |
| Index 작업당 비용 | $0.07 | $0.18 |
| Vals Index(코딩, 법률, 세무, 금융 및 기타 전문 업무) | 51.2% | 51.7% |
| Vals 테스트당 비용 | $0.43 | $0.82 |
| GDPval-AA v2.1 Elo, max 기준(비공개 평가 기준표로 비즈니스 문서 채점. Elo는 일대일 비교로 산출하며 높을수록 좋음) | 1438 | 1463 |
| GDPval-AA v2.1 Elo, medium 기준 | 1262 | 1133 |
| 출력 속도, 초당 토큰 | 131 | 124 |
GPT-6 Luna에 대한 문제 제기는 GDPval-AA에서 시작됐다. Artificial Analysis는 출시 분석에서 GPT-6 Luna가 GPT-5.6 Luna보다 GDPval-AA에서 약 75 Elo 포인트, 또 다른 문서 벤치마크인 AA-Briefcase v1.1에서 약 45포인트 낮다고 밝혔다. 원인으로는 “표현 품질 저하와 평가 기준 항목이 빠진 결과물”을 꼽았고, 리뷰어들은 이를 “형식 비용(format tax)“이라고 불렀다. 현재 리더보드에서 max 기준 격차는 25포인트다. medium에서는 오히려 GPT-6 Luna가 129포인트 앞선다.
다른 업체 모델과 비교하면 GPT-6 Luna는 저렴하고 빠른 flash급 모델과 경쟁한다. 같은 Index에서 DeepSeek V4.1 Flash는 max 기준 39점에 작업당 $0.27, Gemini 3.8 Flash는 high 기준 41점에 $1.24다. GPT-6 Luna는 1-3점을 내주는 대신 작업당 비용이 4-18배 낮다. 출력 속도는 두 모델이 더 빠르며, 각각 초당 209토큰과 249토큰을 생성한다.
가격 말고 달라진 것은?
GPT-6 Luna의 한도와 설정은 GPT-5.6 Luna와 같다. 바뀐 것은 cache 가격과 학습 데이터 기준일뿐이다. 두 모델 모두 context window는 1,050,000토큰, 출력 한도는 128,000토큰이다. 프롬프트가 272K토큰을 넘으면 요청 전체에 입력 2배, 출력 1.5배 요금이 적용된다. 캐시된 입력은 100만 토큰당 $0.02에서 $0.01로 내려갔고, 학습 데이터 기준일은 2026년 2월 16일에서 5월 18일로 바뀌었다. Responses API에서는 reasoning.effort로 effort를 설정한다(none, low, medium, high, xhigh, max). 추론 내용은 표시되지 않지만 출력 토큰으로 과금된다.
출시 일주일 뒤 OpenAI는 상위 티어의 GPT-6 Sol 후속 모델인 GPT-6.1 Sol을 출시했다. GPT-6.1 Sol 측정 결과 답변 길이는 이전 수준으로 돌아왔다. Luna는 업데이트되지 않았다. 그래서 GPT-6 Luna가 무엇을 짧게 쓰고, 무엇을 빠뜨리며, 어떻게 하면 다시 상세하게 쓰는지 측정했다.
어떻게 테스트했나?
별도의 평가 모델 없이 코드로 요구 사항을 확인할 수 있는 문서 작성 작업을 만들었다. 각 작업에서 모델은 합성 데이터 블록을 받고 그 데이터로 문서를 작성한다.
| 문서 | 데이터 | 문서에 기대하는 내용 |
|---|---|---|
| 분기 리뷰 | 지역 6-12곳의 매출 | 모든 지역을 다루고, 감소 폭이 가장 큰 지역을 명시 |
| 장애 사후 분석 | 타임스탬프가 있는 이벤트 7-10개 | 모든 이벤트와 장애 지속 시간 |
| 공급업체 비교 | 호스팅 견적 5-8개 | 모든 공급업체를 다룸 |
| 고객 답변 | 지원 티켓 6-14개 | 모든 티켓에 답하고 고객 이름으로 호칭 |
각 작업은 같은 데이터를 사용하되 프롬프트를 두 방식으로 작성했다. 목표만 제시한 프롬프트는 문서의 종류만 말하고 구성 항목은 지정하지 않는다(“리더십 팀을 위한 3분기 지역별 리뷰를 작성해 줘”). 이 경우 표에 있는 항목만 채점했다. 필수 항목을 명시한 프롬프트는 섹션, 개수, 단어 수 범위를 나열하고 이를 모두 채점했다. 요구 항목이 누락되지 않고, 분량이나 개수가 기준에 못 미치지 않아야 완성된 문서로 봤다. 목표만 제시한 공급업체 비교는 길이만 셌다. 어떤 공급업체가 적합한지는 판단이 필요한 문제이기 때문이다.
2026-10-02에 두 모델을 대상으로 목표만 제시한 항목 80개를 각각 5가지 effort 설정에서 실행했다. GPT-6 Luna는 verbosity 설정도 하나 추가로 테스트했다. 필수 항목을 명시한 항목 80개는 두 모델 모두 기본 effort로 실행했다. 총 Responses API 호출은 1,040회였다. 모든 프롬프트에 고유한 임의 문자열을 넣어 캐시된 응답이 나오지 않게 했고, 비용은 OpenAI 정가로 계산했다. 두 모델에 같은 항목을 요청했으므로, 결과 비교에는 정확 McNemar 검정(두 모델의 결과가 다른 항목에 대한 쌍체 검정)과 Holm 보정을 사용했다. Holm 보정은 여러 비교를 동시에 검정할 때 유의성 기준을 더 엄격하게 만든다. 보정 후에도 남는 격차만 차이로 판단했다.
GPT-6 Luna는 GPT-5.6 Luna보다 짧게 쓰나?
기본 effort에서 목표만 제시했을 때 GPT-6 Luna가 쓴 단어 수는 GPT-5.6 Luna의 0.55배였다. 문서당 384개 vs 703개였고, 80개 항목 모두에서 더 짧았다. 모든 문서 유형에서 짧았으며, 격차는 장애 사후 분석에서 가장 컸고(441개 vs 981개) 고객 답변에서 가장 작았다(576개 vs 767개).
필수 항목을 명시하면 차이는 사라졌다. 단어 수는 738개 vs 724개였다.
짧게 쓰는 기본 동작은 Luna만의 특징이 아니다. 같은 항목에서 GPT-6 Sol은 325개 단어를 썼고 GPT-5.6 Sol은 592개를 썼다. GPT-6.1 Sol은 다시 565개로 늘었다.
GPT-6 Luna는 내용을 빠뜨리나?
목표만 제시한 프롬프트에서 GPT-6 Luna가 GPT-5.6 Luna보다 자주 빠뜨린 것은 하나였다. 장애 사후 분석의 장애 지속 시간이다. 대개 시간 범위(“Incident window: 18:00-18:39 UTC”)는 제시했지만, 차이를 계산하는 일은 독자에게 맡겼다. 그 밖에는 모든 effort 설정에서 필요한 내용이 들어갔다. 모든 지역과 감소 폭이 가장 큰 지역, 모든 이벤트, 각 티켓에 고객 이름을 넣어 작성한 답변이 있었다. 예외는 none에서 한 건뿐이었다.
| 목표만 제시한 프롬프트 | GPT-6 Luna 완성 | GPT-6 Luna 지속 시간 누락 사후 분석 | GPT-5.6 Luna 완성 | GPT-5.6 Luna 지속 시간 누락 사후 분석 |
|---|---|---|---|---|
none | 44 / 60 | 15 / 20 | 57 / 60 | 3 / 20 |
low | 47 / 60 | 13 / 20 | 54 / 60 | 6 / 20 |
medium | 51 / 60 | 9 / 20 | 58 / 60 | 2 / 20 |
high | 53 / 60 | 7 / 20 | 57 / 60 | 3 / 20 |
max | 59 / 60 | 1 / 20 | 60 / 60 | 0 / 20 |
none에서의 격차(44개 vs 57개)는 보정 후에도 유의했다. medium의 격차(51개 vs 58개)는 보정 전에서만 유의하므로 경향으로만 봐야 한다. max에서는 두 모델이 같았다. 차이는 모두 한 가지 문서 유형에서 나왔다. GPT-6 Luna가 장애 사후 분석에서 계산해야 하는 수치를 생략하는 경향은 있지만, 전반적으로 내용을 빠뜨린다고 볼 근거는 없다.
필수 항목을 명시했을 때 완성된 문서는 GPT-6 Luna가 80개 중 74개, GPT-5.6 Luna가 69개로 차이가 없었다. 두 모델이 실패한 사례는 모두 메모나 영향 설명 단락이 요청한 단어 수에 못 미친 경우였다. GPT-6 Luna는 6개, GPT-5.6 Luna는 11개였다.
길이와 빠진 내용을 되돌리려면?
프롬프트에 필수 항목을 명시하면 된다. 두 요청 파라미터만으로는 해결되지 않았다. 같은 effort의 GPT-6 Luna가 프롬프트에 필수 항목을 적자 384개 단어에서 738개로 늘었고, 모든 장애 사후 분석에서 지속 시간을 명시했다. 다음 정도면 충분하다.
Write the postmortem with these sections: Timeline (a table with every event),
Impact (120-200 words, state the total duration in minutes), Root Cause,
Action Items (5, each ending "Owner: <team>"), Lessons Learned (at least 3 bullets).
text.verbosity는 화면에 보이는 답변의 길이와 상세도를 조절하는 Responses API 파라미터다(low, medium, high). high로 설정하자 목표만 제시한 GPT-6 Luna의 문서는 7% 길어져 410개 단어가 됐다. 완성된 문서는 60개 중 52개로, 기존 51개와 비슷했다.
reasoning.effort를 높이면 글 길이보다 모델의 추론량이 더 크게 바뀐다. none에서 max로 올렸을 때 GPT-6 Luna의 문서 길이는 370개에서 436개 단어로 늘었지만, 답변당 추론 토큰은 0개에서 4,192개로 늘었다. max에서는 지속 시간 누락이 20개 중 1개로 줄었다. 비용은 medium의 4.5배였다.
OpenAI Python SDK에서 두 파라미터를 설정하는 방법은 다음과 같다.
from openai import OpenAI
client = OpenAI()
prompt = "Write the postmortem with these sections: ..." # data and required parts
resp = client.responses.create(
model="gpt-6-luna",
reasoning={"effort": "medium"}, # none, low, medium (default), high, xhigh, max
text={"verbosity": "high"}, # 7% longer in our runs; did not change completeness
input=prompt,
)
print(resp.output_text)
usage = resp.usage
print(usage.output_tokens, usage.output_tokens_details.reasoning_tokens)
output_tokens에는 추론 토큰도 포함된다. 화면에 보이는 답변의 토큰 수는 두 값의 차이다.
GPT-6 Luna는 GPT-5.6 Luna보다 얼마나 저렴한가?
같은 문서를 작성할 때 GPT-6 Luna의 비용은 GPT-5.6 Luna보다 49% 낮았다. 필수 항목을 명시한 문서 1,000개당 $0.81 vs $1.61이었다. 가격 인하만 반영했다면 절감 폭은 더 컸을 것이다. GPT-5.6 Luna가 사용한 토큰에 GPT-6 Luna의 요금을 적용하면 $0.68로, 58% 낮다. 실제 GPT-6 Luna 비용은 이보다 20% 높았다. 답변당 추론 토큰을 두 배 가까이 썼고(537개 vs 271개), 총 출력 토큰도 1,284개에서 1,558개로 늘었기 때문이다.
목표만 제시한 프롬프트에서는 문서 1,000개당 $0.54 vs $1.66으로 비용이 68% 낮았다. 다만 추가로 절약한 비용 대부분은 GPT-6 Luna가 절반 길이로 작성한 데서 나온다. 빠진 절반이 필요 없을 때만 실질적인 절감이다.
속도는 비슷했다. 전체 요청 시간 기준 GPT-6 Luna의 출력 속도는 초당 115토큰, GPT-5.6 Luna는 125토큰이었다. 목표만 제시한 문서의 응답 시간 중앙값은 8.1초 vs 11.1초로 GPT-6 Luna가 짧았는데, 작성할 내용이 적었기 때문이다.
다른 공개 테스트와 결과가 일치하나?
공개 벤치마크와 겹치는 부분에서는 결과가 일치한다. 여기에 무엇이 짧고, 무엇이 빠지며, 어떻게 해결할 수 있는지를 추가로 확인했다.
| 질문 | 다른 곳에 공개된 결과 | 자체 측정 | 판단 |
|---|---|---|---|
| 일반 성능, GPT-6 Luna vs GPT-5.6 Luna | Artificial Analysis 38점 vs 37점, Vals 51.2% vs 51.7% | 필수 항목을 명시했을 때 80개 중 완성된 문서 74개 vs 69개로 차이 없음 | 일치: 비슷함 |
| 문서 품질 | GDPval-AA v2.1 Elo: max에서 25점 낮고 medium에서 129점 높음 | medium에서 목표만 제시하면 단어 수가 0.55배, 장애 지속 시간 누락은 사후 분석 20개 중 9개 vs 2개 | 엇갈림: 어느 쪽도 기본 effort에서 뚜렷한 품질 저하를 보여주지는 않음. 자체 측정에서는 기본 답변이 짧고 그로 인해 빠지는 항목 하나를 확인 |
| 출력 토큰 | max 기준 Index 작업당 51K vs 41K로 24% 많음 | medium에서 문서당 1,558개 vs 1,284개로 21% 많음 | 일치 |
| 비용 | Index 작업당 61% 낮고 Vals 테스트당 48% 낮음 | 필수 항목을 명시하면 49% 낮고, 목표만 제시하면 68% 낮음 | 일치 |
관찰한 결과와 모델 선택 기준
프롬프트를 제어할 수 있다면 GPT-6 Luna를 쓰고 필요한 항목을 명시하자. 프롬프트를 바꿀 수 없고 독자가 긴 문서를 기대하는 경우에만 GPT-5.6 Luna를 유지하면 된다. 근거는 세 가지다.
- GPT-6 Luna는 요청에 맞춰 쓴다. 목표만 주면 짧은 문서를 쓰고, 필수 항목을 나열하면 GPT-5.6 Luna와 길이가 비슷한 완전한 문서를 쓴다.
- 빠뜨리는 내용은 제한적이다. 네 가지 문서 유형에서 더 자주 누락된 항목은 장애 지속 시간 하나뿐이었다.
- 비용 절감은 가격 인하 덕분이다. 같은 문서를 만드는 데 출력 토큰을 21% 더 쓰므로, 실제 절감률 49%는 정가만 비교한 58%보다 낮다.
| 작업 | 선택 | 근거 수치 |
|---|---|---|
| 프로그램이 읽는 출력: 분류, 추출, 라우팅 | 정확도 요구 사항을 충족하는 가장 낮은 effort의 GPT-6 Luna | 정가는 입력 50%, 출력 58% 낮음. 프로그램이 읽는 답변에서는 길이가 중요하지 않음 |
| 템플릿이나 직접 작성한 프롬프트로 만드는 문서 | 섹션, 개수, 분량을 프롬프트에 적은 GPT-6 Luna | 완성된 문서 80개 중 74개 vs 69개, 1,000건당 $0.81 vs $1.61 |
| 수정할 수 없는 최종 사용자 프롬프트로 만드는 문서 | 요청에 필수 항목을 추가할 수 있으면 GPT-6 Luna, 그렇지 않으면 GPT-5.6 Luna | 목표만 제시하면 384개 vs 703개 단어. 장애 지속 시간 누락은 사후 분석 20개 중 9개 vs 2개 |
| 평가 기준표로 채점하는 결과물 | 평가 기준표를 프롬프트에 넣고 text.verbosity에만 의존하지 말 것 | verbosity high: 완성된 문서 60개 중 52개 vs 51개, 단어 수 7% 증가 |
고객에게 보낼 문서는 어떤 모델로 작성했든 전송 전에 필수 항목을 코드로 확인하자.
FAQ
GPT-6 Luna는 GPT-5.6 Luna보다 성능이 낮은가? 프롬프트에 필수 항목을 명시하면 GPT-6 Luna의 완성도는 GPT-5.6 Luna와 비슷했다(문서 80개 중 74개 vs 69개). 비용은 절반이었다. 목표만 제시하면 글 길이가 약 절반으로 줄고, 장애 사후 분석에서 지속 시간을 더 자주 빠뜨렸다.
text.verbosity: "high"로 설정하면 GPT-6 Luna가 GPT-5.6 Luna만큼 길게 쓰나?
측정 결과 text.verbosity: "high"는 GPT-6 Luna의 단어 수를 7% 늘렸다. 그래도 GPT-5.6 Luna 길이의 약 58%였고 완성도도 바뀌지 않았다. 프롬프트에 필수 항목을 명시했을 때 두 모델의 길이가 비슷해졌다.
GPT-6.1 업데이트로 GPT-6 Luna의 짧은 답변이 해결됐나? OpenAI의 6.1 업데이트는 Sol 티어에만 적용됐다. GPT-6.1 Sol의 글 길이는 다시 GPT-5.6 Sol 수준이 됐지만, GPT-6 Luna는 2026-09-22 출시 이후 바뀌지 않았다.
관련 측정 결과: GPT-6.1 Sol vs Claude Sonnet 5.5, flash급 LLM 비교, GPT-5.6 비용 절감 방법.