신규 무료로 가입하고 10회 호출해 보세요. 최대 $1, 카드 등록 불필요.

GPT-6 Luna vs GPT-5.6 Luna: 가격 절반, 글 길이도 절반

목차
  1. 벤치마크에서 GPT-6 Luna와 GPT-5.6 Luna는 얼마나 다른가?
  2. 가격 말고 달라진 것은?
  3. 어떻게 테스트했나?
  4. GPT-6 Luna는 GPT-5.6 Luna보다 짧게 쓰나?
  5. GPT-6 Luna는 내용을 빠뜨리나?
  6. 길이와 빠진 내용을 되돌리려면?
  7. GPT-6 Luna는 GPT-5.6 Luna보다 얼마나 저렴한가?
  8. 다른 공개 테스트와 결과가 일치하나?
  9. 관찰한 결과와 모델 선택 기준
  10. FAQ

GPT-6 Luna는 공개 벤치마크에서 GPT-5.6 Luna와 비슷한 점수를 낸다(Artificial Analysis Intelligence Index 38점 vs 37점). 작업당 비용은 약 절반이다. 차이는 작성하는 글에 있다. 프롬프트에 목표만 적으면(“3분기 리뷰를 작성해 줘”) GPT-6 Luna가 작성한 비즈니스 문서 80개의 단어 수는 GPT-5.6 Luna의 0.55배였다. 요청받은 항목을 빠뜨린 것은 아니다. 필수 항목을 명시하면 두 모델의 문서 완성도는 비슷했다. 목표만 적은 프롬프트에서 GPT-6 Luna가 더 자주 빠뜨린 세부 사항은 장애 지속 시간 하나였다.

TL;DR

  • Artificial Analysis에서 max effort 기준 GPT-6 Luna는 38점, GPT-5.6 Luna는 37점이다. 작업당 비용은 각각 $0.07, $0.18이다.
  • 목표만 적은 프롬프트에서 문서당 단어 수는 GPT-6 Luna가 384개, GPT-5.6 Luna가 703개였다.
  • 목표만 적은 장애 사후 분석 문서 20개 중 GPT-6 Luna는 9개에서 장애 지속 시간을 빠뜨렸고, GPT-5.6 Luna는 2개에서 빠뜨렸다.
  • 필수 항목을 명시하면 완성된 문서는 GPT-6 Luna가 80개 중 74개, GPT-5.6 Luna가 69개였다. 1,000건당 비용은 각각 $0.81, $1.61이었다.

벤치마크에서 GPT-6 Luna와 GPT-5.6 Luna는 얼마나 다른가?

일반 벤치마크에서 GPT-6 Luna는 GPT-5.6 Luna와 비슷한 성적을 내면서 작업당 비용은 48%-61% 낮다. 두 모델의 차이는 평가 기준표(rubric)로 채점하는 문서에서만 나타난다. 점수에는 reasoning effort 설정이 붙는다. 이는 답변 전 모델이 얼마나 추론할지 정하는 API 설정으로, none부터 max까지 있으며 기본값은 medium이다. 아래 수치는 2026-10-02에 각 게시 기관의 페이지에서 확인했다.

GPT-6 LunaGPT-5.6 Luna
출시일2026-09-222026-07-09
정가, 입력 / 출력 토큰 1M개당$0.10 / $0.50$0.20 / $1.20
Artificial Analysis Intelligence Index v4.3.2, max 기준(지식, 추론, 코딩, 에이전트 작업, 비즈니스 문서 작업 등 평가 10개)3837
Index 작업당 비용$0.07$0.18
Vals Index(코딩, 법률, 세무, 금융 및 기타 전문 업무)51.2%51.7%
Vals 테스트당 비용$0.43$0.82
GDPval-AA v2.1 Elo, max 기준(비공개 평가 기준표로 비즈니스 문서 채점. Elo는 일대일 비교로 산출하며 높을수록 좋음)14381463
GDPval-AA v2.1 Elo, medium 기준12621133
출력 속도, 초당 토큰131124

GPT-6 Luna에 대한 문제 제기는 GDPval-AA에서 시작됐다. Artificial Analysis는 출시 분석에서 GPT-6 Luna가 GPT-5.6 Luna보다 GDPval-AA에서 약 75 Elo 포인트, 또 다른 문서 벤치마크인 AA-Briefcase v1.1에서 약 45포인트 낮다고 밝혔다. 원인으로는 “표현 품질 저하와 평가 기준 항목이 빠진 결과물”을 꼽았고, 리뷰어들은 이를 “형식 비용(format tax)“이라고 불렀다. 현재 리더보드에서 max 기준 격차는 25포인트다. medium에서는 오히려 GPT-6 Luna가 129포인트 앞선다.

다른 업체 모델과 비교하면 GPT-6 Luna는 저렴하고 빠른 flash급 모델과 경쟁한다. 같은 Index에서 DeepSeek V4.1 Flash는 max 기준 39점에 작업당 $0.27, Gemini 3.8 Flash는 high 기준 41점에 $1.24다. GPT-6 Luna는 1-3점을 내주는 대신 작업당 비용이 4-18배 낮다. 출력 속도는 두 모델이 더 빠르며, 각각 초당 209토큰과 249토큰을 생성한다.

가격 말고 달라진 것은?

GPT-6 Luna의 한도와 설정은 GPT-5.6 Luna와 같다. 바뀐 것은 cache 가격과 학습 데이터 기준일뿐이다. 두 모델 모두 context window는 1,050,000토큰, 출력 한도는 128,000토큰이다. 프롬프트가 272K토큰을 넘으면 요청 전체에 입력 2배, 출력 1.5배 요금이 적용된다. 캐시된 입력은 100만 토큰당 $0.02에서 $0.01로 내려갔고, 학습 데이터 기준일은 2026년 2월 16일에서 5월 18일로 바뀌었다. Responses API에서는 reasoning.effort로 effort를 설정한다(none, low, medium, high, xhigh, max). 추론 내용은 표시되지 않지만 출력 토큰으로 과금된다.

출시 일주일 뒤 OpenAI는 상위 티어의 GPT-6 Sol 후속 모델인 GPT-6.1 Sol을 출시했다. GPT-6.1 Sol 측정 결과 답변 길이는 이전 수준으로 돌아왔다. Luna는 업데이트되지 않았다. 그래서 GPT-6 Luna가 무엇을 짧게 쓰고, 무엇을 빠뜨리며, 어떻게 하면 다시 상세하게 쓰는지 측정했다.

어떻게 테스트했나?

별도의 평가 모델 없이 코드로 요구 사항을 확인할 수 있는 문서 작성 작업을 만들었다. 각 작업에서 모델은 합성 데이터 블록을 받고 그 데이터로 문서를 작성한다.

문서데이터문서에 기대하는 내용
분기 리뷰지역 6-12곳의 매출모든 지역을 다루고, 감소 폭이 가장 큰 지역을 명시
장애 사후 분석타임스탬프가 있는 이벤트 7-10개모든 이벤트와 장애 지속 시간
공급업체 비교호스팅 견적 5-8개모든 공급업체를 다룸
고객 답변지원 티켓 6-14개모든 티켓에 답하고 고객 이름으로 호칭

각 작업은 같은 데이터를 사용하되 프롬프트를 두 방식으로 작성했다. 목표만 제시한 프롬프트는 문서의 종류만 말하고 구성 항목은 지정하지 않는다(“리더십 팀을 위한 3분기 지역별 리뷰를 작성해 줘”). 이 경우 표에 있는 항목만 채점했다. 필수 항목을 명시한 프롬프트는 섹션, 개수, 단어 수 범위를 나열하고 이를 모두 채점했다. 요구 항목이 누락되지 않고, 분량이나 개수가 기준에 못 미치지 않아야 완성된 문서로 봤다. 목표만 제시한 공급업체 비교는 길이만 셌다. 어떤 공급업체가 적합한지는 판단이 필요한 문제이기 때문이다.

2026-10-02에 두 모델을 대상으로 목표만 제시한 항목 80개를 각각 5가지 effort 설정에서 실행했다. GPT-6 Luna는 verbosity 설정도 하나 추가로 테스트했다. 필수 항목을 명시한 항목 80개는 두 모델 모두 기본 effort로 실행했다. 총 Responses API 호출은 1,040회였다. 모든 프롬프트에 고유한 임의 문자열을 넣어 캐시된 응답이 나오지 않게 했고, 비용은 OpenAI 정가로 계산했다. 두 모델에 같은 항목을 요청했으므로, 결과 비교에는 정확 McNemar 검정(두 모델의 결과가 다른 항목에 대한 쌍체 검정)과 Holm 보정을 사용했다. Holm 보정은 여러 비교를 동시에 검정할 때 유의성 기준을 더 엄격하게 만든다. 보정 후에도 남는 격차만 차이로 판단했다.

GPT-6 Luna는 GPT-5.6 Luna보다 짧게 쓰나?

기본 effort에서 목표만 제시했을 때 GPT-6 Luna가 쓴 단어 수는 GPT-5.6 Luna의 0.55배였다. 문서당 384개 vs 703개였고, 80개 항목 모두에서 더 짧았다. 모든 문서 유형에서 짧았으며, 격차는 장애 사후 분석에서 가장 컸고(441개 vs 981개) 고객 답변에서 가장 작았다(576개 vs 767개).

필수 항목을 명시하면 차이는 사라졌다. 단어 수는 738개 vs 724개였다.

GPT-6 Luna와 GPT-5.6 Luna의 답변당 단어 수를 비교한 가로 막대그래프. 목표만 제시한 프롬프트에서 effort 설정별 GPT-6 Luna는 365-436개, GPT-5.6 Luna는 656-727개 단어를 작성했다. medium에서는 384개 vs 703개였고, 60개 중 완성된 문서는 51개 vs 58개였다. 필수 항목을 명시하면 738개 vs 724개 단어였고, 80개 중 완성된 문서는 74개 vs 69개였다

짧게 쓰는 기본 동작은 Luna만의 특징이 아니다. 같은 항목에서 GPT-6 Sol은 325개 단어를 썼고 GPT-5.6 Sol은 592개를 썼다. GPT-6.1 Sol은 다시 565개로 늘었다.

GPT-6 Luna는 내용을 빠뜨리나?

목표만 제시한 프롬프트에서 GPT-6 Luna가 GPT-5.6 Luna보다 자주 빠뜨린 것은 하나였다. 장애 사후 분석의 장애 지속 시간이다. 대개 시간 범위(“Incident window: 18:00-18:39 UTC”)는 제시했지만, 차이를 계산하는 일은 독자에게 맡겼다. 그 밖에는 모든 effort 설정에서 필요한 내용이 들어갔다. 모든 지역과 감소 폭이 가장 큰 지역, 모든 이벤트, 각 티켓에 고객 이름을 넣어 작성한 답변이 있었다. 예외는 none에서 한 건뿐이었다.

목표만 제시한 프롬프트GPT-6 Luna 완성GPT-6 Luna 지속 시간 누락 사후 분석GPT-5.6 Luna 완성GPT-5.6 Luna 지속 시간 누락 사후 분석
none44 / 6015 / 2057 / 603 / 20
low47 / 6013 / 2054 / 606 / 20
medium51 / 609 / 2058 / 602 / 20
high53 / 607 / 2057 / 603 / 20
max59 / 601 / 2060 / 600 / 20

none에서의 격차(44개 vs 57개)는 보정 후에도 유의했다. medium의 격차(51개 vs 58개)는 보정 전에서만 유의하므로 경향으로만 봐야 한다. max에서는 두 모델이 같았다. 차이는 모두 한 가지 문서 유형에서 나왔다. GPT-6 Luna가 장애 사후 분석에서 계산해야 하는 수치를 생략하는 경향은 있지만, 전반적으로 내용을 빠뜨린다고 볼 근거는 없다.

필수 항목을 명시했을 때 완성된 문서는 GPT-6 Luna가 80개 중 74개, GPT-5.6 Luna가 69개로 차이가 없었다. 두 모델이 실패한 사례는 모두 메모나 영향 설명 단락이 요청한 단어 수에 못 미친 경우였다. GPT-6 Luna는 6개, GPT-5.6 Luna는 11개였다.

길이와 빠진 내용을 되돌리려면?

프롬프트에 필수 항목을 명시하면 된다. 두 요청 파라미터만으로는 해결되지 않았다. 같은 effort의 GPT-6 Luna가 프롬프트에 필수 항목을 적자 384개 단어에서 738개로 늘었고, 모든 장애 사후 분석에서 지속 시간을 명시했다. 다음 정도면 충분하다.

Write the postmortem with these sections: Timeline (a table with every event),
Impact (120-200 words, state the total duration in minutes), Root Cause,
Action Items (5, each ending "Owner: <team>"), Lessons Learned (at least 3 bullets).

text.verbosity는 화면에 보이는 답변의 길이와 상세도를 조절하는 Responses API 파라미터다(low, medium, high). high로 설정하자 목표만 제시한 GPT-6 Luna의 문서는 7% 길어져 410개 단어가 됐다. 완성된 문서는 60개 중 52개로, 기존 51개와 비슷했다.

reasoning.effort를 높이면 글 길이보다 모델의 추론량이 더 크게 바뀐다. none에서 max로 올렸을 때 GPT-6 Luna의 문서 길이는 370개에서 436개 단어로 늘었지만, 답변당 추론 토큰은 0개에서 4,192개로 늘었다. max에서는 지속 시간 누락이 20개 중 1개로 줄었다. 비용은 medium의 4.5배였다.

OpenAI Python SDK에서 두 파라미터를 설정하는 방법은 다음과 같다.

from openai import OpenAI

client = OpenAI()
prompt = "Write the postmortem with these sections: ..."  # data and required parts
resp = client.responses.create(
    model="gpt-6-luna",
    reasoning={"effort": "medium"},   # none, low, medium (default), high, xhigh, max
    text={"verbosity": "high"},       # 7% longer in our runs; did not change completeness
    input=prompt,
)
print(resp.output_text)
usage = resp.usage
print(usage.output_tokens, usage.output_tokens_details.reasoning_tokens)

output_tokens에는 추론 토큰도 포함된다. 화면에 보이는 답변의 토큰 수는 두 값의 차이다.

GPT-6 Luna는 GPT-5.6 Luna보다 얼마나 저렴한가?

같은 문서를 작성할 때 GPT-6 Luna의 비용은 GPT-5.6 Luna보다 49% 낮았다. 필수 항목을 명시한 문서 1,000개당 $0.81 vs $1.61이었다. 가격 인하만 반영했다면 절감 폭은 더 컸을 것이다. GPT-5.6 Luna가 사용한 토큰에 GPT-6 Luna의 요금을 적용하면 $0.68로, 58% 낮다. 실제 GPT-6 Luna 비용은 이보다 20% 높았다. 답변당 추론 토큰을 두 배 가까이 썼고(537개 vs 271개), 총 출력 토큰도 1,284개에서 1,558개로 늘었기 때문이다.

목표만 제시한 프롬프트에서는 문서 1,000개당 $0.54 vs $1.66으로 비용이 68% 낮았다. 다만 추가로 절약한 비용 대부분은 GPT-6 Luna가 절반 길이로 작성한 데서 나온다. 빠진 절반이 필요 없을 때만 실질적인 절감이다.

속도는 비슷했다. 전체 요청 시간 기준 GPT-6 Luna의 출력 속도는 초당 115토큰, GPT-5.6 Luna는 125토큰이었다. 목표만 제시한 문서의 응답 시간 중앙값은 8.1초 vs 11.1초로 GPT-6 Luna가 짧았는데, 작성할 내용이 적었기 때문이다.

다른 공개 테스트와 결과가 일치하나?

공개 벤치마크와 겹치는 부분에서는 결과가 일치한다. 여기에 무엇이 짧고, 무엇이 빠지며, 어떻게 해결할 수 있는지를 추가로 확인했다.

질문다른 곳에 공개된 결과자체 측정판단
일반 성능, GPT-6 Luna vs GPT-5.6 LunaArtificial Analysis 38점 vs 37점, Vals 51.2% vs 51.7%필수 항목을 명시했을 때 80개 중 완성된 문서 74개 vs 69개로 차이 없음일치: 비슷함
문서 품질GDPval-AA v2.1 Elo: max에서 25점 낮고 medium에서 129점 높음medium에서 목표만 제시하면 단어 수가 0.55배, 장애 지속 시간 누락은 사후 분석 20개 중 9개 vs 2개엇갈림: 어느 쪽도 기본 effort에서 뚜렷한 품질 저하를 보여주지는 않음. 자체 측정에서는 기본 답변이 짧고 그로 인해 빠지는 항목 하나를 확인
출력 토큰max 기준 Index 작업당 51K vs 41K로 24% 많음medium에서 문서당 1,558개 vs 1,284개로 21% 많음일치
비용Index 작업당 61% 낮고 Vals 테스트당 48% 낮음필수 항목을 명시하면 49% 낮고, 목표만 제시하면 68% 낮음일치

관찰한 결과와 모델 선택 기준

프롬프트를 제어할 수 있다면 GPT-6 Luna를 쓰고 필요한 항목을 명시하자. 프롬프트를 바꿀 수 없고 독자가 긴 문서를 기대하는 경우에만 GPT-5.6 Luna를 유지하면 된다. 근거는 세 가지다.

  1. GPT-6 Luna는 요청에 맞춰 쓴다. 목표만 주면 짧은 문서를 쓰고, 필수 항목을 나열하면 GPT-5.6 Luna와 길이가 비슷한 완전한 문서를 쓴다.
  2. 빠뜨리는 내용은 제한적이다. 네 가지 문서 유형에서 더 자주 누락된 항목은 장애 지속 시간 하나뿐이었다.
  3. 비용 절감은 가격 인하 덕분이다. 같은 문서를 만드는 데 출력 토큰을 21% 더 쓰므로, 실제 절감률 49%는 정가만 비교한 58%보다 낮다.
작업선택근거 수치
프로그램이 읽는 출력: 분류, 추출, 라우팅정확도 요구 사항을 충족하는 가장 낮은 effort의 GPT-6 Luna정가는 입력 50%, 출력 58% 낮음. 프로그램이 읽는 답변에서는 길이가 중요하지 않음
템플릿이나 직접 작성한 프롬프트로 만드는 문서섹션, 개수, 분량을 프롬프트에 적은 GPT-6 Luna완성된 문서 80개 중 74개 vs 69개, 1,000건당 $0.81 vs $1.61
수정할 수 없는 최종 사용자 프롬프트로 만드는 문서요청에 필수 항목을 추가할 수 있으면 GPT-6 Luna, 그렇지 않으면 GPT-5.6 Luna목표만 제시하면 384개 vs 703개 단어. 장애 지속 시간 누락은 사후 분석 20개 중 9개 vs 2개
평가 기준표로 채점하는 결과물평가 기준표를 프롬프트에 넣고 text.verbosity에만 의존하지 말 것verbosity high: 완성된 문서 60개 중 52개 vs 51개, 단어 수 7% 증가

고객에게 보낼 문서는 어떤 모델로 작성했든 전송 전에 필수 항목을 코드로 확인하자.

FAQ

GPT-6 Luna는 GPT-5.6 Luna보다 성능이 낮은가? 프롬프트에 필수 항목을 명시하면 GPT-6 Luna의 완성도는 GPT-5.6 Luna와 비슷했다(문서 80개 중 74개 vs 69개). 비용은 절반이었다. 목표만 제시하면 글 길이가 약 절반으로 줄고, 장애 사후 분석에서 지속 시간을 더 자주 빠뜨렸다.

text.verbosity: "high"로 설정하면 GPT-6 Luna가 GPT-5.6 Luna만큼 길게 쓰나? 측정 결과 text.verbosity: "high"는 GPT-6 Luna의 단어 수를 7% 늘렸다. 그래도 GPT-5.6 Luna 길이의 약 58%였고 완성도도 바뀌지 않았다. 프롬프트에 필수 항목을 명시했을 때 두 모델의 길이가 비슷해졌다.

GPT-6.1 업데이트로 GPT-6 Luna의 짧은 답변이 해결됐나? OpenAI의 6.1 업데이트는 Sol 티어에만 적용됐다. GPT-6.1 Sol의 글 길이는 다시 GPT-5.6 Sol 수준이 됐지만, GPT-6 Luna는 2026-09-22 출시 이후 바뀌지 않았다.

관련 측정 결과: GPT-6.1 Sol vs Claude Sonnet 5.5, flash급 LLM 비교, GPT-5.6 비용 절감 방법.

← 블로그로 돌아가기