신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.
이 모델은 현행 카탈로그에서 내려갔습니다. 아래 정보는 아카이브된 내용입니다. 벤더는 glm-5.2로의 마이그레이션을 권장합니다.

GLM-5.1

2026-04-07 출시

chat코드리즈닝도구 호출프롬프트 캐싱

GLM-5.1은 롱 호라이즌 과제를 위해 설계된 Z.AI의 플래그십 파운데이션 모델로, 공식적으로는 계획·실행·테스트·수정·인도에 이르기까지 하나의 과제를 최대 8시간 동안 연속적이고 자율적으로 수행할 수 있다고 설명됩니다.

입력
텍스트 $1.4/M
출력
텍스트 $4.4/M
캐시 읽기
$0.26/M
컨텍스트
200K
GPT-4o 대비
약 72% 저렴

가격의 위치

동종 60개 모델 중 가격 위치

입력$1.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
출력$4.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
캐시 읽기$0.26/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

토큰

컨텍스트 윈도우(공급사 사양) 200,000
최대 출력(벤더 스펙) 131,072

프롬프트 캐싱

캐싱 방식 자동

사고

공급사 파라미터 thinking.type
허용 값 enabled · disabled
기본값 enabled, 사고 여부는 모델이 자동으로 판단 요청에서 지정하지 않을 때 적용
비활성화 가능 지원
사고 동작 트레이스는 reasoning_content로 반환됩니다. 이전 턴의 트레이스는 기본적으로 삭제되며(clear_thinking true), 인터리브드 사고 블록은 보존해 도구 결과와 함께 반환하는 것이 좋습니다. reasoning_effort 제어는 없으며, 문서상 GLM-5.2 전용입니다.
파라미터 reasoning_effort
minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다

모델

모달리티 텍스트 → 텍스트
파라미터 전체 744B · 활성 40B MoE
라이선스 MIT
  • 차세대 에이전틱 엔지니어링 플래그십(744B-A40B): 단일 실행에서 수천 번의 도구 호출에 걸쳐 최대 8시간 동안 자율적으로 작업
  • 200K 컨텍스트 / 128K 최대 출력

출처: Z.ai 공식 문서 ↗

30초 만에 GLM-5.1 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5.1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

GLM-5.1 소개

  • GLM-5 위에 구축되어 단발성 생성이 아니라 실험-분석-최적화 루프를 강조하며, 복잡한 엔지니어링 환경에서 자율적 탐색, 지속적 개선, 안정적 인도를 가능하게 합니다.
  • Z.AI가 이 업그레이드를 규정하는 방식은 최고 성능이 아니라 지구력입니다.
  • 이전 릴리스가 에이전트 루프 초반에 정체되는 반면, GLM-5.1은 수백 라운드와 수천 번의 도구 호출에 걸쳐 최적화를 지속하고 모호한 문제에 대한 판단이 더 낫다고 문서화되어 있습니다.
  • 200K 컨텍스트 윈도우와 최대 128K 출력 토큰에 더해 사고 모드와 함수 호출을 제공합니다.
  • 명시된 워크로드는 코드를 넘어 일반 대화, 창작 글쓰기, 프런트엔드 및 아티팩트 생성, 사무 생산성까지 이어집니다.
  • 사고는 이 라인의 나머지와 동일한 thinking 객체로 전환되고 기본적으로 모델이 판단하도록 두며, 트레이스는 별도의 reasoning_content 필드로 반환됩니다.
  • 다만 Z.AI가 나중에 추가한 추론 강도 제어는 GLM-5.2 전용으로 문서화되어 있어 이 모델에는 강도 조절 수단이 없습니다.
  • MCP 도구, 스트리밍, JSON 출력, 자동 프리픽스 캐싱을 모두 지원하며, 가중치는 MIT License로 공개되어 있습니다.
  • Synthorai는 그대로 갈아 끼울 수 있도록 OpenAI 호환 엔드포인트 뒤에 GLM-5.1을 노출합니다.

자주 묻는 질문

GLM-5.1 API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $1.4/M 기준으로, 이 크레딧만으로도 GLM-5.1에 약 8K 토큰 규모의 요청을 대략 89회 보낼 수 있습니다.

GLM-5.1은 무엇에 가장 강한가요?

최대 8시간 자율 작업, 단발 생성 대신 실험-분석-최적화 루프, 계획부터 테스트·전달까지 커버. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

GLM-5.1의 가격은 얼마인가요?

Synthorai에서 GLM-5.1은 입력 토큰 100만 개당 $1.4, 출력 토큰 100만 개당 $4.4입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다. 캐시된 입력 토큰은 $0.26/M로 과금됩니다.

GLM-5.1은 프롬프트 캐싱을 지원하나요?

네, 자동으로 지원합니다. Z.ai에서 서빙되는 프롬프트는 코드 변경 없이 캐시됩니다. 캐시된 입력 토큰은 $0.26/M로 과금됩니다(미캐시 시 $1.4/M). 프롬프트 캐싱 가이드 →

GLM-5.1은 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="glm-5.1"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

GLM-5.1은 오픈소스인가요?

네, 가중치가 MIT 라이선스 하에 공개되어 있습니다. GPU를 직접 마련할 필요도 없습니다: 여기서 제공되는 호스팅 버전은 종량제이며 운영할 인프라가 없습니다. 오픈 웨이트 모델 실행하기 →

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →