GLM-5.1은 롱 호라이즌 과제를 위해 설계된 Z.AI의 플래그십 파운데이션 모델로, 공식적으로는 계획·실행·테스트·수정·인도에 이르기까지 하나의 과제를 최대 8시간 동안 연속적이고 자율적으로 수행할 수 있다고 설명됩니다.
- 입력
- 텍스트 $1.4/M
- 출력
- 텍스트 $4.4/M
- 캐시 읽기
- $0.26/M
- 컨텍스트
- 200K
- GPT-4o 대비
- 약 72% 저렴
가격의 위치
동종 60개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
토큰
| 컨텍스트 윈도우(공급사 사양) | 200,000 |
|---|---|
| 최대 출력(벤더 스펙) | 131,072 |
프롬프트 캐싱
| 캐싱 방식 | 자동 |
|---|
사고
| 공급사 파라미터 | thinking.type |
|---|---|
| 허용 값 | enabled · disabled |
| 기본값 | enabled, 사고 여부는 모델이 자동으로 판단 요청에서 지정하지 않을 때 적용 |
| 비활성화 가능 | 지원 |
| 사고 동작 | 트레이스는 reasoning_content로 반환됩니다. 이전 턴의 트레이스는 기본적으로 삭제되며(clear_thinking true), 인터리브드 사고 블록은 보존해 도구 결과와 함께 반환하는 것이 좋습니다. reasoning_effort 제어는 없으며, 문서상 GLM-5.2 전용입니다. |
| 파라미터 | reasoning_effort |
| 값 | minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다 |
모델
| 모달리티 | 텍스트 → 텍스트 |
|---|---|
| 파라미터 | 전체 744B · 활성 40B MoE |
| 라이선스 | MIT |
- 차세대 에이전틱 엔지니어링 플래그십(744B-A40B): 단일 실행에서 수천 번의 도구 호출에 걸쳐 최대 8시간 동안 자율적으로 작업
- 200K 컨텍스트 / 128K 최대 출력
출처: Z.ai 공식 문서 ↗
30초 만에 GLM-5.1 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5.1",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5.1",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.1",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5.1",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5.1")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));GLM-5.1 소개
- GLM-5 위에 구축되어 단발성 생성이 아니라 실험-분석-최적화 루프를 강조하며, 복잡한 엔지니어링 환경에서 자율적 탐색, 지속적 개선, 안정적 인도를 가능하게 합니다.
- Z.AI가 이 업그레이드를 규정하는 방식은 최고 성능이 아니라 지구력입니다.
- 이전 릴리스가 에이전트 루프 초반에 정체되는 반면, GLM-5.1은 수백 라운드와 수천 번의 도구 호출에 걸쳐 최적화를 지속하고 모호한 문제에 대한 판단이 더 낫다고 문서화되어 있습니다.
- 200K 컨텍스트 윈도우와 최대 128K 출력 토큰에 더해 사고 모드와 함수 호출을 제공합니다.
- 명시된 워크로드는 코드를 넘어 일반 대화, 창작 글쓰기, 프런트엔드 및 아티팩트 생성, 사무 생산성까지 이어집니다.
- 사고는 이 라인의 나머지와 동일한 thinking 객체로 전환되고 기본적으로 모델이 판단하도록 두며, 트레이스는 별도의 reasoning_content 필드로 반환됩니다.
- 다만 Z.AI가 나중에 추가한 추론 강도 제어는 GLM-5.2 전용으로 문서화되어 있어 이 모델에는 강도 조절 수단이 없습니다.
- MCP 도구, 스트리밍, JSON 출력, 자동 프리픽스 캐싱을 모두 지원하며, 가중치는 MIT License로 공개되어 있습니다.
- Synthorai는 그대로 갈아 끼울 수 있도록 OpenAI 호환 엔드포인트 뒤에 GLM-5.1을 노출합니다.
자주 묻는 질문
GLM-5.1 API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $1.4/M 기준으로, 이 크레딧만으로도 GLM-5.1에 약 8K 토큰 규모의 요청을 대략 89회 보낼 수 있습니다.
GLM-5.1은 무엇에 가장 강한가요?
최대 8시간 자율 작업, 단발 생성 대신 실험-분석-최적화 루프, 계획부터 테스트·전달까지 커버. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
GLM-5.1의 가격은 얼마인가요?
Synthorai에서 GLM-5.1은 입력 토큰 100만 개당 $1.4, 출력 토큰 100만 개당 $4.4입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다. 캐시된 입력 토큰은 $0.26/M로 과금됩니다.
GLM-5.1은 프롬프트 캐싱을 지원하나요?
네, 자동으로 지원합니다. Z.ai에서 서빙되는 프롬프트는 코드 변경 없이 캐시됩니다. 캐시된 입력 토큰은 $0.26/M로 과금됩니다(미캐시 시 $1.4/M). 프롬프트 캐싱 가이드 →
GLM-5.1은 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="glm-5.1"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
GLM-5.1은 오픈소스인가요?
네, 가중치가 MIT 라이선스 하에 공개되어 있습니다. GPU를 직접 마련할 필요도 없습니다: 여기서 제공되는 호스팅 버전은 종량제이며 운영할 인프라가 없습니다. 오픈 웨이트 모델 실행하기 →
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.