Kimi K2.7 Code는 Kimi K2.6 위에 구축된 Moonshot AI의 코딩 특화 에이전틱 모델로, 실제 소프트웨어 엔지니어링에 맞춰 튜닝되었으며 Moonshot은 이를 자사의 전용 코딩 모델이라고 소개합니다.
- 입력
- 텍스트 이미지 비디오 $0.95/M
- 출력
- 텍스트 $4/M
- 캐시 읽기
- $0.19/M
- 컨텍스트
- 256K
- GPT-4o 대비
- 약 81% 저렴
벤치마크
벤더 공개: Alibaba (Qwen) Moonshot OpenAI Z.ai
가격의 위치
동종 60개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
토큰
| 컨텍스트 윈도우(공급사 사양) | 256,000 |
|---|---|
| 최대 출력(벤더 스펙) | 32,768 |
프롬프트 캐싱
| 캐싱 방식 | 자동 |
|---|
사고
| 공급사 파라미터 | thinking.type + thinking.keep |
|---|---|
| 허용 값 | type accepts only enabled; keep accepts only all |
| 기본값 | 사고 켜짐, Preserved Thinking도 켜짐 요청에서 지정하지 않을 때 적용 |
| 비활성화 가능 | 미지원 |
| 사고 동작 | type을 disabled로 전달하면 오류가 반환됩니다. Preserved Thinking이 서버 측에서 강제되므로, 이전 어시스턴트 메시지의 reasoning_content를 모두 원본 그대로 되돌려 보내야 합니다. |
| 파라미터 | reasoning_effort |
| 값 | minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다 |
모델
| 모달리티 | 텍스트 + 이미지 + 비디오 → 텍스트 |
|---|---|
| 파라미터 | 전체 1T · 활성 32B MoE |
| 라이선스 | Modified-MIT |
- K2.6 기반의 코딩 특화 에이전틱 모델: 1T/32B 활성 MoE, 256K 컨텍스트
- 사고가 항상 켜져 있고 턴 간 추론이 보존됨
- K2.6 대비 사고 토큰 약 30% 감소
출처: Moonshot 공식 문서 ↗
하나의 프롬프트 - 게이트웨이를 통해 측정됨
Kimi K2.7 Code 통과 · 3 sentences
Enabling reasoning mode causes the model to generate an internal chain-of-thought before producing each answer, and that hidden reasoning text is billed like any other output. Those extra reasoning tokens typically add up to much more than the final response itself, so every API call now costs significantly more than before. Because our overall usage volume did not change, the doubled bill reflects that each query consumes roughly twice as many billable tokens.
출력 259 tok (+174 추론) 지연 시간 5.4 s
지시 준수(정확히 세 문장 - 셀 수 있음), 독자 맞춤(CFO 어조), 그리고 아래 토큰 계량기가 드러내는 숨은 사고 과금 격차.
Kimi K2.7 Code 통과 · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The bug is that the function counts *transitions* between equal neighbors instead of counting the items themselves, so a single-element list never enters the loop and returns `0` instead of `1`. Likewise, resetting `cur` to `0` on a mismatch forgets the current item that starts a new run, which causes runs that end at the last index to be undercounted. Initializing both `best` and `cur` to `1` and resetting `cur` to `1` fixes both issues.
출력 410 tok (+222 추론) 지연 시간 9.4 s
수정이 실제로 옳은지(실행 가능한지), 설명의 밀도, 그리고 범위가 정해진 작업에서의 토큰 효율.
Kimi K2.7 Code 통과 · 5/5 fields, guidance "withheld pending the Q4 close"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld pending the Q4 close" } ```
출력 721 tok (+663 추론) 지연 시간 13.2 s
스키마 준수(없는 필드를 지어내지 않기), 환각 압력(guidance는 명시적으로 보류됨), 그리고 구조화 출력 경로의 차이.
Kimi K2.7 Code 통과 · 120 words, 0 banned, 1 question
We're introducing Prompt Cache for our API Gateway, a new capability that stores prompt responses across multiple AI providers. By caching replies, you reduce redundant calls, lower latency, and cut costs without changing how you build. Teams using several model providers can now reuse identical prompt results instantly, keeping traffic consistent and budgets predictable. Responses are keyed by provider, model, and exact prompt, so you always get the right result. Configure TTL, hit thresholds, and eviction rules from a single dashboard. It fits into your existing routing and requires no code changes. Setup takes minutes and works with your current endpoints. Want to see how much latency and spend you can trim? Check the docs to enable Prompt Cache today.
출력 2375 tok (+2235 추론) 지연 시간 38.6 s
제약 준수(단어 예산, 금지어 목록, 단 하나의 의문문), 문체 지문, 그리고 길이 제어.
30초 만에 Kimi K2.7 Code 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k2.7-code",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k2.7-code",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.7-code",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k2.7-code",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k2.7-code")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Kimi K2.7 Code 소개
- 긴 컨텍스트에서 지시를 더 안정적으로 따르고 코딩 과제를 더 높은 성공률로 완수한다는 설명입니다.
- 토큰당 32B가 활성화되는 1T 파라미터 Mixture-of-Experts 아키텍처(전문가 384개, 토큰당 8개와 공유 1개)와 256K 컨텍스트를 유지하고, 텍스트와 함께 이미지 입력을 받아들이며, 항상 사고 모드로 동작하고 멀티턴 대화 전반에서 추론 내용을 보존합니다.
- 비사고 모드는 권장되지 않는 정도가 아니라 아예 거부됩니다.
- 문서는 이 모델이 비사고 모드를 지원하지 않으며 사고를 끄면 오류가 반환되고 사고 보존이 서버 측에서 강제된다고 밝힙니다.
- 추론은 답변에 앞서 reasoning_content로 도착하며, 가이드는 도구 호출 턴에서 그 필드를 어시스턴트 메시지와 함께 되돌려 주지 않으면 요청이 실패한다고 명시합니다.
- 이는 이 모델에서 가장 흔한 통합 실수입니다.
- 공식적으로는 복잡한 소프트웨어 엔지니어링 워크플로 전반에서 처음부터 끝까지 과제를 완수하는 능력을 강화하면서 사고 토큰은 K2.6 대비 약 30% 적게 사용하며, MCP 생태계를 통한 에이전틱 도구 사용과 다단계 도구 호출에 걸친 인터리브드 사고를 지원합니다.
- Moonshot은 추론이 토큰을 소모하므로 max_tokens에 넉넉한 여유를 두라고 권합니다.
- 가중치는 Modified MIT 라이선스로 공개되어 있습니다.
- Kimi K2.7 Code는 Synthorai의 OpenAI 호환 엔드포인트로 이용하십시오.
자주 묻는 질문
Kimi K2.7 Code API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $0.95/M 기준으로, 이 크레딧만으로도 Kimi K2.7 Code에 약 8K 토큰 규모의 요청을 대략 131회 보낼 수 있습니다.
Kimi K2.7 Code는 무엇에 가장 강한가요?
사고 토큰 약 30% 절감, 멀티턴 대화 전반에 추론 보존, 실전 소프트웨어 엔지니어링 특화 튜닝. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Kimi K2.7 Code의 가격은 얼마인가요?
Synthorai에서 Kimi K2.7 Code는 입력 토큰 100만 개당 $0.95, 출력 토큰 100만 개당 $4입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다. 캐시된 입력 토큰은 $0.19/M로 과금됩니다.
Kimi K2.7 Code는 프롬프트 캐싱을 지원하나요?
네, 자동으로 지원합니다. Moonshot에서 서빙되는 프롬프트는 코드 변경 없이 캐시됩니다. 캐시된 입력 토큰은 $0.19/M로 과금됩니다(미캐시 시 $0.95/M). 프롬프트 캐싱 가이드 →
Kimi K2.7 Code는 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="kimi-k2.7-code"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
Kimi K2.7 Code는 오픈소스인가요?
네, 가중치가 Modified-MIT 라이선스 하에 공개되어 있습니다. GPU를 직접 마련할 필요도 없습니다: 여기서 제공되는 호스팅 버전은 종량제이며 운영할 인프라가 없습니다. 오픈 웨이트 모델 실행하기 →
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.