Kimi K2.5는 Moonshot AI의 오픈소스 네이티브 멀티모달 에이전틱 모델로, Kimi-K2-Base 위에 약 15T의 시각·텍스트 혼합 토큰으로 계속 사전 학습해 만들어졌습니다.
- 입력
- 텍스트 이미지 비디오 $0.574/M
- 출력
- 텍스트 $3.011/M
- 캐시 읽기
- $0.115/M
- 컨텍스트
- 262K
- GPT-4o 대비
- 약 89% 저렴
벤치마크
벤더 공개: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
가격의 위치
동종 60개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
토큰
| 컨텍스트 윈도우(공급사 사양) | 256,000 |
|---|
프롬프트 캐싱
| 캐싱 방식 | 자동 |
|---|
사고
| 공급사 파라미터 | thinking.type |
|---|---|
| 허용 값 | enabled · disabled |
| 기본값 | Moonshot 자체 플랫폼에서는 enabled; 다만 Alibaba Model Studio는 자사 배포판을 기본 사고 비활성으로 문서화하고 있음 요청에서 지정하지 않을 때 적용 |
| 비활성화 가능 | 지원 |
| 사고 동작 | 트레이스는 reasoning_content로 반환되며, max_tokens에 포함되고 언제나 content보다 먼저 스트리밍됩니다. Preserved Thinking은 지원되지 않지만, 이전 reasoning_content를 messages에 남겨 두지 않으면 모델이 추론 컨텍스트를 잃습니다. |
| 파라미터 | reasoning_effort |
| 값 | minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다 |
모델
| 모달리티 | 텍스트 + 이미지 + 비디오 → 텍스트 |
|---|---|
| 파라미터 | 전체 1T · 활성 32B MoE |
| 라이선스 | Modified-MIT |
- 1T/32B 활성 MoE, 256K 컨텍스트, 네이티브 멀티모달(MoonViT 인코더, 이미지 + 영상 입력), instant + thinking 모드, 최대 100개 서브에이전트의 Agent Swarm
- 네이티브 INT4 양자화
출처: Moonshot 공식 문서 ↗
하나의 프롬프트 - 게이트웨이를 통해 측정됨
Kimi K2.5 통과 · 3 sentences
Enabling reasoning causes the model to perform extended internal deliberation, generating substantially more tokens per query than standard responses. Each reasoning chain consumes compute credits equivalent to multiple regular completions, and user query volume remained constant while per-query costs multiplied. The doubling reflects usage of a more expensive capability tier, not an operational error or billing anomaly.
출력 67 tok 지연 시간 1.9 s
지시 준수(정확히 세 문장 - 셀 수 있음), 독자 맞춤(CFO 어조), 그리고 아래 토큰 계량기가 드러내는 숨은 사고 과금 격차.
Kimi K2.5 통과 · 8/8 cases
The bug has two causes: the loop starts at index 1 and `cur` counts *additional* matching elements rather than the run length itself, so a single element run returns 0 instead of 1, and runs ending at the final element aren't properly captured because `best` is only updated inside the loop when elements match—meaning if the last run is just one element or if `cur` was never updated for the final position, the correct value gets lost. To fix this, initialize `best` and `cur` to 1 (since every run has at least one element), start the loop at 1, keep the same logic for incrementing `cur` when elements match and resetting otherwise, and update `best` after both branches or at the end to ensure the last run is considered. […]
출력 250 tok 지연 시간 5.0 s
수정이 실제로 옳은지(실행 가능한지), 설명의 밀도, 그리고 범위가 정해진 작업에서의 토큰 효율.
Kimi K2.5 통과 · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
출력 51 tok 지연 시간 1.6 s
스키마 준수(없는 필드를 지어내지 않기), 환각 압력(guidance는 명시적으로 보류됨), 그리고 구조화 출력 경로의 차이.
Kimi K2.5 통과 · 113 words, 0 banned, 1 question
**Announcing Prompt Cache: One Store, Every Provider** Stop rewriting the same prompts for different AI platforms. Our new API gateway feature stores your prompts in a unified cache, making them instantly available across OpenAI, Anthropic, Google, and more. Switch providers without touching your prompt library. Compare outputs side-by-side using identical inputs. Your team maintains one source of truth while gaining the flexibility to route requests wherever performance or pricing demands. Version history tracks every edit. Access controls keep sensitive prompts secure. And with sub-10ms retrieval times, latency won't slow you down. Why maintain separate prompt libraries when one intelligent cache does it all? Prompt Cache is available today for Enterprise and Scale plans.
출력 141 tok 지연 시간 3.3 s
제약 준수(단어 예산, 금지어 목록, 단 하나의 의문문), 문체 지문, 그리고 길이 제어.
30초 만에 Kimi K2.5 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k2.5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k2.5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k2.5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k2.5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Kimi K2.5 소개
- Mixture-of-Experts 설계는 총 1T 파라미터에 32B가 활성화되며(전문가 384개, 토큰당 8개 라우팅과 공유 전문가 1개), 400M 파라미터의 MoonViT 비전 인코더를 더하고 256K 컨텍스트를 지원합니다.
- Kimi K2 대비 시각-언어 이해, 시각적 명세로부터의 코드 생성, 그리고 단일 에이전트 실행에서 협응하는 스웜형 운영으로 나아가는 Agent Swarm을 도입했으며, 사고 모드와 즉시(instant) 모드를 모두 갖추고 있습니다.
- Moonshot의 출시 포스트는 최대 100개의 서브 에이전트로 이루어진 스웜이 1,500회에 이르는 도구 호출에 걸쳐 작업한다고 설명합니다.
- Moonshot은 이 모델을 만든 목적의 워크로드를 명시합니다.
- 문서 생성과 변환, 슬라이드 제작, 스프레드시트 수식과 분석, 시각 디자인으로부터의 웹사이트 구축, 그리고 보고서 종합을 포함한 딥 리서치입니다.
- 모드는 별도의 모델 id가 아니라 파라미터입니다.
- 사고가 기본으로 켜져 있고 즉시 모드는 사고를 끈 상태이며, 추론은 reasoning_content로 반환되어 max_tokens에 산입됩니다.
- Moonshot의 이후 코딩 모델과 달리 턴을 넘겨 추론을 이어가지 않아 여기서는 사고 보존이 지원되지 않습니다.
- 함수 호출, 파셜 모드 프리필, JSON 및 JSON 스키마 응답, 자동 프롬프트 캐싱을 모두 이용할 수 있고, Moonshot은 네이티브 INT4 양자화를 함께 제공합니다.
- 가중치는 Modified MIT 라이선스로 배포되며, 유일한 추가 조항은 매우 큰 규모의 상업적 배포에 대한 출처 표기 요구입니다.
- Synthorai는 OpenAI 호환 API 인터페이스로 Kimi K2.5를 호출할 수 있게 합니다.
자주 묻는 질문
Kimi K2.5 API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $0.574/M 기준으로, 이 크레딧만으로도 Kimi K2.5에 약 8K 토큰 규모의 요청을 대략 217회 보낼 수 있습니다.
Kimi K2.5는 무엇에 가장 강한가요?
시각-언어 이해와 시각 사양 기반 코드 생성, 조율된 다중 에이전트 운영의 Agent Swarm, Modified MIT 라이선스의 1T 파라미터 MoE. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Kimi K2.5의 가격은 얼마인가요?
Synthorai에서 Kimi K2.5는 입력 토큰 100만 개당 $0.574, 출력 토큰 100만 개당 $3.011입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다. 캐시된 입력 토큰은 $0.115/M로 과금됩니다.
Kimi K2.5는 프롬프트 캐싱을 지원하나요?
네, 자동으로 지원합니다. Moonshot에서 서빙되는 프롬프트는 코드 변경 없이 캐시됩니다. 캐시된 입력 토큰은 $0.115/M로 과금됩니다(미캐시 시 $0.574/M). 프롬프트 캐싱 가이드 →
Kimi K2.5는 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="kimi-k2.5"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
Kimi K2.5는 오픈소스인가요?
네, 가중치가 Modified-MIT 라이선스 하에 공개되어 있습니다 (공식 저장소 링크는 소개 섹션 참고). GPU를 직접 마련할 필요도 없습니다: 여기서 제공되는 호스팅 버전은 종량제이며 운영할 인프라가 없습니다. 오픈 웨이트 모델 실행하기 →
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.