신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

Kimi K3

chat코드리즈닝도구 호출비전프롬프트 캐싱

Kimi K3는 지금까지 Moonshot이 내놓은 가장 강력한 플래그십 모델이며, 2.8조 파라미터로 문서가 세계 최초의 3조 파라미터급 오픈소스 모델이라고 부르는 모델입니다.

입력
텍스트 이미지 비디오 $3/M
출력
텍스트 $15/M
캐시 읽기
$0.3/M
컨텍스트
1M
GPT-4o 대비
약 40% 저렴

벤치마크

평균 상회최고 점수51 / 6213 / 62
Kimi K3 측정된 다른 모델 측정 대상 평균 더 높은 점수를 낸 모델 없음
Terminal-Bench 2.1
88.3%
OSWorld-Verified
84.8%
Cybergym
80%
Finance Agent v2
54.4%
Harvey Lab-AA
더 높은 점수를 낸 모델 없음 94.6%
GPQA Diamond
93.5%
BrowseComp
더 높은 점수를 낸 모델 없음 91.2%
Video-MME (w. sub)
더 높은 점수를 낸 모델 없음 90%

벤더 공개: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

가격의 위치

동종 65개 모델 중 가격 위치

입력$3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
출력$15/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
캐시 읽기$0.3/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

토큰

컨텍스트 윈도우(공급사 사양) 1,048,576
최대 출력(벤더 스펙) 1,048,576

프롬프트 캐싱

캐싱 방식 자동

사고

공급사 파라미터 reasoning_effort (top-level; the thinking object is not accepted)
허용 값 low · high · max
기본값 max 요청에서 지정하지 않을 때 적용
비활성화 가능 미지원
사고 동작 K3는 항상 추론하므로 끄는 대신 low로 낮춰야 합니다. 멀티턴 및 도구 호출 턴에서는 reasoning_content와 tool_calls를 포함한 어시스턴트 메시지 전체를 되돌려 보내야 하며, 세션 도중 effort를 바꾸면 프리픽스 캐시 적중이 무효화됩니다.
파라미터 reasoning_effort
minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다

모델

모달리티 텍스트 + 이미지 + 비디오 → 텍스트
파라미터 전체 2.8T · 활성 104B MoE: Kimi Delta Attention(KDA) + Attention Residuals, 896개 전문가 중 토큰당 16개 활성
라이선스 Kimi K3 License

사고 모드가 항상 켜져 있어 추론을 비활성화할 수는 없고 강도 수준(low / high / max)으로 낮출 수만 있습니다. max_completion_tokens의 기본값은 131,072이며 최대 1,048,576까지 올릴 수 있습니다. 컨텍스트 캐싱은 캐시 id, TTL, 추가 파라미터 없이 자동으로 동작하고, 직전 요청의 프롬프트가 256 토큰을 넘으면 작동합니다. 오픈 가중치(MXFP4 가중치 / MXFP8 활성값, 양자화 인식 학습)는 Kimi K3 License로 Hugging Face에 공개되어 있습니다.

출처: Moonshot 공식 문서 ↗

하나의 프롬프트 - 게이트웨이를 통해 측정됨

프롬프트 Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. 확인 정확히 3문장

Kimi K3 통과 · 3 sentences

Reasoning models don't just answer questions—they "think" first, generating long internal chains of step-by-step logic before producing a response. Those hidden thinking steps are billed as output tokens (the most expensive kind, typically 3–5x the price of input tokens), and a single query can generate thousands of them even when the visible answer is only a paragraph long. So you're paying for dramatically more compute per request: the bill doubled because the model does far more work behind the scenes, not because usage increased.

출력 755 tok (+637 추론) 지연 시간 20.8 s

지시 준수(정확히 세 문장 - 셀 수 있음), 독자 맞춤(CFO 어조), 그리고 아래 토큰 계량기가 드러내는 숨은 사고 과금 격차.

프롬프트 This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. 확인 수정이 테스트를 통과

Kimi K3 통과 · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The bug is a fencepost error: `cur` counts *matching adjacent pairs* rather than *items in the run*, because it starts at 0 and only increments when `xs[i] == xs[i - 1]`. A run of length L contains L−1 equal pairs, so every run was undercounted by exactly one. For a single-element list (a run of length 1) the loop never runs and the function returns 0 instead of 1; likewise any run ending at the last index — e.g. the two `2`s in `[1, 2, 2]` — reported 1 instead of 2, making it look like no run existed at all. […]

출력 1837 tok (+1547 추론) 지연 시간 47.2 s

수정이 실제로 옳은지(실행 가능한지), 설명의 밀도, 그리고 범위가 정해진 작업에서의 토큰 효율.

프롬프트 Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. 확인 유효한 JSON, 스키마 정확

Kimi K3 통과 · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

출력 924 tok (+863 추론) 지연 시간 25.9 s

스키마 준수(없는 필드를 지어내지 않기), 환각 압력(guidance는 명시적으로 보류됨), 그리고 구조화 출력 경로의 차이.

프롬프트 Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. 확인 120단어, 금지어 0개

Kimi K3 통과 · 120 words, 0 banned, 1 question

Meet Prompt Cache, a new API gateway capability that stores prompt responses and serves them across OpenAI, Anthropic, Google, and Azure endpoints. It matches requests by model, prompt hash, tools, temperature, and tenant policy, so repeated work returns fast while sensitive contexts stay isolated. Teams set TTLs, stale rules, encryption scopes, and bypass flags per route. Analytics show hit rate, latency saved, token spend avoided, and drift risk by provider. What changes for developers? Keep one integration, add cache headers, and watch fallback logic respect consent, residency, and audit needs. During rollout, canary keys compare fresh answers with cached copies before promotion. Prompt Cache cuts vendor calls, steadies p95 latency, and gives platform owners controls for cost, quality, and compliance.

출력 1527 tok (+1354 추론) 지연 시간 37.9 s

제약 준수(단어 예산, 금지어 목록, 단 하나의 의문문), 문체 지문, 그리고 길이 제어.

30초 만에 Kimi K3 사용하기

OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Kimi K3 소개

  • 아키텍처는 하이브리드 선형 어텐션 메커니즘인 Kimi Delta Attention과 Attention Residuals를 결합하고, Stable LatentMoE 프레임워크로 Mixture-of-Experts 희소성을 더 밀어붙여 896개 전문가 중 16개를 활성화합니다.
  • Moonshot은 이러한 변경으로 K2 대비 전체 스케일링 효율이 약 2.5배가 되었다고 밝힙니다.
  • 네이티브 시각 이해와 1M 토큰 컨텍스트 윈도우를 탑재했고, 롱 호라이즌 코딩·지식 노동·추론을 포함한 프런티어 지능 시나리오를 겨냥합니다.
  • 최소한의 감독으로 긴 엔지니어링 과제를 지속하고, 대규모 코드베이스를 넘나들며 작업하고, 터미널 도구를 구동하고, 게임 개발·프런트엔드 엔지니어링·CAD 워크플로에서 스크린샷과 시각적 피드백을 활용합니다.
  • 여기서 사고는 선택 사항이 아닙니다.
  • K3는 항상 추론하며, 제어 수단은 최상위 reasoning_effort 필드의 low, high, max뿐이고 기본값이 max이므로 지연에 민감한 배포라면 명시적으로 낮춰야 합니다.
  • 코드에서 감안할 다른 제약도 몇 가지 있습니다. max_completion_tokens는 1,048,576 상한에 대해 기본값이 131,072이고, 샘플링 파라미터는 고정되어 있어 요청에서 생략해야 하며, 멀티턴과 도구 호출 턴에서는 어시스턴트 메시지 전체를 변경 없이 되돌려 주어야 하고, 비전 입력은 공개 이미지 URL을 거부하고 base64나 업로드된 파일 참조를 요구합니다.
  • 컨텍스트 캐싱은 캐시 id나 TTL, 추가 파라미터 없이 자동으로 동작하며 이전 요청의 프롬프트가 256 토큰을 넘으면 작동하고, 가격은 컨텍스트 길이에 따른 구간 없이 단일 요율입니다.
  • 구조화 출력, 파셜 모드 프리필, 동적 도구 로딩을 지원하며, 가중치는 Kimi K3 License로 공개되어 있습니다.
  • Synthorai는 OpenAI 호환 chat completions 엔드포인트로 Kimi K3를 호출할 수 있게 합니다.

자주 묻는 질문

Kimi K3 API는 무료로 사용해 볼 수 있나요?

네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $3/M 기준으로, 이 크레딧만으로도 Kimi K3에 약 8K 토큰 규모의 요청을 대략 41회 보낼 수 있습니다.

Kimi K3은 무엇에 가장 강한가요?

3조 파라미터급 최초의 오픈소스 모델, 1M 토큰 컨텍스트 윈도우와 네이티브 시각 이해, 항상 추론하며 reasoning_effort 기본값은 max. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

Kimi K3의 가격은 얼마인가요?

Synthorai에서 Kimi K3은 입력 토큰 100만 개당 $3, 출력 토큰 100만 개당 $15입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다. 캐시된 입력 토큰은 $0.3/M로 과금됩니다.

Kimi K3은 프롬프트 캐싱을 지원하나요?

네, 자동으로 지원합니다. Moonshot에서 서빙되는 프롬프트는 코드 변경 없이 캐시됩니다. 캐시된 입력 토큰은 $0.3/M로 과금됩니다(미캐시 시 $3/M). 프롬프트 캐싱 가이드 →

Kimi K3은 어떻게 이용하나요?

기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="kimi-k3"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.

Kimi K3은 오픈소스인가요?

네, 가중치가 Kimi K3 License 하에 공개되어 있습니다 (공식 저장소 링크는 소개 섹션 참고). GPU를 직접 마련할 필요도 없습니다: 여기서 제공되는 호스팅 버전은 종량제이며 운영할 인프라가 없습니다. 오픈 웨이트 모델 실행하기 →

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →