O Kimi K3 é o modelo carro-chefe mais capaz da Moonshot até hoje e, com 2,8 trilhões de parâmetros, o que sua documentação chama do primeiro modelo open-source do mundo na classe de três trilhões de parâmetros.
- Entrada
- texto imagem vídeo $3/M
- Saída
- texto $15/M
- Leitura de cache
- $0.3/M
- Contexto
- 1M
- vs GPT-4o
- ~40% mais barato
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
O preço em contexto
Posição do preço entre 65 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.048.576 |
|---|---|
| Saída máxima (especificação do fornecedor) | 1.048.576 |
Cache de prompts
| Modo | automático |
|---|
Raciocínio
| Parâmetro do fornecedor | reasoning_effort (top-level; the thinking object is not accepted) |
|---|---|
| Valores aceites | low · high · max |
| Valor predefinido | max aplicado quando o pedido nada indica |
| Pode ser desativado | Não |
| Comportamento do raciocínio | O K3 sempre raciocina, então reduza com low em vez de desligar; a mensagem de assistente completa, incluindo reasoning_content e tool_calls, precisa ser devolvida nos turnos de conversa em múltiplos turnos e nos turnos com chamada de ferramentas, e trocar o esforço no meio da sessão invalida os acertos de cache de prefixo. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto + imagem + vídeo → texto |
|---|---|
| Parâmetros | 2.8T no total · 104B ativos MoE: Kimi Delta Attention (KDA) + Attention Residuals, 16 de 896 especialistas ativos por token |
| Licença | Kimi K3 License |
O modo de raciocínio está sempre ativo: o raciocínio não pode ser desativado, apenas reduzido pelos níveis de esforço (low / high / max). max_completion_tokens tem padrão de 131.072 e pode ser elevado ao total de 1.048.576. O cache de contexto é automático, sem id de cache, TTL ou parâmetro extra, e entra em ação assim que o prompt da requisição anterior passa de 256 tokens. Pesos abertos (pesos MXFP4 / ativações MXFP8, treinamento consciente de quantização) publicados no Hugging Face sob a Kimi K3 License.
conforme documentação oficial da Moonshot ↗
Um prompt, medido pelo gateway
Kimi K3 passou · 3 sentences
Reasoning models don't just answer questions—they "think" first, generating long internal chains of step-by-step logic before producing a response. Those hidden thinking steps are billed as output tokens (the most expensive kind, typically 3–5x the price of input tokens), and a single query can generate thousands of them even when the visible answer is only a paragraph long. So you're paying for dramatically more compute per request: the bill doubled because the model does far more work behind the scenes, not because usage increased.
saída 755 tok (+637 pensamento) latência 20.8 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
Kimi K3 passou · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The bug is a fencepost error: `cur` counts *matching adjacent pairs* rather than *items in the run*, because it starts at 0 and only increments when `xs[i] == xs[i - 1]`. A run of length L contains L−1 equal pairs, so every run was undercounted by exactly one. For a single-element list (a run of length 1) the loop never runs and the function returns 0 instead of 1; likewise any run ending at the last index — e.g. the two `2`s in `[1, 2, 2]` — reported 1 instead of 2, making it look like no run existed at all. […]
saída 1837 tok (+1547 pensamento) latência 47.2 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
Kimi K3 passou · 5/5 fields, guidance null
{ "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }
saída 924 tok (+863 pensamento) latência 25.9 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
Kimi K3 passou · 120 words, 0 banned, 1 question
Meet Prompt Cache, a new API gateway capability that stores prompt responses and serves them across OpenAI, Anthropic, Google, and Azure endpoints. It matches requests by model, prompt hash, tools, temperature, and tenant policy, so repeated work returns fast while sensitive contexts stay isolated. Teams set TTLs, stale rules, encryption scopes, and bypass flags per route. Analytics show hit rate, latency saved, token spend avoided, and drift risk by provider. What changes for developers? Keep one integration, add cache headers, and watch fallback logic respect consent, residency, and audit needs. During rollout, canary keys compare fresh answers with cached copies before promotion. Prompt Cache cuts vendor calls, steadies p95 latency, and gives platform owners controls for cost, quality, and compliance.
saída 1527 tok (+1354 pensamento) latência 37.9 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o Kimi K3 em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k3",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k3",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k3")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o Kimi K3
- A arquitetura combina a Kimi Delta Attention, um mecanismo híbrido de atenção linear, com Attention Residuals, e leva a esparsidade Mixture-of-Experts adiante pelo framework Stable LatentMoE, ativando 16 de 896 especialistas; a Moonshot credita essas mudanças com cerca de 2,5 vezes a eficiência geral de escalonamento do K2.
- Ele traz entendimento visual nativo e uma janela de contexto de 1M tokens, e mira cenários de inteligência de fronteira incluindo código de longo horizonte, trabalho de conhecimento e raciocínio: sustentar tarefas longas de engenharia com supervisão mínima, trabalhar em grandes bases de código, conduzir ferramentas de terminal e usar capturas de tela e feedback visual em desenvolvimento de jogos, engenharia de frontend e fluxos de CAD.
- O raciocínio não é opcional aqui.
- O K3 sempre raciocina, e o único controle é o campo de nível superior reasoning_effort em low, high ou max, que assume max por padrão, então uma implantação sensível à latência precisa reduzi-lo explicitamente.
- Vários outros limites merecem ser tratados no código: max_completion_tokens assume 131.072 por padrão contra um teto de 1.048.576, os parâmetros de amostragem são fixos e devem ser omitidos das requisições, a mensagem completa do assistente precisa ser retornada sem alterações em conversas de múltiplos turnos e em turnos de chamada de ferramentas, e a entrada de visão rejeita URLs públicas de imagem em favor de base64 ou de uma referência a arquivo enviado.
- O cache de contexto é automático, sem cache id, TTL ou parâmetro extra, entrando em ação assim que o prompt da requisição anterior passa de 256 tokens, e o preço é fixo, sem escalonamento por comprimento de contexto.
- Saída estruturada, prefills em modo parcial e carregamento dinâmico de ferramentas são suportados, e os pesos são publicados sob a Kimi K3 License.
- A Synthorai torna o Kimi K3 chamável pelo seu endpoint de chat completions compatível com OpenAI.
Perguntas frequentes
A API do Kimi K3 é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $3/M de tokens de entrada, só esse crédito já cobre cerca de 41 requisições de ~8K tokens ao Kimi K3.
Em que o Kimi K3 é melhor?
Primeiro modelo open-source da classe de três trilhões de parâmetros; entendimento visual nativo com janela de contexto de 1M tokens; sempre raciocina, com reasoning_effort assumindo max por padrão. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Kimi K3?
Na Synthorai, o Kimi K3 custa $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.3/M.
O Kimi K3 suporta cache de prompts?
Sim, automaticamente: prompts servidos pela Moonshot entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.3/M, contra $3/M sem cache. Guia de cache de prompts →
Como obtenho acesso ao Kimi K3?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="kimi-k3" e pronto. Uma única chave de API cobre todos os modelos do gateway.
O Kimi K3 é open source?
Sim, os pesos são publicados sob a Kimi K3 License (repositório oficial com link na seção Sobre). Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.