O Kimi K2.5 é o modelo agêntico nativamente multimodal e open-source da Moonshot AI, construído por pré-treinamento contínuo em cerca de 15T tokens mistos visuais e de texto sobre o Kimi-K2-Base.
- Entrada
- texto imagem vídeo $0.574/M
- Saída
- texto $3.011/M
- Leitura de cache
- $0.115/M
- Contexto
- 262K
- vs GPT-4o
- ~89% mais barato
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
O preço em contexto
Posição do preço entre 60 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 256.000 |
|---|
Cache de prompts
| Modo | automático |
|---|
Raciocínio
| Parâmetro do fornecedor | thinking.type |
|---|---|
| Valores aceites | enabled · disabled |
| Valor predefinido | enabled na plataforma da própria Moonshot; note que o Alibaba Model Studio documenta a sua implantação deste modelo com o raciocínio desativado por padrão aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Comportamento do raciocínio | O trace retorna em reasoning_content, conta para max_tokens e sempre é transmitido antes de content; o Preserved Thinking não é suportado, mas o reasoning_content histórico deve ser mantido em messages, caso contrário o modelo perde o contexto de raciocínio. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto + imagem + vídeo → texto |
|---|---|
| Parâmetros | 1T no total · 32B ativos MoE |
| Licença | Modified-MIT |
- MoE de 1T com 32B ativos, contexto de 256K, multimodal nativo (encoder MoonViT, entrada de imagem e vídeo), modos instant e thinking, Agent Swarm com até 100 subagentes
- quantização INT4 nativa
conforme documentação oficial da Moonshot ↗
Um prompt, medido pelo gateway
Kimi K2.5 passou · 3 sentences
Enabling reasoning causes the model to perform extended internal deliberation, generating substantially more tokens per query than standard responses. Each reasoning chain consumes compute credits equivalent to multiple regular completions, and user query volume remained constant while per-query costs multiplied. The doubling reflects usage of a more expensive capability tier, not an operational error or billing anomaly.
saída 67 tok latência 1.9 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
Kimi K2.5 passou · 8/8 cases
The bug has two causes: the loop starts at index 1 and `cur` counts *additional* matching elements rather than the run length itself, so a single element run returns 0 instead of 1, and runs ending at the final element aren't properly captured because `best` is only updated inside the loop when elements match—meaning if the last run is just one element or if `cur` was never updated for the final position, the correct value gets lost. To fix this, initialize `best` and `cur` to 1 (since every run has at least one element), start the loop at 1, keep the same logic for incrementing `cur` when elements match and resetting otherwise, and update `best` after both branches or at the end to ensure the last run is considered. […]
saída 250 tok latência 5.0 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
Kimi K2.5 passou · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
saída 51 tok latência 1.6 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
Kimi K2.5 passou · 113 words, 0 banned, 1 question
**Announcing Prompt Cache: One Store, Every Provider** Stop rewriting the same prompts for different AI platforms. Our new API gateway feature stores your prompts in a unified cache, making them instantly available across OpenAI, Anthropic, Google, and more. Switch providers without touching your prompt library. Compare outputs side-by-side using identical inputs. Your team maintains one source of truth while gaining the flexibility to route requests wherever performance or pricing demands. Version history tracks every edit. Access controls keep sensitive prompts secure. And with sub-10ms retrieval times, latency won't slow you down. Why maintain separate prompt libraries when one intelligent cache does it all? Prompt Cache is available today for Enterprise and Scale plans.
saída 141 tok latência 3.3 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o Kimi K2.5 em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k2.5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k2.5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k2.5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k2.5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o Kimi K2.5
- Seu design Mixture-of-Experts totaliza 1T de parâmetros com 32B ativados (384 especialistas, oito roteados por token mais um compartilhado), adiciona o codificador de visão MoonViT de 400M de parâmetros e suporta um contexto de 256K.
- Em relação ao Kimi K2, ele introduz entendimento visão-linguagem, geração de código a partir de especificações visuais e Agent Swarm, passando da execução de agente único para operação coordenada no estilo enxame, com modos thinking e instant; o post de lançamento da Moonshot descreve enxames de até 100 subagentes trabalhando em até 1.500 chamadas de ferramentas.
- A Moonshot nomeia as cargas de trabalho para as quais construiu isso: geração e conversão de documentos, criação de slides, fórmulas e análise de planilhas, construção de sites a partir de designs visuais, e pesquisa profunda com síntese de relatórios.
- Os modos são um parâmetro, e não um id de modelo separado: o thinking vem ativado por padrão e o modo instant é o thinking desativado, com o raciocínio retornado em reasoning_content e contado contra max_tokens.
- Diferente dos modelos de código posteriores da Moonshot, ele não carrega o raciocínio entre turnos: o thinking preservado não é suportado aqui.
- Function calling, prefills em modo parcial, respostas em JSON e em JSON schema, e cache automático de prompts estão todos disponíveis, e a Moonshot entrega quantização INT4 nativa.
- Os pesos vêm sob uma licença Modified MIT cuja única adição é uma exigência de atribuição para implantações comerciais muito grandes.
- A Synthorai torna o Kimi K2.5 chamável pela sua superfície de API compatível com OpenAI.
Perguntas frequentes
A API do Kimi K2.5 é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.574/M de tokens de entrada, só esse crédito já cobre cerca de 217 requisições de ~8K tokens ao Kimi K2.5.
Em que o Kimi K2.5 é melhor?
Entendimento visão-linguagem e código a partir de especificações visuais; agent swarm para operação coordenada de múltiplos agentes; MoE de 1T parâmetros sob licença Modified MIT. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Kimi K2.5?
Na Synthorai, o Kimi K2.5 custa $0.574 por milhão de tokens de entrada e $3.011 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.115/M.
O Kimi K2.5 suporta cache de prompts?
Sim, automaticamente: prompts servidos pela Moonshot entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.115/M, contra $0.574/M sem cache. Guia de cache de prompts →
Como obtenho acesso ao Kimi K2.5?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="kimi-k2.5" e pronto. Uma única chave de API cobre todos os modelos do gateway.
O Kimi K2.5 é open source?
Sim, os pesos são publicados sob a Modified-MIT License (repositório oficial com link na seção Sobre). Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.