Kimi K2.5 es el modelo agéntico multimodal nativo y de código abierto de Moonshot AI, construido mediante preentrenamiento continuo sobre aproximadamente 15T tokens visuales y de texto mezclados sobre Kimi-K2-Base.
- Entrada
- texto imagen vídeo $0.574/M
- Salida
- texto $3.011/M
- Lectura de caché
- $0.115/M
- Contexto
- 262K
- vs GPT-4o
- ~89% más barato
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 256.000 |
|---|
Caché de prompts
| Modo | automático |
|---|
Razonamiento
| Parámetro del proveedor | thinking.type |
|---|---|
| Valores admitidos | enabled · disabled |
| Valor por defecto | enabled en la propia plataforma de Moonshot; tenga en cuenta que Alibaba Model Studio documenta su despliegue de este modelo con el pensamiento desactivado por defecto se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content, cuenta para max_tokens y siempre se transmite antes que content; Preserved Thinking no está admitido, pero conviene mantener el reasoning_content histórico en messages o el modelo pierde el contexto de razonamiento. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen + vídeo → texto |
|---|---|
| Parámetros | 1T totales · 32B activos MoE |
| Licencia | Modified-MIT |
- MoE de 1T con 32B activos, contexto de 256K, multimodal nativo (codificador MoonViT, entrada de imagen y vídeo), modos instant y thinking, Agent Swarm de hasta 100 subagentes
- cuantización INT4 nativa
Un prompt, medido a través del gateway
Kimi K2.5 superado · 3 sentences
Enabling reasoning causes the model to perform extended internal deliberation, generating substantially more tokens per query than standard responses. Each reasoning chain consumes compute credits equivalent to multiple regular completions, and user query volume remained constant while per-query costs multiplied. The doubling reflects usage of a more expensive capability tier, not an operational error or billing anomaly.
salida 67 tok latencia 1.9 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
Kimi K2.5 superado · 8/8 cases
The bug has two causes: the loop starts at index 1 and `cur` counts *additional* matching elements rather than the run length itself, so a single element run returns 0 instead of 1, and runs ending at the final element aren't properly captured because `best` is only updated inside the loop when elements match—meaning if the last run is just one element or if `cur` was never updated for the final position, the correct value gets lost. To fix this, initialize `best` and `cur` to 1 (since every run has at least one element), start the loop at 1, keep the same logic for incrementing `cur` when elements match and resetting otherwise, and update `best` after both branches or at the end to ensure the last run is considered. […]
salida 250 tok latencia 5.0 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
Kimi K2.5 superado · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
salida 51 tok latencia 1.6 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
Kimi K2.5 superado · 113 words, 0 banned, 1 question
**Announcing Prompt Cache: One Store, Every Provider** Stop rewriting the same prompts for different AI platforms. Our new API gateway feature stores your prompts in a unified cache, making them instantly available across OpenAI, Anthropic, Google, and more. Switch providers without touching your prompt library. Compare outputs side-by-side using identical inputs. Your team maintains one source of truth while gaining the flexibility to route requests wherever performance or pricing demands. Version history tracks every edit. Access controls keep sensitive prompts secure. And with sub-10ms retrieval times, latency won't slow you down. Why maintain separate prompt libraries when one intelligent cache does it all? Prompt Cache is available today for Enterprise and Scale plans.
salida 141 tok latencia 3.3 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use Kimi K2.5 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="kimi-k2.5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "kimi-k2.5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "kimi-k2.5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("kimi-k2.5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Kimi K2.5
- Su diseño Mixture-of-Experts totaliza 1T parámetros con 32B activados (384 expertos, ocho enrutados por token más uno compartido), añade el codificador de visión MoonViT de 400M parámetros y admite un contexto de 256K.
- Frente a Kimi K2, introduce comprensión de lenguaje-visión, generación de código a partir de especificaciones visuales y Agent Swarm, pasando de la ejecución de un solo agente a una operación coordinada de tipo enjambre, con modos de pensamiento e instantáneo; la publicación de lanzamiento de Moonshot describe enjambres de hasta 100 subagentes trabajando a lo largo de hasta 1500 llamadas a herramientas.
- Moonshot nombra las cargas de trabajo para las que lo construyó: generación y conversión de documentos, creación de diapositivas, fórmulas y análisis de hojas de cálculo, construcción de sitios web a partir de diseños visuales, e investigación profunda con síntesis de informes.
- Los modos son un parámetro, no un id de modelo aparte: el pensamiento está habilitado por defecto y el modo instantáneo es el pensamiento desactivado, con el razonamiento devuelto en reasoning_content y contabilizado contra max_tokens.
- A diferencia de los modelos de codificación posteriores de Moonshot, no arrastra el razonamiento entre turnos: aquí no se admite el pensamiento preservado.
- La llamada a funciones, los prefills en modo parcial, las respuestas JSON y con esquema JSON, y la caché de prompts automática están todos disponibles, y Moonshot distribuye cuantización INT4 nativa.
- Los pesos se distribuyen bajo una licencia Modified MIT cuya única añadidura es un requisito de atribución para despliegues comerciales muy grandes.
- Synthorai hace que Kimi K2.5 se pueda invocar a través de su superficie de API compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Kimi K2.5?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.574/M por tokens de entrada, solo ese crédito cubre aproximadamente 217 solicitudes de ~8K tokens contra Kimi K2.5.
¿En qué destaca Kimi K2.5?
Comprensión de lenguaje-visión y código desde especificaciones visuales; Agent Swarm para operación coordinada de múltiples agentes; MoE de 1T parámetros bajo licencia Modified MIT. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Kimi K2.5?
Kimi K2.5 cuesta $0.574 por millón de tokens de entrada y $3.011 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.115/M.
¿Kimi K2.5 admite caché de prompts?
Sí, automáticamente: los prompts servidos por Moonshot se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.115/M frente a $0.574/M sin caché. Guía de caché de prompts →
¿Cómo obtengo acceso a Kimi K2.5?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="kimi-k2.5" y listo. Una sola clave API cubre todos los modelos del gateway.
¿Kimi K2.5 es open source?
Sí: los pesos se publican bajo Modified-MIT License (repositorio oficial enlazado en la sección Acerca de). O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.