Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Kimi K2.7 Code

Lanzamiento: 2026-06

chatCódigoRazonamientoLlamada a herramientasVisión

Kimi K2.7 Code es el modelo agéntico centrado en codificación de Moonshot AI, construido sobre Kimi K2.6, ajustado para la ingeniería de software del mundo real y descrito por Moonshot como su modelo dedicado a la codificación, que sigue instrucciones de forma más fiable en contextos largos y completa tareas de codificación con mayores tasas de éxito.

Entrada
texto imagen vídeo $0.95/M
Salida
texto $4/M
Lectura de caché
$0.19/M
Contexto
256K
vs GPT-4o
~81% más barato

Benchmarks

Sobre la media1 / 5
Kimi K2.7 Code otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
MLS-Bench-Lite
35.1%
MCP-Atlas
76%

Publicado por los proveedores: Alibaba (Qwen) Moonshot OpenAI Z.ai

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$0.95/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.19/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 256.000
Salida máxima (especificación del proveedor) 32.768

Caché de prompts

Modo automático

Razonamiento

Parámetro del proveedor thinking.type + thinking.keep
Valores admitidos type accepts only enabled; keep accepts only all
Valor por defecto pensamiento activado con Preserved Thinking activado se aplica si la solicitud no indica nada
Se puede desactivar No
Comportamiento del razonamiento Pasar type disabled devuelve un error; como Preserved Thinking se fuerza en el servidor, el reasoning_content de cada mensaje del asistente del historial debe devolverse tal cual.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto + imagen + vídeo → texto
Parámetros 1T totales · 32B activos MoE
Licencia Modified-MIT
  • Modelo agéntico centrado en programación y construido sobre K2.6: MoE de 1T con 32B activos, contexto de 256K
  • pensamiento siempre activo con razonamiento preservado entre turnos
  • ~30% menos tokens de pensamiento que K2.6

según documentación oficial de Moonshot ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

Kimi K2.7 Code superado · 3 sentences

Enabling reasoning mode causes the model to generate an internal chain-of-thought before producing each answer, and that hidden reasoning text is billed like any other output. Those extra reasoning tokens typically add up to much more than the final response itself, so every API call now costs significantly more than before. Because our overall usage volume did not change, the doubled bill reflects that each query consumes roughly twice as many billable tokens.

salida 259 tok (+174 pensamiento) latencia 5.4 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

Kimi K2.7 Code superado · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` The bug is that the function counts *transitions* between equal neighbors instead of counting the items themselves, so a single-element list never enters the loop and returns `0` instead of `1`. Likewise, resetting `cur` to `0` on a mismatch forgets the current item that starts a new run, which causes runs that end at the last index to be undercounted. Initializing both `best` and `cur` to `1` and resetting `cur` to `1` fixes both issues.

salida 410 tok (+222 pensamiento) latencia 9.4 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

Kimi K2.7 Code superado · 5/5 fields, guidance "withheld pending the Q4 close"

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld pending the Q4 close" } ```

salida 721 tok (+663 pensamiento) latencia 13.2 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

Kimi K2.7 Code superado · 120 words, 0 banned, 1 question

We're introducing Prompt Cache for our API Gateway, a new capability that stores prompt responses across multiple AI providers. By caching replies, you reduce redundant calls, lower latency, and cut costs without changing how you build. Teams using several model providers can now reuse identical prompt results instantly, keeping traffic consistent and budgets predictable. Responses are keyed by provider, model, and exact prompt, so you always get the right result. Configure TTL, hit thresholds, and eviction rules from a single dashboard. It fits into your existing routing and requires no code changes. Setup takes minutes and works with your current endpoints. Want to see how much latency and spend you can trim? Check the docs to enable Prompt Cache today.

salida 2375 tok (+2235 pensamiento) latencia 38.6 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use Kimi K2.7 Code en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="kimi-k2.7-code",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de Kimi K2.7 Code

  • Conserva la arquitectura Mixture-of-Experts de 1T parámetros con 32B activados por token (384 expertos, ocho por token más uno compartido) y un contexto de 256K, acepta entrada de imagen junto al texto, y siempre funciona en modo de pensamiento con el contenido de razonamiento preservado entre turnos de una conversación.
  • El modo sin pensamiento no solo se desaconseja, sino que se rechaza: la documentación indica que el modelo no lo admite y que desactivar el pensamiento devuelve un error, con el pensamiento preservado forzado en el servidor.
  • El razonamiento llega en reasoning_content por delante de la respuesta, y la guía es explícita en que hay que devolver ese campo con el mensaje del asistente en los turnos de llamada a herramientas o la solicitud dará error, que es el error de integración más común con este modelo.
  • Oficialmente, refuerza la finalización de tareas de extremo a extremo en flujos de trabajo complejos de ingeniería de software mientras usa alrededor de un 30% menos de tokens de pensamiento que K2.6, y admite el uso agéntico de herramientas mediante el ecosistema MCP con pensamiento intercalado a lo largo de llamadas a herramientas de varios pasos.
  • Moonshot aconseja dejar un margen generoso de max_tokens porque el razonamiento lo consume.
  • Los pesos son abiertos bajo una licencia Modified MIT.
  • Acceda a Kimi K2.7 Code en Synthorai a través del endpoint compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Kimi K2.7 Code?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.95/M por tokens de entrada, solo ese crédito cubre aproximadamente 131 solicitudes de ~8K tokens contra Kimi K2.7 Code.

¿En qué destaca Kimi K2.7 Code?

Aproximadamente un 30% menos de tokens de pensamiento; razonamiento preservado a lo largo de conversaciones de varios turnos; ajustado para la ingeniería de software del mundo real. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Kimi K2.7 Code?

Kimi K2.7 Code cuesta $0.95 por millón de tokens de entrada y $4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.19/M.

¿Kimi K2.7 Code admite caché de prompts?

Sí, automáticamente: los prompts servidos por Moonshot se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.19/M frente a $0.95/M sin caché. Guía de caché de prompts →

¿Cómo obtengo acceso a Kimi K2.7 Code?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="kimi-k2.7-code" y listo. Una sola clave API cubre todos los modelos del gateway.

¿Kimi K2.7 Code es open source?

Sí: los pesos se publican bajo Modified-MIT License. O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →