Moonshot AI lanzó Kimi K2.7-Code esta semana, una actualización de código abierto para su modelo de codificación K2 familia, alegando un razonamiento más ágil y ganancias de desempeño de dos dígitos.
K2.7-Code se basa en la misma arquitectura de combinación de expertos de billones de parámetros que su pRedecesor K2.6y accede a través de una API compatible con OpenAI, lo cual es importante para los equipos que ya ejecutan K2.6 en puertas de enlace de producción.
Cuando K2.6 se lanzó en abril, encabezó la clasificación semanal de LLM de OpenRouter: una clasificación basada en decisiones reales de enrutamiento de API por parte de los desarrolladores, no en puntuaciones de referencia autoinformadas.
Moonshot AI dice que K2.7-Code aborda lo que llama «pensar demasiado», reduciendo el uso de tokens de pensamiento en un 30 % en comparación con K2.6, una cifra que afectaría directamente los costos de inferencia para los equipos que ejecutan flujos de trabajo agentes. Si esa ganancia de eficiencia se mantiene en puntos de referencia independientes es una cuestión que los profesionales ya han comenzado a plantear públicamente.
Qué es el código Kimi K2.7
K2.7-Code se publica bajo una licencia MIT modificada, con pesos disponibles en HuggingFace. El modelo se puede implementar mediante vLLM o SGLang. Se ejecuta exclusivamente en modo de pensamiento y no admite el ajuste de temperatura: Moonshot AI lo ha fijado en 1.0, lo que significa que los equipos no pueden ajustar el determinismo de salida como lo harían con otros modelos.
El cambio principal con respecto a K2.6 es cómo el modelo genera código de bajo nivel. Mientras que K2.6 produjo implementaciones empaquetando bibliotecas existentes y enrutando a través de marcos establecidos, K2.7-Code crea implementaciones directamente. Moonshot AI dice que esto produce una generalización más confiable en Rust, Go y Python, y en todos los tipos de tareas, incluido el desarrollo frontend, DevOps y la optimización del rendimiento.
En cuanto al rendimiento de referencia, Moonshot AI afirma obtener ganancias del 21,8% en Kimi Code Bench v2, del 11% en Program Bench y del 31,5% en MLS Bench Lite. Los tres son puntos de referencia propios ejecutados por Moonshot AI. El modelo no se ha enviado a DeepSWE, un punto de referencia de codificación independiente que produce una distribución de 70 puntos entre modelos, en comparación con la distribución de 30 puntos de SWE-Bench Pro, lo que lo convierte en una señal más discriminatoria para los equipos que configuran sistemas de enrutamiento de modelos.
VB Transform · 14 y 15 de julio · Menlo Park · Infraestructura de inferencia e inteligencia artificial
GM obtuvo un aumento del 300% en relaciones públicas fusionadas mediante la reestructuración de los agentes. Esto es lo que construyeron.
El tema de infraestructura en Transform cubre la generación de video en tiempo real, pilas de razonamiento de máquina a máquina y lo que realmente se necesita para ejecutar agentes a escala empresarial.
Más honesto, más débil por ello.
La imagen desde fuera de los propios puntos de referencia de Moonshot es más complicada.
El investigador Elliot Arledge ejecutó K2.7-Code contra K2.6 y Claude Fable 5 en KernelBench-Hard, un punto de referencia público centrado en la optimización del kernel de GPU, y publicó sus registros de ejecución completos en kernelbench.com.
«K2.7 es más honesto pero no más capaz» Arledge escribió en X.
En cinco de seis problemas, K2.7-Code produjo núcleos Triton de autor real donde K2.6 había usado envoltorios de biblioteca. Dos de esos núcleos fallaron debido a errores propios del modelo. El resultado del kernel MoE retrocedió de la puntuación de K2.6 de 0,222 a 0,157.
«Fable, como referencia, encabeza todas las celdas que honestamente no falla», escribió Arledge.
Sugumaran Balasubramaniyan, un desarrollador que construyó un enrutador de tareas modelo para la plataforma Hermes Agent utilizando DeepSWE como señal de referencia, respondió públicamente al lanzamiento del código K2.7 y desafió a Moonshot AI directamente en las opciones de referencia.
«Respetuosamente, cada modelo ‘mejora’ dos dígitos en su propio conjunto de pruebas». Balasubramaniyan escribió en X.
Señaló que K2.6 obtuvo una puntuación del 24 % en DeepSWE, empatado con GPT-5.4-mini, y preguntó si Moonshot AI sometería a K2.7-Code al mismo punto de referencia.
Balasubramaniyan dijo que se necesitaron 13 rondas de revisión para obtener los datos de referencia correctos para su enrutador y que enrutaría las tareas de codificación a K2.7-Code si los números independientes se mantienen.
Qué significa esto para las empresas
La ganancia de eficiencia del token se puede utilizar de inmediato. Los equipos que ejecutan K2.6 en producción pueden intercambiar el código K2.7 a través de la API compatible con OpenAI y esperar costos de inferencia más bajos en flujos de trabajo agentes sin un cambio de arquitectura. La reducción del 30 % del token de pensamiento es la cifra propia de Moonshot, pero la ruta de integración es lo suficientemente riesgosa como para probarla con sus propias cargas de trabajo antes de comprometerse.
La pregunta práctica es si esas ganancias de eficiencia se mantienen en la distribución de tareas del propio equipo. Ejecutar K2.7-Code en sus propias cargas de trabajo antes de ajustar los pesos de la puerta de enlace es el camino de bajo riesgo para descubrirlo.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































