La mayoría de los marcos de orquestación se crearon para agentes que se ejecutan durante segundos o minutos. Ahora que los agentes son corriendo por horaDurante los últimos años (y en algunos casos, días), esos marcos están empezando a resquebrajarse.
Varios proveedores de modelos, como Anthropic con Claude Code y OpenAI con Codex, introdujeron soporte temprano para agentes de largo plazo a través de tareas multisesión, subagentes y ejecución en segundo plano. Sin embargo, estos sistemas a veces suponen que los agentes siguen operando dentro de flujos de trabajo de tiempo limitado, incluso cuando funcionan durante períodos prolongados.
El proveedor de modelos de código abierto Moonshot AI quiere ir más allá con su nuevo modelo, Kimi K2.6.
Moonshot dice que el modelo está diseñado para una ejecución continua, con casos de uso internos que incluyen agentes que corrieron durante horas y, en un caso, cinco días seguidos, manejando el monitoreo y la respuesta a incidentes de forma autónoma.
Pero este uso creciente de este tipo de agente está exponiendo una brecha crítica en la orquestación: la mayoría de los marcos de orquestación no fueron diseñados para este tipo de ejecución continua y con estado. Los modelos de código abierto, como Kimi K2.6, que dependen de enjambres de agentes, argumentan que su enfoque de orquestación se acerca a la gestión de agentes con estado.
Las dificultades de orquestar agentes de larga duración
Si bien es cierto que algunas empresas preferirían incorporar sus propios marcos de orquestación a su ecosistema de agentes, los proveedores de modelos y las plataformas de agentes reconocen que ofrecer gestión de agentes sigue siendo una ventaja competitiva.
Otros proveedores de modelos han comenzado a explorar agentes de larga duración, muchos de ellos mediante tareas de múltiples sesiones y ejecución en segundo plano. Por ejemplo, el Código Claude de Anthropic organiza agentes con un agente líder que dirige otros agentes basándose en un conjunto de definiciones instruidas por el usuario. Códice de OpenAI corre de manera similar.
Kimi K2.6 aborda la orquestación con una versión mejorada de su Agent Swarms, capaz de gestionar hasta 300 subagentes «ejecutando 4000 pasos coordinados simultáneamente». Moonshot AI escribió en una publicación de blog. En comparación con Claude Code y Codex, K2.6 se basa en el modelo, en lugar de roles predefinidos, para determinar la orquestación.
Kimi K2.6 ya está disponible en Hugging Face, a través de su API, Kimi Code y la aplicación Kimi.
Los profesionales que experimentan con agentes de largo plazo dicen que la fragilidad es más profunda de lo que las indicaciones pueden solucionar.
Como lo expresó un practicante, Maxim Saplin una publicación de blog«Eso no significa que los subagentes sean inútiles. Significa que la orquestación aún es frágil. En este momento, se siente más como un problema de producto y capacitación que como algo que se pueda resolver escribiendo un mensaje suficientemente severo».
El problema que plantean los agentes de larga duración es que es difícil mantener su estado, especialmente porque su entorno continúa cambiando mientras hacen su trabajo. El agente llamaría constantemente a diferentes herramientas y API o accedería a diferentes bases de datos durante su tiempo de ejecución. La mayoría de los agentes actuales, aquellos que pueden ejecutarse durante una o dos ejecuciones, llaman a diferentes herramientas, pero durante como máximo un minuto.
Mark Lambert, director de producto de ArmorCode, que construye una plataforma de seguridad autónoma para empresas, dijo a VentureBeat en un correo electrónico que la brecha de gobernanza ya está superando la implementación.
«Estos sistemas agentes ahora pueden generar códigos y cambios en el sistema más rápido de lo que la mayoría de las organizaciones pueden revisarlos, remediarlos o gobernarlos. Esto requerirá algo más que un simple escaneo adicional. Las organizaciones necesitarán una gobernanza de IA más fuerte que proporcione el contexto, la priorización y la responsabilidad que los equipos necesitan para gestionar Kimi y otros riesgos generados por la IA antes de que se conviertan en exposición acumulada», afirmó Lambert.
Los agentes de larga duración también podrían correr el riesgo de fracasar sin una reversión clara. Lo más importante es que este tipo de agentes a menudo carecen de un conjunto de tareas bien definidas y ajustan dinámicamente sus planes a medida que se ejecutan.
Kunal Anand, director de producto de F5, dijo a VentureBeat en un correo electrónico que los agentes de largo plazo representan un cambio arquitectónico mucho mayor del que la mayoría de las empresas estaban preparadas.
«Pasamos de scripts a servicios, a contenedores, a funciones, y ahora a agentes como infraestructura persistente. Eso crea categorías para las que aún no tenemos buenos nombres: tiempo de ejecución del agente, puerta de enlace del agente, proveedor de identidad del agente, malla del agente. El patrón de puerta de enlace API se está transformando en algo que tiene que comprender objetivos y flujos de trabajo, no sólo puntos finales y verbos», dijo Anand.
Corriendo durante 13 horas e incluso cinco días.
Comprender cómo orquestar agentes se vuelve importante porque las capacidades del modelo han comenzado a superar las innovaciones en orquestación, incluso cuando las empresas comienzan a mirar agentes con horizontes a largo plazo.
Moonshot AI dice que el modelo está diseñado para tareas que reflejan «desafíos del mundo real que normalmente exigen semanas o meses de esfuerzo humano colectivo». En un documento técnico separado proporcionado a VentureBeat, Moonshot afirma que K2.6 construyó un compilador SysY completo desde cero en 10 horas (trabajo que caracterizó como equivalente a un equipo de cuatro ingenieros durante dos meses) y pasó las 140 pruebas funcionales sin intervención humana.
El equipo implementó K2.6 para tareas de ingeniería complejas, incluida la revisión de un motor de comparación financiera de código abierto de ocho años de antigüedad. Los ingenieros de Moonshot describieron una ejecución de 13 horas que «repitió a través de 12 estrategias de optimización, iniciando más de 1000 llamadas a herramientas para modificar más de 4000 líneas de código con precisión».
Moonshot dijo que uno de sus equipos utilizó K2.6 para crear un agente que se ejecutara de forma autónoma durante cinco días. Ese agente gestionó el seguimiento, la respuesta a incidentes y las operaciones del sistema.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































