A medida que los agentes de IA empresarial asumen tareas cada vez más complejas y de largo plazo, su desempeño a menudo se ve restringido por su arnés, el andamiaje de software que conecta el LLM principal con su entorno.
Actualmente, los arneses son en gran medida estáticos y artesanales. Mejorarlos es en gran medida manual y no mejoran automáticamente en función de los datos de ejecución que recopilan de su entorno.
Para abordar este cuello de botella de ingeniería, los investigadores de Xiaomi presentaron ArnésXun marco que trata el arnés de IA como un objeto componible y aplica mejoras de forma autónoma a su código.
En aplicaciones empresariales del mundo real, esta adaptación automatizada permite que los sistemas de IA se ajusten dinámicamente a los requisitos específicos de la aplicación. Las pruebas prácticas demostraron que HarnessX ofrece mejoras sustanciales de rendimiento en dominios como la ingeniería de software y la interacción web.
Los resultados demuestran que ampliar el modelo básico no es el único camino hacia una IA más capaz y, para modelos más pequeños, puede que ni siquiera sea el mejor. La evolución del arnés de HarnessX produjo una ganancia de rendimiento promedio de +14,5 % en 15 combinaciones de modelo y referencia; Para el Qwen3.5-9B de peso abierto, las ganancias alcanzaron el +44% en tareas de planificación incorporadas.
Los desafíos de la ingeniería de arneses
En las aplicaciones de IA, la capacidad de un modelo básico depende en gran medida de su arnés circundante. El arnés actúa como la capa operativa que convierte los resultados del modelo sin procesar en comportamientos de agentes estructurados y ejecutables. Comprende las indicaciones, las integraciones de herramientas externas, la gestión de la memoria y los flujos de control que dictan cómo un sistema de IA observa su entorno, razona un problema y toma medidas.
A medida que los agentes empresariales asumen flujos de trabajo más complejos y de largo plazo, la ingeniería de aprovechamiento se ha convertido en una parte fundamental del desarrollo de la IA. A pesar de su importancia, el desarrollo de arneses aún está lejos de ser una disciplina de ingeniería madura y presenta tres desafíos clave.
En primer lugar, los arneses son estáticos y están diseñados a mano. Cualquier cambio en el modelo básico subyacente, la introducción de nuevas herramientas o un giro hacia un dominio operativo diferente requiere reescrituras de código manuales y personalizadas. Los arneses tradicionales carecen de mecanismos para aprender y mejorar de forma autónoma a partir de experiencias de ejecución pasadas.
En segundo lugar, la mayoría de los arneses existentes sufren de enredos arquitectónicos. Combinan estrechamente plantillas de avisos, envoltorios de herramientas, políticas de reintento y administración de memoria dentro de las mismas rutas de código. Este enredo significa que modificar un componente puede dañar silenciosamente otros. Intentar reutilizar un arnés en diferentes dominios empresariales a menudo implica copiar código sin formato en lugar de una composición limpia y modular.
En tercer lugar, el modelo de arnés y base se optimiza de forma aislada. Cuando los ingenieros realizan pruebas para mejorar el arnés, los seguimientos de ejecución generados generalmente se descartan en lugar de usarse como datos de entrenamiento para mejorar el modelo. En consecuencia, las actualizaciones de modelos no conducen naturalmente a mejoras en el aprovechamiento, lo que crea un cuello de botella donde los equipos no logran capturar el valor total de los datos operativos de sus agentes.
HarnessX: una fundición autónoma para agentes de IA
HarnessX resuelve los obstáculos de ingeniería del desarrollo de arneses manuales con lo que los investigadores llaman una «fundición de arneses unificada».
La principal innovación de HarnessX es tratar el arnés como un «objeto de primera clase». En términos de ingeniería de software, esto significa que el arnés es una entidad serializable, modular y sustituible de forma independiente. Al separar la configuración del modelo (es decir, qué modelo de IA está funcionando) de la configuración del arnés, los ingenieros pueden intercambiar, adaptar y evolucionar el andamiaje sin tocar el modelo subyacente.
HarnessX divide el comportamiento de los agentes en diferentes componentes, como ensamblaje de contexto, gestión de memoria, ecosistemas de herramientas, flujo de control y observabilidad. Cada comportamiento específico se implementa como un «procesador» que se conecta a ganchos precisos del ciclo de vida del arnés. Esta estructura modular permite que el sistema intercambie, agregue o elimine estos procesadores sin romper la tubería circundante.
Para automatizar la optimización de esta estructura modular, HarnessX presenta AEGIS, un motor de evolución basado en trazas. Los marcos AEGIS aprovechan la adaptación como un problema de aprendizaje por refuerzo (RL) sobre los diferentes componentes simbólicos del arnés.
Enmarcar la optimización del arnés como un problema de aprendizaje por refuerzo introduce tres patologías contra las que los investigadores tuvieron que diseñar explícitamente:
-
Hackeo de recompensas: El sistema podría explotar atajos hacia la solución en lugar de resolver genuinamente la tarea.
-
Olvido catastrófico: Una edición que solucione un patrón de error en un dominio podría interrumpir silenciosamente un flujo de trabajo previamente resuelto en otro.
-
Subexploración: El sistema podría iterar sobre ajustes menores en lugar de explorar configuraciones de herramientas nuevas y estructuralmente superiores.

Para evitar estos problemas, AEGIS se basa en la observabilidad total del seguimiento y en un proceso de cuatro etapas:
-
Digeridor: Comprime los seguimientos de ejecución en resúmenes estructurados para identificar dónde falló el agente.
-
Planificador: Analiza estos resúmenes para permitir que el sistema explore cambios estructurales en lugar de solo ajustes locales.
-
Evolver: Genera ediciones y pruebas de arnés a nivel de código para garantizar que se ejecuten correctamente antes de la implementación.
-
Crítico y puerta: Un crítico evalúa las ediciones para detectar piratería de recompensas, mientras que una puerta determinista rechaza cualquier actualización que retroceda una tarea previamente resuelta para evitar un olvido catastrófico.
HarnessX ingresa a un campo creciente de investigación de arneses de mejora personal – pero lo que lo separa es la coevolución del modelo de arnés.
Los investigadores destacan que la optimización de cualquiera de los componentes de forma aislada eventualmente choca contra un muro. La evolución de sólo el arnés toca un techo de andamiaje si el modelo subyacente carece de la capacidad de razonamiento para utilizar las nuevas herramientas. Entrenar solo al modelo alcanza un límite máximo de señales de entrenamiento si el arnés nunca le indica al modelo que use sus capacidades avanzadas.
HarnessX entrelaza la evolución del arnés con el entrenamiento de modelos. Los seguimientos de ejecución generados mientras el arnés intenta adaptarse a las tareas se convierten en señales de aprendizaje por refuerzo para el modelo básico. Cada vez que el arnés mejora su estrategia, el modelo aprende simultáneamente a explotar mejor esa nueva estrategia, rompiendo los límites de capacidad del desarrollo tradicional de agentes de IA.
HarnessX hace posible esta coevolución a través de GRPO (optimización de políticas relativas de grupo) entre ejes. GRPO es el algoritmo RL popular Se utiliza para entrenar modelos de razonamiento como DeepSeek-R1.
Al ajustar el modelo, el GRPO cruzado agrupa las trayectorias de ejecución de un agente para la misma tarea en versiones completamente diferentes de los arneses de la aplicación. Esto permite que el modelo subyacente internalice cambios de estrategia de alto nivel, como usar un nuevo punto final API o administrar un presupuesto de ejecución, en lugar de simplemente aprender variaciones menores de redacción.
HarnessX en acción sobre los puntos de referencia de la industria
Para validar la utilidad práctica de HarnessX, los investigadores lo probaron en cinco puntos de referencia que comprenden ingeniería de software, diálogo de servicio al cliente de múltiples turnos, navegación web, razonamiento abierto de múltiples pasos y planificación incorporada.
Separaron la IA en dos roles. El «metaagente», impulsado por Claude Opus 4.6, analizó los registros y escribió el código para desarrollar los arneses. Los “agentes de tareas” ejecutaron los flujos de trabajo reales. Para demostrar que el marco es independiente del modelo, lo probaron en tres modelos de trabajadores diferentes: Claude Sonnet 4.6, GPT-5.4 y el Qwen3.5-9B de peso abierto.
HarnessX se comparó con dos líneas de base principales. El primero fue un arnés estático, que representa cómo la mayoría de las empresas implementan la IA en la actualidad, utilizando configuraciones congeladas hechas a mano con indicaciones y herramientas específicas de referencia. El segundo fue el Código Claude SDK, una línea de base que representa un evolucionador de un solo agente para probar si el complejo proceso de cuatro etapas de AEGIS tuvo un rendimiento superior al solicitar a un modelo de lenguaje único que iterara el código.
La evolución dinámica del arnés produce ganancias significativas en el mismo modelo base. HarnessX mejoró el rendimiento en 14 de 15 combinaciones de modelo y referencia. En todas las pruebas, la evolución del arnés arrojó una ganancia de rendimiento absoluta promedio de +14,5%.
Los modelos más débiles fueron los que más se beneficiaron de la mejora del arnés dinámico. El Qwen3.5-9B de peso abierto experimentó un aumento de rendimiento del +44,0 % en el punto de referencia de planificación incorporada ALFWorld y un aumento del +18,2 % en SWE-bench Verified para ingeniería de software.
La coevolución también resultó muy eficaz. Cuando los investigadores entrenaron el modelo básico utilizando los datos generados mientras evolucionaban el arnés, observaron un aumento promedio adicional del rendimiento del 4,7 %. Mejorar el arnés y el modelo simultáneamente produce el techo más alto. La ganancia de coevolución se aplica sólo a los modelos de peso abierto.
La evidencia anecdótica de los experimentos muestra cómo HarnessX resuelve problemas perniciosos al crear arneses de agentes para tareas del mundo real. Por ejemplo, en el punto de referencia de razonamiento de varios pasos de GAIA, el agente de tareas fallaba constantemente porque la herramienta de navegador sin cabeza que utilizó para extraer Wikipedia expiró en la interfaz del sitio con mucho JavaScript. HarnessX analizó los rastros de ejecución, diagnosticó el error y escribió una nueva herramienta que omitió el navegador por completo y consultó la API de MediaWiki directamente en busca de texto sin formato. Cambió esta herramienta al arnés y desbloqueó instantáneamente las tareas fallidas.
Durante las pruebas de comercio electrónico de WebShop, el agente de IA a menudo se quedaba atascado en bucles de paginación, haciendo clic sin cesar en «página siguiente» y reformulando búsquedas sin siquiera comprometerse a comprar un producto. En lugar de simplemente modificar el mensaje, HarnessX creó un procesador de asesoramiento que detectaba cuando el agente estaba repitiendo acciones de navegación. Inyectó una advertencia en el contexto para forzar una decisión, solucionando el comportamiento de bucle y aumentando el rendimiento.
Límites de la ingeniería de arneses automatizada
Una advertencia importante es que el sistema actualmente se basa en modelos potentes que actúan como metaagente que reescribe el código de arnés. En sus experimentos, los investigadores se basaron en modelos de frontera cerrada como Claude Opus. Los modelos de peso abierto están mejorando rápidamente, pero su capacidad para servir como metaagente aún no se ha probado.
Otra limitación que vale la pena considerar son las capacidades intrínsecas de los modelos utilizados. Si el modelo de tarea subyacente es fundamentalmente demasiado débil para ejecutar los complejos flujos de trabajo que propone el nuevo arnés, HarnessX no podrá mejorar las capacidades generales del agente (los investigadores observaron esto con el modelo Qwen3.5-9B en las pruebas de codificación del banco SWE).
A pesar de estas limitaciones, HarnessX presenta un caso concreto de que aprovechar la ingeniería (no sólo el escalamiento de modelos) es una palanca que los profesionales pueden utilizar ahora. Para los equipos que ejecutan modelos más pequeños y abiertos en flujos de trabajo complejos, las ganancias aquí son lo suficientemente grandes como para justificar la evaluación de la evolución del arnés como un primer paso antes de buscar un modelo de frontera más costoso. Los investigadores planean publicar el código en una actualización futura.
A medida que los agentes de IA empresarial asumen tareas cada vez más complejas y de largo plazo, su desempeño a menudo se ve restringido por su arnés, el andamiaje de software que conecta el LLM principal con su entorno.
Actualmente, los arneses son en gran medida estáticos y artesanales. Mejorarlos es en gran medida manual y no mejoran automáticamente en función de los datos de ejecución que recopilan de su entorno.
Para abordar este cuello de botella de ingeniería, los investigadores de Xiaomi presentaron ArnésXun marco que trata el arnés de IA como un objeto componible y aplica mejoras de forma autónoma a su código.
En aplicaciones empresariales del mundo real, esta adaptación automatizada permite que los sistemas de IA se ajusten dinámicamente a los requisitos específicos de la aplicación. Las pruebas prácticas demostraron que HarnessX ofrece mejoras sustanciales de rendimiento en dominios como la ingeniería de software y la interacción web.
Los resultados demuestran que ampliar el modelo básico no es el único camino hacia una IA más capaz y, para modelos más pequeños, puede que ni siquiera sea el mejor. La evolución del arnés de HarnessX produjo una ganancia de rendimiento promedio de +14,5 % en 15 combinaciones de modelo y referencia; Para el Qwen3.5-9B de peso abierto, las ganancias alcanzaron el +44% en tareas de planificación incorporadas.
Los desafíos de la ingeniería de arneses
En las aplicaciones de IA, la capacidad de un modelo básico depende en gran medida de su arnés circundante. El arnés actúa como la capa operativa que convierte los resultados del modelo sin procesar en comportamientos de agentes estructurados y ejecutables. Comprende las indicaciones, las integraciones de herramientas externas, la gestión de la memoria y los flujos de control que dictan cómo un sistema de IA observa su entorno, razona un problema y toma medidas.
A medida que los agentes empresariales asumen flujos de trabajo más complejos y de largo plazo, la ingeniería de aprovechamiento se ha convertido en una parte fundamental del desarrollo de la IA. A pesar de su importancia, el desarrollo de arneses aún está lejos de ser una disciplina de ingeniería madura y presenta tres desafíos clave.
En primer lugar, los arneses son estáticos y están diseñados a mano. Cualquier cambio en el modelo básico subyacente, la introducción de nuevas herramientas o un giro hacia un dominio operativo diferente requiere reescrituras de código manuales y personalizadas. Los arneses tradicionales carecen de mecanismos para aprender y mejorar de forma autónoma a partir de experiencias de ejecución pasadas.
En segundo lugar, la mayoría de los arneses existentes sufren de enredos arquitectónicos. Combinan estrechamente plantillas de avisos, envoltorios de herramientas, políticas de reintento y administración de memoria dentro de las mismas rutas de código. Este enredo significa que modificar un componente puede dañar silenciosamente otros. Intentar reutilizar un arnés en diferentes dominios empresariales a menudo implica copiar código sin formato en lugar de una composición limpia y modular.
En tercer lugar, el modelo de arnés y base se optimiza de forma aislada. Cuando los ingenieros realizan pruebas para mejorar el arnés, los seguimientos de ejecución generados generalmente se descartan en lugar de usarse como datos de entrenamiento para mejorar el modelo. En consecuencia, las actualizaciones de modelos no conducen naturalmente a mejoras en el aprovechamiento, lo que crea un cuello de botella donde los equipos no logran capturar el valor total de los datos operativos de sus agentes.
HarnessX: una fundición autónoma para agentes de IA
HarnessX resuelve los obstáculos de ingeniería del desarrollo de arneses manuales con lo que los investigadores llaman una «fundición de arneses unificada».
La principal innovación de HarnessX es tratar el arnés como un «objeto de primera clase». En términos de ingeniería de software, esto significa que el arnés es una entidad serializable, modular y sustituible de forma independiente. Al separar la configuración del modelo (es decir, qué modelo de IA está funcionando) de la configuración del arnés, los ingenieros pueden intercambiar, adaptar y evolucionar el andamiaje sin tocar el modelo subyacente.
HarnessX divide el comportamiento de los agentes en diferentes componentes, como ensamblaje de contexto, gestión de memoria, ecosistemas de herramientas, flujo de control y observabilidad. Cada comportamiento específico se implementa como un «procesador» que se conecta a ganchos precisos del ciclo de vida del arnés. Esta estructura modular permite que el sistema intercambie, agregue o elimine estos procesadores sin romper la tubería circundante.
Para automatizar la optimización de esta estructura modular, HarnessX presenta AEGIS, un motor de evolución basado en trazas. Los marcos AEGIS aprovechan la adaptación como un problema de aprendizaje por refuerzo (RL) sobre los diferentes componentes simbólicos del arnés.
Enmarcar la optimización del arnés como un problema de aprendizaje por refuerzo introduce tres patologías contra las que los investigadores tuvieron que diseñar explícitamente:
-
Hackeo de recompensas: El sistema podría explotar atajos hacia la solución en lugar de resolver genuinamente la tarea.
-
Olvido catastrófico: Una edición que solucione un patrón de error en un dominio podría interrumpir silenciosamente un flujo de trabajo previamente resuelto en otro.
-
Subexploración: El sistema podría iterar sobre ajustes menores en lugar de explorar configuraciones de herramientas nuevas y estructuralmente superiores.

Para evitar estos problemas, AEGIS se basa en la observabilidad total del seguimiento y en un proceso de cuatro etapas:
-
Digeridor: Comprime los seguimientos de ejecución en resúmenes estructurados para identificar dónde falló el agente.
-
Planificador: Analiza estos resúmenes para permitir que el sistema explore cambios estructurales en lugar de solo ajustes locales.
-
Evolver: Genera ediciones y pruebas de arnés a nivel de código para garantizar que se ejecuten correctamente antes de la implementación.
-
Crítico y puerta: Un crítico evalúa las ediciones para detectar piratería de recompensas, mientras que una puerta determinista rechaza cualquier actualización que retroceda una tarea previamente resuelta para evitar un olvido catastrófico.
HarnessX ingresa a un campo creciente de investigación de arneses de mejora personal – pero lo que lo separa es la coevolución del modelo de arnés.
Los investigadores destacan que la optimización de cualquiera de los componentes de forma aislada eventualmente choca contra un muro. La evolución de sólo el arnés toca un techo de andamiaje si el modelo subyacente carece de la capacidad de razonamiento para utilizar las nuevas herramientas. Entrenar solo al modelo alcanza un límite máximo de señales de entrenamiento si el arnés nunca le indica al modelo que use sus capacidades avanzadas.
HarnessX entrelaza la evolución del arnés con el entrenamiento de modelos. Los seguimientos de ejecución generados mientras el arnés intenta adaptarse a las tareas se convierten en señales de aprendizaje por refuerzo para el modelo básico. Cada vez que el arnés mejora su estrategia, el modelo aprende simultáneamente a explotar mejor esa nueva estrategia, rompiendo los límites de capacidad del desarrollo tradicional de agentes de IA.
HarnessX hace posible esta coevolución a través de GRPO (optimización de políticas relativas de grupo) entre ejes. GRPO es el algoritmo RL popular Se utiliza para entrenar modelos de razonamiento como DeepSeek-R1.
Al ajustar el modelo, el GRPO cruzado agrupa las trayectorias de ejecución de un agente para la misma tarea en versiones completamente diferentes de los arneses de la aplicación. Esto permite que el modelo subyacente internalice cambios de estrategia de alto nivel, como usar un nuevo punto final API o administrar un presupuesto de ejecución, en lugar de simplemente aprender variaciones menores de redacción.
HarnessX en acción sobre los puntos de referencia de la industria
Para validar la utilidad práctica de HarnessX, los investigadores lo probaron en cinco puntos de referencia que comprenden ingeniería de software, diálogo de servicio al cliente de múltiples turnos, navegación web, razonamiento abierto de múltiples pasos y planificación incorporada.
Separaron la IA en dos roles. El «metaagente», impulsado por Claude Opus 4.6, analizó los registros y escribió el código para desarrollar los arneses. Los “agentes de tareas” ejecutaron los flujos de trabajo reales. Para demostrar que el marco es independiente del modelo, lo probaron en tres modelos de trabajadores diferentes: Claude Sonnet 4.6, GPT-5.4 y el Qwen3.5-9B de peso abierto.
HarnessX se comparó con dos líneas de base principales. El primero fue un arnés estático, que representa cómo la mayoría de las empresas implementan la IA en la actualidad, utilizando configuraciones congeladas hechas a mano con indicaciones y herramientas específicas de referencia. El segundo fue el Código Claude SDK, una línea de base que representa un evolucionador de un solo agente para probar si el complejo proceso de cuatro etapas de AEGIS tuvo un rendimiento superior al solicitar a un modelo de lenguaje único que iterara el código.
La evolución dinámica del arnés produce ganancias significativas en el mismo modelo base. HarnessX mejoró el rendimiento en 14 de 15 combinaciones de modelo y referencia. En todas las pruebas, la evolución del arnés arrojó una ganancia de rendimiento absoluta promedio de +14,5%.
Los modelos más débiles fueron los que más se beneficiaron de la mejora del arnés dinámico. El Qwen3.5-9B de peso abierto experimentó un aumento de rendimiento del +44,0 % en el punto de referencia de planificación incorporada ALFWorld y un aumento del +18,2 % en SWE-bench Verified para ingeniería de software.
La coevolución también resultó muy eficaz. Cuando los investigadores entrenaron el modelo básico utilizando los datos generados mientras evolucionaban el arnés, observaron un aumento promedio adicional del rendimiento del 4,7 %. Mejorar el arnés y el modelo simultáneamente produce el techo más alto. La ganancia de coevolución se aplica sólo a los modelos de peso abierto.
La evidencia anecdótica de los experimentos muestra cómo HarnessX resuelve problemas perniciosos al crear arneses de agentes para tareas del mundo real. Por ejemplo, en el punto de referencia de razonamiento de varios pasos de GAIA, el agente de tareas fallaba constantemente porque la herramienta de navegador sin cabeza que utilizó para extraer Wikipedia expiró en la interfaz del sitio con mucho JavaScript. HarnessX analizó los rastros de ejecución, diagnosticó el error y escribió una nueva herramienta que omitió el navegador por completo y consultó la API de MediaWiki directamente en busca de texto sin formato. Cambió esta herramienta al arnés y desbloqueó instantáneamente las tareas fallidas.
Durante las pruebas de comercio electrónico de WebShop, el agente de IA a menudo se quedaba atascado en bucles de paginación, haciendo clic sin cesar en «página siguiente» y reformulando búsquedas sin siquiera comprometerse a comprar un producto. En lugar de simplemente modificar el mensaje, HarnessX creó un procesador de asesoramiento que detectaba cuando el agente estaba repitiendo acciones de navegación. Inyectó una advertencia en el contexto para forzar una decisión, solucionando el comportamiento de bucle y aumentando el rendimiento.
Límites de la ingeniería de arneses automatizada
Una advertencia importante es que el sistema actualmente se basa en modelos potentes que actúan como metaagente que reescribe el código de arnés. En sus experimentos, los investigadores se basaron en modelos de frontera cerrada como Claude Opus. Los modelos de peso abierto están mejorando rápidamente, pero su capacidad para servir como metaagente aún no se ha probado.
Otra limitación que vale la pena considerar son las capacidades intrínsecas de los modelos utilizados. Si el modelo de tarea subyacente es fundamentalmente demasiado débil para ejecutar los complejos flujos de trabajo que propone el nuevo arnés, HarnessX no podrá mejorar las capacidades generales del agente (los investigadores observaron esto con el modelo Qwen3.5-9B en las pruebas de codificación del banco SWE).
A pesar de estas limitaciones, HarnessX presenta un caso concreto de que aprovechar la ingeniería (no sólo el escalamiento de modelos) es una palanca que los profesionales pueden utilizar ahora. Para los equipos que ejecutan modelos más pequeños y abiertos en flujos de trabajo complejos, las ganancias aquí son lo suficientemente grandes como para justificar la evaluación de la evolución del arnés como un primer paso antes de buscar un modelo de frontera más costoso. Los investigadores planean publicar el código en una actualización futura.
A medida que los agentes de IA empresarial asumen tareas cada vez más complejas y de largo plazo, su desempeño a menudo se ve restringido por su arnés, el andamiaje de software que conecta el LLM principal con su entorno.
Actualmente, los arneses son en gran medida estáticos y artesanales. Mejorarlos es en gran medida manual y no mejoran automáticamente en función de los datos de ejecución que recopilan de su entorno.
Para abordar este cuello de botella de ingeniería, los investigadores de Xiaomi presentaron ArnésXun marco que trata el arnés de IA como un objeto componible y aplica mejoras de forma autónoma a su código.
En aplicaciones empresariales del mundo real, esta adaptación automatizada permite que los sistemas de IA se ajusten dinámicamente a los requisitos específicos de la aplicación. Las pruebas prácticas demostraron que HarnessX ofrece mejoras sustanciales de rendimiento en dominios como la ingeniería de software y la interacción web.
Los resultados demuestran que ampliar el modelo básico no es el único camino hacia una IA más capaz y, para modelos más pequeños, puede que ni siquiera sea el mejor. La evolución del arnés de HarnessX produjo una ganancia de rendimiento promedio de +14,5 % en 15 combinaciones de modelo y referencia; Para el Qwen3.5-9B de peso abierto, las ganancias alcanzaron el +44% en tareas de planificación incorporadas.
Los desafíos de la ingeniería de arneses
En las aplicaciones de IA, la capacidad de un modelo básico depende en gran medida de su arnés circundante. El arnés actúa como la capa operativa que convierte los resultados del modelo sin procesar en comportamientos de agentes estructurados y ejecutables. Comprende las indicaciones, las integraciones de herramientas externas, la gestión de la memoria y los flujos de control que dictan cómo un sistema de IA observa su entorno, razona un problema y toma medidas.
A medida que los agentes empresariales asumen flujos de trabajo más complejos y de largo plazo, la ingeniería de aprovechamiento se ha convertido en una parte fundamental del desarrollo de la IA. A pesar de su importancia, el desarrollo de arneses aún está lejos de ser una disciplina de ingeniería madura y presenta tres desafíos clave.
En primer lugar, los arneses son estáticos y están diseñados a mano. Cualquier cambio en el modelo básico subyacente, la introducción de nuevas herramientas o un giro hacia un dominio operativo diferente requiere reescrituras de código manuales y personalizadas. Los arneses tradicionales carecen de mecanismos para aprender y mejorar de forma autónoma a partir de experiencias de ejecución pasadas.
En segundo lugar, la mayoría de los arneses existentes sufren de enredos arquitectónicos. Combinan estrechamente plantillas de avisos, envoltorios de herramientas, políticas de reintento y administración de memoria dentro de las mismas rutas de código. Este enredo significa que modificar un componente puede dañar silenciosamente otros. Intentar reutilizar un arnés en diferentes dominios empresariales a menudo implica copiar código sin formato en lugar de una composición limpia y modular.
En tercer lugar, el modelo de arnés y base se optimiza de forma aislada. Cuando los ingenieros realizan pruebas para mejorar el arnés, los seguimientos de ejecución generados generalmente se descartan en lugar de usarse como datos de entrenamiento para mejorar el modelo. En consecuencia, las actualizaciones de modelos no conducen naturalmente a mejoras en el aprovechamiento, lo que crea un cuello de botella donde los equipos no logran capturar el valor total de los datos operativos de sus agentes.
HarnessX: una fundición autónoma para agentes de IA
HarnessX resuelve los obstáculos de ingeniería del desarrollo de arneses manuales con lo que los investigadores llaman una «fundición de arneses unificada».
La principal innovación de HarnessX es tratar el arnés como un «objeto de primera clase». En términos de ingeniería de software, esto significa que el arnés es una entidad serializable, modular y sustituible de forma independiente. Al separar la configuración del modelo (es decir, qué modelo de IA está funcionando) de la configuración del arnés, los ingenieros pueden intercambiar, adaptar y evolucionar el andamiaje sin tocar el modelo subyacente.
HarnessX divide el comportamiento de los agentes en diferentes componentes, como ensamblaje de contexto, gestión de memoria, ecosistemas de herramientas, flujo de control y observabilidad. Cada comportamiento específico se implementa como un «procesador» que se conecta a ganchos precisos del ciclo de vida del arnés. Esta estructura modular permite que el sistema intercambie, agregue o elimine estos procesadores sin romper la tubería circundante.
Para automatizar la optimización de esta estructura modular, HarnessX presenta AEGIS, un motor de evolución basado en trazas. Los marcos AEGIS aprovechan la adaptación como un problema de aprendizaje por refuerzo (RL) sobre los diferentes componentes simbólicos del arnés.
Enmarcar la optimización del arnés como un problema de aprendizaje por refuerzo introduce tres patologías contra las que los investigadores tuvieron que diseñar explícitamente:
-
Hackeo de recompensas: El sistema podría explotar atajos hacia la solución en lugar de resolver genuinamente la tarea.
-
Olvido catastrófico: Una edición que solucione un patrón de error en un dominio podría interrumpir silenciosamente un flujo de trabajo previamente resuelto en otro.
-
Subexploración: El sistema podría iterar sobre ajustes menores en lugar de explorar configuraciones de herramientas nuevas y estructuralmente superiores.

Para evitar estos problemas, AEGIS se basa en la observabilidad total del seguimiento y en un proceso de cuatro etapas:
-
Digeridor: Comprime los seguimientos de ejecución en resúmenes estructurados para identificar dónde falló el agente.
-
Planificador: Analiza estos resúmenes para permitir que el sistema explore cambios estructurales en lugar de solo ajustes locales.
-
Evolver: Genera ediciones y pruebas de arnés a nivel de código para garantizar que se ejecuten correctamente antes de la implementación.
-
Crítico y puerta: Un crítico evalúa las ediciones para detectar piratería de recompensas, mientras que una puerta determinista rechaza cualquier actualización que retroceda una tarea previamente resuelta para evitar un olvido catastrófico.
HarnessX ingresa a un campo creciente de investigación de arneses de mejora personal – pero lo que lo separa es la coevolución del modelo de arnés.
Los investigadores destacan que la optimización de cualquiera de los componentes de forma aislada eventualmente choca contra un muro. La evolución de sólo el arnés toca un techo de andamiaje si el modelo subyacente carece de la capacidad de razonamiento para utilizar las nuevas herramientas. Entrenar solo al modelo alcanza un límite máximo de señales de entrenamiento si el arnés nunca le indica al modelo que use sus capacidades avanzadas.
HarnessX entrelaza la evolución del arnés con el entrenamiento de modelos. Los seguimientos de ejecución generados mientras el arnés intenta adaptarse a las tareas se convierten en señales de aprendizaje por refuerzo para el modelo básico. Cada vez que el arnés mejora su estrategia, el modelo aprende simultáneamente a explotar mejor esa nueva estrategia, rompiendo los límites de capacidad del desarrollo tradicional de agentes de IA.
HarnessX hace posible esta coevolución a través de GRPO (optimización de políticas relativas de grupo) entre ejes. GRPO es el algoritmo RL popular Se utiliza para entrenar modelos de razonamiento como DeepSeek-R1.
Al ajustar el modelo, el GRPO cruzado agrupa las trayectorias de ejecución de un agente para la misma tarea en versiones completamente diferentes de los arneses de la aplicación. Esto permite que el modelo subyacente internalice cambios de estrategia de alto nivel, como usar un nuevo punto final API o administrar un presupuesto de ejecución, en lugar de simplemente aprender variaciones menores de redacción.
HarnessX en acción sobre los puntos de referencia de la industria
Para validar la utilidad práctica de HarnessX, los investigadores lo probaron en cinco puntos de referencia que comprenden ingeniería de software, diálogo de servicio al cliente de múltiples turnos, navegación web, razonamiento abierto de múltiples pasos y planificación incorporada.
Separaron la IA en dos roles. El «metaagente», impulsado por Claude Opus 4.6, analizó los registros y escribió el código para desarrollar los arneses. Los “agentes de tareas” ejecutaron los flujos de trabajo reales. Para demostrar que el marco es independiente del modelo, lo probaron en tres modelos de trabajadores diferentes: Claude Sonnet 4.6, GPT-5.4 y el Qwen3.5-9B de peso abierto.
HarnessX se comparó con dos líneas de base principales. El primero fue un arnés estático, que representa cómo la mayoría de las empresas implementan la IA en la actualidad, utilizando configuraciones congeladas hechas a mano con indicaciones y herramientas específicas de referencia. El segundo fue el Código Claude SDK, una línea de base que representa un evolucionador de un solo agente para probar si el complejo proceso de cuatro etapas de AEGIS tuvo un rendimiento superior al solicitar a un modelo de lenguaje único que iterara el código.
La evolución dinámica del arnés produce ganancias significativas en el mismo modelo base. HarnessX mejoró el rendimiento en 14 de 15 combinaciones de modelo y referencia. En todas las pruebas, la evolución del arnés arrojó una ganancia de rendimiento absoluta promedio de +14,5%.
Los modelos más débiles fueron los que más se beneficiaron de la mejora del arnés dinámico. El Qwen3.5-9B de peso abierto experimentó un aumento de rendimiento del +44,0 % en el punto de referencia de planificación incorporada ALFWorld y un aumento del +18,2 % en SWE-bench Verified para ingeniería de software.
La coevolución también resultó muy eficaz. Cuando los investigadores entrenaron el modelo básico utilizando los datos generados mientras evolucionaban el arnés, observaron un aumento promedio adicional del rendimiento del 4,7 %. Mejorar el arnés y el modelo simultáneamente produce el techo más alto. La ganancia de coevolución se aplica sólo a los modelos de peso abierto.
La evidencia anecdótica de los experimentos muestra cómo HarnessX resuelve problemas perniciosos al crear arneses de agentes para tareas del mundo real. Por ejemplo, en el punto de referencia de razonamiento de varios pasos de GAIA, el agente de tareas fallaba constantemente porque la herramienta de navegador sin cabeza que utilizó para extraer Wikipedia expiró en la interfaz del sitio con mucho JavaScript. HarnessX analizó los rastros de ejecución, diagnosticó el error y escribió una nueva herramienta que omitió el navegador por completo y consultó la API de MediaWiki directamente en busca de texto sin formato. Cambió esta herramienta al arnés y desbloqueó instantáneamente las tareas fallidas.
Durante las pruebas de comercio electrónico de WebShop, el agente de IA a menudo se quedaba atascado en bucles de paginación, haciendo clic sin cesar en «página siguiente» y reformulando búsquedas sin siquiera comprometerse a comprar un producto. En lugar de simplemente modificar el mensaje, HarnessX creó un procesador de asesoramiento que detectaba cuando el agente estaba repitiendo acciones de navegación. Inyectó una advertencia en el contexto para forzar una decisión, solucionando el comportamiento de bucle y aumentando el rendimiento.
Límites de la ingeniería de arneses automatizada
Una advertencia importante es que el sistema actualmente se basa en modelos potentes que actúan como metaagente que reescribe el código de arnés. En sus experimentos, los investigadores se basaron en modelos de frontera cerrada como Claude Opus. Los modelos de peso abierto están mejorando rápidamente, pero su capacidad para servir como metaagente aún no se ha probado.
Otra limitación que vale la pena considerar son las capacidades intrínsecas de los modelos utilizados. Si el modelo de tarea subyacente es fundamentalmente demasiado débil para ejecutar los complejos flujos de trabajo que propone el nuevo arnés, HarnessX no podrá mejorar las capacidades generales del agente (los investigadores observaron esto con el modelo Qwen3.5-9B en las pruebas de codificación del banco SWE).
A pesar de estas limitaciones, HarnessX presenta un caso concreto de que aprovechar la ingeniería (no sólo el escalamiento de modelos) es una palanca que los profesionales pueden utilizar ahora. Para los equipos que ejecutan modelos más pequeños y abiertos en flujos de trabajo complejos, las ganancias aquí son lo suficientemente grandes como para justificar la evaluación de la evolución del arnés como un primer paso antes de buscar un modelo de frontera más costoso. Los investigadores planean publicar el código en una actualización futura.
A medida que los agentes de IA empresarial asumen tareas cada vez más complejas y de largo plazo, su desempeño a menudo se ve restringido por su arnés, el andamiaje de software que conecta el LLM principal con su entorno.
Actualmente, los arneses son en gran medida estáticos y artesanales. Mejorarlos es en gran medida manual y no mejoran automáticamente en función de los datos de ejecución que recopilan de su entorno.
Para abordar este cuello de botella de ingeniería, los investigadores de Xiaomi presentaron ArnésXun marco que trata el arnés de IA como un objeto componible y aplica mejoras de forma autónoma a su código.
En aplicaciones empresariales del mundo real, esta adaptación automatizada permite que los sistemas de IA se ajusten dinámicamente a los requisitos específicos de la aplicación. Las pruebas prácticas demostraron que HarnessX ofrece mejoras sustanciales de rendimiento en dominios como la ingeniería de software y la interacción web.
Los resultados demuestran que ampliar el modelo básico no es el único camino hacia una IA más capaz y, para modelos más pequeños, puede que ni siquiera sea el mejor. La evolución del arnés de HarnessX produjo una ganancia de rendimiento promedio de +14,5 % en 15 combinaciones de modelo y referencia; Para el Qwen3.5-9B de peso abierto, las ganancias alcanzaron el +44% en tareas de planificación incorporadas.
Los desafíos de la ingeniería de arneses
En las aplicaciones de IA, la capacidad de un modelo básico depende en gran medida de su arnés circundante. El arnés actúa como la capa operativa que convierte los resultados del modelo sin procesar en comportamientos de agentes estructurados y ejecutables. Comprende las indicaciones, las integraciones de herramientas externas, la gestión de la memoria y los flujos de control que dictan cómo un sistema de IA observa su entorno, razona un problema y toma medidas.
A medida que los agentes empresariales asumen flujos de trabajo más complejos y de largo plazo, la ingeniería de aprovechamiento se ha convertido en una parte fundamental del desarrollo de la IA. A pesar de su importancia, el desarrollo de arneses aún está lejos de ser una disciplina de ingeniería madura y presenta tres desafíos clave.
En primer lugar, los arneses son estáticos y están diseñados a mano. Cualquier cambio en el modelo básico subyacente, la introducción de nuevas herramientas o un giro hacia un dominio operativo diferente requiere reescrituras de código manuales y personalizadas. Los arneses tradicionales carecen de mecanismos para aprender y mejorar de forma autónoma a partir de experiencias de ejecución pasadas.
En segundo lugar, la mayoría de los arneses existentes sufren de enredos arquitectónicos. Combinan estrechamente plantillas de avisos, envoltorios de herramientas, políticas de reintento y administración de memoria dentro de las mismas rutas de código. Este enredo significa que modificar un componente puede dañar silenciosamente otros. Intentar reutilizar un arnés en diferentes dominios empresariales a menudo implica copiar código sin formato en lugar de una composición limpia y modular.
En tercer lugar, el modelo de arnés y base se optimiza de forma aislada. Cuando los ingenieros realizan pruebas para mejorar el arnés, los seguimientos de ejecución generados generalmente se descartan en lugar de usarse como datos de entrenamiento para mejorar el modelo. En consecuencia, las actualizaciones de modelos no conducen naturalmente a mejoras en el aprovechamiento, lo que crea un cuello de botella donde los equipos no logran capturar el valor total de los datos operativos de sus agentes.
HarnessX: una fundición autónoma para agentes de IA
HarnessX resuelve los obstáculos de ingeniería del desarrollo de arneses manuales con lo que los investigadores llaman una «fundición de arneses unificada».
La principal innovación de HarnessX es tratar el arnés como un «objeto de primera clase». En términos de ingeniería de software, esto significa que el arnés es una entidad serializable, modular y sustituible de forma independiente. Al separar la configuración del modelo (es decir, qué modelo de IA está funcionando) de la configuración del arnés, los ingenieros pueden intercambiar, adaptar y evolucionar el andamiaje sin tocar el modelo subyacente.
HarnessX divide el comportamiento de los agentes en diferentes componentes, como ensamblaje de contexto, gestión de memoria, ecosistemas de herramientas, flujo de control y observabilidad. Cada comportamiento específico se implementa como un «procesador» que se conecta a ganchos precisos del ciclo de vida del arnés. Esta estructura modular permite que el sistema intercambie, agregue o elimine estos procesadores sin romper la tubería circundante.
Para automatizar la optimización de esta estructura modular, HarnessX presenta AEGIS, un motor de evolución basado en trazas. Los marcos AEGIS aprovechan la adaptación como un problema de aprendizaje por refuerzo (RL) sobre los diferentes componentes simbólicos del arnés.
Enmarcar la optimización del arnés como un problema de aprendizaje por refuerzo introduce tres patologías contra las que los investigadores tuvieron que diseñar explícitamente:
-
Hackeo de recompensas: El sistema podría explotar atajos hacia la solución en lugar de resolver genuinamente la tarea.
-
Olvido catastrófico: Una edición que solucione un patrón de error en un dominio podría interrumpir silenciosamente un flujo de trabajo previamente resuelto en otro.
-
Subexploración: El sistema podría iterar sobre ajustes menores en lugar de explorar configuraciones de herramientas nuevas y estructuralmente superiores.

Para evitar estos problemas, AEGIS se basa en la observabilidad total del seguimiento y en un proceso de cuatro etapas:
-
Digeridor: Comprime los seguimientos de ejecución en resúmenes estructurados para identificar dónde falló el agente.
-
Planificador: Analiza estos resúmenes para permitir que el sistema explore cambios estructurales en lugar de solo ajustes locales.
-
Evolver: Genera ediciones y pruebas de arnés a nivel de código para garantizar que se ejecuten correctamente antes de la implementación.
-
Crítico y puerta: Un crítico evalúa las ediciones para detectar piratería de recompensas, mientras que una puerta determinista rechaza cualquier actualización que retroceda una tarea previamente resuelta para evitar un olvido catastrófico.
HarnessX ingresa a un campo creciente de investigación de arneses de mejora personal – pero lo que lo separa es la coevolución del modelo de arnés.
Los investigadores destacan que la optimización de cualquiera de los componentes de forma aislada eventualmente choca contra un muro. La evolución de sólo el arnés toca un techo de andamiaje si el modelo subyacente carece de la capacidad de razonamiento para utilizar las nuevas herramientas. Entrenar solo al modelo alcanza un límite máximo de señales de entrenamiento si el arnés nunca le indica al modelo que use sus capacidades avanzadas.
HarnessX entrelaza la evolución del arnés con el entrenamiento de modelos. Los seguimientos de ejecución generados mientras el arnés intenta adaptarse a las tareas se convierten en señales de aprendizaje por refuerzo para el modelo básico. Cada vez que el arnés mejora su estrategia, el modelo aprende simultáneamente a explotar mejor esa nueva estrategia, rompiendo los límites de capacidad del desarrollo tradicional de agentes de IA.
HarnessX hace posible esta coevolución a través de GRPO (optimización de políticas relativas de grupo) entre ejes. GRPO es el algoritmo RL popular Se utiliza para entrenar modelos de razonamiento como DeepSeek-R1.
Al ajustar el modelo, el GRPO cruzado agrupa las trayectorias de ejecución de un agente para la misma tarea en versiones completamente diferentes de los arneses de la aplicación. Esto permite que el modelo subyacente internalice cambios de estrategia de alto nivel, como usar un nuevo punto final API o administrar un presupuesto de ejecución, en lugar de simplemente aprender variaciones menores de redacción.
HarnessX en acción sobre los puntos de referencia de la industria
Para validar la utilidad práctica de HarnessX, los investigadores lo probaron en cinco puntos de referencia que comprenden ingeniería de software, diálogo de servicio al cliente de múltiples turnos, navegación web, razonamiento abierto de múltiples pasos y planificación incorporada.
Separaron la IA en dos roles. El «metaagente», impulsado por Claude Opus 4.6, analizó los registros y escribió el código para desarrollar los arneses. Los “agentes de tareas” ejecutaron los flujos de trabajo reales. Para demostrar que el marco es independiente del modelo, lo probaron en tres modelos de trabajadores diferentes: Claude Sonnet 4.6, GPT-5.4 y el Qwen3.5-9B de peso abierto.
HarnessX se comparó con dos líneas de base principales. El primero fue un arnés estático, que representa cómo la mayoría de las empresas implementan la IA en la actualidad, utilizando configuraciones congeladas hechas a mano con indicaciones y herramientas específicas de referencia. El segundo fue el Código Claude SDK, una línea de base que representa un evolucionador de un solo agente para probar si el complejo proceso de cuatro etapas de AEGIS tuvo un rendimiento superior al solicitar a un modelo de lenguaje único que iterara el código.
La evolución dinámica del arnés produce ganancias significativas en el mismo modelo base. HarnessX mejoró el rendimiento en 14 de 15 combinaciones de modelo y referencia. En todas las pruebas, la evolución del arnés arrojó una ganancia de rendimiento absoluta promedio de +14,5%.
Los modelos más débiles fueron los que más se beneficiaron de la mejora del arnés dinámico. El Qwen3.5-9B de peso abierto experimentó un aumento de rendimiento del +44,0 % en el punto de referencia de planificación incorporada ALFWorld y un aumento del +18,2 % en SWE-bench Verified para ingeniería de software.
La coevolución también resultó muy eficaz. Cuando los investigadores entrenaron el modelo básico utilizando los datos generados mientras evolucionaban el arnés, observaron un aumento promedio adicional del rendimiento del 4,7 %. Mejorar el arnés y el modelo simultáneamente produce el techo más alto. La ganancia de coevolución se aplica sólo a los modelos de peso abierto.
La evidencia anecdótica de los experimentos muestra cómo HarnessX resuelve problemas perniciosos al crear arneses de agentes para tareas del mundo real. Por ejemplo, en el punto de referencia de razonamiento de varios pasos de GAIA, el agente de tareas fallaba constantemente porque la herramienta de navegador sin cabeza que utilizó para extraer Wikipedia expiró en la interfaz del sitio con mucho JavaScript. HarnessX analizó los rastros de ejecución, diagnosticó el error y escribió una nueva herramienta que omitió el navegador por completo y consultó la API de MediaWiki directamente en busca de texto sin formato. Cambió esta herramienta al arnés y desbloqueó instantáneamente las tareas fallidas.
Durante las pruebas de comercio electrónico de WebShop, el agente de IA a menudo se quedaba atascado en bucles de paginación, haciendo clic sin cesar en «página siguiente» y reformulando búsquedas sin siquiera comprometerse a comprar un producto. En lugar de simplemente modificar el mensaje, HarnessX creó un procesador de asesoramiento que detectaba cuando el agente estaba repitiendo acciones de navegación. Inyectó una advertencia en el contexto para forzar una decisión, solucionando el comportamiento de bucle y aumentando el rendimiento.
Límites de la ingeniería de arneses automatizada
Una advertencia importante es que el sistema actualmente se basa en modelos potentes que actúan como metaagente que reescribe el código de arnés. En sus experimentos, los investigadores se basaron en modelos de frontera cerrada como Claude Opus. Los modelos de peso abierto están mejorando rápidamente, pero su capacidad para servir como metaagente aún no se ha probado.
Otra limitación que vale la pena considerar son las capacidades intrínsecas de los modelos utilizados. Si el modelo de tarea subyacente es fundamentalmente demasiado débil para ejecutar los complejos flujos de trabajo que propone el nuevo arnés, HarnessX no podrá mejorar las capacidades generales del agente (los investigadores observaron esto con el modelo Qwen3.5-9B en las pruebas de codificación del banco SWE).
A pesar de estas limitaciones, HarnessX presenta un caso concreto de que aprovechar la ingeniería (no sólo el escalamiento de modelos) es una palanca que los profesionales pueden utilizar ahora. Para los equipos que ejecutan modelos más pequeños y abiertos en flujos de trabajo complejos, las ganancias aquí son lo suficientemente grandes como para justificar la evaluación de la evolución del arnés como un primer paso antes de buscar un modelo de frontera más costoso. Los investigadores planean publicar el código en una actualización futura.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
A medida que los agentes de IA empresarial asumen tareas cada vez más complejas y de largo plazo, su desempeño a menudo se ve restringido por su arnés, el andamiaje de software que conecta el LLM principal con su entorno.
Actualmente, los arneses son en gran medida estáticos y artesanales. Mejorarlos es en gran medida manual y no mejoran automáticamente en función de los datos de ejecución que recopilan de su entorno.
Para abordar este cuello de botella de ingeniería, los investigadores de Xiaomi presentaron ArnésXun marco que trata el arnés de IA como un objeto componible y aplica mejoras de forma autónoma a su código.
En aplicaciones empresariales del mundo real, esta adaptación automatizada permite que los sistemas de IA se ajusten dinámicamente a los requisitos específicos de la aplicación. Las pruebas prácticas demostraron que HarnessX ofrece mejoras sustanciales de rendimiento en dominios como la ingeniería de software y la interacción web.
Los resultados demuestran que ampliar el modelo básico no es el único camino hacia una IA más capaz y, para modelos más pequeños, puede que ni siquiera sea el mejor. La evolución del arnés de HarnessX produjo una ganancia de rendimiento promedio de +14,5 % en 15 combinaciones de modelo y referencia; Para el Qwen3.5-9B de peso abierto, las ganancias alcanzaron el +44% en tareas de planificación incorporadas.
Los desafíos de la ingeniería de arneses
En las aplicaciones de IA, la capacidad de un modelo básico depende en gran medida de su arnés circundante. El arnés actúa como la capa operativa que convierte los resultados del modelo sin procesar en comportamientos de agentes estructurados y ejecutables. Comprende las indicaciones, las integraciones de herramientas externas, la gestión de la memoria y los flujos de control que dictan cómo un sistema de IA observa su entorno, razona un problema y toma medidas.
A medida que los agentes empresariales asumen flujos de trabajo más complejos y de largo plazo, la ingeniería de aprovechamiento se ha convertido en una parte fundamental del desarrollo de la IA. A pesar de su importancia, el desarrollo de arneses aún está lejos de ser una disciplina de ingeniería madura y presenta tres desafíos clave.
En primer lugar, los arneses son estáticos y están diseñados a mano. Cualquier cambio en el modelo básico subyacente, la introducción de nuevas herramientas o un giro hacia un dominio operativo diferente requiere reescrituras de código manuales y personalizadas. Los arneses tradicionales carecen de mecanismos para aprender y mejorar de forma autónoma a partir de experiencias de ejecución pasadas.
En segundo lugar, la mayoría de los arneses existentes sufren de enredos arquitectónicos. Combinan estrechamente plantillas de avisos, envoltorios de herramientas, políticas de reintento y administración de memoria dentro de las mismas rutas de código. Este enredo significa que modificar un componente puede dañar silenciosamente otros. Intentar reutilizar un arnés en diferentes dominios empresariales a menudo implica copiar código sin formato en lugar de una composición limpia y modular.
En tercer lugar, el modelo de arnés y base se optimiza de forma aislada. Cuando los ingenieros realizan pruebas para mejorar el arnés, los seguimientos de ejecución generados generalmente se descartan en lugar de usarse como datos de entrenamiento para mejorar el modelo. En consecuencia, las actualizaciones de modelos no conducen naturalmente a mejoras en el aprovechamiento, lo que crea un cuello de botella donde los equipos no logran capturar el valor total de los datos operativos de sus agentes.
HarnessX: una fundición autónoma para agentes de IA
HarnessX resuelve los obstáculos de ingeniería del desarrollo de arneses manuales con lo que los investigadores llaman una «fundición de arneses unificada».
La principal innovación de HarnessX es tratar el arnés como un «objeto de primera clase». En términos de ingeniería de software, esto significa que el arnés es una entidad serializable, modular y sustituible de forma independiente. Al separar la configuración del modelo (es decir, qué modelo de IA está funcionando) de la configuración del arnés, los ingenieros pueden intercambiar, adaptar y evolucionar el andamiaje sin tocar el modelo subyacente.
HarnessX divide el comportamiento de los agentes en diferentes componentes, como ensamblaje de contexto, gestión de memoria, ecosistemas de herramientas, flujo de control y observabilidad. Cada comportamiento específico se implementa como un «procesador» que se conecta a ganchos precisos del ciclo de vida del arnés. Esta estructura modular permite que el sistema intercambie, agregue o elimine estos procesadores sin romper la tubería circundante.
Para automatizar la optimización de esta estructura modular, HarnessX presenta AEGIS, un motor de evolución basado en trazas. Los marcos AEGIS aprovechan la adaptación como un problema de aprendizaje por refuerzo (RL) sobre los diferentes componentes simbólicos del arnés.
Enmarcar la optimización del arnés como un problema de aprendizaje por refuerzo introduce tres patologías contra las que los investigadores tuvieron que diseñar explícitamente:
-
Hackeo de recompensas: El sistema podría explotar atajos hacia la solución en lugar de resolver genuinamente la tarea.
-
Olvido catastrófico: Una edición que solucione un patrón de error en un dominio podría interrumpir silenciosamente un flujo de trabajo previamente resuelto en otro.
-
Subexploración: El sistema podría iterar sobre ajustes menores en lugar de explorar configuraciones de herramientas nuevas y estructuralmente superiores.

Para evitar estos problemas, AEGIS se basa en la observabilidad total del seguimiento y en un proceso de cuatro etapas:
-
Digeridor: Comprime los seguimientos de ejecución en resúmenes estructurados para identificar dónde falló el agente.
-
Planificador: Analiza estos resúmenes para permitir que el sistema explore cambios estructurales en lugar de solo ajustes locales.
-
Evolver: Genera ediciones y pruebas de arnés a nivel de código para garantizar que se ejecuten correctamente antes de la implementación.
-
Crítico y puerta: Un crítico evalúa las ediciones para detectar piratería de recompensas, mientras que una puerta determinista rechaza cualquier actualización que retroceda una tarea previamente resuelta para evitar un olvido catastrófico.
HarnessX ingresa a un campo creciente de investigación de arneses de mejora personal – pero lo que lo separa es la coevolución del modelo de arnés.
Los investigadores destacan que la optimización de cualquiera de los componentes de forma aislada eventualmente choca contra un muro. La evolución de sólo el arnés toca un techo de andamiaje si el modelo subyacente carece de la capacidad de razonamiento para utilizar las nuevas herramientas. Entrenar solo al modelo alcanza un límite máximo de señales de entrenamiento si el arnés nunca le indica al modelo que use sus capacidades avanzadas.
HarnessX entrelaza la evolución del arnés con el entrenamiento de modelos. Los seguimientos de ejecución generados mientras el arnés intenta adaptarse a las tareas se convierten en señales de aprendizaje por refuerzo para el modelo básico. Cada vez que el arnés mejora su estrategia, el modelo aprende simultáneamente a explotar mejor esa nueva estrategia, rompiendo los límites de capacidad del desarrollo tradicional de agentes de IA.
HarnessX hace posible esta coevolución a través de GRPO (optimización de políticas relativas de grupo) entre ejes. GRPO es el algoritmo RL popular Se utiliza para entrenar modelos de razonamiento como DeepSeek-R1.
Al ajustar el modelo, el GRPO cruzado agrupa las trayectorias de ejecución de un agente para la misma tarea en versiones completamente diferentes de los arneses de la aplicación. Esto permite que el modelo subyacente internalice cambios de estrategia de alto nivel, como usar un nuevo punto final API o administrar un presupuesto de ejecución, en lugar de simplemente aprender variaciones menores de redacción.
HarnessX en acción sobre los puntos de referencia de la industria
Para validar la utilidad práctica de HarnessX, los investigadores lo probaron en cinco puntos de referencia que comprenden ingeniería de software, diálogo de servicio al cliente de múltiples turnos, navegación web, razonamiento abierto de múltiples pasos y planificación incorporada.
Separaron la IA en dos roles. El «metaagente», impulsado por Claude Opus 4.6, analizó los registros y escribió el código para desarrollar los arneses. Los “agentes de tareas” ejecutaron los flujos de trabajo reales. Para demostrar que el marco es independiente del modelo, lo probaron en tres modelos de trabajadores diferentes: Claude Sonnet 4.6, GPT-5.4 y el Qwen3.5-9B de peso abierto.
HarnessX se comparó con dos líneas de base principales. El primero fue un arnés estático, que representa cómo la mayoría de las empresas implementan la IA en la actualidad, utilizando configuraciones congeladas hechas a mano con indicaciones y herramientas específicas de referencia. El segundo fue el Código Claude SDK, una línea de base que representa un evolucionador de un solo agente para probar si el complejo proceso de cuatro etapas de AEGIS tuvo un rendimiento superior al solicitar a un modelo de lenguaje único que iterara el código.
La evolución dinámica del arnés produce ganancias significativas en el mismo modelo base. HarnessX mejoró el rendimiento en 14 de 15 combinaciones de modelo y referencia. En todas las pruebas, la evolución del arnés arrojó una ganancia de rendimiento absoluta promedio de +14,5%.
Los modelos más débiles fueron los que más se beneficiaron de la mejora del arnés dinámico. El Qwen3.5-9B de peso abierto experimentó un aumento de rendimiento del +44,0 % en el punto de referencia de planificación incorporada ALFWorld y un aumento del +18,2 % en SWE-bench Verified para ingeniería de software.
La coevolución también resultó muy eficaz. Cuando los investigadores entrenaron el modelo básico utilizando los datos generados mientras evolucionaban el arnés, observaron un aumento promedio adicional del rendimiento del 4,7 %. Mejorar el arnés y el modelo simultáneamente produce el techo más alto. La ganancia de coevolución se aplica sólo a los modelos de peso abierto.
La evidencia anecdótica de los experimentos muestra cómo HarnessX resuelve problemas perniciosos al crear arneses de agentes para tareas del mundo real. Por ejemplo, en el punto de referencia de razonamiento de varios pasos de GAIA, el agente de tareas fallaba constantemente porque la herramienta de navegador sin cabeza que utilizó para extraer Wikipedia expiró en la interfaz del sitio con mucho JavaScript. HarnessX analizó los rastros de ejecución, diagnosticó el error y escribió una nueva herramienta que omitió el navegador por completo y consultó la API de MediaWiki directamente en busca de texto sin formato. Cambió esta herramienta al arnés y desbloqueó instantáneamente las tareas fallidas.
Durante las pruebas de comercio electrónico de WebShop, el agente de IA a menudo se quedaba atascado en bucles de paginación, haciendo clic sin cesar en «página siguiente» y reformulando búsquedas sin siquiera comprometerse a comprar un producto. En lugar de simplemente modificar el mensaje, HarnessX creó un procesador de asesoramiento que detectaba cuando el agente estaba repitiendo acciones de navegación. Inyectó una advertencia en el contexto para forzar una decisión, solucionando el comportamiento de bucle y aumentando el rendimiento.
Límites de la ingeniería de arneses automatizada
Una advertencia importante es que el sistema actualmente se basa en modelos potentes que actúan como metaagente que reescribe el código de arnés. En sus experimentos, los investigadores se basaron en modelos de frontera cerrada como Claude Opus. Los modelos de peso abierto están mejorando rápidamente, pero su capacidad para servir como metaagente aún no se ha probado.
Otra limitación que vale la pena considerar son las capacidades intrínsecas de los modelos utilizados. Si el modelo de tarea subyacente es fundamentalmente demasiado débil para ejecutar los complejos flujos de trabajo que propone el nuevo arnés, HarnessX no podrá mejorar las capacidades generales del agente (los investigadores observaron esto con el modelo Qwen3.5-9B en las pruebas de codificación del banco SWE).
A pesar de estas limitaciones, HarnessX presenta un caso concreto de que aprovechar la ingeniería (no sólo el escalamiento de modelos) es una palanca que los profesionales pueden utilizar ahora. Para los equipos que ejecutan modelos más pequeños y abiertos en flujos de trabajo complejos, las ganancias aquí son lo suficientemente grandes como para justificar la evaluación de la evolución del arnés como un primer paso antes de buscar un modelo de frontera más costoso. Los investigadores planean publicar el código en una actualización futura.
A medida que los agentes de IA empresarial asumen tareas cada vez más complejas y de largo plazo, su desempeño a menudo se ve restringido por su arnés, el andamiaje de software que conecta el LLM principal con su entorno.
Actualmente, los arneses son en gran medida estáticos y artesanales. Mejorarlos es en gran medida manual y no mejoran automáticamente en función de los datos de ejecución que recopilan de su entorno.
Para abordar este cuello de botella de ingeniería, los investigadores de Xiaomi presentaron ArnésXun marco que trata el arnés de IA como un objeto componible y aplica mejoras de forma autónoma a su código.
En aplicaciones empresariales del mundo real, esta adaptación automatizada permite que los sistemas de IA se ajusten dinámicamente a los requisitos específicos de la aplicación. Las pruebas prácticas demostraron que HarnessX ofrece mejoras sustanciales de rendimiento en dominios como la ingeniería de software y la interacción web.
Los resultados demuestran que ampliar el modelo básico no es el único camino hacia una IA más capaz y, para modelos más pequeños, puede que ni siquiera sea el mejor. La evolución del arnés de HarnessX produjo una ganancia de rendimiento promedio de +14,5 % en 15 combinaciones de modelo y referencia; Para el Qwen3.5-9B de peso abierto, las ganancias alcanzaron el +44% en tareas de planificación incorporadas.
Los desafíos de la ingeniería de arneses
En las aplicaciones de IA, la capacidad de un modelo básico depende en gran medida de su arnés circundante. El arnés actúa como la capa operativa que convierte los resultados del modelo sin procesar en comportamientos de agentes estructurados y ejecutables. Comprende las indicaciones, las integraciones de herramientas externas, la gestión de la memoria y los flujos de control que dictan cómo un sistema de IA observa su entorno, razona un problema y toma medidas.
A medida que los agentes empresariales asumen flujos de trabajo más complejos y de largo plazo, la ingeniería de aprovechamiento se ha convertido en una parte fundamental del desarrollo de la IA. A pesar de su importancia, el desarrollo de arneses aún está lejos de ser una disciplina de ingeniería madura y presenta tres desafíos clave.
En primer lugar, los arneses son estáticos y están diseñados a mano. Cualquier cambio en el modelo básico subyacente, la introducción de nuevas herramientas o un giro hacia un dominio operativo diferente requiere reescrituras de código manuales y personalizadas. Los arneses tradicionales carecen de mecanismos para aprender y mejorar de forma autónoma a partir de experiencias de ejecución pasadas.
En segundo lugar, la mayoría de los arneses existentes sufren de enredos arquitectónicos. Combinan estrechamente plantillas de avisos, envoltorios de herramientas, políticas de reintento y administración de memoria dentro de las mismas rutas de código. Este enredo significa que modificar un componente puede dañar silenciosamente otros. Intentar reutilizar un arnés en diferentes dominios empresariales a menudo implica copiar código sin formato en lugar de una composición limpia y modular.
En tercer lugar, el modelo de arnés y base se optimiza de forma aislada. Cuando los ingenieros realizan pruebas para mejorar el arnés, los seguimientos de ejecución generados generalmente se descartan en lugar de usarse como datos de entrenamiento para mejorar el modelo. En consecuencia, las actualizaciones de modelos no conducen naturalmente a mejoras en el aprovechamiento, lo que crea un cuello de botella donde los equipos no logran capturar el valor total de los datos operativos de sus agentes.
HarnessX: una fundición autónoma para agentes de IA
HarnessX resuelve los obstáculos de ingeniería del desarrollo de arneses manuales con lo que los investigadores llaman una «fundición de arneses unificada».
La principal innovación de HarnessX es tratar el arnés como un «objeto de primera clase». En términos de ingeniería de software, esto significa que el arnés es una entidad serializable, modular y sustituible de forma independiente. Al separar la configuración del modelo (es decir, qué modelo de IA está funcionando) de la configuración del arnés, los ingenieros pueden intercambiar, adaptar y evolucionar el andamiaje sin tocar el modelo subyacente.
HarnessX divide el comportamiento de los agentes en diferentes componentes, como ensamblaje de contexto, gestión de memoria, ecosistemas de herramientas, flujo de control y observabilidad. Cada comportamiento específico se implementa como un «procesador» que se conecta a ganchos precisos del ciclo de vida del arnés. Esta estructura modular permite que el sistema intercambie, agregue o elimine estos procesadores sin romper la tubería circundante.
Para automatizar la optimización de esta estructura modular, HarnessX presenta AEGIS, un motor de evolución basado en trazas. Los marcos AEGIS aprovechan la adaptación como un problema de aprendizaje por refuerzo (RL) sobre los diferentes componentes simbólicos del arnés.
Enmarcar la optimización del arnés como un problema de aprendizaje por refuerzo introduce tres patologías contra las que los investigadores tuvieron que diseñar explícitamente:
-
Hackeo de recompensas: El sistema podría explotar atajos hacia la solución en lugar de resolver genuinamente la tarea.
-
Olvido catastrófico: Una edición que solucione un patrón de error en un dominio podría interrumpir silenciosamente un flujo de trabajo previamente resuelto en otro.
-
Subexploración: El sistema podría iterar sobre ajustes menores en lugar de explorar configuraciones de herramientas nuevas y estructuralmente superiores.

Para evitar estos problemas, AEGIS se basa en la observabilidad total del seguimiento y en un proceso de cuatro etapas:
-
Digeridor: Comprime los seguimientos de ejecución en resúmenes estructurados para identificar dónde falló el agente.
-
Planificador: Analiza estos resúmenes para permitir que el sistema explore cambios estructurales en lugar de solo ajustes locales.
-
Evolver: Genera ediciones y pruebas de arnés a nivel de código para garantizar que se ejecuten correctamente antes de la implementación.
-
Crítico y puerta: Un crítico evalúa las ediciones para detectar piratería de recompensas, mientras que una puerta determinista rechaza cualquier actualización que retroceda una tarea previamente resuelta para evitar un olvido catastrófico.
HarnessX ingresa a un campo creciente de investigación de arneses de mejora personal – pero lo que lo separa es la coevolución del modelo de arnés.
Los investigadores destacan que la optimización de cualquiera de los componentes de forma aislada eventualmente choca contra un muro. La evolución de sólo el arnés toca un techo de andamiaje si el modelo subyacente carece de la capacidad de razonamiento para utilizar las nuevas herramientas. Entrenar solo al modelo alcanza un límite máximo de señales de entrenamiento si el arnés nunca le indica al modelo que use sus capacidades avanzadas.
HarnessX entrelaza la evolución del arnés con el entrenamiento de modelos. Los seguimientos de ejecución generados mientras el arnés intenta adaptarse a las tareas se convierten en señales de aprendizaje por refuerzo para el modelo básico. Cada vez que el arnés mejora su estrategia, el modelo aprende simultáneamente a explotar mejor esa nueva estrategia, rompiendo los límites de capacidad del desarrollo tradicional de agentes de IA.
HarnessX hace posible esta coevolución a través de GRPO (optimización de políticas relativas de grupo) entre ejes. GRPO es el algoritmo RL popular Se utiliza para entrenar modelos de razonamiento como DeepSeek-R1.
Al ajustar el modelo, el GRPO cruzado agrupa las trayectorias de ejecución de un agente para la misma tarea en versiones completamente diferentes de los arneses de la aplicación. Esto permite que el modelo subyacente internalice cambios de estrategia de alto nivel, como usar un nuevo punto final API o administrar un presupuesto de ejecución, en lugar de simplemente aprender variaciones menores de redacción.
HarnessX en acción sobre los puntos de referencia de la industria
Para validar la utilidad práctica de HarnessX, los investigadores lo probaron en cinco puntos de referencia que comprenden ingeniería de software, diálogo de servicio al cliente de múltiples turnos, navegación web, razonamiento abierto de múltiples pasos y planificación incorporada.
Separaron la IA en dos roles. El «metaagente», impulsado por Claude Opus 4.6, analizó los registros y escribió el código para desarrollar los arneses. Los “agentes de tareas” ejecutaron los flujos de trabajo reales. Para demostrar que el marco es independiente del modelo, lo probaron en tres modelos de trabajadores diferentes: Claude Sonnet 4.6, GPT-5.4 y el Qwen3.5-9B de peso abierto.
HarnessX se comparó con dos líneas de base principales. El primero fue un arnés estático, que representa cómo la mayoría de las empresas implementan la IA en la actualidad, utilizando configuraciones congeladas hechas a mano con indicaciones y herramientas específicas de referencia. El segundo fue el Código Claude SDK, una línea de base que representa un evolucionador de un solo agente para probar si el complejo proceso de cuatro etapas de AEGIS tuvo un rendimiento superior al solicitar a un modelo de lenguaje único que iterara el código.
La evolución dinámica del arnés produce ganancias significativas en el mismo modelo base. HarnessX mejoró el rendimiento en 14 de 15 combinaciones de modelo y referencia. En todas las pruebas, la evolución del arnés arrojó una ganancia de rendimiento absoluta promedio de +14,5%.
Los modelos más débiles fueron los que más se beneficiaron de la mejora del arnés dinámico. El Qwen3.5-9B de peso abierto experimentó un aumento de rendimiento del +44,0 % en el punto de referencia de planificación incorporada ALFWorld y un aumento del +18,2 % en SWE-bench Verified para ingeniería de software.
La coevolución también resultó muy eficaz. Cuando los investigadores entrenaron el modelo básico utilizando los datos generados mientras evolucionaban el arnés, observaron un aumento promedio adicional del rendimiento del 4,7 %. Mejorar el arnés y el modelo simultáneamente produce el techo más alto. La ganancia de coevolución se aplica sólo a los modelos de peso abierto.
La evidencia anecdótica de los experimentos muestra cómo HarnessX resuelve problemas perniciosos al crear arneses de agentes para tareas del mundo real. Por ejemplo, en el punto de referencia de razonamiento de varios pasos de GAIA, el agente de tareas fallaba constantemente porque la herramienta de navegador sin cabeza que utilizó para extraer Wikipedia expiró en la interfaz del sitio con mucho JavaScript. HarnessX analizó los rastros de ejecución, diagnosticó el error y escribió una nueva herramienta que omitió el navegador por completo y consultó la API de MediaWiki directamente en busca de texto sin formato. Cambió esta herramienta al arnés y desbloqueó instantáneamente las tareas fallidas.
Durante las pruebas de comercio electrónico de WebShop, el agente de IA a menudo se quedaba atascado en bucles de paginación, haciendo clic sin cesar en «página siguiente» y reformulando búsquedas sin siquiera comprometerse a comprar un producto. En lugar de simplemente modificar el mensaje, HarnessX creó un procesador de asesoramiento que detectaba cuando el agente estaba repitiendo acciones de navegación. Inyectó una advertencia en el contexto para forzar una decisión, solucionando el comportamiento de bucle y aumentando el rendimiento.
Límites de la ingeniería de arneses automatizada
Una advertencia importante es que el sistema actualmente se basa en modelos potentes que actúan como metaagente que reescribe el código de arnés. En sus experimentos, los investigadores se basaron en modelos de frontera cerrada como Claude Opus. Los modelos de peso abierto están mejorando rápidamente, pero su capacidad para servir como metaagente aún no se ha probado.
Otra limitación que vale la pena considerar son las capacidades intrínsecas de los modelos utilizados. Si el modelo de tarea subyacente es fundamentalmente demasiado débil para ejecutar los complejos flujos de trabajo que propone el nuevo arnés, HarnessX no podrá mejorar las capacidades generales del agente (los investigadores observaron esto con el modelo Qwen3.5-9B en las pruebas de codificación del banco SWE).
A pesar de estas limitaciones, HarnessX presenta un caso concreto de que aprovechar la ingeniería (no sólo el escalamiento de modelos) es una palanca que los profesionales pueden utilizar ahora. Para los equipos que ejecutan modelos más pequeños y abiertos en flujos de trabajo complejos, las ganancias aquí son lo suficientemente grandes como para justificar la evaluación de la evolución del arnés como un primer paso antes de buscar un modelo de frontera más costoso. Los investigadores planean publicar el código en una actualización futura.
A medida que los agentes de IA empresarial asumen tareas cada vez más complejas y de largo plazo, su desempeño a menudo se ve restringido por su arnés, el andamiaje de software que conecta el LLM principal con su entorno.
Actualmente, los arneses son en gran medida estáticos y artesanales. Mejorarlos es en gran medida manual y no mejoran automáticamente en función de los datos de ejecución que recopilan de su entorno.
Para abordar este cuello de botella de ingeniería, los investigadores de Xiaomi presentaron ArnésXun marco que trata el arnés de IA como un objeto componible y aplica mejoras de forma autónoma a su código.
En aplicaciones empresariales del mundo real, esta adaptación automatizada permite que los sistemas de IA se ajusten dinámicamente a los requisitos específicos de la aplicación. Las pruebas prácticas demostraron que HarnessX ofrece mejoras sustanciales de rendimiento en dominios como la ingeniería de software y la interacción web.
Los resultados demuestran que ampliar el modelo básico no es el único camino hacia una IA más capaz y, para modelos más pequeños, puede que ni siquiera sea el mejor. La evolución del arnés de HarnessX produjo una ganancia de rendimiento promedio de +14,5 % en 15 combinaciones de modelo y referencia; Para el Qwen3.5-9B de peso abierto, las ganancias alcanzaron el +44% en tareas de planificación incorporadas.
Los desafíos de la ingeniería de arneses
En las aplicaciones de IA, la capacidad de un modelo básico depende en gran medida de su arnés circundante. El arnés actúa como la capa operativa que convierte los resultados del modelo sin procesar en comportamientos de agentes estructurados y ejecutables. Comprende las indicaciones, las integraciones de herramientas externas, la gestión de la memoria y los flujos de control que dictan cómo un sistema de IA observa su entorno, razona un problema y toma medidas.
A medida que los agentes empresariales asumen flujos de trabajo más complejos y de largo plazo, la ingeniería de aprovechamiento se ha convertido en una parte fundamental del desarrollo de la IA. A pesar de su importancia, el desarrollo de arneses aún está lejos de ser una disciplina de ingeniería madura y presenta tres desafíos clave.
En primer lugar, los arneses son estáticos y están diseñados a mano. Cualquier cambio en el modelo básico subyacente, la introducción de nuevas herramientas o un giro hacia un dominio operativo diferente requiere reescrituras de código manuales y personalizadas. Los arneses tradicionales carecen de mecanismos para aprender y mejorar de forma autónoma a partir de experiencias de ejecución pasadas.
En segundo lugar, la mayoría de los arneses existentes sufren de enredos arquitectónicos. Combinan estrechamente plantillas de avisos, envoltorios de herramientas, políticas de reintento y administración de memoria dentro de las mismas rutas de código. Este enredo significa que modificar un componente puede dañar silenciosamente otros. Intentar reutilizar un arnés en diferentes dominios empresariales a menudo implica copiar código sin formato en lugar de una composición limpia y modular.
En tercer lugar, el modelo de arnés y base se optimiza de forma aislada. Cuando los ingenieros realizan pruebas para mejorar el arnés, los seguimientos de ejecución generados generalmente se descartan en lugar de usarse como datos de entrenamiento para mejorar el modelo. En consecuencia, las actualizaciones de modelos no conducen naturalmente a mejoras en el aprovechamiento, lo que crea un cuello de botella donde los equipos no logran capturar el valor total de los datos operativos de sus agentes.
HarnessX: una fundición autónoma para agentes de IA
HarnessX resuelve los obstáculos de ingeniería del desarrollo de arneses manuales con lo que los investigadores llaman una «fundición de arneses unificada».
La principal innovación de HarnessX es tratar el arnés como un «objeto de primera clase». En términos de ingeniería de software, esto significa que el arnés es una entidad serializable, modular y sustituible de forma independiente. Al separar la configuración del modelo (es decir, qué modelo de IA está funcionando) de la configuración del arnés, los ingenieros pueden intercambiar, adaptar y evolucionar el andamiaje sin tocar el modelo subyacente.
HarnessX divide el comportamiento de los agentes en diferentes componentes, como ensamblaje de contexto, gestión de memoria, ecosistemas de herramientas, flujo de control y observabilidad. Cada comportamiento específico se implementa como un «procesador» que se conecta a ganchos precisos del ciclo de vida del arnés. Esta estructura modular permite que el sistema intercambie, agregue o elimine estos procesadores sin romper la tubería circundante.
Para automatizar la optimización de esta estructura modular, HarnessX presenta AEGIS, un motor de evolución basado en trazas. Los marcos AEGIS aprovechan la adaptación como un problema de aprendizaje por refuerzo (RL) sobre los diferentes componentes simbólicos del arnés.
Enmarcar la optimización del arnés como un problema de aprendizaje por refuerzo introduce tres patologías contra las que los investigadores tuvieron que diseñar explícitamente:
-
Hackeo de recompensas: El sistema podría explotar atajos hacia la solución en lugar de resolver genuinamente la tarea.
-
Olvido catastrófico: Una edición que solucione un patrón de error en un dominio podría interrumpir silenciosamente un flujo de trabajo previamente resuelto en otro.
-
Subexploración: El sistema podría iterar sobre ajustes menores en lugar de explorar configuraciones de herramientas nuevas y estructuralmente superiores.

Para evitar estos problemas, AEGIS se basa en la observabilidad total del seguimiento y en un proceso de cuatro etapas:
-
Digeridor: Comprime los seguimientos de ejecución en resúmenes estructurados para identificar dónde falló el agente.
-
Planificador: Analiza estos resúmenes para permitir que el sistema explore cambios estructurales en lugar de solo ajustes locales.
-
Evolver: Genera ediciones y pruebas de arnés a nivel de código para garantizar que se ejecuten correctamente antes de la implementación.
-
Crítico y puerta: Un crítico evalúa las ediciones para detectar piratería de recompensas, mientras que una puerta determinista rechaza cualquier actualización que retroceda una tarea previamente resuelta para evitar un olvido catastrófico.
HarnessX ingresa a un campo creciente de investigación de arneses de mejora personal – pero lo que lo separa es la coevolución del modelo de arnés.
Los investigadores destacan que la optimización de cualquiera de los componentes de forma aislada eventualmente choca contra un muro. La evolución de sólo el arnés toca un techo de andamiaje si el modelo subyacente carece de la capacidad de razonamiento para utilizar las nuevas herramientas. Entrenar solo al modelo alcanza un límite máximo de señales de entrenamiento si el arnés nunca le indica al modelo que use sus capacidades avanzadas.
HarnessX entrelaza la evolución del arnés con el entrenamiento de modelos. Los seguimientos de ejecución generados mientras el arnés intenta adaptarse a las tareas se convierten en señales de aprendizaje por refuerzo para el modelo básico. Cada vez que el arnés mejora su estrategia, el modelo aprende simultáneamente a explotar mejor esa nueva estrategia, rompiendo los límites de capacidad del desarrollo tradicional de agentes de IA.
HarnessX hace posible esta coevolución a través de GRPO (optimización de políticas relativas de grupo) entre ejes. GRPO es el algoritmo RL popular Se utiliza para entrenar modelos de razonamiento como DeepSeek-R1.
Al ajustar el modelo, el GRPO cruzado agrupa las trayectorias de ejecución de un agente para la misma tarea en versiones completamente diferentes de los arneses de la aplicación. Esto permite que el modelo subyacente internalice cambios de estrategia de alto nivel, como usar un nuevo punto final API o administrar un presupuesto de ejecución, en lugar de simplemente aprender variaciones menores de redacción.
HarnessX en acción sobre los puntos de referencia de la industria
Para validar la utilidad práctica de HarnessX, los investigadores lo probaron en cinco puntos de referencia que comprenden ingeniería de software, diálogo de servicio al cliente de múltiples turnos, navegación web, razonamiento abierto de múltiples pasos y planificación incorporada.
Separaron la IA en dos roles. El «metaagente», impulsado por Claude Opus 4.6, analizó los registros y escribió el código para desarrollar los arneses. Los “agentes de tareas” ejecutaron los flujos de trabajo reales. Para demostrar que el marco es independiente del modelo, lo probaron en tres modelos de trabajadores diferentes: Claude Sonnet 4.6, GPT-5.4 y el Qwen3.5-9B de peso abierto.
HarnessX se comparó con dos líneas de base principales. El primero fue un arnés estático, que representa cómo la mayoría de las empresas implementan la IA en la actualidad, utilizando configuraciones congeladas hechas a mano con indicaciones y herramientas específicas de referencia. El segundo fue el Código Claude SDK, una línea de base que representa un evolucionador de un solo agente para probar si el complejo proceso de cuatro etapas de AEGIS tuvo un rendimiento superior al solicitar a un modelo de lenguaje único que iterara el código.
La evolución dinámica del arnés produce ganancias significativas en el mismo modelo base. HarnessX mejoró el rendimiento en 14 de 15 combinaciones de modelo y referencia. En todas las pruebas, la evolución del arnés arrojó una ganancia de rendimiento absoluta promedio de +14,5%.
Los modelos más débiles fueron los que más se beneficiaron de la mejora del arnés dinámico. El Qwen3.5-9B de peso abierto experimentó un aumento de rendimiento del +44,0 % en el punto de referencia de planificación incorporada ALFWorld y un aumento del +18,2 % en SWE-bench Verified para ingeniería de software.
La coevolución también resultó muy eficaz. Cuando los investigadores entrenaron el modelo básico utilizando los datos generados mientras evolucionaban el arnés, observaron un aumento promedio adicional del rendimiento del 4,7 %. Mejorar el arnés y el modelo simultáneamente produce el techo más alto. La ganancia de coevolución se aplica sólo a los modelos de peso abierto.
La evidencia anecdótica de los experimentos muestra cómo HarnessX resuelve problemas perniciosos al crear arneses de agentes para tareas del mundo real. Por ejemplo, en el punto de referencia de razonamiento de varios pasos de GAIA, el agente de tareas fallaba constantemente porque la herramienta de navegador sin cabeza que utilizó para extraer Wikipedia expiró en la interfaz del sitio con mucho JavaScript. HarnessX analizó los rastros de ejecución, diagnosticó el error y escribió una nueva herramienta que omitió el navegador por completo y consultó la API de MediaWiki directamente en busca de texto sin formato. Cambió esta herramienta al arnés y desbloqueó instantáneamente las tareas fallidas.
Durante las pruebas de comercio electrónico de WebShop, el agente de IA a menudo se quedaba atascado en bucles de paginación, haciendo clic sin cesar en «página siguiente» y reformulando búsquedas sin siquiera comprometerse a comprar un producto. En lugar de simplemente modificar el mensaje, HarnessX creó un procesador de asesoramiento que detectaba cuando el agente estaba repitiendo acciones de navegación. Inyectó una advertencia en el contexto para forzar una decisión, solucionando el comportamiento de bucle y aumentando el rendimiento.
Límites de la ingeniería de arneses automatizada
Una advertencia importante es que el sistema actualmente se basa en modelos potentes que actúan como metaagente que reescribe el código de arnés. En sus experimentos, los investigadores se basaron en modelos de frontera cerrada como Claude Opus. Los modelos de peso abierto están mejorando rápidamente, pero su capacidad para servir como metaagente aún no se ha probado.
Otra limitación que vale la pena considerar son las capacidades intrínsecas de los modelos utilizados. Si el modelo de tarea subyacente es fundamentalmente demasiado débil para ejecutar los complejos flujos de trabajo que propone el nuevo arnés, HarnessX no podrá mejorar las capacidades generales del agente (los investigadores observaron esto con el modelo Qwen3.5-9B en las pruebas de codificación del banco SWE).
A pesar de estas limitaciones, HarnessX presenta un caso concreto de que aprovechar la ingeniería (no sólo el escalamiento de modelos) es una palanca que los profesionales pueden utilizar ahora. Para los equipos que ejecutan modelos más pequeños y abiertos en flujos de trabajo complejos, las ganancias aquí son lo suficientemente grandes como para justificar la evaluación de la evolución del arnés como un primer paso antes de buscar un modelo de frontera más costoso. Los investigadores planean publicar el código en una actualización futura.
A medida que los agentes de IA empresarial asumen tareas cada vez más complejas y de largo plazo, su desempeño a menudo se ve restringido por su arnés, el andamiaje de software que conecta el LLM principal con su entorno.
Actualmente, los arneses son en gran medida estáticos y artesanales. Mejorarlos es en gran medida manual y no mejoran automáticamente en función de los datos de ejecución que recopilan de su entorno.
Para abordar este cuello de botella de ingeniería, los investigadores de Xiaomi presentaron ArnésXun marco que trata el arnés de IA como un objeto componible y aplica mejoras de forma autónoma a su código.
En aplicaciones empresariales del mundo real, esta adaptación automatizada permite que los sistemas de IA se ajusten dinámicamente a los requisitos específicos de la aplicación. Las pruebas prácticas demostraron que HarnessX ofrece mejoras sustanciales de rendimiento en dominios como la ingeniería de software y la interacción web.
Los resultados demuestran que ampliar el modelo básico no es el único camino hacia una IA más capaz y, para modelos más pequeños, puede que ni siquiera sea el mejor. La evolución del arnés de HarnessX produjo una ganancia de rendimiento promedio de +14,5 % en 15 combinaciones de modelo y referencia; Para el Qwen3.5-9B de peso abierto, las ganancias alcanzaron el +44% en tareas de planificación incorporadas.
Los desafíos de la ingeniería de arneses
En las aplicaciones de IA, la capacidad de un modelo básico depende en gran medida de su arnés circundante. El arnés actúa como la capa operativa que convierte los resultados del modelo sin procesar en comportamientos de agentes estructurados y ejecutables. Comprende las indicaciones, las integraciones de herramientas externas, la gestión de la memoria y los flujos de control que dictan cómo un sistema de IA observa su entorno, razona un problema y toma medidas.
A medida que los agentes empresariales asumen flujos de trabajo más complejos y de largo plazo, la ingeniería de aprovechamiento se ha convertido en una parte fundamental del desarrollo de la IA. A pesar de su importancia, el desarrollo de arneses aún está lejos de ser una disciplina de ingeniería madura y presenta tres desafíos clave.
En primer lugar, los arneses son estáticos y están diseñados a mano. Cualquier cambio en el modelo básico subyacente, la introducción de nuevas herramientas o un giro hacia un dominio operativo diferente requiere reescrituras de código manuales y personalizadas. Los arneses tradicionales carecen de mecanismos para aprender y mejorar de forma autónoma a partir de experiencias de ejecución pasadas.
En segundo lugar, la mayoría de los arneses existentes sufren de enredos arquitectónicos. Combinan estrechamente plantillas de avisos, envoltorios de herramientas, políticas de reintento y administración de memoria dentro de las mismas rutas de código. Este enredo significa que modificar un componente puede dañar silenciosamente otros. Intentar reutilizar un arnés en diferentes dominios empresariales a menudo implica copiar código sin formato en lugar de una composición limpia y modular.
En tercer lugar, el modelo de arnés y base se optimiza de forma aislada. Cuando los ingenieros realizan pruebas para mejorar el arnés, los seguimientos de ejecución generados generalmente se descartan en lugar de usarse como datos de entrenamiento para mejorar el modelo. En consecuencia, las actualizaciones de modelos no conducen naturalmente a mejoras en el aprovechamiento, lo que crea un cuello de botella donde los equipos no logran capturar el valor total de los datos operativos de sus agentes.
HarnessX: una fundición autónoma para agentes de IA
HarnessX resuelve los obstáculos de ingeniería del desarrollo de arneses manuales con lo que los investigadores llaman una «fundición de arneses unificada».
La principal innovación de HarnessX es tratar el arnés como un «objeto de primera clase». En términos de ingeniería de software, esto significa que el arnés es una entidad serializable, modular y sustituible de forma independiente. Al separar la configuración del modelo (es decir, qué modelo de IA está funcionando) de la configuración del arnés, los ingenieros pueden intercambiar, adaptar y evolucionar el andamiaje sin tocar el modelo subyacente.
HarnessX divide el comportamiento de los agentes en diferentes componentes, como ensamblaje de contexto, gestión de memoria, ecosistemas de herramientas, flujo de control y observabilidad. Cada comportamiento específico se implementa como un «procesador» que se conecta a ganchos precisos del ciclo de vida del arnés. Esta estructura modular permite que el sistema intercambie, agregue o elimine estos procesadores sin romper la tubería circundante.
Para automatizar la optimización de esta estructura modular, HarnessX presenta AEGIS, un motor de evolución basado en trazas. Los marcos AEGIS aprovechan la adaptación como un problema de aprendizaje por refuerzo (RL) sobre los diferentes componentes simbólicos del arnés.
Enmarcar la optimización del arnés como un problema de aprendizaje por refuerzo introduce tres patologías contra las que los investigadores tuvieron que diseñar explícitamente:
-
Hackeo de recompensas: El sistema podría explotar atajos hacia la solución en lugar de resolver genuinamente la tarea.
-
Olvido catastrófico: Una edición que solucione un patrón de error en un dominio podría interrumpir silenciosamente un flujo de trabajo previamente resuelto en otro.
-
Subexploración: El sistema podría iterar sobre ajustes menores en lugar de explorar configuraciones de herramientas nuevas y estructuralmente superiores.

Para evitar estos problemas, AEGIS se basa en la observabilidad total del seguimiento y en un proceso de cuatro etapas:
-
Digeridor: Comprime los seguimientos de ejecución en resúmenes estructurados para identificar dónde falló el agente.
-
Planificador: Analiza estos resúmenes para permitir que el sistema explore cambios estructurales en lugar de solo ajustes locales.
-
Evolver: Genera ediciones y pruebas de arnés a nivel de código para garantizar que se ejecuten correctamente antes de la implementación.
-
Crítico y puerta: Un crítico evalúa las ediciones para detectar piratería de recompensas, mientras que una puerta determinista rechaza cualquier actualización que retroceda una tarea previamente resuelta para evitar un olvido catastrófico.
HarnessX ingresa a un campo creciente de investigación de arneses de mejora personal – pero lo que lo separa es la coevolución del modelo de arnés.
Los investigadores destacan que la optimización de cualquiera de los componentes de forma aislada eventualmente choca contra un muro. La evolución de sólo el arnés toca un techo de andamiaje si el modelo subyacente carece de la capacidad de razonamiento para utilizar las nuevas herramientas. Entrenar solo al modelo alcanza un límite máximo de señales de entrenamiento si el arnés nunca le indica al modelo que use sus capacidades avanzadas.
HarnessX entrelaza la evolución del arnés con el entrenamiento de modelos. Los seguimientos de ejecución generados mientras el arnés intenta adaptarse a las tareas se convierten en señales de aprendizaje por refuerzo para el modelo básico. Cada vez que el arnés mejora su estrategia, el modelo aprende simultáneamente a explotar mejor esa nueva estrategia, rompiendo los límites de capacidad del desarrollo tradicional de agentes de IA.
HarnessX hace posible esta coevolución a través de GRPO (optimización de políticas relativas de grupo) entre ejes. GRPO es el algoritmo RL popular Se utiliza para entrenar modelos de razonamiento como DeepSeek-R1.
Al ajustar el modelo, el GRPO cruzado agrupa las trayectorias de ejecución de un agente para la misma tarea en versiones completamente diferentes de los arneses de la aplicación. Esto permite que el modelo subyacente internalice cambios de estrategia de alto nivel, como usar un nuevo punto final API o administrar un presupuesto de ejecución, en lugar de simplemente aprender variaciones menores de redacción.
HarnessX en acción sobre los puntos de referencia de la industria
Para validar la utilidad práctica de HarnessX, los investigadores lo probaron en cinco puntos de referencia que comprenden ingeniería de software, diálogo de servicio al cliente de múltiples turnos, navegación web, razonamiento abierto de múltiples pasos y planificación incorporada.
Separaron la IA en dos roles. El «metaagente», impulsado por Claude Opus 4.6, analizó los registros y escribió el código para desarrollar los arneses. Los “agentes de tareas” ejecutaron los flujos de trabajo reales. Para demostrar que el marco es independiente del modelo, lo probaron en tres modelos de trabajadores diferentes: Claude Sonnet 4.6, GPT-5.4 y el Qwen3.5-9B de peso abierto.
HarnessX se comparó con dos líneas de base principales. El primero fue un arnés estático, que representa cómo la mayoría de las empresas implementan la IA en la actualidad, utilizando configuraciones congeladas hechas a mano con indicaciones y herramientas específicas de referencia. El segundo fue el Código Claude SDK, una línea de base que representa un evolucionador de un solo agente para probar si el complejo proceso de cuatro etapas de AEGIS tuvo un rendimiento superior al solicitar a un modelo de lenguaje único que iterara el código.
La evolución dinámica del arnés produce ganancias significativas en el mismo modelo base. HarnessX mejoró el rendimiento en 14 de 15 combinaciones de modelo y referencia. En todas las pruebas, la evolución del arnés arrojó una ganancia de rendimiento absoluta promedio de +14,5%.
Los modelos más débiles fueron los que más se beneficiaron de la mejora del arnés dinámico. El Qwen3.5-9B de peso abierto experimentó un aumento de rendimiento del +44,0 % en el punto de referencia de planificación incorporada ALFWorld y un aumento del +18,2 % en SWE-bench Verified para ingeniería de software.
La coevolución también resultó muy eficaz. Cuando los investigadores entrenaron el modelo básico utilizando los datos generados mientras evolucionaban el arnés, observaron un aumento promedio adicional del rendimiento del 4,7 %. Mejorar el arnés y el modelo simultáneamente produce el techo más alto. La ganancia de coevolución se aplica sólo a los modelos de peso abierto.
La evidencia anecdótica de los experimentos muestra cómo HarnessX resuelve problemas perniciosos al crear arneses de agentes para tareas del mundo real. Por ejemplo, en el punto de referencia de razonamiento de varios pasos de GAIA, el agente de tareas fallaba constantemente porque la herramienta de navegador sin cabeza que utilizó para extraer Wikipedia expiró en la interfaz del sitio con mucho JavaScript. HarnessX analizó los rastros de ejecución, diagnosticó el error y escribió una nueva herramienta que omitió el navegador por completo y consultó la API de MediaWiki directamente en busca de texto sin formato. Cambió esta herramienta al arnés y desbloqueó instantáneamente las tareas fallidas.
Durante las pruebas de comercio electrónico de WebShop, el agente de IA a menudo se quedaba atascado en bucles de paginación, haciendo clic sin cesar en «página siguiente» y reformulando búsquedas sin siquiera comprometerse a comprar un producto. En lugar de simplemente modificar el mensaje, HarnessX creó un procesador de asesoramiento que detectaba cuando el agente estaba repitiendo acciones de navegación. Inyectó una advertencia en el contexto para forzar una decisión, solucionando el comportamiento de bucle y aumentando el rendimiento.
Límites de la ingeniería de arneses automatizada
Una advertencia importante es que el sistema actualmente se basa en modelos potentes que actúan como metaagente que reescribe el código de arnés. En sus experimentos, los investigadores se basaron en modelos de frontera cerrada como Claude Opus. Los modelos de peso abierto están mejorando rápidamente, pero su capacidad para servir como metaagente aún no se ha probado.
Otra limitación que vale la pena considerar son las capacidades intrínsecas de los modelos utilizados. Si el modelo de tarea subyacente es fundamentalmente demasiado débil para ejecutar los complejos flujos de trabajo que propone el nuevo arnés, HarnessX no podrá mejorar las capacidades generales del agente (los investigadores observaron esto con el modelo Qwen3.5-9B en las pruebas de codificación del banco SWE).
A pesar de estas limitaciones, HarnessX presenta un caso concreto de que aprovechar la ingeniería (no sólo el escalamiento de modelos) es una palanca que los profesionales pueden utilizar ahora. Para los equipos que ejecutan modelos más pequeños y abiertos en flujos de trabajo complejos, las ganancias aquí son lo suficientemente grandes como para justificar la evaluación de la evolución del arnés como un primer paso antes de buscar un modelo de frontera más costoso. Los investigadores planean publicar el código en una actualización futura.












































































