Un desafío importante en el despliegue de agentes autónomos es construir sistemas que puedan adaptarse a los cambios en sus entornos sin la necesidad de volver a entrenar los modelos de lenguajes grandes (LLM) subyacentes.
Habilidades de recuerdoun nuevo marco desarrollado por investigadores de varias universidades, aborda este cuello de botella al brindar a los agentes la capacidad de desarrollar sus habilidades por sí mismos. «Agrega su aprendizaje continuo capacidad a la oferta existente en el mercado actual, como OpenClaw y Claude Code», dijo a VentureBeat Jun Wang, coautor del artículo.
Memento-Skills actúa como una memoria externa en evolución, permitiendo que el sistema mejore progresivamente sus capacidades sin modificar el modelo subyacente. El marco proporciona un conjunto de habilidades que pueden actualizarse y ampliarse a medida que el agente recibe retroalimentación de su entorno.
Para los equipos empresariales que ejecutan agentes en producción, eso es importante. La alternativa (ajustar los pesos del modelo o desarrollar habilidades manualmente) conlleva importantes gastos operativos y requisitos de datos. Memento-Skills evita ambos.
Los desafíos de construir agentes que evolucionan a sí mismos
Los agentes que evolucionan a sí mismos son cruciales porque superan las limitaciones de los modelos de lenguaje congelados. Una vez que se implementa un modelo, sus parámetros permanecen fijos, restringiéndolo al conocimiento codificado durante el entrenamiento y a todo lo que encaje en su ventana de contexto inmediato.
Darle al modelo una estructura de memoria externa le permite mejorar sin el costoso y lento proceso de reentrenamiento. Sin embargo, los enfoques actuales para la adaptación de agentes se basan en gran medida en habilidades diseñadas manualmente para manejar nuevas tareas. Si bien existen algunos métodos automáticos de aprendizaje de habilidades, en su mayoría producen guías de solo texto que equivalen a una optimización rápida. Otros enfoques simplemente registran trayectorias de una sola tarea que no se transfieren entre diferentes tareas.
Además, cuando estos agentes intentan recuperar conocimiento relevante para una nueva tarea, normalmente dependen de enrutadores de similitud semántica, como incrustaciones densas estándar; una alta superposición semántica no garantiza la utilidad conductual. Un agente que dependa del RAG estándar podría recuperar un script de «restablecimiento de contraseña» para resolver una consulta de «procesamiento de reembolso» simplemente porque los documentos comparten terminología empresarial.
«La mayoría de los sistemas de recuperación de generación aumentada (RAG) se basan en la recuperación basada en similitudes. Sin embargo, cuando las habilidades se representan como artefactos ejecutables, como documentos de rebajas o fragmentos de código, la similitud por sí sola puede no seleccionar la habilidad más efectiva», dijo Wang.
Cómo Memento-Skills almacena y actualiza las habilidades
Para resolver las limitaciones de los sistemas agentes actuales, los investigadores construyeron Memento-Skills. El artículo describe el sistema como «un sistema de agentes LLM generalista y de aprendizaje continuo que funciona como un agente de diseño de agentes». En lugar de mantener un registro pasivo de conversaciones pasadas, Memento-Skills crea un conjunto de habilidades que actúan como una memoria externa persistente y en evolución.
Estas habilidades se almacenan como archivos de rebajas estructurados y sirven como base de conocimientos en evolución del agente. Cada artefacto de habilidad reutilizable se compone de tres elementos centrales. Contiene especificaciones declarativas que describen qué es la habilidad y cómo debe usarse. Incluye instrucciones especializadas e indicaciones que guían el razonamiento del modelo de lenguaje. Y alberga el código ejecutable y los scripts auxiliares que ejecuta el agente para resolver la tarea.
Memento-Skills logra un aprendizaje continuo a través de su mecanismo de «aprendizaje reflexivo de lectura y escritura», que enmarca las actualizaciones de la memoria como una iteración de políticas activas en lugar de un registro de datos pasivo. Cuando se enfrenta a una nueva tarea, el agente consulta un enrutador de habilidades especializado para recuperar la habilidad más relevante desde el punto de vista del comportamiento (no solo la más semánticamente similar) y la ejecuta.
Después de que el agente ejecuta la habilidad y recibe retroalimentación, el sistema reflexiona sobre el resultado para cerrar el ciclo de aprendizaje. En lugar de simplemente agregar un registro de lo sucedido, el sistema muta activamente su memoria. Si la ejecución falla, un orquestador evalúa el seguimiento y reescribe los artefactos de habilidad. Esto significa que actualiza directamente el código o solicita parchear el modo de falla específico. En caso de necesidad, crea una habilidad completamente nueva.
Memento-Skills también actualiza el enrutador de habilidades a través de un proceso de aprendizaje de refuerzo fuera de línea de un solo paso que aprende de los comentarios de ejecución en lugar de solo la superposición de texto. «El verdadero valor de una habilidad radica en cómo contribuye al flujo de trabajo agente general y a la ejecución posterior», afirmó Wang. «Por lo tanto, el aprendizaje por refuerzo proporciona un marco más adecuado, ya que permite al agente evaluar y seleccionar habilidades en función de su utilidad a largo plazo».
Para evitar la regresión en un entorno de producción, las mutaciones automatizadas de habilidades están protegidas por una puerta automática de prueba unitaria. El sistema genera un caso de prueba sintético, lo ejecuta a través de la habilidad actualizada y verifica los resultados antes de guardar los cambios en la biblioteca global.
Al reescribir y perfeccionar continuamente sus propias herramientas ejecutables, Memento-Skills permite que un modelo de lenguaje congelado desarrolle una memoria muscular sólida y amplíe progresivamente sus capacidades de un extremo a otro.
Poniendo a prueba el agente que evoluciona a sí mismo
Los investigadores evaluaron Memento-Skills según dos puntos de referencia rigurosos. El primero es Asistentes generales de IA (GAIA), que requiere un razonamiento complejo de varios pasos, manejo multimodal, navegación web y uso de herramientas. El segundo es El último examen de la humanidado HLE, un punto de referencia de nivel experto que abarca ocho materias académicas diversas, como matemáticas y biología. Todo el sistema estaba alimentado por Géminis-3.1-Flash actuando como el modelo de lenguaje congelado subyacente.
El sistema se comparó con una base de lectura y escritura que recupera habilidades y recopila comentarios, pero no tiene funciones de evolución automática. Los investigadores también probaron su enrutador de habilidades personalizado con líneas de base de recuperación semántica estándar, incluidas BM25 y Incrustaciones de Qwen3.
Los resultados demostraron que la memoria que evoluciona activamente supera ampliamente a una biblioteca de habilidades estática. En el punto de referencia GAIA, de gran diversidad, Memento-Skills mejoró la precisión del conjunto de pruebas en 13,7 puntos porcentuales con respecto a la línea de base estática, logrando un 66,0 % en comparación con un 52,3 %. En el punto de referencia HLE, donde la estructura del dominio permitió la reutilización masiva de habilidades entre tareas, el sistema duplicó con creces el rendimiento de la línea base, saltando del 17,9% al 38,7%.
Además, el enrutador de habilidades especializado de Memento-Skills evita la clásica trampa de recuperación en la que se selecciona una habilidad irrelevante simplemente por similitud semántica. Los experimentos muestran que Memento-Skills aumenta las tasas de éxito de las tareas de un extremo a otro al 80 %, en comparación con solo el 50 % de la recuperación estándar BM25.
Los investigadores observaron que Memento-Skills gestiona este desempeño a través de un crecimiento de habilidades estructurado y altamente orgánico. Ambos experimentos de referencia comenzaron con solo cinco habilidades de semillas atómicas, como búsqueda web básica y operaciones de terminal. En el punto de referencia GAIA, el agente expandió de forma autónoma este grupo inicial en una biblioteca compacta de 41 habilidades para manejar las diversas tareas. En el punto de referencia HLE de nivel experto, el sistema amplió dinámicamente su biblioteca a 235 habilidades distintas.
Encontrar el punto ideal de la empresa
Los investigadores han publicado el código para Memento-Skills en GitHuby está disponible para su uso.
Para los arquitectos empresariales, la eficacia de este sistema depende de la alineación del dominio. En lugar de simplemente observar las puntuaciones de referencia, la principal desventaja del negocio radica en si sus agentes manejan tareas aisladas o flujos de trabajo estructurados.
«La transferencia de habilidades depende del grado de similitud entre las tareas», afirmó Wang. «En primer lugar, cuando las tareas están aisladas o débilmente relacionadas, el agente no puede confiar en la experiencia previa y debe aprender a través de la interacción». En entornos tan dispersos, la transferencia entre tareas es limitada. «En segundo lugar, cuando las tareas comparten una estructura sustancial, las habilidades previamente adquiridas se pueden reutilizar directamente. Aquí, el aprendizaje se vuelve más eficiente porque el conocimiento se transfiere entre tareas, lo que permite al agente desempeñarse bien en nuevos problemas con poca o ninguna interacción adicional».
Dado que el sistema requiere patrones de tareas recurrentes para consolidar el conocimiento, los líderes empresariales necesitan saber exactamente dónde implementarlo hoy y dónde esperar.
«Los flujos de trabajo son probablemente el entorno más apropiado para este enfoque, ya que proporcionan un entorno estructurado en el que se pueden componer, evaluar y mejorar las habilidades», dijo Wang.
Sin embargo, advirtió contra el despliegue excesivo en áreas que aún no son adecuadas para el marco. «Los agentes físicos permanecen en gran medida inexplorados en este contexto y requieren más investigación. Además, las tareas con horizontes más largos pueden exigir enfoques más avanzados, como sistemas LLM de múltiples agentes, para permitir la coordinación, planificación y ejecución sostenida a lo largo de secuencias extendidas de decisiones».
A medida que la industria avanza hacia agentes que reescriben de forma autónoma su propio código de producción, la gobernanza y la seguridad siguen siendo primordiales. Si bien Memento-Skills emplea barreras de seguridad fundamentales, como puertas automáticas de prueba unitaria, probablemente se necesitará un marco más amplio para la adopción empresarial.
«Para permitir una superación personal confiable, necesitamos un sistema de evaluación o evaluación bien diseñado que pueda evaluar el desempeño y proporcionar una orientación consistente», dijo Wang. «En lugar de permitir una automodificación sin restricciones, el proceso debería estructurarse como una forma guiada de autodesarrollo, donde la retroalimentación orienta al agente hacia mejores diseños».
Un desafío importante en el despliegue de agentes autónomos es construir sistemas que puedan adaptarse a los cambios en sus entornos sin la necesidad de volver a entrenar los modelos de lenguajes grandes (LLM) subyacentes.
Habilidades de recuerdoun nuevo marco desarrollado por investigadores de varias universidades, aborda este cuello de botella al brindar a los agentes la capacidad de desarrollar sus habilidades por sí mismos. «Agrega su aprendizaje continuo capacidad a la oferta existente en el mercado actual, como OpenClaw y Claude Code», dijo a VentureBeat Jun Wang, coautor del artículo.
Memento-Skills actúa como una memoria externa en evolución, permitiendo que el sistema mejore progresivamente sus capacidades sin modificar el modelo subyacente. El marco proporciona un conjunto de habilidades que pueden actualizarse y ampliarse a medida que el agente recibe retroalimentación de su entorno.
Para los equipos empresariales que ejecutan agentes en producción, eso es importante. La alternativa (ajustar los pesos del modelo o desarrollar habilidades manualmente) conlleva importantes gastos operativos y requisitos de datos. Memento-Skills evita ambos.
Los desafíos de construir agentes que evolucionan a sí mismos
Los agentes que evolucionan a sí mismos son cruciales porque superan las limitaciones de los modelos de lenguaje congelados. Una vez que se implementa un modelo, sus parámetros permanecen fijos, restringiéndolo al conocimiento codificado durante el entrenamiento y a todo lo que encaje en su ventana de contexto inmediato.
Darle al modelo una estructura de memoria externa le permite mejorar sin el costoso y lento proceso de reentrenamiento. Sin embargo, los enfoques actuales para la adaptación de agentes se basan en gran medida en habilidades diseñadas manualmente para manejar nuevas tareas. Si bien existen algunos métodos automáticos de aprendizaje de habilidades, en su mayoría producen guías de solo texto que equivalen a una optimización rápida. Otros enfoques simplemente registran trayectorias de una sola tarea que no se transfieren entre diferentes tareas.
Además, cuando estos agentes intentan recuperar conocimiento relevante para una nueva tarea, normalmente dependen de enrutadores de similitud semántica, como incrustaciones densas estándar; una alta superposición semántica no garantiza la utilidad conductual. Un agente que dependa del RAG estándar podría recuperar un script de «restablecimiento de contraseña» para resolver una consulta de «procesamiento de reembolso» simplemente porque los documentos comparten terminología empresarial.
«La mayoría de los sistemas de recuperación de generación aumentada (RAG) se basan en la recuperación basada en similitudes. Sin embargo, cuando las habilidades se representan como artefactos ejecutables, como documentos de rebajas o fragmentos de código, la similitud por sí sola puede no seleccionar la habilidad más efectiva», dijo Wang.
Cómo Memento-Skills almacena y actualiza las habilidades
Para resolver las limitaciones de los sistemas agentes actuales, los investigadores construyeron Memento-Skills. El artículo describe el sistema como «un sistema de agentes LLM generalista y de aprendizaje continuo que funciona como un agente de diseño de agentes». En lugar de mantener un registro pasivo de conversaciones pasadas, Memento-Skills crea un conjunto de habilidades que actúan como una memoria externa persistente y en evolución.
Estas habilidades se almacenan como archivos de rebajas estructurados y sirven como base de conocimientos en evolución del agente. Cada artefacto de habilidad reutilizable se compone de tres elementos centrales. Contiene especificaciones declarativas que describen qué es la habilidad y cómo debe usarse. Incluye instrucciones especializadas e indicaciones que guían el razonamiento del modelo de lenguaje. Y alberga el código ejecutable y los scripts auxiliares que ejecuta el agente para resolver la tarea.
Memento-Skills logra un aprendizaje continuo a través de su mecanismo de «aprendizaje reflexivo de lectura y escritura», que enmarca las actualizaciones de la memoria como una iteración de políticas activas en lugar de un registro de datos pasivo. Cuando se enfrenta a una nueva tarea, el agente consulta un enrutador de habilidades especializado para recuperar la habilidad más relevante desde el punto de vista del comportamiento (no solo la más semánticamente similar) y la ejecuta.
Después de que el agente ejecuta la habilidad y recibe retroalimentación, el sistema reflexiona sobre el resultado para cerrar el ciclo de aprendizaje. En lugar de simplemente agregar un registro de lo sucedido, el sistema muta activamente su memoria. Si la ejecución falla, un orquestador evalúa el seguimiento y reescribe los artefactos de habilidad. Esto significa que actualiza directamente el código o solicita parchear el modo de falla específico. En caso de necesidad, crea una habilidad completamente nueva.
Memento-Skills también actualiza el enrutador de habilidades a través de un proceso de aprendizaje de refuerzo fuera de línea de un solo paso que aprende de los comentarios de ejecución en lugar de solo la superposición de texto. «El verdadero valor de una habilidad radica en cómo contribuye al flujo de trabajo agente general y a la ejecución posterior», afirmó Wang. «Por lo tanto, el aprendizaje por refuerzo proporciona un marco más adecuado, ya que permite al agente evaluar y seleccionar habilidades en función de su utilidad a largo plazo».
Para evitar la regresión en un entorno de producción, las mutaciones automatizadas de habilidades están protegidas por una puerta automática de prueba unitaria. El sistema genera un caso de prueba sintético, lo ejecuta a través de la habilidad actualizada y verifica los resultados antes de guardar los cambios en la biblioteca global.
Al reescribir y perfeccionar continuamente sus propias herramientas ejecutables, Memento-Skills permite que un modelo de lenguaje congelado desarrolle una memoria muscular sólida y amplíe progresivamente sus capacidades de un extremo a otro.
Poniendo a prueba el agente que evoluciona a sí mismo
Los investigadores evaluaron Memento-Skills según dos puntos de referencia rigurosos. El primero es Asistentes generales de IA (GAIA), que requiere un razonamiento complejo de varios pasos, manejo multimodal, navegación web y uso de herramientas. El segundo es El último examen de la humanidado HLE, un punto de referencia de nivel experto que abarca ocho materias académicas diversas, como matemáticas y biología. Todo el sistema estaba alimentado por Géminis-3.1-Flash actuando como el modelo de lenguaje congelado subyacente.
El sistema se comparó con una base de lectura y escritura que recupera habilidades y recopila comentarios, pero no tiene funciones de evolución automática. Los investigadores también probaron su enrutador de habilidades personalizado con líneas de base de recuperación semántica estándar, incluidas BM25 y Incrustaciones de Qwen3.
Los resultados demostraron que la memoria que evoluciona activamente supera ampliamente a una biblioteca de habilidades estática. En el punto de referencia GAIA, de gran diversidad, Memento-Skills mejoró la precisión del conjunto de pruebas en 13,7 puntos porcentuales con respecto a la línea de base estática, logrando un 66,0 % en comparación con un 52,3 %. En el punto de referencia HLE, donde la estructura del dominio permitió la reutilización masiva de habilidades entre tareas, el sistema duplicó con creces el rendimiento de la línea base, saltando del 17,9% al 38,7%.
Además, el enrutador de habilidades especializado de Memento-Skills evita la clásica trampa de recuperación en la que se selecciona una habilidad irrelevante simplemente por similitud semántica. Los experimentos muestran que Memento-Skills aumenta las tasas de éxito de las tareas de un extremo a otro al 80 %, en comparación con solo el 50 % de la recuperación estándar BM25.
Los investigadores observaron que Memento-Skills gestiona este desempeño a través de un crecimiento de habilidades estructurado y altamente orgánico. Ambos experimentos de referencia comenzaron con solo cinco habilidades de semillas atómicas, como búsqueda web básica y operaciones de terminal. En el punto de referencia GAIA, el agente expandió de forma autónoma este grupo inicial en una biblioteca compacta de 41 habilidades para manejar las diversas tareas. En el punto de referencia HLE de nivel experto, el sistema amplió dinámicamente su biblioteca a 235 habilidades distintas.
Encontrar el punto ideal de la empresa
Los investigadores han publicado el código para Memento-Skills en GitHuby está disponible para su uso.
Para los arquitectos empresariales, la eficacia de este sistema depende de la alineación del dominio. En lugar de simplemente observar las puntuaciones de referencia, la principal desventaja del negocio radica en si sus agentes manejan tareas aisladas o flujos de trabajo estructurados.
«La transferencia de habilidades depende del grado de similitud entre las tareas», afirmó Wang. «En primer lugar, cuando las tareas están aisladas o débilmente relacionadas, el agente no puede confiar en la experiencia previa y debe aprender a través de la interacción». En entornos tan dispersos, la transferencia entre tareas es limitada. «En segundo lugar, cuando las tareas comparten una estructura sustancial, las habilidades previamente adquiridas se pueden reutilizar directamente. Aquí, el aprendizaje se vuelve más eficiente porque el conocimiento se transfiere entre tareas, lo que permite al agente desempeñarse bien en nuevos problemas con poca o ninguna interacción adicional».
Dado que el sistema requiere patrones de tareas recurrentes para consolidar el conocimiento, los líderes empresariales necesitan saber exactamente dónde implementarlo hoy y dónde esperar.
«Los flujos de trabajo son probablemente el entorno más apropiado para este enfoque, ya que proporcionan un entorno estructurado en el que se pueden componer, evaluar y mejorar las habilidades», dijo Wang.
Sin embargo, advirtió contra el despliegue excesivo en áreas que aún no son adecuadas para el marco. «Los agentes físicos permanecen en gran medida inexplorados en este contexto y requieren más investigación. Además, las tareas con horizontes más largos pueden exigir enfoques más avanzados, como sistemas LLM de múltiples agentes, para permitir la coordinación, planificación y ejecución sostenida a lo largo de secuencias extendidas de decisiones».
A medida que la industria avanza hacia agentes que reescriben de forma autónoma su propio código de producción, la gobernanza y la seguridad siguen siendo primordiales. Si bien Memento-Skills emplea barreras de seguridad fundamentales, como puertas automáticas de prueba unitaria, probablemente se necesitará un marco más amplio para la adopción empresarial.
«Para permitir una superación personal confiable, necesitamos un sistema de evaluación o evaluación bien diseñado que pueda evaluar el desempeño y proporcionar una orientación consistente», dijo Wang. «En lugar de permitir una automodificación sin restricciones, el proceso debería estructurarse como una forma guiada de autodesarrollo, donde la retroalimentación orienta al agente hacia mejores diseños».
Un desafío importante en el despliegue de agentes autónomos es construir sistemas que puedan adaptarse a los cambios en sus entornos sin la necesidad de volver a entrenar los modelos de lenguajes grandes (LLM) subyacentes.
Habilidades de recuerdoun nuevo marco desarrollado por investigadores de varias universidades, aborda este cuello de botella al brindar a los agentes la capacidad de desarrollar sus habilidades por sí mismos. «Agrega su aprendizaje continuo capacidad a la oferta existente en el mercado actual, como OpenClaw y Claude Code», dijo a VentureBeat Jun Wang, coautor del artículo.
Memento-Skills actúa como una memoria externa en evolución, permitiendo que el sistema mejore progresivamente sus capacidades sin modificar el modelo subyacente. El marco proporciona un conjunto de habilidades que pueden actualizarse y ampliarse a medida que el agente recibe retroalimentación de su entorno.
Para los equipos empresariales que ejecutan agentes en producción, eso es importante. La alternativa (ajustar los pesos del modelo o desarrollar habilidades manualmente) conlleva importantes gastos operativos y requisitos de datos. Memento-Skills evita ambos.
Los desafíos de construir agentes que evolucionan a sí mismos
Los agentes que evolucionan a sí mismos son cruciales porque superan las limitaciones de los modelos de lenguaje congelados. Una vez que se implementa un modelo, sus parámetros permanecen fijos, restringiéndolo al conocimiento codificado durante el entrenamiento y a todo lo que encaje en su ventana de contexto inmediato.
Darle al modelo una estructura de memoria externa le permite mejorar sin el costoso y lento proceso de reentrenamiento. Sin embargo, los enfoques actuales para la adaptación de agentes se basan en gran medida en habilidades diseñadas manualmente para manejar nuevas tareas. Si bien existen algunos métodos automáticos de aprendizaje de habilidades, en su mayoría producen guías de solo texto que equivalen a una optimización rápida. Otros enfoques simplemente registran trayectorias de una sola tarea que no se transfieren entre diferentes tareas.
Además, cuando estos agentes intentan recuperar conocimiento relevante para una nueva tarea, normalmente dependen de enrutadores de similitud semántica, como incrustaciones densas estándar; una alta superposición semántica no garantiza la utilidad conductual. Un agente que dependa del RAG estándar podría recuperar un script de «restablecimiento de contraseña» para resolver una consulta de «procesamiento de reembolso» simplemente porque los documentos comparten terminología empresarial.
«La mayoría de los sistemas de recuperación de generación aumentada (RAG) se basan en la recuperación basada en similitudes. Sin embargo, cuando las habilidades se representan como artefactos ejecutables, como documentos de rebajas o fragmentos de código, la similitud por sí sola puede no seleccionar la habilidad más efectiva», dijo Wang.
Cómo Memento-Skills almacena y actualiza las habilidades
Para resolver las limitaciones de los sistemas agentes actuales, los investigadores construyeron Memento-Skills. El artículo describe el sistema como «un sistema de agentes LLM generalista y de aprendizaje continuo que funciona como un agente de diseño de agentes». En lugar de mantener un registro pasivo de conversaciones pasadas, Memento-Skills crea un conjunto de habilidades que actúan como una memoria externa persistente y en evolución.
Estas habilidades se almacenan como archivos de rebajas estructurados y sirven como base de conocimientos en evolución del agente. Cada artefacto de habilidad reutilizable se compone de tres elementos centrales. Contiene especificaciones declarativas que describen qué es la habilidad y cómo debe usarse. Incluye instrucciones especializadas e indicaciones que guían el razonamiento del modelo de lenguaje. Y alberga el código ejecutable y los scripts auxiliares que ejecuta el agente para resolver la tarea.
Memento-Skills logra un aprendizaje continuo a través de su mecanismo de «aprendizaje reflexivo de lectura y escritura», que enmarca las actualizaciones de la memoria como una iteración de políticas activas en lugar de un registro de datos pasivo. Cuando se enfrenta a una nueva tarea, el agente consulta un enrutador de habilidades especializado para recuperar la habilidad más relevante desde el punto de vista del comportamiento (no solo la más semánticamente similar) y la ejecuta.
Después de que el agente ejecuta la habilidad y recibe retroalimentación, el sistema reflexiona sobre el resultado para cerrar el ciclo de aprendizaje. En lugar de simplemente agregar un registro de lo sucedido, el sistema muta activamente su memoria. Si la ejecución falla, un orquestador evalúa el seguimiento y reescribe los artefactos de habilidad. Esto significa que actualiza directamente el código o solicita parchear el modo de falla específico. En caso de necesidad, crea una habilidad completamente nueva.
Memento-Skills también actualiza el enrutador de habilidades a través de un proceso de aprendizaje de refuerzo fuera de línea de un solo paso que aprende de los comentarios de ejecución en lugar de solo la superposición de texto. «El verdadero valor de una habilidad radica en cómo contribuye al flujo de trabajo agente general y a la ejecución posterior», afirmó Wang. «Por lo tanto, el aprendizaje por refuerzo proporciona un marco más adecuado, ya que permite al agente evaluar y seleccionar habilidades en función de su utilidad a largo plazo».
Para evitar la regresión en un entorno de producción, las mutaciones automatizadas de habilidades están protegidas por una puerta automática de prueba unitaria. El sistema genera un caso de prueba sintético, lo ejecuta a través de la habilidad actualizada y verifica los resultados antes de guardar los cambios en la biblioteca global.
Al reescribir y perfeccionar continuamente sus propias herramientas ejecutables, Memento-Skills permite que un modelo de lenguaje congelado desarrolle una memoria muscular sólida y amplíe progresivamente sus capacidades de un extremo a otro.
Poniendo a prueba el agente que evoluciona a sí mismo
Los investigadores evaluaron Memento-Skills según dos puntos de referencia rigurosos. El primero es Asistentes generales de IA (GAIA), que requiere un razonamiento complejo de varios pasos, manejo multimodal, navegación web y uso de herramientas. El segundo es El último examen de la humanidado HLE, un punto de referencia de nivel experto que abarca ocho materias académicas diversas, como matemáticas y biología. Todo el sistema estaba alimentado por Géminis-3.1-Flash actuando como el modelo de lenguaje congelado subyacente.
El sistema se comparó con una base de lectura y escritura que recupera habilidades y recopila comentarios, pero no tiene funciones de evolución automática. Los investigadores también probaron su enrutador de habilidades personalizado con líneas de base de recuperación semántica estándar, incluidas BM25 y Incrustaciones de Qwen3.
Los resultados demostraron que la memoria que evoluciona activamente supera ampliamente a una biblioteca de habilidades estática. En el punto de referencia GAIA, de gran diversidad, Memento-Skills mejoró la precisión del conjunto de pruebas en 13,7 puntos porcentuales con respecto a la línea de base estática, logrando un 66,0 % en comparación con un 52,3 %. En el punto de referencia HLE, donde la estructura del dominio permitió la reutilización masiva de habilidades entre tareas, el sistema duplicó con creces el rendimiento de la línea base, saltando del 17,9% al 38,7%.
Además, el enrutador de habilidades especializado de Memento-Skills evita la clásica trampa de recuperación en la que se selecciona una habilidad irrelevante simplemente por similitud semántica. Los experimentos muestran que Memento-Skills aumenta las tasas de éxito de las tareas de un extremo a otro al 80 %, en comparación con solo el 50 % de la recuperación estándar BM25.
Los investigadores observaron que Memento-Skills gestiona este desempeño a través de un crecimiento de habilidades estructurado y altamente orgánico. Ambos experimentos de referencia comenzaron con solo cinco habilidades de semillas atómicas, como búsqueda web básica y operaciones de terminal. En el punto de referencia GAIA, el agente expandió de forma autónoma este grupo inicial en una biblioteca compacta de 41 habilidades para manejar las diversas tareas. En el punto de referencia HLE de nivel experto, el sistema amplió dinámicamente su biblioteca a 235 habilidades distintas.
Encontrar el punto ideal de la empresa
Los investigadores han publicado el código para Memento-Skills en GitHuby está disponible para su uso.
Para los arquitectos empresariales, la eficacia de este sistema depende de la alineación del dominio. En lugar de simplemente observar las puntuaciones de referencia, la principal desventaja del negocio radica en si sus agentes manejan tareas aisladas o flujos de trabajo estructurados.
«La transferencia de habilidades depende del grado de similitud entre las tareas», afirmó Wang. «En primer lugar, cuando las tareas están aisladas o débilmente relacionadas, el agente no puede confiar en la experiencia previa y debe aprender a través de la interacción». En entornos tan dispersos, la transferencia entre tareas es limitada. «En segundo lugar, cuando las tareas comparten una estructura sustancial, las habilidades previamente adquiridas se pueden reutilizar directamente. Aquí, el aprendizaje se vuelve más eficiente porque el conocimiento se transfiere entre tareas, lo que permite al agente desempeñarse bien en nuevos problemas con poca o ninguna interacción adicional».
Dado que el sistema requiere patrones de tareas recurrentes para consolidar el conocimiento, los líderes empresariales necesitan saber exactamente dónde implementarlo hoy y dónde esperar.
«Los flujos de trabajo son probablemente el entorno más apropiado para este enfoque, ya que proporcionan un entorno estructurado en el que se pueden componer, evaluar y mejorar las habilidades», dijo Wang.
Sin embargo, advirtió contra el despliegue excesivo en áreas que aún no son adecuadas para el marco. «Los agentes físicos permanecen en gran medida inexplorados en este contexto y requieren más investigación. Además, las tareas con horizontes más largos pueden exigir enfoques más avanzados, como sistemas LLM de múltiples agentes, para permitir la coordinación, planificación y ejecución sostenida a lo largo de secuencias extendidas de decisiones».
A medida que la industria avanza hacia agentes que reescriben de forma autónoma su propio código de producción, la gobernanza y la seguridad siguen siendo primordiales. Si bien Memento-Skills emplea barreras de seguridad fundamentales, como puertas automáticas de prueba unitaria, probablemente se necesitará un marco más amplio para la adopción empresarial.
«Para permitir una superación personal confiable, necesitamos un sistema de evaluación o evaluación bien diseñado que pueda evaluar el desempeño y proporcionar una orientación consistente», dijo Wang. «En lugar de permitir una automodificación sin restricciones, el proceso debería estructurarse como una forma guiada de autodesarrollo, donde la retroalimentación orienta al agente hacia mejores diseños».
Un desafío importante en el despliegue de agentes autónomos es construir sistemas que puedan adaptarse a los cambios en sus entornos sin la necesidad de volver a entrenar los modelos de lenguajes grandes (LLM) subyacentes.
Habilidades de recuerdoun nuevo marco desarrollado por investigadores de varias universidades, aborda este cuello de botella al brindar a los agentes la capacidad de desarrollar sus habilidades por sí mismos. «Agrega su aprendizaje continuo capacidad a la oferta existente en el mercado actual, como OpenClaw y Claude Code», dijo a VentureBeat Jun Wang, coautor del artículo.
Memento-Skills actúa como una memoria externa en evolución, permitiendo que el sistema mejore progresivamente sus capacidades sin modificar el modelo subyacente. El marco proporciona un conjunto de habilidades que pueden actualizarse y ampliarse a medida que el agente recibe retroalimentación de su entorno.
Para los equipos empresariales que ejecutan agentes en producción, eso es importante. La alternativa (ajustar los pesos del modelo o desarrollar habilidades manualmente) conlleva importantes gastos operativos y requisitos de datos. Memento-Skills evita ambos.
Los desafíos de construir agentes que evolucionan a sí mismos
Los agentes que evolucionan a sí mismos son cruciales porque superan las limitaciones de los modelos de lenguaje congelados. Una vez que se implementa un modelo, sus parámetros permanecen fijos, restringiéndolo al conocimiento codificado durante el entrenamiento y a todo lo que encaje en su ventana de contexto inmediato.
Darle al modelo una estructura de memoria externa le permite mejorar sin el costoso y lento proceso de reentrenamiento. Sin embargo, los enfoques actuales para la adaptación de agentes se basan en gran medida en habilidades diseñadas manualmente para manejar nuevas tareas. Si bien existen algunos métodos automáticos de aprendizaje de habilidades, en su mayoría producen guías de solo texto que equivalen a una optimización rápida. Otros enfoques simplemente registran trayectorias de una sola tarea que no se transfieren entre diferentes tareas.
Además, cuando estos agentes intentan recuperar conocimiento relevante para una nueva tarea, normalmente dependen de enrutadores de similitud semántica, como incrustaciones densas estándar; una alta superposición semántica no garantiza la utilidad conductual. Un agente que dependa del RAG estándar podría recuperar un script de «restablecimiento de contraseña» para resolver una consulta de «procesamiento de reembolso» simplemente porque los documentos comparten terminología empresarial.
«La mayoría de los sistemas de recuperación de generación aumentada (RAG) se basan en la recuperación basada en similitudes. Sin embargo, cuando las habilidades se representan como artefactos ejecutables, como documentos de rebajas o fragmentos de código, la similitud por sí sola puede no seleccionar la habilidad más efectiva», dijo Wang.
Cómo Memento-Skills almacena y actualiza las habilidades
Para resolver las limitaciones de los sistemas agentes actuales, los investigadores construyeron Memento-Skills. El artículo describe el sistema como «un sistema de agentes LLM generalista y de aprendizaje continuo que funciona como un agente de diseño de agentes». En lugar de mantener un registro pasivo de conversaciones pasadas, Memento-Skills crea un conjunto de habilidades que actúan como una memoria externa persistente y en evolución.
Estas habilidades se almacenan como archivos de rebajas estructurados y sirven como base de conocimientos en evolución del agente. Cada artefacto de habilidad reutilizable se compone de tres elementos centrales. Contiene especificaciones declarativas que describen qué es la habilidad y cómo debe usarse. Incluye instrucciones especializadas e indicaciones que guían el razonamiento del modelo de lenguaje. Y alberga el código ejecutable y los scripts auxiliares que ejecuta el agente para resolver la tarea.
Memento-Skills logra un aprendizaje continuo a través de su mecanismo de «aprendizaje reflexivo de lectura y escritura», que enmarca las actualizaciones de la memoria como una iteración de políticas activas en lugar de un registro de datos pasivo. Cuando se enfrenta a una nueva tarea, el agente consulta un enrutador de habilidades especializado para recuperar la habilidad más relevante desde el punto de vista del comportamiento (no solo la más semánticamente similar) y la ejecuta.
Después de que el agente ejecuta la habilidad y recibe retroalimentación, el sistema reflexiona sobre el resultado para cerrar el ciclo de aprendizaje. En lugar de simplemente agregar un registro de lo sucedido, el sistema muta activamente su memoria. Si la ejecución falla, un orquestador evalúa el seguimiento y reescribe los artefactos de habilidad. Esto significa que actualiza directamente el código o solicita parchear el modo de falla específico. En caso de necesidad, crea una habilidad completamente nueva.
Memento-Skills también actualiza el enrutador de habilidades a través de un proceso de aprendizaje de refuerzo fuera de línea de un solo paso que aprende de los comentarios de ejecución en lugar de solo la superposición de texto. «El verdadero valor de una habilidad radica en cómo contribuye al flujo de trabajo agente general y a la ejecución posterior», afirmó Wang. «Por lo tanto, el aprendizaje por refuerzo proporciona un marco más adecuado, ya que permite al agente evaluar y seleccionar habilidades en función de su utilidad a largo plazo».
Para evitar la regresión en un entorno de producción, las mutaciones automatizadas de habilidades están protegidas por una puerta automática de prueba unitaria. El sistema genera un caso de prueba sintético, lo ejecuta a través de la habilidad actualizada y verifica los resultados antes de guardar los cambios en la biblioteca global.
Al reescribir y perfeccionar continuamente sus propias herramientas ejecutables, Memento-Skills permite que un modelo de lenguaje congelado desarrolle una memoria muscular sólida y amplíe progresivamente sus capacidades de un extremo a otro.
Poniendo a prueba el agente que evoluciona a sí mismo
Los investigadores evaluaron Memento-Skills según dos puntos de referencia rigurosos. El primero es Asistentes generales de IA (GAIA), que requiere un razonamiento complejo de varios pasos, manejo multimodal, navegación web y uso de herramientas. El segundo es El último examen de la humanidado HLE, un punto de referencia de nivel experto que abarca ocho materias académicas diversas, como matemáticas y biología. Todo el sistema estaba alimentado por Géminis-3.1-Flash actuando como el modelo de lenguaje congelado subyacente.
El sistema se comparó con una base de lectura y escritura que recupera habilidades y recopila comentarios, pero no tiene funciones de evolución automática. Los investigadores también probaron su enrutador de habilidades personalizado con líneas de base de recuperación semántica estándar, incluidas BM25 y Incrustaciones de Qwen3.
Los resultados demostraron que la memoria que evoluciona activamente supera ampliamente a una biblioteca de habilidades estática. En el punto de referencia GAIA, de gran diversidad, Memento-Skills mejoró la precisión del conjunto de pruebas en 13,7 puntos porcentuales con respecto a la línea de base estática, logrando un 66,0 % en comparación con un 52,3 %. En el punto de referencia HLE, donde la estructura del dominio permitió la reutilización masiva de habilidades entre tareas, el sistema duplicó con creces el rendimiento de la línea base, saltando del 17,9% al 38,7%.
Además, el enrutador de habilidades especializado de Memento-Skills evita la clásica trampa de recuperación en la que se selecciona una habilidad irrelevante simplemente por similitud semántica. Los experimentos muestran que Memento-Skills aumenta las tasas de éxito de las tareas de un extremo a otro al 80 %, en comparación con solo el 50 % de la recuperación estándar BM25.
Los investigadores observaron que Memento-Skills gestiona este desempeño a través de un crecimiento de habilidades estructurado y altamente orgánico. Ambos experimentos de referencia comenzaron con solo cinco habilidades de semillas atómicas, como búsqueda web básica y operaciones de terminal. En el punto de referencia GAIA, el agente expandió de forma autónoma este grupo inicial en una biblioteca compacta de 41 habilidades para manejar las diversas tareas. En el punto de referencia HLE de nivel experto, el sistema amplió dinámicamente su biblioteca a 235 habilidades distintas.
Encontrar el punto ideal de la empresa
Los investigadores han publicado el código para Memento-Skills en GitHuby está disponible para su uso.
Para los arquitectos empresariales, la eficacia de este sistema depende de la alineación del dominio. En lugar de simplemente observar las puntuaciones de referencia, la principal desventaja del negocio radica en si sus agentes manejan tareas aisladas o flujos de trabajo estructurados.
«La transferencia de habilidades depende del grado de similitud entre las tareas», afirmó Wang. «En primer lugar, cuando las tareas están aisladas o débilmente relacionadas, el agente no puede confiar en la experiencia previa y debe aprender a través de la interacción». En entornos tan dispersos, la transferencia entre tareas es limitada. «En segundo lugar, cuando las tareas comparten una estructura sustancial, las habilidades previamente adquiridas se pueden reutilizar directamente. Aquí, el aprendizaje se vuelve más eficiente porque el conocimiento se transfiere entre tareas, lo que permite al agente desempeñarse bien en nuevos problemas con poca o ninguna interacción adicional».
Dado que el sistema requiere patrones de tareas recurrentes para consolidar el conocimiento, los líderes empresariales necesitan saber exactamente dónde implementarlo hoy y dónde esperar.
«Los flujos de trabajo son probablemente el entorno más apropiado para este enfoque, ya que proporcionan un entorno estructurado en el que se pueden componer, evaluar y mejorar las habilidades», dijo Wang.
Sin embargo, advirtió contra el despliegue excesivo en áreas que aún no son adecuadas para el marco. «Los agentes físicos permanecen en gran medida inexplorados en este contexto y requieren más investigación. Además, las tareas con horizontes más largos pueden exigir enfoques más avanzados, como sistemas LLM de múltiples agentes, para permitir la coordinación, planificación y ejecución sostenida a lo largo de secuencias extendidas de decisiones».
A medida que la industria avanza hacia agentes que reescriben de forma autónoma su propio código de producción, la gobernanza y la seguridad siguen siendo primordiales. Si bien Memento-Skills emplea barreras de seguridad fundamentales, como puertas automáticas de prueba unitaria, probablemente se necesitará un marco más amplio para la adopción empresarial.
«Para permitir una superación personal confiable, necesitamos un sistema de evaluación o evaluación bien diseñado que pueda evaluar el desempeño y proporcionar una orientación consistente», dijo Wang. «En lugar de permitir una automodificación sin restricciones, el proceso debería estructurarse como una forma guiada de autodesarrollo, donde la retroalimentación orienta al agente hacia mejores diseños».
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Un desafío importante en el despliegue de agentes autónomos es construir sistemas que puedan adaptarse a los cambios en sus entornos sin la necesidad de volver a entrenar los modelos de lenguajes grandes (LLM) subyacentes.
Habilidades de recuerdoun nuevo marco desarrollado por investigadores de varias universidades, aborda este cuello de botella al brindar a los agentes la capacidad de desarrollar sus habilidades por sí mismos. «Agrega su aprendizaje continuo capacidad a la oferta existente en el mercado actual, como OpenClaw y Claude Code», dijo a VentureBeat Jun Wang, coautor del artículo.
Memento-Skills actúa como una memoria externa en evolución, permitiendo que el sistema mejore progresivamente sus capacidades sin modificar el modelo subyacente. El marco proporciona un conjunto de habilidades que pueden actualizarse y ampliarse a medida que el agente recibe retroalimentación de su entorno.
Para los equipos empresariales que ejecutan agentes en producción, eso es importante. La alternativa (ajustar los pesos del modelo o desarrollar habilidades manualmente) conlleva importantes gastos operativos y requisitos de datos. Memento-Skills evita ambos.
Los desafíos de construir agentes que evolucionan a sí mismos
Los agentes que evolucionan a sí mismos son cruciales porque superan las limitaciones de los modelos de lenguaje congelados. Una vez que se implementa un modelo, sus parámetros permanecen fijos, restringiéndolo al conocimiento codificado durante el entrenamiento y a todo lo que encaje en su ventana de contexto inmediato.
Darle al modelo una estructura de memoria externa le permite mejorar sin el costoso y lento proceso de reentrenamiento. Sin embargo, los enfoques actuales para la adaptación de agentes se basan en gran medida en habilidades diseñadas manualmente para manejar nuevas tareas. Si bien existen algunos métodos automáticos de aprendizaje de habilidades, en su mayoría producen guías de solo texto que equivalen a una optimización rápida. Otros enfoques simplemente registran trayectorias de una sola tarea que no se transfieren entre diferentes tareas.
Además, cuando estos agentes intentan recuperar conocimiento relevante para una nueva tarea, normalmente dependen de enrutadores de similitud semántica, como incrustaciones densas estándar; una alta superposición semántica no garantiza la utilidad conductual. Un agente que dependa del RAG estándar podría recuperar un script de «restablecimiento de contraseña» para resolver una consulta de «procesamiento de reembolso» simplemente porque los documentos comparten terminología empresarial.
«La mayoría de los sistemas de recuperación de generación aumentada (RAG) se basan en la recuperación basada en similitudes. Sin embargo, cuando las habilidades se representan como artefactos ejecutables, como documentos de rebajas o fragmentos de código, la similitud por sí sola puede no seleccionar la habilidad más efectiva», dijo Wang.
Cómo Memento-Skills almacena y actualiza las habilidades
Para resolver las limitaciones de los sistemas agentes actuales, los investigadores construyeron Memento-Skills. El artículo describe el sistema como «un sistema de agentes LLM generalista y de aprendizaje continuo que funciona como un agente de diseño de agentes». En lugar de mantener un registro pasivo de conversaciones pasadas, Memento-Skills crea un conjunto de habilidades que actúan como una memoria externa persistente y en evolución.
Estas habilidades se almacenan como archivos de rebajas estructurados y sirven como base de conocimientos en evolución del agente. Cada artefacto de habilidad reutilizable se compone de tres elementos centrales. Contiene especificaciones declarativas que describen qué es la habilidad y cómo debe usarse. Incluye instrucciones especializadas e indicaciones que guían el razonamiento del modelo de lenguaje. Y alberga el código ejecutable y los scripts auxiliares que ejecuta el agente para resolver la tarea.
Memento-Skills logra un aprendizaje continuo a través de su mecanismo de «aprendizaje reflexivo de lectura y escritura», que enmarca las actualizaciones de la memoria como una iteración de políticas activas en lugar de un registro de datos pasivo. Cuando se enfrenta a una nueva tarea, el agente consulta un enrutador de habilidades especializado para recuperar la habilidad más relevante desde el punto de vista del comportamiento (no solo la más semánticamente similar) y la ejecuta.
Después de que el agente ejecuta la habilidad y recibe retroalimentación, el sistema reflexiona sobre el resultado para cerrar el ciclo de aprendizaje. En lugar de simplemente agregar un registro de lo sucedido, el sistema muta activamente su memoria. Si la ejecución falla, un orquestador evalúa el seguimiento y reescribe los artefactos de habilidad. Esto significa que actualiza directamente el código o solicita parchear el modo de falla específico. En caso de necesidad, crea una habilidad completamente nueva.
Memento-Skills también actualiza el enrutador de habilidades a través de un proceso de aprendizaje de refuerzo fuera de línea de un solo paso que aprende de los comentarios de ejecución en lugar de solo la superposición de texto. «El verdadero valor de una habilidad radica en cómo contribuye al flujo de trabajo agente general y a la ejecución posterior», afirmó Wang. «Por lo tanto, el aprendizaje por refuerzo proporciona un marco más adecuado, ya que permite al agente evaluar y seleccionar habilidades en función de su utilidad a largo plazo».
Para evitar la regresión en un entorno de producción, las mutaciones automatizadas de habilidades están protegidas por una puerta automática de prueba unitaria. El sistema genera un caso de prueba sintético, lo ejecuta a través de la habilidad actualizada y verifica los resultados antes de guardar los cambios en la biblioteca global.
Al reescribir y perfeccionar continuamente sus propias herramientas ejecutables, Memento-Skills permite que un modelo de lenguaje congelado desarrolle una memoria muscular sólida y amplíe progresivamente sus capacidades de un extremo a otro.
Poniendo a prueba el agente que evoluciona a sí mismo
Los investigadores evaluaron Memento-Skills según dos puntos de referencia rigurosos. El primero es Asistentes generales de IA (GAIA), que requiere un razonamiento complejo de varios pasos, manejo multimodal, navegación web y uso de herramientas. El segundo es El último examen de la humanidado HLE, un punto de referencia de nivel experto que abarca ocho materias académicas diversas, como matemáticas y biología. Todo el sistema estaba alimentado por Géminis-3.1-Flash actuando como el modelo de lenguaje congelado subyacente.
El sistema se comparó con una base de lectura y escritura que recupera habilidades y recopila comentarios, pero no tiene funciones de evolución automática. Los investigadores también probaron su enrutador de habilidades personalizado con líneas de base de recuperación semántica estándar, incluidas BM25 y Incrustaciones de Qwen3.
Los resultados demostraron que la memoria que evoluciona activamente supera ampliamente a una biblioteca de habilidades estática. En el punto de referencia GAIA, de gran diversidad, Memento-Skills mejoró la precisión del conjunto de pruebas en 13,7 puntos porcentuales con respecto a la línea de base estática, logrando un 66,0 % en comparación con un 52,3 %. En el punto de referencia HLE, donde la estructura del dominio permitió la reutilización masiva de habilidades entre tareas, el sistema duplicó con creces el rendimiento de la línea base, saltando del 17,9% al 38,7%.
Además, el enrutador de habilidades especializado de Memento-Skills evita la clásica trampa de recuperación en la que se selecciona una habilidad irrelevante simplemente por similitud semántica. Los experimentos muestran que Memento-Skills aumenta las tasas de éxito de las tareas de un extremo a otro al 80 %, en comparación con solo el 50 % de la recuperación estándar BM25.
Los investigadores observaron que Memento-Skills gestiona este desempeño a través de un crecimiento de habilidades estructurado y altamente orgánico. Ambos experimentos de referencia comenzaron con solo cinco habilidades de semillas atómicas, como búsqueda web básica y operaciones de terminal. En el punto de referencia GAIA, el agente expandió de forma autónoma este grupo inicial en una biblioteca compacta de 41 habilidades para manejar las diversas tareas. En el punto de referencia HLE de nivel experto, el sistema amplió dinámicamente su biblioteca a 235 habilidades distintas.
Encontrar el punto ideal de la empresa
Los investigadores han publicado el código para Memento-Skills en GitHuby está disponible para su uso.
Para los arquitectos empresariales, la eficacia de este sistema depende de la alineación del dominio. En lugar de simplemente observar las puntuaciones de referencia, la principal desventaja del negocio radica en si sus agentes manejan tareas aisladas o flujos de trabajo estructurados.
«La transferencia de habilidades depende del grado de similitud entre las tareas», afirmó Wang. «En primer lugar, cuando las tareas están aisladas o débilmente relacionadas, el agente no puede confiar en la experiencia previa y debe aprender a través de la interacción». En entornos tan dispersos, la transferencia entre tareas es limitada. «En segundo lugar, cuando las tareas comparten una estructura sustancial, las habilidades previamente adquiridas se pueden reutilizar directamente. Aquí, el aprendizaje se vuelve más eficiente porque el conocimiento se transfiere entre tareas, lo que permite al agente desempeñarse bien en nuevos problemas con poca o ninguna interacción adicional».
Dado que el sistema requiere patrones de tareas recurrentes para consolidar el conocimiento, los líderes empresariales necesitan saber exactamente dónde implementarlo hoy y dónde esperar.
«Los flujos de trabajo son probablemente el entorno más apropiado para este enfoque, ya que proporcionan un entorno estructurado en el que se pueden componer, evaluar y mejorar las habilidades», dijo Wang.
Sin embargo, advirtió contra el despliegue excesivo en áreas que aún no son adecuadas para el marco. «Los agentes físicos permanecen en gran medida inexplorados en este contexto y requieren más investigación. Además, las tareas con horizontes más largos pueden exigir enfoques más avanzados, como sistemas LLM de múltiples agentes, para permitir la coordinación, planificación y ejecución sostenida a lo largo de secuencias extendidas de decisiones».
A medida que la industria avanza hacia agentes que reescriben de forma autónoma su propio código de producción, la gobernanza y la seguridad siguen siendo primordiales. Si bien Memento-Skills emplea barreras de seguridad fundamentales, como puertas automáticas de prueba unitaria, probablemente se necesitará un marco más amplio para la adopción empresarial.
«Para permitir una superación personal confiable, necesitamos un sistema de evaluación o evaluación bien diseñado que pueda evaluar el desempeño y proporcionar una orientación consistente», dijo Wang. «En lugar de permitir una automodificación sin restricciones, el proceso debería estructurarse como una forma guiada de autodesarrollo, donde la retroalimentación orienta al agente hacia mejores diseños».
Un desafío importante en el despliegue de agentes autónomos es construir sistemas que puedan adaptarse a los cambios en sus entornos sin la necesidad de volver a entrenar los modelos de lenguajes grandes (LLM) subyacentes.
Habilidades de recuerdoun nuevo marco desarrollado por investigadores de varias universidades, aborda este cuello de botella al brindar a los agentes la capacidad de desarrollar sus habilidades por sí mismos. «Agrega su aprendizaje continuo capacidad a la oferta existente en el mercado actual, como OpenClaw y Claude Code», dijo a VentureBeat Jun Wang, coautor del artículo.
Memento-Skills actúa como una memoria externa en evolución, permitiendo que el sistema mejore progresivamente sus capacidades sin modificar el modelo subyacente. El marco proporciona un conjunto de habilidades que pueden actualizarse y ampliarse a medida que el agente recibe retroalimentación de su entorno.
Para los equipos empresariales que ejecutan agentes en producción, eso es importante. La alternativa (ajustar los pesos del modelo o desarrollar habilidades manualmente) conlleva importantes gastos operativos y requisitos de datos. Memento-Skills evita ambos.
Los desafíos de construir agentes que evolucionan a sí mismos
Los agentes que evolucionan a sí mismos son cruciales porque superan las limitaciones de los modelos de lenguaje congelados. Una vez que se implementa un modelo, sus parámetros permanecen fijos, restringiéndolo al conocimiento codificado durante el entrenamiento y a todo lo que encaje en su ventana de contexto inmediato.
Darle al modelo una estructura de memoria externa le permite mejorar sin el costoso y lento proceso de reentrenamiento. Sin embargo, los enfoques actuales para la adaptación de agentes se basan en gran medida en habilidades diseñadas manualmente para manejar nuevas tareas. Si bien existen algunos métodos automáticos de aprendizaje de habilidades, en su mayoría producen guías de solo texto que equivalen a una optimización rápida. Otros enfoques simplemente registran trayectorias de una sola tarea que no se transfieren entre diferentes tareas.
Además, cuando estos agentes intentan recuperar conocimiento relevante para una nueva tarea, normalmente dependen de enrutadores de similitud semántica, como incrustaciones densas estándar; una alta superposición semántica no garantiza la utilidad conductual. Un agente que dependa del RAG estándar podría recuperar un script de «restablecimiento de contraseña» para resolver una consulta de «procesamiento de reembolso» simplemente porque los documentos comparten terminología empresarial.
«La mayoría de los sistemas de recuperación de generación aumentada (RAG) se basan en la recuperación basada en similitudes. Sin embargo, cuando las habilidades se representan como artefactos ejecutables, como documentos de rebajas o fragmentos de código, la similitud por sí sola puede no seleccionar la habilidad más efectiva», dijo Wang.
Cómo Memento-Skills almacena y actualiza las habilidades
Para resolver las limitaciones de los sistemas agentes actuales, los investigadores construyeron Memento-Skills. El artículo describe el sistema como «un sistema de agentes LLM generalista y de aprendizaje continuo que funciona como un agente de diseño de agentes». En lugar de mantener un registro pasivo de conversaciones pasadas, Memento-Skills crea un conjunto de habilidades que actúan como una memoria externa persistente y en evolución.
Estas habilidades se almacenan como archivos de rebajas estructurados y sirven como base de conocimientos en evolución del agente. Cada artefacto de habilidad reutilizable se compone de tres elementos centrales. Contiene especificaciones declarativas que describen qué es la habilidad y cómo debe usarse. Incluye instrucciones especializadas e indicaciones que guían el razonamiento del modelo de lenguaje. Y alberga el código ejecutable y los scripts auxiliares que ejecuta el agente para resolver la tarea.
Memento-Skills logra un aprendizaje continuo a través de su mecanismo de «aprendizaje reflexivo de lectura y escritura», que enmarca las actualizaciones de la memoria como una iteración de políticas activas en lugar de un registro de datos pasivo. Cuando se enfrenta a una nueva tarea, el agente consulta un enrutador de habilidades especializado para recuperar la habilidad más relevante desde el punto de vista del comportamiento (no solo la más semánticamente similar) y la ejecuta.
Después de que el agente ejecuta la habilidad y recibe retroalimentación, el sistema reflexiona sobre el resultado para cerrar el ciclo de aprendizaje. En lugar de simplemente agregar un registro de lo sucedido, el sistema muta activamente su memoria. Si la ejecución falla, un orquestador evalúa el seguimiento y reescribe los artefactos de habilidad. Esto significa que actualiza directamente el código o solicita parchear el modo de falla específico. En caso de necesidad, crea una habilidad completamente nueva.
Memento-Skills también actualiza el enrutador de habilidades a través de un proceso de aprendizaje de refuerzo fuera de línea de un solo paso que aprende de los comentarios de ejecución en lugar de solo la superposición de texto. «El verdadero valor de una habilidad radica en cómo contribuye al flujo de trabajo agente general y a la ejecución posterior», afirmó Wang. «Por lo tanto, el aprendizaje por refuerzo proporciona un marco más adecuado, ya que permite al agente evaluar y seleccionar habilidades en función de su utilidad a largo plazo».
Para evitar la regresión en un entorno de producción, las mutaciones automatizadas de habilidades están protegidas por una puerta automática de prueba unitaria. El sistema genera un caso de prueba sintético, lo ejecuta a través de la habilidad actualizada y verifica los resultados antes de guardar los cambios en la biblioteca global.
Al reescribir y perfeccionar continuamente sus propias herramientas ejecutables, Memento-Skills permite que un modelo de lenguaje congelado desarrolle una memoria muscular sólida y amplíe progresivamente sus capacidades de un extremo a otro.
Poniendo a prueba el agente que evoluciona a sí mismo
Los investigadores evaluaron Memento-Skills según dos puntos de referencia rigurosos. El primero es Asistentes generales de IA (GAIA), que requiere un razonamiento complejo de varios pasos, manejo multimodal, navegación web y uso de herramientas. El segundo es El último examen de la humanidado HLE, un punto de referencia de nivel experto que abarca ocho materias académicas diversas, como matemáticas y biología. Todo el sistema estaba alimentado por Géminis-3.1-Flash actuando como el modelo de lenguaje congelado subyacente.
El sistema se comparó con una base de lectura y escritura que recupera habilidades y recopila comentarios, pero no tiene funciones de evolución automática. Los investigadores también probaron su enrutador de habilidades personalizado con líneas de base de recuperación semántica estándar, incluidas BM25 y Incrustaciones de Qwen3.
Los resultados demostraron que la memoria que evoluciona activamente supera ampliamente a una biblioteca de habilidades estática. En el punto de referencia GAIA, de gran diversidad, Memento-Skills mejoró la precisión del conjunto de pruebas en 13,7 puntos porcentuales con respecto a la línea de base estática, logrando un 66,0 % en comparación con un 52,3 %. En el punto de referencia HLE, donde la estructura del dominio permitió la reutilización masiva de habilidades entre tareas, el sistema duplicó con creces el rendimiento de la línea base, saltando del 17,9% al 38,7%.
Además, el enrutador de habilidades especializado de Memento-Skills evita la clásica trampa de recuperación en la que se selecciona una habilidad irrelevante simplemente por similitud semántica. Los experimentos muestran que Memento-Skills aumenta las tasas de éxito de las tareas de un extremo a otro al 80 %, en comparación con solo el 50 % de la recuperación estándar BM25.
Los investigadores observaron que Memento-Skills gestiona este desempeño a través de un crecimiento de habilidades estructurado y altamente orgánico. Ambos experimentos de referencia comenzaron con solo cinco habilidades de semillas atómicas, como búsqueda web básica y operaciones de terminal. En el punto de referencia GAIA, el agente expandió de forma autónoma este grupo inicial en una biblioteca compacta de 41 habilidades para manejar las diversas tareas. En el punto de referencia HLE de nivel experto, el sistema amplió dinámicamente su biblioteca a 235 habilidades distintas.
Encontrar el punto ideal de la empresa
Los investigadores han publicado el código para Memento-Skills en GitHuby está disponible para su uso.
Para los arquitectos empresariales, la eficacia de este sistema depende de la alineación del dominio. En lugar de simplemente observar las puntuaciones de referencia, la principal desventaja del negocio radica en si sus agentes manejan tareas aisladas o flujos de trabajo estructurados.
«La transferencia de habilidades depende del grado de similitud entre las tareas», afirmó Wang. «En primer lugar, cuando las tareas están aisladas o débilmente relacionadas, el agente no puede confiar en la experiencia previa y debe aprender a través de la interacción». En entornos tan dispersos, la transferencia entre tareas es limitada. «En segundo lugar, cuando las tareas comparten una estructura sustancial, las habilidades previamente adquiridas se pueden reutilizar directamente. Aquí, el aprendizaje se vuelve más eficiente porque el conocimiento se transfiere entre tareas, lo que permite al agente desempeñarse bien en nuevos problemas con poca o ninguna interacción adicional».
Dado que el sistema requiere patrones de tareas recurrentes para consolidar el conocimiento, los líderes empresariales necesitan saber exactamente dónde implementarlo hoy y dónde esperar.
«Los flujos de trabajo son probablemente el entorno más apropiado para este enfoque, ya que proporcionan un entorno estructurado en el que se pueden componer, evaluar y mejorar las habilidades», dijo Wang.
Sin embargo, advirtió contra el despliegue excesivo en áreas que aún no son adecuadas para el marco. «Los agentes físicos permanecen en gran medida inexplorados en este contexto y requieren más investigación. Además, las tareas con horizontes más largos pueden exigir enfoques más avanzados, como sistemas LLM de múltiples agentes, para permitir la coordinación, planificación y ejecución sostenida a lo largo de secuencias extendidas de decisiones».
A medida que la industria avanza hacia agentes que reescriben de forma autónoma su propio código de producción, la gobernanza y la seguridad siguen siendo primordiales. Si bien Memento-Skills emplea barreras de seguridad fundamentales, como puertas automáticas de prueba unitaria, probablemente se necesitará un marco más amplio para la adopción empresarial.
«Para permitir una superación personal confiable, necesitamos un sistema de evaluación o evaluación bien diseñado que pueda evaluar el desempeño y proporcionar una orientación consistente», dijo Wang. «En lugar de permitir una automodificación sin restricciones, el proceso debería estructurarse como una forma guiada de autodesarrollo, donde la retroalimentación orienta al agente hacia mejores diseños».
Un desafío importante en el despliegue de agentes autónomos es construir sistemas que puedan adaptarse a los cambios en sus entornos sin la necesidad de volver a entrenar los modelos de lenguajes grandes (LLM) subyacentes.
Habilidades de recuerdoun nuevo marco desarrollado por investigadores de varias universidades, aborda este cuello de botella al brindar a los agentes la capacidad de desarrollar sus habilidades por sí mismos. «Agrega su aprendizaje continuo capacidad a la oferta existente en el mercado actual, como OpenClaw y Claude Code», dijo a VentureBeat Jun Wang, coautor del artículo.
Memento-Skills actúa como una memoria externa en evolución, permitiendo que el sistema mejore progresivamente sus capacidades sin modificar el modelo subyacente. El marco proporciona un conjunto de habilidades que pueden actualizarse y ampliarse a medida que el agente recibe retroalimentación de su entorno.
Para los equipos empresariales que ejecutan agentes en producción, eso es importante. La alternativa (ajustar los pesos del modelo o desarrollar habilidades manualmente) conlleva importantes gastos operativos y requisitos de datos. Memento-Skills evita ambos.
Los desafíos de construir agentes que evolucionan a sí mismos
Los agentes que evolucionan a sí mismos son cruciales porque superan las limitaciones de los modelos de lenguaje congelados. Una vez que se implementa un modelo, sus parámetros permanecen fijos, restringiéndolo al conocimiento codificado durante el entrenamiento y a todo lo que encaje en su ventana de contexto inmediato.
Darle al modelo una estructura de memoria externa le permite mejorar sin el costoso y lento proceso de reentrenamiento. Sin embargo, los enfoques actuales para la adaptación de agentes se basan en gran medida en habilidades diseñadas manualmente para manejar nuevas tareas. Si bien existen algunos métodos automáticos de aprendizaje de habilidades, en su mayoría producen guías de solo texto que equivalen a una optimización rápida. Otros enfoques simplemente registran trayectorias de una sola tarea que no se transfieren entre diferentes tareas.
Además, cuando estos agentes intentan recuperar conocimiento relevante para una nueva tarea, normalmente dependen de enrutadores de similitud semántica, como incrustaciones densas estándar; una alta superposición semántica no garantiza la utilidad conductual. Un agente que dependa del RAG estándar podría recuperar un script de «restablecimiento de contraseña» para resolver una consulta de «procesamiento de reembolso» simplemente porque los documentos comparten terminología empresarial.
«La mayoría de los sistemas de recuperación de generación aumentada (RAG) se basan en la recuperación basada en similitudes. Sin embargo, cuando las habilidades se representan como artefactos ejecutables, como documentos de rebajas o fragmentos de código, la similitud por sí sola puede no seleccionar la habilidad más efectiva», dijo Wang.
Cómo Memento-Skills almacena y actualiza las habilidades
Para resolver las limitaciones de los sistemas agentes actuales, los investigadores construyeron Memento-Skills. El artículo describe el sistema como «un sistema de agentes LLM generalista y de aprendizaje continuo que funciona como un agente de diseño de agentes». En lugar de mantener un registro pasivo de conversaciones pasadas, Memento-Skills crea un conjunto de habilidades que actúan como una memoria externa persistente y en evolución.
Estas habilidades se almacenan como archivos de rebajas estructurados y sirven como base de conocimientos en evolución del agente. Cada artefacto de habilidad reutilizable se compone de tres elementos centrales. Contiene especificaciones declarativas que describen qué es la habilidad y cómo debe usarse. Incluye instrucciones especializadas e indicaciones que guían el razonamiento del modelo de lenguaje. Y alberga el código ejecutable y los scripts auxiliares que ejecuta el agente para resolver la tarea.
Memento-Skills logra un aprendizaje continuo a través de su mecanismo de «aprendizaje reflexivo de lectura y escritura», que enmarca las actualizaciones de la memoria como una iteración de políticas activas en lugar de un registro de datos pasivo. Cuando se enfrenta a una nueva tarea, el agente consulta un enrutador de habilidades especializado para recuperar la habilidad más relevante desde el punto de vista del comportamiento (no solo la más semánticamente similar) y la ejecuta.
Después de que el agente ejecuta la habilidad y recibe retroalimentación, el sistema reflexiona sobre el resultado para cerrar el ciclo de aprendizaje. En lugar de simplemente agregar un registro de lo sucedido, el sistema muta activamente su memoria. Si la ejecución falla, un orquestador evalúa el seguimiento y reescribe los artefactos de habilidad. Esto significa que actualiza directamente el código o solicita parchear el modo de falla específico. En caso de necesidad, crea una habilidad completamente nueva.
Memento-Skills también actualiza el enrutador de habilidades a través de un proceso de aprendizaje de refuerzo fuera de línea de un solo paso que aprende de los comentarios de ejecución en lugar de solo la superposición de texto. «El verdadero valor de una habilidad radica en cómo contribuye al flujo de trabajo agente general y a la ejecución posterior», afirmó Wang. «Por lo tanto, el aprendizaje por refuerzo proporciona un marco más adecuado, ya que permite al agente evaluar y seleccionar habilidades en función de su utilidad a largo plazo».
Para evitar la regresión en un entorno de producción, las mutaciones automatizadas de habilidades están protegidas por una puerta automática de prueba unitaria. El sistema genera un caso de prueba sintético, lo ejecuta a través de la habilidad actualizada y verifica los resultados antes de guardar los cambios en la biblioteca global.
Al reescribir y perfeccionar continuamente sus propias herramientas ejecutables, Memento-Skills permite que un modelo de lenguaje congelado desarrolle una memoria muscular sólida y amplíe progresivamente sus capacidades de un extremo a otro.
Poniendo a prueba el agente que evoluciona a sí mismo
Los investigadores evaluaron Memento-Skills según dos puntos de referencia rigurosos. El primero es Asistentes generales de IA (GAIA), que requiere un razonamiento complejo de varios pasos, manejo multimodal, navegación web y uso de herramientas. El segundo es El último examen de la humanidado HLE, un punto de referencia de nivel experto que abarca ocho materias académicas diversas, como matemáticas y biología. Todo el sistema estaba alimentado por Géminis-3.1-Flash actuando como el modelo de lenguaje congelado subyacente.
El sistema se comparó con una base de lectura y escritura que recupera habilidades y recopila comentarios, pero no tiene funciones de evolución automática. Los investigadores también probaron su enrutador de habilidades personalizado con líneas de base de recuperación semántica estándar, incluidas BM25 y Incrustaciones de Qwen3.
Los resultados demostraron que la memoria que evoluciona activamente supera ampliamente a una biblioteca de habilidades estática. En el punto de referencia GAIA, de gran diversidad, Memento-Skills mejoró la precisión del conjunto de pruebas en 13,7 puntos porcentuales con respecto a la línea de base estática, logrando un 66,0 % en comparación con un 52,3 %. En el punto de referencia HLE, donde la estructura del dominio permitió la reutilización masiva de habilidades entre tareas, el sistema duplicó con creces el rendimiento de la línea base, saltando del 17,9% al 38,7%.
Además, el enrutador de habilidades especializado de Memento-Skills evita la clásica trampa de recuperación en la que se selecciona una habilidad irrelevante simplemente por similitud semántica. Los experimentos muestran que Memento-Skills aumenta las tasas de éxito de las tareas de un extremo a otro al 80 %, en comparación con solo el 50 % de la recuperación estándar BM25.
Los investigadores observaron que Memento-Skills gestiona este desempeño a través de un crecimiento de habilidades estructurado y altamente orgánico. Ambos experimentos de referencia comenzaron con solo cinco habilidades de semillas atómicas, como búsqueda web básica y operaciones de terminal. En el punto de referencia GAIA, el agente expandió de forma autónoma este grupo inicial en una biblioteca compacta de 41 habilidades para manejar las diversas tareas. En el punto de referencia HLE de nivel experto, el sistema amplió dinámicamente su biblioteca a 235 habilidades distintas.
Encontrar el punto ideal de la empresa
Los investigadores han publicado el código para Memento-Skills en GitHuby está disponible para su uso.
Para los arquitectos empresariales, la eficacia de este sistema depende de la alineación del dominio. En lugar de simplemente observar las puntuaciones de referencia, la principal desventaja del negocio radica en si sus agentes manejan tareas aisladas o flujos de trabajo estructurados.
«La transferencia de habilidades depende del grado de similitud entre las tareas», afirmó Wang. «En primer lugar, cuando las tareas están aisladas o débilmente relacionadas, el agente no puede confiar en la experiencia previa y debe aprender a través de la interacción». En entornos tan dispersos, la transferencia entre tareas es limitada. «En segundo lugar, cuando las tareas comparten una estructura sustancial, las habilidades previamente adquiridas se pueden reutilizar directamente. Aquí, el aprendizaje se vuelve más eficiente porque el conocimiento se transfiere entre tareas, lo que permite al agente desempeñarse bien en nuevos problemas con poca o ninguna interacción adicional».
Dado que el sistema requiere patrones de tareas recurrentes para consolidar el conocimiento, los líderes empresariales necesitan saber exactamente dónde implementarlo hoy y dónde esperar.
«Los flujos de trabajo son probablemente el entorno más apropiado para este enfoque, ya que proporcionan un entorno estructurado en el que se pueden componer, evaluar y mejorar las habilidades», dijo Wang.
Sin embargo, advirtió contra el despliegue excesivo en áreas que aún no son adecuadas para el marco. «Los agentes físicos permanecen en gran medida inexplorados en este contexto y requieren más investigación. Además, las tareas con horizontes más largos pueden exigir enfoques más avanzados, como sistemas LLM de múltiples agentes, para permitir la coordinación, planificación y ejecución sostenida a lo largo de secuencias extendidas de decisiones».
A medida que la industria avanza hacia agentes que reescriben de forma autónoma su propio código de producción, la gobernanza y la seguridad siguen siendo primordiales. Si bien Memento-Skills emplea barreras de seguridad fundamentales, como puertas automáticas de prueba unitaria, probablemente se necesitará un marco más amplio para la adopción empresarial.
«Para permitir una superación personal confiable, necesitamos un sistema de evaluación o evaluación bien diseñado que pueda evaluar el desempeño y proporcionar una orientación consistente», dijo Wang. «En lugar de permitir una automodificación sin restricciones, el proceso debería estructurarse como una forma guiada de autodesarrollo, donde la retroalimentación orienta al agente hacia mejores diseños».
Un desafío importante en el despliegue de agentes autónomos es construir sistemas que puedan adaptarse a los cambios en sus entornos sin la necesidad de volver a entrenar los modelos de lenguajes grandes (LLM) subyacentes.
Habilidades de recuerdoun nuevo marco desarrollado por investigadores de varias universidades, aborda este cuello de botella al brindar a los agentes la capacidad de desarrollar sus habilidades por sí mismos. «Agrega su aprendizaje continuo capacidad a la oferta existente en el mercado actual, como OpenClaw y Claude Code», dijo a VentureBeat Jun Wang, coautor del artículo.
Memento-Skills actúa como una memoria externa en evolución, permitiendo que el sistema mejore progresivamente sus capacidades sin modificar el modelo subyacente. El marco proporciona un conjunto de habilidades que pueden actualizarse y ampliarse a medida que el agente recibe retroalimentación de su entorno.
Para los equipos empresariales que ejecutan agentes en producción, eso es importante. La alternativa (ajustar los pesos del modelo o desarrollar habilidades manualmente) conlleva importantes gastos operativos y requisitos de datos. Memento-Skills evita ambos.
Los desafíos de construir agentes que evolucionan a sí mismos
Los agentes que evolucionan a sí mismos son cruciales porque superan las limitaciones de los modelos de lenguaje congelados. Una vez que se implementa un modelo, sus parámetros permanecen fijos, restringiéndolo al conocimiento codificado durante el entrenamiento y a todo lo que encaje en su ventana de contexto inmediato.
Darle al modelo una estructura de memoria externa le permite mejorar sin el costoso y lento proceso de reentrenamiento. Sin embargo, los enfoques actuales para la adaptación de agentes se basan en gran medida en habilidades diseñadas manualmente para manejar nuevas tareas. Si bien existen algunos métodos automáticos de aprendizaje de habilidades, en su mayoría producen guías de solo texto que equivalen a una optimización rápida. Otros enfoques simplemente registran trayectorias de una sola tarea que no se transfieren entre diferentes tareas.
Además, cuando estos agentes intentan recuperar conocimiento relevante para una nueva tarea, normalmente dependen de enrutadores de similitud semántica, como incrustaciones densas estándar; una alta superposición semántica no garantiza la utilidad conductual. Un agente que dependa del RAG estándar podría recuperar un script de «restablecimiento de contraseña» para resolver una consulta de «procesamiento de reembolso» simplemente porque los documentos comparten terminología empresarial.
«La mayoría de los sistemas de recuperación de generación aumentada (RAG) se basan en la recuperación basada en similitudes. Sin embargo, cuando las habilidades se representan como artefactos ejecutables, como documentos de rebajas o fragmentos de código, la similitud por sí sola puede no seleccionar la habilidad más efectiva», dijo Wang.
Cómo Memento-Skills almacena y actualiza las habilidades
Para resolver las limitaciones de los sistemas agentes actuales, los investigadores construyeron Memento-Skills. El artículo describe el sistema como «un sistema de agentes LLM generalista y de aprendizaje continuo que funciona como un agente de diseño de agentes». En lugar de mantener un registro pasivo de conversaciones pasadas, Memento-Skills crea un conjunto de habilidades que actúan como una memoria externa persistente y en evolución.
Estas habilidades se almacenan como archivos de rebajas estructurados y sirven como base de conocimientos en evolución del agente. Cada artefacto de habilidad reutilizable se compone de tres elementos centrales. Contiene especificaciones declarativas que describen qué es la habilidad y cómo debe usarse. Incluye instrucciones especializadas e indicaciones que guían el razonamiento del modelo de lenguaje. Y alberga el código ejecutable y los scripts auxiliares que ejecuta el agente para resolver la tarea.
Memento-Skills logra un aprendizaje continuo a través de su mecanismo de «aprendizaje reflexivo de lectura y escritura», que enmarca las actualizaciones de la memoria como una iteración de políticas activas en lugar de un registro de datos pasivo. Cuando se enfrenta a una nueva tarea, el agente consulta un enrutador de habilidades especializado para recuperar la habilidad más relevante desde el punto de vista del comportamiento (no solo la más semánticamente similar) y la ejecuta.
Después de que el agente ejecuta la habilidad y recibe retroalimentación, el sistema reflexiona sobre el resultado para cerrar el ciclo de aprendizaje. En lugar de simplemente agregar un registro de lo sucedido, el sistema muta activamente su memoria. Si la ejecución falla, un orquestador evalúa el seguimiento y reescribe los artefactos de habilidad. Esto significa que actualiza directamente el código o solicita parchear el modo de falla específico. En caso de necesidad, crea una habilidad completamente nueva.
Memento-Skills también actualiza el enrutador de habilidades a través de un proceso de aprendizaje de refuerzo fuera de línea de un solo paso que aprende de los comentarios de ejecución en lugar de solo la superposición de texto. «El verdadero valor de una habilidad radica en cómo contribuye al flujo de trabajo agente general y a la ejecución posterior», afirmó Wang. «Por lo tanto, el aprendizaje por refuerzo proporciona un marco más adecuado, ya que permite al agente evaluar y seleccionar habilidades en función de su utilidad a largo plazo».
Para evitar la regresión en un entorno de producción, las mutaciones automatizadas de habilidades están protegidas por una puerta automática de prueba unitaria. El sistema genera un caso de prueba sintético, lo ejecuta a través de la habilidad actualizada y verifica los resultados antes de guardar los cambios en la biblioteca global.
Al reescribir y perfeccionar continuamente sus propias herramientas ejecutables, Memento-Skills permite que un modelo de lenguaje congelado desarrolle una memoria muscular sólida y amplíe progresivamente sus capacidades de un extremo a otro.
Poniendo a prueba el agente que evoluciona a sí mismo
Los investigadores evaluaron Memento-Skills según dos puntos de referencia rigurosos. El primero es Asistentes generales de IA (GAIA), que requiere un razonamiento complejo de varios pasos, manejo multimodal, navegación web y uso de herramientas. El segundo es El último examen de la humanidado HLE, un punto de referencia de nivel experto que abarca ocho materias académicas diversas, como matemáticas y biología. Todo el sistema estaba alimentado por Géminis-3.1-Flash actuando como el modelo de lenguaje congelado subyacente.
El sistema se comparó con una base de lectura y escritura que recupera habilidades y recopila comentarios, pero no tiene funciones de evolución automática. Los investigadores también probaron su enrutador de habilidades personalizado con líneas de base de recuperación semántica estándar, incluidas BM25 y Incrustaciones de Qwen3.
Los resultados demostraron que la memoria que evoluciona activamente supera ampliamente a una biblioteca de habilidades estática. En el punto de referencia GAIA, de gran diversidad, Memento-Skills mejoró la precisión del conjunto de pruebas en 13,7 puntos porcentuales con respecto a la línea de base estática, logrando un 66,0 % en comparación con un 52,3 %. En el punto de referencia HLE, donde la estructura del dominio permitió la reutilización masiva de habilidades entre tareas, el sistema duplicó con creces el rendimiento de la línea base, saltando del 17,9% al 38,7%.
Además, el enrutador de habilidades especializado de Memento-Skills evita la clásica trampa de recuperación en la que se selecciona una habilidad irrelevante simplemente por similitud semántica. Los experimentos muestran que Memento-Skills aumenta las tasas de éxito de las tareas de un extremo a otro al 80 %, en comparación con solo el 50 % de la recuperación estándar BM25.
Los investigadores observaron que Memento-Skills gestiona este desempeño a través de un crecimiento de habilidades estructurado y altamente orgánico. Ambos experimentos de referencia comenzaron con solo cinco habilidades de semillas atómicas, como búsqueda web básica y operaciones de terminal. En el punto de referencia GAIA, el agente expandió de forma autónoma este grupo inicial en una biblioteca compacta de 41 habilidades para manejar las diversas tareas. En el punto de referencia HLE de nivel experto, el sistema amplió dinámicamente su biblioteca a 235 habilidades distintas.
Encontrar el punto ideal de la empresa
Los investigadores han publicado el código para Memento-Skills en GitHuby está disponible para su uso.
Para los arquitectos empresariales, la eficacia de este sistema depende de la alineación del dominio. En lugar de simplemente observar las puntuaciones de referencia, la principal desventaja del negocio radica en si sus agentes manejan tareas aisladas o flujos de trabajo estructurados.
«La transferencia de habilidades depende del grado de similitud entre las tareas», afirmó Wang. «En primer lugar, cuando las tareas están aisladas o débilmente relacionadas, el agente no puede confiar en la experiencia previa y debe aprender a través de la interacción». En entornos tan dispersos, la transferencia entre tareas es limitada. «En segundo lugar, cuando las tareas comparten una estructura sustancial, las habilidades previamente adquiridas se pueden reutilizar directamente. Aquí, el aprendizaje se vuelve más eficiente porque el conocimiento se transfiere entre tareas, lo que permite al agente desempeñarse bien en nuevos problemas con poca o ninguna interacción adicional».
Dado que el sistema requiere patrones de tareas recurrentes para consolidar el conocimiento, los líderes empresariales necesitan saber exactamente dónde implementarlo hoy y dónde esperar.
«Los flujos de trabajo son probablemente el entorno más apropiado para este enfoque, ya que proporcionan un entorno estructurado en el que se pueden componer, evaluar y mejorar las habilidades», dijo Wang.
Sin embargo, advirtió contra el despliegue excesivo en áreas que aún no son adecuadas para el marco. «Los agentes físicos permanecen en gran medida inexplorados en este contexto y requieren más investigación. Además, las tareas con horizontes más largos pueden exigir enfoques más avanzados, como sistemas LLM de múltiples agentes, para permitir la coordinación, planificación y ejecución sostenida a lo largo de secuencias extendidas de decisiones».
A medida que la industria avanza hacia agentes que reescriben de forma autónoma su propio código de producción, la gobernanza y la seguridad siguen siendo primordiales. Si bien Memento-Skills emplea barreras de seguridad fundamentales, como puertas automáticas de prueba unitaria, probablemente se necesitará un marco más amplio para la adopción empresarial.
«Para permitir una superación personal confiable, necesitamos un sistema de evaluación o evaluación bien diseñado que pueda evaluar el desempeño y proporcionar una orientación consistente», dijo Wang. «En lugar de permitir una automodificación sin restricciones, el proceso debería estructurarse como una forma guiada de autodesarrollo, donde la retroalimentación orienta al agente hacia mejores diseños».












































































