El razonamiento a largo plazo expone una debilidad fundamental de los agentes de IA: las ventanas de contexto se llenan rápidamente y los canales de recuperación devuelven ruido en lugar de señal.
Para solucionar esto, investigadores de la Universidad Nacional de Singapur desarrollaron Agente de MRAun marco que abandona el enfoque estático de «recuperar y luego razonar». En cambio, utiliza un mecanismo que permite a un agente desarrollar dinámicamente su memoria basándose en la acumulación de evidencia.
Esta reconstrucción de la memoria de varios pasos se integra en el proceso de razonamiento del modelo de lenguaje grande (LLM). Si bien no es el único marco en este espacio, MRAgent reduce significativamente el consumo de tokens y los costos de tiempo de ejecución en comparación con otros enfoques de administración de memoria agente.
Los límites de la recuperación pasiva en tareas de largo horizonte
En los canales de recuperación clásicos, los documentos se recuperan mediante búsqueda de vectores o recorrido de gráficos y se pasan a un LLM para su razonamiento. Este enfoque pasivo falla porque no puede combinar el razonamiento con el acceso a la memoria, lo que crea tres cuellos de botella importantes:
-
Estos sistemas no pueden revisar su estrategia de recuperación a mitad del razonamiento. Si un agente busca un documento y descubre que falta una pista crucial (una fecha o persona específica), no tiene forma de emitir una nueva consulta basada en ese hallazgo.
-
Las puntuaciones de similitud fijas y las expansiones de gráficos predefinidas devuelven coincidencias a nivel de superficie que inundan la ventana de contexto del LLM con ruido irrelevante y razonamiento degradante.
-
Los sistemas actuales dependen en gran medida de estructuras preconstruidas, como resultados top-k y funciones de relevancia estática, lo que limita la flexibilidad necesaria para escalar a través de interacciones de usuario impredecibles y de largo horizonte.
Los investigadores sostienen que para superar estas limitaciones, los desarrolladores deben avanzar hacia un «proceso de reconstrucción activo y asociativo», un concepto inspirado en la neurociencia cognitiva.
Bajo este paradigma, la recuperación de la memoria se desarrolla secuencialmente en lugar de operar como una lectura pasiva de una base de datos estática. El sistema comienza con activadores pequeños y específicos a partir del mensaje del usuario, como el nombre de una persona, una acción o un lugar. Estas sugerencias iniciales apuntan a conectar conceptos o categorías en lugar de bloques masivos de texto.
Siguiendo estos pasos de metadatos, el agente reúne pequeñas piezas de evidencia una por una. Utiliza cada nueva información para guiar el siguiente paso hasta lograr reconstruir con éxito la historia completa y precisa.
Cómo MRAgent implementa la reconstrucción activa de la memoria
En lugar de ver la memoria como una base de datos estática, MRAgent (Arquitectura de razonamiento de memoria para agentes LLM) la trata como un entorno interactivo. Al procesar una consulta compleja, el agente utiliza las capacidades de razonamiento del LLM troncal para explorar múltiples rutas de recuperación de candidatos a través de un gráfico de memoria estructurado.
En cada paso, el LLM evalúa la evidencia intermedia que ha recopilado y la utiliza para optimizar iterativamente su búsqueda. Infiere nuevas restricciones de búsqueda, sigue los caminos con la mejor información y poda ramas irrelevantes. Esto permite a MRAgent reconstruir información profundamente oculta sin llenar de ruido el contexto del LLM.
Para que esta exploración activa sea computacionalmente eficiente y escalable, el marco organiza su base de datos utilizando un mecanismo de «Cue-Tag-Content». Funciona como un gráfico asociativo de varias capas con tres tipos de nodos:
-
Señales: palabras clave detalladas, como entidades o atributos contextuales extraídos de las interacciones del usuario.
-
Contenido: Las unidades de memoria almacenadas reales. Estos se dividen en capas multigranulares, como la memoria episódica para eventos concretos y la memoria semántica para hechos estables y preferencias del usuario.
-
Etiquetas: Puentes semánticos que resumen las asociaciones relacionales entre Cues y Contenidos específicos.
Esta estructura permite un proceso de recuperación de dos etapas altamente eficiente. El LLM primero navega desde Cues hasta Tags candidatas. Debido a que las etiquetas exponen explícitamente las relaciones semánticas y las asociaciones estructurales de los datos, el agente evalúa estos breves resúmenes para juzgar su relevancia. El LLM identifica rutas transversales prometedoras y descarta ramas irrelevantes antes de gastar cómputo y tokens de solicitud para acceder a los contenidos detallados y pesados de la memoria.
Por ejemplo, un usuario podría preguntarle a un agente de IA: «¿Cómo usó Nate el dinero del premio cuando ganó su tercer torneo de videojuegos?»
-
MRAgent primero extrae señales iniciales detalladas del mensaje, como «Nate», «torneo de videojuegos» y «ganar».
-
El agente asigna estas señales iniciales al gráfico de memoria y observa las etiquetas asociativas disponibles conectadas a ellas. El agente ve etiquetas como «Victoria en el torneo» y «Participación en el torneo». Dado que solo le preocupa lo que hizo la persona después de ganar el campeonato, MRAgent elimina la etiqueta de participación en el torneo y busca la etiqueta de victoria.
-
El agente recupera el contenido episódico vinculado al par Cue-Tag elegido, recuperando tres episodios de memoria distintos en los que Nate ganó un torneo.
-
MRAgent analiza los tres recuerdos, decide que uno de ellos en particular es relevante para la consulta y descarta los otros dos.
-
Con esta información, actualiza sus señales y comienza otra ronda de descubrimiento y poda. A partir de la nueva memoria episódica que ha recuperado, el agente agrega “ganancias del torneo” a sus señales y las utiliza para atravesar nuevas etiquetas y encontrar nuevos recuerdos. Repite este proceso hasta que reúne suficiente información para responder la consulta, que podría ser algo así como «Nate ahorró el dinero».
Desempeño de MRAgent en los puntos de referencia de la industria
MRAgent opera junto con varios otros marcos que abordan la creación de memoria agente. Las alternativas incluyen A-MEMun marco de memoria agente basado en gráficos, y MemoryOS, un marco de memoria jerárquica. Otros marcos de memoria persistente incluyen LangMem y mem0.
Los investigadores probaron MRAgent en los puntos de referencia de la industria LoCoMo y LongMemEval. Estos ponen a prueba las capacidades de los agentes para resolver consultas sobre tareas y conversaciones a largo plazo a lo largo de docenas de sesiones y cientos de turnos de diálogo. Los modelos backbone utilizados fueron Gemini 2.5 Flash y Claude Sonnet 4.5. El sistema se probó con los estándares RAG, A-MEM, MemoryOS, LangMem y Mem0.
MRAgent superó consistentemente todos los valores de referencia en ambos modelos y en todos los tipos de preguntas por un margen significativo.
Sin embargo, para los desarrolladores empresariales, la métrica más crítica suele ser el costo computacional. En las pruebas de LongMemEval, MRAgent redujo drásticamente el consumo de tokens a solo 118.000 por muestra. En comparación, A-Mem consumió 632.000 tokens y LangMem quemó 3,26 millones de tokens por consulta. MRAgent también redujo efectivamente a la mitad el tiempo de ejecución en comparación con A-Mem, pasando de 1122 segundos a 586 segundos.
Lo que hace que MRAgent sea eficiente en la práctica es su comportamiento bajo demanda. Evaluar etiquetas y eliminar rutas irrelevantes antes de recuperarlas ahorra dinero y espacio de contexto. Además, el sistema evalúa de forma autónoma su contexto acumulado y sabe inherentemente cuándo detener la búsqueda, evitando por completo la exploración de datos redundantes.
Captura de implementación y desarrollo
Si bien MRAgent es muy eficaz, la estructura Cue-Tag-Content debe prepararse antes de que el agente pueda consultarla. Los desarrolladores deben descubrir cómo diseñar la base de datos de memoria subyacente para permitir que el LLM navegue de manera eficiente por elementos asociativos y elimine rutas irrelevantes sin disparar los costos de computación.
Afortunadamente, los desarrolladores no tienen que etiquetar ni estructurar manualmente estos datos. Los autores diseñaron MRAgent con un proceso de destilación automatizado que utiliza LLM para procesar historiales de interacción sin procesar y completar automáticamente el gráfico de memoria. Para un desarrollador, el trabajo es implementar y orquestar este canal de ingesta automatizado, en lugar de etiquetar datos manualmente.
Debe configurar un trabajo en segundo plano o un canal de transmisión que pase las interacciones sin procesar del usuario a través de plantillas de mensajes para extraer estos metadatos antes de almacenarlos en su base de datos de gráficos.
Sin embargo, los autores enfatizan que esta es una fase de construcción liviana y MRAgent mantiene intencionalmente la ingestión simple.
Los autores han publicado el código el GitHub.
El razonamiento a largo plazo expone una debilidad fundamental de los agentes de IA: las ventanas de contexto se llenan rápidamente y los canales de recuperación devuelven ruido en lugar de señal.
Para solucionar esto, investigadores de la Universidad Nacional de Singapur desarrollaron Agente de MRAun marco que abandona el enfoque estático de «recuperar y luego razonar». En cambio, utiliza un mecanismo que permite a un agente desarrollar dinámicamente su memoria basándose en la acumulación de evidencia.
Esta reconstrucción de la memoria de varios pasos se integra en el proceso de razonamiento del modelo de lenguaje grande (LLM). Si bien no es el único marco en este espacio, MRAgent reduce significativamente el consumo de tokens y los costos de tiempo de ejecución en comparación con otros enfoques de administración de memoria agente.
Los límites de la recuperación pasiva en tareas de largo horizonte
En los canales de recuperación clásicos, los documentos se recuperan mediante búsqueda de vectores o recorrido de gráficos y se pasan a un LLM para su razonamiento. Este enfoque pasivo falla porque no puede combinar el razonamiento con el acceso a la memoria, lo que crea tres cuellos de botella importantes:
-
Estos sistemas no pueden revisar su estrategia de recuperación a mitad del razonamiento. Si un agente busca un documento y descubre que falta una pista crucial (una fecha o persona específica), no tiene forma de emitir una nueva consulta basada en ese hallazgo.
-
Las puntuaciones de similitud fijas y las expansiones de gráficos predefinidas devuelven coincidencias a nivel de superficie que inundan la ventana de contexto del LLM con ruido irrelevante y razonamiento degradante.
-
Los sistemas actuales dependen en gran medida de estructuras preconstruidas, como resultados top-k y funciones de relevancia estática, lo que limita la flexibilidad necesaria para escalar a través de interacciones de usuario impredecibles y de largo horizonte.
Los investigadores sostienen que para superar estas limitaciones, los desarrolladores deben avanzar hacia un «proceso de reconstrucción activo y asociativo», un concepto inspirado en la neurociencia cognitiva.
Bajo este paradigma, la recuperación de la memoria se desarrolla secuencialmente en lugar de operar como una lectura pasiva de una base de datos estática. El sistema comienza con activadores pequeños y específicos a partir del mensaje del usuario, como el nombre de una persona, una acción o un lugar. Estas sugerencias iniciales apuntan a conectar conceptos o categorías en lugar de bloques masivos de texto.
Siguiendo estos pasos de metadatos, el agente reúne pequeñas piezas de evidencia una por una. Utiliza cada nueva información para guiar el siguiente paso hasta lograr reconstruir con éxito la historia completa y precisa.
Cómo MRAgent implementa la reconstrucción activa de la memoria
En lugar de ver la memoria como una base de datos estática, MRAgent (Arquitectura de razonamiento de memoria para agentes LLM) la trata como un entorno interactivo. Al procesar una consulta compleja, el agente utiliza las capacidades de razonamiento del LLM troncal para explorar múltiples rutas de recuperación de candidatos a través de un gráfico de memoria estructurado.
En cada paso, el LLM evalúa la evidencia intermedia que ha recopilado y la utiliza para optimizar iterativamente su búsqueda. Infiere nuevas restricciones de búsqueda, sigue los caminos con la mejor información y poda ramas irrelevantes. Esto permite a MRAgent reconstruir información profundamente oculta sin llenar de ruido el contexto del LLM.
Para que esta exploración activa sea computacionalmente eficiente y escalable, el marco organiza su base de datos utilizando un mecanismo de «Cue-Tag-Content». Funciona como un gráfico asociativo de varias capas con tres tipos de nodos:
-
Señales: palabras clave detalladas, como entidades o atributos contextuales extraídos de las interacciones del usuario.
-
Contenido: Las unidades de memoria almacenadas reales. Estos se dividen en capas multigranulares, como la memoria episódica para eventos concretos y la memoria semántica para hechos estables y preferencias del usuario.
-
Etiquetas: Puentes semánticos que resumen las asociaciones relacionales entre Cues y Contenidos específicos.
Esta estructura permite un proceso de recuperación de dos etapas altamente eficiente. El LLM primero navega desde Cues hasta Tags candidatas. Debido a que las etiquetas exponen explícitamente las relaciones semánticas y las asociaciones estructurales de los datos, el agente evalúa estos breves resúmenes para juzgar su relevancia. El LLM identifica rutas transversales prometedoras y descarta ramas irrelevantes antes de gastar cómputo y tokens de solicitud para acceder a los contenidos detallados y pesados de la memoria.
Por ejemplo, un usuario podría preguntarle a un agente de IA: «¿Cómo usó Nate el dinero del premio cuando ganó su tercer torneo de videojuegos?»
-
MRAgent primero extrae señales iniciales detalladas del mensaje, como «Nate», «torneo de videojuegos» y «ganar».
-
El agente asigna estas señales iniciales al gráfico de memoria y observa las etiquetas asociativas disponibles conectadas a ellas. El agente ve etiquetas como «Victoria en el torneo» y «Participación en el torneo». Dado que solo le preocupa lo que hizo la persona después de ganar el campeonato, MRAgent elimina la etiqueta de participación en el torneo y busca la etiqueta de victoria.
-
El agente recupera el contenido episódico vinculado al par Cue-Tag elegido, recuperando tres episodios de memoria distintos en los que Nate ganó un torneo.
-
MRAgent analiza los tres recuerdos, decide que uno de ellos en particular es relevante para la consulta y descarta los otros dos.
-
Con esta información, actualiza sus señales y comienza otra ronda de descubrimiento y poda. A partir de la nueva memoria episódica que ha recuperado, el agente agrega “ganancias del torneo” a sus señales y las utiliza para atravesar nuevas etiquetas y encontrar nuevos recuerdos. Repite este proceso hasta que reúne suficiente información para responder la consulta, que podría ser algo así como «Nate ahorró el dinero».
Desempeño de MRAgent en los puntos de referencia de la industria
MRAgent opera junto con varios otros marcos que abordan la creación de memoria agente. Las alternativas incluyen A-MEMun marco de memoria agente basado en gráficos, y MemoryOS, un marco de memoria jerárquica. Otros marcos de memoria persistente incluyen LangMem y mem0.
Los investigadores probaron MRAgent en los puntos de referencia de la industria LoCoMo y LongMemEval. Estos ponen a prueba las capacidades de los agentes para resolver consultas sobre tareas y conversaciones a largo plazo a lo largo de docenas de sesiones y cientos de turnos de diálogo. Los modelos backbone utilizados fueron Gemini 2.5 Flash y Claude Sonnet 4.5. El sistema se probó con los estándares RAG, A-MEM, MemoryOS, LangMem y Mem0.
MRAgent superó consistentemente todos los valores de referencia en ambos modelos y en todos los tipos de preguntas por un margen significativo.
Sin embargo, para los desarrolladores empresariales, la métrica más crítica suele ser el costo computacional. En las pruebas de LongMemEval, MRAgent redujo drásticamente el consumo de tokens a solo 118.000 por muestra. En comparación, A-Mem consumió 632.000 tokens y LangMem quemó 3,26 millones de tokens por consulta. MRAgent también redujo efectivamente a la mitad el tiempo de ejecución en comparación con A-Mem, pasando de 1122 segundos a 586 segundos.
Lo que hace que MRAgent sea eficiente en la práctica es su comportamiento bajo demanda. Evaluar etiquetas y eliminar rutas irrelevantes antes de recuperarlas ahorra dinero y espacio de contexto. Además, el sistema evalúa de forma autónoma su contexto acumulado y sabe inherentemente cuándo detener la búsqueda, evitando por completo la exploración de datos redundantes.
Captura de implementación y desarrollo
Si bien MRAgent es muy eficaz, la estructura Cue-Tag-Content debe prepararse antes de que el agente pueda consultarla. Los desarrolladores deben descubrir cómo diseñar la base de datos de memoria subyacente para permitir que el LLM navegue de manera eficiente por elementos asociativos y elimine rutas irrelevantes sin disparar los costos de computación.
Afortunadamente, los desarrolladores no tienen que etiquetar ni estructurar manualmente estos datos. Los autores diseñaron MRAgent con un proceso de destilación automatizado que utiliza LLM para procesar historiales de interacción sin procesar y completar automáticamente el gráfico de memoria. Para un desarrollador, el trabajo es implementar y orquestar este canal de ingesta automatizado, en lugar de etiquetar datos manualmente.
Debe configurar un trabajo en segundo plano o un canal de transmisión que pase las interacciones sin procesar del usuario a través de plantillas de mensajes para extraer estos metadatos antes de almacenarlos en su base de datos de gráficos.
Sin embargo, los autores enfatizan que esta es una fase de construcción liviana y MRAgent mantiene intencionalmente la ingestión simple.
Los autores han publicado el código el GitHub.
El razonamiento a largo plazo expone una debilidad fundamental de los agentes de IA: las ventanas de contexto se llenan rápidamente y los canales de recuperación devuelven ruido en lugar de señal.
Para solucionar esto, investigadores de la Universidad Nacional de Singapur desarrollaron Agente de MRAun marco que abandona el enfoque estático de «recuperar y luego razonar». En cambio, utiliza un mecanismo que permite a un agente desarrollar dinámicamente su memoria basándose en la acumulación de evidencia.
Esta reconstrucción de la memoria de varios pasos se integra en el proceso de razonamiento del modelo de lenguaje grande (LLM). Si bien no es el único marco en este espacio, MRAgent reduce significativamente el consumo de tokens y los costos de tiempo de ejecución en comparación con otros enfoques de administración de memoria agente.
Los límites de la recuperación pasiva en tareas de largo horizonte
En los canales de recuperación clásicos, los documentos se recuperan mediante búsqueda de vectores o recorrido de gráficos y se pasan a un LLM para su razonamiento. Este enfoque pasivo falla porque no puede combinar el razonamiento con el acceso a la memoria, lo que crea tres cuellos de botella importantes:
-
Estos sistemas no pueden revisar su estrategia de recuperación a mitad del razonamiento. Si un agente busca un documento y descubre que falta una pista crucial (una fecha o persona específica), no tiene forma de emitir una nueva consulta basada en ese hallazgo.
-
Las puntuaciones de similitud fijas y las expansiones de gráficos predefinidas devuelven coincidencias a nivel de superficie que inundan la ventana de contexto del LLM con ruido irrelevante y razonamiento degradante.
-
Los sistemas actuales dependen en gran medida de estructuras preconstruidas, como resultados top-k y funciones de relevancia estática, lo que limita la flexibilidad necesaria para escalar a través de interacciones de usuario impredecibles y de largo horizonte.
Los investigadores sostienen que para superar estas limitaciones, los desarrolladores deben avanzar hacia un «proceso de reconstrucción activo y asociativo», un concepto inspirado en la neurociencia cognitiva.
Bajo este paradigma, la recuperación de la memoria se desarrolla secuencialmente en lugar de operar como una lectura pasiva de una base de datos estática. El sistema comienza con activadores pequeños y específicos a partir del mensaje del usuario, como el nombre de una persona, una acción o un lugar. Estas sugerencias iniciales apuntan a conectar conceptos o categorías en lugar de bloques masivos de texto.
Siguiendo estos pasos de metadatos, el agente reúne pequeñas piezas de evidencia una por una. Utiliza cada nueva información para guiar el siguiente paso hasta lograr reconstruir con éxito la historia completa y precisa.
Cómo MRAgent implementa la reconstrucción activa de la memoria
En lugar de ver la memoria como una base de datos estática, MRAgent (Arquitectura de razonamiento de memoria para agentes LLM) la trata como un entorno interactivo. Al procesar una consulta compleja, el agente utiliza las capacidades de razonamiento del LLM troncal para explorar múltiples rutas de recuperación de candidatos a través de un gráfico de memoria estructurado.
En cada paso, el LLM evalúa la evidencia intermedia que ha recopilado y la utiliza para optimizar iterativamente su búsqueda. Infiere nuevas restricciones de búsqueda, sigue los caminos con la mejor información y poda ramas irrelevantes. Esto permite a MRAgent reconstruir información profundamente oculta sin llenar de ruido el contexto del LLM.
Para que esta exploración activa sea computacionalmente eficiente y escalable, el marco organiza su base de datos utilizando un mecanismo de «Cue-Tag-Content». Funciona como un gráfico asociativo de varias capas con tres tipos de nodos:
-
Señales: palabras clave detalladas, como entidades o atributos contextuales extraídos de las interacciones del usuario.
-
Contenido: Las unidades de memoria almacenadas reales. Estos se dividen en capas multigranulares, como la memoria episódica para eventos concretos y la memoria semántica para hechos estables y preferencias del usuario.
-
Etiquetas: Puentes semánticos que resumen las asociaciones relacionales entre Cues y Contenidos específicos.
Esta estructura permite un proceso de recuperación de dos etapas altamente eficiente. El LLM primero navega desde Cues hasta Tags candidatas. Debido a que las etiquetas exponen explícitamente las relaciones semánticas y las asociaciones estructurales de los datos, el agente evalúa estos breves resúmenes para juzgar su relevancia. El LLM identifica rutas transversales prometedoras y descarta ramas irrelevantes antes de gastar cómputo y tokens de solicitud para acceder a los contenidos detallados y pesados de la memoria.
Por ejemplo, un usuario podría preguntarle a un agente de IA: «¿Cómo usó Nate el dinero del premio cuando ganó su tercer torneo de videojuegos?»
-
MRAgent primero extrae señales iniciales detalladas del mensaje, como «Nate», «torneo de videojuegos» y «ganar».
-
El agente asigna estas señales iniciales al gráfico de memoria y observa las etiquetas asociativas disponibles conectadas a ellas. El agente ve etiquetas como «Victoria en el torneo» y «Participación en el torneo». Dado que solo le preocupa lo que hizo la persona después de ganar el campeonato, MRAgent elimina la etiqueta de participación en el torneo y busca la etiqueta de victoria.
-
El agente recupera el contenido episódico vinculado al par Cue-Tag elegido, recuperando tres episodios de memoria distintos en los que Nate ganó un torneo.
-
MRAgent analiza los tres recuerdos, decide que uno de ellos en particular es relevante para la consulta y descarta los otros dos.
-
Con esta información, actualiza sus señales y comienza otra ronda de descubrimiento y poda. A partir de la nueva memoria episódica que ha recuperado, el agente agrega “ganancias del torneo” a sus señales y las utiliza para atravesar nuevas etiquetas y encontrar nuevos recuerdos. Repite este proceso hasta que reúne suficiente información para responder la consulta, que podría ser algo así como «Nate ahorró el dinero».
Desempeño de MRAgent en los puntos de referencia de la industria
MRAgent opera junto con varios otros marcos que abordan la creación de memoria agente. Las alternativas incluyen A-MEMun marco de memoria agente basado en gráficos, y MemoryOS, un marco de memoria jerárquica. Otros marcos de memoria persistente incluyen LangMem y mem0.
Los investigadores probaron MRAgent en los puntos de referencia de la industria LoCoMo y LongMemEval. Estos ponen a prueba las capacidades de los agentes para resolver consultas sobre tareas y conversaciones a largo plazo a lo largo de docenas de sesiones y cientos de turnos de diálogo. Los modelos backbone utilizados fueron Gemini 2.5 Flash y Claude Sonnet 4.5. El sistema se probó con los estándares RAG, A-MEM, MemoryOS, LangMem y Mem0.
MRAgent superó consistentemente todos los valores de referencia en ambos modelos y en todos los tipos de preguntas por un margen significativo.
Sin embargo, para los desarrolladores empresariales, la métrica más crítica suele ser el costo computacional. En las pruebas de LongMemEval, MRAgent redujo drásticamente el consumo de tokens a solo 118.000 por muestra. En comparación, A-Mem consumió 632.000 tokens y LangMem quemó 3,26 millones de tokens por consulta. MRAgent también redujo efectivamente a la mitad el tiempo de ejecución en comparación con A-Mem, pasando de 1122 segundos a 586 segundos.
Lo que hace que MRAgent sea eficiente en la práctica es su comportamiento bajo demanda. Evaluar etiquetas y eliminar rutas irrelevantes antes de recuperarlas ahorra dinero y espacio de contexto. Además, el sistema evalúa de forma autónoma su contexto acumulado y sabe inherentemente cuándo detener la búsqueda, evitando por completo la exploración de datos redundantes.
Captura de implementación y desarrollo
Si bien MRAgent es muy eficaz, la estructura Cue-Tag-Content debe prepararse antes de que el agente pueda consultarla. Los desarrolladores deben descubrir cómo diseñar la base de datos de memoria subyacente para permitir que el LLM navegue de manera eficiente por elementos asociativos y elimine rutas irrelevantes sin disparar los costos de computación.
Afortunadamente, los desarrolladores no tienen que etiquetar ni estructurar manualmente estos datos. Los autores diseñaron MRAgent con un proceso de destilación automatizado que utiliza LLM para procesar historiales de interacción sin procesar y completar automáticamente el gráfico de memoria. Para un desarrollador, el trabajo es implementar y orquestar este canal de ingesta automatizado, en lugar de etiquetar datos manualmente.
Debe configurar un trabajo en segundo plano o un canal de transmisión que pase las interacciones sin procesar del usuario a través de plantillas de mensajes para extraer estos metadatos antes de almacenarlos en su base de datos de gráficos.
Sin embargo, los autores enfatizan que esta es una fase de construcción liviana y MRAgent mantiene intencionalmente la ingestión simple.
Los autores han publicado el código el GitHub.
El razonamiento a largo plazo expone una debilidad fundamental de los agentes de IA: las ventanas de contexto se llenan rápidamente y los canales de recuperación devuelven ruido en lugar de señal.
Para solucionar esto, investigadores de la Universidad Nacional de Singapur desarrollaron Agente de MRAun marco que abandona el enfoque estático de «recuperar y luego razonar». En cambio, utiliza un mecanismo que permite a un agente desarrollar dinámicamente su memoria basándose en la acumulación de evidencia.
Esta reconstrucción de la memoria de varios pasos se integra en el proceso de razonamiento del modelo de lenguaje grande (LLM). Si bien no es el único marco en este espacio, MRAgent reduce significativamente el consumo de tokens y los costos de tiempo de ejecución en comparación con otros enfoques de administración de memoria agente.
Los límites de la recuperación pasiva en tareas de largo horizonte
En los canales de recuperación clásicos, los documentos se recuperan mediante búsqueda de vectores o recorrido de gráficos y se pasan a un LLM para su razonamiento. Este enfoque pasivo falla porque no puede combinar el razonamiento con el acceso a la memoria, lo que crea tres cuellos de botella importantes:
-
Estos sistemas no pueden revisar su estrategia de recuperación a mitad del razonamiento. Si un agente busca un documento y descubre que falta una pista crucial (una fecha o persona específica), no tiene forma de emitir una nueva consulta basada en ese hallazgo.
-
Las puntuaciones de similitud fijas y las expansiones de gráficos predefinidas devuelven coincidencias a nivel de superficie que inundan la ventana de contexto del LLM con ruido irrelevante y razonamiento degradante.
-
Los sistemas actuales dependen en gran medida de estructuras preconstruidas, como resultados top-k y funciones de relevancia estática, lo que limita la flexibilidad necesaria para escalar a través de interacciones de usuario impredecibles y de largo horizonte.
Los investigadores sostienen que para superar estas limitaciones, los desarrolladores deben avanzar hacia un «proceso de reconstrucción activo y asociativo», un concepto inspirado en la neurociencia cognitiva.
Bajo este paradigma, la recuperación de la memoria se desarrolla secuencialmente en lugar de operar como una lectura pasiva de una base de datos estática. El sistema comienza con activadores pequeños y específicos a partir del mensaje del usuario, como el nombre de una persona, una acción o un lugar. Estas sugerencias iniciales apuntan a conectar conceptos o categorías en lugar de bloques masivos de texto.
Siguiendo estos pasos de metadatos, el agente reúne pequeñas piezas de evidencia una por una. Utiliza cada nueva información para guiar el siguiente paso hasta lograr reconstruir con éxito la historia completa y precisa.
Cómo MRAgent implementa la reconstrucción activa de la memoria
En lugar de ver la memoria como una base de datos estática, MRAgent (Arquitectura de razonamiento de memoria para agentes LLM) la trata como un entorno interactivo. Al procesar una consulta compleja, el agente utiliza las capacidades de razonamiento del LLM troncal para explorar múltiples rutas de recuperación de candidatos a través de un gráfico de memoria estructurado.
En cada paso, el LLM evalúa la evidencia intermedia que ha recopilado y la utiliza para optimizar iterativamente su búsqueda. Infiere nuevas restricciones de búsqueda, sigue los caminos con la mejor información y poda ramas irrelevantes. Esto permite a MRAgent reconstruir información profundamente oculta sin llenar de ruido el contexto del LLM.
Para que esta exploración activa sea computacionalmente eficiente y escalable, el marco organiza su base de datos utilizando un mecanismo de «Cue-Tag-Content». Funciona como un gráfico asociativo de varias capas con tres tipos de nodos:
-
Señales: palabras clave detalladas, como entidades o atributos contextuales extraídos de las interacciones del usuario.
-
Contenido: Las unidades de memoria almacenadas reales. Estos se dividen en capas multigranulares, como la memoria episódica para eventos concretos y la memoria semántica para hechos estables y preferencias del usuario.
-
Etiquetas: Puentes semánticos que resumen las asociaciones relacionales entre Cues y Contenidos específicos.
Esta estructura permite un proceso de recuperación de dos etapas altamente eficiente. El LLM primero navega desde Cues hasta Tags candidatas. Debido a que las etiquetas exponen explícitamente las relaciones semánticas y las asociaciones estructurales de los datos, el agente evalúa estos breves resúmenes para juzgar su relevancia. El LLM identifica rutas transversales prometedoras y descarta ramas irrelevantes antes de gastar cómputo y tokens de solicitud para acceder a los contenidos detallados y pesados de la memoria.
Por ejemplo, un usuario podría preguntarle a un agente de IA: «¿Cómo usó Nate el dinero del premio cuando ganó su tercer torneo de videojuegos?»
-
MRAgent primero extrae señales iniciales detalladas del mensaje, como «Nate», «torneo de videojuegos» y «ganar».
-
El agente asigna estas señales iniciales al gráfico de memoria y observa las etiquetas asociativas disponibles conectadas a ellas. El agente ve etiquetas como «Victoria en el torneo» y «Participación en el torneo». Dado que solo le preocupa lo que hizo la persona después de ganar el campeonato, MRAgent elimina la etiqueta de participación en el torneo y busca la etiqueta de victoria.
-
El agente recupera el contenido episódico vinculado al par Cue-Tag elegido, recuperando tres episodios de memoria distintos en los que Nate ganó un torneo.
-
MRAgent analiza los tres recuerdos, decide que uno de ellos en particular es relevante para la consulta y descarta los otros dos.
-
Con esta información, actualiza sus señales y comienza otra ronda de descubrimiento y poda. A partir de la nueva memoria episódica que ha recuperado, el agente agrega “ganancias del torneo” a sus señales y las utiliza para atravesar nuevas etiquetas y encontrar nuevos recuerdos. Repite este proceso hasta que reúne suficiente información para responder la consulta, que podría ser algo así como «Nate ahorró el dinero».
Desempeño de MRAgent en los puntos de referencia de la industria
MRAgent opera junto con varios otros marcos que abordan la creación de memoria agente. Las alternativas incluyen A-MEMun marco de memoria agente basado en gráficos, y MemoryOS, un marco de memoria jerárquica. Otros marcos de memoria persistente incluyen LangMem y mem0.
Los investigadores probaron MRAgent en los puntos de referencia de la industria LoCoMo y LongMemEval. Estos ponen a prueba las capacidades de los agentes para resolver consultas sobre tareas y conversaciones a largo plazo a lo largo de docenas de sesiones y cientos de turnos de diálogo. Los modelos backbone utilizados fueron Gemini 2.5 Flash y Claude Sonnet 4.5. El sistema se probó con los estándares RAG, A-MEM, MemoryOS, LangMem y Mem0.
MRAgent superó consistentemente todos los valores de referencia en ambos modelos y en todos los tipos de preguntas por un margen significativo.
Sin embargo, para los desarrolladores empresariales, la métrica más crítica suele ser el costo computacional. En las pruebas de LongMemEval, MRAgent redujo drásticamente el consumo de tokens a solo 118.000 por muestra. En comparación, A-Mem consumió 632.000 tokens y LangMem quemó 3,26 millones de tokens por consulta. MRAgent también redujo efectivamente a la mitad el tiempo de ejecución en comparación con A-Mem, pasando de 1122 segundos a 586 segundos.
Lo que hace que MRAgent sea eficiente en la práctica es su comportamiento bajo demanda. Evaluar etiquetas y eliminar rutas irrelevantes antes de recuperarlas ahorra dinero y espacio de contexto. Además, el sistema evalúa de forma autónoma su contexto acumulado y sabe inherentemente cuándo detener la búsqueda, evitando por completo la exploración de datos redundantes.
Captura de implementación y desarrollo
Si bien MRAgent es muy eficaz, la estructura Cue-Tag-Content debe prepararse antes de que el agente pueda consultarla. Los desarrolladores deben descubrir cómo diseñar la base de datos de memoria subyacente para permitir que el LLM navegue de manera eficiente por elementos asociativos y elimine rutas irrelevantes sin disparar los costos de computación.
Afortunadamente, los desarrolladores no tienen que etiquetar ni estructurar manualmente estos datos. Los autores diseñaron MRAgent con un proceso de destilación automatizado que utiliza LLM para procesar historiales de interacción sin procesar y completar automáticamente el gráfico de memoria. Para un desarrollador, el trabajo es implementar y orquestar este canal de ingesta automatizado, en lugar de etiquetar datos manualmente.
Debe configurar un trabajo en segundo plano o un canal de transmisión que pase las interacciones sin procesar del usuario a través de plantillas de mensajes para extraer estos metadatos antes de almacenarlos en su base de datos de gráficos.
Sin embargo, los autores enfatizan que esta es una fase de construcción liviana y MRAgent mantiene intencionalmente la ingestión simple.
Los autores han publicado el código el GitHub.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
El razonamiento a largo plazo expone una debilidad fundamental de los agentes de IA: las ventanas de contexto se llenan rápidamente y los canales de recuperación devuelven ruido en lugar de señal.
Para solucionar esto, investigadores de la Universidad Nacional de Singapur desarrollaron Agente de MRAun marco que abandona el enfoque estático de «recuperar y luego razonar». En cambio, utiliza un mecanismo que permite a un agente desarrollar dinámicamente su memoria basándose en la acumulación de evidencia.
Esta reconstrucción de la memoria de varios pasos se integra en el proceso de razonamiento del modelo de lenguaje grande (LLM). Si bien no es el único marco en este espacio, MRAgent reduce significativamente el consumo de tokens y los costos de tiempo de ejecución en comparación con otros enfoques de administración de memoria agente.
Los límites de la recuperación pasiva en tareas de largo horizonte
En los canales de recuperación clásicos, los documentos se recuperan mediante búsqueda de vectores o recorrido de gráficos y se pasan a un LLM para su razonamiento. Este enfoque pasivo falla porque no puede combinar el razonamiento con el acceso a la memoria, lo que crea tres cuellos de botella importantes:
-
Estos sistemas no pueden revisar su estrategia de recuperación a mitad del razonamiento. Si un agente busca un documento y descubre que falta una pista crucial (una fecha o persona específica), no tiene forma de emitir una nueva consulta basada en ese hallazgo.
-
Las puntuaciones de similitud fijas y las expansiones de gráficos predefinidas devuelven coincidencias a nivel de superficie que inundan la ventana de contexto del LLM con ruido irrelevante y razonamiento degradante.
-
Los sistemas actuales dependen en gran medida de estructuras preconstruidas, como resultados top-k y funciones de relevancia estática, lo que limita la flexibilidad necesaria para escalar a través de interacciones de usuario impredecibles y de largo horizonte.
Los investigadores sostienen que para superar estas limitaciones, los desarrolladores deben avanzar hacia un «proceso de reconstrucción activo y asociativo», un concepto inspirado en la neurociencia cognitiva.
Bajo este paradigma, la recuperación de la memoria se desarrolla secuencialmente en lugar de operar como una lectura pasiva de una base de datos estática. El sistema comienza con activadores pequeños y específicos a partir del mensaje del usuario, como el nombre de una persona, una acción o un lugar. Estas sugerencias iniciales apuntan a conectar conceptos o categorías en lugar de bloques masivos de texto.
Siguiendo estos pasos de metadatos, el agente reúne pequeñas piezas de evidencia una por una. Utiliza cada nueva información para guiar el siguiente paso hasta lograr reconstruir con éxito la historia completa y precisa.
Cómo MRAgent implementa la reconstrucción activa de la memoria
En lugar de ver la memoria como una base de datos estática, MRAgent (Arquitectura de razonamiento de memoria para agentes LLM) la trata como un entorno interactivo. Al procesar una consulta compleja, el agente utiliza las capacidades de razonamiento del LLM troncal para explorar múltiples rutas de recuperación de candidatos a través de un gráfico de memoria estructurado.
En cada paso, el LLM evalúa la evidencia intermedia que ha recopilado y la utiliza para optimizar iterativamente su búsqueda. Infiere nuevas restricciones de búsqueda, sigue los caminos con la mejor información y poda ramas irrelevantes. Esto permite a MRAgent reconstruir información profundamente oculta sin llenar de ruido el contexto del LLM.
Para que esta exploración activa sea computacionalmente eficiente y escalable, el marco organiza su base de datos utilizando un mecanismo de «Cue-Tag-Content». Funciona como un gráfico asociativo de varias capas con tres tipos de nodos:
-
Señales: palabras clave detalladas, como entidades o atributos contextuales extraídos de las interacciones del usuario.
-
Contenido: Las unidades de memoria almacenadas reales. Estos se dividen en capas multigranulares, como la memoria episódica para eventos concretos y la memoria semántica para hechos estables y preferencias del usuario.
-
Etiquetas: Puentes semánticos que resumen las asociaciones relacionales entre Cues y Contenidos específicos.
Esta estructura permite un proceso de recuperación de dos etapas altamente eficiente. El LLM primero navega desde Cues hasta Tags candidatas. Debido a que las etiquetas exponen explícitamente las relaciones semánticas y las asociaciones estructurales de los datos, el agente evalúa estos breves resúmenes para juzgar su relevancia. El LLM identifica rutas transversales prometedoras y descarta ramas irrelevantes antes de gastar cómputo y tokens de solicitud para acceder a los contenidos detallados y pesados de la memoria.
Por ejemplo, un usuario podría preguntarle a un agente de IA: «¿Cómo usó Nate el dinero del premio cuando ganó su tercer torneo de videojuegos?»
-
MRAgent primero extrae señales iniciales detalladas del mensaje, como «Nate», «torneo de videojuegos» y «ganar».
-
El agente asigna estas señales iniciales al gráfico de memoria y observa las etiquetas asociativas disponibles conectadas a ellas. El agente ve etiquetas como «Victoria en el torneo» y «Participación en el torneo». Dado que solo le preocupa lo que hizo la persona después de ganar el campeonato, MRAgent elimina la etiqueta de participación en el torneo y busca la etiqueta de victoria.
-
El agente recupera el contenido episódico vinculado al par Cue-Tag elegido, recuperando tres episodios de memoria distintos en los que Nate ganó un torneo.
-
MRAgent analiza los tres recuerdos, decide que uno de ellos en particular es relevante para la consulta y descarta los otros dos.
-
Con esta información, actualiza sus señales y comienza otra ronda de descubrimiento y poda. A partir de la nueva memoria episódica que ha recuperado, el agente agrega “ganancias del torneo” a sus señales y las utiliza para atravesar nuevas etiquetas y encontrar nuevos recuerdos. Repite este proceso hasta que reúne suficiente información para responder la consulta, que podría ser algo así como «Nate ahorró el dinero».
Desempeño de MRAgent en los puntos de referencia de la industria
MRAgent opera junto con varios otros marcos que abordan la creación de memoria agente. Las alternativas incluyen A-MEMun marco de memoria agente basado en gráficos, y MemoryOS, un marco de memoria jerárquica. Otros marcos de memoria persistente incluyen LangMem y mem0.
Los investigadores probaron MRAgent en los puntos de referencia de la industria LoCoMo y LongMemEval. Estos ponen a prueba las capacidades de los agentes para resolver consultas sobre tareas y conversaciones a largo plazo a lo largo de docenas de sesiones y cientos de turnos de diálogo. Los modelos backbone utilizados fueron Gemini 2.5 Flash y Claude Sonnet 4.5. El sistema se probó con los estándares RAG, A-MEM, MemoryOS, LangMem y Mem0.
MRAgent superó consistentemente todos los valores de referencia en ambos modelos y en todos los tipos de preguntas por un margen significativo.
Sin embargo, para los desarrolladores empresariales, la métrica más crítica suele ser el costo computacional. En las pruebas de LongMemEval, MRAgent redujo drásticamente el consumo de tokens a solo 118.000 por muestra. En comparación, A-Mem consumió 632.000 tokens y LangMem quemó 3,26 millones de tokens por consulta. MRAgent también redujo efectivamente a la mitad el tiempo de ejecución en comparación con A-Mem, pasando de 1122 segundos a 586 segundos.
Lo que hace que MRAgent sea eficiente en la práctica es su comportamiento bajo demanda. Evaluar etiquetas y eliminar rutas irrelevantes antes de recuperarlas ahorra dinero y espacio de contexto. Además, el sistema evalúa de forma autónoma su contexto acumulado y sabe inherentemente cuándo detener la búsqueda, evitando por completo la exploración de datos redundantes.
Captura de implementación y desarrollo
Si bien MRAgent es muy eficaz, la estructura Cue-Tag-Content debe prepararse antes de que el agente pueda consultarla. Los desarrolladores deben descubrir cómo diseñar la base de datos de memoria subyacente para permitir que el LLM navegue de manera eficiente por elementos asociativos y elimine rutas irrelevantes sin disparar los costos de computación.
Afortunadamente, los desarrolladores no tienen que etiquetar ni estructurar manualmente estos datos. Los autores diseñaron MRAgent con un proceso de destilación automatizado que utiliza LLM para procesar historiales de interacción sin procesar y completar automáticamente el gráfico de memoria. Para un desarrollador, el trabajo es implementar y orquestar este canal de ingesta automatizado, en lugar de etiquetar datos manualmente.
Debe configurar un trabajo en segundo plano o un canal de transmisión que pase las interacciones sin procesar del usuario a través de plantillas de mensajes para extraer estos metadatos antes de almacenarlos en su base de datos de gráficos.
Sin embargo, los autores enfatizan que esta es una fase de construcción liviana y MRAgent mantiene intencionalmente la ingestión simple.
Los autores han publicado el código el GitHub.
El razonamiento a largo plazo expone una debilidad fundamental de los agentes de IA: las ventanas de contexto se llenan rápidamente y los canales de recuperación devuelven ruido en lugar de señal.
Para solucionar esto, investigadores de la Universidad Nacional de Singapur desarrollaron Agente de MRAun marco que abandona el enfoque estático de «recuperar y luego razonar». En cambio, utiliza un mecanismo que permite a un agente desarrollar dinámicamente su memoria basándose en la acumulación de evidencia.
Esta reconstrucción de la memoria de varios pasos se integra en el proceso de razonamiento del modelo de lenguaje grande (LLM). Si bien no es el único marco en este espacio, MRAgent reduce significativamente el consumo de tokens y los costos de tiempo de ejecución en comparación con otros enfoques de administración de memoria agente.
Los límites de la recuperación pasiva en tareas de largo horizonte
En los canales de recuperación clásicos, los documentos se recuperan mediante búsqueda de vectores o recorrido de gráficos y se pasan a un LLM para su razonamiento. Este enfoque pasivo falla porque no puede combinar el razonamiento con el acceso a la memoria, lo que crea tres cuellos de botella importantes:
-
Estos sistemas no pueden revisar su estrategia de recuperación a mitad del razonamiento. Si un agente busca un documento y descubre que falta una pista crucial (una fecha o persona específica), no tiene forma de emitir una nueva consulta basada en ese hallazgo.
-
Las puntuaciones de similitud fijas y las expansiones de gráficos predefinidas devuelven coincidencias a nivel de superficie que inundan la ventana de contexto del LLM con ruido irrelevante y razonamiento degradante.
-
Los sistemas actuales dependen en gran medida de estructuras preconstruidas, como resultados top-k y funciones de relevancia estática, lo que limita la flexibilidad necesaria para escalar a través de interacciones de usuario impredecibles y de largo horizonte.
Los investigadores sostienen que para superar estas limitaciones, los desarrolladores deben avanzar hacia un «proceso de reconstrucción activo y asociativo», un concepto inspirado en la neurociencia cognitiva.
Bajo este paradigma, la recuperación de la memoria se desarrolla secuencialmente en lugar de operar como una lectura pasiva de una base de datos estática. El sistema comienza con activadores pequeños y específicos a partir del mensaje del usuario, como el nombre de una persona, una acción o un lugar. Estas sugerencias iniciales apuntan a conectar conceptos o categorías en lugar de bloques masivos de texto.
Siguiendo estos pasos de metadatos, el agente reúne pequeñas piezas de evidencia una por una. Utiliza cada nueva información para guiar el siguiente paso hasta lograr reconstruir con éxito la historia completa y precisa.
Cómo MRAgent implementa la reconstrucción activa de la memoria
En lugar de ver la memoria como una base de datos estática, MRAgent (Arquitectura de razonamiento de memoria para agentes LLM) la trata como un entorno interactivo. Al procesar una consulta compleja, el agente utiliza las capacidades de razonamiento del LLM troncal para explorar múltiples rutas de recuperación de candidatos a través de un gráfico de memoria estructurado.
En cada paso, el LLM evalúa la evidencia intermedia que ha recopilado y la utiliza para optimizar iterativamente su búsqueda. Infiere nuevas restricciones de búsqueda, sigue los caminos con la mejor información y poda ramas irrelevantes. Esto permite a MRAgent reconstruir información profundamente oculta sin llenar de ruido el contexto del LLM.
Para que esta exploración activa sea computacionalmente eficiente y escalable, el marco organiza su base de datos utilizando un mecanismo de «Cue-Tag-Content». Funciona como un gráfico asociativo de varias capas con tres tipos de nodos:
-
Señales: palabras clave detalladas, como entidades o atributos contextuales extraídos de las interacciones del usuario.
-
Contenido: Las unidades de memoria almacenadas reales. Estos se dividen en capas multigranulares, como la memoria episódica para eventos concretos y la memoria semántica para hechos estables y preferencias del usuario.
-
Etiquetas: Puentes semánticos que resumen las asociaciones relacionales entre Cues y Contenidos específicos.
Esta estructura permite un proceso de recuperación de dos etapas altamente eficiente. El LLM primero navega desde Cues hasta Tags candidatas. Debido a que las etiquetas exponen explícitamente las relaciones semánticas y las asociaciones estructurales de los datos, el agente evalúa estos breves resúmenes para juzgar su relevancia. El LLM identifica rutas transversales prometedoras y descarta ramas irrelevantes antes de gastar cómputo y tokens de solicitud para acceder a los contenidos detallados y pesados de la memoria.
Por ejemplo, un usuario podría preguntarle a un agente de IA: «¿Cómo usó Nate el dinero del premio cuando ganó su tercer torneo de videojuegos?»
-
MRAgent primero extrae señales iniciales detalladas del mensaje, como «Nate», «torneo de videojuegos» y «ganar».
-
El agente asigna estas señales iniciales al gráfico de memoria y observa las etiquetas asociativas disponibles conectadas a ellas. El agente ve etiquetas como «Victoria en el torneo» y «Participación en el torneo». Dado que solo le preocupa lo que hizo la persona después de ganar el campeonato, MRAgent elimina la etiqueta de participación en el torneo y busca la etiqueta de victoria.
-
El agente recupera el contenido episódico vinculado al par Cue-Tag elegido, recuperando tres episodios de memoria distintos en los que Nate ganó un torneo.
-
MRAgent analiza los tres recuerdos, decide que uno de ellos en particular es relevante para la consulta y descarta los otros dos.
-
Con esta información, actualiza sus señales y comienza otra ronda de descubrimiento y poda. A partir de la nueva memoria episódica que ha recuperado, el agente agrega “ganancias del torneo” a sus señales y las utiliza para atravesar nuevas etiquetas y encontrar nuevos recuerdos. Repite este proceso hasta que reúne suficiente información para responder la consulta, que podría ser algo así como «Nate ahorró el dinero».
Desempeño de MRAgent en los puntos de referencia de la industria
MRAgent opera junto con varios otros marcos que abordan la creación de memoria agente. Las alternativas incluyen A-MEMun marco de memoria agente basado en gráficos, y MemoryOS, un marco de memoria jerárquica. Otros marcos de memoria persistente incluyen LangMem y mem0.
Los investigadores probaron MRAgent en los puntos de referencia de la industria LoCoMo y LongMemEval. Estos ponen a prueba las capacidades de los agentes para resolver consultas sobre tareas y conversaciones a largo plazo a lo largo de docenas de sesiones y cientos de turnos de diálogo. Los modelos backbone utilizados fueron Gemini 2.5 Flash y Claude Sonnet 4.5. El sistema se probó con los estándares RAG, A-MEM, MemoryOS, LangMem y Mem0.
MRAgent superó consistentemente todos los valores de referencia en ambos modelos y en todos los tipos de preguntas por un margen significativo.
Sin embargo, para los desarrolladores empresariales, la métrica más crítica suele ser el costo computacional. En las pruebas de LongMemEval, MRAgent redujo drásticamente el consumo de tokens a solo 118.000 por muestra. En comparación, A-Mem consumió 632.000 tokens y LangMem quemó 3,26 millones de tokens por consulta. MRAgent también redujo efectivamente a la mitad el tiempo de ejecución en comparación con A-Mem, pasando de 1122 segundos a 586 segundos.
Lo que hace que MRAgent sea eficiente en la práctica es su comportamiento bajo demanda. Evaluar etiquetas y eliminar rutas irrelevantes antes de recuperarlas ahorra dinero y espacio de contexto. Además, el sistema evalúa de forma autónoma su contexto acumulado y sabe inherentemente cuándo detener la búsqueda, evitando por completo la exploración de datos redundantes.
Captura de implementación y desarrollo
Si bien MRAgent es muy eficaz, la estructura Cue-Tag-Content debe prepararse antes de que el agente pueda consultarla. Los desarrolladores deben descubrir cómo diseñar la base de datos de memoria subyacente para permitir que el LLM navegue de manera eficiente por elementos asociativos y elimine rutas irrelevantes sin disparar los costos de computación.
Afortunadamente, los desarrolladores no tienen que etiquetar ni estructurar manualmente estos datos. Los autores diseñaron MRAgent con un proceso de destilación automatizado que utiliza LLM para procesar historiales de interacción sin procesar y completar automáticamente el gráfico de memoria. Para un desarrollador, el trabajo es implementar y orquestar este canal de ingesta automatizado, en lugar de etiquetar datos manualmente.
Debe configurar un trabajo en segundo plano o un canal de transmisión que pase las interacciones sin procesar del usuario a través de plantillas de mensajes para extraer estos metadatos antes de almacenarlos en su base de datos de gráficos.
Sin embargo, los autores enfatizan que esta es una fase de construcción liviana y MRAgent mantiene intencionalmente la ingestión simple.
Los autores han publicado el código el GitHub.
El razonamiento a largo plazo expone una debilidad fundamental de los agentes de IA: las ventanas de contexto se llenan rápidamente y los canales de recuperación devuelven ruido en lugar de señal.
Para solucionar esto, investigadores de la Universidad Nacional de Singapur desarrollaron Agente de MRAun marco que abandona el enfoque estático de «recuperar y luego razonar». En cambio, utiliza un mecanismo que permite a un agente desarrollar dinámicamente su memoria basándose en la acumulación de evidencia.
Esta reconstrucción de la memoria de varios pasos se integra en el proceso de razonamiento del modelo de lenguaje grande (LLM). Si bien no es el único marco en este espacio, MRAgent reduce significativamente el consumo de tokens y los costos de tiempo de ejecución en comparación con otros enfoques de administración de memoria agente.
Los límites de la recuperación pasiva en tareas de largo horizonte
En los canales de recuperación clásicos, los documentos se recuperan mediante búsqueda de vectores o recorrido de gráficos y se pasan a un LLM para su razonamiento. Este enfoque pasivo falla porque no puede combinar el razonamiento con el acceso a la memoria, lo que crea tres cuellos de botella importantes:
-
Estos sistemas no pueden revisar su estrategia de recuperación a mitad del razonamiento. Si un agente busca un documento y descubre que falta una pista crucial (una fecha o persona específica), no tiene forma de emitir una nueva consulta basada en ese hallazgo.
-
Las puntuaciones de similitud fijas y las expansiones de gráficos predefinidas devuelven coincidencias a nivel de superficie que inundan la ventana de contexto del LLM con ruido irrelevante y razonamiento degradante.
-
Los sistemas actuales dependen en gran medida de estructuras preconstruidas, como resultados top-k y funciones de relevancia estática, lo que limita la flexibilidad necesaria para escalar a través de interacciones de usuario impredecibles y de largo horizonte.
Los investigadores sostienen que para superar estas limitaciones, los desarrolladores deben avanzar hacia un «proceso de reconstrucción activo y asociativo», un concepto inspirado en la neurociencia cognitiva.
Bajo este paradigma, la recuperación de la memoria se desarrolla secuencialmente en lugar de operar como una lectura pasiva de una base de datos estática. El sistema comienza con activadores pequeños y específicos a partir del mensaje del usuario, como el nombre de una persona, una acción o un lugar. Estas sugerencias iniciales apuntan a conectar conceptos o categorías en lugar de bloques masivos de texto.
Siguiendo estos pasos de metadatos, el agente reúne pequeñas piezas de evidencia una por una. Utiliza cada nueva información para guiar el siguiente paso hasta lograr reconstruir con éxito la historia completa y precisa.
Cómo MRAgent implementa la reconstrucción activa de la memoria
En lugar de ver la memoria como una base de datos estática, MRAgent (Arquitectura de razonamiento de memoria para agentes LLM) la trata como un entorno interactivo. Al procesar una consulta compleja, el agente utiliza las capacidades de razonamiento del LLM troncal para explorar múltiples rutas de recuperación de candidatos a través de un gráfico de memoria estructurado.
En cada paso, el LLM evalúa la evidencia intermedia que ha recopilado y la utiliza para optimizar iterativamente su búsqueda. Infiere nuevas restricciones de búsqueda, sigue los caminos con la mejor información y poda ramas irrelevantes. Esto permite a MRAgent reconstruir información profundamente oculta sin llenar de ruido el contexto del LLM.
Para que esta exploración activa sea computacionalmente eficiente y escalable, el marco organiza su base de datos utilizando un mecanismo de «Cue-Tag-Content». Funciona como un gráfico asociativo de varias capas con tres tipos de nodos:
-
Señales: palabras clave detalladas, como entidades o atributos contextuales extraídos de las interacciones del usuario.
-
Contenido: Las unidades de memoria almacenadas reales. Estos se dividen en capas multigranulares, como la memoria episódica para eventos concretos y la memoria semántica para hechos estables y preferencias del usuario.
-
Etiquetas: Puentes semánticos que resumen las asociaciones relacionales entre Cues y Contenidos específicos.
Esta estructura permite un proceso de recuperación de dos etapas altamente eficiente. El LLM primero navega desde Cues hasta Tags candidatas. Debido a que las etiquetas exponen explícitamente las relaciones semánticas y las asociaciones estructurales de los datos, el agente evalúa estos breves resúmenes para juzgar su relevancia. El LLM identifica rutas transversales prometedoras y descarta ramas irrelevantes antes de gastar cómputo y tokens de solicitud para acceder a los contenidos detallados y pesados de la memoria.
Por ejemplo, un usuario podría preguntarle a un agente de IA: «¿Cómo usó Nate el dinero del premio cuando ganó su tercer torneo de videojuegos?»
-
MRAgent primero extrae señales iniciales detalladas del mensaje, como «Nate», «torneo de videojuegos» y «ganar».
-
El agente asigna estas señales iniciales al gráfico de memoria y observa las etiquetas asociativas disponibles conectadas a ellas. El agente ve etiquetas como «Victoria en el torneo» y «Participación en el torneo». Dado que solo le preocupa lo que hizo la persona después de ganar el campeonato, MRAgent elimina la etiqueta de participación en el torneo y busca la etiqueta de victoria.
-
El agente recupera el contenido episódico vinculado al par Cue-Tag elegido, recuperando tres episodios de memoria distintos en los que Nate ganó un torneo.
-
MRAgent analiza los tres recuerdos, decide que uno de ellos en particular es relevante para la consulta y descarta los otros dos.
-
Con esta información, actualiza sus señales y comienza otra ronda de descubrimiento y poda. A partir de la nueva memoria episódica que ha recuperado, el agente agrega “ganancias del torneo” a sus señales y las utiliza para atravesar nuevas etiquetas y encontrar nuevos recuerdos. Repite este proceso hasta que reúne suficiente información para responder la consulta, que podría ser algo así como «Nate ahorró el dinero».
Desempeño de MRAgent en los puntos de referencia de la industria
MRAgent opera junto con varios otros marcos que abordan la creación de memoria agente. Las alternativas incluyen A-MEMun marco de memoria agente basado en gráficos, y MemoryOS, un marco de memoria jerárquica. Otros marcos de memoria persistente incluyen LangMem y mem0.
Los investigadores probaron MRAgent en los puntos de referencia de la industria LoCoMo y LongMemEval. Estos ponen a prueba las capacidades de los agentes para resolver consultas sobre tareas y conversaciones a largo plazo a lo largo de docenas de sesiones y cientos de turnos de diálogo. Los modelos backbone utilizados fueron Gemini 2.5 Flash y Claude Sonnet 4.5. El sistema se probó con los estándares RAG, A-MEM, MemoryOS, LangMem y Mem0.
MRAgent superó consistentemente todos los valores de referencia en ambos modelos y en todos los tipos de preguntas por un margen significativo.
Sin embargo, para los desarrolladores empresariales, la métrica más crítica suele ser el costo computacional. En las pruebas de LongMemEval, MRAgent redujo drásticamente el consumo de tokens a solo 118.000 por muestra. En comparación, A-Mem consumió 632.000 tokens y LangMem quemó 3,26 millones de tokens por consulta. MRAgent también redujo efectivamente a la mitad el tiempo de ejecución en comparación con A-Mem, pasando de 1122 segundos a 586 segundos.
Lo que hace que MRAgent sea eficiente en la práctica es su comportamiento bajo demanda. Evaluar etiquetas y eliminar rutas irrelevantes antes de recuperarlas ahorra dinero y espacio de contexto. Además, el sistema evalúa de forma autónoma su contexto acumulado y sabe inherentemente cuándo detener la búsqueda, evitando por completo la exploración de datos redundantes.
Captura de implementación y desarrollo
Si bien MRAgent es muy eficaz, la estructura Cue-Tag-Content debe prepararse antes de que el agente pueda consultarla. Los desarrolladores deben descubrir cómo diseñar la base de datos de memoria subyacente para permitir que el LLM navegue de manera eficiente por elementos asociativos y elimine rutas irrelevantes sin disparar los costos de computación.
Afortunadamente, los desarrolladores no tienen que etiquetar ni estructurar manualmente estos datos. Los autores diseñaron MRAgent con un proceso de destilación automatizado que utiliza LLM para procesar historiales de interacción sin procesar y completar automáticamente el gráfico de memoria. Para un desarrollador, el trabajo es implementar y orquestar este canal de ingesta automatizado, en lugar de etiquetar datos manualmente.
Debe configurar un trabajo en segundo plano o un canal de transmisión que pase las interacciones sin procesar del usuario a través de plantillas de mensajes para extraer estos metadatos antes de almacenarlos en su base de datos de gráficos.
Sin embargo, los autores enfatizan que esta es una fase de construcción liviana y MRAgent mantiene intencionalmente la ingestión simple.
Los autores han publicado el código el GitHub.
El razonamiento a largo plazo expone una debilidad fundamental de los agentes de IA: las ventanas de contexto se llenan rápidamente y los canales de recuperación devuelven ruido en lugar de señal.
Para solucionar esto, investigadores de la Universidad Nacional de Singapur desarrollaron Agente de MRAun marco que abandona el enfoque estático de «recuperar y luego razonar». En cambio, utiliza un mecanismo que permite a un agente desarrollar dinámicamente su memoria basándose en la acumulación de evidencia.
Esta reconstrucción de la memoria de varios pasos se integra en el proceso de razonamiento del modelo de lenguaje grande (LLM). Si bien no es el único marco en este espacio, MRAgent reduce significativamente el consumo de tokens y los costos de tiempo de ejecución en comparación con otros enfoques de administración de memoria agente.
Los límites de la recuperación pasiva en tareas de largo horizonte
En los canales de recuperación clásicos, los documentos se recuperan mediante búsqueda de vectores o recorrido de gráficos y se pasan a un LLM para su razonamiento. Este enfoque pasivo falla porque no puede combinar el razonamiento con el acceso a la memoria, lo que crea tres cuellos de botella importantes:
-
Estos sistemas no pueden revisar su estrategia de recuperación a mitad del razonamiento. Si un agente busca un documento y descubre que falta una pista crucial (una fecha o persona específica), no tiene forma de emitir una nueva consulta basada en ese hallazgo.
-
Las puntuaciones de similitud fijas y las expansiones de gráficos predefinidas devuelven coincidencias a nivel de superficie que inundan la ventana de contexto del LLM con ruido irrelevante y razonamiento degradante.
-
Los sistemas actuales dependen en gran medida de estructuras preconstruidas, como resultados top-k y funciones de relevancia estática, lo que limita la flexibilidad necesaria para escalar a través de interacciones de usuario impredecibles y de largo horizonte.
Los investigadores sostienen que para superar estas limitaciones, los desarrolladores deben avanzar hacia un «proceso de reconstrucción activo y asociativo», un concepto inspirado en la neurociencia cognitiva.
Bajo este paradigma, la recuperación de la memoria se desarrolla secuencialmente en lugar de operar como una lectura pasiva de una base de datos estática. El sistema comienza con activadores pequeños y específicos a partir del mensaje del usuario, como el nombre de una persona, una acción o un lugar. Estas sugerencias iniciales apuntan a conectar conceptos o categorías en lugar de bloques masivos de texto.
Siguiendo estos pasos de metadatos, el agente reúne pequeñas piezas de evidencia una por una. Utiliza cada nueva información para guiar el siguiente paso hasta lograr reconstruir con éxito la historia completa y precisa.
Cómo MRAgent implementa la reconstrucción activa de la memoria
En lugar de ver la memoria como una base de datos estática, MRAgent (Arquitectura de razonamiento de memoria para agentes LLM) la trata como un entorno interactivo. Al procesar una consulta compleja, el agente utiliza las capacidades de razonamiento del LLM troncal para explorar múltiples rutas de recuperación de candidatos a través de un gráfico de memoria estructurado.
En cada paso, el LLM evalúa la evidencia intermedia que ha recopilado y la utiliza para optimizar iterativamente su búsqueda. Infiere nuevas restricciones de búsqueda, sigue los caminos con la mejor información y poda ramas irrelevantes. Esto permite a MRAgent reconstruir información profundamente oculta sin llenar de ruido el contexto del LLM.
Para que esta exploración activa sea computacionalmente eficiente y escalable, el marco organiza su base de datos utilizando un mecanismo de «Cue-Tag-Content». Funciona como un gráfico asociativo de varias capas con tres tipos de nodos:
-
Señales: palabras clave detalladas, como entidades o atributos contextuales extraídos de las interacciones del usuario.
-
Contenido: Las unidades de memoria almacenadas reales. Estos se dividen en capas multigranulares, como la memoria episódica para eventos concretos y la memoria semántica para hechos estables y preferencias del usuario.
-
Etiquetas: Puentes semánticos que resumen las asociaciones relacionales entre Cues y Contenidos específicos.
Esta estructura permite un proceso de recuperación de dos etapas altamente eficiente. El LLM primero navega desde Cues hasta Tags candidatas. Debido a que las etiquetas exponen explícitamente las relaciones semánticas y las asociaciones estructurales de los datos, el agente evalúa estos breves resúmenes para juzgar su relevancia. El LLM identifica rutas transversales prometedoras y descarta ramas irrelevantes antes de gastar cómputo y tokens de solicitud para acceder a los contenidos detallados y pesados de la memoria.
Por ejemplo, un usuario podría preguntarle a un agente de IA: «¿Cómo usó Nate el dinero del premio cuando ganó su tercer torneo de videojuegos?»
-
MRAgent primero extrae señales iniciales detalladas del mensaje, como «Nate», «torneo de videojuegos» y «ganar».
-
El agente asigna estas señales iniciales al gráfico de memoria y observa las etiquetas asociativas disponibles conectadas a ellas. El agente ve etiquetas como «Victoria en el torneo» y «Participación en el torneo». Dado que solo le preocupa lo que hizo la persona después de ganar el campeonato, MRAgent elimina la etiqueta de participación en el torneo y busca la etiqueta de victoria.
-
El agente recupera el contenido episódico vinculado al par Cue-Tag elegido, recuperando tres episodios de memoria distintos en los que Nate ganó un torneo.
-
MRAgent analiza los tres recuerdos, decide que uno de ellos en particular es relevante para la consulta y descarta los otros dos.
-
Con esta información, actualiza sus señales y comienza otra ronda de descubrimiento y poda. A partir de la nueva memoria episódica que ha recuperado, el agente agrega “ganancias del torneo” a sus señales y las utiliza para atravesar nuevas etiquetas y encontrar nuevos recuerdos. Repite este proceso hasta que reúne suficiente información para responder la consulta, que podría ser algo así como «Nate ahorró el dinero».
Desempeño de MRAgent en los puntos de referencia de la industria
MRAgent opera junto con varios otros marcos que abordan la creación de memoria agente. Las alternativas incluyen A-MEMun marco de memoria agente basado en gráficos, y MemoryOS, un marco de memoria jerárquica. Otros marcos de memoria persistente incluyen LangMem y mem0.
Los investigadores probaron MRAgent en los puntos de referencia de la industria LoCoMo y LongMemEval. Estos ponen a prueba las capacidades de los agentes para resolver consultas sobre tareas y conversaciones a largo plazo a lo largo de docenas de sesiones y cientos de turnos de diálogo. Los modelos backbone utilizados fueron Gemini 2.5 Flash y Claude Sonnet 4.5. El sistema se probó con los estándares RAG, A-MEM, MemoryOS, LangMem y Mem0.
MRAgent superó consistentemente todos los valores de referencia en ambos modelos y en todos los tipos de preguntas por un margen significativo.
Sin embargo, para los desarrolladores empresariales, la métrica más crítica suele ser el costo computacional. En las pruebas de LongMemEval, MRAgent redujo drásticamente el consumo de tokens a solo 118.000 por muestra. En comparación, A-Mem consumió 632.000 tokens y LangMem quemó 3,26 millones de tokens por consulta. MRAgent también redujo efectivamente a la mitad el tiempo de ejecución en comparación con A-Mem, pasando de 1122 segundos a 586 segundos.
Lo que hace que MRAgent sea eficiente en la práctica es su comportamiento bajo demanda. Evaluar etiquetas y eliminar rutas irrelevantes antes de recuperarlas ahorra dinero y espacio de contexto. Además, el sistema evalúa de forma autónoma su contexto acumulado y sabe inherentemente cuándo detener la búsqueda, evitando por completo la exploración de datos redundantes.
Captura de implementación y desarrollo
Si bien MRAgent es muy eficaz, la estructura Cue-Tag-Content debe prepararse antes de que el agente pueda consultarla. Los desarrolladores deben descubrir cómo diseñar la base de datos de memoria subyacente para permitir que el LLM navegue de manera eficiente por elementos asociativos y elimine rutas irrelevantes sin disparar los costos de computación.
Afortunadamente, los desarrolladores no tienen que etiquetar ni estructurar manualmente estos datos. Los autores diseñaron MRAgent con un proceso de destilación automatizado que utiliza LLM para procesar historiales de interacción sin procesar y completar automáticamente el gráfico de memoria. Para un desarrollador, el trabajo es implementar y orquestar este canal de ingesta automatizado, en lugar de etiquetar datos manualmente.
Debe configurar un trabajo en segundo plano o un canal de transmisión que pase las interacciones sin procesar del usuario a través de plantillas de mensajes para extraer estos metadatos antes de almacenarlos en su base de datos de gráficos.
Sin embargo, los autores enfatizan que esta es una fase de construcción liviana y MRAgent mantiene intencionalmente la ingestión simple.
Los autores han publicado el código el GitHub.












































































