Los agentes de IA lo olvidan. Cada vez que un asistente de codificación pierde el rastro de un hilo de depuración o un agente de análisis de datos vuelve a ingerir el mismo contexto que ya procesó, el equipo paga en latencia, costos de tokens y flujos de trabajo frágiles. La solución que buscan la mayoría de los equipos (ampliar la ventana de contexto o agregar más RAG) es cada vez más costosa y aún no funciona de manera confiable.
Para abordar esto, investigadores de Mind Lab y varias universidades propusieron delta-memuna técnica eficiente que comprime la información histórica del modelo en una matriz actualizada dinámicamente sin cambiar el modelo en sí. El módulo resultante añade sólo el 0,12% de los parámetros del modelo backbone (en comparación con el 76,40% de una alternativa líder) y lo supera en pruebas comparativas con mucha memoria. Delta-mem permite que los modelos acumulen y reutilicen continuamente datos históricos, lo que reduce la dependencia de ventanas de contexto masivas o módulos de recuperación externos complejos para la continuidad del comportamiento.
El desafío de la memoria larga
La solución convencional es simplemente volcar toda la información en la ventana contextual del modelo.
Pero como dijo a VentureBeat Jingdi Lei, coautor del artículo, los sistemas actuales tratan la memoria simplemente como un problema de gestión del contexto. «O seguimos ampliando la ventana contextual o recuperamos más documentos a través de RAG», explicó Lei. “Estos enfoques son útiles y seguirán siendo importantes, pero se vuelven cada vez más costosos y frágiles cuando los agentes necesitan operar en interacciones de varios pasos y de larga duración, y en realidad no lo hacen. [work] «Se parecen a la memoria humana, ya que se parecen más a buscar documentos».
En entornos empresariales, el cuello de botella no es sólo si el modelo puede acceder al historial, sino también si puede reutilizarlo de manera eficiente, continua y con baja latencia. Los mecanismos de atención estándar incurren en un costo computacional cuadrático a medida que aumenta la longitud de la secuencia. Además, expandir la ventana de contexto no garantiza que el modelo realmente recuerde la información de manera efectiva. Los modelos a menudo sufren de degradación del contexto o podredumbre del contexto a medida que se sienten abrumados con más información (y a menudo contradictoria), incluso si en teoría admiten un millón de tokens.
Los investigadores abogan por mecanismos de memoria avanzados que puedan representar información histórica de forma compacta y mantenerla dinámicamente a lo largo de las interacciones. Las soluciones existentes conllevan importantes concesiones y generalmente se dividen en tres paradigmas:
-
Memoria textual: almacena el historial como texto inyectado en contexto, restringido por los límites de las ventanas y propenso a la pérdida de información bajo compresión.
-
Canal exterior (RAG): codifica y recupera de módulos externos: agrega latencia, complejidad de integración y posible desalineación con la red troncal.
-
Paramétrico: codifica la memoria en pesos del modelo a través de adaptadores: estática después del entrenamiento, no puede adaptarse a nueva información durante las interacciones en vivo.
Dentro de delta-mem
Para lograr una memoria compacta y actualizada dinámicamente, delta-mem comprime las interacciones pasadas de un agente en un «estado en línea de memoria asociativa» (OSAM). Este estado se mantiene como una matriz de tamaño fijo que preserva la información histórica mientras el modelo de lenguaje subyacente permanece congelado.
Para los flujos de trabajo empresariales, esto se traduce directamente en resolver cuellos de botella operativos. Lei señaló que un asistente de codificación persistente, por ejemplo, «puede necesitar recordar las convenciones del proyecto, los pasos de depuración recientes, las preferencias del usuario o las decisiones intermedias a lo largo de un flujo de trabajo». De manera similar, un agente de análisis de datos podría «necesitar mantener el estado de la tarea, las suposiciones y las observaciones previas mientras itera sobre múltiples llamadas a herramientas».
En lugar de recuperar y reinsertar repetidamente todo el historial relevante para estas tareas, la matriz delta-mem proporciona una manera de bajo costo para llevar adelante estados de interacción útiles dentro del cálculo directo del modelo.
Durante la generación, el sistema no recupera segmentos de texto sin formato para agregarlos al mensaje. En cambio, el estado oculto actual del LLM troncal se proyecta en la matriz para recuperar la memoria antigua. Esta operación extrae señales de memoria asociativa relevantes para el contexto de delta-mem. Luego, estas señales se transforman en correcciones numéricas que se aplican a los cálculos del modelo. Esto dirige el razonamiento del modelo en el momento de la inferencia sin alterar sus parámetros internos.
Después de cada interacción, delta-mem actualiza el estado en línea mediante el «aprendizaje de reglas delta». Cuando llega nueva información, el estado anterior hace una predicción sobre los valores de atención resultantes. Luego compara esta predicción con el valor real y corrige la matriz de memoria en función de la discrepancia.
Este mecanismo de actualización se basa en una «regla delta cerrada». Básicamente, el módulo de memoria tiene diferentes perillas que controlan cuánta memoria anterior se conserva y cuánta memoria nueva se aplica. Esta corrección de errores con olvido controlado permite que la matriz evolucione con el tiempo, manteniendo asociaciones históricas estables sin verse descarrilada por el ruido a corto plazo.
Los investigadores exploraron tres estrategias para determinar cuándo y cómo se actualiza la matriz:
-
Escritura en estado de token Capta cambios detallados pero es vulnerable al ruido a corto plazo.
-
Escritura de estado de secuencia promedia los tokens dentro de un segmento de mensaje, suavizando las actualizaciones a costa de algunos detalles localizados.
-
Escritura multiestado descompone la memoria en subestados para diferentes tipos de información, como hechos o progreso de tareas.
Delta-mem en acción
Los investigadores evaluaron delta-mem en tres pilares de LLM: Qwen3-8B, Qwen3-4B-Instruct y SmolLM3-3B. Configuraron el marco con una matriz compacta de 8×8. El sistema fue probado en puntos de referencia de capacidad general, incluidos HotpotQA, GPQA-Diamond e IFEval. También se evaluó en tareas que requieren mucha memoria, como LoCoMo, que prueba la memoria conversacional a largo plazo, y Memory Agent Bench, que evalúa la retención, la recuperación, el olvido selectivo y el aprendizaje en el momento de la prueba en interacciones prolongadas.
El marco se comparó con modelos representativos de los tres paradigmas de memoria existentes: líneas base de memoria textual (por ejemplo, BM25 RAG, LLMLingua-2 y MemoryBank), sistemas paramétricos (Context2LoRA y MemGen) y el enfoque de canal externo MLP Memory.
En general, delta-mem superó a las líneas de base, según los investigadores. En la columna vertebral Qwen3-4B-Instruct, la variante de escritura en estado de token logró una puntuación promedio del 51,66 %, superando fácilmente la columna vertebral de vainilla congelada con un 46,79 % y la línea de base más sólida, Context2LoRA, con un 44,90 %. En el Memory Agent Bench, con mucha memoria, la puntuación promedio saltó del 29,54% al 38,85%. El rendimiento en la subtarea de aprendizaje específica en el momento del examen casi se duplicó de 26,14 a 50,50.
Sin embargo, las conclusiones más convincentes son la eficiencia operativa del sistema. Los investigadores probaron el marco en un entorno sin contexto donde el texto histórico fue completamente eliminado del contexto. Incluso sin una reproducción de texto explícita, delta-mem recuperó con éxito evidencia relevante para el contexto en tareas de múltiples saltos. Los investigadores argumentan que el modelo recuerda interacciones pasadas sin necesidad de ingerir cantidades masivas de tokens rápidos.
El marco también agrega solo 4,87 millones de parámetros entrenables, lo que representa solo el 0,12 % de la columna vertebral de Qwen3-4B-Instruct. En comparación, la línea base de memoria MLP requirió 3 mil millones de parámetros, escalando hasta el 76,40 % del tamaño de la red troncal y, al mismo tiempo, arrojó resultados inferiores. Cuando la longitud de las solicitudes aumentó hasta 32 000 tokens durante las pruebas de inferencia, el marco mantuvo casi exactamente la misma huella de memoria de GPU que un modelo estándar sin modificaciones. Evita la gran sobrecarga de memoria que afecta a otros sistemas de memoria avanzados como MemGen y MLP Memory.
Diferentes estrategias de actualización resultaron beneficiosas según la capacidad del modelo subyacente. La estrategia de escritura de estado de secuencia fue la más efectiva para redes troncales más fuertes como Qwen3-8B. Estos modelos más capaces utilizan la escritura a nivel de segmento para suavizar las actualizaciones y mitigar el ruido a nivel de token. Por el contrario, la estrategia de escritura en varios estados impulsó enormes avances en el rendimiento de redes troncales más pequeñas como SmolLM3-3B. Para estos modelos de menor capacidad, separar la memoria en múltiples estados resultó fundamental para minimizar la interferencia de la información.
Implementación de delta-mem en la pila empresarial
Los investigadores han publicado el código para delta-mem en GitHub y el pesos para sus adaptadores entrenados en Abrazar la cara. Para los equipos de ingeniería de IA que buscan integrar este marco en su pila de inferencia existente, el proceso requiere recursos informáticos mínimos.
«En la práctica, un equipo de ingeniería comenzaría a partir de una red troncal existente sintonizada con instrucciones, conectaría los módulos adaptadores Delta-Mem a capas de atención seleccionadas, entrenaría solo los parámetros del adaptador en datos de contexto largo o de múltiples giros relevantes para el dominio… y luego ejecutaría la inferencia con el estado de la memoria actualizado en línea durante la interacción», dijo Lei. Fundamentalmente, los equipos no necesitan un corpus de preentrenamiento masivo. Los datos de entrenamiento solo necesitan reflejar el comportamiento de la memoria objetivo, como diálogos de varios turnos, seguimientos de agentes o flujos de trabajo de dominio donde la información anterior debe influir en las decisiones posteriores.
Si bien comprimir el historial de interacciones en una matriz matemática de tamaño fijo crea una inmensa eficiencia, conlleva compensaciones. Delta-mem no reemplaza sin pérdidas los registros de texto explícitos o la recuperación de documentos. Debido a que diferentes piezas de información compiten dentro del mismo estado limitado, existe el riesgo de que se mezclen los recuerdos.
«Delta-Mem es útil cuando el sistema necesita un estado de comportamiento rápido, en línea y continuamente actualizado», dijo Lei. «RAG es mejor cuando el sistema necesita un recuerdo exacto de los hechos, citas, cumplimiento, auditabilidad o acceso a una gran base de conocimiento externo». Recordar el estilo de trabajo de un usuario o una trayectoria de razonamiento de varios pasos es perfecto para delta-mem, mientras que recuperar un contrato legal o una directriz médica debe permanecer en una base de datos vectorial.
Esto significa que la arquitectura empresarial más realista en el futuro es un enfoque híbrido. Delta-mem actúa como una memoria de trabajo interna liviana, lo que reduce la necesidad de recuperar o reproducir todo todo el tiempo, mientras que RAG sirve como capa de memoria explícita de alta capacidad.
«De cara al futuro, no creo que las bases de datos vectoriales se vuelvan obsoletas», afirmó Lei. «En cambio, espero que las pilas de IA empresarial tengan más capas. Probablemente veremos memoria de trabajo a corto plazo dentro del modelo, memoria explícita a largo plazo en los sistemas de recuperación y capas de políticas o auditorías que deciden qué se debe almacenar, recuperar, olvidar o exponer al usuario».
Los agentes de IA lo olvidan. Cada vez que un asistente de codificación pierde el rastro de un hilo de depuración o un agente de análisis de datos vuelve a ingerir el mismo contexto que ya procesó, el equipo paga en latencia, costos de tokens y flujos de trabajo frágiles. La solución que buscan la mayoría de los equipos (ampliar la ventana de contexto o agregar más RAG) es cada vez más costosa y aún no funciona de manera confiable.
Para abordar esto, investigadores de Mind Lab y varias universidades propusieron delta-memuna técnica eficiente que comprime la información histórica del modelo en una matriz actualizada dinámicamente sin cambiar el modelo en sí. El módulo resultante añade sólo el 0,12% de los parámetros del modelo backbone (en comparación con el 76,40% de una alternativa líder) y lo supera en pruebas comparativas con mucha memoria. Delta-mem permite que los modelos acumulen y reutilicen continuamente datos históricos, lo que reduce la dependencia de ventanas de contexto masivas o módulos de recuperación externos complejos para la continuidad del comportamiento.
El desafío de la memoria larga
La solución convencional es simplemente volcar toda la información en la ventana contextual del modelo.
Pero como dijo a VentureBeat Jingdi Lei, coautor del artículo, los sistemas actuales tratan la memoria simplemente como un problema de gestión del contexto. «O seguimos ampliando la ventana contextual o recuperamos más documentos a través de RAG», explicó Lei. “Estos enfoques son útiles y seguirán siendo importantes, pero se vuelven cada vez más costosos y frágiles cuando los agentes necesitan operar en interacciones de varios pasos y de larga duración, y en realidad no lo hacen. [work] «Se parecen a la memoria humana, ya que se parecen más a buscar documentos».
En entornos empresariales, el cuello de botella no es sólo si el modelo puede acceder al historial, sino también si puede reutilizarlo de manera eficiente, continua y con baja latencia. Los mecanismos de atención estándar incurren en un costo computacional cuadrático a medida que aumenta la longitud de la secuencia. Además, expandir la ventana de contexto no garantiza que el modelo realmente recuerde la información de manera efectiva. Los modelos a menudo sufren de degradación del contexto o podredumbre del contexto a medida que se sienten abrumados con más información (y a menudo contradictoria), incluso si en teoría admiten un millón de tokens.
Los investigadores abogan por mecanismos de memoria avanzados que puedan representar información histórica de forma compacta y mantenerla dinámicamente a lo largo de las interacciones. Las soluciones existentes conllevan importantes concesiones y generalmente se dividen en tres paradigmas:
-
Memoria textual: almacena el historial como texto inyectado en contexto, restringido por los límites de las ventanas y propenso a la pérdida de información bajo compresión.
-
Canal exterior (RAG): codifica y recupera de módulos externos: agrega latencia, complejidad de integración y posible desalineación con la red troncal.
-
Paramétrico: codifica la memoria en pesos del modelo a través de adaptadores: estática después del entrenamiento, no puede adaptarse a nueva información durante las interacciones en vivo.
Dentro de delta-mem
Para lograr una memoria compacta y actualizada dinámicamente, delta-mem comprime las interacciones pasadas de un agente en un «estado en línea de memoria asociativa» (OSAM). Este estado se mantiene como una matriz de tamaño fijo que preserva la información histórica mientras el modelo de lenguaje subyacente permanece congelado.
Para los flujos de trabajo empresariales, esto se traduce directamente en resolver cuellos de botella operativos. Lei señaló que un asistente de codificación persistente, por ejemplo, «puede necesitar recordar las convenciones del proyecto, los pasos de depuración recientes, las preferencias del usuario o las decisiones intermedias a lo largo de un flujo de trabajo». De manera similar, un agente de análisis de datos podría «necesitar mantener el estado de la tarea, las suposiciones y las observaciones previas mientras itera sobre múltiples llamadas a herramientas».
En lugar de recuperar y reinsertar repetidamente todo el historial relevante para estas tareas, la matriz delta-mem proporciona una manera de bajo costo para llevar adelante estados de interacción útiles dentro del cálculo directo del modelo.
Durante la generación, el sistema no recupera segmentos de texto sin formato para agregarlos al mensaje. En cambio, el estado oculto actual del LLM troncal se proyecta en la matriz para recuperar la memoria antigua. Esta operación extrae señales de memoria asociativa relevantes para el contexto de delta-mem. Luego, estas señales se transforman en correcciones numéricas que se aplican a los cálculos del modelo. Esto dirige el razonamiento del modelo en el momento de la inferencia sin alterar sus parámetros internos.
Después de cada interacción, delta-mem actualiza el estado en línea mediante el «aprendizaje de reglas delta». Cuando llega nueva información, el estado anterior hace una predicción sobre los valores de atención resultantes. Luego compara esta predicción con el valor real y corrige la matriz de memoria en función de la discrepancia.
Este mecanismo de actualización se basa en una «regla delta cerrada». Básicamente, el módulo de memoria tiene diferentes perillas que controlan cuánta memoria anterior se conserva y cuánta memoria nueva se aplica. Esta corrección de errores con olvido controlado permite que la matriz evolucione con el tiempo, manteniendo asociaciones históricas estables sin verse descarrilada por el ruido a corto plazo.
Los investigadores exploraron tres estrategias para determinar cuándo y cómo se actualiza la matriz:
-
Escritura en estado de token Capta cambios detallados pero es vulnerable al ruido a corto plazo.
-
Escritura de estado de secuencia promedia los tokens dentro de un segmento de mensaje, suavizando las actualizaciones a costa de algunos detalles localizados.
-
Escritura multiestado descompone la memoria en subestados para diferentes tipos de información, como hechos o progreso de tareas.
Delta-mem en acción
Los investigadores evaluaron delta-mem en tres pilares de LLM: Qwen3-8B, Qwen3-4B-Instruct y SmolLM3-3B. Configuraron el marco con una matriz compacta de 8×8. El sistema fue probado en puntos de referencia de capacidad general, incluidos HotpotQA, GPQA-Diamond e IFEval. También se evaluó en tareas que requieren mucha memoria, como LoCoMo, que prueba la memoria conversacional a largo plazo, y Memory Agent Bench, que evalúa la retención, la recuperación, el olvido selectivo y el aprendizaje en el momento de la prueba en interacciones prolongadas.
El marco se comparó con modelos representativos de los tres paradigmas de memoria existentes: líneas base de memoria textual (por ejemplo, BM25 RAG, LLMLingua-2 y MemoryBank), sistemas paramétricos (Context2LoRA y MemGen) y el enfoque de canal externo MLP Memory.
En general, delta-mem superó a las líneas de base, según los investigadores. En la columna vertebral Qwen3-4B-Instruct, la variante de escritura en estado de token logró una puntuación promedio del 51,66 %, superando fácilmente la columna vertebral de vainilla congelada con un 46,79 % y la línea de base más sólida, Context2LoRA, con un 44,90 %. En el Memory Agent Bench, con mucha memoria, la puntuación promedio saltó del 29,54% al 38,85%. El rendimiento en la subtarea de aprendizaje específica en el momento del examen casi se duplicó de 26,14 a 50,50.
Sin embargo, las conclusiones más convincentes son la eficiencia operativa del sistema. Los investigadores probaron el marco en un entorno sin contexto donde el texto histórico fue completamente eliminado del contexto. Incluso sin una reproducción de texto explícita, delta-mem recuperó con éxito evidencia relevante para el contexto en tareas de múltiples saltos. Los investigadores argumentan que el modelo recuerda interacciones pasadas sin necesidad de ingerir cantidades masivas de tokens rápidos.
El marco también agrega solo 4,87 millones de parámetros entrenables, lo que representa solo el 0,12 % de la columna vertebral de Qwen3-4B-Instruct. En comparación, la línea base de memoria MLP requirió 3 mil millones de parámetros, escalando hasta el 76,40 % del tamaño de la red troncal y, al mismo tiempo, arrojó resultados inferiores. Cuando la longitud de las solicitudes aumentó hasta 32 000 tokens durante las pruebas de inferencia, el marco mantuvo casi exactamente la misma huella de memoria de GPU que un modelo estándar sin modificaciones. Evita la gran sobrecarga de memoria que afecta a otros sistemas de memoria avanzados como MemGen y MLP Memory.
Diferentes estrategias de actualización resultaron beneficiosas según la capacidad del modelo subyacente. La estrategia de escritura de estado de secuencia fue la más efectiva para redes troncales más fuertes como Qwen3-8B. Estos modelos más capaces utilizan la escritura a nivel de segmento para suavizar las actualizaciones y mitigar el ruido a nivel de token. Por el contrario, la estrategia de escritura en varios estados impulsó enormes avances en el rendimiento de redes troncales más pequeñas como SmolLM3-3B. Para estos modelos de menor capacidad, separar la memoria en múltiples estados resultó fundamental para minimizar la interferencia de la información.
Implementación de delta-mem en la pila empresarial
Los investigadores han publicado el código para delta-mem en GitHub y el pesos para sus adaptadores entrenados en Abrazar la cara. Para los equipos de ingeniería de IA que buscan integrar este marco en su pila de inferencia existente, el proceso requiere recursos informáticos mínimos.
«En la práctica, un equipo de ingeniería comenzaría a partir de una red troncal existente sintonizada con instrucciones, conectaría los módulos adaptadores Delta-Mem a capas de atención seleccionadas, entrenaría solo los parámetros del adaptador en datos de contexto largo o de múltiples giros relevantes para el dominio… y luego ejecutaría la inferencia con el estado de la memoria actualizado en línea durante la interacción», dijo Lei. Fundamentalmente, los equipos no necesitan un corpus de preentrenamiento masivo. Los datos de entrenamiento solo necesitan reflejar el comportamiento de la memoria objetivo, como diálogos de varios turnos, seguimientos de agentes o flujos de trabajo de dominio donde la información anterior debe influir en las decisiones posteriores.
Si bien comprimir el historial de interacciones en una matriz matemática de tamaño fijo crea una inmensa eficiencia, conlleva compensaciones. Delta-mem no reemplaza sin pérdidas los registros de texto explícitos o la recuperación de documentos. Debido a que diferentes piezas de información compiten dentro del mismo estado limitado, existe el riesgo de que se mezclen los recuerdos.
«Delta-Mem es útil cuando el sistema necesita un estado de comportamiento rápido, en línea y continuamente actualizado», dijo Lei. «RAG es mejor cuando el sistema necesita un recuerdo exacto de los hechos, citas, cumplimiento, auditabilidad o acceso a una gran base de conocimiento externo». Recordar el estilo de trabajo de un usuario o una trayectoria de razonamiento de varios pasos es perfecto para delta-mem, mientras que recuperar un contrato legal o una directriz médica debe permanecer en una base de datos vectorial.
Esto significa que la arquitectura empresarial más realista en el futuro es un enfoque híbrido. Delta-mem actúa como una memoria de trabajo interna liviana, lo que reduce la necesidad de recuperar o reproducir todo todo el tiempo, mientras que RAG sirve como capa de memoria explícita de alta capacidad.
«De cara al futuro, no creo que las bases de datos vectoriales se vuelvan obsoletas», afirmó Lei. «En cambio, espero que las pilas de IA empresarial tengan más capas. Probablemente veremos memoria de trabajo a corto plazo dentro del modelo, memoria explícita a largo plazo en los sistemas de recuperación y capas de políticas o auditorías que deciden qué se debe almacenar, recuperar, olvidar o exponer al usuario».
Los agentes de IA lo olvidan. Cada vez que un asistente de codificación pierde el rastro de un hilo de depuración o un agente de análisis de datos vuelve a ingerir el mismo contexto que ya procesó, el equipo paga en latencia, costos de tokens y flujos de trabajo frágiles. La solución que buscan la mayoría de los equipos (ampliar la ventana de contexto o agregar más RAG) es cada vez más costosa y aún no funciona de manera confiable.
Para abordar esto, investigadores de Mind Lab y varias universidades propusieron delta-memuna técnica eficiente que comprime la información histórica del modelo en una matriz actualizada dinámicamente sin cambiar el modelo en sí. El módulo resultante añade sólo el 0,12% de los parámetros del modelo backbone (en comparación con el 76,40% de una alternativa líder) y lo supera en pruebas comparativas con mucha memoria. Delta-mem permite que los modelos acumulen y reutilicen continuamente datos históricos, lo que reduce la dependencia de ventanas de contexto masivas o módulos de recuperación externos complejos para la continuidad del comportamiento.
El desafío de la memoria larga
La solución convencional es simplemente volcar toda la información en la ventana contextual del modelo.
Pero como dijo a VentureBeat Jingdi Lei, coautor del artículo, los sistemas actuales tratan la memoria simplemente como un problema de gestión del contexto. «O seguimos ampliando la ventana contextual o recuperamos más documentos a través de RAG», explicó Lei. “Estos enfoques son útiles y seguirán siendo importantes, pero se vuelven cada vez más costosos y frágiles cuando los agentes necesitan operar en interacciones de varios pasos y de larga duración, y en realidad no lo hacen. [work] «Se parecen a la memoria humana, ya que se parecen más a buscar documentos».
En entornos empresariales, el cuello de botella no es sólo si el modelo puede acceder al historial, sino también si puede reutilizarlo de manera eficiente, continua y con baja latencia. Los mecanismos de atención estándar incurren en un costo computacional cuadrático a medida que aumenta la longitud de la secuencia. Además, expandir la ventana de contexto no garantiza que el modelo realmente recuerde la información de manera efectiva. Los modelos a menudo sufren de degradación del contexto o podredumbre del contexto a medida que se sienten abrumados con más información (y a menudo contradictoria), incluso si en teoría admiten un millón de tokens.
Los investigadores abogan por mecanismos de memoria avanzados que puedan representar información histórica de forma compacta y mantenerla dinámicamente a lo largo de las interacciones. Las soluciones existentes conllevan importantes concesiones y generalmente se dividen en tres paradigmas:
-
Memoria textual: almacena el historial como texto inyectado en contexto, restringido por los límites de las ventanas y propenso a la pérdida de información bajo compresión.
-
Canal exterior (RAG): codifica y recupera de módulos externos: agrega latencia, complejidad de integración y posible desalineación con la red troncal.
-
Paramétrico: codifica la memoria en pesos del modelo a través de adaptadores: estática después del entrenamiento, no puede adaptarse a nueva información durante las interacciones en vivo.
Dentro de delta-mem
Para lograr una memoria compacta y actualizada dinámicamente, delta-mem comprime las interacciones pasadas de un agente en un «estado en línea de memoria asociativa» (OSAM). Este estado se mantiene como una matriz de tamaño fijo que preserva la información histórica mientras el modelo de lenguaje subyacente permanece congelado.
Para los flujos de trabajo empresariales, esto se traduce directamente en resolver cuellos de botella operativos. Lei señaló que un asistente de codificación persistente, por ejemplo, «puede necesitar recordar las convenciones del proyecto, los pasos de depuración recientes, las preferencias del usuario o las decisiones intermedias a lo largo de un flujo de trabajo». De manera similar, un agente de análisis de datos podría «necesitar mantener el estado de la tarea, las suposiciones y las observaciones previas mientras itera sobre múltiples llamadas a herramientas».
En lugar de recuperar y reinsertar repetidamente todo el historial relevante para estas tareas, la matriz delta-mem proporciona una manera de bajo costo para llevar adelante estados de interacción útiles dentro del cálculo directo del modelo.
Durante la generación, el sistema no recupera segmentos de texto sin formato para agregarlos al mensaje. En cambio, el estado oculto actual del LLM troncal se proyecta en la matriz para recuperar la memoria antigua. Esta operación extrae señales de memoria asociativa relevantes para el contexto de delta-mem. Luego, estas señales se transforman en correcciones numéricas que se aplican a los cálculos del modelo. Esto dirige el razonamiento del modelo en el momento de la inferencia sin alterar sus parámetros internos.
Después de cada interacción, delta-mem actualiza el estado en línea mediante el «aprendizaje de reglas delta». Cuando llega nueva información, el estado anterior hace una predicción sobre los valores de atención resultantes. Luego compara esta predicción con el valor real y corrige la matriz de memoria en función de la discrepancia.
Este mecanismo de actualización se basa en una «regla delta cerrada». Básicamente, el módulo de memoria tiene diferentes perillas que controlan cuánta memoria anterior se conserva y cuánta memoria nueva se aplica. Esta corrección de errores con olvido controlado permite que la matriz evolucione con el tiempo, manteniendo asociaciones históricas estables sin verse descarrilada por el ruido a corto plazo.
Los investigadores exploraron tres estrategias para determinar cuándo y cómo se actualiza la matriz:
-
Escritura en estado de token Capta cambios detallados pero es vulnerable al ruido a corto plazo.
-
Escritura de estado de secuencia promedia los tokens dentro de un segmento de mensaje, suavizando las actualizaciones a costa de algunos detalles localizados.
-
Escritura multiestado descompone la memoria en subestados para diferentes tipos de información, como hechos o progreso de tareas.
Delta-mem en acción
Los investigadores evaluaron delta-mem en tres pilares de LLM: Qwen3-8B, Qwen3-4B-Instruct y SmolLM3-3B. Configuraron el marco con una matriz compacta de 8×8. El sistema fue probado en puntos de referencia de capacidad general, incluidos HotpotQA, GPQA-Diamond e IFEval. También se evaluó en tareas que requieren mucha memoria, como LoCoMo, que prueba la memoria conversacional a largo plazo, y Memory Agent Bench, que evalúa la retención, la recuperación, el olvido selectivo y el aprendizaje en el momento de la prueba en interacciones prolongadas.
El marco se comparó con modelos representativos de los tres paradigmas de memoria existentes: líneas base de memoria textual (por ejemplo, BM25 RAG, LLMLingua-2 y MemoryBank), sistemas paramétricos (Context2LoRA y MemGen) y el enfoque de canal externo MLP Memory.
En general, delta-mem superó a las líneas de base, según los investigadores. En la columna vertebral Qwen3-4B-Instruct, la variante de escritura en estado de token logró una puntuación promedio del 51,66 %, superando fácilmente la columna vertebral de vainilla congelada con un 46,79 % y la línea de base más sólida, Context2LoRA, con un 44,90 %. En el Memory Agent Bench, con mucha memoria, la puntuación promedio saltó del 29,54% al 38,85%. El rendimiento en la subtarea de aprendizaje específica en el momento del examen casi se duplicó de 26,14 a 50,50.
Sin embargo, las conclusiones más convincentes son la eficiencia operativa del sistema. Los investigadores probaron el marco en un entorno sin contexto donde el texto histórico fue completamente eliminado del contexto. Incluso sin una reproducción de texto explícita, delta-mem recuperó con éxito evidencia relevante para el contexto en tareas de múltiples saltos. Los investigadores argumentan que el modelo recuerda interacciones pasadas sin necesidad de ingerir cantidades masivas de tokens rápidos.
El marco también agrega solo 4,87 millones de parámetros entrenables, lo que representa solo el 0,12 % de la columna vertebral de Qwen3-4B-Instruct. En comparación, la línea base de memoria MLP requirió 3 mil millones de parámetros, escalando hasta el 76,40 % del tamaño de la red troncal y, al mismo tiempo, arrojó resultados inferiores. Cuando la longitud de las solicitudes aumentó hasta 32 000 tokens durante las pruebas de inferencia, el marco mantuvo casi exactamente la misma huella de memoria de GPU que un modelo estándar sin modificaciones. Evita la gran sobrecarga de memoria que afecta a otros sistemas de memoria avanzados como MemGen y MLP Memory.
Diferentes estrategias de actualización resultaron beneficiosas según la capacidad del modelo subyacente. La estrategia de escritura de estado de secuencia fue la más efectiva para redes troncales más fuertes como Qwen3-8B. Estos modelos más capaces utilizan la escritura a nivel de segmento para suavizar las actualizaciones y mitigar el ruido a nivel de token. Por el contrario, la estrategia de escritura en varios estados impulsó enormes avances en el rendimiento de redes troncales más pequeñas como SmolLM3-3B. Para estos modelos de menor capacidad, separar la memoria en múltiples estados resultó fundamental para minimizar la interferencia de la información.
Implementación de delta-mem en la pila empresarial
Los investigadores han publicado el código para delta-mem en GitHub y el pesos para sus adaptadores entrenados en Abrazar la cara. Para los equipos de ingeniería de IA que buscan integrar este marco en su pila de inferencia existente, el proceso requiere recursos informáticos mínimos.
«En la práctica, un equipo de ingeniería comenzaría a partir de una red troncal existente sintonizada con instrucciones, conectaría los módulos adaptadores Delta-Mem a capas de atención seleccionadas, entrenaría solo los parámetros del adaptador en datos de contexto largo o de múltiples giros relevantes para el dominio… y luego ejecutaría la inferencia con el estado de la memoria actualizado en línea durante la interacción», dijo Lei. Fundamentalmente, los equipos no necesitan un corpus de preentrenamiento masivo. Los datos de entrenamiento solo necesitan reflejar el comportamiento de la memoria objetivo, como diálogos de varios turnos, seguimientos de agentes o flujos de trabajo de dominio donde la información anterior debe influir en las decisiones posteriores.
Si bien comprimir el historial de interacciones en una matriz matemática de tamaño fijo crea una inmensa eficiencia, conlleva compensaciones. Delta-mem no reemplaza sin pérdidas los registros de texto explícitos o la recuperación de documentos. Debido a que diferentes piezas de información compiten dentro del mismo estado limitado, existe el riesgo de que se mezclen los recuerdos.
«Delta-Mem es útil cuando el sistema necesita un estado de comportamiento rápido, en línea y continuamente actualizado», dijo Lei. «RAG es mejor cuando el sistema necesita un recuerdo exacto de los hechos, citas, cumplimiento, auditabilidad o acceso a una gran base de conocimiento externo». Recordar el estilo de trabajo de un usuario o una trayectoria de razonamiento de varios pasos es perfecto para delta-mem, mientras que recuperar un contrato legal o una directriz médica debe permanecer en una base de datos vectorial.
Esto significa que la arquitectura empresarial más realista en el futuro es un enfoque híbrido. Delta-mem actúa como una memoria de trabajo interna liviana, lo que reduce la necesidad de recuperar o reproducir todo todo el tiempo, mientras que RAG sirve como capa de memoria explícita de alta capacidad.
«De cara al futuro, no creo que las bases de datos vectoriales se vuelvan obsoletas», afirmó Lei. «En cambio, espero que las pilas de IA empresarial tengan más capas. Probablemente veremos memoria de trabajo a corto plazo dentro del modelo, memoria explícita a largo plazo en los sistemas de recuperación y capas de políticas o auditorías que deciden qué se debe almacenar, recuperar, olvidar o exponer al usuario».
Los agentes de IA lo olvidan. Cada vez que un asistente de codificación pierde el rastro de un hilo de depuración o un agente de análisis de datos vuelve a ingerir el mismo contexto que ya procesó, el equipo paga en latencia, costos de tokens y flujos de trabajo frágiles. La solución que buscan la mayoría de los equipos (ampliar la ventana de contexto o agregar más RAG) es cada vez más costosa y aún no funciona de manera confiable.
Para abordar esto, investigadores de Mind Lab y varias universidades propusieron delta-memuna técnica eficiente que comprime la información histórica del modelo en una matriz actualizada dinámicamente sin cambiar el modelo en sí. El módulo resultante añade sólo el 0,12% de los parámetros del modelo backbone (en comparación con el 76,40% de una alternativa líder) y lo supera en pruebas comparativas con mucha memoria. Delta-mem permite que los modelos acumulen y reutilicen continuamente datos históricos, lo que reduce la dependencia de ventanas de contexto masivas o módulos de recuperación externos complejos para la continuidad del comportamiento.
El desafío de la memoria larga
La solución convencional es simplemente volcar toda la información en la ventana contextual del modelo.
Pero como dijo a VentureBeat Jingdi Lei, coautor del artículo, los sistemas actuales tratan la memoria simplemente como un problema de gestión del contexto. «O seguimos ampliando la ventana contextual o recuperamos más documentos a través de RAG», explicó Lei. “Estos enfoques son útiles y seguirán siendo importantes, pero se vuelven cada vez más costosos y frágiles cuando los agentes necesitan operar en interacciones de varios pasos y de larga duración, y en realidad no lo hacen. [work] «Se parecen a la memoria humana, ya que se parecen más a buscar documentos».
En entornos empresariales, el cuello de botella no es sólo si el modelo puede acceder al historial, sino también si puede reutilizarlo de manera eficiente, continua y con baja latencia. Los mecanismos de atención estándar incurren en un costo computacional cuadrático a medida que aumenta la longitud de la secuencia. Además, expandir la ventana de contexto no garantiza que el modelo realmente recuerde la información de manera efectiva. Los modelos a menudo sufren de degradación del contexto o podredumbre del contexto a medida que se sienten abrumados con más información (y a menudo contradictoria), incluso si en teoría admiten un millón de tokens.
Los investigadores abogan por mecanismos de memoria avanzados que puedan representar información histórica de forma compacta y mantenerla dinámicamente a lo largo de las interacciones. Las soluciones existentes conllevan importantes concesiones y generalmente se dividen en tres paradigmas:
-
Memoria textual: almacena el historial como texto inyectado en contexto, restringido por los límites de las ventanas y propenso a la pérdida de información bajo compresión.
-
Canal exterior (RAG): codifica y recupera de módulos externos: agrega latencia, complejidad de integración y posible desalineación con la red troncal.
-
Paramétrico: codifica la memoria en pesos del modelo a través de adaptadores: estática después del entrenamiento, no puede adaptarse a nueva información durante las interacciones en vivo.
Dentro de delta-mem
Para lograr una memoria compacta y actualizada dinámicamente, delta-mem comprime las interacciones pasadas de un agente en un «estado en línea de memoria asociativa» (OSAM). Este estado se mantiene como una matriz de tamaño fijo que preserva la información histórica mientras el modelo de lenguaje subyacente permanece congelado.
Para los flujos de trabajo empresariales, esto se traduce directamente en resolver cuellos de botella operativos. Lei señaló que un asistente de codificación persistente, por ejemplo, «puede necesitar recordar las convenciones del proyecto, los pasos de depuración recientes, las preferencias del usuario o las decisiones intermedias a lo largo de un flujo de trabajo». De manera similar, un agente de análisis de datos podría «necesitar mantener el estado de la tarea, las suposiciones y las observaciones previas mientras itera sobre múltiples llamadas a herramientas».
En lugar de recuperar y reinsertar repetidamente todo el historial relevante para estas tareas, la matriz delta-mem proporciona una manera de bajo costo para llevar adelante estados de interacción útiles dentro del cálculo directo del modelo.
Durante la generación, el sistema no recupera segmentos de texto sin formato para agregarlos al mensaje. En cambio, el estado oculto actual del LLM troncal se proyecta en la matriz para recuperar la memoria antigua. Esta operación extrae señales de memoria asociativa relevantes para el contexto de delta-mem. Luego, estas señales se transforman en correcciones numéricas que se aplican a los cálculos del modelo. Esto dirige el razonamiento del modelo en el momento de la inferencia sin alterar sus parámetros internos.
Después de cada interacción, delta-mem actualiza el estado en línea mediante el «aprendizaje de reglas delta». Cuando llega nueva información, el estado anterior hace una predicción sobre los valores de atención resultantes. Luego compara esta predicción con el valor real y corrige la matriz de memoria en función de la discrepancia.
Este mecanismo de actualización se basa en una «regla delta cerrada». Básicamente, el módulo de memoria tiene diferentes perillas que controlan cuánta memoria anterior se conserva y cuánta memoria nueva se aplica. Esta corrección de errores con olvido controlado permite que la matriz evolucione con el tiempo, manteniendo asociaciones históricas estables sin verse descarrilada por el ruido a corto plazo.
Los investigadores exploraron tres estrategias para determinar cuándo y cómo se actualiza la matriz:
-
Escritura en estado de token Capta cambios detallados pero es vulnerable al ruido a corto plazo.
-
Escritura de estado de secuencia promedia los tokens dentro de un segmento de mensaje, suavizando las actualizaciones a costa de algunos detalles localizados.
-
Escritura multiestado descompone la memoria en subestados para diferentes tipos de información, como hechos o progreso de tareas.
Delta-mem en acción
Los investigadores evaluaron delta-mem en tres pilares de LLM: Qwen3-8B, Qwen3-4B-Instruct y SmolLM3-3B. Configuraron el marco con una matriz compacta de 8×8. El sistema fue probado en puntos de referencia de capacidad general, incluidos HotpotQA, GPQA-Diamond e IFEval. También se evaluó en tareas que requieren mucha memoria, como LoCoMo, que prueba la memoria conversacional a largo plazo, y Memory Agent Bench, que evalúa la retención, la recuperación, el olvido selectivo y el aprendizaje en el momento de la prueba en interacciones prolongadas.
El marco se comparó con modelos representativos de los tres paradigmas de memoria existentes: líneas base de memoria textual (por ejemplo, BM25 RAG, LLMLingua-2 y MemoryBank), sistemas paramétricos (Context2LoRA y MemGen) y el enfoque de canal externo MLP Memory.
En general, delta-mem superó a las líneas de base, según los investigadores. En la columna vertebral Qwen3-4B-Instruct, la variante de escritura en estado de token logró una puntuación promedio del 51,66 %, superando fácilmente la columna vertebral de vainilla congelada con un 46,79 % y la línea de base más sólida, Context2LoRA, con un 44,90 %. En el Memory Agent Bench, con mucha memoria, la puntuación promedio saltó del 29,54% al 38,85%. El rendimiento en la subtarea de aprendizaje específica en el momento del examen casi se duplicó de 26,14 a 50,50.
Sin embargo, las conclusiones más convincentes son la eficiencia operativa del sistema. Los investigadores probaron el marco en un entorno sin contexto donde el texto histórico fue completamente eliminado del contexto. Incluso sin una reproducción de texto explícita, delta-mem recuperó con éxito evidencia relevante para el contexto en tareas de múltiples saltos. Los investigadores argumentan que el modelo recuerda interacciones pasadas sin necesidad de ingerir cantidades masivas de tokens rápidos.
El marco también agrega solo 4,87 millones de parámetros entrenables, lo que representa solo el 0,12 % de la columna vertebral de Qwen3-4B-Instruct. En comparación, la línea base de memoria MLP requirió 3 mil millones de parámetros, escalando hasta el 76,40 % del tamaño de la red troncal y, al mismo tiempo, arrojó resultados inferiores. Cuando la longitud de las solicitudes aumentó hasta 32 000 tokens durante las pruebas de inferencia, el marco mantuvo casi exactamente la misma huella de memoria de GPU que un modelo estándar sin modificaciones. Evita la gran sobrecarga de memoria que afecta a otros sistemas de memoria avanzados como MemGen y MLP Memory.
Diferentes estrategias de actualización resultaron beneficiosas según la capacidad del modelo subyacente. La estrategia de escritura de estado de secuencia fue la más efectiva para redes troncales más fuertes como Qwen3-8B. Estos modelos más capaces utilizan la escritura a nivel de segmento para suavizar las actualizaciones y mitigar el ruido a nivel de token. Por el contrario, la estrategia de escritura en varios estados impulsó enormes avances en el rendimiento de redes troncales más pequeñas como SmolLM3-3B. Para estos modelos de menor capacidad, separar la memoria en múltiples estados resultó fundamental para minimizar la interferencia de la información.
Implementación de delta-mem en la pila empresarial
Los investigadores han publicado el código para delta-mem en GitHub y el pesos para sus adaptadores entrenados en Abrazar la cara. Para los equipos de ingeniería de IA que buscan integrar este marco en su pila de inferencia existente, el proceso requiere recursos informáticos mínimos.
«En la práctica, un equipo de ingeniería comenzaría a partir de una red troncal existente sintonizada con instrucciones, conectaría los módulos adaptadores Delta-Mem a capas de atención seleccionadas, entrenaría solo los parámetros del adaptador en datos de contexto largo o de múltiples giros relevantes para el dominio… y luego ejecutaría la inferencia con el estado de la memoria actualizado en línea durante la interacción», dijo Lei. Fundamentalmente, los equipos no necesitan un corpus de preentrenamiento masivo. Los datos de entrenamiento solo necesitan reflejar el comportamiento de la memoria objetivo, como diálogos de varios turnos, seguimientos de agentes o flujos de trabajo de dominio donde la información anterior debe influir en las decisiones posteriores.
Si bien comprimir el historial de interacciones en una matriz matemática de tamaño fijo crea una inmensa eficiencia, conlleva compensaciones. Delta-mem no reemplaza sin pérdidas los registros de texto explícitos o la recuperación de documentos. Debido a que diferentes piezas de información compiten dentro del mismo estado limitado, existe el riesgo de que se mezclen los recuerdos.
«Delta-Mem es útil cuando el sistema necesita un estado de comportamiento rápido, en línea y continuamente actualizado», dijo Lei. «RAG es mejor cuando el sistema necesita un recuerdo exacto de los hechos, citas, cumplimiento, auditabilidad o acceso a una gran base de conocimiento externo». Recordar el estilo de trabajo de un usuario o una trayectoria de razonamiento de varios pasos es perfecto para delta-mem, mientras que recuperar un contrato legal o una directriz médica debe permanecer en una base de datos vectorial.
Esto significa que la arquitectura empresarial más realista en el futuro es un enfoque híbrido. Delta-mem actúa como una memoria de trabajo interna liviana, lo que reduce la necesidad de recuperar o reproducir todo todo el tiempo, mientras que RAG sirve como capa de memoria explícita de alta capacidad.
«De cara al futuro, no creo que las bases de datos vectoriales se vuelvan obsoletas», afirmó Lei. «En cambio, espero que las pilas de IA empresarial tengan más capas. Probablemente veremos memoria de trabajo a corto plazo dentro del modelo, memoria explícita a largo plazo en los sistemas de recuperación y capas de políticas o auditorías que deciden qué se debe almacenar, recuperar, olvidar o exponer al usuario».
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Los agentes de IA lo olvidan. Cada vez que un asistente de codificación pierde el rastro de un hilo de depuración o un agente de análisis de datos vuelve a ingerir el mismo contexto que ya procesó, el equipo paga en latencia, costos de tokens y flujos de trabajo frágiles. La solución que buscan la mayoría de los equipos (ampliar la ventana de contexto o agregar más RAG) es cada vez más costosa y aún no funciona de manera confiable.
Para abordar esto, investigadores de Mind Lab y varias universidades propusieron delta-memuna técnica eficiente que comprime la información histórica del modelo en una matriz actualizada dinámicamente sin cambiar el modelo en sí. El módulo resultante añade sólo el 0,12% de los parámetros del modelo backbone (en comparación con el 76,40% de una alternativa líder) y lo supera en pruebas comparativas con mucha memoria. Delta-mem permite que los modelos acumulen y reutilicen continuamente datos históricos, lo que reduce la dependencia de ventanas de contexto masivas o módulos de recuperación externos complejos para la continuidad del comportamiento.
El desafío de la memoria larga
La solución convencional es simplemente volcar toda la información en la ventana contextual del modelo.
Pero como dijo a VentureBeat Jingdi Lei, coautor del artículo, los sistemas actuales tratan la memoria simplemente como un problema de gestión del contexto. «O seguimos ampliando la ventana contextual o recuperamos más documentos a través de RAG», explicó Lei. “Estos enfoques son útiles y seguirán siendo importantes, pero se vuelven cada vez más costosos y frágiles cuando los agentes necesitan operar en interacciones de varios pasos y de larga duración, y en realidad no lo hacen. [work] «Se parecen a la memoria humana, ya que se parecen más a buscar documentos».
En entornos empresariales, el cuello de botella no es sólo si el modelo puede acceder al historial, sino también si puede reutilizarlo de manera eficiente, continua y con baja latencia. Los mecanismos de atención estándar incurren en un costo computacional cuadrático a medida que aumenta la longitud de la secuencia. Además, expandir la ventana de contexto no garantiza que el modelo realmente recuerde la información de manera efectiva. Los modelos a menudo sufren de degradación del contexto o podredumbre del contexto a medida que se sienten abrumados con más información (y a menudo contradictoria), incluso si en teoría admiten un millón de tokens.
Los investigadores abogan por mecanismos de memoria avanzados que puedan representar información histórica de forma compacta y mantenerla dinámicamente a lo largo de las interacciones. Las soluciones existentes conllevan importantes concesiones y generalmente se dividen en tres paradigmas:
-
Memoria textual: almacena el historial como texto inyectado en contexto, restringido por los límites de las ventanas y propenso a la pérdida de información bajo compresión.
-
Canal exterior (RAG): codifica y recupera de módulos externos: agrega latencia, complejidad de integración y posible desalineación con la red troncal.
-
Paramétrico: codifica la memoria en pesos del modelo a través de adaptadores: estática después del entrenamiento, no puede adaptarse a nueva información durante las interacciones en vivo.
Dentro de delta-mem
Para lograr una memoria compacta y actualizada dinámicamente, delta-mem comprime las interacciones pasadas de un agente en un «estado en línea de memoria asociativa» (OSAM). Este estado se mantiene como una matriz de tamaño fijo que preserva la información histórica mientras el modelo de lenguaje subyacente permanece congelado.
Para los flujos de trabajo empresariales, esto se traduce directamente en resolver cuellos de botella operativos. Lei señaló que un asistente de codificación persistente, por ejemplo, «puede necesitar recordar las convenciones del proyecto, los pasos de depuración recientes, las preferencias del usuario o las decisiones intermedias a lo largo de un flujo de trabajo». De manera similar, un agente de análisis de datos podría «necesitar mantener el estado de la tarea, las suposiciones y las observaciones previas mientras itera sobre múltiples llamadas a herramientas».
En lugar de recuperar y reinsertar repetidamente todo el historial relevante para estas tareas, la matriz delta-mem proporciona una manera de bajo costo para llevar adelante estados de interacción útiles dentro del cálculo directo del modelo.
Durante la generación, el sistema no recupera segmentos de texto sin formato para agregarlos al mensaje. En cambio, el estado oculto actual del LLM troncal se proyecta en la matriz para recuperar la memoria antigua. Esta operación extrae señales de memoria asociativa relevantes para el contexto de delta-mem. Luego, estas señales se transforman en correcciones numéricas que se aplican a los cálculos del modelo. Esto dirige el razonamiento del modelo en el momento de la inferencia sin alterar sus parámetros internos.
Después de cada interacción, delta-mem actualiza el estado en línea mediante el «aprendizaje de reglas delta». Cuando llega nueva información, el estado anterior hace una predicción sobre los valores de atención resultantes. Luego compara esta predicción con el valor real y corrige la matriz de memoria en función de la discrepancia.
Este mecanismo de actualización se basa en una «regla delta cerrada». Básicamente, el módulo de memoria tiene diferentes perillas que controlan cuánta memoria anterior se conserva y cuánta memoria nueva se aplica. Esta corrección de errores con olvido controlado permite que la matriz evolucione con el tiempo, manteniendo asociaciones históricas estables sin verse descarrilada por el ruido a corto plazo.
Los investigadores exploraron tres estrategias para determinar cuándo y cómo se actualiza la matriz:
-
Escritura en estado de token Capta cambios detallados pero es vulnerable al ruido a corto plazo.
-
Escritura de estado de secuencia promedia los tokens dentro de un segmento de mensaje, suavizando las actualizaciones a costa de algunos detalles localizados.
-
Escritura multiestado descompone la memoria en subestados para diferentes tipos de información, como hechos o progreso de tareas.
Delta-mem en acción
Los investigadores evaluaron delta-mem en tres pilares de LLM: Qwen3-8B, Qwen3-4B-Instruct y SmolLM3-3B. Configuraron el marco con una matriz compacta de 8×8. El sistema fue probado en puntos de referencia de capacidad general, incluidos HotpotQA, GPQA-Diamond e IFEval. También se evaluó en tareas que requieren mucha memoria, como LoCoMo, que prueba la memoria conversacional a largo plazo, y Memory Agent Bench, que evalúa la retención, la recuperación, el olvido selectivo y el aprendizaje en el momento de la prueba en interacciones prolongadas.
El marco se comparó con modelos representativos de los tres paradigmas de memoria existentes: líneas base de memoria textual (por ejemplo, BM25 RAG, LLMLingua-2 y MemoryBank), sistemas paramétricos (Context2LoRA y MemGen) y el enfoque de canal externo MLP Memory.
En general, delta-mem superó a las líneas de base, según los investigadores. En la columna vertebral Qwen3-4B-Instruct, la variante de escritura en estado de token logró una puntuación promedio del 51,66 %, superando fácilmente la columna vertebral de vainilla congelada con un 46,79 % y la línea de base más sólida, Context2LoRA, con un 44,90 %. En el Memory Agent Bench, con mucha memoria, la puntuación promedio saltó del 29,54% al 38,85%. El rendimiento en la subtarea de aprendizaje específica en el momento del examen casi se duplicó de 26,14 a 50,50.
Sin embargo, las conclusiones más convincentes son la eficiencia operativa del sistema. Los investigadores probaron el marco en un entorno sin contexto donde el texto histórico fue completamente eliminado del contexto. Incluso sin una reproducción de texto explícita, delta-mem recuperó con éxito evidencia relevante para el contexto en tareas de múltiples saltos. Los investigadores argumentan que el modelo recuerda interacciones pasadas sin necesidad de ingerir cantidades masivas de tokens rápidos.
El marco también agrega solo 4,87 millones de parámetros entrenables, lo que representa solo el 0,12 % de la columna vertebral de Qwen3-4B-Instruct. En comparación, la línea base de memoria MLP requirió 3 mil millones de parámetros, escalando hasta el 76,40 % del tamaño de la red troncal y, al mismo tiempo, arrojó resultados inferiores. Cuando la longitud de las solicitudes aumentó hasta 32 000 tokens durante las pruebas de inferencia, el marco mantuvo casi exactamente la misma huella de memoria de GPU que un modelo estándar sin modificaciones. Evita la gran sobrecarga de memoria que afecta a otros sistemas de memoria avanzados como MemGen y MLP Memory.
Diferentes estrategias de actualización resultaron beneficiosas según la capacidad del modelo subyacente. La estrategia de escritura de estado de secuencia fue la más efectiva para redes troncales más fuertes como Qwen3-8B. Estos modelos más capaces utilizan la escritura a nivel de segmento para suavizar las actualizaciones y mitigar el ruido a nivel de token. Por el contrario, la estrategia de escritura en varios estados impulsó enormes avances en el rendimiento de redes troncales más pequeñas como SmolLM3-3B. Para estos modelos de menor capacidad, separar la memoria en múltiples estados resultó fundamental para minimizar la interferencia de la información.
Implementación de delta-mem en la pila empresarial
Los investigadores han publicado el código para delta-mem en GitHub y el pesos para sus adaptadores entrenados en Abrazar la cara. Para los equipos de ingeniería de IA que buscan integrar este marco en su pila de inferencia existente, el proceso requiere recursos informáticos mínimos.
«En la práctica, un equipo de ingeniería comenzaría a partir de una red troncal existente sintonizada con instrucciones, conectaría los módulos adaptadores Delta-Mem a capas de atención seleccionadas, entrenaría solo los parámetros del adaptador en datos de contexto largo o de múltiples giros relevantes para el dominio… y luego ejecutaría la inferencia con el estado de la memoria actualizado en línea durante la interacción», dijo Lei. Fundamentalmente, los equipos no necesitan un corpus de preentrenamiento masivo. Los datos de entrenamiento solo necesitan reflejar el comportamiento de la memoria objetivo, como diálogos de varios turnos, seguimientos de agentes o flujos de trabajo de dominio donde la información anterior debe influir en las decisiones posteriores.
Si bien comprimir el historial de interacciones en una matriz matemática de tamaño fijo crea una inmensa eficiencia, conlleva compensaciones. Delta-mem no reemplaza sin pérdidas los registros de texto explícitos o la recuperación de documentos. Debido a que diferentes piezas de información compiten dentro del mismo estado limitado, existe el riesgo de que se mezclen los recuerdos.
«Delta-Mem es útil cuando el sistema necesita un estado de comportamiento rápido, en línea y continuamente actualizado», dijo Lei. «RAG es mejor cuando el sistema necesita un recuerdo exacto de los hechos, citas, cumplimiento, auditabilidad o acceso a una gran base de conocimiento externo». Recordar el estilo de trabajo de un usuario o una trayectoria de razonamiento de varios pasos es perfecto para delta-mem, mientras que recuperar un contrato legal o una directriz médica debe permanecer en una base de datos vectorial.
Esto significa que la arquitectura empresarial más realista en el futuro es un enfoque híbrido. Delta-mem actúa como una memoria de trabajo interna liviana, lo que reduce la necesidad de recuperar o reproducir todo todo el tiempo, mientras que RAG sirve como capa de memoria explícita de alta capacidad.
«De cara al futuro, no creo que las bases de datos vectoriales se vuelvan obsoletas», afirmó Lei. «En cambio, espero que las pilas de IA empresarial tengan más capas. Probablemente veremos memoria de trabajo a corto plazo dentro del modelo, memoria explícita a largo plazo en los sistemas de recuperación y capas de políticas o auditorías que deciden qué se debe almacenar, recuperar, olvidar o exponer al usuario».
Los agentes de IA lo olvidan. Cada vez que un asistente de codificación pierde el rastro de un hilo de depuración o un agente de análisis de datos vuelve a ingerir el mismo contexto que ya procesó, el equipo paga en latencia, costos de tokens y flujos de trabajo frágiles. La solución que buscan la mayoría de los equipos (ampliar la ventana de contexto o agregar más RAG) es cada vez más costosa y aún no funciona de manera confiable.
Para abordar esto, investigadores de Mind Lab y varias universidades propusieron delta-memuna técnica eficiente que comprime la información histórica del modelo en una matriz actualizada dinámicamente sin cambiar el modelo en sí. El módulo resultante añade sólo el 0,12% de los parámetros del modelo backbone (en comparación con el 76,40% de una alternativa líder) y lo supera en pruebas comparativas con mucha memoria. Delta-mem permite que los modelos acumulen y reutilicen continuamente datos históricos, lo que reduce la dependencia de ventanas de contexto masivas o módulos de recuperación externos complejos para la continuidad del comportamiento.
El desafío de la memoria larga
La solución convencional es simplemente volcar toda la información en la ventana contextual del modelo.
Pero como dijo a VentureBeat Jingdi Lei, coautor del artículo, los sistemas actuales tratan la memoria simplemente como un problema de gestión del contexto. «O seguimos ampliando la ventana contextual o recuperamos más documentos a través de RAG», explicó Lei. “Estos enfoques son útiles y seguirán siendo importantes, pero se vuelven cada vez más costosos y frágiles cuando los agentes necesitan operar en interacciones de varios pasos y de larga duración, y en realidad no lo hacen. [work] «Se parecen a la memoria humana, ya que se parecen más a buscar documentos».
En entornos empresariales, el cuello de botella no es sólo si el modelo puede acceder al historial, sino también si puede reutilizarlo de manera eficiente, continua y con baja latencia. Los mecanismos de atención estándar incurren en un costo computacional cuadrático a medida que aumenta la longitud de la secuencia. Además, expandir la ventana de contexto no garantiza que el modelo realmente recuerde la información de manera efectiva. Los modelos a menudo sufren de degradación del contexto o podredumbre del contexto a medida que se sienten abrumados con más información (y a menudo contradictoria), incluso si en teoría admiten un millón de tokens.
Los investigadores abogan por mecanismos de memoria avanzados que puedan representar información histórica de forma compacta y mantenerla dinámicamente a lo largo de las interacciones. Las soluciones existentes conllevan importantes concesiones y generalmente se dividen en tres paradigmas:
-
Memoria textual: almacena el historial como texto inyectado en contexto, restringido por los límites de las ventanas y propenso a la pérdida de información bajo compresión.
-
Canal exterior (RAG): codifica y recupera de módulos externos: agrega latencia, complejidad de integración y posible desalineación con la red troncal.
-
Paramétrico: codifica la memoria en pesos del modelo a través de adaptadores: estática después del entrenamiento, no puede adaptarse a nueva información durante las interacciones en vivo.
Dentro de delta-mem
Para lograr una memoria compacta y actualizada dinámicamente, delta-mem comprime las interacciones pasadas de un agente en un «estado en línea de memoria asociativa» (OSAM). Este estado se mantiene como una matriz de tamaño fijo que preserva la información histórica mientras el modelo de lenguaje subyacente permanece congelado.
Para los flujos de trabajo empresariales, esto se traduce directamente en resolver cuellos de botella operativos. Lei señaló que un asistente de codificación persistente, por ejemplo, «puede necesitar recordar las convenciones del proyecto, los pasos de depuración recientes, las preferencias del usuario o las decisiones intermedias a lo largo de un flujo de trabajo». De manera similar, un agente de análisis de datos podría «necesitar mantener el estado de la tarea, las suposiciones y las observaciones previas mientras itera sobre múltiples llamadas a herramientas».
En lugar de recuperar y reinsertar repetidamente todo el historial relevante para estas tareas, la matriz delta-mem proporciona una manera de bajo costo para llevar adelante estados de interacción útiles dentro del cálculo directo del modelo.
Durante la generación, el sistema no recupera segmentos de texto sin formato para agregarlos al mensaje. En cambio, el estado oculto actual del LLM troncal se proyecta en la matriz para recuperar la memoria antigua. Esta operación extrae señales de memoria asociativa relevantes para el contexto de delta-mem. Luego, estas señales se transforman en correcciones numéricas que se aplican a los cálculos del modelo. Esto dirige el razonamiento del modelo en el momento de la inferencia sin alterar sus parámetros internos.
Después de cada interacción, delta-mem actualiza el estado en línea mediante el «aprendizaje de reglas delta». Cuando llega nueva información, el estado anterior hace una predicción sobre los valores de atención resultantes. Luego compara esta predicción con el valor real y corrige la matriz de memoria en función de la discrepancia.
Este mecanismo de actualización se basa en una «regla delta cerrada». Básicamente, el módulo de memoria tiene diferentes perillas que controlan cuánta memoria anterior se conserva y cuánta memoria nueva se aplica. Esta corrección de errores con olvido controlado permite que la matriz evolucione con el tiempo, manteniendo asociaciones históricas estables sin verse descarrilada por el ruido a corto plazo.
Los investigadores exploraron tres estrategias para determinar cuándo y cómo se actualiza la matriz:
-
Escritura en estado de token Capta cambios detallados pero es vulnerable al ruido a corto plazo.
-
Escritura de estado de secuencia promedia los tokens dentro de un segmento de mensaje, suavizando las actualizaciones a costa de algunos detalles localizados.
-
Escritura multiestado descompone la memoria en subestados para diferentes tipos de información, como hechos o progreso de tareas.
Delta-mem en acción
Los investigadores evaluaron delta-mem en tres pilares de LLM: Qwen3-8B, Qwen3-4B-Instruct y SmolLM3-3B. Configuraron el marco con una matriz compacta de 8×8. El sistema fue probado en puntos de referencia de capacidad general, incluidos HotpotQA, GPQA-Diamond e IFEval. También se evaluó en tareas que requieren mucha memoria, como LoCoMo, que prueba la memoria conversacional a largo plazo, y Memory Agent Bench, que evalúa la retención, la recuperación, el olvido selectivo y el aprendizaje en el momento de la prueba en interacciones prolongadas.
El marco se comparó con modelos representativos de los tres paradigmas de memoria existentes: líneas base de memoria textual (por ejemplo, BM25 RAG, LLMLingua-2 y MemoryBank), sistemas paramétricos (Context2LoRA y MemGen) y el enfoque de canal externo MLP Memory.
En general, delta-mem superó a las líneas de base, según los investigadores. En la columna vertebral Qwen3-4B-Instruct, la variante de escritura en estado de token logró una puntuación promedio del 51,66 %, superando fácilmente la columna vertebral de vainilla congelada con un 46,79 % y la línea de base más sólida, Context2LoRA, con un 44,90 %. En el Memory Agent Bench, con mucha memoria, la puntuación promedio saltó del 29,54% al 38,85%. El rendimiento en la subtarea de aprendizaje específica en el momento del examen casi se duplicó de 26,14 a 50,50.
Sin embargo, las conclusiones más convincentes son la eficiencia operativa del sistema. Los investigadores probaron el marco en un entorno sin contexto donde el texto histórico fue completamente eliminado del contexto. Incluso sin una reproducción de texto explícita, delta-mem recuperó con éxito evidencia relevante para el contexto en tareas de múltiples saltos. Los investigadores argumentan que el modelo recuerda interacciones pasadas sin necesidad de ingerir cantidades masivas de tokens rápidos.
El marco también agrega solo 4,87 millones de parámetros entrenables, lo que representa solo el 0,12 % de la columna vertebral de Qwen3-4B-Instruct. En comparación, la línea base de memoria MLP requirió 3 mil millones de parámetros, escalando hasta el 76,40 % del tamaño de la red troncal y, al mismo tiempo, arrojó resultados inferiores. Cuando la longitud de las solicitudes aumentó hasta 32 000 tokens durante las pruebas de inferencia, el marco mantuvo casi exactamente la misma huella de memoria de GPU que un modelo estándar sin modificaciones. Evita la gran sobrecarga de memoria que afecta a otros sistemas de memoria avanzados como MemGen y MLP Memory.
Diferentes estrategias de actualización resultaron beneficiosas según la capacidad del modelo subyacente. La estrategia de escritura de estado de secuencia fue la más efectiva para redes troncales más fuertes como Qwen3-8B. Estos modelos más capaces utilizan la escritura a nivel de segmento para suavizar las actualizaciones y mitigar el ruido a nivel de token. Por el contrario, la estrategia de escritura en varios estados impulsó enormes avances en el rendimiento de redes troncales más pequeñas como SmolLM3-3B. Para estos modelos de menor capacidad, separar la memoria en múltiples estados resultó fundamental para minimizar la interferencia de la información.
Implementación de delta-mem en la pila empresarial
Los investigadores han publicado el código para delta-mem en GitHub y el pesos para sus adaptadores entrenados en Abrazar la cara. Para los equipos de ingeniería de IA que buscan integrar este marco en su pila de inferencia existente, el proceso requiere recursos informáticos mínimos.
«En la práctica, un equipo de ingeniería comenzaría a partir de una red troncal existente sintonizada con instrucciones, conectaría los módulos adaptadores Delta-Mem a capas de atención seleccionadas, entrenaría solo los parámetros del adaptador en datos de contexto largo o de múltiples giros relevantes para el dominio… y luego ejecutaría la inferencia con el estado de la memoria actualizado en línea durante la interacción», dijo Lei. Fundamentalmente, los equipos no necesitan un corpus de preentrenamiento masivo. Los datos de entrenamiento solo necesitan reflejar el comportamiento de la memoria objetivo, como diálogos de varios turnos, seguimientos de agentes o flujos de trabajo de dominio donde la información anterior debe influir en las decisiones posteriores.
Si bien comprimir el historial de interacciones en una matriz matemática de tamaño fijo crea una inmensa eficiencia, conlleva compensaciones. Delta-mem no reemplaza sin pérdidas los registros de texto explícitos o la recuperación de documentos. Debido a que diferentes piezas de información compiten dentro del mismo estado limitado, existe el riesgo de que se mezclen los recuerdos.
«Delta-Mem es útil cuando el sistema necesita un estado de comportamiento rápido, en línea y continuamente actualizado», dijo Lei. «RAG es mejor cuando el sistema necesita un recuerdo exacto de los hechos, citas, cumplimiento, auditabilidad o acceso a una gran base de conocimiento externo». Recordar el estilo de trabajo de un usuario o una trayectoria de razonamiento de varios pasos es perfecto para delta-mem, mientras que recuperar un contrato legal o una directriz médica debe permanecer en una base de datos vectorial.
Esto significa que la arquitectura empresarial más realista en el futuro es un enfoque híbrido. Delta-mem actúa como una memoria de trabajo interna liviana, lo que reduce la necesidad de recuperar o reproducir todo todo el tiempo, mientras que RAG sirve como capa de memoria explícita de alta capacidad.
«De cara al futuro, no creo que las bases de datos vectoriales se vuelvan obsoletas», afirmó Lei. «En cambio, espero que las pilas de IA empresarial tengan más capas. Probablemente veremos memoria de trabajo a corto plazo dentro del modelo, memoria explícita a largo plazo en los sistemas de recuperación y capas de políticas o auditorías que deciden qué se debe almacenar, recuperar, olvidar o exponer al usuario».
Los agentes de IA lo olvidan. Cada vez que un asistente de codificación pierde el rastro de un hilo de depuración o un agente de análisis de datos vuelve a ingerir el mismo contexto que ya procesó, el equipo paga en latencia, costos de tokens y flujos de trabajo frágiles. La solución que buscan la mayoría de los equipos (ampliar la ventana de contexto o agregar más RAG) es cada vez más costosa y aún no funciona de manera confiable.
Para abordar esto, investigadores de Mind Lab y varias universidades propusieron delta-memuna técnica eficiente que comprime la información histórica del modelo en una matriz actualizada dinámicamente sin cambiar el modelo en sí. El módulo resultante añade sólo el 0,12% de los parámetros del modelo backbone (en comparación con el 76,40% de una alternativa líder) y lo supera en pruebas comparativas con mucha memoria. Delta-mem permite que los modelos acumulen y reutilicen continuamente datos históricos, lo que reduce la dependencia de ventanas de contexto masivas o módulos de recuperación externos complejos para la continuidad del comportamiento.
El desafío de la memoria larga
La solución convencional es simplemente volcar toda la información en la ventana contextual del modelo.
Pero como dijo a VentureBeat Jingdi Lei, coautor del artículo, los sistemas actuales tratan la memoria simplemente como un problema de gestión del contexto. «O seguimos ampliando la ventana contextual o recuperamos más documentos a través de RAG», explicó Lei. “Estos enfoques son útiles y seguirán siendo importantes, pero se vuelven cada vez más costosos y frágiles cuando los agentes necesitan operar en interacciones de varios pasos y de larga duración, y en realidad no lo hacen. [work] «Se parecen a la memoria humana, ya que se parecen más a buscar documentos».
En entornos empresariales, el cuello de botella no es sólo si el modelo puede acceder al historial, sino también si puede reutilizarlo de manera eficiente, continua y con baja latencia. Los mecanismos de atención estándar incurren en un costo computacional cuadrático a medida que aumenta la longitud de la secuencia. Además, expandir la ventana de contexto no garantiza que el modelo realmente recuerde la información de manera efectiva. Los modelos a menudo sufren de degradación del contexto o podredumbre del contexto a medida que se sienten abrumados con más información (y a menudo contradictoria), incluso si en teoría admiten un millón de tokens.
Los investigadores abogan por mecanismos de memoria avanzados que puedan representar información histórica de forma compacta y mantenerla dinámicamente a lo largo de las interacciones. Las soluciones existentes conllevan importantes concesiones y generalmente se dividen en tres paradigmas:
-
Memoria textual: almacena el historial como texto inyectado en contexto, restringido por los límites de las ventanas y propenso a la pérdida de información bajo compresión.
-
Canal exterior (RAG): codifica y recupera de módulos externos: agrega latencia, complejidad de integración y posible desalineación con la red troncal.
-
Paramétrico: codifica la memoria en pesos del modelo a través de adaptadores: estática después del entrenamiento, no puede adaptarse a nueva información durante las interacciones en vivo.
Dentro de delta-mem
Para lograr una memoria compacta y actualizada dinámicamente, delta-mem comprime las interacciones pasadas de un agente en un «estado en línea de memoria asociativa» (OSAM). Este estado se mantiene como una matriz de tamaño fijo que preserva la información histórica mientras el modelo de lenguaje subyacente permanece congelado.
Para los flujos de trabajo empresariales, esto se traduce directamente en resolver cuellos de botella operativos. Lei señaló que un asistente de codificación persistente, por ejemplo, «puede necesitar recordar las convenciones del proyecto, los pasos de depuración recientes, las preferencias del usuario o las decisiones intermedias a lo largo de un flujo de trabajo». De manera similar, un agente de análisis de datos podría «necesitar mantener el estado de la tarea, las suposiciones y las observaciones previas mientras itera sobre múltiples llamadas a herramientas».
En lugar de recuperar y reinsertar repetidamente todo el historial relevante para estas tareas, la matriz delta-mem proporciona una manera de bajo costo para llevar adelante estados de interacción útiles dentro del cálculo directo del modelo.
Durante la generación, el sistema no recupera segmentos de texto sin formato para agregarlos al mensaje. En cambio, el estado oculto actual del LLM troncal se proyecta en la matriz para recuperar la memoria antigua. Esta operación extrae señales de memoria asociativa relevantes para el contexto de delta-mem. Luego, estas señales se transforman en correcciones numéricas que se aplican a los cálculos del modelo. Esto dirige el razonamiento del modelo en el momento de la inferencia sin alterar sus parámetros internos.
Después de cada interacción, delta-mem actualiza el estado en línea mediante el «aprendizaje de reglas delta». Cuando llega nueva información, el estado anterior hace una predicción sobre los valores de atención resultantes. Luego compara esta predicción con el valor real y corrige la matriz de memoria en función de la discrepancia.
Este mecanismo de actualización se basa en una «regla delta cerrada». Básicamente, el módulo de memoria tiene diferentes perillas que controlan cuánta memoria anterior se conserva y cuánta memoria nueva se aplica. Esta corrección de errores con olvido controlado permite que la matriz evolucione con el tiempo, manteniendo asociaciones históricas estables sin verse descarrilada por el ruido a corto plazo.
Los investigadores exploraron tres estrategias para determinar cuándo y cómo se actualiza la matriz:
-
Escritura en estado de token Capta cambios detallados pero es vulnerable al ruido a corto plazo.
-
Escritura de estado de secuencia promedia los tokens dentro de un segmento de mensaje, suavizando las actualizaciones a costa de algunos detalles localizados.
-
Escritura multiestado descompone la memoria en subestados para diferentes tipos de información, como hechos o progreso de tareas.
Delta-mem en acción
Los investigadores evaluaron delta-mem en tres pilares de LLM: Qwen3-8B, Qwen3-4B-Instruct y SmolLM3-3B. Configuraron el marco con una matriz compacta de 8×8. El sistema fue probado en puntos de referencia de capacidad general, incluidos HotpotQA, GPQA-Diamond e IFEval. También se evaluó en tareas que requieren mucha memoria, como LoCoMo, que prueba la memoria conversacional a largo plazo, y Memory Agent Bench, que evalúa la retención, la recuperación, el olvido selectivo y el aprendizaje en el momento de la prueba en interacciones prolongadas.
El marco se comparó con modelos representativos de los tres paradigmas de memoria existentes: líneas base de memoria textual (por ejemplo, BM25 RAG, LLMLingua-2 y MemoryBank), sistemas paramétricos (Context2LoRA y MemGen) y el enfoque de canal externo MLP Memory.
En general, delta-mem superó a las líneas de base, según los investigadores. En la columna vertebral Qwen3-4B-Instruct, la variante de escritura en estado de token logró una puntuación promedio del 51,66 %, superando fácilmente la columna vertebral de vainilla congelada con un 46,79 % y la línea de base más sólida, Context2LoRA, con un 44,90 %. En el Memory Agent Bench, con mucha memoria, la puntuación promedio saltó del 29,54% al 38,85%. El rendimiento en la subtarea de aprendizaje específica en el momento del examen casi se duplicó de 26,14 a 50,50.
Sin embargo, las conclusiones más convincentes son la eficiencia operativa del sistema. Los investigadores probaron el marco en un entorno sin contexto donde el texto histórico fue completamente eliminado del contexto. Incluso sin una reproducción de texto explícita, delta-mem recuperó con éxito evidencia relevante para el contexto en tareas de múltiples saltos. Los investigadores argumentan que el modelo recuerda interacciones pasadas sin necesidad de ingerir cantidades masivas de tokens rápidos.
El marco también agrega solo 4,87 millones de parámetros entrenables, lo que representa solo el 0,12 % de la columna vertebral de Qwen3-4B-Instruct. En comparación, la línea base de memoria MLP requirió 3 mil millones de parámetros, escalando hasta el 76,40 % del tamaño de la red troncal y, al mismo tiempo, arrojó resultados inferiores. Cuando la longitud de las solicitudes aumentó hasta 32 000 tokens durante las pruebas de inferencia, el marco mantuvo casi exactamente la misma huella de memoria de GPU que un modelo estándar sin modificaciones. Evita la gran sobrecarga de memoria que afecta a otros sistemas de memoria avanzados como MemGen y MLP Memory.
Diferentes estrategias de actualización resultaron beneficiosas según la capacidad del modelo subyacente. La estrategia de escritura de estado de secuencia fue la más efectiva para redes troncales más fuertes como Qwen3-8B. Estos modelos más capaces utilizan la escritura a nivel de segmento para suavizar las actualizaciones y mitigar el ruido a nivel de token. Por el contrario, la estrategia de escritura en varios estados impulsó enormes avances en el rendimiento de redes troncales más pequeñas como SmolLM3-3B. Para estos modelos de menor capacidad, separar la memoria en múltiples estados resultó fundamental para minimizar la interferencia de la información.
Implementación de delta-mem en la pila empresarial
Los investigadores han publicado el código para delta-mem en GitHub y el pesos para sus adaptadores entrenados en Abrazar la cara. Para los equipos de ingeniería de IA que buscan integrar este marco en su pila de inferencia existente, el proceso requiere recursos informáticos mínimos.
«En la práctica, un equipo de ingeniería comenzaría a partir de una red troncal existente sintonizada con instrucciones, conectaría los módulos adaptadores Delta-Mem a capas de atención seleccionadas, entrenaría solo los parámetros del adaptador en datos de contexto largo o de múltiples giros relevantes para el dominio… y luego ejecutaría la inferencia con el estado de la memoria actualizado en línea durante la interacción», dijo Lei. Fundamentalmente, los equipos no necesitan un corpus de preentrenamiento masivo. Los datos de entrenamiento solo necesitan reflejar el comportamiento de la memoria objetivo, como diálogos de varios turnos, seguimientos de agentes o flujos de trabajo de dominio donde la información anterior debe influir en las decisiones posteriores.
Si bien comprimir el historial de interacciones en una matriz matemática de tamaño fijo crea una inmensa eficiencia, conlleva compensaciones. Delta-mem no reemplaza sin pérdidas los registros de texto explícitos o la recuperación de documentos. Debido a que diferentes piezas de información compiten dentro del mismo estado limitado, existe el riesgo de que se mezclen los recuerdos.
«Delta-Mem es útil cuando el sistema necesita un estado de comportamiento rápido, en línea y continuamente actualizado», dijo Lei. «RAG es mejor cuando el sistema necesita un recuerdo exacto de los hechos, citas, cumplimiento, auditabilidad o acceso a una gran base de conocimiento externo». Recordar el estilo de trabajo de un usuario o una trayectoria de razonamiento de varios pasos es perfecto para delta-mem, mientras que recuperar un contrato legal o una directriz médica debe permanecer en una base de datos vectorial.
Esto significa que la arquitectura empresarial más realista en el futuro es un enfoque híbrido. Delta-mem actúa como una memoria de trabajo interna liviana, lo que reduce la necesidad de recuperar o reproducir todo todo el tiempo, mientras que RAG sirve como capa de memoria explícita de alta capacidad.
«De cara al futuro, no creo que las bases de datos vectoriales se vuelvan obsoletas», afirmó Lei. «En cambio, espero que las pilas de IA empresarial tengan más capas. Probablemente veremos memoria de trabajo a corto plazo dentro del modelo, memoria explícita a largo plazo en los sistemas de recuperación y capas de políticas o auditorías que deciden qué se debe almacenar, recuperar, olvidar o exponer al usuario».
Los agentes de IA lo olvidan. Cada vez que un asistente de codificación pierde el rastro de un hilo de depuración o un agente de análisis de datos vuelve a ingerir el mismo contexto que ya procesó, el equipo paga en latencia, costos de tokens y flujos de trabajo frágiles. La solución que buscan la mayoría de los equipos (ampliar la ventana de contexto o agregar más RAG) es cada vez más costosa y aún no funciona de manera confiable.
Para abordar esto, investigadores de Mind Lab y varias universidades propusieron delta-memuna técnica eficiente que comprime la información histórica del modelo en una matriz actualizada dinámicamente sin cambiar el modelo en sí. El módulo resultante añade sólo el 0,12% de los parámetros del modelo backbone (en comparación con el 76,40% de una alternativa líder) y lo supera en pruebas comparativas con mucha memoria. Delta-mem permite que los modelos acumulen y reutilicen continuamente datos históricos, lo que reduce la dependencia de ventanas de contexto masivas o módulos de recuperación externos complejos para la continuidad del comportamiento.
El desafío de la memoria larga
La solución convencional es simplemente volcar toda la información en la ventana contextual del modelo.
Pero como dijo a VentureBeat Jingdi Lei, coautor del artículo, los sistemas actuales tratan la memoria simplemente como un problema de gestión del contexto. «O seguimos ampliando la ventana contextual o recuperamos más documentos a través de RAG», explicó Lei. “Estos enfoques son útiles y seguirán siendo importantes, pero se vuelven cada vez más costosos y frágiles cuando los agentes necesitan operar en interacciones de varios pasos y de larga duración, y en realidad no lo hacen. [work] «Se parecen a la memoria humana, ya que se parecen más a buscar documentos».
En entornos empresariales, el cuello de botella no es sólo si el modelo puede acceder al historial, sino también si puede reutilizarlo de manera eficiente, continua y con baja latencia. Los mecanismos de atención estándar incurren en un costo computacional cuadrático a medida que aumenta la longitud de la secuencia. Además, expandir la ventana de contexto no garantiza que el modelo realmente recuerde la información de manera efectiva. Los modelos a menudo sufren de degradación del contexto o podredumbre del contexto a medida que se sienten abrumados con más información (y a menudo contradictoria), incluso si en teoría admiten un millón de tokens.
Los investigadores abogan por mecanismos de memoria avanzados que puedan representar información histórica de forma compacta y mantenerla dinámicamente a lo largo de las interacciones. Las soluciones existentes conllevan importantes concesiones y generalmente se dividen en tres paradigmas:
-
Memoria textual: almacena el historial como texto inyectado en contexto, restringido por los límites de las ventanas y propenso a la pérdida de información bajo compresión.
-
Canal exterior (RAG): codifica y recupera de módulos externos: agrega latencia, complejidad de integración y posible desalineación con la red troncal.
-
Paramétrico: codifica la memoria en pesos del modelo a través de adaptadores: estática después del entrenamiento, no puede adaptarse a nueva información durante las interacciones en vivo.
Dentro de delta-mem
Para lograr una memoria compacta y actualizada dinámicamente, delta-mem comprime las interacciones pasadas de un agente en un «estado en línea de memoria asociativa» (OSAM). Este estado se mantiene como una matriz de tamaño fijo que preserva la información histórica mientras el modelo de lenguaje subyacente permanece congelado.
Para los flujos de trabajo empresariales, esto se traduce directamente en resolver cuellos de botella operativos. Lei señaló que un asistente de codificación persistente, por ejemplo, «puede necesitar recordar las convenciones del proyecto, los pasos de depuración recientes, las preferencias del usuario o las decisiones intermedias a lo largo de un flujo de trabajo». De manera similar, un agente de análisis de datos podría «necesitar mantener el estado de la tarea, las suposiciones y las observaciones previas mientras itera sobre múltiples llamadas a herramientas».
En lugar de recuperar y reinsertar repetidamente todo el historial relevante para estas tareas, la matriz delta-mem proporciona una manera de bajo costo para llevar adelante estados de interacción útiles dentro del cálculo directo del modelo.
Durante la generación, el sistema no recupera segmentos de texto sin formato para agregarlos al mensaje. En cambio, el estado oculto actual del LLM troncal se proyecta en la matriz para recuperar la memoria antigua. Esta operación extrae señales de memoria asociativa relevantes para el contexto de delta-mem. Luego, estas señales se transforman en correcciones numéricas que se aplican a los cálculos del modelo. Esto dirige el razonamiento del modelo en el momento de la inferencia sin alterar sus parámetros internos.
Después de cada interacción, delta-mem actualiza el estado en línea mediante el «aprendizaje de reglas delta». Cuando llega nueva información, el estado anterior hace una predicción sobre los valores de atención resultantes. Luego compara esta predicción con el valor real y corrige la matriz de memoria en función de la discrepancia.
Este mecanismo de actualización se basa en una «regla delta cerrada». Básicamente, el módulo de memoria tiene diferentes perillas que controlan cuánta memoria anterior se conserva y cuánta memoria nueva se aplica. Esta corrección de errores con olvido controlado permite que la matriz evolucione con el tiempo, manteniendo asociaciones históricas estables sin verse descarrilada por el ruido a corto plazo.
Los investigadores exploraron tres estrategias para determinar cuándo y cómo se actualiza la matriz:
-
Escritura en estado de token Capta cambios detallados pero es vulnerable al ruido a corto plazo.
-
Escritura de estado de secuencia promedia los tokens dentro de un segmento de mensaje, suavizando las actualizaciones a costa de algunos detalles localizados.
-
Escritura multiestado descompone la memoria en subestados para diferentes tipos de información, como hechos o progreso de tareas.
Delta-mem en acción
Los investigadores evaluaron delta-mem en tres pilares de LLM: Qwen3-8B, Qwen3-4B-Instruct y SmolLM3-3B. Configuraron el marco con una matriz compacta de 8×8. El sistema fue probado en puntos de referencia de capacidad general, incluidos HotpotQA, GPQA-Diamond e IFEval. También se evaluó en tareas que requieren mucha memoria, como LoCoMo, que prueba la memoria conversacional a largo plazo, y Memory Agent Bench, que evalúa la retención, la recuperación, el olvido selectivo y el aprendizaje en el momento de la prueba en interacciones prolongadas.
El marco se comparó con modelos representativos de los tres paradigmas de memoria existentes: líneas base de memoria textual (por ejemplo, BM25 RAG, LLMLingua-2 y MemoryBank), sistemas paramétricos (Context2LoRA y MemGen) y el enfoque de canal externo MLP Memory.
En general, delta-mem superó a las líneas de base, según los investigadores. En la columna vertebral Qwen3-4B-Instruct, la variante de escritura en estado de token logró una puntuación promedio del 51,66 %, superando fácilmente la columna vertebral de vainilla congelada con un 46,79 % y la línea de base más sólida, Context2LoRA, con un 44,90 %. En el Memory Agent Bench, con mucha memoria, la puntuación promedio saltó del 29,54% al 38,85%. El rendimiento en la subtarea de aprendizaje específica en el momento del examen casi se duplicó de 26,14 a 50,50.
Sin embargo, las conclusiones más convincentes son la eficiencia operativa del sistema. Los investigadores probaron el marco en un entorno sin contexto donde el texto histórico fue completamente eliminado del contexto. Incluso sin una reproducción de texto explícita, delta-mem recuperó con éxito evidencia relevante para el contexto en tareas de múltiples saltos. Los investigadores argumentan que el modelo recuerda interacciones pasadas sin necesidad de ingerir cantidades masivas de tokens rápidos.
El marco también agrega solo 4,87 millones de parámetros entrenables, lo que representa solo el 0,12 % de la columna vertebral de Qwen3-4B-Instruct. En comparación, la línea base de memoria MLP requirió 3 mil millones de parámetros, escalando hasta el 76,40 % del tamaño de la red troncal y, al mismo tiempo, arrojó resultados inferiores. Cuando la longitud de las solicitudes aumentó hasta 32 000 tokens durante las pruebas de inferencia, el marco mantuvo casi exactamente la misma huella de memoria de GPU que un modelo estándar sin modificaciones. Evita la gran sobrecarga de memoria que afecta a otros sistemas de memoria avanzados como MemGen y MLP Memory.
Diferentes estrategias de actualización resultaron beneficiosas según la capacidad del modelo subyacente. La estrategia de escritura de estado de secuencia fue la más efectiva para redes troncales más fuertes como Qwen3-8B. Estos modelos más capaces utilizan la escritura a nivel de segmento para suavizar las actualizaciones y mitigar el ruido a nivel de token. Por el contrario, la estrategia de escritura en varios estados impulsó enormes avances en el rendimiento de redes troncales más pequeñas como SmolLM3-3B. Para estos modelos de menor capacidad, separar la memoria en múltiples estados resultó fundamental para minimizar la interferencia de la información.
Implementación de delta-mem en la pila empresarial
Los investigadores han publicado el código para delta-mem en GitHub y el pesos para sus adaptadores entrenados en Abrazar la cara. Para los equipos de ingeniería de IA que buscan integrar este marco en su pila de inferencia existente, el proceso requiere recursos informáticos mínimos.
«En la práctica, un equipo de ingeniería comenzaría a partir de una red troncal existente sintonizada con instrucciones, conectaría los módulos adaptadores Delta-Mem a capas de atención seleccionadas, entrenaría solo los parámetros del adaptador en datos de contexto largo o de múltiples giros relevantes para el dominio… y luego ejecutaría la inferencia con el estado de la memoria actualizado en línea durante la interacción», dijo Lei. Fundamentalmente, los equipos no necesitan un corpus de preentrenamiento masivo. Los datos de entrenamiento solo necesitan reflejar el comportamiento de la memoria objetivo, como diálogos de varios turnos, seguimientos de agentes o flujos de trabajo de dominio donde la información anterior debe influir en las decisiones posteriores.
Si bien comprimir el historial de interacciones en una matriz matemática de tamaño fijo crea una inmensa eficiencia, conlleva compensaciones. Delta-mem no reemplaza sin pérdidas los registros de texto explícitos o la recuperación de documentos. Debido a que diferentes piezas de información compiten dentro del mismo estado limitado, existe el riesgo de que se mezclen los recuerdos.
«Delta-Mem es útil cuando el sistema necesita un estado de comportamiento rápido, en línea y continuamente actualizado», dijo Lei. «RAG es mejor cuando el sistema necesita un recuerdo exacto de los hechos, citas, cumplimiento, auditabilidad o acceso a una gran base de conocimiento externo». Recordar el estilo de trabajo de un usuario o una trayectoria de razonamiento de varios pasos es perfecto para delta-mem, mientras que recuperar un contrato legal o una directriz médica debe permanecer en una base de datos vectorial.
Esto significa que la arquitectura empresarial más realista en el futuro es un enfoque híbrido. Delta-mem actúa como una memoria de trabajo interna liviana, lo que reduce la necesidad de recuperar o reproducir todo todo el tiempo, mientras que RAG sirve como capa de memoria explícita de alta capacidad.
«De cara al futuro, no creo que las bases de datos vectoriales se vuelvan obsoletas», afirmó Lei. «En cambio, espero que las pilas de IA empresarial tengan más capas. Probablemente veremos memoria de trabajo a corto plazo dentro del modelo, memoria explícita a largo plazo en los sistemas de recuperación y capas de políticas o auditorías que deciden qué se debe almacenar, recuperar, olvidar o exponer al usuario».













































































