Uno de los principales desafíos de los sistemas de IA multiagente actuales es que se comunican generando y compartiendo secuencias de texto, lo que introduce latencia, aumenta los costos de los tokens y dificulta el entrenamiento de todo el sistema como una unidad coherente.
Para superar este desafío, investigadores de la Universidad de Illinois en Urbana-Champaign y la Universidad de Stanford desarrollaron RecursivoPLUSun marco que permite a los agentes colaborar y transmitir información a través de la integración del espacio en lugar del texto. Este cambio da como resultado ganancias tanto de eficiencia como de rendimiento.
Los experimentos muestran que RecursiveMAS ayuda a mejorar la precisión en áreas complejas como la generación de códigos, el razonamiento médico y la investigación, al tiempo que aumenta la velocidad de inferencia y reduce significativamente el uso de tokens.
RecursiveMAS es significativamente más barato de entrenar que los métodos estándar de ajuste completo o LoRA, lo que lo convierte en un modelo escalable y rentable para sistemas personalizados de múltiples agentes.
Los desafíos de mejorar los sistemas multiagente
Sistemas multiagente puede ayudar a resolver tareas complejas que los sistemas de agente único tienen dificultades para manejar. Al escalar sistemas multiagente para aplicaciones del mundo real, un gran desafío es permitir que el sistema evolucione, mejore y se adapte a diferentes escenarios a lo largo del tiempo.
La adaptación basada en indicaciones mejora las interacciones de los agentes al refinar iterativamente el contexto compartido proporcionado a los agentes. Al actualizar las indicaciones, el sistema actúa como director, guiando a los agentes para generar respuestas más alineadas con el objetivo general. La limitación fundamental es que las capacidades de los modelos subyacentes a cada agente permanecen estáticas.
Un enfoque más sofisticado consiste en capacitar a los agentes actualizando las ponderaciones de los modelos subyacentes. Entrenar un sistema completo de agentes es difícil porque actualizar todos los parámetros en múltiples modelos no es computacionalmente trivial.
Incluso si un equipo de ingenieros se compromete a entrenar sus modelos, la forma estándar en que los agentes se comunican mediante interacciones basadas en texto crea importantes cuellos de botella. Dado que los agentes dependen de la generación secuencial de texto, esto genera latencia porque cada modelo debe esperar a que el anterior termine de generar su texto antes de poder comenzar su propio procesamiento.
Obligar a los modelos a deletrear su razonamiento intermedio token por token sólo para que el siguiente modelo pueda leerlo es muy ineficiente. Esto aumenta drásticamente el uso de tokens, aumenta los costos computacionales y hace que el aprendizaje iterativo en todo el sistema sea extremadamente lento de escalar.
Cómo funciona RecursiveMAS
En lugar de intentar mejorar cada agente como un componente aislado e independiente, RecursiveMAS está diseñado para coevolucionar y evolucionar todo el sistema multiagente como un todo integrado.
El marco está inspirado en modelos de lenguaje recursivo (RLM). En un modelo de lenguaje estándar, los datos fluyen linealmente a través de una pila de capas distintas. Por el contrario, un modelo de lenguaje recursivo reutiliza un conjunto de capas compartidas que procesan datos y se los devuelven entre sí. Al completar el cálculo, el modelo puede profundizar su razonamiento sin agregar parámetros.
RecursiveMAS extiende este principio de escalamiento de un modelo único a una arquitectura de múltiples agentes que actúa como un sistema recursivo unificado. En esta configuración, cada agente funciona como una capa en un modelo de lenguaje recursivo. En lugar de generar texto, los agentes pasan iterativamente sus representaciones latentes continuas al siguiente agente en la secuencia, creando un flujo de información oculto y en bucle que circula a través del sistema.
Esta transferencia latente continúa a través de todos los agentes. Cuando el agente final completa su procesamiento, sus resultados latentes se envían directamente al primer agente, lo que desencadena un nuevo ciclo de recursividad.
Esta estructura permite que todo el sistema de múltiples agentes interactúe, refleje y refine su razonamiento colectivo durante múltiples rondas completamente en un espacio latente, y solo el último agente produce resultados textuales en la ronda final. Es como si los agentes se comunicaran telepáticamente como un todo unificado y el último agente proporcionara la respuesta final en forma de texto.
La arquitectura de la colaboración latente
Para hacer posible la colaboración continua en el espacio latente, los autores introducen un componente arquitectónico especializado llamado RecursiveLink. Es un módulo liviano de dos capas diseñado para transmitir y refinar los estados latentes de un modelo en lugar de obligarlo a decodificar texto.
Los estados ocultos de la última capa de un modelo de lenguaje contienen la rica representación semántica de su proceso de razonamiento. RecursiveLink está diseñado para preservar y transmitir esta información de alta dimensión de un espacio de integración a otro.
Para evitar el costo de actualizar cada parámetro en múltiples modelos de lenguaje grandes, el marco mantiene congelados los parámetros del modelo. En cambio, optimiza el sistema entrenando únicamente los parámetros de los módulos RecursiveLink.
Para manejar tanto el razonamiento interno como la comunicación externa, el sistema utiliza dos variaciones del módulo. El RecursiveLink interno opera dentro de un agente durante su fase de razonamiento. Toma las incrustaciones recién generadas del modelo y las asigna directamente a su propio espacio de incrustación de entrada. Esto permite al agente generar continuamente un flujo de pensamientos latentes sin generar tokens de texto discretos.
El RecursiveLink externo sirve como puente entre agentes. Dado que los agentes en un sistema real pueden usar diferentes arquitecturas y tamaños de modelo, sus espacios internos de integración tienen dimensiones completamente diferentes. El RecursiveLink externo incluye una capa adicional diseñada para hacer coincidir las incrustaciones de la dimensión oculta de un agente con el espacio de incrustación del siguiente agente.
Durante la capacitación, primero, los enlaces internos se entrenan de forma independiente para calentar la capacidad de cada agente para pensar en integraciones latentes continuas. A continuación, el sistema ingresa al entrenamiento de bucle externo, donde los distintos modelos congelados se encadenan en un bucle y el sistema se evalúa en función del resultado textual final del último agente.
Lo único que se actualiza durante el proceso de entrenamiento son los parámetros de RecursiveLink y los pesos del modelo original permanecen sin cambios, en cuanto a adaptación de bajo rango (LoRA). Otro beneficio de este sistema entra en vigor cuando tiene varios agentes sobre el mismo modelo base.
Si tiene un sistema de múltiples agentes en el que dos agentes se crean exactamente en el mismo modelo base y actúan en diferentes roles, no necesita cargar dos copias del modelo en la memoria de su GPU, ni necesita entrenarlas por separado. Los agentes compartirán la misma columna vertebral que el cerebro y utilizarán RecursiveLink como tejido conectivo.
MAS recursivo en acción
Los investigadores evaluaron RecursiveMAS según nueve criterios que abarcan matemáticas, ciencias y medicina, generación de códigos y respuesta a preguntas basadas en investigaciones. Crearon un sistema multiagente utilizando modelos de peso abierto, incluidos Qwen, Llama-3, Gemma3 y Mistral. A estos modelos se les asignaron funciones para entrenar diferentes modelos de colaboración de agentes, como el razonamiento secuencial y la colaboración mixta de expertos.
RecursiveMAS se comparó con puntos de referencia con presupuestos de capacitación idénticos, incluidos modelos independientes mejorados con LoRA o ajustes finos totalmente supervisados, marcos alternativos de múltiples agentes como Mixture-of-Agents y TextGrad, y puntos de referencia recursivos como LoopLM. También se ha comparado con Recursive-TextMAS, que utiliza la misma estructura de bucle recursivo que RecursiveMAS pero requiere que los agentes se comuniquen explícitamente a través de texto.
RecursiveMAS logró una mejora de precisión promedio del 8,3 % con respecto a las líneas de base más sólidas de todos los puntos de referencia. Se destacó particularmente en tareas que requieren mucho razonamiento, superando a los métodos de optimización basados en texto como TextGrad en un 18,1 % en AIME2025 y un 13 % en AIME2026.
Debido a que evita generar texto en cada paso, RecursiveMAS logró una aceleración de la inferencia de un extremo a otro de 1,2 a 2,4 veces. RecursiveMAS también es mucho más eficiente simbólicamente que la alternativa. En comparación con Recursive-TextMAS basado en texto, reduce el uso de tokens en un 34,6% en la primera ronda de recursividad y en la tercera ronda logra una reducción de tokens del 75,6%. RecursiveMAS también ha demostrado ser notablemente barato de entrenar. Debido a que actualiza solo módulos RecursiveLink livianos, que incluyen alrededor de 13 millones de parámetros, o alrededor del 0,31% de los parámetros entrenables de los modelos congelados, requiere la menor memoria de GPU y reduce los costos de entrenamiento a más de la mitad en comparación con un ajuste completo.
Adopción empresarial
Las eficiencias (consumo de tokens reducido, requisitos de memoria GPU reducidos e inferencia más rápida) tienen como objetivo hacer viables los flujos de trabajo de agentes complejos y de varios pasos en entornos de producción sin la sobrecarga informática que limita las implementaciones de agentes empresariales. Los investigadores publicaron el código y entrenaron los pesos del modelo bajo la licencia Apache 2.0.
Uno de los principales desafíos de los sistemas de IA multiagente actuales es que se comunican generando y compartiendo secuencias de texto, lo que introduce latencia, aumenta los costos de los tokens y dificulta el entrenamiento de todo el sistema como una unidad coherente.
Para superar este desafío, investigadores de la Universidad de Illinois en Urbana-Champaign y la Universidad de Stanford desarrollaron RecursivoPLUSun marco que permite a los agentes colaborar y transmitir información a través de la integración del espacio en lugar del texto. Este cambio da como resultado ganancias tanto de eficiencia como de rendimiento.
Los experimentos muestran que RecursiveMAS ayuda a mejorar la precisión en áreas complejas como la generación de códigos, el razonamiento médico y la investigación, al tiempo que aumenta la velocidad de inferencia y reduce significativamente el uso de tokens.
RecursiveMAS es significativamente más barato de entrenar que los métodos estándar de ajuste completo o LoRA, lo que lo convierte en un modelo escalable y rentable para sistemas personalizados de múltiples agentes.
Los desafíos de mejorar los sistemas multiagente
Sistemas multiagente puede ayudar a resolver tareas complejas que los sistemas de agente único tienen dificultades para manejar. Al escalar sistemas multiagente para aplicaciones del mundo real, un gran desafío es permitir que el sistema evolucione, mejore y se adapte a diferentes escenarios a lo largo del tiempo.
La adaptación basada en indicaciones mejora las interacciones de los agentes al refinar iterativamente el contexto compartido proporcionado a los agentes. Al actualizar las indicaciones, el sistema actúa como director, guiando a los agentes para generar respuestas más alineadas con el objetivo general. La limitación fundamental es que las capacidades de los modelos subyacentes a cada agente permanecen estáticas.
Un enfoque más sofisticado consiste en capacitar a los agentes actualizando las ponderaciones de los modelos subyacentes. Entrenar un sistema completo de agentes es difícil porque actualizar todos los parámetros en múltiples modelos no es computacionalmente trivial.
Incluso si un equipo de ingenieros se compromete a entrenar sus modelos, la forma estándar en que los agentes se comunican mediante interacciones basadas en texto crea importantes cuellos de botella. Dado que los agentes dependen de la generación secuencial de texto, esto genera latencia porque cada modelo debe esperar a que el anterior termine de generar su texto antes de poder comenzar su propio procesamiento.
Obligar a los modelos a deletrear su razonamiento intermedio token por token sólo para que el siguiente modelo pueda leerlo es muy ineficiente. Esto aumenta drásticamente el uso de tokens, aumenta los costos computacionales y hace que el aprendizaje iterativo en todo el sistema sea extremadamente lento de escalar.
Cómo funciona RecursiveMAS
En lugar de intentar mejorar cada agente como un componente aislado e independiente, RecursiveMAS está diseñado para coevolucionar y evolucionar todo el sistema multiagente como un todo integrado.
El marco está inspirado en modelos de lenguaje recursivo (RLM). En un modelo de lenguaje estándar, los datos fluyen linealmente a través de una pila de capas distintas. Por el contrario, un modelo de lenguaje recursivo reutiliza un conjunto de capas compartidas que procesan datos y se los devuelven entre sí. Al completar el cálculo, el modelo puede profundizar su razonamiento sin agregar parámetros.
RecursiveMAS extiende este principio de escalamiento de un modelo único a una arquitectura de múltiples agentes que actúa como un sistema recursivo unificado. En esta configuración, cada agente funciona como una capa en un modelo de lenguaje recursivo. En lugar de generar texto, los agentes pasan iterativamente sus representaciones latentes continuas al siguiente agente en la secuencia, creando un flujo de información oculto y en bucle que circula a través del sistema.
Esta transferencia latente continúa a través de todos los agentes. Cuando el agente final completa su procesamiento, sus resultados latentes se envían directamente al primer agente, lo que desencadena un nuevo ciclo de recursividad.
Esta estructura permite que todo el sistema de múltiples agentes interactúe, refleje y refine su razonamiento colectivo durante múltiples rondas completamente en un espacio latente, y solo el último agente produce resultados textuales en la ronda final. Es como si los agentes se comunicaran telepáticamente como un todo unificado y el último agente proporcionara la respuesta final en forma de texto.
La arquitectura de la colaboración latente
Para hacer posible la colaboración continua en el espacio latente, los autores introducen un componente arquitectónico especializado llamado RecursiveLink. Es un módulo liviano de dos capas diseñado para transmitir y refinar los estados latentes de un modelo en lugar de obligarlo a decodificar texto.
Los estados ocultos de la última capa de un modelo de lenguaje contienen la rica representación semántica de su proceso de razonamiento. RecursiveLink está diseñado para preservar y transmitir esta información de alta dimensión de un espacio de integración a otro.
Para evitar el costo de actualizar cada parámetro en múltiples modelos de lenguaje grandes, el marco mantiene congelados los parámetros del modelo. En cambio, optimiza el sistema entrenando únicamente los parámetros de los módulos RecursiveLink.
Para manejar tanto el razonamiento interno como la comunicación externa, el sistema utiliza dos variaciones del módulo. El RecursiveLink interno opera dentro de un agente durante su fase de razonamiento. Toma las incrustaciones recién generadas del modelo y las asigna directamente a su propio espacio de incrustación de entrada. Esto permite al agente generar continuamente un flujo de pensamientos latentes sin generar tokens de texto discretos.
El RecursiveLink externo sirve como puente entre agentes. Dado que los agentes en un sistema real pueden usar diferentes arquitecturas y tamaños de modelo, sus espacios internos de integración tienen dimensiones completamente diferentes. El RecursiveLink externo incluye una capa adicional diseñada para hacer coincidir las incrustaciones de la dimensión oculta de un agente con el espacio de incrustación del siguiente agente.
Durante la capacitación, primero, los enlaces internos se entrenan de forma independiente para calentar la capacidad de cada agente para pensar en integraciones latentes continuas. A continuación, el sistema ingresa al entrenamiento de bucle externo, donde los distintos modelos congelados se encadenan en un bucle y el sistema se evalúa en función del resultado textual final del último agente.
Lo único que se actualiza durante el proceso de entrenamiento son los parámetros de RecursiveLink y los pesos del modelo original permanecen sin cambios, en cuanto a adaptación de bajo rango (LoRA). Otro beneficio de este sistema entra en vigor cuando tiene varios agentes sobre el mismo modelo base.
Si tiene un sistema de múltiples agentes en el que dos agentes se crean exactamente en el mismo modelo base y actúan en diferentes roles, no necesita cargar dos copias del modelo en la memoria de su GPU, ni necesita entrenarlas por separado. Los agentes compartirán la misma columna vertebral que el cerebro y utilizarán RecursiveLink como tejido conectivo.
MAS recursivo en acción
Los investigadores evaluaron RecursiveMAS según nueve criterios que abarcan matemáticas, ciencias y medicina, generación de códigos y respuesta a preguntas basadas en investigaciones. Crearon un sistema multiagente utilizando modelos de peso abierto, incluidos Qwen, Llama-3, Gemma3 y Mistral. A estos modelos se les asignaron funciones para entrenar diferentes modelos de colaboración de agentes, como el razonamiento secuencial y la colaboración mixta de expertos.
RecursiveMAS se comparó con puntos de referencia con presupuestos de capacitación idénticos, incluidos modelos independientes mejorados con LoRA o ajustes finos totalmente supervisados, marcos alternativos de múltiples agentes como Mixture-of-Agents y TextGrad, y puntos de referencia recursivos como LoopLM. También se ha comparado con Recursive-TextMAS, que utiliza la misma estructura de bucle recursivo que RecursiveMAS pero requiere que los agentes se comuniquen explícitamente a través de texto.
RecursiveMAS logró una mejora de precisión promedio del 8,3 % con respecto a las líneas de base más sólidas de todos los puntos de referencia. Se destacó particularmente en tareas que requieren mucho razonamiento, superando a los métodos de optimización basados en texto como TextGrad en un 18,1 % en AIME2025 y un 13 % en AIME2026.
Debido a que evita generar texto en cada paso, RecursiveMAS logró una aceleración de la inferencia de un extremo a otro de 1,2 a 2,4 veces. RecursiveMAS también es mucho más eficiente simbólicamente que la alternativa. En comparación con Recursive-TextMAS basado en texto, reduce el uso de tokens en un 34,6% en la primera ronda de recursividad y en la tercera ronda logra una reducción de tokens del 75,6%. RecursiveMAS también ha demostrado ser notablemente barato de entrenar. Debido a que actualiza solo módulos RecursiveLink livianos, que incluyen alrededor de 13 millones de parámetros, o alrededor del 0,31% de los parámetros entrenables de los modelos congelados, requiere la menor memoria de GPU y reduce los costos de entrenamiento a más de la mitad en comparación con un ajuste completo.
Adopción empresarial
Las eficiencias (consumo de tokens reducido, requisitos de memoria GPU reducidos e inferencia más rápida) tienen como objetivo hacer viables los flujos de trabajo de agentes complejos y de varios pasos en entornos de producción sin la sobrecarga informática que limita las implementaciones de agentes empresariales. Los investigadores publicaron el código y entrenaron los pesos del modelo bajo la licencia Apache 2.0.
Uno de los principales desafíos de los sistemas de IA multiagente actuales es que se comunican generando y compartiendo secuencias de texto, lo que introduce latencia, aumenta los costos de los tokens y dificulta el entrenamiento de todo el sistema como una unidad coherente.
Para superar este desafío, investigadores de la Universidad de Illinois en Urbana-Champaign y la Universidad de Stanford desarrollaron RecursivoPLUSun marco que permite a los agentes colaborar y transmitir información a través de la integración del espacio en lugar del texto. Este cambio da como resultado ganancias tanto de eficiencia como de rendimiento.
Los experimentos muestran que RecursiveMAS ayuda a mejorar la precisión en áreas complejas como la generación de códigos, el razonamiento médico y la investigación, al tiempo que aumenta la velocidad de inferencia y reduce significativamente el uso de tokens.
RecursiveMAS es significativamente más barato de entrenar que los métodos estándar de ajuste completo o LoRA, lo que lo convierte en un modelo escalable y rentable para sistemas personalizados de múltiples agentes.
Los desafíos de mejorar los sistemas multiagente
Sistemas multiagente puede ayudar a resolver tareas complejas que los sistemas de agente único tienen dificultades para manejar. Al escalar sistemas multiagente para aplicaciones del mundo real, un gran desafío es permitir que el sistema evolucione, mejore y se adapte a diferentes escenarios a lo largo del tiempo.
La adaptación basada en indicaciones mejora las interacciones de los agentes al refinar iterativamente el contexto compartido proporcionado a los agentes. Al actualizar las indicaciones, el sistema actúa como director, guiando a los agentes para generar respuestas más alineadas con el objetivo general. La limitación fundamental es que las capacidades de los modelos subyacentes a cada agente permanecen estáticas.
Un enfoque más sofisticado consiste en capacitar a los agentes actualizando las ponderaciones de los modelos subyacentes. Entrenar un sistema completo de agentes es difícil porque actualizar todos los parámetros en múltiples modelos no es computacionalmente trivial.
Incluso si un equipo de ingenieros se compromete a entrenar sus modelos, la forma estándar en que los agentes se comunican mediante interacciones basadas en texto crea importantes cuellos de botella. Dado que los agentes dependen de la generación secuencial de texto, esto genera latencia porque cada modelo debe esperar a que el anterior termine de generar su texto antes de poder comenzar su propio procesamiento.
Obligar a los modelos a deletrear su razonamiento intermedio token por token sólo para que el siguiente modelo pueda leerlo es muy ineficiente. Esto aumenta drásticamente el uso de tokens, aumenta los costos computacionales y hace que el aprendizaje iterativo en todo el sistema sea extremadamente lento de escalar.
Cómo funciona RecursiveMAS
En lugar de intentar mejorar cada agente como un componente aislado e independiente, RecursiveMAS está diseñado para coevolucionar y evolucionar todo el sistema multiagente como un todo integrado.
El marco está inspirado en modelos de lenguaje recursivo (RLM). En un modelo de lenguaje estándar, los datos fluyen linealmente a través de una pila de capas distintas. Por el contrario, un modelo de lenguaje recursivo reutiliza un conjunto de capas compartidas que procesan datos y se los devuelven entre sí. Al completar el cálculo, el modelo puede profundizar su razonamiento sin agregar parámetros.
RecursiveMAS extiende este principio de escalamiento de un modelo único a una arquitectura de múltiples agentes que actúa como un sistema recursivo unificado. En esta configuración, cada agente funciona como una capa en un modelo de lenguaje recursivo. En lugar de generar texto, los agentes pasan iterativamente sus representaciones latentes continuas al siguiente agente en la secuencia, creando un flujo de información oculto y en bucle que circula a través del sistema.
Esta transferencia latente continúa a través de todos los agentes. Cuando el agente final completa su procesamiento, sus resultados latentes se envían directamente al primer agente, lo que desencadena un nuevo ciclo de recursividad.
Esta estructura permite que todo el sistema de múltiples agentes interactúe, refleje y refine su razonamiento colectivo durante múltiples rondas completamente en un espacio latente, y solo el último agente produce resultados textuales en la ronda final. Es como si los agentes se comunicaran telepáticamente como un todo unificado y el último agente proporcionara la respuesta final en forma de texto.
La arquitectura de la colaboración latente
Para hacer posible la colaboración continua en el espacio latente, los autores introducen un componente arquitectónico especializado llamado RecursiveLink. Es un módulo liviano de dos capas diseñado para transmitir y refinar los estados latentes de un modelo en lugar de obligarlo a decodificar texto.
Los estados ocultos de la última capa de un modelo de lenguaje contienen la rica representación semántica de su proceso de razonamiento. RecursiveLink está diseñado para preservar y transmitir esta información de alta dimensión de un espacio de integración a otro.
Para evitar el costo de actualizar cada parámetro en múltiples modelos de lenguaje grandes, el marco mantiene congelados los parámetros del modelo. En cambio, optimiza el sistema entrenando únicamente los parámetros de los módulos RecursiveLink.
Para manejar tanto el razonamiento interno como la comunicación externa, el sistema utiliza dos variaciones del módulo. El RecursiveLink interno opera dentro de un agente durante su fase de razonamiento. Toma las incrustaciones recién generadas del modelo y las asigna directamente a su propio espacio de incrustación de entrada. Esto permite al agente generar continuamente un flujo de pensamientos latentes sin generar tokens de texto discretos.
El RecursiveLink externo sirve como puente entre agentes. Dado que los agentes en un sistema real pueden usar diferentes arquitecturas y tamaños de modelo, sus espacios internos de integración tienen dimensiones completamente diferentes. El RecursiveLink externo incluye una capa adicional diseñada para hacer coincidir las incrustaciones de la dimensión oculta de un agente con el espacio de incrustación del siguiente agente.
Durante la capacitación, primero, los enlaces internos se entrenan de forma independiente para calentar la capacidad de cada agente para pensar en integraciones latentes continuas. A continuación, el sistema ingresa al entrenamiento de bucle externo, donde los distintos modelos congelados se encadenan en un bucle y el sistema se evalúa en función del resultado textual final del último agente.
Lo único que se actualiza durante el proceso de entrenamiento son los parámetros de RecursiveLink y los pesos del modelo original permanecen sin cambios, en cuanto a adaptación de bajo rango (LoRA). Otro beneficio de este sistema entra en vigor cuando tiene varios agentes sobre el mismo modelo base.
Si tiene un sistema de múltiples agentes en el que dos agentes se crean exactamente en el mismo modelo base y actúan en diferentes roles, no necesita cargar dos copias del modelo en la memoria de su GPU, ni necesita entrenarlas por separado. Los agentes compartirán la misma columna vertebral que el cerebro y utilizarán RecursiveLink como tejido conectivo.
MAS recursivo en acción
Los investigadores evaluaron RecursiveMAS según nueve criterios que abarcan matemáticas, ciencias y medicina, generación de códigos y respuesta a preguntas basadas en investigaciones. Crearon un sistema multiagente utilizando modelos de peso abierto, incluidos Qwen, Llama-3, Gemma3 y Mistral. A estos modelos se les asignaron funciones para entrenar diferentes modelos de colaboración de agentes, como el razonamiento secuencial y la colaboración mixta de expertos.
RecursiveMAS se comparó con puntos de referencia con presupuestos de capacitación idénticos, incluidos modelos independientes mejorados con LoRA o ajustes finos totalmente supervisados, marcos alternativos de múltiples agentes como Mixture-of-Agents y TextGrad, y puntos de referencia recursivos como LoopLM. También se ha comparado con Recursive-TextMAS, que utiliza la misma estructura de bucle recursivo que RecursiveMAS pero requiere que los agentes se comuniquen explícitamente a través de texto.
RecursiveMAS logró una mejora de precisión promedio del 8,3 % con respecto a las líneas de base más sólidas de todos los puntos de referencia. Se destacó particularmente en tareas que requieren mucho razonamiento, superando a los métodos de optimización basados en texto como TextGrad en un 18,1 % en AIME2025 y un 13 % en AIME2026.
Debido a que evita generar texto en cada paso, RecursiveMAS logró una aceleración de la inferencia de un extremo a otro de 1,2 a 2,4 veces. RecursiveMAS también es mucho más eficiente simbólicamente que la alternativa. En comparación con Recursive-TextMAS basado en texto, reduce el uso de tokens en un 34,6% en la primera ronda de recursividad y en la tercera ronda logra una reducción de tokens del 75,6%. RecursiveMAS también ha demostrado ser notablemente barato de entrenar. Debido a que actualiza solo módulos RecursiveLink livianos, que incluyen alrededor de 13 millones de parámetros, o alrededor del 0,31% de los parámetros entrenables de los modelos congelados, requiere la menor memoria de GPU y reduce los costos de entrenamiento a más de la mitad en comparación con un ajuste completo.
Adopción empresarial
Las eficiencias (consumo de tokens reducido, requisitos de memoria GPU reducidos e inferencia más rápida) tienen como objetivo hacer viables los flujos de trabajo de agentes complejos y de varios pasos en entornos de producción sin la sobrecarga informática que limita las implementaciones de agentes empresariales. Los investigadores publicaron el código y entrenaron los pesos del modelo bajo la licencia Apache 2.0.
Uno de los principales desafíos de los sistemas de IA multiagente actuales es que se comunican generando y compartiendo secuencias de texto, lo que introduce latencia, aumenta los costos de los tokens y dificulta el entrenamiento de todo el sistema como una unidad coherente.
Para superar este desafío, investigadores de la Universidad de Illinois en Urbana-Champaign y la Universidad de Stanford desarrollaron RecursivoPLUSun marco que permite a los agentes colaborar y transmitir información a través de la integración del espacio en lugar del texto. Este cambio da como resultado ganancias tanto de eficiencia como de rendimiento.
Los experimentos muestran que RecursiveMAS ayuda a mejorar la precisión en áreas complejas como la generación de códigos, el razonamiento médico y la investigación, al tiempo que aumenta la velocidad de inferencia y reduce significativamente el uso de tokens.
RecursiveMAS es significativamente más barato de entrenar que los métodos estándar de ajuste completo o LoRA, lo que lo convierte en un modelo escalable y rentable para sistemas personalizados de múltiples agentes.
Los desafíos de mejorar los sistemas multiagente
Sistemas multiagente puede ayudar a resolver tareas complejas que los sistemas de agente único tienen dificultades para manejar. Al escalar sistemas multiagente para aplicaciones del mundo real, un gran desafío es permitir que el sistema evolucione, mejore y se adapte a diferentes escenarios a lo largo del tiempo.
La adaptación basada en indicaciones mejora las interacciones de los agentes al refinar iterativamente el contexto compartido proporcionado a los agentes. Al actualizar las indicaciones, el sistema actúa como director, guiando a los agentes para generar respuestas más alineadas con el objetivo general. La limitación fundamental es que las capacidades de los modelos subyacentes a cada agente permanecen estáticas.
Un enfoque más sofisticado consiste en capacitar a los agentes actualizando las ponderaciones de los modelos subyacentes. Entrenar un sistema completo de agentes es difícil porque actualizar todos los parámetros en múltiples modelos no es computacionalmente trivial.
Incluso si un equipo de ingenieros se compromete a entrenar sus modelos, la forma estándar en que los agentes se comunican mediante interacciones basadas en texto crea importantes cuellos de botella. Dado que los agentes dependen de la generación secuencial de texto, esto genera latencia porque cada modelo debe esperar a que el anterior termine de generar su texto antes de poder comenzar su propio procesamiento.
Obligar a los modelos a deletrear su razonamiento intermedio token por token sólo para que el siguiente modelo pueda leerlo es muy ineficiente. Esto aumenta drásticamente el uso de tokens, aumenta los costos computacionales y hace que el aprendizaje iterativo en todo el sistema sea extremadamente lento de escalar.
Cómo funciona RecursiveMAS
En lugar de intentar mejorar cada agente como un componente aislado e independiente, RecursiveMAS está diseñado para coevolucionar y evolucionar todo el sistema multiagente como un todo integrado.
El marco está inspirado en modelos de lenguaje recursivo (RLM). En un modelo de lenguaje estándar, los datos fluyen linealmente a través de una pila de capas distintas. Por el contrario, un modelo de lenguaje recursivo reutiliza un conjunto de capas compartidas que procesan datos y se los devuelven entre sí. Al completar el cálculo, el modelo puede profundizar su razonamiento sin agregar parámetros.
RecursiveMAS extiende este principio de escalamiento de un modelo único a una arquitectura de múltiples agentes que actúa como un sistema recursivo unificado. En esta configuración, cada agente funciona como una capa en un modelo de lenguaje recursivo. En lugar de generar texto, los agentes pasan iterativamente sus representaciones latentes continuas al siguiente agente en la secuencia, creando un flujo de información oculto y en bucle que circula a través del sistema.
Esta transferencia latente continúa a través de todos los agentes. Cuando el agente final completa su procesamiento, sus resultados latentes se envían directamente al primer agente, lo que desencadena un nuevo ciclo de recursividad.
Esta estructura permite que todo el sistema de múltiples agentes interactúe, refleje y refine su razonamiento colectivo durante múltiples rondas completamente en un espacio latente, y solo el último agente produce resultados textuales en la ronda final. Es como si los agentes se comunicaran telepáticamente como un todo unificado y el último agente proporcionara la respuesta final en forma de texto.
La arquitectura de la colaboración latente
Para hacer posible la colaboración continua en el espacio latente, los autores introducen un componente arquitectónico especializado llamado RecursiveLink. Es un módulo liviano de dos capas diseñado para transmitir y refinar los estados latentes de un modelo en lugar de obligarlo a decodificar texto.
Los estados ocultos de la última capa de un modelo de lenguaje contienen la rica representación semántica de su proceso de razonamiento. RecursiveLink está diseñado para preservar y transmitir esta información de alta dimensión de un espacio de integración a otro.
Para evitar el costo de actualizar cada parámetro en múltiples modelos de lenguaje grandes, el marco mantiene congelados los parámetros del modelo. En cambio, optimiza el sistema entrenando únicamente los parámetros de los módulos RecursiveLink.
Para manejar tanto el razonamiento interno como la comunicación externa, el sistema utiliza dos variaciones del módulo. El RecursiveLink interno opera dentro de un agente durante su fase de razonamiento. Toma las incrustaciones recién generadas del modelo y las asigna directamente a su propio espacio de incrustación de entrada. Esto permite al agente generar continuamente un flujo de pensamientos latentes sin generar tokens de texto discretos.
El RecursiveLink externo sirve como puente entre agentes. Dado que los agentes en un sistema real pueden usar diferentes arquitecturas y tamaños de modelo, sus espacios internos de integración tienen dimensiones completamente diferentes. El RecursiveLink externo incluye una capa adicional diseñada para hacer coincidir las incrustaciones de la dimensión oculta de un agente con el espacio de incrustación del siguiente agente.
Durante la capacitación, primero, los enlaces internos se entrenan de forma independiente para calentar la capacidad de cada agente para pensar en integraciones latentes continuas. A continuación, el sistema ingresa al entrenamiento de bucle externo, donde los distintos modelos congelados se encadenan en un bucle y el sistema se evalúa en función del resultado textual final del último agente.
Lo único que se actualiza durante el proceso de entrenamiento son los parámetros de RecursiveLink y los pesos del modelo original permanecen sin cambios, en cuanto a adaptación de bajo rango (LoRA). Otro beneficio de este sistema entra en vigor cuando tiene varios agentes sobre el mismo modelo base.
Si tiene un sistema de múltiples agentes en el que dos agentes se crean exactamente en el mismo modelo base y actúan en diferentes roles, no necesita cargar dos copias del modelo en la memoria de su GPU, ni necesita entrenarlas por separado. Los agentes compartirán la misma columna vertebral que el cerebro y utilizarán RecursiveLink como tejido conectivo.
MAS recursivo en acción
Los investigadores evaluaron RecursiveMAS según nueve criterios que abarcan matemáticas, ciencias y medicina, generación de códigos y respuesta a preguntas basadas en investigaciones. Crearon un sistema multiagente utilizando modelos de peso abierto, incluidos Qwen, Llama-3, Gemma3 y Mistral. A estos modelos se les asignaron funciones para entrenar diferentes modelos de colaboración de agentes, como el razonamiento secuencial y la colaboración mixta de expertos.
RecursiveMAS se comparó con puntos de referencia con presupuestos de capacitación idénticos, incluidos modelos independientes mejorados con LoRA o ajustes finos totalmente supervisados, marcos alternativos de múltiples agentes como Mixture-of-Agents y TextGrad, y puntos de referencia recursivos como LoopLM. También se ha comparado con Recursive-TextMAS, que utiliza la misma estructura de bucle recursivo que RecursiveMAS pero requiere que los agentes se comuniquen explícitamente a través de texto.
RecursiveMAS logró una mejora de precisión promedio del 8,3 % con respecto a las líneas de base más sólidas de todos los puntos de referencia. Se destacó particularmente en tareas que requieren mucho razonamiento, superando a los métodos de optimización basados en texto como TextGrad en un 18,1 % en AIME2025 y un 13 % en AIME2026.
Debido a que evita generar texto en cada paso, RecursiveMAS logró una aceleración de la inferencia de un extremo a otro de 1,2 a 2,4 veces. RecursiveMAS también es mucho más eficiente simbólicamente que la alternativa. En comparación con Recursive-TextMAS basado en texto, reduce el uso de tokens en un 34,6% en la primera ronda de recursividad y en la tercera ronda logra una reducción de tokens del 75,6%. RecursiveMAS también ha demostrado ser notablemente barato de entrenar. Debido a que actualiza solo módulos RecursiveLink livianos, que incluyen alrededor de 13 millones de parámetros, o alrededor del 0,31% de los parámetros entrenables de los modelos congelados, requiere la menor memoria de GPU y reduce los costos de entrenamiento a más de la mitad en comparación con un ajuste completo.
Adopción empresarial
Las eficiencias (consumo de tokens reducido, requisitos de memoria GPU reducidos e inferencia más rápida) tienen como objetivo hacer viables los flujos de trabajo de agentes complejos y de varios pasos en entornos de producción sin la sobrecarga informática que limita las implementaciones de agentes empresariales. Los investigadores publicaron el código y entrenaron los pesos del modelo bajo la licencia Apache 2.0.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Uno de los principales desafíos de los sistemas de IA multiagente actuales es que se comunican generando y compartiendo secuencias de texto, lo que introduce latencia, aumenta los costos de los tokens y dificulta el entrenamiento de todo el sistema como una unidad coherente.
Para superar este desafío, investigadores de la Universidad de Illinois en Urbana-Champaign y la Universidad de Stanford desarrollaron RecursivoPLUSun marco que permite a los agentes colaborar y transmitir información a través de la integración del espacio en lugar del texto. Este cambio da como resultado ganancias tanto de eficiencia como de rendimiento.
Los experimentos muestran que RecursiveMAS ayuda a mejorar la precisión en áreas complejas como la generación de códigos, el razonamiento médico y la investigación, al tiempo que aumenta la velocidad de inferencia y reduce significativamente el uso de tokens.
RecursiveMAS es significativamente más barato de entrenar que los métodos estándar de ajuste completo o LoRA, lo que lo convierte en un modelo escalable y rentable para sistemas personalizados de múltiples agentes.
Los desafíos de mejorar los sistemas multiagente
Sistemas multiagente puede ayudar a resolver tareas complejas que los sistemas de agente único tienen dificultades para manejar. Al escalar sistemas multiagente para aplicaciones del mundo real, un gran desafío es permitir que el sistema evolucione, mejore y se adapte a diferentes escenarios a lo largo del tiempo.
La adaptación basada en indicaciones mejora las interacciones de los agentes al refinar iterativamente el contexto compartido proporcionado a los agentes. Al actualizar las indicaciones, el sistema actúa como director, guiando a los agentes para generar respuestas más alineadas con el objetivo general. La limitación fundamental es que las capacidades de los modelos subyacentes a cada agente permanecen estáticas.
Un enfoque más sofisticado consiste en capacitar a los agentes actualizando las ponderaciones de los modelos subyacentes. Entrenar un sistema completo de agentes es difícil porque actualizar todos los parámetros en múltiples modelos no es computacionalmente trivial.
Incluso si un equipo de ingenieros se compromete a entrenar sus modelos, la forma estándar en que los agentes se comunican mediante interacciones basadas en texto crea importantes cuellos de botella. Dado que los agentes dependen de la generación secuencial de texto, esto genera latencia porque cada modelo debe esperar a que el anterior termine de generar su texto antes de poder comenzar su propio procesamiento.
Obligar a los modelos a deletrear su razonamiento intermedio token por token sólo para que el siguiente modelo pueda leerlo es muy ineficiente. Esto aumenta drásticamente el uso de tokens, aumenta los costos computacionales y hace que el aprendizaje iterativo en todo el sistema sea extremadamente lento de escalar.
Cómo funciona RecursiveMAS
En lugar de intentar mejorar cada agente como un componente aislado e independiente, RecursiveMAS está diseñado para coevolucionar y evolucionar todo el sistema multiagente como un todo integrado.
El marco está inspirado en modelos de lenguaje recursivo (RLM). En un modelo de lenguaje estándar, los datos fluyen linealmente a través de una pila de capas distintas. Por el contrario, un modelo de lenguaje recursivo reutiliza un conjunto de capas compartidas que procesan datos y se los devuelven entre sí. Al completar el cálculo, el modelo puede profundizar su razonamiento sin agregar parámetros.
RecursiveMAS extiende este principio de escalamiento de un modelo único a una arquitectura de múltiples agentes que actúa como un sistema recursivo unificado. En esta configuración, cada agente funciona como una capa en un modelo de lenguaje recursivo. En lugar de generar texto, los agentes pasan iterativamente sus representaciones latentes continuas al siguiente agente en la secuencia, creando un flujo de información oculto y en bucle que circula a través del sistema.
Esta transferencia latente continúa a través de todos los agentes. Cuando el agente final completa su procesamiento, sus resultados latentes se envían directamente al primer agente, lo que desencadena un nuevo ciclo de recursividad.
Esta estructura permite que todo el sistema de múltiples agentes interactúe, refleje y refine su razonamiento colectivo durante múltiples rondas completamente en un espacio latente, y solo el último agente produce resultados textuales en la ronda final. Es como si los agentes se comunicaran telepáticamente como un todo unificado y el último agente proporcionara la respuesta final en forma de texto.
La arquitectura de la colaboración latente
Para hacer posible la colaboración continua en el espacio latente, los autores introducen un componente arquitectónico especializado llamado RecursiveLink. Es un módulo liviano de dos capas diseñado para transmitir y refinar los estados latentes de un modelo en lugar de obligarlo a decodificar texto.
Los estados ocultos de la última capa de un modelo de lenguaje contienen la rica representación semántica de su proceso de razonamiento. RecursiveLink está diseñado para preservar y transmitir esta información de alta dimensión de un espacio de integración a otro.
Para evitar el costo de actualizar cada parámetro en múltiples modelos de lenguaje grandes, el marco mantiene congelados los parámetros del modelo. En cambio, optimiza el sistema entrenando únicamente los parámetros de los módulos RecursiveLink.
Para manejar tanto el razonamiento interno como la comunicación externa, el sistema utiliza dos variaciones del módulo. El RecursiveLink interno opera dentro de un agente durante su fase de razonamiento. Toma las incrustaciones recién generadas del modelo y las asigna directamente a su propio espacio de incrustación de entrada. Esto permite al agente generar continuamente un flujo de pensamientos latentes sin generar tokens de texto discretos.
El RecursiveLink externo sirve como puente entre agentes. Dado que los agentes en un sistema real pueden usar diferentes arquitecturas y tamaños de modelo, sus espacios internos de integración tienen dimensiones completamente diferentes. El RecursiveLink externo incluye una capa adicional diseñada para hacer coincidir las incrustaciones de la dimensión oculta de un agente con el espacio de incrustación del siguiente agente.
Durante la capacitación, primero, los enlaces internos se entrenan de forma independiente para calentar la capacidad de cada agente para pensar en integraciones latentes continuas. A continuación, el sistema ingresa al entrenamiento de bucle externo, donde los distintos modelos congelados se encadenan en un bucle y el sistema se evalúa en función del resultado textual final del último agente.
Lo único que se actualiza durante el proceso de entrenamiento son los parámetros de RecursiveLink y los pesos del modelo original permanecen sin cambios, en cuanto a adaptación de bajo rango (LoRA). Otro beneficio de este sistema entra en vigor cuando tiene varios agentes sobre el mismo modelo base.
Si tiene un sistema de múltiples agentes en el que dos agentes se crean exactamente en el mismo modelo base y actúan en diferentes roles, no necesita cargar dos copias del modelo en la memoria de su GPU, ni necesita entrenarlas por separado. Los agentes compartirán la misma columna vertebral que el cerebro y utilizarán RecursiveLink como tejido conectivo.
MAS recursivo en acción
Los investigadores evaluaron RecursiveMAS según nueve criterios que abarcan matemáticas, ciencias y medicina, generación de códigos y respuesta a preguntas basadas en investigaciones. Crearon un sistema multiagente utilizando modelos de peso abierto, incluidos Qwen, Llama-3, Gemma3 y Mistral. A estos modelos se les asignaron funciones para entrenar diferentes modelos de colaboración de agentes, como el razonamiento secuencial y la colaboración mixta de expertos.
RecursiveMAS se comparó con puntos de referencia con presupuestos de capacitación idénticos, incluidos modelos independientes mejorados con LoRA o ajustes finos totalmente supervisados, marcos alternativos de múltiples agentes como Mixture-of-Agents y TextGrad, y puntos de referencia recursivos como LoopLM. También se ha comparado con Recursive-TextMAS, que utiliza la misma estructura de bucle recursivo que RecursiveMAS pero requiere que los agentes se comuniquen explícitamente a través de texto.
RecursiveMAS logró una mejora de precisión promedio del 8,3 % con respecto a las líneas de base más sólidas de todos los puntos de referencia. Se destacó particularmente en tareas que requieren mucho razonamiento, superando a los métodos de optimización basados en texto como TextGrad en un 18,1 % en AIME2025 y un 13 % en AIME2026.
Debido a que evita generar texto en cada paso, RecursiveMAS logró una aceleración de la inferencia de un extremo a otro de 1,2 a 2,4 veces. RecursiveMAS también es mucho más eficiente simbólicamente que la alternativa. En comparación con Recursive-TextMAS basado en texto, reduce el uso de tokens en un 34,6% en la primera ronda de recursividad y en la tercera ronda logra una reducción de tokens del 75,6%. RecursiveMAS también ha demostrado ser notablemente barato de entrenar. Debido a que actualiza solo módulos RecursiveLink livianos, que incluyen alrededor de 13 millones de parámetros, o alrededor del 0,31% de los parámetros entrenables de los modelos congelados, requiere la menor memoria de GPU y reduce los costos de entrenamiento a más de la mitad en comparación con un ajuste completo.
Adopción empresarial
Las eficiencias (consumo de tokens reducido, requisitos de memoria GPU reducidos e inferencia más rápida) tienen como objetivo hacer viables los flujos de trabajo de agentes complejos y de varios pasos en entornos de producción sin la sobrecarga informática que limita las implementaciones de agentes empresariales. Los investigadores publicaron el código y entrenaron los pesos del modelo bajo la licencia Apache 2.0.
Uno de los principales desafíos de los sistemas de IA multiagente actuales es que se comunican generando y compartiendo secuencias de texto, lo que introduce latencia, aumenta los costos de los tokens y dificulta el entrenamiento de todo el sistema como una unidad coherente.
Para superar este desafío, investigadores de la Universidad de Illinois en Urbana-Champaign y la Universidad de Stanford desarrollaron RecursivoPLUSun marco que permite a los agentes colaborar y transmitir información a través de la integración del espacio en lugar del texto. Este cambio da como resultado ganancias tanto de eficiencia como de rendimiento.
Los experimentos muestran que RecursiveMAS ayuda a mejorar la precisión en áreas complejas como la generación de códigos, el razonamiento médico y la investigación, al tiempo que aumenta la velocidad de inferencia y reduce significativamente el uso de tokens.
RecursiveMAS es significativamente más barato de entrenar que los métodos estándar de ajuste completo o LoRA, lo que lo convierte en un modelo escalable y rentable para sistemas personalizados de múltiples agentes.
Los desafíos de mejorar los sistemas multiagente
Sistemas multiagente puede ayudar a resolver tareas complejas que los sistemas de agente único tienen dificultades para manejar. Al escalar sistemas multiagente para aplicaciones del mundo real, un gran desafío es permitir que el sistema evolucione, mejore y se adapte a diferentes escenarios a lo largo del tiempo.
La adaptación basada en indicaciones mejora las interacciones de los agentes al refinar iterativamente el contexto compartido proporcionado a los agentes. Al actualizar las indicaciones, el sistema actúa como director, guiando a los agentes para generar respuestas más alineadas con el objetivo general. La limitación fundamental es que las capacidades de los modelos subyacentes a cada agente permanecen estáticas.
Un enfoque más sofisticado consiste en capacitar a los agentes actualizando las ponderaciones de los modelos subyacentes. Entrenar un sistema completo de agentes es difícil porque actualizar todos los parámetros en múltiples modelos no es computacionalmente trivial.
Incluso si un equipo de ingenieros se compromete a entrenar sus modelos, la forma estándar en que los agentes se comunican mediante interacciones basadas en texto crea importantes cuellos de botella. Dado que los agentes dependen de la generación secuencial de texto, esto genera latencia porque cada modelo debe esperar a que el anterior termine de generar su texto antes de poder comenzar su propio procesamiento.
Obligar a los modelos a deletrear su razonamiento intermedio token por token sólo para que el siguiente modelo pueda leerlo es muy ineficiente. Esto aumenta drásticamente el uso de tokens, aumenta los costos computacionales y hace que el aprendizaje iterativo en todo el sistema sea extremadamente lento de escalar.
Cómo funciona RecursiveMAS
En lugar de intentar mejorar cada agente como un componente aislado e independiente, RecursiveMAS está diseñado para coevolucionar y evolucionar todo el sistema multiagente como un todo integrado.
El marco está inspirado en modelos de lenguaje recursivo (RLM). En un modelo de lenguaje estándar, los datos fluyen linealmente a través de una pila de capas distintas. Por el contrario, un modelo de lenguaje recursivo reutiliza un conjunto de capas compartidas que procesan datos y se los devuelven entre sí. Al completar el cálculo, el modelo puede profundizar su razonamiento sin agregar parámetros.
RecursiveMAS extiende este principio de escalamiento de un modelo único a una arquitectura de múltiples agentes que actúa como un sistema recursivo unificado. En esta configuración, cada agente funciona como una capa en un modelo de lenguaje recursivo. En lugar de generar texto, los agentes pasan iterativamente sus representaciones latentes continuas al siguiente agente en la secuencia, creando un flujo de información oculto y en bucle que circula a través del sistema.
Esta transferencia latente continúa a través de todos los agentes. Cuando el agente final completa su procesamiento, sus resultados latentes se envían directamente al primer agente, lo que desencadena un nuevo ciclo de recursividad.
Esta estructura permite que todo el sistema de múltiples agentes interactúe, refleje y refine su razonamiento colectivo durante múltiples rondas completamente en un espacio latente, y solo el último agente produce resultados textuales en la ronda final. Es como si los agentes se comunicaran telepáticamente como un todo unificado y el último agente proporcionara la respuesta final en forma de texto.
La arquitectura de la colaboración latente
Para hacer posible la colaboración continua en el espacio latente, los autores introducen un componente arquitectónico especializado llamado RecursiveLink. Es un módulo liviano de dos capas diseñado para transmitir y refinar los estados latentes de un modelo en lugar de obligarlo a decodificar texto.
Los estados ocultos de la última capa de un modelo de lenguaje contienen la rica representación semántica de su proceso de razonamiento. RecursiveLink está diseñado para preservar y transmitir esta información de alta dimensión de un espacio de integración a otro.
Para evitar el costo de actualizar cada parámetro en múltiples modelos de lenguaje grandes, el marco mantiene congelados los parámetros del modelo. En cambio, optimiza el sistema entrenando únicamente los parámetros de los módulos RecursiveLink.
Para manejar tanto el razonamiento interno como la comunicación externa, el sistema utiliza dos variaciones del módulo. El RecursiveLink interno opera dentro de un agente durante su fase de razonamiento. Toma las incrustaciones recién generadas del modelo y las asigna directamente a su propio espacio de incrustación de entrada. Esto permite al agente generar continuamente un flujo de pensamientos latentes sin generar tokens de texto discretos.
El RecursiveLink externo sirve como puente entre agentes. Dado que los agentes en un sistema real pueden usar diferentes arquitecturas y tamaños de modelo, sus espacios internos de integración tienen dimensiones completamente diferentes. El RecursiveLink externo incluye una capa adicional diseñada para hacer coincidir las incrustaciones de la dimensión oculta de un agente con el espacio de incrustación del siguiente agente.
Durante la capacitación, primero, los enlaces internos se entrenan de forma independiente para calentar la capacidad de cada agente para pensar en integraciones latentes continuas. A continuación, el sistema ingresa al entrenamiento de bucle externo, donde los distintos modelos congelados se encadenan en un bucle y el sistema se evalúa en función del resultado textual final del último agente.
Lo único que se actualiza durante el proceso de entrenamiento son los parámetros de RecursiveLink y los pesos del modelo original permanecen sin cambios, en cuanto a adaptación de bajo rango (LoRA). Otro beneficio de este sistema entra en vigor cuando tiene varios agentes sobre el mismo modelo base.
Si tiene un sistema de múltiples agentes en el que dos agentes se crean exactamente en el mismo modelo base y actúan en diferentes roles, no necesita cargar dos copias del modelo en la memoria de su GPU, ni necesita entrenarlas por separado. Los agentes compartirán la misma columna vertebral que el cerebro y utilizarán RecursiveLink como tejido conectivo.
MAS recursivo en acción
Los investigadores evaluaron RecursiveMAS según nueve criterios que abarcan matemáticas, ciencias y medicina, generación de códigos y respuesta a preguntas basadas en investigaciones. Crearon un sistema multiagente utilizando modelos de peso abierto, incluidos Qwen, Llama-3, Gemma3 y Mistral. A estos modelos se les asignaron funciones para entrenar diferentes modelos de colaboración de agentes, como el razonamiento secuencial y la colaboración mixta de expertos.
RecursiveMAS se comparó con puntos de referencia con presupuestos de capacitación idénticos, incluidos modelos independientes mejorados con LoRA o ajustes finos totalmente supervisados, marcos alternativos de múltiples agentes como Mixture-of-Agents y TextGrad, y puntos de referencia recursivos como LoopLM. También se ha comparado con Recursive-TextMAS, que utiliza la misma estructura de bucle recursivo que RecursiveMAS pero requiere que los agentes se comuniquen explícitamente a través de texto.
RecursiveMAS logró una mejora de precisión promedio del 8,3 % con respecto a las líneas de base más sólidas de todos los puntos de referencia. Se destacó particularmente en tareas que requieren mucho razonamiento, superando a los métodos de optimización basados en texto como TextGrad en un 18,1 % en AIME2025 y un 13 % en AIME2026.
Debido a que evita generar texto en cada paso, RecursiveMAS logró una aceleración de la inferencia de un extremo a otro de 1,2 a 2,4 veces. RecursiveMAS también es mucho más eficiente simbólicamente que la alternativa. En comparación con Recursive-TextMAS basado en texto, reduce el uso de tokens en un 34,6% en la primera ronda de recursividad y en la tercera ronda logra una reducción de tokens del 75,6%. RecursiveMAS también ha demostrado ser notablemente barato de entrenar. Debido a que actualiza solo módulos RecursiveLink livianos, que incluyen alrededor de 13 millones de parámetros, o alrededor del 0,31% de los parámetros entrenables de los modelos congelados, requiere la menor memoria de GPU y reduce los costos de entrenamiento a más de la mitad en comparación con un ajuste completo.
Adopción empresarial
Las eficiencias (consumo de tokens reducido, requisitos de memoria GPU reducidos e inferencia más rápida) tienen como objetivo hacer viables los flujos de trabajo de agentes complejos y de varios pasos en entornos de producción sin la sobrecarga informática que limita las implementaciones de agentes empresariales. Los investigadores publicaron el código y entrenaron los pesos del modelo bajo la licencia Apache 2.0.
Uno de los principales desafíos de los sistemas de IA multiagente actuales es que se comunican generando y compartiendo secuencias de texto, lo que introduce latencia, aumenta los costos de los tokens y dificulta el entrenamiento de todo el sistema como una unidad coherente.
Para superar este desafío, investigadores de la Universidad de Illinois en Urbana-Champaign y la Universidad de Stanford desarrollaron RecursivoPLUSun marco que permite a los agentes colaborar y transmitir información a través de la integración del espacio en lugar del texto. Este cambio da como resultado ganancias tanto de eficiencia como de rendimiento.
Los experimentos muestran que RecursiveMAS ayuda a mejorar la precisión en áreas complejas como la generación de códigos, el razonamiento médico y la investigación, al tiempo que aumenta la velocidad de inferencia y reduce significativamente el uso de tokens.
RecursiveMAS es significativamente más barato de entrenar que los métodos estándar de ajuste completo o LoRA, lo que lo convierte en un modelo escalable y rentable para sistemas personalizados de múltiples agentes.
Los desafíos de mejorar los sistemas multiagente
Sistemas multiagente puede ayudar a resolver tareas complejas que los sistemas de agente único tienen dificultades para manejar. Al escalar sistemas multiagente para aplicaciones del mundo real, un gran desafío es permitir que el sistema evolucione, mejore y se adapte a diferentes escenarios a lo largo del tiempo.
La adaptación basada en indicaciones mejora las interacciones de los agentes al refinar iterativamente el contexto compartido proporcionado a los agentes. Al actualizar las indicaciones, el sistema actúa como director, guiando a los agentes para generar respuestas más alineadas con el objetivo general. La limitación fundamental es que las capacidades de los modelos subyacentes a cada agente permanecen estáticas.
Un enfoque más sofisticado consiste en capacitar a los agentes actualizando las ponderaciones de los modelos subyacentes. Entrenar un sistema completo de agentes es difícil porque actualizar todos los parámetros en múltiples modelos no es computacionalmente trivial.
Incluso si un equipo de ingenieros se compromete a entrenar sus modelos, la forma estándar en que los agentes se comunican mediante interacciones basadas en texto crea importantes cuellos de botella. Dado que los agentes dependen de la generación secuencial de texto, esto genera latencia porque cada modelo debe esperar a que el anterior termine de generar su texto antes de poder comenzar su propio procesamiento.
Obligar a los modelos a deletrear su razonamiento intermedio token por token sólo para que el siguiente modelo pueda leerlo es muy ineficiente. Esto aumenta drásticamente el uso de tokens, aumenta los costos computacionales y hace que el aprendizaje iterativo en todo el sistema sea extremadamente lento de escalar.
Cómo funciona RecursiveMAS
En lugar de intentar mejorar cada agente como un componente aislado e independiente, RecursiveMAS está diseñado para coevolucionar y evolucionar todo el sistema multiagente como un todo integrado.
El marco está inspirado en modelos de lenguaje recursivo (RLM). En un modelo de lenguaje estándar, los datos fluyen linealmente a través de una pila de capas distintas. Por el contrario, un modelo de lenguaje recursivo reutiliza un conjunto de capas compartidas que procesan datos y se los devuelven entre sí. Al completar el cálculo, el modelo puede profundizar su razonamiento sin agregar parámetros.
RecursiveMAS extiende este principio de escalamiento de un modelo único a una arquitectura de múltiples agentes que actúa como un sistema recursivo unificado. En esta configuración, cada agente funciona como una capa en un modelo de lenguaje recursivo. En lugar de generar texto, los agentes pasan iterativamente sus representaciones latentes continuas al siguiente agente en la secuencia, creando un flujo de información oculto y en bucle que circula a través del sistema.
Esta transferencia latente continúa a través de todos los agentes. Cuando el agente final completa su procesamiento, sus resultados latentes se envían directamente al primer agente, lo que desencadena un nuevo ciclo de recursividad.
Esta estructura permite que todo el sistema de múltiples agentes interactúe, refleje y refine su razonamiento colectivo durante múltiples rondas completamente en un espacio latente, y solo el último agente produce resultados textuales en la ronda final. Es como si los agentes se comunicaran telepáticamente como un todo unificado y el último agente proporcionara la respuesta final en forma de texto.
La arquitectura de la colaboración latente
Para hacer posible la colaboración continua en el espacio latente, los autores introducen un componente arquitectónico especializado llamado RecursiveLink. Es un módulo liviano de dos capas diseñado para transmitir y refinar los estados latentes de un modelo en lugar de obligarlo a decodificar texto.
Los estados ocultos de la última capa de un modelo de lenguaje contienen la rica representación semántica de su proceso de razonamiento. RecursiveLink está diseñado para preservar y transmitir esta información de alta dimensión de un espacio de integración a otro.
Para evitar el costo de actualizar cada parámetro en múltiples modelos de lenguaje grandes, el marco mantiene congelados los parámetros del modelo. En cambio, optimiza el sistema entrenando únicamente los parámetros de los módulos RecursiveLink.
Para manejar tanto el razonamiento interno como la comunicación externa, el sistema utiliza dos variaciones del módulo. El RecursiveLink interno opera dentro de un agente durante su fase de razonamiento. Toma las incrustaciones recién generadas del modelo y las asigna directamente a su propio espacio de incrustación de entrada. Esto permite al agente generar continuamente un flujo de pensamientos latentes sin generar tokens de texto discretos.
El RecursiveLink externo sirve como puente entre agentes. Dado que los agentes en un sistema real pueden usar diferentes arquitecturas y tamaños de modelo, sus espacios internos de integración tienen dimensiones completamente diferentes. El RecursiveLink externo incluye una capa adicional diseñada para hacer coincidir las incrustaciones de la dimensión oculta de un agente con el espacio de incrustación del siguiente agente.
Durante la capacitación, primero, los enlaces internos se entrenan de forma independiente para calentar la capacidad de cada agente para pensar en integraciones latentes continuas. A continuación, el sistema ingresa al entrenamiento de bucle externo, donde los distintos modelos congelados se encadenan en un bucle y el sistema se evalúa en función del resultado textual final del último agente.
Lo único que se actualiza durante el proceso de entrenamiento son los parámetros de RecursiveLink y los pesos del modelo original permanecen sin cambios, en cuanto a adaptación de bajo rango (LoRA). Otro beneficio de este sistema entra en vigor cuando tiene varios agentes sobre el mismo modelo base.
Si tiene un sistema de múltiples agentes en el que dos agentes se crean exactamente en el mismo modelo base y actúan en diferentes roles, no necesita cargar dos copias del modelo en la memoria de su GPU, ni necesita entrenarlas por separado. Los agentes compartirán la misma columna vertebral que el cerebro y utilizarán RecursiveLink como tejido conectivo.
MAS recursivo en acción
Los investigadores evaluaron RecursiveMAS según nueve criterios que abarcan matemáticas, ciencias y medicina, generación de códigos y respuesta a preguntas basadas en investigaciones. Crearon un sistema multiagente utilizando modelos de peso abierto, incluidos Qwen, Llama-3, Gemma3 y Mistral. A estos modelos se les asignaron funciones para entrenar diferentes modelos de colaboración de agentes, como el razonamiento secuencial y la colaboración mixta de expertos.
RecursiveMAS se comparó con puntos de referencia con presupuestos de capacitación idénticos, incluidos modelos independientes mejorados con LoRA o ajustes finos totalmente supervisados, marcos alternativos de múltiples agentes como Mixture-of-Agents y TextGrad, y puntos de referencia recursivos como LoopLM. También se ha comparado con Recursive-TextMAS, que utiliza la misma estructura de bucle recursivo que RecursiveMAS pero requiere que los agentes se comuniquen explícitamente a través de texto.
RecursiveMAS logró una mejora de precisión promedio del 8,3 % con respecto a las líneas de base más sólidas de todos los puntos de referencia. Se destacó particularmente en tareas que requieren mucho razonamiento, superando a los métodos de optimización basados en texto como TextGrad en un 18,1 % en AIME2025 y un 13 % en AIME2026.
Debido a que evita generar texto en cada paso, RecursiveMAS logró una aceleración de la inferencia de un extremo a otro de 1,2 a 2,4 veces. RecursiveMAS también es mucho más eficiente simbólicamente que la alternativa. En comparación con Recursive-TextMAS basado en texto, reduce el uso de tokens en un 34,6% en la primera ronda de recursividad y en la tercera ronda logra una reducción de tokens del 75,6%. RecursiveMAS también ha demostrado ser notablemente barato de entrenar. Debido a que actualiza solo módulos RecursiveLink livianos, que incluyen alrededor de 13 millones de parámetros, o alrededor del 0,31% de los parámetros entrenables de los modelos congelados, requiere la menor memoria de GPU y reduce los costos de entrenamiento a más de la mitad en comparación con un ajuste completo.
Adopción empresarial
Las eficiencias (consumo de tokens reducido, requisitos de memoria GPU reducidos e inferencia más rápida) tienen como objetivo hacer viables los flujos de trabajo de agentes complejos y de varios pasos en entornos de producción sin la sobrecarga informática que limita las implementaciones de agentes empresariales. Los investigadores publicaron el código y entrenaron los pesos del modelo bajo la licencia Apache 2.0.
Uno de los principales desafíos de los sistemas de IA multiagente actuales es que se comunican generando y compartiendo secuencias de texto, lo que introduce latencia, aumenta los costos de los tokens y dificulta el entrenamiento de todo el sistema como una unidad coherente.
Para superar este desafío, investigadores de la Universidad de Illinois en Urbana-Champaign y la Universidad de Stanford desarrollaron RecursivoPLUSun marco que permite a los agentes colaborar y transmitir información a través de la integración del espacio en lugar del texto. Este cambio da como resultado ganancias tanto de eficiencia como de rendimiento.
Los experimentos muestran que RecursiveMAS ayuda a mejorar la precisión en áreas complejas como la generación de códigos, el razonamiento médico y la investigación, al tiempo que aumenta la velocidad de inferencia y reduce significativamente el uso de tokens.
RecursiveMAS es significativamente más barato de entrenar que los métodos estándar de ajuste completo o LoRA, lo que lo convierte en un modelo escalable y rentable para sistemas personalizados de múltiples agentes.
Los desafíos de mejorar los sistemas multiagente
Sistemas multiagente puede ayudar a resolver tareas complejas que los sistemas de agente único tienen dificultades para manejar. Al escalar sistemas multiagente para aplicaciones del mundo real, un gran desafío es permitir que el sistema evolucione, mejore y se adapte a diferentes escenarios a lo largo del tiempo.
La adaptación basada en indicaciones mejora las interacciones de los agentes al refinar iterativamente el contexto compartido proporcionado a los agentes. Al actualizar las indicaciones, el sistema actúa como director, guiando a los agentes para generar respuestas más alineadas con el objetivo general. La limitación fundamental es que las capacidades de los modelos subyacentes a cada agente permanecen estáticas.
Un enfoque más sofisticado consiste en capacitar a los agentes actualizando las ponderaciones de los modelos subyacentes. Entrenar un sistema completo de agentes es difícil porque actualizar todos los parámetros en múltiples modelos no es computacionalmente trivial.
Incluso si un equipo de ingenieros se compromete a entrenar sus modelos, la forma estándar en que los agentes se comunican mediante interacciones basadas en texto crea importantes cuellos de botella. Dado que los agentes dependen de la generación secuencial de texto, esto genera latencia porque cada modelo debe esperar a que el anterior termine de generar su texto antes de poder comenzar su propio procesamiento.
Obligar a los modelos a deletrear su razonamiento intermedio token por token sólo para que el siguiente modelo pueda leerlo es muy ineficiente. Esto aumenta drásticamente el uso de tokens, aumenta los costos computacionales y hace que el aprendizaje iterativo en todo el sistema sea extremadamente lento de escalar.
Cómo funciona RecursiveMAS
En lugar de intentar mejorar cada agente como un componente aislado e independiente, RecursiveMAS está diseñado para coevolucionar y evolucionar todo el sistema multiagente como un todo integrado.
El marco está inspirado en modelos de lenguaje recursivo (RLM). En un modelo de lenguaje estándar, los datos fluyen linealmente a través de una pila de capas distintas. Por el contrario, un modelo de lenguaje recursivo reutiliza un conjunto de capas compartidas que procesan datos y se los devuelven entre sí. Al completar el cálculo, el modelo puede profundizar su razonamiento sin agregar parámetros.
RecursiveMAS extiende este principio de escalamiento de un modelo único a una arquitectura de múltiples agentes que actúa como un sistema recursivo unificado. En esta configuración, cada agente funciona como una capa en un modelo de lenguaje recursivo. En lugar de generar texto, los agentes pasan iterativamente sus representaciones latentes continuas al siguiente agente en la secuencia, creando un flujo de información oculto y en bucle que circula a través del sistema.
Esta transferencia latente continúa a través de todos los agentes. Cuando el agente final completa su procesamiento, sus resultados latentes se envían directamente al primer agente, lo que desencadena un nuevo ciclo de recursividad.
Esta estructura permite que todo el sistema de múltiples agentes interactúe, refleje y refine su razonamiento colectivo durante múltiples rondas completamente en un espacio latente, y solo el último agente produce resultados textuales en la ronda final. Es como si los agentes se comunicaran telepáticamente como un todo unificado y el último agente proporcionara la respuesta final en forma de texto.
La arquitectura de la colaboración latente
Para hacer posible la colaboración continua en el espacio latente, los autores introducen un componente arquitectónico especializado llamado RecursiveLink. Es un módulo liviano de dos capas diseñado para transmitir y refinar los estados latentes de un modelo en lugar de obligarlo a decodificar texto.
Los estados ocultos de la última capa de un modelo de lenguaje contienen la rica representación semántica de su proceso de razonamiento. RecursiveLink está diseñado para preservar y transmitir esta información de alta dimensión de un espacio de integración a otro.
Para evitar el costo de actualizar cada parámetro en múltiples modelos de lenguaje grandes, el marco mantiene congelados los parámetros del modelo. En cambio, optimiza el sistema entrenando únicamente los parámetros de los módulos RecursiveLink.
Para manejar tanto el razonamiento interno como la comunicación externa, el sistema utiliza dos variaciones del módulo. El RecursiveLink interno opera dentro de un agente durante su fase de razonamiento. Toma las incrustaciones recién generadas del modelo y las asigna directamente a su propio espacio de incrustación de entrada. Esto permite al agente generar continuamente un flujo de pensamientos latentes sin generar tokens de texto discretos.
El RecursiveLink externo sirve como puente entre agentes. Dado que los agentes en un sistema real pueden usar diferentes arquitecturas y tamaños de modelo, sus espacios internos de integración tienen dimensiones completamente diferentes. El RecursiveLink externo incluye una capa adicional diseñada para hacer coincidir las incrustaciones de la dimensión oculta de un agente con el espacio de incrustación del siguiente agente.
Durante la capacitación, primero, los enlaces internos se entrenan de forma independiente para calentar la capacidad de cada agente para pensar en integraciones latentes continuas. A continuación, el sistema ingresa al entrenamiento de bucle externo, donde los distintos modelos congelados se encadenan en un bucle y el sistema se evalúa en función del resultado textual final del último agente.
Lo único que se actualiza durante el proceso de entrenamiento son los parámetros de RecursiveLink y los pesos del modelo original permanecen sin cambios, en cuanto a adaptación de bajo rango (LoRA). Otro beneficio de este sistema entra en vigor cuando tiene varios agentes sobre el mismo modelo base.
Si tiene un sistema de múltiples agentes en el que dos agentes se crean exactamente en el mismo modelo base y actúan en diferentes roles, no necesita cargar dos copias del modelo en la memoria de su GPU, ni necesita entrenarlas por separado. Los agentes compartirán la misma columna vertebral que el cerebro y utilizarán RecursiveLink como tejido conectivo.
MAS recursivo en acción
Los investigadores evaluaron RecursiveMAS según nueve criterios que abarcan matemáticas, ciencias y medicina, generación de códigos y respuesta a preguntas basadas en investigaciones. Crearon un sistema multiagente utilizando modelos de peso abierto, incluidos Qwen, Llama-3, Gemma3 y Mistral. A estos modelos se les asignaron funciones para entrenar diferentes modelos de colaboración de agentes, como el razonamiento secuencial y la colaboración mixta de expertos.
RecursiveMAS se comparó con puntos de referencia con presupuestos de capacitación idénticos, incluidos modelos independientes mejorados con LoRA o ajustes finos totalmente supervisados, marcos alternativos de múltiples agentes como Mixture-of-Agents y TextGrad, y puntos de referencia recursivos como LoopLM. También se ha comparado con Recursive-TextMAS, que utiliza la misma estructura de bucle recursivo que RecursiveMAS pero requiere que los agentes se comuniquen explícitamente a través de texto.
RecursiveMAS logró una mejora de precisión promedio del 8,3 % con respecto a las líneas de base más sólidas de todos los puntos de referencia. Se destacó particularmente en tareas que requieren mucho razonamiento, superando a los métodos de optimización basados en texto como TextGrad en un 18,1 % en AIME2025 y un 13 % en AIME2026.
Debido a que evita generar texto en cada paso, RecursiveMAS logró una aceleración de la inferencia de un extremo a otro de 1,2 a 2,4 veces. RecursiveMAS también es mucho más eficiente simbólicamente que la alternativa. En comparación con Recursive-TextMAS basado en texto, reduce el uso de tokens en un 34,6% en la primera ronda de recursividad y en la tercera ronda logra una reducción de tokens del 75,6%. RecursiveMAS también ha demostrado ser notablemente barato de entrenar. Debido a que actualiza solo módulos RecursiveLink livianos, que incluyen alrededor de 13 millones de parámetros, o alrededor del 0,31% de los parámetros entrenables de los modelos congelados, requiere la menor memoria de GPU y reduce los costos de entrenamiento a más de la mitad en comparación con un ajuste completo.
Adopción empresarial
Las eficiencias (consumo de tokens reducido, requisitos de memoria GPU reducidos e inferencia más rápida) tienen como objetivo hacer viables los flujos de trabajo de agentes complejos y de varios pasos en entornos de producción sin la sobrecarga informática que limita las implementaciones de agentes empresariales. Los investigadores publicaron el código y entrenaron los pesos del modelo bajo la licencia Apache 2.0.











































































