Uno de los supuestos que subyacen a los marcos actuales de IA es que los agentes necesitan un “jefe” en el centro; este orquestador dirige el espectáculo, dirige las solicitudes y se asegura de que todo el sistema no caiga en el caos.
Esta suposición puede ser falsa y el costo de realizarla podría medirse en dólares de inferencia y latencia de coordinación. Un nuevo marco de Stanford llamado modelo de lenguaje descentralizado, o DeLM, se basa en el principio de que los agentes pueden coordinarse directamente, sin enrutar cada actualización a través de un controlador central.
La base de conocimiento compartida de DeLM sirve como un «sustrato de comunicación común» para que los agentes puedan aprovechar el progreso verificado de cada uno sin tener que enrutar cada interacción a través de un agente maestro para «fusionar, filtrar y retransmitir», explican Yuzhen Mao y Azalia Mirhoseini, codesarrolladores del marco, en un artículo de investigación.
Se trata de un sistema que no sólo es posible, sino deseable en determinados casos. «Los agentes pueden aprovechar hallazgos anteriores, evitar fallos repetidos, preservar las limitaciones y recuperar pruebas detalladas sólo cuando sea necesario. »
Los desafíos de los sistemas tradicionales multiagente
En un sistema típico centralizado de múltiples agentes, un agente maestro divide las tareas en subtareas, las asigna a múltiples subagentes en paralelo, espera respuestas, fusiona y resume el progreso intermedio y luego emite una siguiente ola de comandos según el contexto recopilado.
Aunque esta es una forma natural de ampliar el razonamiento del LLM, los investigadores de Stanford dicen que no se adapta bien. Cada descubrimiento útil, descubrimiento parcial y falla se debe informar al agente superior, quien luego determina qué información fusionar y retransmitir a los agentes inferiores.
«A medida que aumenta el número de subtareas, este controlador se convierte en un cuello de botella de comunicación e integración», escriben Mao y Mirhoseini. Además, el orquestador principal puede «diluir, omitir o distorsionar» información útil, lo que resulta en una pérdida de progreso.
Este cuello de botella también ocurre en escenarios de razonamiento de contexto largo. Una vez que recibe informes de los subagentes, un agente maestro normalmente agrupa conceptos relacionados, puntos de datos y otros elementos en un ciclo de aprendizaje no supervisado. Luego puede preasignar estos “grupos de evidencia” a subagentes antes de saber qué material descubierto es realmente relevante o si está combinado correctamente.
Cuando un subagente recibe este contexto insuficiente, esencialmente se confundirá y regresará al agente principal, lo que desencadenará otro ciclo de recuperación o delegación. «Este ir y venir hace que la coordinación sea más lenta, más iterativa y cada vez más limitada por un único agente principal sobrecargado», escriben los investigadores.
VB Transform · 14-15 de julio · Menlo Park · Orquestación Agentic
Intuit reconstruyó su sistema multiagente en 60 días. ¿Qué han cambiado y por qué?
En Transform, los líderes de ingeniería de Intuit, Target e Instacart comparten cómo reinventaron sus arquitecturas de orquestación para lograr confiabilidad, escalabilidad y clientes reales.
Ver la agenda completa →
Qué aborda DeLM y cómo funciona
DeLM, por otro lado, se basa en agentes paralelos, un contexto compartido y una cola de tareas.
El contexto compartido es esencialmente un conjunto organizado de “resúmenes” o resúmenes de información que otros agentes podrían encontrar útil. Estas incluyen conclusiones verificadas y basadas en evidencia, así como conclusiones parciales y fallas documentadas; También señalan evidencia detallada en la que los agentes pueden confiar dependiendo de su tarea específica.
Una cola de tareas es entonces un conjunto de subtareas pendientes posteriores que los agentes pueden reclamar de forma independiente.
«Los agentes escriben actualizaciones compactas y verificadas en un contexto compartido que los agentes posteriores pueden leer directamente», escriben los investigadores. Los descubrimientos, fallas y limitaciones útiles se acumulan como un “estado de problema compartido” en lugar de pasar por un controlador central.
La tubería se ve así:
-
Inicialización: Las entradas se dividen en diferentes unidades de trabajo y se agregan a una cola;
-
Ejecución paralela: Los agentes trabajan de forma independiente y en conjunto, completando tareas y leyendo el contexto compartido a medida que avanzan.
-
Compresión y verificación: Los resultados se comprimen en “resúmenes” reutilizables que se comparan con la evidencia que los respalda. Solo se comparten con el grupo los artículos esenciales completamente verificados.
-
Trabajo adicional (si es necesario): Cuando se vacía la cola, el último agente en devolver una respuesta inspecciona todo el contexto compartido para determinar si se necesita trabajo adicional.
-
Último paso: El agente final determina que no se requieren más pasos y devuelve la respuesta final.
Los agentes «intercambian progreso a través de un estado compartido, reclaman asincrónicamente tareas listas y escalan de manera más adaptativa a medida que aumenta el número de subtareas», explican los investigadores.
Cómo funciona DeLM en la naturaleza
Con DeLM, los agentes pueden evitar exploraciones redundantes; reutilizar y aprovechar los descubrimientos y fracasos de cada persona; y centrarse en cuestiones no resueltas.
El marco puede ser particularmente útil para ampliar el tiempo de prueba en ingeniería de software, cuando a los modelos se les da tiempo para «pensar» para mejorar su razonamiento y sus habilidades de resolución de problemas. Diferentes agentes pueden explorar sus propias hipótesis o seguir caminos de razonamiento en paralelo, mientras comparten avances intermedios. Un ejemplo es la depuración concurrente.
DeLM también es adecuado para razonar en un contexto extenso y responder preguntas de varios documentos; Los agentes pueden examinar simultáneamente sus propios grupos de evidencia (colecciones de documentos, códigos u otros materiales), mientras mantienen una “panorama general” de la evidencia acumulada.
Los investigadores dicen que esto hace que las tareas de los agentes sean más precisas y significativamente menos costosas. Esto está respaldado por su desempeño en puntos de referencia del mundo real: en SWE-bench Verified, que evalúa qué tan bien los modelos y agentes de IA resuelven problemas de ingeniería de software del mundo real, tuvo un desempeño un 10,5 % mejor que el punto de referencia más sólido y redujo el costo por tarea en aproximadamente un 50 %.
Pero puede ir más allá de la codificación: en el control de calidad Multi-Doc de LongBench‑v2, que evalúa la capacidad de los LLM para manejar problemas del mundo real y de contexto prolongado, DeLM tuvo la mayor precisión en cuatro familias de modelos, incluidos GPT‑5.4, Claude Sonnet, Gemini Flash y DeepSeek‑V4‑Pro.
DeLM supera a otros modelos en SWE-Bench por varias razones, como detalló Mao en X.
Primero, los agentes comparten sus fracasos. En ejecuciones paralelas ordinarias, cuando un agente sigue el camino equivocado, este error sigue siendo privado y los agentes posteriores pueden perder tiempo (y dinero) persiguiendo el mismo callejón sin salida. Pero con DeLM, las hipótesis fallidas se escriben en un contexto compartido.
«Los agentes posteriores pueden leerlos como limitaciones, evitar exploraciones repetidas y redirigir su búsqueda hacia soluciones más prometedoras», dijo Mao.
Además, las restricciones, una vez verificadas, se agregan inmediatamente al contexto compartido de los agentes. Esto significa que se convierten en un Estado compartido y vinculante. “Los agentes posteriores los heredan, construyen a partir de ellos y evitan repetir simplificaciones globalmente inválidas”, dijo Mao.
Es importante destacar que DeLM mantiene el progreso compartido lo suficientemente compacto como para poder reutilizarlo. Es ampliable, lo que significa que los agentes ven resúmenes breves de forma predeterminada, pero pueden optar por ampliarlos a resúmenes más detallados y evidencia sin procesar.
Como señalan los investigadores, proporcionar todos los documentos y rastreos sin procesar brinda a los agentes la máxima cantidad de información, pero puede sobrecargar sus ventanas emergentes y, en última instancia, aumentar los costos.
«Si los agentes compartieran rastros completos, cada trabajador necesitaría leer largos historiales de comandos, guardados de archivos, cambios fallidos y razonamientos intermedios, lo que convertiría la coordinación misma en otro cuello de botella de contexto prolongado», dijo Mao.
Por otro lado, aunque compartir resúmenes compactos es menos costoso, se pueden perder detalles y evidencia importantes, lo que resulta en un razonamiento menos confiable.
Por lo tanto, Unfolding ofrece un acceso opcional de “grueso a fino”. Esto puede mejorar la precisión y el costo.
En última instancia, con un marco como DeLM, los agentes pueden ser más eficientes porque no pueden leer repetidamente los mismos documentos ni volver a ejecutar el mismo análisis fallido; más eficiente porque los resultados útiles se propagan por cables paralelos; y más sólidos porque solo comparten afirmaciones verificadas.
Para los creadores de negocios, DeLM desafía una suposición fundamental: cada flujo de trabajo de múltiples agentes necesita un controlador central. Los resultados de SWE-bench y LongBench-v2 sugieren que el modelo descentralizado no sólo es teóricamente más limpio: es más rápido, más preciso y cuesta aproximadamente la mitad del costo.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.















































































