A medida que los grandes modelos de lenguaje se vuelven más capaces, los usuarios se sienten tentados a delegar tareas de conocimiento donde los modelos procesan documentos en su nombre y proporcionan los resultados finales. Pero, ¿qué tan bien puede confiar en que el modelo se mantendrá fiel al contenido de sus documentos cuando tiene que revisarlos durante múltiples ciclos?
Un nuevo estudio realizado por investigadores de Microsoft muestra que los grandes modelos de lenguaje corrompen silenciosamente los documentos en los que trabajan introduciendo errores. Los investigadores desarrollaron un punto de referencia que simula flujos de trabajo autónomos de varios pasos en 52 dominios profesionales, utilizando un método que mide automáticamente el grado de degradación del contenido a lo largo del tiempo.
Sus hallazgos muestran que incluso los modelos de límites de primer nivel corrompen en promedio el 25% del contenido del documento al final de estos flujos de trabajo. Y proporcionar a los modelos herramientas de agentes o documentos de distracción realistas en realidad degrada su rendimiento.
Esto sirve como advertencia: aunque existe una presión creciente para automatizar el trabajo del conocimiento, los modelos lingüísticos actuales no son del todo fiables para estas tareas.
La mecánica del trabajo delegado
El estudio de Microsoft se centra en el «trabajo delegado», un paradigma emergente en el que los usuarios permiten a los LLM completar tareas de conocimiento en su nombre mediante el análisis y la edición de documentos.
Un ejemplo destacado de este paradigma es la codificación por vibración, en la que un usuario delega el desarrollo de software y la edición de código a una IA. Pero los flujos de trabajo delegados van mucho más allá de la programación y se extienden a otras áreas. En contabilidad, por ejemplo, un usuario puede proporcionar un libro de contabilidad denso y pedirle al modelo que divida el documento en archivos separados organizados por categorías de gastos específicas.
Dado que los usuarios pueden carecer del tiempo o la experiencia especializada para revisar manualmente cada cambio que implementa la IA, la delegación a menudo depende de la confianza. Los usuarios esperan que el modelo complete fielmente las tareas sin introducir errores no controlados, eliminaciones no autorizadas o alucinaciones en los documentos.
Para medir qué tan confiables pueden ser los sistemas de IA en flujos de trabajo delegados extensos e iterativos, los investigadores desarrollaron el punto de referencia DELEGATE-52. El punto de referencia se compone de 310 entornos de trabajo que cubren 52 campos profesionales diversos, incluida la contabilidad financiera, la ingeniería de software, la cristalografía y la notación musical.
Cada entorno de trabajo se basa en documentos de texto semilla reales que van desde 2000 a 5000 tokens. Además del documento inicial, los entornos incluyen de cinco a diez tareas de edición complejas y no triviales.
La puntuación de un proceso de edición complejo y de varios pasos normalmente requiere una costosa revisión humana. DELEGATE-52 soluciona este problema utilizando un método de simulación de «relé de ida y vuelta» que evalúa las respuestas sin requerir soluciones de referencia anotadas por humanos. El enfoque está inspirado en la técnica de retrotraducción utilizada en la evaluación de la traducción automática, donde se pide a un modelo de IA que traduzca un documento de un idioma a otro y viceversa para ver qué tan perfectamente reproduce la versión original.
Como resultado, cada tarea de edición en DELEGATE-52 está diseñada para ser completamente reversible, combinando una instrucción directa con su inversa precisa. Por ejemplo, una instrucción para dividir el libro mayor en archivos separados por categoría de gastos se combina con una instrucción para fusionar todos los archivos de categorías en un solo libro mayor.
En comentarios proporcionados a VentureBeat, Philippe Laban, investigador principal de Microsoft Research y coautor del artículo, aclaró que esto no es simplemente una prueba de si una IA puede presionar «deshacer». Dado que no se puede obligar a los trabajadores humanos a “olvidar” instantáneamente una tarea que acaban de completar, esta evaluación de ida y vuelta es particularmente adecuada para la IA. Al iniciar una nueva sesión de conversación, los investigadores obligan al modelo a intentar la tarea opuesta de forma completamente independiente.
Los modelos de sus experimentos «no saben si una tarea es un paso hacia adelante o hacia atrás y no conocen el diseño general del experimento», explicó Laban. «Simplemente intentan realizar cada tarea lo más minuciosamente posible, en cada paso del camino».
Estas tareas de ida y vuelta se encadenan en un relevo continuo para simular flujos de trabajo a largo plazo que abarcan 20 interacciones consecutivas. Para hacer que el entorno sea más realista, el punto de referencia introduce archivos distractores en el contexto de cada tarea. Estos contienen entre 8.000 y 12.000 fichas de documentos temáticos pero completamente irrelevantes. Las distracciones miden si la IA puede mantener el enfoque o si se confunde y extrae datos incorrectos.
Prueba de modelos de límites en el relé
Para comprender cómo las diferentes arquitecturas y escalas manejan el trabajo delegado, los investigadores probaron 19 modelos de lenguaje diferentes de OpenAI, Anthropic, Google, Mistral, xAI y Moonshot. El experimento principal sometió estos modelos a una simulación de 20 interacciones de edición consecutivas.
En todos los modelos combinados, los documentos sufrieron una degradación promedio del 50% al final de la simulación. Incluso los mejores modelos de frontera del experimento, en particular Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, corrompieron en promedio el 25% del contenido del documento.
De 52 campos profesionales, Python fue el único donde la mayoría de los modelos alcanzaron el estado «listo» con una puntuación del 98% o más. Las plantillas destacan en tareas programáticas, pero tienen dificultades con el lenguaje natural y áreas específicas como ficción, estados de resultados o recetas. El modelo superior, Gemini 3.1 Pro, fue calificado como listo para trabajo delegado en sólo 11 de 52 áreas.
Curiosamente, la corrupción no fue causada por la muerte de mil cortes donde los modelos acumulan lentamente pequeños errores. En cambio, alrededor del 80% de la degradación total es causada por fallas críticas raras pero masivas, que son interacciones únicas durante las cuales un modelo pierde repentinamente al menos el 10% del contenido del documento. Los modelos de límites no son necesariamente mejores para evitar pequeños errores. Simplemente posponen estos fracasos catastróficos para ciclos posteriores.
Otra observación importante es que cuando los modelos más débiles fallan, su degradación se debe principalmente a la eliminación de contenido. Sin embargo, cuando los modelos de límites fallan, corrompen activamente el contenido existente. El texto sigue ahí, pero ha sido sutilmente distorsionado o alucinado, lo que hace mucho más difícil para un supervisor humano detectar el error.
Curiosamente, darle a los modelos un arnés agente con herramientas genéricas para la ejecución de código y acceso de lectura/escritura a archivos en realidad degradó su rendimiento, agregando en promedio un 6% más de degradación. Laban explicó que el fracaso radica en confiar en herramientas genéricas en lugar de herramientas de dominio específico.
«Los modelos no tienen la capacidad de escribir programas eficientes sobre la marcha que puedan manipular archivos en varios dominios sin errores», señaló. «Cuando no pueden hacer algo mediante programación, recurren a leer y reescribir archivos completos, lo cual es menos eficiente y más propenso a errores». La solución para los desarrolladores es crear herramientas de alcance limitado (como funciones específicas para calcular o mover entradas en archivos .ledger) para mantener a los agentes encaminados.
La degradación también aumenta a medida que los documentos se vuelven más grandes o se agregan más archivos que distraen al espacio de trabajo. Para los equipos empresariales que invierten mucho en generación de recuperación aumentada (RAG), estos documentos que distraen sirven como una advertencia directa del costo compuesto de un entorno desordenado. Si bien una ventana emergente ruidosa puede provocar una caída mínima del rendimiento del 1 % después de solo dos interacciones, esta degradación se agrava hasta una caída masiva del 2 al 8 % en una simulación larga.
«Para la comunidad de recuperación: los oleoductos RAG deben evaluarse en flujos de trabajo de múltiples etapas, no solo con criterios de recuperación de una sola ronda», dijo Laban. «Las mediciones de una sola vuelta subestiman sistemáticamente los daños de una recuperación imprecisa».
Verificación de la realidad para el negocio autónomo
Los resultados del benchmark DELEGATE-52 ofrecen una verificación crítica de la realidad del revuelo actual en torno a los agentes de IA totalmente autónomos.
El diseño de referencia también implica una restricción práctica: debido a que los modelos pueden mantener un registro limpio durante varias etapas antes de una falla catastrófica repentina, se requiere una revisión humana incremental, no una sola verificación final. Laban recomienda crear aplicaciones de IA en torno a tareas breves y transparentes en lugar de agentes complejos a largo plazo. Esto conserva la implicación de la acción sin que el escritor proporcione la prescripción.
Para las organizaciones que hoy buscan implementar de forma segura agentes autónomos, la metodología DELEGATE-52 proporciona un modelo práctico para probar canales de datos internos. Laban explicó que «… un equipo empresarial que desee adoptar este marco debe crear tres componentes: (a) un conjunto de tareas de edición reversibles representativas de sus flujos de trabajo, (b) un analizador que convierte sus documentos de dominio en una representación estructurada y (c) una función de similitud que compara dos representaciones analizadas. » Los equipos ni siquiera necesitan crear analizadores desde cero. El equipo de investigación de Microsoft reutilizó con éxito las bibliotecas de análisis existentes para 30 de los 52 dominios probados.
Laban es optimista sobre el ritmo de mejora. «El progreso es real y rápido. Si analizamos únicamente la familia GPT, los modelos pasan de obtener una puntuación inferior al 20% a alrededor del 70% en 18 meses», afirmó Laban. «Si esta trayectoria continúa, los modelos pronto podrán alcanzar puntuaciones saturadas en DELEGATE-52».
Sin embargo, Laban advirtió que DELEGATE-52 es intencionalmente pequeño en comparación con entornos empresariales masivos. Incluso si los modelos básicos inevitablemente dominan este punto de referencia, la larga e infinita cola de flujos de trabajo y datos empresariales únicos significa que las organizaciones seguirán necesitando invertir en herramientas personalizadas y específicas de dominio para garantizar la confiabilidad de sus agentes autónomos.
A medida que los grandes modelos de lenguaje se vuelven más capaces, los usuarios se sienten tentados a delegar tareas de conocimiento donde los modelos procesan documentos en su nombre y proporcionan los resultados finales. Pero, ¿qué tan bien puede confiar en que el modelo se mantendrá fiel al contenido de sus documentos cuando tiene que revisarlos durante múltiples ciclos?
Un nuevo estudio realizado por investigadores de Microsoft muestra que los grandes modelos de lenguaje corrompen silenciosamente los documentos en los que trabajan introduciendo errores. Los investigadores desarrollaron un punto de referencia que simula flujos de trabajo autónomos de varios pasos en 52 dominios profesionales, utilizando un método que mide automáticamente el grado de degradación del contenido a lo largo del tiempo.
Sus hallazgos muestran que incluso los modelos de límites de primer nivel corrompen en promedio el 25% del contenido del documento al final de estos flujos de trabajo. Y proporcionar a los modelos herramientas de agentes o documentos de distracción realistas en realidad degrada su rendimiento.
Esto sirve como advertencia: aunque existe una presión creciente para automatizar el trabajo del conocimiento, los modelos lingüísticos actuales no son del todo fiables para estas tareas.
La mecánica del trabajo delegado
El estudio de Microsoft se centra en el «trabajo delegado», un paradigma emergente en el que los usuarios permiten a los LLM completar tareas de conocimiento en su nombre mediante el análisis y la edición de documentos.
Un ejemplo destacado de este paradigma es la codificación por vibración, en la que un usuario delega el desarrollo de software y la edición de código a una IA. Pero los flujos de trabajo delegados van mucho más allá de la programación y se extienden a otras áreas. En contabilidad, por ejemplo, un usuario puede proporcionar un libro de contabilidad denso y pedirle al modelo que divida el documento en archivos separados organizados por categorías de gastos específicas.
Dado que los usuarios pueden carecer del tiempo o la experiencia especializada para revisar manualmente cada cambio que implementa la IA, la delegación a menudo depende de la confianza. Los usuarios esperan que el modelo complete fielmente las tareas sin introducir errores no controlados, eliminaciones no autorizadas o alucinaciones en los documentos.
Para medir qué tan confiables pueden ser los sistemas de IA en flujos de trabajo delegados extensos e iterativos, los investigadores desarrollaron el punto de referencia DELEGATE-52. El punto de referencia se compone de 310 entornos de trabajo que cubren 52 campos profesionales diversos, incluida la contabilidad financiera, la ingeniería de software, la cristalografía y la notación musical.
Cada entorno de trabajo se basa en documentos de texto semilla reales que van desde 2000 a 5000 tokens. Además del documento inicial, los entornos incluyen de cinco a diez tareas de edición complejas y no triviales.
La puntuación de un proceso de edición complejo y de varios pasos normalmente requiere una costosa revisión humana. DELEGATE-52 soluciona este problema utilizando un método de simulación de «relé de ida y vuelta» que evalúa las respuestas sin requerir soluciones de referencia anotadas por humanos. El enfoque está inspirado en la técnica de retrotraducción utilizada en la evaluación de la traducción automática, donde se pide a un modelo de IA que traduzca un documento de un idioma a otro y viceversa para ver qué tan perfectamente reproduce la versión original.
Como resultado, cada tarea de edición en DELEGATE-52 está diseñada para ser completamente reversible, combinando una instrucción directa con su inversa precisa. Por ejemplo, una instrucción para dividir el libro mayor en archivos separados por categoría de gastos se combina con una instrucción para fusionar todos los archivos de categorías en un solo libro mayor.
En comentarios proporcionados a VentureBeat, Philippe Laban, investigador principal de Microsoft Research y coautor del artículo, aclaró que esto no es simplemente una prueba de si una IA puede presionar «deshacer». Dado que no se puede obligar a los trabajadores humanos a “olvidar” instantáneamente una tarea que acaban de completar, esta evaluación de ida y vuelta es particularmente adecuada para la IA. Al iniciar una nueva sesión de conversación, los investigadores obligan al modelo a intentar la tarea opuesta de forma completamente independiente.
Los modelos de sus experimentos «no saben si una tarea es un paso hacia adelante o hacia atrás y no conocen el diseño general del experimento», explicó Laban. «Simplemente intentan realizar cada tarea lo más minuciosamente posible, en cada paso del camino».
Estas tareas de ida y vuelta se encadenan en un relevo continuo para simular flujos de trabajo a largo plazo que abarcan 20 interacciones consecutivas. Para hacer que el entorno sea más realista, el punto de referencia introduce archivos distractores en el contexto de cada tarea. Estos contienen entre 8.000 y 12.000 fichas de documentos temáticos pero completamente irrelevantes. Las distracciones miden si la IA puede mantener el enfoque o si se confunde y extrae datos incorrectos.
Prueba de modelos de límites en el relé
Para comprender cómo las diferentes arquitecturas y escalas manejan el trabajo delegado, los investigadores probaron 19 modelos de lenguaje diferentes de OpenAI, Anthropic, Google, Mistral, xAI y Moonshot. El experimento principal sometió estos modelos a una simulación de 20 interacciones de edición consecutivas.
En todos los modelos combinados, los documentos sufrieron una degradación promedio del 50% al final de la simulación. Incluso los mejores modelos de frontera del experimento, en particular Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, corrompieron en promedio el 25% del contenido del documento.
De 52 campos profesionales, Python fue el único donde la mayoría de los modelos alcanzaron el estado «listo» con una puntuación del 98% o más. Las plantillas destacan en tareas programáticas, pero tienen dificultades con el lenguaje natural y áreas específicas como ficción, estados de resultados o recetas. El modelo superior, Gemini 3.1 Pro, fue calificado como listo para trabajo delegado en sólo 11 de 52 áreas.
Curiosamente, la corrupción no fue causada por la muerte de mil cortes donde los modelos acumulan lentamente pequeños errores. En cambio, alrededor del 80% de la degradación total es causada por fallas críticas raras pero masivas, que son interacciones únicas durante las cuales un modelo pierde repentinamente al menos el 10% del contenido del documento. Los modelos de límites no son necesariamente mejores para evitar pequeños errores. Simplemente posponen estos fracasos catastróficos para ciclos posteriores.
Otra observación importante es que cuando los modelos más débiles fallan, su degradación se debe principalmente a la eliminación de contenido. Sin embargo, cuando los modelos de límites fallan, corrompen activamente el contenido existente. El texto sigue ahí, pero ha sido sutilmente distorsionado o alucinado, lo que hace mucho más difícil para un supervisor humano detectar el error.
Curiosamente, darle a los modelos un arnés agente con herramientas genéricas para la ejecución de código y acceso de lectura/escritura a archivos en realidad degradó su rendimiento, agregando en promedio un 6% más de degradación. Laban explicó que el fracaso radica en confiar en herramientas genéricas en lugar de herramientas de dominio específico.
«Los modelos no tienen la capacidad de escribir programas eficientes sobre la marcha que puedan manipular archivos en varios dominios sin errores», señaló. «Cuando no pueden hacer algo mediante programación, recurren a leer y reescribir archivos completos, lo cual es menos eficiente y más propenso a errores». La solución para los desarrolladores es crear herramientas de alcance limitado (como funciones específicas para calcular o mover entradas en archivos .ledger) para mantener a los agentes encaminados.
La degradación también aumenta a medida que los documentos se vuelven más grandes o se agregan más archivos que distraen al espacio de trabajo. Para los equipos empresariales que invierten mucho en generación de recuperación aumentada (RAG), estos documentos que distraen sirven como una advertencia directa del costo compuesto de un entorno desordenado. Si bien una ventana emergente ruidosa puede provocar una caída mínima del rendimiento del 1 % después de solo dos interacciones, esta degradación se agrava hasta una caída masiva del 2 al 8 % en una simulación larga.
«Para la comunidad de recuperación: los oleoductos RAG deben evaluarse en flujos de trabajo de múltiples etapas, no solo con criterios de recuperación de una sola ronda», dijo Laban. «Las mediciones de una sola vuelta subestiman sistemáticamente los daños de una recuperación imprecisa».
Verificación de la realidad para el negocio autónomo
Los resultados del benchmark DELEGATE-52 ofrecen una verificación crítica de la realidad del revuelo actual en torno a los agentes de IA totalmente autónomos.
El diseño de referencia también implica una restricción práctica: debido a que los modelos pueden mantener un registro limpio durante varias etapas antes de una falla catastrófica repentina, se requiere una revisión humana incremental, no una sola verificación final. Laban recomienda crear aplicaciones de IA en torno a tareas breves y transparentes en lugar de agentes complejos a largo plazo. Esto conserva la implicación de la acción sin que el escritor proporcione la prescripción.
Para las organizaciones que hoy buscan implementar de forma segura agentes autónomos, la metodología DELEGATE-52 proporciona un modelo práctico para probar canales de datos internos. Laban explicó que «… un equipo empresarial que desee adoptar este marco debe crear tres componentes: (a) un conjunto de tareas de edición reversibles representativas de sus flujos de trabajo, (b) un analizador que convierte sus documentos de dominio en una representación estructurada y (c) una función de similitud que compara dos representaciones analizadas. » Los equipos ni siquiera necesitan crear analizadores desde cero. El equipo de investigación de Microsoft reutilizó con éxito las bibliotecas de análisis existentes para 30 de los 52 dominios probados.
Laban es optimista sobre el ritmo de mejora. «El progreso es real y rápido. Si analizamos únicamente la familia GPT, los modelos pasan de obtener una puntuación inferior al 20% a alrededor del 70% en 18 meses», afirmó Laban. «Si esta trayectoria continúa, los modelos pronto podrán alcanzar puntuaciones saturadas en DELEGATE-52».
Sin embargo, Laban advirtió que DELEGATE-52 es intencionalmente pequeño en comparación con entornos empresariales masivos. Incluso si los modelos básicos inevitablemente dominan este punto de referencia, la larga e infinita cola de flujos de trabajo y datos empresariales únicos significa que las organizaciones seguirán necesitando invertir en herramientas personalizadas y específicas de dominio para garantizar la confiabilidad de sus agentes autónomos.
A medida que los grandes modelos de lenguaje se vuelven más capaces, los usuarios se sienten tentados a delegar tareas de conocimiento donde los modelos procesan documentos en su nombre y proporcionan los resultados finales. Pero, ¿qué tan bien puede confiar en que el modelo se mantendrá fiel al contenido de sus documentos cuando tiene que revisarlos durante múltiples ciclos?
Un nuevo estudio realizado por investigadores de Microsoft muestra que los grandes modelos de lenguaje corrompen silenciosamente los documentos en los que trabajan introduciendo errores. Los investigadores desarrollaron un punto de referencia que simula flujos de trabajo autónomos de varios pasos en 52 dominios profesionales, utilizando un método que mide automáticamente el grado de degradación del contenido a lo largo del tiempo.
Sus hallazgos muestran que incluso los modelos de límites de primer nivel corrompen en promedio el 25% del contenido del documento al final de estos flujos de trabajo. Y proporcionar a los modelos herramientas de agentes o documentos de distracción realistas en realidad degrada su rendimiento.
Esto sirve como advertencia: aunque existe una presión creciente para automatizar el trabajo del conocimiento, los modelos lingüísticos actuales no son del todo fiables para estas tareas.
La mecánica del trabajo delegado
El estudio de Microsoft se centra en el «trabajo delegado», un paradigma emergente en el que los usuarios permiten a los LLM completar tareas de conocimiento en su nombre mediante el análisis y la edición de documentos.
Un ejemplo destacado de este paradigma es la codificación por vibración, en la que un usuario delega el desarrollo de software y la edición de código a una IA. Pero los flujos de trabajo delegados van mucho más allá de la programación y se extienden a otras áreas. En contabilidad, por ejemplo, un usuario puede proporcionar un libro de contabilidad denso y pedirle al modelo que divida el documento en archivos separados organizados por categorías de gastos específicas.
Dado que los usuarios pueden carecer del tiempo o la experiencia especializada para revisar manualmente cada cambio que implementa la IA, la delegación a menudo depende de la confianza. Los usuarios esperan que el modelo complete fielmente las tareas sin introducir errores no controlados, eliminaciones no autorizadas o alucinaciones en los documentos.
Para medir qué tan confiables pueden ser los sistemas de IA en flujos de trabajo delegados extensos e iterativos, los investigadores desarrollaron el punto de referencia DELEGATE-52. El punto de referencia se compone de 310 entornos de trabajo que cubren 52 campos profesionales diversos, incluida la contabilidad financiera, la ingeniería de software, la cristalografía y la notación musical.
Cada entorno de trabajo se basa en documentos de texto semilla reales que van desde 2000 a 5000 tokens. Además del documento inicial, los entornos incluyen de cinco a diez tareas de edición complejas y no triviales.
La puntuación de un proceso de edición complejo y de varios pasos normalmente requiere una costosa revisión humana. DELEGATE-52 soluciona este problema utilizando un método de simulación de «relé de ida y vuelta» que evalúa las respuestas sin requerir soluciones de referencia anotadas por humanos. El enfoque está inspirado en la técnica de retrotraducción utilizada en la evaluación de la traducción automática, donde se pide a un modelo de IA que traduzca un documento de un idioma a otro y viceversa para ver qué tan perfectamente reproduce la versión original.
Como resultado, cada tarea de edición en DELEGATE-52 está diseñada para ser completamente reversible, combinando una instrucción directa con su inversa precisa. Por ejemplo, una instrucción para dividir el libro mayor en archivos separados por categoría de gastos se combina con una instrucción para fusionar todos los archivos de categorías en un solo libro mayor.
En comentarios proporcionados a VentureBeat, Philippe Laban, investigador principal de Microsoft Research y coautor del artículo, aclaró que esto no es simplemente una prueba de si una IA puede presionar «deshacer». Dado que no se puede obligar a los trabajadores humanos a “olvidar” instantáneamente una tarea que acaban de completar, esta evaluación de ida y vuelta es particularmente adecuada para la IA. Al iniciar una nueva sesión de conversación, los investigadores obligan al modelo a intentar la tarea opuesta de forma completamente independiente.
Los modelos de sus experimentos «no saben si una tarea es un paso hacia adelante o hacia atrás y no conocen el diseño general del experimento», explicó Laban. «Simplemente intentan realizar cada tarea lo más minuciosamente posible, en cada paso del camino».
Estas tareas de ida y vuelta se encadenan en un relevo continuo para simular flujos de trabajo a largo plazo que abarcan 20 interacciones consecutivas. Para hacer que el entorno sea más realista, el punto de referencia introduce archivos distractores en el contexto de cada tarea. Estos contienen entre 8.000 y 12.000 fichas de documentos temáticos pero completamente irrelevantes. Las distracciones miden si la IA puede mantener el enfoque o si se confunde y extrae datos incorrectos.
Prueba de modelos de límites en el relé
Para comprender cómo las diferentes arquitecturas y escalas manejan el trabajo delegado, los investigadores probaron 19 modelos de lenguaje diferentes de OpenAI, Anthropic, Google, Mistral, xAI y Moonshot. El experimento principal sometió estos modelos a una simulación de 20 interacciones de edición consecutivas.
En todos los modelos combinados, los documentos sufrieron una degradación promedio del 50% al final de la simulación. Incluso los mejores modelos de frontera del experimento, en particular Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, corrompieron en promedio el 25% del contenido del documento.
De 52 campos profesionales, Python fue el único donde la mayoría de los modelos alcanzaron el estado «listo» con una puntuación del 98% o más. Las plantillas destacan en tareas programáticas, pero tienen dificultades con el lenguaje natural y áreas específicas como ficción, estados de resultados o recetas. El modelo superior, Gemini 3.1 Pro, fue calificado como listo para trabajo delegado en sólo 11 de 52 áreas.
Curiosamente, la corrupción no fue causada por la muerte de mil cortes donde los modelos acumulan lentamente pequeños errores. En cambio, alrededor del 80% de la degradación total es causada por fallas críticas raras pero masivas, que son interacciones únicas durante las cuales un modelo pierde repentinamente al menos el 10% del contenido del documento. Los modelos de límites no son necesariamente mejores para evitar pequeños errores. Simplemente posponen estos fracasos catastróficos para ciclos posteriores.
Otra observación importante es que cuando los modelos más débiles fallan, su degradación se debe principalmente a la eliminación de contenido. Sin embargo, cuando los modelos de límites fallan, corrompen activamente el contenido existente. El texto sigue ahí, pero ha sido sutilmente distorsionado o alucinado, lo que hace mucho más difícil para un supervisor humano detectar el error.
Curiosamente, darle a los modelos un arnés agente con herramientas genéricas para la ejecución de código y acceso de lectura/escritura a archivos en realidad degradó su rendimiento, agregando en promedio un 6% más de degradación. Laban explicó que el fracaso radica en confiar en herramientas genéricas en lugar de herramientas de dominio específico.
«Los modelos no tienen la capacidad de escribir programas eficientes sobre la marcha que puedan manipular archivos en varios dominios sin errores», señaló. «Cuando no pueden hacer algo mediante programación, recurren a leer y reescribir archivos completos, lo cual es menos eficiente y más propenso a errores». La solución para los desarrolladores es crear herramientas de alcance limitado (como funciones específicas para calcular o mover entradas en archivos .ledger) para mantener a los agentes encaminados.
La degradación también aumenta a medida que los documentos se vuelven más grandes o se agregan más archivos que distraen al espacio de trabajo. Para los equipos empresariales que invierten mucho en generación de recuperación aumentada (RAG), estos documentos que distraen sirven como una advertencia directa del costo compuesto de un entorno desordenado. Si bien una ventana emergente ruidosa puede provocar una caída mínima del rendimiento del 1 % después de solo dos interacciones, esta degradación se agrava hasta una caída masiva del 2 al 8 % en una simulación larga.
«Para la comunidad de recuperación: los oleoductos RAG deben evaluarse en flujos de trabajo de múltiples etapas, no solo con criterios de recuperación de una sola ronda», dijo Laban. «Las mediciones de una sola vuelta subestiman sistemáticamente los daños de una recuperación imprecisa».
Verificación de la realidad para el negocio autónomo
Los resultados del benchmark DELEGATE-52 ofrecen una verificación crítica de la realidad del revuelo actual en torno a los agentes de IA totalmente autónomos.
El diseño de referencia también implica una restricción práctica: debido a que los modelos pueden mantener un registro limpio durante varias etapas antes de una falla catastrófica repentina, se requiere una revisión humana incremental, no una sola verificación final. Laban recomienda crear aplicaciones de IA en torno a tareas breves y transparentes en lugar de agentes complejos a largo plazo. Esto conserva la implicación de la acción sin que el escritor proporcione la prescripción.
Para las organizaciones que hoy buscan implementar de forma segura agentes autónomos, la metodología DELEGATE-52 proporciona un modelo práctico para probar canales de datos internos. Laban explicó que «… un equipo empresarial que desee adoptar este marco debe crear tres componentes: (a) un conjunto de tareas de edición reversibles representativas de sus flujos de trabajo, (b) un analizador que convierte sus documentos de dominio en una representación estructurada y (c) una función de similitud que compara dos representaciones analizadas. » Los equipos ni siquiera necesitan crear analizadores desde cero. El equipo de investigación de Microsoft reutilizó con éxito las bibliotecas de análisis existentes para 30 de los 52 dominios probados.
Laban es optimista sobre el ritmo de mejora. «El progreso es real y rápido. Si analizamos únicamente la familia GPT, los modelos pasan de obtener una puntuación inferior al 20% a alrededor del 70% en 18 meses», afirmó Laban. «Si esta trayectoria continúa, los modelos pronto podrán alcanzar puntuaciones saturadas en DELEGATE-52».
Sin embargo, Laban advirtió que DELEGATE-52 es intencionalmente pequeño en comparación con entornos empresariales masivos. Incluso si los modelos básicos inevitablemente dominan este punto de referencia, la larga e infinita cola de flujos de trabajo y datos empresariales únicos significa que las organizaciones seguirán necesitando invertir en herramientas personalizadas y específicas de dominio para garantizar la confiabilidad de sus agentes autónomos.
A medida que los grandes modelos de lenguaje se vuelven más capaces, los usuarios se sienten tentados a delegar tareas de conocimiento donde los modelos procesan documentos en su nombre y proporcionan los resultados finales. Pero, ¿qué tan bien puede confiar en que el modelo se mantendrá fiel al contenido de sus documentos cuando tiene que revisarlos durante múltiples ciclos?
Un nuevo estudio realizado por investigadores de Microsoft muestra que los grandes modelos de lenguaje corrompen silenciosamente los documentos en los que trabajan introduciendo errores. Los investigadores desarrollaron un punto de referencia que simula flujos de trabajo autónomos de varios pasos en 52 dominios profesionales, utilizando un método que mide automáticamente el grado de degradación del contenido a lo largo del tiempo.
Sus hallazgos muestran que incluso los modelos de límites de primer nivel corrompen en promedio el 25% del contenido del documento al final de estos flujos de trabajo. Y proporcionar a los modelos herramientas de agentes o documentos de distracción realistas en realidad degrada su rendimiento.
Esto sirve como advertencia: aunque existe una presión creciente para automatizar el trabajo del conocimiento, los modelos lingüísticos actuales no son del todo fiables para estas tareas.
La mecánica del trabajo delegado
El estudio de Microsoft se centra en el «trabajo delegado», un paradigma emergente en el que los usuarios permiten a los LLM completar tareas de conocimiento en su nombre mediante el análisis y la edición de documentos.
Un ejemplo destacado de este paradigma es la codificación por vibración, en la que un usuario delega el desarrollo de software y la edición de código a una IA. Pero los flujos de trabajo delegados van mucho más allá de la programación y se extienden a otras áreas. En contabilidad, por ejemplo, un usuario puede proporcionar un libro de contabilidad denso y pedirle al modelo que divida el documento en archivos separados organizados por categorías de gastos específicas.
Dado que los usuarios pueden carecer del tiempo o la experiencia especializada para revisar manualmente cada cambio que implementa la IA, la delegación a menudo depende de la confianza. Los usuarios esperan que el modelo complete fielmente las tareas sin introducir errores no controlados, eliminaciones no autorizadas o alucinaciones en los documentos.
Para medir qué tan confiables pueden ser los sistemas de IA en flujos de trabajo delegados extensos e iterativos, los investigadores desarrollaron el punto de referencia DELEGATE-52. El punto de referencia se compone de 310 entornos de trabajo que cubren 52 campos profesionales diversos, incluida la contabilidad financiera, la ingeniería de software, la cristalografía y la notación musical.
Cada entorno de trabajo se basa en documentos de texto semilla reales que van desde 2000 a 5000 tokens. Además del documento inicial, los entornos incluyen de cinco a diez tareas de edición complejas y no triviales.
La puntuación de un proceso de edición complejo y de varios pasos normalmente requiere una costosa revisión humana. DELEGATE-52 soluciona este problema utilizando un método de simulación de «relé de ida y vuelta» que evalúa las respuestas sin requerir soluciones de referencia anotadas por humanos. El enfoque está inspirado en la técnica de retrotraducción utilizada en la evaluación de la traducción automática, donde se pide a un modelo de IA que traduzca un documento de un idioma a otro y viceversa para ver qué tan perfectamente reproduce la versión original.
Como resultado, cada tarea de edición en DELEGATE-52 está diseñada para ser completamente reversible, combinando una instrucción directa con su inversa precisa. Por ejemplo, una instrucción para dividir el libro mayor en archivos separados por categoría de gastos se combina con una instrucción para fusionar todos los archivos de categorías en un solo libro mayor.
En comentarios proporcionados a VentureBeat, Philippe Laban, investigador principal de Microsoft Research y coautor del artículo, aclaró que esto no es simplemente una prueba de si una IA puede presionar «deshacer». Dado que no se puede obligar a los trabajadores humanos a “olvidar” instantáneamente una tarea que acaban de completar, esta evaluación de ida y vuelta es particularmente adecuada para la IA. Al iniciar una nueva sesión de conversación, los investigadores obligan al modelo a intentar la tarea opuesta de forma completamente independiente.
Los modelos de sus experimentos «no saben si una tarea es un paso hacia adelante o hacia atrás y no conocen el diseño general del experimento», explicó Laban. «Simplemente intentan realizar cada tarea lo más minuciosamente posible, en cada paso del camino».
Estas tareas de ida y vuelta se encadenan en un relevo continuo para simular flujos de trabajo a largo plazo que abarcan 20 interacciones consecutivas. Para hacer que el entorno sea más realista, el punto de referencia introduce archivos distractores en el contexto de cada tarea. Estos contienen entre 8.000 y 12.000 fichas de documentos temáticos pero completamente irrelevantes. Las distracciones miden si la IA puede mantener el enfoque o si se confunde y extrae datos incorrectos.
Prueba de modelos de límites en el relé
Para comprender cómo las diferentes arquitecturas y escalas manejan el trabajo delegado, los investigadores probaron 19 modelos de lenguaje diferentes de OpenAI, Anthropic, Google, Mistral, xAI y Moonshot. El experimento principal sometió estos modelos a una simulación de 20 interacciones de edición consecutivas.
En todos los modelos combinados, los documentos sufrieron una degradación promedio del 50% al final de la simulación. Incluso los mejores modelos de frontera del experimento, en particular Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, corrompieron en promedio el 25% del contenido del documento.
De 52 campos profesionales, Python fue el único donde la mayoría de los modelos alcanzaron el estado «listo» con una puntuación del 98% o más. Las plantillas destacan en tareas programáticas, pero tienen dificultades con el lenguaje natural y áreas específicas como ficción, estados de resultados o recetas. El modelo superior, Gemini 3.1 Pro, fue calificado como listo para trabajo delegado en sólo 11 de 52 áreas.
Curiosamente, la corrupción no fue causada por la muerte de mil cortes donde los modelos acumulan lentamente pequeños errores. En cambio, alrededor del 80% de la degradación total es causada por fallas críticas raras pero masivas, que son interacciones únicas durante las cuales un modelo pierde repentinamente al menos el 10% del contenido del documento. Los modelos de límites no son necesariamente mejores para evitar pequeños errores. Simplemente posponen estos fracasos catastróficos para ciclos posteriores.
Otra observación importante es que cuando los modelos más débiles fallan, su degradación se debe principalmente a la eliminación de contenido. Sin embargo, cuando los modelos de límites fallan, corrompen activamente el contenido existente. El texto sigue ahí, pero ha sido sutilmente distorsionado o alucinado, lo que hace mucho más difícil para un supervisor humano detectar el error.
Curiosamente, darle a los modelos un arnés agente con herramientas genéricas para la ejecución de código y acceso de lectura/escritura a archivos en realidad degradó su rendimiento, agregando en promedio un 6% más de degradación. Laban explicó que el fracaso radica en confiar en herramientas genéricas en lugar de herramientas de dominio específico.
«Los modelos no tienen la capacidad de escribir programas eficientes sobre la marcha que puedan manipular archivos en varios dominios sin errores», señaló. «Cuando no pueden hacer algo mediante programación, recurren a leer y reescribir archivos completos, lo cual es menos eficiente y más propenso a errores». La solución para los desarrolladores es crear herramientas de alcance limitado (como funciones específicas para calcular o mover entradas en archivos .ledger) para mantener a los agentes encaminados.
La degradación también aumenta a medida que los documentos se vuelven más grandes o se agregan más archivos que distraen al espacio de trabajo. Para los equipos empresariales que invierten mucho en generación de recuperación aumentada (RAG), estos documentos que distraen sirven como una advertencia directa del costo compuesto de un entorno desordenado. Si bien una ventana emergente ruidosa puede provocar una caída mínima del rendimiento del 1 % después de solo dos interacciones, esta degradación se agrava hasta una caída masiva del 2 al 8 % en una simulación larga.
«Para la comunidad de recuperación: los oleoductos RAG deben evaluarse en flujos de trabajo de múltiples etapas, no solo con criterios de recuperación de una sola ronda», dijo Laban. «Las mediciones de una sola vuelta subestiman sistemáticamente los daños de una recuperación imprecisa».
Verificación de la realidad para el negocio autónomo
Los resultados del benchmark DELEGATE-52 ofrecen una verificación crítica de la realidad del revuelo actual en torno a los agentes de IA totalmente autónomos.
El diseño de referencia también implica una restricción práctica: debido a que los modelos pueden mantener un registro limpio durante varias etapas antes de una falla catastrófica repentina, se requiere una revisión humana incremental, no una sola verificación final. Laban recomienda crear aplicaciones de IA en torno a tareas breves y transparentes en lugar de agentes complejos a largo plazo. Esto conserva la implicación de la acción sin que el escritor proporcione la prescripción.
Para las organizaciones que hoy buscan implementar de forma segura agentes autónomos, la metodología DELEGATE-52 proporciona un modelo práctico para probar canales de datos internos. Laban explicó que «… un equipo empresarial que desee adoptar este marco debe crear tres componentes: (a) un conjunto de tareas de edición reversibles representativas de sus flujos de trabajo, (b) un analizador que convierte sus documentos de dominio en una representación estructurada y (c) una función de similitud que compara dos representaciones analizadas. » Los equipos ni siquiera necesitan crear analizadores desde cero. El equipo de investigación de Microsoft reutilizó con éxito las bibliotecas de análisis existentes para 30 de los 52 dominios probados.
Laban es optimista sobre el ritmo de mejora. «El progreso es real y rápido. Si analizamos únicamente la familia GPT, los modelos pasan de obtener una puntuación inferior al 20% a alrededor del 70% en 18 meses», afirmó Laban. «Si esta trayectoria continúa, los modelos pronto podrán alcanzar puntuaciones saturadas en DELEGATE-52».
Sin embargo, Laban advirtió que DELEGATE-52 es intencionalmente pequeño en comparación con entornos empresariales masivos. Incluso si los modelos básicos inevitablemente dominan este punto de referencia, la larga e infinita cola de flujos de trabajo y datos empresariales únicos significa que las organizaciones seguirán necesitando invertir en herramientas personalizadas y específicas de dominio para garantizar la confiabilidad de sus agentes autónomos.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
A medida que los grandes modelos de lenguaje se vuelven más capaces, los usuarios se sienten tentados a delegar tareas de conocimiento donde los modelos procesan documentos en su nombre y proporcionan los resultados finales. Pero, ¿qué tan bien puede confiar en que el modelo se mantendrá fiel al contenido de sus documentos cuando tiene que revisarlos durante múltiples ciclos?
Un nuevo estudio realizado por investigadores de Microsoft muestra que los grandes modelos de lenguaje corrompen silenciosamente los documentos en los que trabajan introduciendo errores. Los investigadores desarrollaron un punto de referencia que simula flujos de trabajo autónomos de varios pasos en 52 dominios profesionales, utilizando un método que mide automáticamente el grado de degradación del contenido a lo largo del tiempo.
Sus hallazgos muestran que incluso los modelos de límites de primer nivel corrompen en promedio el 25% del contenido del documento al final de estos flujos de trabajo. Y proporcionar a los modelos herramientas de agentes o documentos de distracción realistas en realidad degrada su rendimiento.
Esto sirve como advertencia: aunque existe una presión creciente para automatizar el trabajo del conocimiento, los modelos lingüísticos actuales no son del todo fiables para estas tareas.
La mecánica del trabajo delegado
El estudio de Microsoft se centra en el «trabajo delegado», un paradigma emergente en el que los usuarios permiten a los LLM completar tareas de conocimiento en su nombre mediante el análisis y la edición de documentos.
Un ejemplo destacado de este paradigma es la codificación por vibración, en la que un usuario delega el desarrollo de software y la edición de código a una IA. Pero los flujos de trabajo delegados van mucho más allá de la programación y se extienden a otras áreas. En contabilidad, por ejemplo, un usuario puede proporcionar un libro de contabilidad denso y pedirle al modelo que divida el documento en archivos separados organizados por categorías de gastos específicas.
Dado que los usuarios pueden carecer del tiempo o la experiencia especializada para revisar manualmente cada cambio que implementa la IA, la delegación a menudo depende de la confianza. Los usuarios esperan que el modelo complete fielmente las tareas sin introducir errores no controlados, eliminaciones no autorizadas o alucinaciones en los documentos.
Para medir qué tan confiables pueden ser los sistemas de IA en flujos de trabajo delegados extensos e iterativos, los investigadores desarrollaron el punto de referencia DELEGATE-52. El punto de referencia se compone de 310 entornos de trabajo que cubren 52 campos profesionales diversos, incluida la contabilidad financiera, la ingeniería de software, la cristalografía y la notación musical.
Cada entorno de trabajo se basa en documentos de texto semilla reales que van desde 2000 a 5000 tokens. Además del documento inicial, los entornos incluyen de cinco a diez tareas de edición complejas y no triviales.
La puntuación de un proceso de edición complejo y de varios pasos normalmente requiere una costosa revisión humana. DELEGATE-52 soluciona este problema utilizando un método de simulación de «relé de ida y vuelta» que evalúa las respuestas sin requerir soluciones de referencia anotadas por humanos. El enfoque está inspirado en la técnica de retrotraducción utilizada en la evaluación de la traducción automática, donde se pide a un modelo de IA que traduzca un documento de un idioma a otro y viceversa para ver qué tan perfectamente reproduce la versión original.
Como resultado, cada tarea de edición en DELEGATE-52 está diseñada para ser completamente reversible, combinando una instrucción directa con su inversa precisa. Por ejemplo, una instrucción para dividir el libro mayor en archivos separados por categoría de gastos se combina con una instrucción para fusionar todos los archivos de categorías en un solo libro mayor.
En comentarios proporcionados a VentureBeat, Philippe Laban, investigador principal de Microsoft Research y coautor del artículo, aclaró que esto no es simplemente una prueba de si una IA puede presionar «deshacer». Dado que no se puede obligar a los trabajadores humanos a “olvidar” instantáneamente una tarea que acaban de completar, esta evaluación de ida y vuelta es particularmente adecuada para la IA. Al iniciar una nueva sesión de conversación, los investigadores obligan al modelo a intentar la tarea opuesta de forma completamente independiente.
Los modelos de sus experimentos «no saben si una tarea es un paso hacia adelante o hacia atrás y no conocen el diseño general del experimento», explicó Laban. «Simplemente intentan realizar cada tarea lo más minuciosamente posible, en cada paso del camino».
Estas tareas de ida y vuelta se encadenan en un relevo continuo para simular flujos de trabajo a largo plazo que abarcan 20 interacciones consecutivas. Para hacer que el entorno sea más realista, el punto de referencia introduce archivos distractores en el contexto de cada tarea. Estos contienen entre 8.000 y 12.000 fichas de documentos temáticos pero completamente irrelevantes. Las distracciones miden si la IA puede mantener el enfoque o si se confunde y extrae datos incorrectos.
Prueba de modelos de límites en el relé
Para comprender cómo las diferentes arquitecturas y escalas manejan el trabajo delegado, los investigadores probaron 19 modelos de lenguaje diferentes de OpenAI, Anthropic, Google, Mistral, xAI y Moonshot. El experimento principal sometió estos modelos a una simulación de 20 interacciones de edición consecutivas.
En todos los modelos combinados, los documentos sufrieron una degradación promedio del 50% al final de la simulación. Incluso los mejores modelos de frontera del experimento, en particular Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, corrompieron en promedio el 25% del contenido del documento.
De 52 campos profesionales, Python fue el único donde la mayoría de los modelos alcanzaron el estado «listo» con una puntuación del 98% o más. Las plantillas destacan en tareas programáticas, pero tienen dificultades con el lenguaje natural y áreas específicas como ficción, estados de resultados o recetas. El modelo superior, Gemini 3.1 Pro, fue calificado como listo para trabajo delegado en sólo 11 de 52 áreas.
Curiosamente, la corrupción no fue causada por la muerte de mil cortes donde los modelos acumulan lentamente pequeños errores. En cambio, alrededor del 80% de la degradación total es causada por fallas críticas raras pero masivas, que son interacciones únicas durante las cuales un modelo pierde repentinamente al menos el 10% del contenido del documento. Los modelos de límites no son necesariamente mejores para evitar pequeños errores. Simplemente posponen estos fracasos catastróficos para ciclos posteriores.
Otra observación importante es que cuando los modelos más débiles fallan, su degradación se debe principalmente a la eliminación de contenido. Sin embargo, cuando los modelos de límites fallan, corrompen activamente el contenido existente. El texto sigue ahí, pero ha sido sutilmente distorsionado o alucinado, lo que hace mucho más difícil para un supervisor humano detectar el error.
Curiosamente, darle a los modelos un arnés agente con herramientas genéricas para la ejecución de código y acceso de lectura/escritura a archivos en realidad degradó su rendimiento, agregando en promedio un 6% más de degradación. Laban explicó que el fracaso radica en confiar en herramientas genéricas en lugar de herramientas de dominio específico.
«Los modelos no tienen la capacidad de escribir programas eficientes sobre la marcha que puedan manipular archivos en varios dominios sin errores», señaló. «Cuando no pueden hacer algo mediante programación, recurren a leer y reescribir archivos completos, lo cual es menos eficiente y más propenso a errores». La solución para los desarrolladores es crear herramientas de alcance limitado (como funciones específicas para calcular o mover entradas en archivos .ledger) para mantener a los agentes encaminados.
La degradación también aumenta a medida que los documentos se vuelven más grandes o se agregan más archivos que distraen al espacio de trabajo. Para los equipos empresariales que invierten mucho en generación de recuperación aumentada (RAG), estos documentos que distraen sirven como una advertencia directa del costo compuesto de un entorno desordenado. Si bien una ventana emergente ruidosa puede provocar una caída mínima del rendimiento del 1 % después de solo dos interacciones, esta degradación se agrava hasta una caída masiva del 2 al 8 % en una simulación larga.
«Para la comunidad de recuperación: los oleoductos RAG deben evaluarse en flujos de trabajo de múltiples etapas, no solo con criterios de recuperación de una sola ronda», dijo Laban. «Las mediciones de una sola vuelta subestiman sistemáticamente los daños de una recuperación imprecisa».
Verificación de la realidad para el negocio autónomo
Los resultados del benchmark DELEGATE-52 ofrecen una verificación crítica de la realidad del revuelo actual en torno a los agentes de IA totalmente autónomos.
El diseño de referencia también implica una restricción práctica: debido a que los modelos pueden mantener un registro limpio durante varias etapas antes de una falla catastrófica repentina, se requiere una revisión humana incremental, no una sola verificación final. Laban recomienda crear aplicaciones de IA en torno a tareas breves y transparentes en lugar de agentes complejos a largo plazo. Esto conserva la implicación de la acción sin que el escritor proporcione la prescripción.
Para las organizaciones que hoy buscan implementar de forma segura agentes autónomos, la metodología DELEGATE-52 proporciona un modelo práctico para probar canales de datos internos. Laban explicó que «… un equipo empresarial que desee adoptar este marco debe crear tres componentes: (a) un conjunto de tareas de edición reversibles representativas de sus flujos de trabajo, (b) un analizador que convierte sus documentos de dominio en una representación estructurada y (c) una función de similitud que compara dos representaciones analizadas. » Los equipos ni siquiera necesitan crear analizadores desde cero. El equipo de investigación de Microsoft reutilizó con éxito las bibliotecas de análisis existentes para 30 de los 52 dominios probados.
Laban es optimista sobre el ritmo de mejora. «El progreso es real y rápido. Si analizamos únicamente la familia GPT, los modelos pasan de obtener una puntuación inferior al 20% a alrededor del 70% en 18 meses», afirmó Laban. «Si esta trayectoria continúa, los modelos pronto podrán alcanzar puntuaciones saturadas en DELEGATE-52».
Sin embargo, Laban advirtió que DELEGATE-52 es intencionalmente pequeño en comparación con entornos empresariales masivos. Incluso si los modelos básicos inevitablemente dominan este punto de referencia, la larga e infinita cola de flujos de trabajo y datos empresariales únicos significa que las organizaciones seguirán necesitando invertir en herramientas personalizadas y específicas de dominio para garantizar la confiabilidad de sus agentes autónomos.
A medida que los grandes modelos de lenguaje se vuelven más capaces, los usuarios se sienten tentados a delegar tareas de conocimiento donde los modelos procesan documentos en su nombre y proporcionan los resultados finales. Pero, ¿qué tan bien puede confiar en que el modelo se mantendrá fiel al contenido de sus documentos cuando tiene que revisarlos durante múltiples ciclos?
Un nuevo estudio realizado por investigadores de Microsoft muestra que los grandes modelos de lenguaje corrompen silenciosamente los documentos en los que trabajan introduciendo errores. Los investigadores desarrollaron un punto de referencia que simula flujos de trabajo autónomos de varios pasos en 52 dominios profesionales, utilizando un método que mide automáticamente el grado de degradación del contenido a lo largo del tiempo.
Sus hallazgos muestran que incluso los modelos de límites de primer nivel corrompen en promedio el 25% del contenido del documento al final de estos flujos de trabajo. Y proporcionar a los modelos herramientas de agentes o documentos de distracción realistas en realidad degrada su rendimiento.
Esto sirve como advertencia: aunque existe una presión creciente para automatizar el trabajo del conocimiento, los modelos lingüísticos actuales no son del todo fiables para estas tareas.
La mecánica del trabajo delegado
El estudio de Microsoft se centra en el «trabajo delegado», un paradigma emergente en el que los usuarios permiten a los LLM completar tareas de conocimiento en su nombre mediante el análisis y la edición de documentos.
Un ejemplo destacado de este paradigma es la codificación por vibración, en la que un usuario delega el desarrollo de software y la edición de código a una IA. Pero los flujos de trabajo delegados van mucho más allá de la programación y se extienden a otras áreas. En contabilidad, por ejemplo, un usuario puede proporcionar un libro de contabilidad denso y pedirle al modelo que divida el documento en archivos separados organizados por categorías de gastos específicas.
Dado que los usuarios pueden carecer del tiempo o la experiencia especializada para revisar manualmente cada cambio que implementa la IA, la delegación a menudo depende de la confianza. Los usuarios esperan que el modelo complete fielmente las tareas sin introducir errores no controlados, eliminaciones no autorizadas o alucinaciones en los documentos.
Para medir qué tan confiables pueden ser los sistemas de IA en flujos de trabajo delegados extensos e iterativos, los investigadores desarrollaron el punto de referencia DELEGATE-52. El punto de referencia se compone de 310 entornos de trabajo que cubren 52 campos profesionales diversos, incluida la contabilidad financiera, la ingeniería de software, la cristalografía y la notación musical.
Cada entorno de trabajo se basa en documentos de texto semilla reales que van desde 2000 a 5000 tokens. Además del documento inicial, los entornos incluyen de cinco a diez tareas de edición complejas y no triviales.
La puntuación de un proceso de edición complejo y de varios pasos normalmente requiere una costosa revisión humana. DELEGATE-52 soluciona este problema utilizando un método de simulación de «relé de ida y vuelta» que evalúa las respuestas sin requerir soluciones de referencia anotadas por humanos. El enfoque está inspirado en la técnica de retrotraducción utilizada en la evaluación de la traducción automática, donde se pide a un modelo de IA que traduzca un documento de un idioma a otro y viceversa para ver qué tan perfectamente reproduce la versión original.
Como resultado, cada tarea de edición en DELEGATE-52 está diseñada para ser completamente reversible, combinando una instrucción directa con su inversa precisa. Por ejemplo, una instrucción para dividir el libro mayor en archivos separados por categoría de gastos se combina con una instrucción para fusionar todos los archivos de categorías en un solo libro mayor.
En comentarios proporcionados a VentureBeat, Philippe Laban, investigador principal de Microsoft Research y coautor del artículo, aclaró que esto no es simplemente una prueba de si una IA puede presionar «deshacer». Dado que no se puede obligar a los trabajadores humanos a “olvidar” instantáneamente una tarea que acaban de completar, esta evaluación de ida y vuelta es particularmente adecuada para la IA. Al iniciar una nueva sesión de conversación, los investigadores obligan al modelo a intentar la tarea opuesta de forma completamente independiente.
Los modelos de sus experimentos «no saben si una tarea es un paso hacia adelante o hacia atrás y no conocen el diseño general del experimento», explicó Laban. «Simplemente intentan realizar cada tarea lo más minuciosamente posible, en cada paso del camino».
Estas tareas de ida y vuelta se encadenan en un relevo continuo para simular flujos de trabajo a largo plazo que abarcan 20 interacciones consecutivas. Para hacer que el entorno sea más realista, el punto de referencia introduce archivos distractores en el contexto de cada tarea. Estos contienen entre 8.000 y 12.000 fichas de documentos temáticos pero completamente irrelevantes. Las distracciones miden si la IA puede mantener el enfoque o si se confunde y extrae datos incorrectos.
Prueba de modelos de límites en el relé
Para comprender cómo las diferentes arquitecturas y escalas manejan el trabajo delegado, los investigadores probaron 19 modelos de lenguaje diferentes de OpenAI, Anthropic, Google, Mistral, xAI y Moonshot. El experimento principal sometió estos modelos a una simulación de 20 interacciones de edición consecutivas.
En todos los modelos combinados, los documentos sufrieron una degradación promedio del 50% al final de la simulación. Incluso los mejores modelos de frontera del experimento, en particular Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, corrompieron en promedio el 25% del contenido del documento.
De 52 campos profesionales, Python fue el único donde la mayoría de los modelos alcanzaron el estado «listo» con una puntuación del 98% o más. Las plantillas destacan en tareas programáticas, pero tienen dificultades con el lenguaje natural y áreas específicas como ficción, estados de resultados o recetas. El modelo superior, Gemini 3.1 Pro, fue calificado como listo para trabajo delegado en sólo 11 de 52 áreas.
Curiosamente, la corrupción no fue causada por la muerte de mil cortes donde los modelos acumulan lentamente pequeños errores. En cambio, alrededor del 80% de la degradación total es causada por fallas críticas raras pero masivas, que son interacciones únicas durante las cuales un modelo pierde repentinamente al menos el 10% del contenido del documento. Los modelos de límites no son necesariamente mejores para evitar pequeños errores. Simplemente posponen estos fracasos catastróficos para ciclos posteriores.
Otra observación importante es que cuando los modelos más débiles fallan, su degradación se debe principalmente a la eliminación de contenido. Sin embargo, cuando los modelos de límites fallan, corrompen activamente el contenido existente. El texto sigue ahí, pero ha sido sutilmente distorsionado o alucinado, lo que hace mucho más difícil para un supervisor humano detectar el error.
Curiosamente, darle a los modelos un arnés agente con herramientas genéricas para la ejecución de código y acceso de lectura/escritura a archivos en realidad degradó su rendimiento, agregando en promedio un 6% más de degradación. Laban explicó que el fracaso radica en confiar en herramientas genéricas en lugar de herramientas de dominio específico.
«Los modelos no tienen la capacidad de escribir programas eficientes sobre la marcha que puedan manipular archivos en varios dominios sin errores», señaló. «Cuando no pueden hacer algo mediante programación, recurren a leer y reescribir archivos completos, lo cual es menos eficiente y más propenso a errores». La solución para los desarrolladores es crear herramientas de alcance limitado (como funciones específicas para calcular o mover entradas en archivos .ledger) para mantener a los agentes encaminados.
La degradación también aumenta a medida que los documentos se vuelven más grandes o se agregan más archivos que distraen al espacio de trabajo. Para los equipos empresariales que invierten mucho en generación de recuperación aumentada (RAG), estos documentos que distraen sirven como una advertencia directa del costo compuesto de un entorno desordenado. Si bien una ventana emergente ruidosa puede provocar una caída mínima del rendimiento del 1 % después de solo dos interacciones, esta degradación se agrava hasta una caída masiva del 2 al 8 % en una simulación larga.
«Para la comunidad de recuperación: los oleoductos RAG deben evaluarse en flujos de trabajo de múltiples etapas, no solo con criterios de recuperación de una sola ronda», dijo Laban. «Las mediciones de una sola vuelta subestiman sistemáticamente los daños de una recuperación imprecisa».
Verificación de la realidad para el negocio autónomo
Los resultados del benchmark DELEGATE-52 ofrecen una verificación crítica de la realidad del revuelo actual en torno a los agentes de IA totalmente autónomos.
El diseño de referencia también implica una restricción práctica: debido a que los modelos pueden mantener un registro limpio durante varias etapas antes de una falla catastrófica repentina, se requiere una revisión humana incremental, no una sola verificación final. Laban recomienda crear aplicaciones de IA en torno a tareas breves y transparentes en lugar de agentes complejos a largo plazo. Esto conserva la implicación de la acción sin que el escritor proporcione la prescripción.
Para las organizaciones que hoy buscan implementar de forma segura agentes autónomos, la metodología DELEGATE-52 proporciona un modelo práctico para probar canales de datos internos. Laban explicó que «… un equipo empresarial que desee adoptar este marco debe crear tres componentes: (a) un conjunto de tareas de edición reversibles representativas de sus flujos de trabajo, (b) un analizador que convierte sus documentos de dominio en una representación estructurada y (c) una función de similitud que compara dos representaciones analizadas. » Los equipos ni siquiera necesitan crear analizadores desde cero. El equipo de investigación de Microsoft reutilizó con éxito las bibliotecas de análisis existentes para 30 de los 52 dominios probados.
Laban es optimista sobre el ritmo de mejora. «El progreso es real y rápido. Si analizamos únicamente la familia GPT, los modelos pasan de obtener una puntuación inferior al 20% a alrededor del 70% en 18 meses», afirmó Laban. «Si esta trayectoria continúa, los modelos pronto podrán alcanzar puntuaciones saturadas en DELEGATE-52».
Sin embargo, Laban advirtió que DELEGATE-52 es intencionalmente pequeño en comparación con entornos empresariales masivos. Incluso si los modelos básicos inevitablemente dominan este punto de referencia, la larga e infinita cola de flujos de trabajo y datos empresariales únicos significa que las organizaciones seguirán necesitando invertir en herramientas personalizadas y específicas de dominio para garantizar la confiabilidad de sus agentes autónomos.
A medida que los grandes modelos de lenguaje se vuelven más capaces, los usuarios se sienten tentados a delegar tareas de conocimiento donde los modelos procesan documentos en su nombre y proporcionan los resultados finales. Pero, ¿qué tan bien puede confiar en que el modelo se mantendrá fiel al contenido de sus documentos cuando tiene que revisarlos durante múltiples ciclos?
Un nuevo estudio realizado por investigadores de Microsoft muestra que los grandes modelos de lenguaje corrompen silenciosamente los documentos en los que trabajan introduciendo errores. Los investigadores desarrollaron un punto de referencia que simula flujos de trabajo autónomos de varios pasos en 52 dominios profesionales, utilizando un método que mide automáticamente el grado de degradación del contenido a lo largo del tiempo.
Sus hallazgos muestran que incluso los modelos de límites de primer nivel corrompen en promedio el 25% del contenido del documento al final de estos flujos de trabajo. Y proporcionar a los modelos herramientas de agentes o documentos de distracción realistas en realidad degrada su rendimiento.
Esto sirve como advertencia: aunque existe una presión creciente para automatizar el trabajo del conocimiento, los modelos lingüísticos actuales no son del todo fiables para estas tareas.
La mecánica del trabajo delegado
El estudio de Microsoft se centra en el «trabajo delegado», un paradigma emergente en el que los usuarios permiten a los LLM completar tareas de conocimiento en su nombre mediante el análisis y la edición de documentos.
Un ejemplo destacado de este paradigma es la codificación por vibración, en la que un usuario delega el desarrollo de software y la edición de código a una IA. Pero los flujos de trabajo delegados van mucho más allá de la programación y se extienden a otras áreas. En contabilidad, por ejemplo, un usuario puede proporcionar un libro de contabilidad denso y pedirle al modelo que divida el documento en archivos separados organizados por categorías de gastos específicas.
Dado que los usuarios pueden carecer del tiempo o la experiencia especializada para revisar manualmente cada cambio que implementa la IA, la delegación a menudo depende de la confianza. Los usuarios esperan que el modelo complete fielmente las tareas sin introducir errores no controlados, eliminaciones no autorizadas o alucinaciones en los documentos.
Para medir qué tan confiables pueden ser los sistemas de IA en flujos de trabajo delegados extensos e iterativos, los investigadores desarrollaron el punto de referencia DELEGATE-52. El punto de referencia se compone de 310 entornos de trabajo que cubren 52 campos profesionales diversos, incluida la contabilidad financiera, la ingeniería de software, la cristalografía y la notación musical.
Cada entorno de trabajo se basa en documentos de texto semilla reales que van desde 2000 a 5000 tokens. Además del documento inicial, los entornos incluyen de cinco a diez tareas de edición complejas y no triviales.
La puntuación de un proceso de edición complejo y de varios pasos normalmente requiere una costosa revisión humana. DELEGATE-52 soluciona este problema utilizando un método de simulación de «relé de ida y vuelta» que evalúa las respuestas sin requerir soluciones de referencia anotadas por humanos. El enfoque está inspirado en la técnica de retrotraducción utilizada en la evaluación de la traducción automática, donde se pide a un modelo de IA que traduzca un documento de un idioma a otro y viceversa para ver qué tan perfectamente reproduce la versión original.
Como resultado, cada tarea de edición en DELEGATE-52 está diseñada para ser completamente reversible, combinando una instrucción directa con su inversa precisa. Por ejemplo, una instrucción para dividir el libro mayor en archivos separados por categoría de gastos se combina con una instrucción para fusionar todos los archivos de categorías en un solo libro mayor.
En comentarios proporcionados a VentureBeat, Philippe Laban, investigador principal de Microsoft Research y coautor del artículo, aclaró que esto no es simplemente una prueba de si una IA puede presionar «deshacer». Dado que no se puede obligar a los trabajadores humanos a “olvidar” instantáneamente una tarea que acaban de completar, esta evaluación de ida y vuelta es particularmente adecuada para la IA. Al iniciar una nueva sesión de conversación, los investigadores obligan al modelo a intentar la tarea opuesta de forma completamente independiente.
Los modelos de sus experimentos «no saben si una tarea es un paso hacia adelante o hacia atrás y no conocen el diseño general del experimento», explicó Laban. «Simplemente intentan realizar cada tarea lo más minuciosamente posible, en cada paso del camino».
Estas tareas de ida y vuelta se encadenan en un relevo continuo para simular flujos de trabajo a largo plazo que abarcan 20 interacciones consecutivas. Para hacer que el entorno sea más realista, el punto de referencia introduce archivos distractores en el contexto de cada tarea. Estos contienen entre 8.000 y 12.000 fichas de documentos temáticos pero completamente irrelevantes. Las distracciones miden si la IA puede mantener el enfoque o si se confunde y extrae datos incorrectos.
Prueba de modelos de límites en el relé
Para comprender cómo las diferentes arquitecturas y escalas manejan el trabajo delegado, los investigadores probaron 19 modelos de lenguaje diferentes de OpenAI, Anthropic, Google, Mistral, xAI y Moonshot. El experimento principal sometió estos modelos a una simulación de 20 interacciones de edición consecutivas.
En todos los modelos combinados, los documentos sufrieron una degradación promedio del 50% al final de la simulación. Incluso los mejores modelos de frontera del experimento, en particular Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, corrompieron en promedio el 25% del contenido del documento.
De 52 campos profesionales, Python fue el único donde la mayoría de los modelos alcanzaron el estado «listo» con una puntuación del 98% o más. Las plantillas destacan en tareas programáticas, pero tienen dificultades con el lenguaje natural y áreas específicas como ficción, estados de resultados o recetas. El modelo superior, Gemini 3.1 Pro, fue calificado como listo para trabajo delegado en sólo 11 de 52 áreas.
Curiosamente, la corrupción no fue causada por la muerte de mil cortes donde los modelos acumulan lentamente pequeños errores. En cambio, alrededor del 80% de la degradación total es causada por fallas críticas raras pero masivas, que son interacciones únicas durante las cuales un modelo pierde repentinamente al menos el 10% del contenido del documento. Los modelos de límites no son necesariamente mejores para evitar pequeños errores. Simplemente posponen estos fracasos catastróficos para ciclos posteriores.
Otra observación importante es que cuando los modelos más débiles fallan, su degradación se debe principalmente a la eliminación de contenido. Sin embargo, cuando los modelos de límites fallan, corrompen activamente el contenido existente. El texto sigue ahí, pero ha sido sutilmente distorsionado o alucinado, lo que hace mucho más difícil para un supervisor humano detectar el error.
Curiosamente, darle a los modelos un arnés agente con herramientas genéricas para la ejecución de código y acceso de lectura/escritura a archivos en realidad degradó su rendimiento, agregando en promedio un 6% más de degradación. Laban explicó que el fracaso radica en confiar en herramientas genéricas en lugar de herramientas de dominio específico.
«Los modelos no tienen la capacidad de escribir programas eficientes sobre la marcha que puedan manipular archivos en varios dominios sin errores», señaló. «Cuando no pueden hacer algo mediante programación, recurren a leer y reescribir archivos completos, lo cual es menos eficiente y más propenso a errores». La solución para los desarrolladores es crear herramientas de alcance limitado (como funciones específicas para calcular o mover entradas en archivos .ledger) para mantener a los agentes encaminados.
La degradación también aumenta a medida que los documentos se vuelven más grandes o se agregan más archivos que distraen al espacio de trabajo. Para los equipos empresariales que invierten mucho en generación de recuperación aumentada (RAG), estos documentos que distraen sirven como una advertencia directa del costo compuesto de un entorno desordenado. Si bien una ventana emergente ruidosa puede provocar una caída mínima del rendimiento del 1 % después de solo dos interacciones, esta degradación se agrava hasta una caída masiva del 2 al 8 % en una simulación larga.
«Para la comunidad de recuperación: los oleoductos RAG deben evaluarse en flujos de trabajo de múltiples etapas, no solo con criterios de recuperación de una sola ronda», dijo Laban. «Las mediciones de una sola vuelta subestiman sistemáticamente los daños de una recuperación imprecisa».
Verificación de la realidad para el negocio autónomo
Los resultados del benchmark DELEGATE-52 ofrecen una verificación crítica de la realidad del revuelo actual en torno a los agentes de IA totalmente autónomos.
El diseño de referencia también implica una restricción práctica: debido a que los modelos pueden mantener un registro limpio durante varias etapas antes de una falla catastrófica repentina, se requiere una revisión humana incremental, no una sola verificación final. Laban recomienda crear aplicaciones de IA en torno a tareas breves y transparentes en lugar de agentes complejos a largo plazo. Esto conserva la implicación de la acción sin que el escritor proporcione la prescripción.
Para las organizaciones que hoy buscan implementar de forma segura agentes autónomos, la metodología DELEGATE-52 proporciona un modelo práctico para probar canales de datos internos. Laban explicó que «… un equipo empresarial que desee adoptar este marco debe crear tres componentes: (a) un conjunto de tareas de edición reversibles representativas de sus flujos de trabajo, (b) un analizador que convierte sus documentos de dominio en una representación estructurada y (c) una función de similitud que compara dos representaciones analizadas. » Los equipos ni siquiera necesitan crear analizadores desde cero. El equipo de investigación de Microsoft reutilizó con éxito las bibliotecas de análisis existentes para 30 de los 52 dominios probados.
Laban es optimista sobre el ritmo de mejora. «El progreso es real y rápido. Si analizamos únicamente la familia GPT, los modelos pasan de obtener una puntuación inferior al 20% a alrededor del 70% en 18 meses», afirmó Laban. «Si esta trayectoria continúa, los modelos pronto podrán alcanzar puntuaciones saturadas en DELEGATE-52».
Sin embargo, Laban advirtió que DELEGATE-52 es intencionalmente pequeño en comparación con entornos empresariales masivos. Incluso si los modelos básicos inevitablemente dominan este punto de referencia, la larga e infinita cola de flujos de trabajo y datos empresariales únicos significa que las organizaciones seguirán necesitando invertir en herramientas personalizadas y específicas de dominio para garantizar la confiabilidad de sus agentes autónomos.
A medida que los grandes modelos de lenguaje se vuelven más capaces, los usuarios se sienten tentados a delegar tareas de conocimiento donde los modelos procesan documentos en su nombre y proporcionan los resultados finales. Pero, ¿qué tan bien puede confiar en que el modelo se mantendrá fiel al contenido de sus documentos cuando tiene que revisarlos durante múltiples ciclos?
Un nuevo estudio realizado por investigadores de Microsoft muestra que los grandes modelos de lenguaje corrompen silenciosamente los documentos en los que trabajan introduciendo errores. Los investigadores desarrollaron un punto de referencia que simula flujos de trabajo autónomos de varios pasos en 52 dominios profesionales, utilizando un método que mide automáticamente el grado de degradación del contenido a lo largo del tiempo.
Sus hallazgos muestran que incluso los modelos de límites de primer nivel corrompen en promedio el 25% del contenido del documento al final de estos flujos de trabajo. Y proporcionar a los modelos herramientas de agentes o documentos de distracción realistas en realidad degrada su rendimiento.
Esto sirve como advertencia: aunque existe una presión creciente para automatizar el trabajo del conocimiento, los modelos lingüísticos actuales no son del todo fiables para estas tareas.
La mecánica del trabajo delegado
El estudio de Microsoft se centra en el «trabajo delegado», un paradigma emergente en el que los usuarios permiten a los LLM completar tareas de conocimiento en su nombre mediante el análisis y la edición de documentos.
Un ejemplo destacado de este paradigma es la codificación por vibración, en la que un usuario delega el desarrollo de software y la edición de código a una IA. Pero los flujos de trabajo delegados van mucho más allá de la programación y se extienden a otras áreas. En contabilidad, por ejemplo, un usuario puede proporcionar un libro de contabilidad denso y pedirle al modelo que divida el documento en archivos separados organizados por categorías de gastos específicas.
Dado que los usuarios pueden carecer del tiempo o la experiencia especializada para revisar manualmente cada cambio que implementa la IA, la delegación a menudo depende de la confianza. Los usuarios esperan que el modelo complete fielmente las tareas sin introducir errores no controlados, eliminaciones no autorizadas o alucinaciones en los documentos.
Para medir qué tan confiables pueden ser los sistemas de IA en flujos de trabajo delegados extensos e iterativos, los investigadores desarrollaron el punto de referencia DELEGATE-52. El punto de referencia se compone de 310 entornos de trabajo que cubren 52 campos profesionales diversos, incluida la contabilidad financiera, la ingeniería de software, la cristalografía y la notación musical.
Cada entorno de trabajo se basa en documentos de texto semilla reales que van desde 2000 a 5000 tokens. Además del documento inicial, los entornos incluyen de cinco a diez tareas de edición complejas y no triviales.
La puntuación de un proceso de edición complejo y de varios pasos normalmente requiere una costosa revisión humana. DELEGATE-52 soluciona este problema utilizando un método de simulación de «relé de ida y vuelta» que evalúa las respuestas sin requerir soluciones de referencia anotadas por humanos. El enfoque está inspirado en la técnica de retrotraducción utilizada en la evaluación de la traducción automática, donde se pide a un modelo de IA que traduzca un documento de un idioma a otro y viceversa para ver qué tan perfectamente reproduce la versión original.
Como resultado, cada tarea de edición en DELEGATE-52 está diseñada para ser completamente reversible, combinando una instrucción directa con su inversa precisa. Por ejemplo, una instrucción para dividir el libro mayor en archivos separados por categoría de gastos se combina con una instrucción para fusionar todos los archivos de categorías en un solo libro mayor.
En comentarios proporcionados a VentureBeat, Philippe Laban, investigador principal de Microsoft Research y coautor del artículo, aclaró que esto no es simplemente una prueba de si una IA puede presionar «deshacer». Dado que no se puede obligar a los trabajadores humanos a “olvidar” instantáneamente una tarea que acaban de completar, esta evaluación de ida y vuelta es particularmente adecuada para la IA. Al iniciar una nueva sesión de conversación, los investigadores obligan al modelo a intentar la tarea opuesta de forma completamente independiente.
Los modelos de sus experimentos «no saben si una tarea es un paso hacia adelante o hacia atrás y no conocen el diseño general del experimento», explicó Laban. «Simplemente intentan realizar cada tarea lo más minuciosamente posible, en cada paso del camino».
Estas tareas de ida y vuelta se encadenan en un relevo continuo para simular flujos de trabajo a largo plazo que abarcan 20 interacciones consecutivas. Para hacer que el entorno sea más realista, el punto de referencia introduce archivos distractores en el contexto de cada tarea. Estos contienen entre 8.000 y 12.000 fichas de documentos temáticos pero completamente irrelevantes. Las distracciones miden si la IA puede mantener el enfoque o si se confunde y extrae datos incorrectos.
Prueba de modelos de límites en el relé
Para comprender cómo las diferentes arquitecturas y escalas manejan el trabajo delegado, los investigadores probaron 19 modelos de lenguaje diferentes de OpenAI, Anthropic, Google, Mistral, xAI y Moonshot. El experimento principal sometió estos modelos a una simulación de 20 interacciones de edición consecutivas.
En todos los modelos combinados, los documentos sufrieron una degradación promedio del 50% al final de la simulación. Incluso los mejores modelos de frontera del experimento, en particular Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, corrompieron en promedio el 25% del contenido del documento.
De 52 campos profesionales, Python fue el único donde la mayoría de los modelos alcanzaron el estado «listo» con una puntuación del 98% o más. Las plantillas destacan en tareas programáticas, pero tienen dificultades con el lenguaje natural y áreas específicas como ficción, estados de resultados o recetas. El modelo superior, Gemini 3.1 Pro, fue calificado como listo para trabajo delegado en sólo 11 de 52 áreas.
Curiosamente, la corrupción no fue causada por la muerte de mil cortes donde los modelos acumulan lentamente pequeños errores. En cambio, alrededor del 80% de la degradación total es causada por fallas críticas raras pero masivas, que son interacciones únicas durante las cuales un modelo pierde repentinamente al menos el 10% del contenido del documento. Los modelos de límites no son necesariamente mejores para evitar pequeños errores. Simplemente posponen estos fracasos catastróficos para ciclos posteriores.
Otra observación importante es que cuando los modelos más débiles fallan, su degradación se debe principalmente a la eliminación de contenido. Sin embargo, cuando los modelos de límites fallan, corrompen activamente el contenido existente. El texto sigue ahí, pero ha sido sutilmente distorsionado o alucinado, lo que hace mucho más difícil para un supervisor humano detectar el error.
Curiosamente, darle a los modelos un arnés agente con herramientas genéricas para la ejecución de código y acceso de lectura/escritura a archivos en realidad degradó su rendimiento, agregando en promedio un 6% más de degradación. Laban explicó que el fracaso radica en confiar en herramientas genéricas en lugar de herramientas de dominio específico.
«Los modelos no tienen la capacidad de escribir programas eficientes sobre la marcha que puedan manipular archivos en varios dominios sin errores», señaló. «Cuando no pueden hacer algo mediante programación, recurren a leer y reescribir archivos completos, lo cual es menos eficiente y más propenso a errores». La solución para los desarrolladores es crear herramientas de alcance limitado (como funciones específicas para calcular o mover entradas en archivos .ledger) para mantener a los agentes encaminados.
La degradación también aumenta a medida que los documentos se vuelven más grandes o se agregan más archivos que distraen al espacio de trabajo. Para los equipos empresariales que invierten mucho en generación de recuperación aumentada (RAG), estos documentos que distraen sirven como una advertencia directa del costo compuesto de un entorno desordenado. Si bien una ventana emergente ruidosa puede provocar una caída mínima del rendimiento del 1 % después de solo dos interacciones, esta degradación se agrava hasta una caída masiva del 2 al 8 % en una simulación larga.
«Para la comunidad de recuperación: los oleoductos RAG deben evaluarse en flujos de trabajo de múltiples etapas, no solo con criterios de recuperación de una sola ronda», dijo Laban. «Las mediciones de una sola vuelta subestiman sistemáticamente los daños de una recuperación imprecisa».
Verificación de la realidad para el negocio autónomo
Los resultados del benchmark DELEGATE-52 ofrecen una verificación crítica de la realidad del revuelo actual en torno a los agentes de IA totalmente autónomos.
El diseño de referencia también implica una restricción práctica: debido a que los modelos pueden mantener un registro limpio durante varias etapas antes de una falla catastrófica repentina, se requiere una revisión humana incremental, no una sola verificación final. Laban recomienda crear aplicaciones de IA en torno a tareas breves y transparentes en lugar de agentes complejos a largo plazo. Esto conserva la implicación de la acción sin que el escritor proporcione la prescripción.
Para las organizaciones que hoy buscan implementar de forma segura agentes autónomos, la metodología DELEGATE-52 proporciona un modelo práctico para probar canales de datos internos. Laban explicó que «… un equipo empresarial que desee adoptar este marco debe crear tres componentes: (a) un conjunto de tareas de edición reversibles representativas de sus flujos de trabajo, (b) un analizador que convierte sus documentos de dominio en una representación estructurada y (c) una función de similitud que compara dos representaciones analizadas. » Los equipos ni siquiera necesitan crear analizadores desde cero. El equipo de investigación de Microsoft reutilizó con éxito las bibliotecas de análisis existentes para 30 de los 52 dominios probados.
Laban es optimista sobre el ritmo de mejora. «El progreso es real y rápido. Si analizamos únicamente la familia GPT, los modelos pasan de obtener una puntuación inferior al 20% a alrededor del 70% en 18 meses», afirmó Laban. «Si esta trayectoria continúa, los modelos pronto podrán alcanzar puntuaciones saturadas en DELEGATE-52».
Sin embargo, Laban advirtió que DELEGATE-52 es intencionalmente pequeño en comparación con entornos empresariales masivos. Incluso si los modelos básicos inevitablemente dominan este punto de referencia, la larga e infinita cola de flujos de trabajo y datos empresariales únicos significa que las organizaciones seguirán necesitando invertir en herramientas personalizadas y específicas de dominio para garantizar la confiabilidad de sus agentes autónomos.













































































