El equipo Qwen de Alibaba lanzó Qwen-AgentWorld el martes: dos modelos entrenados no para actuar dentro de entornos de agentes, sino para predecir lo que devuelven esos entornos. El lanzamiento cubre siete dominios bajo una única arquitectura: MCP, Búsqueda, Terminal, Ingeniería de software, Android, Web y SO.
El comunicado amplía el reciente impulso de Alibaba hacia los agentes autónomos. Qwen3.7-Maxlanzado en mayo, se construyó alrededor de una capacidad de ejecución autónoma de 35 horas.
Ese cambio apunta a un techo con el que se topan directamente los equipos que capacitan a los agentes a escala. Los motores de búsqueda reales muestran cualquier resultado que exista, sin ningún mecanismo para inyectar condiciones controladas. Los terminales activos no permiten inyectar una condición de poco espacio en disco bajo demanda. La capacitación de agentes está limitada por los entornos de producción que surgirán, sin una forma sistemática de exponer los casos extremos que los agentes necesitarán manejar pero que rara vez encuentran en la capacitación.
El equipo de investigación entrenó a agentes dentro del simulador resultante y encontró mejoras en el rendimiento que excedían lo que producía el entrenamiento en entornos reales por sí solo. En una prueba separada, el uso del entrenamiento del modelo mundial como calentamiento antes del ajuste agente mejoró el rendimiento en siete puntos de referencia, incluidos tres que el modelo nunca había visto durante el entrenamiento.
El documento que acompaña al lanzamiento identificó una brecha en la investigación anterior de agentes. «Sostenemos que el modelado mundial es una pieza crucial que falta en el camino hacia agentes generales».
Qwen-AgentWorld entrena sobre qué entornos regresan, no qué deben hacer los agentes
La mayoría de los modelos de agentes están entrenados para responder una pregunta: dado lo que me acaba de mostrar el entorno, ¿qué debo hacer a continuación? Qwen-AgentWorld está entrenado para responder lo inverso: dado lo que acaba de hacer el agente, ¿qué mostrará el entorno a continuación?
Esa inversión es el núcleo de lo que el artículo llama un modelo del mundo del lenguaje: en lugar de optimizar la selección de acciones, el modelo aprende a predecir el siguiente estado ambiental en los siete dominios bajo un único objetivo de entrenamiento. El trabajo anterior fue más limitado: Mundo Webun proyecto anterior de Qwen de febrero, cubría únicamente entornos web; Modelo del mundo del agente de Snowflakepublicado el mismo mes, genera entornos respaldados por SQL basados en código en lugar de entrenar un modelo para predecir estados. Qwen-AgentWorld es el primero en abarcar siete dominios en un solo modelo, con modelado de entorno integrado desde la primera etapa de preentrenamiento.
Alibaba entrenó ambos modelos en tres etapas en más de 10 millones de trayectorias de interacción con el entorno a partir de ejecuciones de agentes reales. La primera etapa le enseña al modelo cómo se comportan los entornos: sistemas de archivos, estados de terminales, cambios DOM del navegador, respuestas API. La segunda etapa entrena al modelo para razonar lo que viene a continuación antes de predecirlo. La tercera etapa, el aprendizaje por refuerzo, refuerza las predicciones mediante controles basados en reglas y puntuaciones de calidad abiertas.
Ambos modelos son diseños de una combinación de expertos: solo una fracción de los parámetros está activa por token. El modelo 35B activa 3B; el 397B activa 17B. Ambos admiten ventanas de contexto de 256K. Para dominios GUI (Android, Web y SO), los modelos funcionan a partir de árboles de accesibilidad textual y jerarquías de vistas de UI en lugar de capturas de pantalla.
Los pesos del modelo 35B y AgentWorldBench están disponibles en Apache 2.0; Los pesos del 397B no se hacen públicos.
Los resultados de la formación importan más que los puntos de referencia
Las puntuaciones de referencia muestran con qué precisión los modelos predicen qué entornos regresan. Los resultados del entrenamiento muestran lo que realmente vale esa capacidad de predicción para los agentes de formación de equipos, y esos son los números que más importan.
Según los investigadores, los agentes entrenados dentro de una simulación controlada superaron a los agentes entrenados en entornos reales. La inyección de perturbaciones específicas (respuestas parciales que obligan a los agentes a tomar medidas adicionales y los casos extremos en entornos reales rara vez surgen) empujó a MCPMark de 24,6 a 33,8. En Búsqueda, los agentes entrenados en mundos completamente ficticios se transfirieron a tareas de búsqueda reales, lo que impulsó el elemento WideSearch F1 de 34.02 a 50.31 en el modelo abierto 35B. Una prueba de calentamiento separada mostró que el preentrenamiento del modelo mundial mejoró BFCL v4 de 62,29 a 71,25 y Claw-Eval de 53,60 a 64,88 sin ningún ajuste específico del agente.
Los investigadores señalan el punto de referencia y el riesgo de sobreajuste
El artículo provocó una reacción inmediata de los investigadores de IA sobre X. Las preocupaciones que plantearon se relacionan con lo que los profesionales deben verificar antes de actuar sobre los hallazgos.
En cuanto al objetivo de la formación y el resultado de la transferencia, la evaluación de un investigador de AI/ML fue directa. «Todos los demás modelos de ‘agentes’ han sido entrenados para actuar en entornos», escribió @drawais_aique tiene un doctorado y analiza periódicamente artículos sobre IA. «Qwen invirtió la pregunta. Entrenaron el modelo para predecir el entorno mismo… Ese conocimiento predictivo luego se transfiere a las tareas del agente incluso sin ningún ajuste específico del agente». Identificó el resultado de Controllable Sim RL como «el recibo» de la afirmación de que el entrenamiento sintético puede sustituir el RL en entorno real a escala, y señaló que tres de los siete puntos de referencia de transferencia estaban completamente fuera de dominio.
El margen de referencia atrajo un escrutinio inmediato. «AgentWorldBench es un punto de referencia de Alibaba creado y publicado en el mismo periódico», escribió @TheSignal_Deskque se centra en opiniones honestas y cifras clave en la investigación de la IA. «Escribieron la prueba y luego la superaron en 0,46».
La metodología sim-RL es el resultado @limalemonnnque construye agentes de producción de inteligencia artificial, fue identificado como el que más necesita un escrutinio antes de que se cite el titular. «Los agentes entrenados en simulación tradicionalmente se adaptan demasiado a las peculiaridades del simulador», escribieron. «Si el modelo mundial es demasiado claro, el agente aprende el modelo, no la tarea». Señalaron la división del periódico como la sección que los profesionales deberían leer antes de actuar sobre los números.
La preocupación por el sobreajuste tiene una respuesta parcial en los datos. La brecha entre Sim RL no controlado (MCPMark 24.6) y Sim RL controlado (MCPMark 33.8) sugiere que las ganancias dependen sustancialmente del mecanismo de controlabilidad, no solo de la precisión de la simulación. El resultado de la búsqueda en un mundo ficticio, donde agentes entrenados en entornos inventados se transfieren a tareas de búsqueda reales, es la evidencia más sólida del artículo contra la preocupación por el sobreajuste.
Qué significa esto para los equipos que crean canales de agentes
Para los equipos de ingeniería de IA que crean y amplían canales de agentes, este trabajo marca un cambio significativo en la forma en que se construye la capacidad de los agentes. Los agentes de capacitación de Teams a escala ahora tienen una tercera opción entre RL en entorno real y puntos de referencia estáticos: simulación controlada que inyecta los casos extremos que la producción no emerge.
Los entornos sintéticos son una capa de entrenamiento legítima. La simulación controlada que inyecta condiciones que los entornos reales no producirán es un complemento de la RL en entornos reales, no un atajo.
Lo que un modelo aprende antes de que comience la capacitación de los agentes es más importante de lo que la mayoría de los canales tienen en cuenta. El hallazgo del calentamiento (mejoras de rendimiento a través de puntos de referencia invisibles sin capacitación específica del agente) sugiere que la conexión a tierra del entorno pertenece al desarrollo antes que la práctica actual.
El equipo Qwen de Alibaba lanzó Qwen-AgentWorld el martes: dos modelos entrenados no para actuar dentro de entornos de agentes, sino para predecir lo que devuelven esos entornos. El lanzamiento cubre siete dominios bajo una única arquitectura: MCP, Búsqueda, Terminal, Ingeniería de software, Android, Web y SO.
El comunicado amplía el reciente impulso de Alibaba hacia los agentes autónomos. Qwen3.7-Maxlanzado en mayo, se construyó alrededor de una capacidad de ejecución autónoma de 35 horas.
Ese cambio apunta a un techo con el que se topan directamente los equipos que capacitan a los agentes a escala. Los motores de búsqueda reales muestran cualquier resultado que exista, sin ningún mecanismo para inyectar condiciones controladas. Los terminales activos no permiten inyectar una condición de poco espacio en disco bajo demanda. La capacitación de agentes está limitada por los entornos de producción que surgirán, sin una forma sistemática de exponer los casos extremos que los agentes necesitarán manejar pero que rara vez encuentran en la capacitación.
El equipo de investigación entrenó a agentes dentro del simulador resultante y encontró mejoras en el rendimiento que excedían lo que producía el entrenamiento en entornos reales por sí solo. En una prueba separada, el uso del entrenamiento del modelo mundial como calentamiento antes del ajuste agente mejoró el rendimiento en siete puntos de referencia, incluidos tres que el modelo nunca había visto durante el entrenamiento.
El documento que acompaña al lanzamiento identificó una brecha en la investigación anterior de agentes. «Sostenemos que el modelado mundial es una pieza crucial que falta en el camino hacia agentes generales».
Qwen-AgentWorld entrena sobre qué entornos regresan, no qué deben hacer los agentes
La mayoría de los modelos de agentes están entrenados para responder una pregunta: dado lo que me acaba de mostrar el entorno, ¿qué debo hacer a continuación? Qwen-AgentWorld está entrenado para responder lo inverso: dado lo que acaba de hacer el agente, ¿qué mostrará el entorno a continuación?
Esa inversión es el núcleo de lo que el artículo llama un modelo del mundo del lenguaje: en lugar de optimizar la selección de acciones, el modelo aprende a predecir el siguiente estado ambiental en los siete dominios bajo un único objetivo de entrenamiento. El trabajo anterior fue más limitado: Mundo Webun proyecto anterior de Qwen de febrero, cubría únicamente entornos web; Modelo del mundo del agente de Snowflakepublicado el mismo mes, genera entornos respaldados por SQL basados en código en lugar de entrenar un modelo para predecir estados. Qwen-AgentWorld es el primero en abarcar siete dominios en un solo modelo, con modelado de entorno integrado desde la primera etapa de preentrenamiento.
Alibaba entrenó ambos modelos en tres etapas en más de 10 millones de trayectorias de interacción con el entorno a partir de ejecuciones de agentes reales. La primera etapa le enseña al modelo cómo se comportan los entornos: sistemas de archivos, estados de terminales, cambios DOM del navegador, respuestas API. La segunda etapa entrena al modelo para razonar lo que viene a continuación antes de predecirlo. La tercera etapa, el aprendizaje por refuerzo, refuerza las predicciones mediante controles basados en reglas y puntuaciones de calidad abiertas.
Ambos modelos son diseños de una combinación de expertos: solo una fracción de los parámetros está activa por token. El modelo 35B activa 3B; el 397B activa 17B. Ambos admiten ventanas de contexto de 256K. Para dominios GUI (Android, Web y SO), los modelos funcionan a partir de árboles de accesibilidad textual y jerarquías de vistas de UI en lugar de capturas de pantalla.
Los pesos del modelo 35B y AgentWorldBench están disponibles en Apache 2.0; Los pesos del 397B no se hacen públicos.
Los resultados de la formación importan más que los puntos de referencia
Las puntuaciones de referencia muestran con qué precisión los modelos predicen qué entornos regresan. Los resultados del entrenamiento muestran lo que realmente vale esa capacidad de predicción para los agentes de formación de equipos, y esos son los números que más importan.
Según los investigadores, los agentes entrenados dentro de una simulación controlada superaron a los agentes entrenados en entornos reales. La inyección de perturbaciones específicas (respuestas parciales que obligan a los agentes a tomar medidas adicionales y los casos extremos en entornos reales rara vez surgen) empujó a MCPMark de 24,6 a 33,8. En Búsqueda, los agentes entrenados en mundos completamente ficticios se transfirieron a tareas de búsqueda reales, lo que impulsó el elemento WideSearch F1 de 34.02 a 50.31 en el modelo abierto 35B. Una prueba de calentamiento separada mostró que el preentrenamiento del modelo mundial mejoró BFCL v4 de 62,29 a 71,25 y Claw-Eval de 53,60 a 64,88 sin ningún ajuste específico del agente.
Los investigadores señalan el punto de referencia y el riesgo de sobreajuste
El artículo provocó una reacción inmediata de los investigadores de IA sobre X. Las preocupaciones que plantearon se relacionan con lo que los profesionales deben verificar antes de actuar sobre los hallazgos.
En cuanto al objetivo de la formación y el resultado de la transferencia, la evaluación de un investigador de AI/ML fue directa. «Todos los demás modelos de ‘agentes’ han sido entrenados para actuar en entornos», escribió @drawais_aique tiene un doctorado y analiza periódicamente artículos sobre IA. «Qwen invirtió la pregunta. Entrenaron el modelo para predecir el entorno mismo… Ese conocimiento predictivo luego se transfiere a las tareas del agente incluso sin ningún ajuste específico del agente». Identificó el resultado de Controllable Sim RL como «el recibo» de la afirmación de que el entrenamiento sintético puede sustituir el RL en entorno real a escala, y señaló que tres de los siete puntos de referencia de transferencia estaban completamente fuera de dominio.
El margen de referencia atrajo un escrutinio inmediato. «AgentWorldBench es un punto de referencia de Alibaba creado y publicado en el mismo periódico», escribió @TheSignal_Deskque se centra en opiniones honestas y cifras clave en la investigación de la IA. «Escribieron la prueba y luego la superaron en 0,46».
La metodología sim-RL es el resultado @limalemonnnque construye agentes de producción de inteligencia artificial, fue identificado como el que más necesita un escrutinio antes de que se cite el titular. «Los agentes entrenados en simulación tradicionalmente se adaptan demasiado a las peculiaridades del simulador», escribieron. «Si el modelo mundial es demasiado claro, el agente aprende el modelo, no la tarea». Señalaron la división del periódico como la sección que los profesionales deberían leer antes de actuar sobre los números.
La preocupación por el sobreajuste tiene una respuesta parcial en los datos. La brecha entre Sim RL no controlado (MCPMark 24.6) y Sim RL controlado (MCPMark 33.8) sugiere que las ganancias dependen sustancialmente del mecanismo de controlabilidad, no solo de la precisión de la simulación. El resultado de la búsqueda en un mundo ficticio, donde agentes entrenados en entornos inventados se transfieren a tareas de búsqueda reales, es la evidencia más sólida del artículo contra la preocupación por el sobreajuste.
Qué significa esto para los equipos que crean canales de agentes
Para los equipos de ingeniería de IA que crean y amplían canales de agentes, este trabajo marca un cambio significativo en la forma en que se construye la capacidad de los agentes. Los agentes de capacitación de Teams a escala ahora tienen una tercera opción entre RL en entorno real y puntos de referencia estáticos: simulación controlada que inyecta los casos extremos que la producción no emerge.
Los entornos sintéticos son una capa de entrenamiento legítima. La simulación controlada que inyecta condiciones que los entornos reales no producirán es un complemento de la RL en entornos reales, no un atajo.
Lo que un modelo aprende antes de que comience la capacitación de los agentes es más importante de lo que la mayoría de los canales tienen en cuenta. El hallazgo del calentamiento (mejoras de rendimiento a través de puntos de referencia invisibles sin capacitación específica del agente) sugiere que la conexión a tierra del entorno pertenece al desarrollo antes que la práctica actual.
El equipo Qwen de Alibaba lanzó Qwen-AgentWorld el martes: dos modelos entrenados no para actuar dentro de entornos de agentes, sino para predecir lo que devuelven esos entornos. El lanzamiento cubre siete dominios bajo una única arquitectura: MCP, Búsqueda, Terminal, Ingeniería de software, Android, Web y SO.
El comunicado amplía el reciente impulso de Alibaba hacia los agentes autónomos. Qwen3.7-Maxlanzado en mayo, se construyó alrededor de una capacidad de ejecución autónoma de 35 horas.
Ese cambio apunta a un techo con el que se topan directamente los equipos que capacitan a los agentes a escala. Los motores de búsqueda reales muestran cualquier resultado que exista, sin ningún mecanismo para inyectar condiciones controladas. Los terminales activos no permiten inyectar una condición de poco espacio en disco bajo demanda. La capacitación de agentes está limitada por los entornos de producción que surgirán, sin una forma sistemática de exponer los casos extremos que los agentes necesitarán manejar pero que rara vez encuentran en la capacitación.
El equipo de investigación entrenó a agentes dentro del simulador resultante y encontró mejoras en el rendimiento que excedían lo que producía el entrenamiento en entornos reales por sí solo. En una prueba separada, el uso del entrenamiento del modelo mundial como calentamiento antes del ajuste agente mejoró el rendimiento en siete puntos de referencia, incluidos tres que el modelo nunca había visto durante el entrenamiento.
El documento que acompaña al lanzamiento identificó una brecha en la investigación anterior de agentes. «Sostenemos que el modelado mundial es una pieza crucial que falta en el camino hacia agentes generales».
Qwen-AgentWorld entrena sobre qué entornos regresan, no qué deben hacer los agentes
La mayoría de los modelos de agentes están entrenados para responder una pregunta: dado lo que me acaba de mostrar el entorno, ¿qué debo hacer a continuación? Qwen-AgentWorld está entrenado para responder lo inverso: dado lo que acaba de hacer el agente, ¿qué mostrará el entorno a continuación?
Esa inversión es el núcleo de lo que el artículo llama un modelo del mundo del lenguaje: en lugar de optimizar la selección de acciones, el modelo aprende a predecir el siguiente estado ambiental en los siete dominios bajo un único objetivo de entrenamiento. El trabajo anterior fue más limitado: Mundo Webun proyecto anterior de Qwen de febrero, cubría únicamente entornos web; Modelo del mundo del agente de Snowflakepublicado el mismo mes, genera entornos respaldados por SQL basados en código en lugar de entrenar un modelo para predecir estados. Qwen-AgentWorld es el primero en abarcar siete dominios en un solo modelo, con modelado de entorno integrado desde la primera etapa de preentrenamiento.
Alibaba entrenó ambos modelos en tres etapas en más de 10 millones de trayectorias de interacción con el entorno a partir de ejecuciones de agentes reales. La primera etapa le enseña al modelo cómo se comportan los entornos: sistemas de archivos, estados de terminales, cambios DOM del navegador, respuestas API. La segunda etapa entrena al modelo para razonar lo que viene a continuación antes de predecirlo. La tercera etapa, el aprendizaje por refuerzo, refuerza las predicciones mediante controles basados en reglas y puntuaciones de calidad abiertas.
Ambos modelos son diseños de una combinación de expertos: solo una fracción de los parámetros está activa por token. El modelo 35B activa 3B; el 397B activa 17B. Ambos admiten ventanas de contexto de 256K. Para dominios GUI (Android, Web y SO), los modelos funcionan a partir de árboles de accesibilidad textual y jerarquías de vistas de UI en lugar de capturas de pantalla.
Los pesos del modelo 35B y AgentWorldBench están disponibles en Apache 2.0; Los pesos del 397B no se hacen públicos.
Los resultados de la formación importan más que los puntos de referencia
Las puntuaciones de referencia muestran con qué precisión los modelos predicen qué entornos regresan. Los resultados del entrenamiento muestran lo que realmente vale esa capacidad de predicción para los agentes de formación de equipos, y esos son los números que más importan.
Según los investigadores, los agentes entrenados dentro de una simulación controlada superaron a los agentes entrenados en entornos reales. La inyección de perturbaciones específicas (respuestas parciales que obligan a los agentes a tomar medidas adicionales y los casos extremos en entornos reales rara vez surgen) empujó a MCPMark de 24,6 a 33,8. En Búsqueda, los agentes entrenados en mundos completamente ficticios se transfirieron a tareas de búsqueda reales, lo que impulsó el elemento WideSearch F1 de 34.02 a 50.31 en el modelo abierto 35B. Una prueba de calentamiento separada mostró que el preentrenamiento del modelo mundial mejoró BFCL v4 de 62,29 a 71,25 y Claw-Eval de 53,60 a 64,88 sin ningún ajuste específico del agente.
Los investigadores señalan el punto de referencia y el riesgo de sobreajuste
El artículo provocó una reacción inmediata de los investigadores de IA sobre X. Las preocupaciones que plantearon se relacionan con lo que los profesionales deben verificar antes de actuar sobre los hallazgos.
En cuanto al objetivo de la formación y el resultado de la transferencia, la evaluación de un investigador de AI/ML fue directa. «Todos los demás modelos de ‘agentes’ han sido entrenados para actuar en entornos», escribió @drawais_aique tiene un doctorado y analiza periódicamente artículos sobre IA. «Qwen invirtió la pregunta. Entrenaron el modelo para predecir el entorno mismo… Ese conocimiento predictivo luego se transfiere a las tareas del agente incluso sin ningún ajuste específico del agente». Identificó el resultado de Controllable Sim RL como «el recibo» de la afirmación de que el entrenamiento sintético puede sustituir el RL en entorno real a escala, y señaló que tres de los siete puntos de referencia de transferencia estaban completamente fuera de dominio.
El margen de referencia atrajo un escrutinio inmediato. «AgentWorldBench es un punto de referencia de Alibaba creado y publicado en el mismo periódico», escribió @TheSignal_Deskque se centra en opiniones honestas y cifras clave en la investigación de la IA. «Escribieron la prueba y luego la superaron en 0,46».
La metodología sim-RL es el resultado @limalemonnnque construye agentes de producción de inteligencia artificial, fue identificado como el que más necesita un escrutinio antes de que se cite el titular. «Los agentes entrenados en simulación tradicionalmente se adaptan demasiado a las peculiaridades del simulador», escribieron. «Si el modelo mundial es demasiado claro, el agente aprende el modelo, no la tarea». Señalaron la división del periódico como la sección que los profesionales deberían leer antes de actuar sobre los números.
La preocupación por el sobreajuste tiene una respuesta parcial en los datos. La brecha entre Sim RL no controlado (MCPMark 24.6) y Sim RL controlado (MCPMark 33.8) sugiere que las ganancias dependen sustancialmente del mecanismo de controlabilidad, no solo de la precisión de la simulación. El resultado de la búsqueda en un mundo ficticio, donde agentes entrenados en entornos inventados se transfieren a tareas de búsqueda reales, es la evidencia más sólida del artículo contra la preocupación por el sobreajuste.
Qué significa esto para los equipos que crean canales de agentes
Para los equipos de ingeniería de IA que crean y amplían canales de agentes, este trabajo marca un cambio significativo en la forma en que se construye la capacidad de los agentes. Los agentes de capacitación de Teams a escala ahora tienen una tercera opción entre RL en entorno real y puntos de referencia estáticos: simulación controlada que inyecta los casos extremos que la producción no emerge.
Los entornos sintéticos son una capa de entrenamiento legítima. La simulación controlada que inyecta condiciones que los entornos reales no producirán es un complemento de la RL en entornos reales, no un atajo.
Lo que un modelo aprende antes de que comience la capacitación de los agentes es más importante de lo que la mayoría de los canales tienen en cuenta. El hallazgo del calentamiento (mejoras de rendimiento a través de puntos de referencia invisibles sin capacitación específica del agente) sugiere que la conexión a tierra del entorno pertenece al desarrollo antes que la práctica actual.
El equipo Qwen de Alibaba lanzó Qwen-AgentWorld el martes: dos modelos entrenados no para actuar dentro de entornos de agentes, sino para predecir lo que devuelven esos entornos. El lanzamiento cubre siete dominios bajo una única arquitectura: MCP, Búsqueda, Terminal, Ingeniería de software, Android, Web y SO.
El comunicado amplía el reciente impulso de Alibaba hacia los agentes autónomos. Qwen3.7-Maxlanzado en mayo, se construyó alrededor de una capacidad de ejecución autónoma de 35 horas.
Ese cambio apunta a un techo con el que se topan directamente los equipos que capacitan a los agentes a escala. Los motores de búsqueda reales muestran cualquier resultado que exista, sin ningún mecanismo para inyectar condiciones controladas. Los terminales activos no permiten inyectar una condición de poco espacio en disco bajo demanda. La capacitación de agentes está limitada por los entornos de producción que surgirán, sin una forma sistemática de exponer los casos extremos que los agentes necesitarán manejar pero que rara vez encuentran en la capacitación.
El equipo de investigación entrenó a agentes dentro del simulador resultante y encontró mejoras en el rendimiento que excedían lo que producía el entrenamiento en entornos reales por sí solo. En una prueba separada, el uso del entrenamiento del modelo mundial como calentamiento antes del ajuste agente mejoró el rendimiento en siete puntos de referencia, incluidos tres que el modelo nunca había visto durante el entrenamiento.
El documento que acompaña al lanzamiento identificó una brecha en la investigación anterior de agentes. «Sostenemos que el modelado mundial es una pieza crucial que falta en el camino hacia agentes generales».
Qwen-AgentWorld entrena sobre qué entornos regresan, no qué deben hacer los agentes
La mayoría de los modelos de agentes están entrenados para responder una pregunta: dado lo que me acaba de mostrar el entorno, ¿qué debo hacer a continuación? Qwen-AgentWorld está entrenado para responder lo inverso: dado lo que acaba de hacer el agente, ¿qué mostrará el entorno a continuación?
Esa inversión es el núcleo de lo que el artículo llama un modelo del mundo del lenguaje: en lugar de optimizar la selección de acciones, el modelo aprende a predecir el siguiente estado ambiental en los siete dominios bajo un único objetivo de entrenamiento. El trabajo anterior fue más limitado: Mundo Webun proyecto anterior de Qwen de febrero, cubría únicamente entornos web; Modelo del mundo del agente de Snowflakepublicado el mismo mes, genera entornos respaldados por SQL basados en código en lugar de entrenar un modelo para predecir estados. Qwen-AgentWorld es el primero en abarcar siete dominios en un solo modelo, con modelado de entorno integrado desde la primera etapa de preentrenamiento.
Alibaba entrenó ambos modelos en tres etapas en más de 10 millones de trayectorias de interacción con el entorno a partir de ejecuciones de agentes reales. La primera etapa le enseña al modelo cómo se comportan los entornos: sistemas de archivos, estados de terminales, cambios DOM del navegador, respuestas API. La segunda etapa entrena al modelo para razonar lo que viene a continuación antes de predecirlo. La tercera etapa, el aprendizaje por refuerzo, refuerza las predicciones mediante controles basados en reglas y puntuaciones de calidad abiertas.
Ambos modelos son diseños de una combinación de expertos: solo una fracción de los parámetros está activa por token. El modelo 35B activa 3B; el 397B activa 17B. Ambos admiten ventanas de contexto de 256K. Para dominios GUI (Android, Web y SO), los modelos funcionan a partir de árboles de accesibilidad textual y jerarquías de vistas de UI en lugar de capturas de pantalla.
Los pesos del modelo 35B y AgentWorldBench están disponibles en Apache 2.0; Los pesos del 397B no se hacen públicos.
Los resultados de la formación importan más que los puntos de referencia
Las puntuaciones de referencia muestran con qué precisión los modelos predicen qué entornos regresan. Los resultados del entrenamiento muestran lo que realmente vale esa capacidad de predicción para los agentes de formación de equipos, y esos son los números que más importan.
Según los investigadores, los agentes entrenados dentro de una simulación controlada superaron a los agentes entrenados en entornos reales. La inyección de perturbaciones específicas (respuestas parciales que obligan a los agentes a tomar medidas adicionales y los casos extremos en entornos reales rara vez surgen) empujó a MCPMark de 24,6 a 33,8. En Búsqueda, los agentes entrenados en mundos completamente ficticios se transfirieron a tareas de búsqueda reales, lo que impulsó el elemento WideSearch F1 de 34.02 a 50.31 en el modelo abierto 35B. Una prueba de calentamiento separada mostró que el preentrenamiento del modelo mundial mejoró BFCL v4 de 62,29 a 71,25 y Claw-Eval de 53,60 a 64,88 sin ningún ajuste específico del agente.
Los investigadores señalan el punto de referencia y el riesgo de sobreajuste
El artículo provocó una reacción inmediata de los investigadores de IA sobre X. Las preocupaciones que plantearon se relacionan con lo que los profesionales deben verificar antes de actuar sobre los hallazgos.
En cuanto al objetivo de la formación y el resultado de la transferencia, la evaluación de un investigador de AI/ML fue directa. «Todos los demás modelos de ‘agentes’ han sido entrenados para actuar en entornos», escribió @drawais_aique tiene un doctorado y analiza periódicamente artículos sobre IA. «Qwen invirtió la pregunta. Entrenaron el modelo para predecir el entorno mismo… Ese conocimiento predictivo luego se transfiere a las tareas del agente incluso sin ningún ajuste específico del agente». Identificó el resultado de Controllable Sim RL como «el recibo» de la afirmación de que el entrenamiento sintético puede sustituir el RL en entorno real a escala, y señaló que tres de los siete puntos de referencia de transferencia estaban completamente fuera de dominio.
El margen de referencia atrajo un escrutinio inmediato. «AgentWorldBench es un punto de referencia de Alibaba creado y publicado en el mismo periódico», escribió @TheSignal_Deskque se centra en opiniones honestas y cifras clave en la investigación de la IA. «Escribieron la prueba y luego la superaron en 0,46».
La metodología sim-RL es el resultado @limalemonnnque construye agentes de producción de inteligencia artificial, fue identificado como el que más necesita un escrutinio antes de que se cite el titular. «Los agentes entrenados en simulación tradicionalmente se adaptan demasiado a las peculiaridades del simulador», escribieron. «Si el modelo mundial es demasiado claro, el agente aprende el modelo, no la tarea». Señalaron la división del periódico como la sección que los profesionales deberían leer antes de actuar sobre los números.
La preocupación por el sobreajuste tiene una respuesta parcial en los datos. La brecha entre Sim RL no controlado (MCPMark 24.6) y Sim RL controlado (MCPMark 33.8) sugiere que las ganancias dependen sustancialmente del mecanismo de controlabilidad, no solo de la precisión de la simulación. El resultado de la búsqueda en un mundo ficticio, donde agentes entrenados en entornos inventados se transfieren a tareas de búsqueda reales, es la evidencia más sólida del artículo contra la preocupación por el sobreajuste.
Qué significa esto para los equipos que crean canales de agentes
Para los equipos de ingeniería de IA que crean y amplían canales de agentes, este trabajo marca un cambio significativo en la forma en que se construye la capacidad de los agentes. Los agentes de capacitación de Teams a escala ahora tienen una tercera opción entre RL en entorno real y puntos de referencia estáticos: simulación controlada que inyecta los casos extremos que la producción no emerge.
Los entornos sintéticos son una capa de entrenamiento legítima. La simulación controlada que inyecta condiciones que los entornos reales no producirán es un complemento de la RL en entornos reales, no un atajo.
Lo que un modelo aprende antes de que comience la capacitación de los agentes es más importante de lo que la mayoría de los canales tienen en cuenta. El hallazgo del calentamiento (mejoras de rendimiento a través de puntos de referencia invisibles sin capacitación específica del agente) sugiere que la conexión a tierra del entorno pertenece al desarrollo antes que la práctica actual.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
El equipo Qwen de Alibaba lanzó Qwen-AgentWorld el martes: dos modelos entrenados no para actuar dentro de entornos de agentes, sino para predecir lo que devuelven esos entornos. El lanzamiento cubre siete dominios bajo una única arquitectura: MCP, Búsqueda, Terminal, Ingeniería de software, Android, Web y SO.
El comunicado amplía el reciente impulso de Alibaba hacia los agentes autónomos. Qwen3.7-Maxlanzado en mayo, se construyó alrededor de una capacidad de ejecución autónoma de 35 horas.
Ese cambio apunta a un techo con el que se topan directamente los equipos que capacitan a los agentes a escala. Los motores de búsqueda reales muestran cualquier resultado que exista, sin ningún mecanismo para inyectar condiciones controladas. Los terminales activos no permiten inyectar una condición de poco espacio en disco bajo demanda. La capacitación de agentes está limitada por los entornos de producción que surgirán, sin una forma sistemática de exponer los casos extremos que los agentes necesitarán manejar pero que rara vez encuentran en la capacitación.
El equipo de investigación entrenó a agentes dentro del simulador resultante y encontró mejoras en el rendimiento que excedían lo que producía el entrenamiento en entornos reales por sí solo. En una prueba separada, el uso del entrenamiento del modelo mundial como calentamiento antes del ajuste agente mejoró el rendimiento en siete puntos de referencia, incluidos tres que el modelo nunca había visto durante el entrenamiento.
El documento que acompaña al lanzamiento identificó una brecha en la investigación anterior de agentes. «Sostenemos que el modelado mundial es una pieza crucial que falta en el camino hacia agentes generales».
Qwen-AgentWorld entrena sobre qué entornos regresan, no qué deben hacer los agentes
La mayoría de los modelos de agentes están entrenados para responder una pregunta: dado lo que me acaba de mostrar el entorno, ¿qué debo hacer a continuación? Qwen-AgentWorld está entrenado para responder lo inverso: dado lo que acaba de hacer el agente, ¿qué mostrará el entorno a continuación?
Esa inversión es el núcleo de lo que el artículo llama un modelo del mundo del lenguaje: en lugar de optimizar la selección de acciones, el modelo aprende a predecir el siguiente estado ambiental en los siete dominios bajo un único objetivo de entrenamiento. El trabajo anterior fue más limitado: Mundo Webun proyecto anterior de Qwen de febrero, cubría únicamente entornos web; Modelo del mundo del agente de Snowflakepublicado el mismo mes, genera entornos respaldados por SQL basados en código en lugar de entrenar un modelo para predecir estados. Qwen-AgentWorld es el primero en abarcar siete dominios en un solo modelo, con modelado de entorno integrado desde la primera etapa de preentrenamiento.
Alibaba entrenó ambos modelos en tres etapas en más de 10 millones de trayectorias de interacción con el entorno a partir de ejecuciones de agentes reales. La primera etapa le enseña al modelo cómo se comportan los entornos: sistemas de archivos, estados de terminales, cambios DOM del navegador, respuestas API. La segunda etapa entrena al modelo para razonar lo que viene a continuación antes de predecirlo. La tercera etapa, el aprendizaje por refuerzo, refuerza las predicciones mediante controles basados en reglas y puntuaciones de calidad abiertas.
Ambos modelos son diseños de una combinación de expertos: solo una fracción de los parámetros está activa por token. El modelo 35B activa 3B; el 397B activa 17B. Ambos admiten ventanas de contexto de 256K. Para dominios GUI (Android, Web y SO), los modelos funcionan a partir de árboles de accesibilidad textual y jerarquías de vistas de UI en lugar de capturas de pantalla.
Los pesos del modelo 35B y AgentWorldBench están disponibles en Apache 2.0; Los pesos del 397B no se hacen públicos.
Los resultados de la formación importan más que los puntos de referencia
Las puntuaciones de referencia muestran con qué precisión los modelos predicen qué entornos regresan. Los resultados del entrenamiento muestran lo que realmente vale esa capacidad de predicción para los agentes de formación de equipos, y esos son los números que más importan.
Según los investigadores, los agentes entrenados dentro de una simulación controlada superaron a los agentes entrenados en entornos reales. La inyección de perturbaciones específicas (respuestas parciales que obligan a los agentes a tomar medidas adicionales y los casos extremos en entornos reales rara vez surgen) empujó a MCPMark de 24,6 a 33,8. En Búsqueda, los agentes entrenados en mundos completamente ficticios se transfirieron a tareas de búsqueda reales, lo que impulsó el elemento WideSearch F1 de 34.02 a 50.31 en el modelo abierto 35B. Una prueba de calentamiento separada mostró que el preentrenamiento del modelo mundial mejoró BFCL v4 de 62,29 a 71,25 y Claw-Eval de 53,60 a 64,88 sin ningún ajuste específico del agente.
Los investigadores señalan el punto de referencia y el riesgo de sobreajuste
El artículo provocó una reacción inmediata de los investigadores de IA sobre X. Las preocupaciones que plantearon se relacionan con lo que los profesionales deben verificar antes de actuar sobre los hallazgos.
En cuanto al objetivo de la formación y el resultado de la transferencia, la evaluación de un investigador de AI/ML fue directa. «Todos los demás modelos de ‘agentes’ han sido entrenados para actuar en entornos», escribió @drawais_aique tiene un doctorado y analiza periódicamente artículos sobre IA. «Qwen invirtió la pregunta. Entrenaron el modelo para predecir el entorno mismo… Ese conocimiento predictivo luego se transfiere a las tareas del agente incluso sin ningún ajuste específico del agente». Identificó el resultado de Controllable Sim RL como «el recibo» de la afirmación de que el entrenamiento sintético puede sustituir el RL en entorno real a escala, y señaló que tres de los siete puntos de referencia de transferencia estaban completamente fuera de dominio.
El margen de referencia atrajo un escrutinio inmediato. «AgentWorldBench es un punto de referencia de Alibaba creado y publicado en el mismo periódico», escribió @TheSignal_Deskque se centra en opiniones honestas y cifras clave en la investigación de la IA. «Escribieron la prueba y luego la superaron en 0,46».
La metodología sim-RL es el resultado @limalemonnnque construye agentes de producción de inteligencia artificial, fue identificado como el que más necesita un escrutinio antes de que se cite el titular. «Los agentes entrenados en simulación tradicionalmente se adaptan demasiado a las peculiaridades del simulador», escribieron. «Si el modelo mundial es demasiado claro, el agente aprende el modelo, no la tarea». Señalaron la división del periódico como la sección que los profesionales deberían leer antes de actuar sobre los números.
La preocupación por el sobreajuste tiene una respuesta parcial en los datos. La brecha entre Sim RL no controlado (MCPMark 24.6) y Sim RL controlado (MCPMark 33.8) sugiere que las ganancias dependen sustancialmente del mecanismo de controlabilidad, no solo de la precisión de la simulación. El resultado de la búsqueda en un mundo ficticio, donde agentes entrenados en entornos inventados se transfieren a tareas de búsqueda reales, es la evidencia más sólida del artículo contra la preocupación por el sobreajuste.
Qué significa esto para los equipos que crean canales de agentes
Para los equipos de ingeniería de IA que crean y amplían canales de agentes, este trabajo marca un cambio significativo en la forma en que se construye la capacidad de los agentes. Los agentes de capacitación de Teams a escala ahora tienen una tercera opción entre RL en entorno real y puntos de referencia estáticos: simulación controlada que inyecta los casos extremos que la producción no emerge.
Los entornos sintéticos son una capa de entrenamiento legítima. La simulación controlada que inyecta condiciones que los entornos reales no producirán es un complemento de la RL en entornos reales, no un atajo.
Lo que un modelo aprende antes de que comience la capacitación de los agentes es más importante de lo que la mayoría de los canales tienen en cuenta. El hallazgo del calentamiento (mejoras de rendimiento a través de puntos de referencia invisibles sin capacitación específica del agente) sugiere que la conexión a tierra del entorno pertenece al desarrollo antes que la práctica actual.
El equipo Qwen de Alibaba lanzó Qwen-AgentWorld el martes: dos modelos entrenados no para actuar dentro de entornos de agentes, sino para predecir lo que devuelven esos entornos. El lanzamiento cubre siete dominios bajo una única arquitectura: MCP, Búsqueda, Terminal, Ingeniería de software, Android, Web y SO.
El comunicado amplía el reciente impulso de Alibaba hacia los agentes autónomos. Qwen3.7-Maxlanzado en mayo, se construyó alrededor de una capacidad de ejecución autónoma de 35 horas.
Ese cambio apunta a un techo con el que se topan directamente los equipos que capacitan a los agentes a escala. Los motores de búsqueda reales muestran cualquier resultado que exista, sin ningún mecanismo para inyectar condiciones controladas. Los terminales activos no permiten inyectar una condición de poco espacio en disco bajo demanda. La capacitación de agentes está limitada por los entornos de producción que surgirán, sin una forma sistemática de exponer los casos extremos que los agentes necesitarán manejar pero que rara vez encuentran en la capacitación.
El equipo de investigación entrenó a agentes dentro del simulador resultante y encontró mejoras en el rendimiento que excedían lo que producía el entrenamiento en entornos reales por sí solo. En una prueba separada, el uso del entrenamiento del modelo mundial como calentamiento antes del ajuste agente mejoró el rendimiento en siete puntos de referencia, incluidos tres que el modelo nunca había visto durante el entrenamiento.
El documento que acompaña al lanzamiento identificó una brecha en la investigación anterior de agentes. «Sostenemos que el modelado mundial es una pieza crucial que falta en el camino hacia agentes generales».
Qwen-AgentWorld entrena sobre qué entornos regresan, no qué deben hacer los agentes
La mayoría de los modelos de agentes están entrenados para responder una pregunta: dado lo que me acaba de mostrar el entorno, ¿qué debo hacer a continuación? Qwen-AgentWorld está entrenado para responder lo inverso: dado lo que acaba de hacer el agente, ¿qué mostrará el entorno a continuación?
Esa inversión es el núcleo de lo que el artículo llama un modelo del mundo del lenguaje: en lugar de optimizar la selección de acciones, el modelo aprende a predecir el siguiente estado ambiental en los siete dominios bajo un único objetivo de entrenamiento. El trabajo anterior fue más limitado: Mundo Webun proyecto anterior de Qwen de febrero, cubría únicamente entornos web; Modelo del mundo del agente de Snowflakepublicado el mismo mes, genera entornos respaldados por SQL basados en código en lugar de entrenar un modelo para predecir estados. Qwen-AgentWorld es el primero en abarcar siete dominios en un solo modelo, con modelado de entorno integrado desde la primera etapa de preentrenamiento.
Alibaba entrenó ambos modelos en tres etapas en más de 10 millones de trayectorias de interacción con el entorno a partir de ejecuciones de agentes reales. La primera etapa le enseña al modelo cómo se comportan los entornos: sistemas de archivos, estados de terminales, cambios DOM del navegador, respuestas API. La segunda etapa entrena al modelo para razonar lo que viene a continuación antes de predecirlo. La tercera etapa, el aprendizaje por refuerzo, refuerza las predicciones mediante controles basados en reglas y puntuaciones de calidad abiertas.
Ambos modelos son diseños de una combinación de expertos: solo una fracción de los parámetros está activa por token. El modelo 35B activa 3B; el 397B activa 17B. Ambos admiten ventanas de contexto de 256K. Para dominios GUI (Android, Web y SO), los modelos funcionan a partir de árboles de accesibilidad textual y jerarquías de vistas de UI en lugar de capturas de pantalla.
Los pesos del modelo 35B y AgentWorldBench están disponibles en Apache 2.0; Los pesos del 397B no se hacen públicos.
Los resultados de la formación importan más que los puntos de referencia
Las puntuaciones de referencia muestran con qué precisión los modelos predicen qué entornos regresan. Los resultados del entrenamiento muestran lo que realmente vale esa capacidad de predicción para los agentes de formación de equipos, y esos son los números que más importan.
Según los investigadores, los agentes entrenados dentro de una simulación controlada superaron a los agentes entrenados en entornos reales. La inyección de perturbaciones específicas (respuestas parciales que obligan a los agentes a tomar medidas adicionales y los casos extremos en entornos reales rara vez surgen) empujó a MCPMark de 24,6 a 33,8. En Búsqueda, los agentes entrenados en mundos completamente ficticios se transfirieron a tareas de búsqueda reales, lo que impulsó el elemento WideSearch F1 de 34.02 a 50.31 en el modelo abierto 35B. Una prueba de calentamiento separada mostró que el preentrenamiento del modelo mundial mejoró BFCL v4 de 62,29 a 71,25 y Claw-Eval de 53,60 a 64,88 sin ningún ajuste específico del agente.
Los investigadores señalan el punto de referencia y el riesgo de sobreajuste
El artículo provocó una reacción inmediata de los investigadores de IA sobre X. Las preocupaciones que plantearon se relacionan con lo que los profesionales deben verificar antes de actuar sobre los hallazgos.
En cuanto al objetivo de la formación y el resultado de la transferencia, la evaluación de un investigador de AI/ML fue directa. «Todos los demás modelos de ‘agentes’ han sido entrenados para actuar en entornos», escribió @drawais_aique tiene un doctorado y analiza periódicamente artículos sobre IA. «Qwen invirtió la pregunta. Entrenaron el modelo para predecir el entorno mismo… Ese conocimiento predictivo luego se transfiere a las tareas del agente incluso sin ningún ajuste específico del agente». Identificó el resultado de Controllable Sim RL como «el recibo» de la afirmación de que el entrenamiento sintético puede sustituir el RL en entorno real a escala, y señaló que tres de los siete puntos de referencia de transferencia estaban completamente fuera de dominio.
El margen de referencia atrajo un escrutinio inmediato. «AgentWorldBench es un punto de referencia de Alibaba creado y publicado en el mismo periódico», escribió @TheSignal_Deskque se centra en opiniones honestas y cifras clave en la investigación de la IA. «Escribieron la prueba y luego la superaron en 0,46».
La metodología sim-RL es el resultado @limalemonnnque construye agentes de producción de inteligencia artificial, fue identificado como el que más necesita un escrutinio antes de que se cite el titular. «Los agentes entrenados en simulación tradicionalmente se adaptan demasiado a las peculiaridades del simulador», escribieron. «Si el modelo mundial es demasiado claro, el agente aprende el modelo, no la tarea». Señalaron la división del periódico como la sección que los profesionales deberían leer antes de actuar sobre los números.
La preocupación por el sobreajuste tiene una respuesta parcial en los datos. La brecha entre Sim RL no controlado (MCPMark 24.6) y Sim RL controlado (MCPMark 33.8) sugiere que las ganancias dependen sustancialmente del mecanismo de controlabilidad, no solo de la precisión de la simulación. El resultado de la búsqueda en un mundo ficticio, donde agentes entrenados en entornos inventados se transfieren a tareas de búsqueda reales, es la evidencia más sólida del artículo contra la preocupación por el sobreajuste.
Qué significa esto para los equipos que crean canales de agentes
Para los equipos de ingeniería de IA que crean y amplían canales de agentes, este trabajo marca un cambio significativo en la forma en que se construye la capacidad de los agentes. Los agentes de capacitación de Teams a escala ahora tienen una tercera opción entre RL en entorno real y puntos de referencia estáticos: simulación controlada que inyecta los casos extremos que la producción no emerge.
Los entornos sintéticos son una capa de entrenamiento legítima. La simulación controlada que inyecta condiciones que los entornos reales no producirán es un complemento de la RL en entornos reales, no un atajo.
Lo que un modelo aprende antes de que comience la capacitación de los agentes es más importante de lo que la mayoría de los canales tienen en cuenta. El hallazgo del calentamiento (mejoras de rendimiento a través de puntos de referencia invisibles sin capacitación específica del agente) sugiere que la conexión a tierra del entorno pertenece al desarrollo antes que la práctica actual.
El equipo Qwen de Alibaba lanzó Qwen-AgentWorld el martes: dos modelos entrenados no para actuar dentro de entornos de agentes, sino para predecir lo que devuelven esos entornos. El lanzamiento cubre siete dominios bajo una única arquitectura: MCP, Búsqueda, Terminal, Ingeniería de software, Android, Web y SO.
El comunicado amplía el reciente impulso de Alibaba hacia los agentes autónomos. Qwen3.7-Maxlanzado en mayo, se construyó alrededor de una capacidad de ejecución autónoma de 35 horas.
Ese cambio apunta a un techo con el que se topan directamente los equipos que capacitan a los agentes a escala. Los motores de búsqueda reales muestran cualquier resultado que exista, sin ningún mecanismo para inyectar condiciones controladas. Los terminales activos no permiten inyectar una condición de poco espacio en disco bajo demanda. La capacitación de agentes está limitada por los entornos de producción que surgirán, sin una forma sistemática de exponer los casos extremos que los agentes necesitarán manejar pero que rara vez encuentran en la capacitación.
El equipo de investigación entrenó a agentes dentro del simulador resultante y encontró mejoras en el rendimiento que excedían lo que producía el entrenamiento en entornos reales por sí solo. En una prueba separada, el uso del entrenamiento del modelo mundial como calentamiento antes del ajuste agente mejoró el rendimiento en siete puntos de referencia, incluidos tres que el modelo nunca había visto durante el entrenamiento.
El documento que acompaña al lanzamiento identificó una brecha en la investigación anterior de agentes. «Sostenemos que el modelado mundial es una pieza crucial que falta en el camino hacia agentes generales».
Qwen-AgentWorld entrena sobre qué entornos regresan, no qué deben hacer los agentes
La mayoría de los modelos de agentes están entrenados para responder una pregunta: dado lo que me acaba de mostrar el entorno, ¿qué debo hacer a continuación? Qwen-AgentWorld está entrenado para responder lo inverso: dado lo que acaba de hacer el agente, ¿qué mostrará el entorno a continuación?
Esa inversión es el núcleo de lo que el artículo llama un modelo del mundo del lenguaje: en lugar de optimizar la selección de acciones, el modelo aprende a predecir el siguiente estado ambiental en los siete dominios bajo un único objetivo de entrenamiento. El trabajo anterior fue más limitado: Mundo Webun proyecto anterior de Qwen de febrero, cubría únicamente entornos web; Modelo del mundo del agente de Snowflakepublicado el mismo mes, genera entornos respaldados por SQL basados en código en lugar de entrenar un modelo para predecir estados. Qwen-AgentWorld es el primero en abarcar siete dominios en un solo modelo, con modelado de entorno integrado desde la primera etapa de preentrenamiento.
Alibaba entrenó ambos modelos en tres etapas en más de 10 millones de trayectorias de interacción con el entorno a partir de ejecuciones de agentes reales. La primera etapa le enseña al modelo cómo se comportan los entornos: sistemas de archivos, estados de terminales, cambios DOM del navegador, respuestas API. La segunda etapa entrena al modelo para razonar lo que viene a continuación antes de predecirlo. La tercera etapa, el aprendizaje por refuerzo, refuerza las predicciones mediante controles basados en reglas y puntuaciones de calidad abiertas.
Ambos modelos son diseños de una combinación de expertos: solo una fracción de los parámetros está activa por token. El modelo 35B activa 3B; el 397B activa 17B. Ambos admiten ventanas de contexto de 256K. Para dominios GUI (Android, Web y SO), los modelos funcionan a partir de árboles de accesibilidad textual y jerarquías de vistas de UI en lugar de capturas de pantalla.
Los pesos del modelo 35B y AgentWorldBench están disponibles en Apache 2.0; Los pesos del 397B no se hacen públicos.
Los resultados de la formación importan más que los puntos de referencia
Las puntuaciones de referencia muestran con qué precisión los modelos predicen qué entornos regresan. Los resultados del entrenamiento muestran lo que realmente vale esa capacidad de predicción para los agentes de formación de equipos, y esos son los números que más importan.
Según los investigadores, los agentes entrenados dentro de una simulación controlada superaron a los agentes entrenados en entornos reales. La inyección de perturbaciones específicas (respuestas parciales que obligan a los agentes a tomar medidas adicionales y los casos extremos en entornos reales rara vez surgen) empujó a MCPMark de 24,6 a 33,8. En Búsqueda, los agentes entrenados en mundos completamente ficticios se transfirieron a tareas de búsqueda reales, lo que impulsó el elemento WideSearch F1 de 34.02 a 50.31 en el modelo abierto 35B. Una prueba de calentamiento separada mostró que el preentrenamiento del modelo mundial mejoró BFCL v4 de 62,29 a 71,25 y Claw-Eval de 53,60 a 64,88 sin ningún ajuste específico del agente.
Los investigadores señalan el punto de referencia y el riesgo de sobreajuste
El artículo provocó una reacción inmediata de los investigadores de IA sobre X. Las preocupaciones que plantearon se relacionan con lo que los profesionales deben verificar antes de actuar sobre los hallazgos.
En cuanto al objetivo de la formación y el resultado de la transferencia, la evaluación de un investigador de AI/ML fue directa. «Todos los demás modelos de ‘agentes’ han sido entrenados para actuar en entornos», escribió @drawais_aique tiene un doctorado y analiza periódicamente artículos sobre IA. «Qwen invirtió la pregunta. Entrenaron el modelo para predecir el entorno mismo… Ese conocimiento predictivo luego se transfiere a las tareas del agente incluso sin ningún ajuste específico del agente». Identificó el resultado de Controllable Sim RL como «el recibo» de la afirmación de que el entrenamiento sintético puede sustituir el RL en entorno real a escala, y señaló que tres de los siete puntos de referencia de transferencia estaban completamente fuera de dominio.
El margen de referencia atrajo un escrutinio inmediato. «AgentWorldBench es un punto de referencia de Alibaba creado y publicado en el mismo periódico», escribió @TheSignal_Deskque se centra en opiniones honestas y cifras clave en la investigación de la IA. «Escribieron la prueba y luego la superaron en 0,46».
La metodología sim-RL es el resultado @limalemonnnque construye agentes de producción de inteligencia artificial, fue identificado como el que más necesita un escrutinio antes de que se cite el titular. «Los agentes entrenados en simulación tradicionalmente se adaptan demasiado a las peculiaridades del simulador», escribieron. «Si el modelo mundial es demasiado claro, el agente aprende el modelo, no la tarea». Señalaron la división del periódico como la sección que los profesionales deberían leer antes de actuar sobre los números.
La preocupación por el sobreajuste tiene una respuesta parcial en los datos. La brecha entre Sim RL no controlado (MCPMark 24.6) y Sim RL controlado (MCPMark 33.8) sugiere que las ganancias dependen sustancialmente del mecanismo de controlabilidad, no solo de la precisión de la simulación. El resultado de la búsqueda en un mundo ficticio, donde agentes entrenados en entornos inventados se transfieren a tareas de búsqueda reales, es la evidencia más sólida del artículo contra la preocupación por el sobreajuste.
Qué significa esto para los equipos que crean canales de agentes
Para los equipos de ingeniería de IA que crean y amplían canales de agentes, este trabajo marca un cambio significativo en la forma en que se construye la capacidad de los agentes. Los agentes de capacitación de Teams a escala ahora tienen una tercera opción entre RL en entorno real y puntos de referencia estáticos: simulación controlada que inyecta los casos extremos que la producción no emerge.
Los entornos sintéticos son una capa de entrenamiento legítima. La simulación controlada que inyecta condiciones que los entornos reales no producirán es un complemento de la RL en entornos reales, no un atajo.
Lo que un modelo aprende antes de que comience la capacitación de los agentes es más importante de lo que la mayoría de los canales tienen en cuenta. El hallazgo del calentamiento (mejoras de rendimiento a través de puntos de referencia invisibles sin capacitación específica del agente) sugiere que la conexión a tierra del entorno pertenece al desarrollo antes que la práctica actual.
El equipo Qwen de Alibaba lanzó Qwen-AgentWorld el martes: dos modelos entrenados no para actuar dentro de entornos de agentes, sino para predecir lo que devuelven esos entornos. El lanzamiento cubre siete dominios bajo una única arquitectura: MCP, Búsqueda, Terminal, Ingeniería de software, Android, Web y SO.
El comunicado amplía el reciente impulso de Alibaba hacia los agentes autónomos. Qwen3.7-Maxlanzado en mayo, se construyó alrededor de una capacidad de ejecución autónoma de 35 horas.
Ese cambio apunta a un techo con el que se topan directamente los equipos que capacitan a los agentes a escala. Los motores de búsqueda reales muestran cualquier resultado que exista, sin ningún mecanismo para inyectar condiciones controladas. Los terminales activos no permiten inyectar una condición de poco espacio en disco bajo demanda. La capacitación de agentes está limitada por los entornos de producción que surgirán, sin una forma sistemática de exponer los casos extremos que los agentes necesitarán manejar pero que rara vez encuentran en la capacitación.
El equipo de investigación entrenó a agentes dentro del simulador resultante y encontró mejoras en el rendimiento que excedían lo que producía el entrenamiento en entornos reales por sí solo. En una prueba separada, el uso del entrenamiento del modelo mundial como calentamiento antes del ajuste agente mejoró el rendimiento en siete puntos de referencia, incluidos tres que el modelo nunca había visto durante el entrenamiento.
El documento que acompaña al lanzamiento identificó una brecha en la investigación anterior de agentes. «Sostenemos que el modelado mundial es una pieza crucial que falta en el camino hacia agentes generales».
Qwen-AgentWorld entrena sobre qué entornos regresan, no qué deben hacer los agentes
La mayoría de los modelos de agentes están entrenados para responder una pregunta: dado lo que me acaba de mostrar el entorno, ¿qué debo hacer a continuación? Qwen-AgentWorld está entrenado para responder lo inverso: dado lo que acaba de hacer el agente, ¿qué mostrará el entorno a continuación?
Esa inversión es el núcleo de lo que el artículo llama un modelo del mundo del lenguaje: en lugar de optimizar la selección de acciones, el modelo aprende a predecir el siguiente estado ambiental en los siete dominios bajo un único objetivo de entrenamiento. El trabajo anterior fue más limitado: Mundo Webun proyecto anterior de Qwen de febrero, cubría únicamente entornos web; Modelo del mundo del agente de Snowflakepublicado el mismo mes, genera entornos respaldados por SQL basados en código en lugar de entrenar un modelo para predecir estados. Qwen-AgentWorld es el primero en abarcar siete dominios en un solo modelo, con modelado de entorno integrado desde la primera etapa de preentrenamiento.
Alibaba entrenó ambos modelos en tres etapas en más de 10 millones de trayectorias de interacción con el entorno a partir de ejecuciones de agentes reales. La primera etapa le enseña al modelo cómo se comportan los entornos: sistemas de archivos, estados de terminales, cambios DOM del navegador, respuestas API. La segunda etapa entrena al modelo para razonar lo que viene a continuación antes de predecirlo. La tercera etapa, el aprendizaje por refuerzo, refuerza las predicciones mediante controles basados en reglas y puntuaciones de calidad abiertas.
Ambos modelos son diseños de una combinación de expertos: solo una fracción de los parámetros está activa por token. El modelo 35B activa 3B; el 397B activa 17B. Ambos admiten ventanas de contexto de 256K. Para dominios GUI (Android, Web y SO), los modelos funcionan a partir de árboles de accesibilidad textual y jerarquías de vistas de UI en lugar de capturas de pantalla.
Los pesos del modelo 35B y AgentWorldBench están disponibles en Apache 2.0; Los pesos del 397B no se hacen públicos.
Los resultados de la formación importan más que los puntos de referencia
Las puntuaciones de referencia muestran con qué precisión los modelos predicen qué entornos regresan. Los resultados del entrenamiento muestran lo que realmente vale esa capacidad de predicción para los agentes de formación de equipos, y esos son los números que más importan.
Según los investigadores, los agentes entrenados dentro de una simulación controlada superaron a los agentes entrenados en entornos reales. La inyección de perturbaciones específicas (respuestas parciales que obligan a los agentes a tomar medidas adicionales y los casos extremos en entornos reales rara vez surgen) empujó a MCPMark de 24,6 a 33,8. En Búsqueda, los agentes entrenados en mundos completamente ficticios se transfirieron a tareas de búsqueda reales, lo que impulsó el elemento WideSearch F1 de 34.02 a 50.31 en el modelo abierto 35B. Una prueba de calentamiento separada mostró que el preentrenamiento del modelo mundial mejoró BFCL v4 de 62,29 a 71,25 y Claw-Eval de 53,60 a 64,88 sin ningún ajuste específico del agente.
Los investigadores señalan el punto de referencia y el riesgo de sobreajuste
El artículo provocó una reacción inmediata de los investigadores de IA sobre X. Las preocupaciones que plantearon se relacionan con lo que los profesionales deben verificar antes de actuar sobre los hallazgos.
En cuanto al objetivo de la formación y el resultado de la transferencia, la evaluación de un investigador de AI/ML fue directa. «Todos los demás modelos de ‘agentes’ han sido entrenados para actuar en entornos», escribió @drawais_aique tiene un doctorado y analiza periódicamente artículos sobre IA. «Qwen invirtió la pregunta. Entrenaron el modelo para predecir el entorno mismo… Ese conocimiento predictivo luego se transfiere a las tareas del agente incluso sin ningún ajuste específico del agente». Identificó el resultado de Controllable Sim RL como «el recibo» de la afirmación de que el entrenamiento sintético puede sustituir el RL en entorno real a escala, y señaló que tres de los siete puntos de referencia de transferencia estaban completamente fuera de dominio.
El margen de referencia atrajo un escrutinio inmediato. «AgentWorldBench es un punto de referencia de Alibaba creado y publicado en el mismo periódico», escribió @TheSignal_Deskque se centra en opiniones honestas y cifras clave en la investigación de la IA. «Escribieron la prueba y luego la superaron en 0,46».
La metodología sim-RL es el resultado @limalemonnnque construye agentes de producción de inteligencia artificial, fue identificado como el que más necesita un escrutinio antes de que se cite el titular. «Los agentes entrenados en simulación tradicionalmente se adaptan demasiado a las peculiaridades del simulador», escribieron. «Si el modelo mundial es demasiado claro, el agente aprende el modelo, no la tarea». Señalaron la división del periódico como la sección que los profesionales deberían leer antes de actuar sobre los números.
La preocupación por el sobreajuste tiene una respuesta parcial en los datos. La brecha entre Sim RL no controlado (MCPMark 24.6) y Sim RL controlado (MCPMark 33.8) sugiere que las ganancias dependen sustancialmente del mecanismo de controlabilidad, no solo de la precisión de la simulación. El resultado de la búsqueda en un mundo ficticio, donde agentes entrenados en entornos inventados se transfieren a tareas de búsqueda reales, es la evidencia más sólida del artículo contra la preocupación por el sobreajuste.
Qué significa esto para los equipos que crean canales de agentes
Para los equipos de ingeniería de IA que crean y amplían canales de agentes, este trabajo marca un cambio significativo en la forma en que se construye la capacidad de los agentes. Los agentes de capacitación de Teams a escala ahora tienen una tercera opción entre RL en entorno real y puntos de referencia estáticos: simulación controlada que inyecta los casos extremos que la producción no emerge.
Los entornos sintéticos son una capa de entrenamiento legítima. La simulación controlada que inyecta condiciones que los entornos reales no producirán es un complemento de la RL en entornos reales, no un atajo.
Lo que un modelo aprende antes de que comience la capacitación de los agentes es más importante de lo que la mayoría de los canales tienen en cuenta. El hallazgo del calentamiento (mejoras de rendimiento a través de puntos de referencia invisibles sin capacitación específica del agente) sugiere que la conexión a tierra del entorno pertenece al desarrollo antes que la práctica actual.












































































