Uno de los desafíos clave para crear agentes de IA eficaces es enseñarles a elegir entre utilizar herramientas externas o confiar en su conocimiento interno. Pero los modelos de lenguaje grandes a menudo se entrenan para invocar herramientas a ciegas, lo que provoca cuellos de botella de latencia, costos API innecesarios y razonamiento degradado causado por el ruido ambiental.
Para superar este desafío, los investigadores de Alibaba introdujeron Optimización jerárquica de políticas desacopladas (HDPO), un marco de aprendizaje por refuerzo que capacita a los agentes para equilibrar la eficiencia de la ejecución y la precisión de las tareas.
Metis, un modelo multimodal que entrenaron utilizando este marco, reduce las invocaciones de herramientas redundantes del 98 % a solo el 2 % al tiempo que establece una nueva precisión de razonamiento de última generación en los puntos de referencia clave de la industria. Este marco ayuda a crear agentes de IA que no son fáciles de disparar y saben cuándo abstenerse de usar herramientas, lo que permite el desarrollo de sistemas de agentes receptivos y rentables.
El déficit metacognitivo
Los modelos agentes actuales se enfrentan a lo que los investigadores llaman un «profundo déficit metacognitivo». Los modelos tienen dificultades para decidir cuándo utilizar su conocimiento paramétrico interno versus cuándo consultar una utilidad externa. Como resultado, invocan ciegamente herramientas y API, como búsqueda web o ejecución de código, incluso cuando el mensaje del usuario ya contiene toda la información necesaria para resolver la tarea.
Este comportamiento de llamada de herramientas de activación fácil crea graves obstáculos operativos para las aplicaciones del mundo real. Debido a que los modelos están entrenados para centrarse casi por completo en la realización de tareas, son indiferentes a la latencia. Estos agentes frecuentemente alcanzan tarifas exorbitantes de llamadas de herramientas. Cada llamada API externa innecesaria introduce un cuello de botella en el procesamiento en serie, lo que convierte una IA técnicamente capaz en un sistema lento que frustra a los usuarios y consume presupuestos de herramientas.
Al mismo tiempo, quemar recursos computacionales mediante el uso excesivo de herramientas no se traduce en un mejor razonamiento. Las interacciones redundantes de herramientas inyectan ruido en el contexto del modelo. Este ruido puede distraer el modelo, descarrilar una cadena de razonamiento que de otro modo sería sólida y degradar activamente el resultado final.
Para abordar los problemas de latencia y costo de la invocación ciega de herramientas, los métodos de aprendizaje por refuerzo anteriores intentaron penalizar el uso excesivo de herramientas combinando la precisión de la tarea y la eficiencia de la ejecución en una señal de recompensa. Sin embargo, este diseño entrelazado crea un dilema de optimización sin solución. Si la penalización de la eficiencia es demasiado agresiva, el modelo se vuelve demasiado conservador y suprime el uso de herramientas esenciales, sacrificando la corrección en tareas arduas. Por el contrario, si la penalización es leve, la señal de optimización pierde su valor y no evita el uso excesivo de la herramienta en tareas más simples.
Además, esta recompensa compartida crea ambigüedad semántica, donde una trayectoria inexacta sin llamadas a herramientas podría generar la misma recompensa que una trayectoria precisa con un uso excesivo de herramientas. Debido a que las señales de entrenamiento para la precisión y la eficiencia se entrelazan, el modelo no puede aprender a controlar el uso de herramientas sin degradar sus capacidades básicas de razonamiento.
Optimización jerárquica de políticas desacopladas
Para resolver el dilema de optimización de las recompensas acopladas, los investigadores introdujeron HDPO. HDPO separa la precisión y la eficiencia en dos canales de optimización independientes. El canal de precisión se centra en maximizar la corrección de las tareas en todas las implementaciones del modelo. El canal de eficiencia optimiza la economía de ejecución.
HDPO calcula las señales de entrenamiento para estos dos canales de forma independiente y solo las combina en la etapa final del cálculo de pérdidas. La señal de eficiencia está condicionada al canal de precisión. Esto significa que una respuesta incorrecta nunca es recompensada simplemente por ser rápido o utilizar menos herramientas. Este desacoplamiento evita situaciones en las que los gradientes de precisión y eficiencia se anulan entre sí, proporcionando a la IA señales de aprendizaje claras para ambos objetivos.
La propiedad emergente más poderosa de este diseño desacoplado es que crea un currículo cognitivo implícito. Al principio del entrenamiento, cuando el modelo todavía tiene dificultades con la tarea, la optimización está dominada por el objetivo de precisión, lo que obliga al modelo a priorizar el aprendizaje del razonamiento y el conocimiento correctos. A medida que las capacidades de razonamiento del modelo maduran y llega consistentemente a las respuestas correctas, la señal de eficiencia aumenta suavemente. Este mecanismo hace que el modelo primero domine la resolución de tareas y solo luego refine su autosuficiencia evitando llamadas API costosas y redundantes.
Para complementar HDPO, los investigadores desarrollaron un régimen riguroso de curación de datos de varias etapas que aborda fallas graves encontradas en conjuntos de datos existentes ampliados con herramientas. Su proceso de curación de datos cubre etapas de ajuste supervisado (SFT) y aprendizaje por refuerzo (RL).
Para la fase SFT, obtuvieron datos de trayectorias multimodales aumentadas con herramientas disponibles públicamente y los filtraron para eliminar ejemplos de baja calidad que contenían fallas de ejecución o inconsistencias en la retroalimentación. También filtraron agresivamente cualquier muestra de entrenamiento que el modelo base pudiera resolver directamente sin herramientas. Finalmente, usando Google Géminis 3.1 Pro Como juez automatizado, filtraron el corpus SFT para conservar solo ejemplos que demostraran el uso de herramientas estratégicas.
Para la fase de RL, la selección se centró en garantizar una señal de optimización estable. Filtraron mensajes con imágenes corruptas o ambigüedad semántica. El algoritmo HDPO se basa en comparar respuestas correctas e incorrectas. Si una tarea es trivialmente fácil cuando el modelo siempre acierta, o prohibitivamente difícil cuando el modelo siempre falla, no hay una variación matemática significativa de la cual aprender. El equipo retuvo estrictamente solo indicaciones que mostraran una combinación no trivial de éxitos y fracasos para garantizar una señal de gradiente procesable.
Agente Metis: HDPO en acción
Para probar HDPO en acción, los investigadores utilizaron el marco para desarrollar Metis, un agente de razonamiento multimodal equipado con herramientas de codificación y búsqueda. Metis está construido sobre el modelo de visión y lenguaje Qwen3-VL-8B-Instruct. Los investigadores lo entrenaron en dos etapas distintas. Primero, aplicaron SFT utilizando sus datos seleccionados para proporcionar una inicialización en frío. A continuación, aplicaron RL utilizando el marco HDPO, exponiendo el modelo a interacciones de múltiples turnos donde podría invocar herramientas como la ejecución de código Python, búsqueda de texto y búsqueda de imágenes.
Los investigadores enfrentaron a Metis con modelos de visión estándar de código abierto como LLaVA-OneVision, razonadores de solo texto y modelos agentes de última generación, incluidos DeepEyes V2 y Skywork-R1V4 de 30 mil millones de parámetros. La evaluación abarcó dos áreas principales: percepción visual y comprensión de documentos de conjuntos de datos como HRBench y V*Bench, y tareas rigurosas de razonamiento matemático y lógico como WeMath y MathVista.
En todas las tareas, Metis logró un rendimiento de vanguardia o altamente competitivo, superando a los modelos agentes existentes, incluido el mucho más grande Skywork-R1V4 de 30 mil millones de parámetros, tanto en tareas de percepción visual como de razonamiento.
Igualmente importante es el comportamiento anecdótico que mostró Metis en los experimentos. Por ejemplo, cuando se les presenta la imagen de un letrero de un museo y se les pregunta qué dice el texto central, los modelos agentes estándar pierden el tiempo escribiendo scripts de Python a ciegas para recortar la imagen solo para leerla. Metis, sin embargo, reconoce que el texto es claramente legible en la imagen en bruto. Omite las herramientas por completo y utiliza una única pasada de inferencia.
En otro experimento, al modelo se le dio un gráfico complejo y se le pidió que identificara la segunda línea más alta en un punto de datos específico dentro de una pequeña subtrama. Metis reconoció que el análisis visual detallado excedía sus capacidades de resolución nativa y no podía distinguir con precisión las líneas superpuestas. En lugar de adivinar a partir de la imagen completa, invocó a Python para recortar y ampliar exclusivamente esa región de la trama secundaria específica, lo que le permitió identificar correctamente la línea. Trata el código como un instrumento de precisión que se implementa sólo cuando la evidencia visual es genuinamente ambigua, no como un recurso alternativo predeterminado.
Los investigadores publicaron Métis junto con el código para HDPO bajo la permisiva licencia Apache 2.0.
«Nuestros resultados demuestran que el uso de herramientas estratégicas y un sólido rendimiento de razonamiento no son una compensación; más bien, la eliminación de llamadas de herramientas ruidosas y redundantes contribuye directamente a una precisión superior», concluyen los investigadores. «En términos más generales, nuestro trabajo sugiere un cambio de paradigma en el aprendizaje aumentado con herramientas: de simplemente enseñar modelos a ejecutar herramientas a cultivar la sabiduría metacognitiva sobre cuándo abstenerse de ellas».
Uno de los desafíos clave para crear agentes de IA eficaces es enseñarles a elegir entre utilizar herramientas externas o confiar en su conocimiento interno. Pero los modelos de lenguaje grandes a menudo se entrenan para invocar herramientas a ciegas, lo que provoca cuellos de botella de latencia, costos API innecesarios y razonamiento degradado causado por el ruido ambiental.
Para superar este desafío, los investigadores de Alibaba introdujeron Optimización jerárquica de políticas desacopladas (HDPO), un marco de aprendizaje por refuerzo que capacita a los agentes para equilibrar la eficiencia de la ejecución y la precisión de las tareas.
Metis, un modelo multimodal que entrenaron utilizando este marco, reduce las invocaciones de herramientas redundantes del 98 % a solo el 2 % al tiempo que establece una nueva precisión de razonamiento de última generación en los puntos de referencia clave de la industria. Este marco ayuda a crear agentes de IA que no son fáciles de disparar y saben cuándo abstenerse de usar herramientas, lo que permite el desarrollo de sistemas de agentes receptivos y rentables.
El déficit metacognitivo
Los modelos agentes actuales se enfrentan a lo que los investigadores llaman un «profundo déficit metacognitivo». Los modelos tienen dificultades para decidir cuándo utilizar su conocimiento paramétrico interno versus cuándo consultar una utilidad externa. Como resultado, invocan ciegamente herramientas y API, como búsqueda web o ejecución de código, incluso cuando el mensaje del usuario ya contiene toda la información necesaria para resolver la tarea.
Este comportamiento de llamada de herramientas de activación fácil crea graves obstáculos operativos para las aplicaciones del mundo real. Debido a que los modelos están entrenados para centrarse casi por completo en la realización de tareas, son indiferentes a la latencia. Estos agentes frecuentemente alcanzan tarifas exorbitantes de llamadas de herramientas. Cada llamada API externa innecesaria introduce un cuello de botella en el procesamiento en serie, lo que convierte una IA técnicamente capaz en un sistema lento que frustra a los usuarios y consume presupuestos de herramientas.
Al mismo tiempo, quemar recursos computacionales mediante el uso excesivo de herramientas no se traduce en un mejor razonamiento. Las interacciones redundantes de herramientas inyectan ruido en el contexto del modelo. Este ruido puede distraer el modelo, descarrilar una cadena de razonamiento que de otro modo sería sólida y degradar activamente el resultado final.
Para abordar los problemas de latencia y costo de la invocación ciega de herramientas, los métodos de aprendizaje por refuerzo anteriores intentaron penalizar el uso excesivo de herramientas combinando la precisión de la tarea y la eficiencia de la ejecución en una señal de recompensa. Sin embargo, este diseño entrelazado crea un dilema de optimización sin solución. Si la penalización de la eficiencia es demasiado agresiva, el modelo se vuelve demasiado conservador y suprime el uso de herramientas esenciales, sacrificando la corrección en tareas arduas. Por el contrario, si la penalización es leve, la señal de optimización pierde su valor y no evita el uso excesivo de la herramienta en tareas más simples.
Además, esta recompensa compartida crea ambigüedad semántica, donde una trayectoria inexacta sin llamadas a herramientas podría generar la misma recompensa que una trayectoria precisa con un uso excesivo de herramientas. Debido a que las señales de entrenamiento para la precisión y la eficiencia se entrelazan, el modelo no puede aprender a controlar el uso de herramientas sin degradar sus capacidades básicas de razonamiento.
Optimización jerárquica de políticas desacopladas
Para resolver el dilema de optimización de las recompensas acopladas, los investigadores introdujeron HDPO. HDPO separa la precisión y la eficiencia en dos canales de optimización independientes. El canal de precisión se centra en maximizar la corrección de las tareas en todas las implementaciones del modelo. El canal de eficiencia optimiza la economía de ejecución.
HDPO calcula las señales de entrenamiento para estos dos canales de forma independiente y solo las combina en la etapa final del cálculo de pérdidas. La señal de eficiencia está condicionada al canal de precisión. Esto significa que una respuesta incorrecta nunca es recompensada simplemente por ser rápido o utilizar menos herramientas. Este desacoplamiento evita situaciones en las que los gradientes de precisión y eficiencia se anulan entre sí, proporcionando a la IA señales de aprendizaje claras para ambos objetivos.
La propiedad emergente más poderosa de este diseño desacoplado es que crea un currículo cognitivo implícito. Al principio del entrenamiento, cuando el modelo todavía tiene dificultades con la tarea, la optimización está dominada por el objetivo de precisión, lo que obliga al modelo a priorizar el aprendizaje del razonamiento y el conocimiento correctos. A medida que las capacidades de razonamiento del modelo maduran y llega consistentemente a las respuestas correctas, la señal de eficiencia aumenta suavemente. Este mecanismo hace que el modelo primero domine la resolución de tareas y solo luego refine su autosuficiencia evitando llamadas API costosas y redundantes.
Para complementar HDPO, los investigadores desarrollaron un régimen riguroso de curación de datos de varias etapas que aborda fallas graves encontradas en conjuntos de datos existentes ampliados con herramientas. Su proceso de curación de datos cubre etapas de ajuste supervisado (SFT) y aprendizaje por refuerzo (RL).
Para la fase SFT, obtuvieron datos de trayectorias multimodales aumentadas con herramientas disponibles públicamente y los filtraron para eliminar ejemplos de baja calidad que contenían fallas de ejecución o inconsistencias en la retroalimentación. También filtraron agresivamente cualquier muestra de entrenamiento que el modelo base pudiera resolver directamente sin herramientas. Finalmente, usando Google Géminis 3.1 Pro Como juez automatizado, filtraron el corpus SFT para conservar solo ejemplos que demostraran el uso de herramientas estratégicas.
Para la fase de RL, la selección se centró en garantizar una señal de optimización estable. Filtraron mensajes con imágenes corruptas o ambigüedad semántica. El algoritmo HDPO se basa en comparar respuestas correctas e incorrectas. Si una tarea es trivialmente fácil cuando el modelo siempre acierta, o prohibitivamente difícil cuando el modelo siempre falla, no hay una variación matemática significativa de la cual aprender. El equipo retuvo estrictamente solo indicaciones que mostraran una combinación no trivial de éxitos y fracasos para garantizar una señal de gradiente procesable.
Agente Metis: HDPO en acción
Para probar HDPO en acción, los investigadores utilizaron el marco para desarrollar Metis, un agente de razonamiento multimodal equipado con herramientas de codificación y búsqueda. Metis está construido sobre el modelo de visión y lenguaje Qwen3-VL-8B-Instruct. Los investigadores lo entrenaron en dos etapas distintas. Primero, aplicaron SFT utilizando sus datos seleccionados para proporcionar una inicialización en frío. A continuación, aplicaron RL utilizando el marco HDPO, exponiendo el modelo a interacciones de múltiples turnos donde podría invocar herramientas como la ejecución de código Python, búsqueda de texto y búsqueda de imágenes.
Los investigadores enfrentaron a Metis con modelos de visión estándar de código abierto como LLaVA-OneVision, razonadores de solo texto y modelos agentes de última generación, incluidos DeepEyes V2 y Skywork-R1V4 de 30 mil millones de parámetros. La evaluación abarcó dos áreas principales: percepción visual y comprensión de documentos de conjuntos de datos como HRBench y V*Bench, y tareas rigurosas de razonamiento matemático y lógico como WeMath y MathVista.
En todas las tareas, Metis logró un rendimiento de vanguardia o altamente competitivo, superando a los modelos agentes existentes, incluido el mucho más grande Skywork-R1V4 de 30 mil millones de parámetros, tanto en tareas de percepción visual como de razonamiento.
Igualmente importante es el comportamiento anecdótico que mostró Metis en los experimentos. Por ejemplo, cuando se les presenta la imagen de un letrero de un museo y se les pregunta qué dice el texto central, los modelos agentes estándar pierden el tiempo escribiendo scripts de Python a ciegas para recortar la imagen solo para leerla. Metis, sin embargo, reconoce que el texto es claramente legible en la imagen en bruto. Omite las herramientas por completo y utiliza una única pasada de inferencia.
En otro experimento, al modelo se le dio un gráfico complejo y se le pidió que identificara la segunda línea más alta en un punto de datos específico dentro de una pequeña subtrama. Metis reconoció que el análisis visual detallado excedía sus capacidades de resolución nativa y no podía distinguir con precisión las líneas superpuestas. En lugar de adivinar a partir de la imagen completa, invocó a Python para recortar y ampliar exclusivamente esa región de la trama secundaria específica, lo que le permitió identificar correctamente la línea. Trata el código como un instrumento de precisión que se implementa sólo cuando la evidencia visual es genuinamente ambigua, no como un recurso alternativo predeterminado.
Los investigadores publicaron Métis junto con el código para HDPO bajo la permisiva licencia Apache 2.0.
«Nuestros resultados demuestran que el uso de herramientas estratégicas y un sólido rendimiento de razonamiento no son una compensación; más bien, la eliminación de llamadas de herramientas ruidosas y redundantes contribuye directamente a una precisión superior», concluyen los investigadores. «En términos más generales, nuestro trabajo sugiere un cambio de paradigma en el aprendizaje aumentado con herramientas: de simplemente enseñar modelos a ejecutar herramientas a cultivar la sabiduría metacognitiva sobre cuándo abstenerse de ellas».
Uno de los desafíos clave para crear agentes de IA eficaces es enseñarles a elegir entre utilizar herramientas externas o confiar en su conocimiento interno. Pero los modelos de lenguaje grandes a menudo se entrenan para invocar herramientas a ciegas, lo que provoca cuellos de botella de latencia, costos API innecesarios y razonamiento degradado causado por el ruido ambiental.
Para superar este desafío, los investigadores de Alibaba introdujeron Optimización jerárquica de políticas desacopladas (HDPO), un marco de aprendizaje por refuerzo que capacita a los agentes para equilibrar la eficiencia de la ejecución y la precisión de las tareas.
Metis, un modelo multimodal que entrenaron utilizando este marco, reduce las invocaciones de herramientas redundantes del 98 % a solo el 2 % al tiempo que establece una nueva precisión de razonamiento de última generación en los puntos de referencia clave de la industria. Este marco ayuda a crear agentes de IA que no son fáciles de disparar y saben cuándo abstenerse de usar herramientas, lo que permite el desarrollo de sistemas de agentes receptivos y rentables.
El déficit metacognitivo
Los modelos agentes actuales se enfrentan a lo que los investigadores llaman un «profundo déficit metacognitivo». Los modelos tienen dificultades para decidir cuándo utilizar su conocimiento paramétrico interno versus cuándo consultar una utilidad externa. Como resultado, invocan ciegamente herramientas y API, como búsqueda web o ejecución de código, incluso cuando el mensaje del usuario ya contiene toda la información necesaria para resolver la tarea.
Este comportamiento de llamada de herramientas de activación fácil crea graves obstáculos operativos para las aplicaciones del mundo real. Debido a que los modelos están entrenados para centrarse casi por completo en la realización de tareas, son indiferentes a la latencia. Estos agentes frecuentemente alcanzan tarifas exorbitantes de llamadas de herramientas. Cada llamada API externa innecesaria introduce un cuello de botella en el procesamiento en serie, lo que convierte una IA técnicamente capaz en un sistema lento que frustra a los usuarios y consume presupuestos de herramientas.
Al mismo tiempo, quemar recursos computacionales mediante el uso excesivo de herramientas no se traduce en un mejor razonamiento. Las interacciones redundantes de herramientas inyectan ruido en el contexto del modelo. Este ruido puede distraer el modelo, descarrilar una cadena de razonamiento que de otro modo sería sólida y degradar activamente el resultado final.
Para abordar los problemas de latencia y costo de la invocación ciega de herramientas, los métodos de aprendizaje por refuerzo anteriores intentaron penalizar el uso excesivo de herramientas combinando la precisión de la tarea y la eficiencia de la ejecución en una señal de recompensa. Sin embargo, este diseño entrelazado crea un dilema de optimización sin solución. Si la penalización de la eficiencia es demasiado agresiva, el modelo se vuelve demasiado conservador y suprime el uso de herramientas esenciales, sacrificando la corrección en tareas arduas. Por el contrario, si la penalización es leve, la señal de optimización pierde su valor y no evita el uso excesivo de la herramienta en tareas más simples.
Además, esta recompensa compartida crea ambigüedad semántica, donde una trayectoria inexacta sin llamadas a herramientas podría generar la misma recompensa que una trayectoria precisa con un uso excesivo de herramientas. Debido a que las señales de entrenamiento para la precisión y la eficiencia se entrelazan, el modelo no puede aprender a controlar el uso de herramientas sin degradar sus capacidades básicas de razonamiento.
Optimización jerárquica de políticas desacopladas
Para resolver el dilema de optimización de las recompensas acopladas, los investigadores introdujeron HDPO. HDPO separa la precisión y la eficiencia en dos canales de optimización independientes. El canal de precisión se centra en maximizar la corrección de las tareas en todas las implementaciones del modelo. El canal de eficiencia optimiza la economía de ejecución.
HDPO calcula las señales de entrenamiento para estos dos canales de forma independiente y solo las combina en la etapa final del cálculo de pérdidas. La señal de eficiencia está condicionada al canal de precisión. Esto significa que una respuesta incorrecta nunca es recompensada simplemente por ser rápido o utilizar menos herramientas. Este desacoplamiento evita situaciones en las que los gradientes de precisión y eficiencia se anulan entre sí, proporcionando a la IA señales de aprendizaje claras para ambos objetivos.
La propiedad emergente más poderosa de este diseño desacoplado es que crea un currículo cognitivo implícito. Al principio del entrenamiento, cuando el modelo todavía tiene dificultades con la tarea, la optimización está dominada por el objetivo de precisión, lo que obliga al modelo a priorizar el aprendizaje del razonamiento y el conocimiento correctos. A medida que las capacidades de razonamiento del modelo maduran y llega consistentemente a las respuestas correctas, la señal de eficiencia aumenta suavemente. Este mecanismo hace que el modelo primero domine la resolución de tareas y solo luego refine su autosuficiencia evitando llamadas API costosas y redundantes.
Para complementar HDPO, los investigadores desarrollaron un régimen riguroso de curación de datos de varias etapas que aborda fallas graves encontradas en conjuntos de datos existentes ampliados con herramientas. Su proceso de curación de datos cubre etapas de ajuste supervisado (SFT) y aprendizaje por refuerzo (RL).
Para la fase SFT, obtuvieron datos de trayectorias multimodales aumentadas con herramientas disponibles públicamente y los filtraron para eliminar ejemplos de baja calidad que contenían fallas de ejecución o inconsistencias en la retroalimentación. También filtraron agresivamente cualquier muestra de entrenamiento que el modelo base pudiera resolver directamente sin herramientas. Finalmente, usando Google Géminis 3.1 Pro Como juez automatizado, filtraron el corpus SFT para conservar solo ejemplos que demostraran el uso de herramientas estratégicas.
Para la fase de RL, la selección se centró en garantizar una señal de optimización estable. Filtraron mensajes con imágenes corruptas o ambigüedad semántica. El algoritmo HDPO se basa en comparar respuestas correctas e incorrectas. Si una tarea es trivialmente fácil cuando el modelo siempre acierta, o prohibitivamente difícil cuando el modelo siempre falla, no hay una variación matemática significativa de la cual aprender. El equipo retuvo estrictamente solo indicaciones que mostraran una combinación no trivial de éxitos y fracasos para garantizar una señal de gradiente procesable.
Agente Metis: HDPO en acción
Para probar HDPO en acción, los investigadores utilizaron el marco para desarrollar Metis, un agente de razonamiento multimodal equipado con herramientas de codificación y búsqueda. Metis está construido sobre el modelo de visión y lenguaje Qwen3-VL-8B-Instruct. Los investigadores lo entrenaron en dos etapas distintas. Primero, aplicaron SFT utilizando sus datos seleccionados para proporcionar una inicialización en frío. A continuación, aplicaron RL utilizando el marco HDPO, exponiendo el modelo a interacciones de múltiples turnos donde podría invocar herramientas como la ejecución de código Python, búsqueda de texto y búsqueda de imágenes.
Los investigadores enfrentaron a Metis con modelos de visión estándar de código abierto como LLaVA-OneVision, razonadores de solo texto y modelos agentes de última generación, incluidos DeepEyes V2 y Skywork-R1V4 de 30 mil millones de parámetros. La evaluación abarcó dos áreas principales: percepción visual y comprensión de documentos de conjuntos de datos como HRBench y V*Bench, y tareas rigurosas de razonamiento matemático y lógico como WeMath y MathVista.
En todas las tareas, Metis logró un rendimiento de vanguardia o altamente competitivo, superando a los modelos agentes existentes, incluido el mucho más grande Skywork-R1V4 de 30 mil millones de parámetros, tanto en tareas de percepción visual como de razonamiento.
Igualmente importante es el comportamiento anecdótico que mostró Metis en los experimentos. Por ejemplo, cuando se les presenta la imagen de un letrero de un museo y se les pregunta qué dice el texto central, los modelos agentes estándar pierden el tiempo escribiendo scripts de Python a ciegas para recortar la imagen solo para leerla. Metis, sin embargo, reconoce que el texto es claramente legible en la imagen en bruto. Omite las herramientas por completo y utiliza una única pasada de inferencia.
En otro experimento, al modelo se le dio un gráfico complejo y se le pidió que identificara la segunda línea más alta en un punto de datos específico dentro de una pequeña subtrama. Metis reconoció que el análisis visual detallado excedía sus capacidades de resolución nativa y no podía distinguir con precisión las líneas superpuestas. En lugar de adivinar a partir de la imagen completa, invocó a Python para recortar y ampliar exclusivamente esa región de la trama secundaria específica, lo que le permitió identificar correctamente la línea. Trata el código como un instrumento de precisión que se implementa sólo cuando la evidencia visual es genuinamente ambigua, no como un recurso alternativo predeterminado.
Los investigadores publicaron Métis junto con el código para HDPO bajo la permisiva licencia Apache 2.0.
«Nuestros resultados demuestran que el uso de herramientas estratégicas y un sólido rendimiento de razonamiento no son una compensación; más bien, la eliminación de llamadas de herramientas ruidosas y redundantes contribuye directamente a una precisión superior», concluyen los investigadores. «En términos más generales, nuestro trabajo sugiere un cambio de paradigma en el aprendizaje aumentado con herramientas: de simplemente enseñar modelos a ejecutar herramientas a cultivar la sabiduría metacognitiva sobre cuándo abstenerse de ellas».
Uno de los desafíos clave para crear agentes de IA eficaces es enseñarles a elegir entre utilizar herramientas externas o confiar en su conocimiento interno. Pero los modelos de lenguaje grandes a menudo se entrenan para invocar herramientas a ciegas, lo que provoca cuellos de botella de latencia, costos API innecesarios y razonamiento degradado causado por el ruido ambiental.
Para superar este desafío, los investigadores de Alibaba introdujeron Optimización jerárquica de políticas desacopladas (HDPO), un marco de aprendizaje por refuerzo que capacita a los agentes para equilibrar la eficiencia de la ejecución y la precisión de las tareas.
Metis, un modelo multimodal que entrenaron utilizando este marco, reduce las invocaciones de herramientas redundantes del 98 % a solo el 2 % al tiempo que establece una nueva precisión de razonamiento de última generación en los puntos de referencia clave de la industria. Este marco ayuda a crear agentes de IA que no son fáciles de disparar y saben cuándo abstenerse de usar herramientas, lo que permite el desarrollo de sistemas de agentes receptivos y rentables.
El déficit metacognitivo
Los modelos agentes actuales se enfrentan a lo que los investigadores llaman un «profundo déficit metacognitivo». Los modelos tienen dificultades para decidir cuándo utilizar su conocimiento paramétrico interno versus cuándo consultar una utilidad externa. Como resultado, invocan ciegamente herramientas y API, como búsqueda web o ejecución de código, incluso cuando el mensaje del usuario ya contiene toda la información necesaria para resolver la tarea.
Este comportamiento de llamada de herramientas de activación fácil crea graves obstáculos operativos para las aplicaciones del mundo real. Debido a que los modelos están entrenados para centrarse casi por completo en la realización de tareas, son indiferentes a la latencia. Estos agentes frecuentemente alcanzan tarifas exorbitantes de llamadas de herramientas. Cada llamada API externa innecesaria introduce un cuello de botella en el procesamiento en serie, lo que convierte una IA técnicamente capaz en un sistema lento que frustra a los usuarios y consume presupuestos de herramientas.
Al mismo tiempo, quemar recursos computacionales mediante el uso excesivo de herramientas no se traduce en un mejor razonamiento. Las interacciones redundantes de herramientas inyectan ruido en el contexto del modelo. Este ruido puede distraer el modelo, descarrilar una cadena de razonamiento que de otro modo sería sólida y degradar activamente el resultado final.
Para abordar los problemas de latencia y costo de la invocación ciega de herramientas, los métodos de aprendizaje por refuerzo anteriores intentaron penalizar el uso excesivo de herramientas combinando la precisión de la tarea y la eficiencia de la ejecución en una señal de recompensa. Sin embargo, este diseño entrelazado crea un dilema de optimización sin solución. Si la penalización de la eficiencia es demasiado agresiva, el modelo se vuelve demasiado conservador y suprime el uso de herramientas esenciales, sacrificando la corrección en tareas arduas. Por el contrario, si la penalización es leve, la señal de optimización pierde su valor y no evita el uso excesivo de la herramienta en tareas más simples.
Además, esta recompensa compartida crea ambigüedad semántica, donde una trayectoria inexacta sin llamadas a herramientas podría generar la misma recompensa que una trayectoria precisa con un uso excesivo de herramientas. Debido a que las señales de entrenamiento para la precisión y la eficiencia se entrelazan, el modelo no puede aprender a controlar el uso de herramientas sin degradar sus capacidades básicas de razonamiento.
Optimización jerárquica de políticas desacopladas
Para resolver el dilema de optimización de las recompensas acopladas, los investigadores introdujeron HDPO. HDPO separa la precisión y la eficiencia en dos canales de optimización independientes. El canal de precisión se centra en maximizar la corrección de las tareas en todas las implementaciones del modelo. El canal de eficiencia optimiza la economía de ejecución.
HDPO calcula las señales de entrenamiento para estos dos canales de forma independiente y solo las combina en la etapa final del cálculo de pérdidas. La señal de eficiencia está condicionada al canal de precisión. Esto significa que una respuesta incorrecta nunca es recompensada simplemente por ser rápido o utilizar menos herramientas. Este desacoplamiento evita situaciones en las que los gradientes de precisión y eficiencia se anulan entre sí, proporcionando a la IA señales de aprendizaje claras para ambos objetivos.
La propiedad emergente más poderosa de este diseño desacoplado es que crea un currículo cognitivo implícito. Al principio del entrenamiento, cuando el modelo todavía tiene dificultades con la tarea, la optimización está dominada por el objetivo de precisión, lo que obliga al modelo a priorizar el aprendizaje del razonamiento y el conocimiento correctos. A medida que las capacidades de razonamiento del modelo maduran y llega consistentemente a las respuestas correctas, la señal de eficiencia aumenta suavemente. Este mecanismo hace que el modelo primero domine la resolución de tareas y solo luego refine su autosuficiencia evitando llamadas API costosas y redundantes.
Para complementar HDPO, los investigadores desarrollaron un régimen riguroso de curación de datos de varias etapas que aborda fallas graves encontradas en conjuntos de datos existentes ampliados con herramientas. Su proceso de curación de datos cubre etapas de ajuste supervisado (SFT) y aprendizaje por refuerzo (RL).
Para la fase SFT, obtuvieron datos de trayectorias multimodales aumentadas con herramientas disponibles públicamente y los filtraron para eliminar ejemplos de baja calidad que contenían fallas de ejecución o inconsistencias en la retroalimentación. También filtraron agresivamente cualquier muestra de entrenamiento que el modelo base pudiera resolver directamente sin herramientas. Finalmente, usando Google Géminis 3.1 Pro Como juez automatizado, filtraron el corpus SFT para conservar solo ejemplos que demostraran el uso de herramientas estratégicas.
Para la fase de RL, la selección se centró en garantizar una señal de optimización estable. Filtraron mensajes con imágenes corruptas o ambigüedad semántica. El algoritmo HDPO se basa en comparar respuestas correctas e incorrectas. Si una tarea es trivialmente fácil cuando el modelo siempre acierta, o prohibitivamente difícil cuando el modelo siempre falla, no hay una variación matemática significativa de la cual aprender. El equipo retuvo estrictamente solo indicaciones que mostraran una combinación no trivial de éxitos y fracasos para garantizar una señal de gradiente procesable.
Agente Metis: HDPO en acción
Para probar HDPO en acción, los investigadores utilizaron el marco para desarrollar Metis, un agente de razonamiento multimodal equipado con herramientas de codificación y búsqueda. Metis está construido sobre el modelo de visión y lenguaje Qwen3-VL-8B-Instruct. Los investigadores lo entrenaron en dos etapas distintas. Primero, aplicaron SFT utilizando sus datos seleccionados para proporcionar una inicialización en frío. A continuación, aplicaron RL utilizando el marco HDPO, exponiendo el modelo a interacciones de múltiples turnos donde podría invocar herramientas como la ejecución de código Python, búsqueda de texto y búsqueda de imágenes.
Los investigadores enfrentaron a Metis con modelos de visión estándar de código abierto como LLaVA-OneVision, razonadores de solo texto y modelos agentes de última generación, incluidos DeepEyes V2 y Skywork-R1V4 de 30 mil millones de parámetros. La evaluación abarcó dos áreas principales: percepción visual y comprensión de documentos de conjuntos de datos como HRBench y V*Bench, y tareas rigurosas de razonamiento matemático y lógico como WeMath y MathVista.
En todas las tareas, Metis logró un rendimiento de vanguardia o altamente competitivo, superando a los modelos agentes existentes, incluido el mucho más grande Skywork-R1V4 de 30 mil millones de parámetros, tanto en tareas de percepción visual como de razonamiento.
Igualmente importante es el comportamiento anecdótico que mostró Metis en los experimentos. Por ejemplo, cuando se les presenta la imagen de un letrero de un museo y se les pregunta qué dice el texto central, los modelos agentes estándar pierden el tiempo escribiendo scripts de Python a ciegas para recortar la imagen solo para leerla. Metis, sin embargo, reconoce que el texto es claramente legible en la imagen en bruto. Omite las herramientas por completo y utiliza una única pasada de inferencia.
En otro experimento, al modelo se le dio un gráfico complejo y se le pidió que identificara la segunda línea más alta en un punto de datos específico dentro de una pequeña subtrama. Metis reconoció que el análisis visual detallado excedía sus capacidades de resolución nativa y no podía distinguir con precisión las líneas superpuestas. En lugar de adivinar a partir de la imagen completa, invocó a Python para recortar y ampliar exclusivamente esa región de la trama secundaria específica, lo que le permitió identificar correctamente la línea. Trata el código como un instrumento de precisión que se implementa sólo cuando la evidencia visual es genuinamente ambigua, no como un recurso alternativo predeterminado.
Los investigadores publicaron Métis junto con el código para HDPO bajo la permisiva licencia Apache 2.0.
«Nuestros resultados demuestran que el uso de herramientas estratégicas y un sólido rendimiento de razonamiento no son una compensación; más bien, la eliminación de llamadas de herramientas ruidosas y redundantes contribuye directamente a una precisión superior», concluyen los investigadores. «En términos más generales, nuestro trabajo sugiere un cambio de paradigma en el aprendizaje aumentado con herramientas: de simplemente enseñar modelos a ejecutar herramientas a cultivar la sabiduría metacognitiva sobre cuándo abstenerse de ellas».
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Uno de los desafíos clave para crear agentes de IA eficaces es enseñarles a elegir entre utilizar herramientas externas o confiar en su conocimiento interno. Pero los modelos de lenguaje grandes a menudo se entrenan para invocar herramientas a ciegas, lo que provoca cuellos de botella de latencia, costos API innecesarios y razonamiento degradado causado por el ruido ambiental.
Para superar este desafío, los investigadores de Alibaba introdujeron Optimización jerárquica de políticas desacopladas (HDPO), un marco de aprendizaje por refuerzo que capacita a los agentes para equilibrar la eficiencia de la ejecución y la precisión de las tareas.
Metis, un modelo multimodal que entrenaron utilizando este marco, reduce las invocaciones de herramientas redundantes del 98 % a solo el 2 % al tiempo que establece una nueva precisión de razonamiento de última generación en los puntos de referencia clave de la industria. Este marco ayuda a crear agentes de IA que no son fáciles de disparar y saben cuándo abstenerse de usar herramientas, lo que permite el desarrollo de sistemas de agentes receptivos y rentables.
El déficit metacognitivo
Los modelos agentes actuales se enfrentan a lo que los investigadores llaman un «profundo déficit metacognitivo». Los modelos tienen dificultades para decidir cuándo utilizar su conocimiento paramétrico interno versus cuándo consultar una utilidad externa. Como resultado, invocan ciegamente herramientas y API, como búsqueda web o ejecución de código, incluso cuando el mensaje del usuario ya contiene toda la información necesaria para resolver la tarea.
Este comportamiento de llamada de herramientas de activación fácil crea graves obstáculos operativos para las aplicaciones del mundo real. Debido a que los modelos están entrenados para centrarse casi por completo en la realización de tareas, son indiferentes a la latencia. Estos agentes frecuentemente alcanzan tarifas exorbitantes de llamadas de herramientas. Cada llamada API externa innecesaria introduce un cuello de botella en el procesamiento en serie, lo que convierte una IA técnicamente capaz en un sistema lento que frustra a los usuarios y consume presupuestos de herramientas.
Al mismo tiempo, quemar recursos computacionales mediante el uso excesivo de herramientas no se traduce en un mejor razonamiento. Las interacciones redundantes de herramientas inyectan ruido en el contexto del modelo. Este ruido puede distraer el modelo, descarrilar una cadena de razonamiento que de otro modo sería sólida y degradar activamente el resultado final.
Para abordar los problemas de latencia y costo de la invocación ciega de herramientas, los métodos de aprendizaje por refuerzo anteriores intentaron penalizar el uso excesivo de herramientas combinando la precisión de la tarea y la eficiencia de la ejecución en una señal de recompensa. Sin embargo, este diseño entrelazado crea un dilema de optimización sin solución. Si la penalización de la eficiencia es demasiado agresiva, el modelo se vuelve demasiado conservador y suprime el uso de herramientas esenciales, sacrificando la corrección en tareas arduas. Por el contrario, si la penalización es leve, la señal de optimización pierde su valor y no evita el uso excesivo de la herramienta en tareas más simples.
Además, esta recompensa compartida crea ambigüedad semántica, donde una trayectoria inexacta sin llamadas a herramientas podría generar la misma recompensa que una trayectoria precisa con un uso excesivo de herramientas. Debido a que las señales de entrenamiento para la precisión y la eficiencia se entrelazan, el modelo no puede aprender a controlar el uso de herramientas sin degradar sus capacidades básicas de razonamiento.
Optimización jerárquica de políticas desacopladas
Para resolver el dilema de optimización de las recompensas acopladas, los investigadores introdujeron HDPO. HDPO separa la precisión y la eficiencia en dos canales de optimización independientes. El canal de precisión se centra en maximizar la corrección de las tareas en todas las implementaciones del modelo. El canal de eficiencia optimiza la economía de ejecución.
HDPO calcula las señales de entrenamiento para estos dos canales de forma independiente y solo las combina en la etapa final del cálculo de pérdidas. La señal de eficiencia está condicionada al canal de precisión. Esto significa que una respuesta incorrecta nunca es recompensada simplemente por ser rápido o utilizar menos herramientas. Este desacoplamiento evita situaciones en las que los gradientes de precisión y eficiencia se anulan entre sí, proporcionando a la IA señales de aprendizaje claras para ambos objetivos.
La propiedad emergente más poderosa de este diseño desacoplado es que crea un currículo cognitivo implícito. Al principio del entrenamiento, cuando el modelo todavía tiene dificultades con la tarea, la optimización está dominada por el objetivo de precisión, lo que obliga al modelo a priorizar el aprendizaje del razonamiento y el conocimiento correctos. A medida que las capacidades de razonamiento del modelo maduran y llega consistentemente a las respuestas correctas, la señal de eficiencia aumenta suavemente. Este mecanismo hace que el modelo primero domine la resolución de tareas y solo luego refine su autosuficiencia evitando llamadas API costosas y redundantes.
Para complementar HDPO, los investigadores desarrollaron un régimen riguroso de curación de datos de varias etapas que aborda fallas graves encontradas en conjuntos de datos existentes ampliados con herramientas. Su proceso de curación de datos cubre etapas de ajuste supervisado (SFT) y aprendizaje por refuerzo (RL).
Para la fase SFT, obtuvieron datos de trayectorias multimodales aumentadas con herramientas disponibles públicamente y los filtraron para eliminar ejemplos de baja calidad que contenían fallas de ejecución o inconsistencias en la retroalimentación. También filtraron agresivamente cualquier muestra de entrenamiento que el modelo base pudiera resolver directamente sin herramientas. Finalmente, usando Google Géminis 3.1 Pro Como juez automatizado, filtraron el corpus SFT para conservar solo ejemplos que demostraran el uso de herramientas estratégicas.
Para la fase de RL, la selección se centró en garantizar una señal de optimización estable. Filtraron mensajes con imágenes corruptas o ambigüedad semántica. El algoritmo HDPO se basa en comparar respuestas correctas e incorrectas. Si una tarea es trivialmente fácil cuando el modelo siempre acierta, o prohibitivamente difícil cuando el modelo siempre falla, no hay una variación matemática significativa de la cual aprender. El equipo retuvo estrictamente solo indicaciones que mostraran una combinación no trivial de éxitos y fracasos para garantizar una señal de gradiente procesable.
Agente Metis: HDPO en acción
Para probar HDPO en acción, los investigadores utilizaron el marco para desarrollar Metis, un agente de razonamiento multimodal equipado con herramientas de codificación y búsqueda. Metis está construido sobre el modelo de visión y lenguaje Qwen3-VL-8B-Instruct. Los investigadores lo entrenaron en dos etapas distintas. Primero, aplicaron SFT utilizando sus datos seleccionados para proporcionar una inicialización en frío. A continuación, aplicaron RL utilizando el marco HDPO, exponiendo el modelo a interacciones de múltiples turnos donde podría invocar herramientas como la ejecución de código Python, búsqueda de texto y búsqueda de imágenes.
Los investigadores enfrentaron a Metis con modelos de visión estándar de código abierto como LLaVA-OneVision, razonadores de solo texto y modelos agentes de última generación, incluidos DeepEyes V2 y Skywork-R1V4 de 30 mil millones de parámetros. La evaluación abarcó dos áreas principales: percepción visual y comprensión de documentos de conjuntos de datos como HRBench y V*Bench, y tareas rigurosas de razonamiento matemático y lógico como WeMath y MathVista.
En todas las tareas, Metis logró un rendimiento de vanguardia o altamente competitivo, superando a los modelos agentes existentes, incluido el mucho más grande Skywork-R1V4 de 30 mil millones de parámetros, tanto en tareas de percepción visual como de razonamiento.
Igualmente importante es el comportamiento anecdótico que mostró Metis en los experimentos. Por ejemplo, cuando se les presenta la imagen de un letrero de un museo y se les pregunta qué dice el texto central, los modelos agentes estándar pierden el tiempo escribiendo scripts de Python a ciegas para recortar la imagen solo para leerla. Metis, sin embargo, reconoce que el texto es claramente legible en la imagen en bruto. Omite las herramientas por completo y utiliza una única pasada de inferencia.
En otro experimento, al modelo se le dio un gráfico complejo y se le pidió que identificara la segunda línea más alta en un punto de datos específico dentro de una pequeña subtrama. Metis reconoció que el análisis visual detallado excedía sus capacidades de resolución nativa y no podía distinguir con precisión las líneas superpuestas. En lugar de adivinar a partir de la imagen completa, invocó a Python para recortar y ampliar exclusivamente esa región de la trama secundaria específica, lo que le permitió identificar correctamente la línea. Trata el código como un instrumento de precisión que se implementa sólo cuando la evidencia visual es genuinamente ambigua, no como un recurso alternativo predeterminado.
Los investigadores publicaron Métis junto con el código para HDPO bajo la permisiva licencia Apache 2.0.
«Nuestros resultados demuestran que el uso de herramientas estratégicas y un sólido rendimiento de razonamiento no son una compensación; más bien, la eliminación de llamadas de herramientas ruidosas y redundantes contribuye directamente a una precisión superior», concluyen los investigadores. «En términos más generales, nuestro trabajo sugiere un cambio de paradigma en el aprendizaje aumentado con herramientas: de simplemente enseñar modelos a ejecutar herramientas a cultivar la sabiduría metacognitiva sobre cuándo abstenerse de ellas».
Uno de los desafíos clave para crear agentes de IA eficaces es enseñarles a elegir entre utilizar herramientas externas o confiar en su conocimiento interno. Pero los modelos de lenguaje grandes a menudo se entrenan para invocar herramientas a ciegas, lo que provoca cuellos de botella de latencia, costos API innecesarios y razonamiento degradado causado por el ruido ambiental.
Para superar este desafío, los investigadores de Alibaba introdujeron Optimización jerárquica de políticas desacopladas (HDPO), un marco de aprendizaje por refuerzo que capacita a los agentes para equilibrar la eficiencia de la ejecución y la precisión de las tareas.
Metis, un modelo multimodal que entrenaron utilizando este marco, reduce las invocaciones de herramientas redundantes del 98 % a solo el 2 % al tiempo que establece una nueva precisión de razonamiento de última generación en los puntos de referencia clave de la industria. Este marco ayuda a crear agentes de IA que no son fáciles de disparar y saben cuándo abstenerse de usar herramientas, lo que permite el desarrollo de sistemas de agentes receptivos y rentables.
El déficit metacognitivo
Los modelos agentes actuales se enfrentan a lo que los investigadores llaman un «profundo déficit metacognitivo». Los modelos tienen dificultades para decidir cuándo utilizar su conocimiento paramétrico interno versus cuándo consultar una utilidad externa. Como resultado, invocan ciegamente herramientas y API, como búsqueda web o ejecución de código, incluso cuando el mensaje del usuario ya contiene toda la información necesaria para resolver la tarea.
Este comportamiento de llamada de herramientas de activación fácil crea graves obstáculos operativos para las aplicaciones del mundo real. Debido a que los modelos están entrenados para centrarse casi por completo en la realización de tareas, son indiferentes a la latencia. Estos agentes frecuentemente alcanzan tarifas exorbitantes de llamadas de herramientas. Cada llamada API externa innecesaria introduce un cuello de botella en el procesamiento en serie, lo que convierte una IA técnicamente capaz en un sistema lento que frustra a los usuarios y consume presupuestos de herramientas.
Al mismo tiempo, quemar recursos computacionales mediante el uso excesivo de herramientas no se traduce en un mejor razonamiento. Las interacciones redundantes de herramientas inyectan ruido en el contexto del modelo. Este ruido puede distraer el modelo, descarrilar una cadena de razonamiento que de otro modo sería sólida y degradar activamente el resultado final.
Para abordar los problemas de latencia y costo de la invocación ciega de herramientas, los métodos de aprendizaje por refuerzo anteriores intentaron penalizar el uso excesivo de herramientas combinando la precisión de la tarea y la eficiencia de la ejecución en una señal de recompensa. Sin embargo, este diseño entrelazado crea un dilema de optimización sin solución. Si la penalización de la eficiencia es demasiado agresiva, el modelo se vuelve demasiado conservador y suprime el uso de herramientas esenciales, sacrificando la corrección en tareas arduas. Por el contrario, si la penalización es leve, la señal de optimización pierde su valor y no evita el uso excesivo de la herramienta en tareas más simples.
Además, esta recompensa compartida crea ambigüedad semántica, donde una trayectoria inexacta sin llamadas a herramientas podría generar la misma recompensa que una trayectoria precisa con un uso excesivo de herramientas. Debido a que las señales de entrenamiento para la precisión y la eficiencia se entrelazan, el modelo no puede aprender a controlar el uso de herramientas sin degradar sus capacidades básicas de razonamiento.
Optimización jerárquica de políticas desacopladas
Para resolver el dilema de optimización de las recompensas acopladas, los investigadores introdujeron HDPO. HDPO separa la precisión y la eficiencia en dos canales de optimización independientes. El canal de precisión se centra en maximizar la corrección de las tareas en todas las implementaciones del modelo. El canal de eficiencia optimiza la economía de ejecución.
HDPO calcula las señales de entrenamiento para estos dos canales de forma independiente y solo las combina en la etapa final del cálculo de pérdidas. La señal de eficiencia está condicionada al canal de precisión. Esto significa que una respuesta incorrecta nunca es recompensada simplemente por ser rápido o utilizar menos herramientas. Este desacoplamiento evita situaciones en las que los gradientes de precisión y eficiencia se anulan entre sí, proporcionando a la IA señales de aprendizaje claras para ambos objetivos.
La propiedad emergente más poderosa de este diseño desacoplado es que crea un currículo cognitivo implícito. Al principio del entrenamiento, cuando el modelo todavía tiene dificultades con la tarea, la optimización está dominada por el objetivo de precisión, lo que obliga al modelo a priorizar el aprendizaje del razonamiento y el conocimiento correctos. A medida que las capacidades de razonamiento del modelo maduran y llega consistentemente a las respuestas correctas, la señal de eficiencia aumenta suavemente. Este mecanismo hace que el modelo primero domine la resolución de tareas y solo luego refine su autosuficiencia evitando llamadas API costosas y redundantes.
Para complementar HDPO, los investigadores desarrollaron un régimen riguroso de curación de datos de varias etapas que aborda fallas graves encontradas en conjuntos de datos existentes ampliados con herramientas. Su proceso de curación de datos cubre etapas de ajuste supervisado (SFT) y aprendizaje por refuerzo (RL).
Para la fase SFT, obtuvieron datos de trayectorias multimodales aumentadas con herramientas disponibles públicamente y los filtraron para eliminar ejemplos de baja calidad que contenían fallas de ejecución o inconsistencias en la retroalimentación. También filtraron agresivamente cualquier muestra de entrenamiento que el modelo base pudiera resolver directamente sin herramientas. Finalmente, usando Google Géminis 3.1 Pro Como juez automatizado, filtraron el corpus SFT para conservar solo ejemplos que demostraran el uso de herramientas estratégicas.
Para la fase de RL, la selección se centró en garantizar una señal de optimización estable. Filtraron mensajes con imágenes corruptas o ambigüedad semántica. El algoritmo HDPO se basa en comparar respuestas correctas e incorrectas. Si una tarea es trivialmente fácil cuando el modelo siempre acierta, o prohibitivamente difícil cuando el modelo siempre falla, no hay una variación matemática significativa de la cual aprender. El equipo retuvo estrictamente solo indicaciones que mostraran una combinación no trivial de éxitos y fracasos para garantizar una señal de gradiente procesable.
Agente Metis: HDPO en acción
Para probar HDPO en acción, los investigadores utilizaron el marco para desarrollar Metis, un agente de razonamiento multimodal equipado con herramientas de codificación y búsqueda. Metis está construido sobre el modelo de visión y lenguaje Qwen3-VL-8B-Instruct. Los investigadores lo entrenaron en dos etapas distintas. Primero, aplicaron SFT utilizando sus datos seleccionados para proporcionar una inicialización en frío. A continuación, aplicaron RL utilizando el marco HDPO, exponiendo el modelo a interacciones de múltiples turnos donde podría invocar herramientas como la ejecución de código Python, búsqueda de texto y búsqueda de imágenes.
Los investigadores enfrentaron a Metis con modelos de visión estándar de código abierto como LLaVA-OneVision, razonadores de solo texto y modelos agentes de última generación, incluidos DeepEyes V2 y Skywork-R1V4 de 30 mil millones de parámetros. La evaluación abarcó dos áreas principales: percepción visual y comprensión de documentos de conjuntos de datos como HRBench y V*Bench, y tareas rigurosas de razonamiento matemático y lógico como WeMath y MathVista.
En todas las tareas, Metis logró un rendimiento de vanguardia o altamente competitivo, superando a los modelos agentes existentes, incluido el mucho más grande Skywork-R1V4 de 30 mil millones de parámetros, tanto en tareas de percepción visual como de razonamiento.
Igualmente importante es el comportamiento anecdótico que mostró Metis en los experimentos. Por ejemplo, cuando se les presenta la imagen de un letrero de un museo y se les pregunta qué dice el texto central, los modelos agentes estándar pierden el tiempo escribiendo scripts de Python a ciegas para recortar la imagen solo para leerla. Metis, sin embargo, reconoce que el texto es claramente legible en la imagen en bruto. Omite las herramientas por completo y utiliza una única pasada de inferencia.
En otro experimento, al modelo se le dio un gráfico complejo y se le pidió que identificara la segunda línea más alta en un punto de datos específico dentro de una pequeña subtrama. Metis reconoció que el análisis visual detallado excedía sus capacidades de resolución nativa y no podía distinguir con precisión las líneas superpuestas. En lugar de adivinar a partir de la imagen completa, invocó a Python para recortar y ampliar exclusivamente esa región de la trama secundaria específica, lo que le permitió identificar correctamente la línea. Trata el código como un instrumento de precisión que se implementa sólo cuando la evidencia visual es genuinamente ambigua, no como un recurso alternativo predeterminado.
Los investigadores publicaron Métis junto con el código para HDPO bajo la permisiva licencia Apache 2.0.
«Nuestros resultados demuestran que el uso de herramientas estratégicas y un sólido rendimiento de razonamiento no son una compensación; más bien, la eliminación de llamadas de herramientas ruidosas y redundantes contribuye directamente a una precisión superior», concluyen los investigadores. «En términos más generales, nuestro trabajo sugiere un cambio de paradigma en el aprendizaje aumentado con herramientas: de simplemente enseñar modelos a ejecutar herramientas a cultivar la sabiduría metacognitiva sobre cuándo abstenerse de ellas».
Uno de los desafíos clave para crear agentes de IA eficaces es enseñarles a elegir entre utilizar herramientas externas o confiar en su conocimiento interno. Pero los modelos de lenguaje grandes a menudo se entrenan para invocar herramientas a ciegas, lo que provoca cuellos de botella de latencia, costos API innecesarios y razonamiento degradado causado por el ruido ambiental.
Para superar este desafío, los investigadores de Alibaba introdujeron Optimización jerárquica de políticas desacopladas (HDPO), un marco de aprendizaje por refuerzo que capacita a los agentes para equilibrar la eficiencia de la ejecución y la precisión de las tareas.
Metis, un modelo multimodal que entrenaron utilizando este marco, reduce las invocaciones de herramientas redundantes del 98 % a solo el 2 % al tiempo que establece una nueva precisión de razonamiento de última generación en los puntos de referencia clave de la industria. Este marco ayuda a crear agentes de IA que no son fáciles de disparar y saben cuándo abstenerse de usar herramientas, lo que permite el desarrollo de sistemas de agentes receptivos y rentables.
El déficit metacognitivo
Los modelos agentes actuales se enfrentan a lo que los investigadores llaman un «profundo déficit metacognitivo». Los modelos tienen dificultades para decidir cuándo utilizar su conocimiento paramétrico interno versus cuándo consultar una utilidad externa. Como resultado, invocan ciegamente herramientas y API, como búsqueda web o ejecución de código, incluso cuando el mensaje del usuario ya contiene toda la información necesaria para resolver la tarea.
Este comportamiento de llamada de herramientas de activación fácil crea graves obstáculos operativos para las aplicaciones del mundo real. Debido a que los modelos están entrenados para centrarse casi por completo en la realización de tareas, son indiferentes a la latencia. Estos agentes frecuentemente alcanzan tarifas exorbitantes de llamadas de herramientas. Cada llamada API externa innecesaria introduce un cuello de botella en el procesamiento en serie, lo que convierte una IA técnicamente capaz en un sistema lento que frustra a los usuarios y consume presupuestos de herramientas.
Al mismo tiempo, quemar recursos computacionales mediante el uso excesivo de herramientas no se traduce en un mejor razonamiento. Las interacciones redundantes de herramientas inyectan ruido en el contexto del modelo. Este ruido puede distraer el modelo, descarrilar una cadena de razonamiento que de otro modo sería sólida y degradar activamente el resultado final.
Para abordar los problemas de latencia y costo de la invocación ciega de herramientas, los métodos de aprendizaje por refuerzo anteriores intentaron penalizar el uso excesivo de herramientas combinando la precisión de la tarea y la eficiencia de la ejecución en una señal de recompensa. Sin embargo, este diseño entrelazado crea un dilema de optimización sin solución. Si la penalización de la eficiencia es demasiado agresiva, el modelo se vuelve demasiado conservador y suprime el uso de herramientas esenciales, sacrificando la corrección en tareas arduas. Por el contrario, si la penalización es leve, la señal de optimización pierde su valor y no evita el uso excesivo de la herramienta en tareas más simples.
Además, esta recompensa compartida crea ambigüedad semántica, donde una trayectoria inexacta sin llamadas a herramientas podría generar la misma recompensa que una trayectoria precisa con un uso excesivo de herramientas. Debido a que las señales de entrenamiento para la precisión y la eficiencia se entrelazan, el modelo no puede aprender a controlar el uso de herramientas sin degradar sus capacidades básicas de razonamiento.
Optimización jerárquica de políticas desacopladas
Para resolver el dilema de optimización de las recompensas acopladas, los investigadores introdujeron HDPO. HDPO separa la precisión y la eficiencia en dos canales de optimización independientes. El canal de precisión se centra en maximizar la corrección de las tareas en todas las implementaciones del modelo. El canal de eficiencia optimiza la economía de ejecución.
HDPO calcula las señales de entrenamiento para estos dos canales de forma independiente y solo las combina en la etapa final del cálculo de pérdidas. La señal de eficiencia está condicionada al canal de precisión. Esto significa que una respuesta incorrecta nunca es recompensada simplemente por ser rápido o utilizar menos herramientas. Este desacoplamiento evita situaciones en las que los gradientes de precisión y eficiencia se anulan entre sí, proporcionando a la IA señales de aprendizaje claras para ambos objetivos.
La propiedad emergente más poderosa de este diseño desacoplado es que crea un currículo cognitivo implícito. Al principio del entrenamiento, cuando el modelo todavía tiene dificultades con la tarea, la optimización está dominada por el objetivo de precisión, lo que obliga al modelo a priorizar el aprendizaje del razonamiento y el conocimiento correctos. A medida que las capacidades de razonamiento del modelo maduran y llega consistentemente a las respuestas correctas, la señal de eficiencia aumenta suavemente. Este mecanismo hace que el modelo primero domine la resolución de tareas y solo luego refine su autosuficiencia evitando llamadas API costosas y redundantes.
Para complementar HDPO, los investigadores desarrollaron un régimen riguroso de curación de datos de varias etapas que aborda fallas graves encontradas en conjuntos de datos existentes ampliados con herramientas. Su proceso de curación de datos cubre etapas de ajuste supervisado (SFT) y aprendizaje por refuerzo (RL).
Para la fase SFT, obtuvieron datos de trayectorias multimodales aumentadas con herramientas disponibles públicamente y los filtraron para eliminar ejemplos de baja calidad que contenían fallas de ejecución o inconsistencias en la retroalimentación. También filtraron agresivamente cualquier muestra de entrenamiento que el modelo base pudiera resolver directamente sin herramientas. Finalmente, usando Google Géminis 3.1 Pro Como juez automatizado, filtraron el corpus SFT para conservar solo ejemplos que demostraran el uso de herramientas estratégicas.
Para la fase de RL, la selección se centró en garantizar una señal de optimización estable. Filtraron mensajes con imágenes corruptas o ambigüedad semántica. El algoritmo HDPO se basa en comparar respuestas correctas e incorrectas. Si una tarea es trivialmente fácil cuando el modelo siempre acierta, o prohibitivamente difícil cuando el modelo siempre falla, no hay una variación matemática significativa de la cual aprender. El equipo retuvo estrictamente solo indicaciones que mostraran una combinación no trivial de éxitos y fracasos para garantizar una señal de gradiente procesable.
Agente Metis: HDPO en acción
Para probar HDPO en acción, los investigadores utilizaron el marco para desarrollar Metis, un agente de razonamiento multimodal equipado con herramientas de codificación y búsqueda. Metis está construido sobre el modelo de visión y lenguaje Qwen3-VL-8B-Instruct. Los investigadores lo entrenaron en dos etapas distintas. Primero, aplicaron SFT utilizando sus datos seleccionados para proporcionar una inicialización en frío. A continuación, aplicaron RL utilizando el marco HDPO, exponiendo el modelo a interacciones de múltiples turnos donde podría invocar herramientas como la ejecución de código Python, búsqueda de texto y búsqueda de imágenes.
Los investigadores enfrentaron a Metis con modelos de visión estándar de código abierto como LLaVA-OneVision, razonadores de solo texto y modelos agentes de última generación, incluidos DeepEyes V2 y Skywork-R1V4 de 30 mil millones de parámetros. La evaluación abarcó dos áreas principales: percepción visual y comprensión de documentos de conjuntos de datos como HRBench y V*Bench, y tareas rigurosas de razonamiento matemático y lógico como WeMath y MathVista.
En todas las tareas, Metis logró un rendimiento de vanguardia o altamente competitivo, superando a los modelos agentes existentes, incluido el mucho más grande Skywork-R1V4 de 30 mil millones de parámetros, tanto en tareas de percepción visual como de razonamiento.
Igualmente importante es el comportamiento anecdótico que mostró Metis en los experimentos. Por ejemplo, cuando se les presenta la imagen de un letrero de un museo y se les pregunta qué dice el texto central, los modelos agentes estándar pierden el tiempo escribiendo scripts de Python a ciegas para recortar la imagen solo para leerla. Metis, sin embargo, reconoce que el texto es claramente legible en la imagen en bruto. Omite las herramientas por completo y utiliza una única pasada de inferencia.
En otro experimento, al modelo se le dio un gráfico complejo y se le pidió que identificara la segunda línea más alta en un punto de datos específico dentro de una pequeña subtrama. Metis reconoció que el análisis visual detallado excedía sus capacidades de resolución nativa y no podía distinguir con precisión las líneas superpuestas. En lugar de adivinar a partir de la imagen completa, invocó a Python para recortar y ampliar exclusivamente esa región de la trama secundaria específica, lo que le permitió identificar correctamente la línea. Trata el código como un instrumento de precisión que se implementa sólo cuando la evidencia visual es genuinamente ambigua, no como un recurso alternativo predeterminado.
Los investigadores publicaron Métis junto con el código para HDPO bajo la permisiva licencia Apache 2.0.
«Nuestros resultados demuestran que el uso de herramientas estratégicas y un sólido rendimiento de razonamiento no son una compensación; más bien, la eliminación de llamadas de herramientas ruidosas y redundantes contribuye directamente a una precisión superior», concluyen los investigadores. «En términos más generales, nuestro trabajo sugiere un cambio de paradigma en el aprendizaje aumentado con herramientas: de simplemente enseñar modelos a ejecutar herramientas a cultivar la sabiduría metacognitiva sobre cuándo abstenerse de ellas».
Uno de los desafíos clave para crear agentes de IA eficaces es enseñarles a elegir entre utilizar herramientas externas o confiar en su conocimiento interno. Pero los modelos de lenguaje grandes a menudo se entrenan para invocar herramientas a ciegas, lo que provoca cuellos de botella de latencia, costos API innecesarios y razonamiento degradado causado por el ruido ambiental.
Para superar este desafío, los investigadores de Alibaba introdujeron Optimización jerárquica de políticas desacopladas (HDPO), un marco de aprendizaje por refuerzo que capacita a los agentes para equilibrar la eficiencia de la ejecución y la precisión de las tareas.
Metis, un modelo multimodal que entrenaron utilizando este marco, reduce las invocaciones de herramientas redundantes del 98 % a solo el 2 % al tiempo que establece una nueva precisión de razonamiento de última generación en los puntos de referencia clave de la industria. Este marco ayuda a crear agentes de IA que no son fáciles de disparar y saben cuándo abstenerse de usar herramientas, lo que permite el desarrollo de sistemas de agentes receptivos y rentables.
El déficit metacognitivo
Los modelos agentes actuales se enfrentan a lo que los investigadores llaman un «profundo déficit metacognitivo». Los modelos tienen dificultades para decidir cuándo utilizar su conocimiento paramétrico interno versus cuándo consultar una utilidad externa. Como resultado, invocan ciegamente herramientas y API, como búsqueda web o ejecución de código, incluso cuando el mensaje del usuario ya contiene toda la información necesaria para resolver la tarea.
Este comportamiento de llamada de herramientas de activación fácil crea graves obstáculos operativos para las aplicaciones del mundo real. Debido a que los modelos están entrenados para centrarse casi por completo en la realización de tareas, son indiferentes a la latencia. Estos agentes frecuentemente alcanzan tarifas exorbitantes de llamadas de herramientas. Cada llamada API externa innecesaria introduce un cuello de botella en el procesamiento en serie, lo que convierte una IA técnicamente capaz en un sistema lento que frustra a los usuarios y consume presupuestos de herramientas.
Al mismo tiempo, quemar recursos computacionales mediante el uso excesivo de herramientas no se traduce en un mejor razonamiento. Las interacciones redundantes de herramientas inyectan ruido en el contexto del modelo. Este ruido puede distraer el modelo, descarrilar una cadena de razonamiento que de otro modo sería sólida y degradar activamente el resultado final.
Para abordar los problemas de latencia y costo de la invocación ciega de herramientas, los métodos de aprendizaje por refuerzo anteriores intentaron penalizar el uso excesivo de herramientas combinando la precisión de la tarea y la eficiencia de la ejecución en una señal de recompensa. Sin embargo, este diseño entrelazado crea un dilema de optimización sin solución. Si la penalización de la eficiencia es demasiado agresiva, el modelo se vuelve demasiado conservador y suprime el uso de herramientas esenciales, sacrificando la corrección en tareas arduas. Por el contrario, si la penalización es leve, la señal de optimización pierde su valor y no evita el uso excesivo de la herramienta en tareas más simples.
Además, esta recompensa compartida crea ambigüedad semántica, donde una trayectoria inexacta sin llamadas a herramientas podría generar la misma recompensa que una trayectoria precisa con un uso excesivo de herramientas. Debido a que las señales de entrenamiento para la precisión y la eficiencia se entrelazan, el modelo no puede aprender a controlar el uso de herramientas sin degradar sus capacidades básicas de razonamiento.
Optimización jerárquica de políticas desacopladas
Para resolver el dilema de optimización de las recompensas acopladas, los investigadores introdujeron HDPO. HDPO separa la precisión y la eficiencia en dos canales de optimización independientes. El canal de precisión se centra en maximizar la corrección de las tareas en todas las implementaciones del modelo. El canal de eficiencia optimiza la economía de ejecución.
HDPO calcula las señales de entrenamiento para estos dos canales de forma independiente y solo las combina en la etapa final del cálculo de pérdidas. La señal de eficiencia está condicionada al canal de precisión. Esto significa que una respuesta incorrecta nunca es recompensada simplemente por ser rápido o utilizar menos herramientas. Este desacoplamiento evita situaciones en las que los gradientes de precisión y eficiencia se anulan entre sí, proporcionando a la IA señales de aprendizaje claras para ambos objetivos.
La propiedad emergente más poderosa de este diseño desacoplado es que crea un currículo cognitivo implícito. Al principio del entrenamiento, cuando el modelo todavía tiene dificultades con la tarea, la optimización está dominada por el objetivo de precisión, lo que obliga al modelo a priorizar el aprendizaje del razonamiento y el conocimiento correctos. A medida que las capacidades de razonamiento del modelo maduran y llega consistentemente a las respuestas correctas, la señal de eficiencia aumenta suavemente. Este mecanismo hace que el modelo primero domine la resolución de tareas y solo luego refine su autosuficiencia evitando llamadas API costosas y redundantes.
Para complementar HDPO, los investigadores desarrollaron un régimen riguroso de curación de datos de varias etapas que aborda fallas graves encontradas en conjuntos de datos existentes ampliados con herramientas. Su proceso de curación de datos cubre etapas de ajuste supervisado (SFT) y aprendizaje por refuerzo (RL).
Para la fase SFT, obtuvieron datos de trayectorias multimodales aumentadas con herramientas disponibles públicamente y los filtraron para eliminar ejemplos de baja calidad que contenían fallas de ejecución o inconsistencias en la retroalimentación. También filtraron agresivamente cualquier muestra de entrenamiento que el modelo base pudiera resolver directamente sin herramientas. Finalmente, usando Google Géminis 3.1 Pro Como juez automatizado, filtraron el corpus SFT para conservar solo ejemplos que demostraran el uso de herramientas estratégicas.
Para la fase de RL, la selección se centró en garantizar una señal de optimización estable. Filtraron mensajes con imágenes corruptas o ambigüedad semántica. El algoritmo HDPO se basa en comparar respuestas correctas e incorrectas. Si una tarea es trivialmente fácil cuando el modelo siempre acierta, o prohibitivamente difícil cuando el modelo siempre falla, no hay una variación matemática significativa de la cual aprender. El equipo retuvo estrictamente solo indicaciones que mostraran una combinación no trivial de éxitos y fracasos para garantizar una señal de gradiente procesable.
Agente Metis: HDPO en acción
Para probar HDPO en acción, los investigadores utilizaron el marco para desarrollar Metis, un agente de razonamiento multimodal equipado con herramientas de codificación y búsqueda. Metis está construido sobre el modelo de visión y lenguaje Qwen3-VL-8B-Instruct. Los investigadores lo entrenaron en dos etapas distintas. Primero, aplicaron SFT utilizando sus datos seleccionados para proporcionar una inicialización en frío. A continuación, aplicaron RL utilizando el marco HDPO, exponiendo el modelo a interacciones de múltiples turnos donde podría invocar herramientas como la ejecución de código Python, búsqueda de texto y búsqueda de imágenes.
Los investigadores enfrentaron a Metis con modelos de visión estándar de código abierto como LLaVA-OneVision, razonadores de solo texto y modelos agentes de última generación, incluidos DeepEyes V2 y Skywork-R1V4 de 30 mil millones de parámetros. La evaluación abarcó dos áreas principales: percepción visual y comprensión de documentos de conjuntos de datos como HRBench y V*Bench, y tareas rigurosas de razonamiento matemático y lógico como WeMath y MathVista.
En todas las tareas, Metis logró un rendimiento de vanguardia o altamente competitivo, superando a los modelos agentes existentes, incluido el mucho más grande Skywork-R1V4 de 30 mil millones de parámetros, tanto en tareas de percepción visual como de razonamiento.
Igualmente importante es el comportamiento anecdótico que mostró Metis en los experimentos. Por ejemplo, cuando se les presenta la imagen de un letrero de un museo y se les pregunta qué dice el texto central, los modelos agentes estándar pierden el tiempo escribiendo scripts de Python a ciegas para recortar la imagen solo para leerla. Metis, sin embargo, reconoce que el texto es claramente legible en la imagen en bruto. Omite las herramientas por completo y utiliza una única pasada de inferencia.
En otro experimento, al modelo se le dio un gráfico complejo y se le pidió que identificara la segunda línea más alta en un punto de datos específico dentro de una pequeña subtrama. Metis reconoció que el análisis visual detallado excedía sus capacidades de resolución nativa y no podía distinguir con precisión las líneas superpuestas. En lugar de adivinar a partir de la imagen completa, invocó a Python para recortar y ampliar exclusivamente esa región de la trama secundaria específica, lo que le permitió identificar correctamente la línea. Trata el código como un instrumento de precisión que se implementa sólo cuando la evidencia visual es genuinamente ambigua, no como un recurso alternativo predeterminado.
Los investigadores publicaron Métis junto con el código para HDPO bajo la permisiva licencia Apache 2.0.
«Nuestros resultados demuestran que el uso de herramientas estratégicas y un sólido rendimiento de razonamiento no son una compensación; más bien, la eliminación de llamadas de herramientas ruidosas y redundantes contribuye directamente a una precisión superior», concluyen los investigadores. «En términos más generales, nuestro trabajo sugiere un cambio de paradigma en el aprendizaje aumentado con herramientas: de simplemente enseñar modelos a ejecutar herramientas a cultivar la sabiduría metacognitiva sobre cuándo abstenerse de ellas».












































































