Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.
Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.
Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.
El problema del entrenamiento de modelos de razonamiento
El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.
RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.
Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.
Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».
La promesa y el fracaso de la autodestilación
La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.
Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.
OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.
Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».
«El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».
Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.
En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.
Desacoplar la dirección de la magnitud con RLSD
Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.
Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.
RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.
El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.
Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.
En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.
«La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».
Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.
Poniendo a RLSD a prueba
Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.
Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.
RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.
Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».
A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.
Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».
En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.
Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.
Cómo pueden empezar las empresas
Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados en preferencias», dijo Yang.
Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.
«Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».
Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.
De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.
«Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».
Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.
Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.
Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.
El problema del entrenamiento de modelos de razonamiento
El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.
RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.
Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.
Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».
La promesa y el fracaso de la autodestilación
La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.
Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.
OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.
Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».
«El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».
Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.
En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.
Desacoplar la dirección de la magnitud con RLSD
Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.
Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.
RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.
El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.
Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.
En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.
«La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».
Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.
Poniendo a RLSD a prueba
Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.
Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.
RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.
Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».
A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.
Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».
En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.
Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.
Cómo pueden empezar las empresas
Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados en preferencias», dijo Yang.
Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.
«Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».
Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.
De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.
«Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».
Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.
Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.
Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.
El problema del entrenamiento de modelos de razonamiento
El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.
RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.
Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.
Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».
La promesa y el fracaso de la autodestilación
La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.
Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.
OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.
Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».
«El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».
Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.
En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.
Desacoplar la dirección de la magnitud con RLSD
Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.
Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.
RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.
El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.
Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.
En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.
«La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».
Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.
Poniendo a RLSD a prueba
Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.
Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.
RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.
Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».
A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.
Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».
En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.
Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.
Cómo pueden empezar las empresas
Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados en preferencias», dijo Yang.
Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.
«Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».
Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.
De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.
«Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».
Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.
Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.
Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.
El problema del entrenamiento de modelos de razonamiento
El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.
RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.
Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.
Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».
La promesa y el fracaso de la autodestilación
La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.
Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.
OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.
Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».
«El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».
Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.
En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.
Desacoplar la dirección de la magnitud con RLSD
Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.
Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.
RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.
El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.
Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.
En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.
«La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».
Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.
Poniendo a RLSD a prueba
Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.
Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.
RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.
Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».
A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.
Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».
En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.
Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.
Cómo pueden empezar las empresas
Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados en preferencias», dijo Yang.
Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.
«Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».
Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.
De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.
«Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.
Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.
Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.
El problema del entrenamiento de modelos de razonamiento
El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.
RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.
Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.
Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».
La promesa y el fracaso de la autodestilación
La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.
Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.
OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.
Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».
«El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».
Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.
En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.
Desacoplar la dirección de la magnitud con RLSD
Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.
Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.
RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.
El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.
Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.
En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.
«La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».
Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.
Poniendo a RLSD a prueba
Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.
Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.
RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.
Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».
A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.
Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».
En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.
Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.
Cómo pueden empezar las empresas
Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados en preferencias», dijo Yang.
Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.
«Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».
Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.
De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.
«Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».
Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.
Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.
Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.
El problema del entrenamiento de modelos de razonamiento
El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.
RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.
Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.
Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».
La promesa y el fracaso de la autodestilación
La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.
Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.
OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.
Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».
«El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».
Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.
En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.
Desacoplar la dirección de la magnitud con RLSD
Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.
Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.
RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.
El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.
Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.
En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.
«La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».
Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.
Poniendo a RLSD a prueba
Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.
Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.
RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.
Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».
A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.
Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».
En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.
Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.
Cómo pueden empezar las empresas
Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados en preferencias», dijo Yang.
Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.
«Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».
Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.
De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.
«Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».
Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.
Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.
Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.
El problema del entrenamiento de modelos de razonamiento
El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.
RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.
Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.
Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».
La promesa y el fracaso de la autodestilación
La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.
Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.
OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.
Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».
«El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».
Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.
En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.
Desacoplar la dirección de la magnitud con RLSD
Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.
Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.
RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.
El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.
Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.
En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.
«La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».
Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.
Poniendo a RLSD a prueba
Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.
Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.
RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.
Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».
A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.
Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».
En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.
Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.
Cómo pueden empezar las empresas
Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados en preferencias», dijo Yang.
Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.
«Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».
Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.
De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.
«Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».
Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.
Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.
Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.
El problema del entrenamiento de modelos de razonamiento
El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.
RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.
Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.
Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».
La promesa y el fracaso de la autodestilación
La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.
Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.
OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.
Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».
«El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».
Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.
En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.
Desacoplar la dirección de la magnitud con RLSD
Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.
Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.
RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.
El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.
Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.
En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.
«La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».
Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.
Poniendo a RLSD a prueba
Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.
Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.
RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.
Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».
A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.
Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».
En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.
Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.
Cómo pueden empezar las empresas
Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados en preferencias», dijo Yang.
Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.
«Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».
Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.
De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.
«Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».











































































