• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
jueves, septiembre 17, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

    Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

    Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

    Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

    Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

    Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

    Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

    Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

    Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

    Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

    Exprocurador general Jean Alain Rodríguez denuncia “manipulación” en informe de Participación Ciudadana

    Suprema Corte ratifica condena a Jean Alain Rodríguez por daños al periodista Marino Zapete

    Fuerza del Pueblo solicita a Estados Unidos trato especial para el arroz dominicano

    Fuerza del Pueblo solicita a Estados Unidos trato especial para el arroz dominicano

    Ramón Raposo: “Hay que sacar al PRM de Palacio; servicios públicos, inseguridad e inflación acaban a RD”

    Ramón Raposo: “Hay que sacar al PRM de Palacio; servicios públicos, inseguridad e inflación acaban a RD”

    Euclides Sánchez: “Habrían mafias en el gobierno con licitaciones; Oposición debe unirse para municipales; LF tiene hoy 43 %

    Euclides Sánchez: “Habrían mafias en el gobierno con licitaciones; Oposición debe unirse para municipales; LF tiene hoy 43 %

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      El Senado aprobó la ley de Inocencia Fiscal II impulsada por el Gobierno de Milei

      El Senado aprobó la ley de Inocencia Fiscal II impulsada por el Gobierno de Milei

      La economía argentina creció 2,2% en el primer semestre en relación a igual periodo de 2025

      La economía argentina creció 2,2% en el primer semestre en relación a igual periodo de 2025

      La Justicia fijó fecha para los juicios orales de Cristina Kirchner y Lázaro Báez por Hotesur y Los Sauces

      La Justicia fijó fecha para los juicios orales de Cristina Kirchner y Lázaro Báez por Hotesur y Los Sauces

      Córdoba desde el aire: parapente, mountain bike y aventura en las sierras

      Córdoba desde el aire: parapente, mountain bike y aventura en las sierras

      Juliana Di Tullio rechazó hacer una autocrítica por la corrupción del kirchnerismo: “¿Por qué la debería hacer?"

      Juliana Di Tullio rechazó hacer una autocrítica por la corrupción del kirchnerismo: “¿Por qué la debería hacer?»

      Thomas Tuchel recordó la derrota de Inglaterra ante Argentina en el Mundial 2026: “Es mi cicatriz”

      Thomas Tuchel recordó la derrota de Inglaterra ante Argentina en el Mundial 2026: “Es mi cicatriz”

      Concluyó en tribunales de Córdoba el concurso de acreedores de Molino Cañuelas

      Concluyó en tribunales de Córdoba el concurso de acreedores de Molino Cañuelas

      Marcelo Gallardo explicó por qué aceptó dirigir a la Selección de Ecuador: "Es un desafío totalmente nuevo para mí"

      Marcelo Gallardo explicó por qué aceptó dirigir a la Selección de Ecuador: «Es un desafío totalmente nuevo para mí»

      Milei envió al Congreso la Ley de Defensa de la Soberanía Nacional para reforzar la causa Malvinas

      Milei envió al Congreso la Ley de Defensa de la Soberanía Nacional para reforzar la causa Malvinas

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

        Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

        Luis Miguel De Camps destaca nuevas oportunidades para que estudiantes continúen su formación tras concluir el bachillerato

        Luis Miguel De Camps destaca nuevas oportunidades para que estudiantes continúen su formación tras concluir el bachillerato

        Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

        Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

        Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

        Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

        Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

        Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

        Observatorio de Áreas Protegidas alerta sobre una emergencia por incendios forestales en República Dominicana

        Observatorio de Áreas Protegidas alerta sobre una emergencia por incendios forestales en República Dominicana

        Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

        Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

        Exprocurador general Jean Alain Rodríguez denuncia “manipulación” en informe de Participación Ciudadana

        Suprema Corte ratifica condena a Jean Alain Rodríguez por daños al periodista Marino Zapete

        Fuerza del Pueblo solicita a Estados Unidos trato especial para el arroz dominicano

        Fuerza del Pueblo solicita a Estados Unidos trato especial para el arroz dominicano

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Fuerza del Pueblo en Ocoa desmiente que seis personas fueran miembros activos del partido y juramentadas con Carolina Mejía

          Fuerza del Pueblo en Ocoa desmiente que seis personas fueran miembros activos del partido y juramentadas con Carolina Mejía

          Danilo Medina proclama en Barahona: “Ya no esperen nada de este gobierno”

          Danilo Medina proclama en Barahona: “Ya no esperen nada de este gobierno”

          Luis Abinader coloca formación política, capacitación y conducta ética entre los ejes de su gestión al frente del PRM

          Luis Abinader coloca formación política, capacitación y conducta ética entre los ejes de su gestión al frente del PRM

          ¡El rumbo de la historia ya está decidido! Fuerza del Pueblo avanza hacia el 2028 junto a Leonel Fernández

          ¡El rumbo de la historia ya está decidido! Fuerza del Pueblo avanza hacia el 2028 junto a Leonel Fernández

          Fuerza del Pueblo cuestiona resultados del programa social...

          Fuerza del Pueblo cuestiona resultados del programa social…

          Rafael Alburquerque advierte que endeudarse para comer revela la difícil realidad económica de las familias dominicanas

          Rafael Alburquerque advierte que endeudarse para comer revela la difícil realidad económica de las familias dominicanas

          SAN JUAN: Presidente provincial de la Fuerza del Pueblo calificó como un rotundo éxito la reciente visita del expresidente Leonel Fernandez

          SAN JUAN: Presidente provincial de la Fuerza del Pueblo calificó como un rotundo éxito la reciente visita del expresidente Leonel Fernandez

          Kelvin Faña asegura Luis Abinader ha salido más inteligente...

          Kelvin Faña asegura Luis Abinader ha salido más inteligente…

          Consulta del PLD avanza con transparencia, imparcialidad...

          Consulta del PLD avanza con transparencia, imparcialidad…

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                US to allow Iran delegation to attend UN meetings in New York

                US to allow Iran delegation to attend UN meetings in New York

                Olympics: The Fitzroy River in Queensland has 500 crocodiles in it - but that's not the main concern

                Olympics: The Fitzroy River in Queensland has 500 crocodiles in it – but that’s not the main concern

                Wife of US scholar jailed in China asks Trump raise arrest at Xi meeting

                Wife of US scholar jailed in China asks Trump raise arrest at Xi meeting

                Warm words on Canada's EU 'associate membership' but no guarantees

                Warm words on Canada’s EU ‘associate membership’ but no guarantees

                Llaman a sanear y cruzar datos de partidos políticos, los "Vincho"

                Llaman a sanear y cruzar datos de partidos políticos, los «Vincho»

                Frente Amplio alerta por impacto del Decreto 693-24 en el arroz

                Frente Amplio alerta por impacto del Decreto 693-24 en el arroz

                Bosch y reforma agraria: "«Ni por la fuerza ni por el dinero"

                Bosch y reforma agraria: ««Ni por la fuerza ni por el dinero»

                Jurgen Klopp: New Germany coach wants to 'reclaim' flag amid elections

                Jurgen Klopp: New Germany coach wants to ‘reclaim’ flag amid elections

                Swedish PM Ulf Kristersson resigns after election loss

                Swedish PM Ulf Kristersson resigns after election loss

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  OpenAI alerta sobre el nuevo comportamiento de la IA y promete seguirlo más de cerca

                  OpenAI alerta sobre el nuevo comportamiento de la IA y promete seguirlo más de cerca

                  Una estrategia global de seguridad de la IA depende de la cooperación entre Estados Unidos y China. Cada uno ve al otro como el problema.

                  Una estrategia global de seguridad de la IA depende de la cooperación entre Estados Unidos y China. Cada uno ve al otro como el problema.

                  Zuckerberg distancia a Meta de los llamados a un enfoque coordinado ante la desaceleración de la IA

                  Zuckerberg distancia a Meta de los llamados a un enfoque coordinado ante la desaceleración de la IA

                  Los satélites muestran que la Tierra perdió más de 12 billones de toneladas de hielo de Groenlandia y la Antártida en 47 años

                  Los satélites muestran que la Tierra perdió más de 12 billones de toneladas de hielo de Groenlandia y la Antártida en 47 años

                  El jefe de la UE propone prohibir en todo el bloque las redes sociales para niños menores de 13 años

                  El jefe de la UE propone prohibir en todo el bloque las redes sociales para niños menores de 13 años

                  Los rivales de la IA llegaron a un acuerdo poco común en materia de seguridad. Ponerlo en práctica es más difícil.

                  Los rivales de la IA llegaron a un acuerdo poco común en materia de seguridad. Ponerlo en práctica es más difícil.

                  Mientras el mundo debate los riesgos de la IA, China cierra la brecha tecnológica con Estados Unidos

                  Mientras el mundo debate los riesgos de la IA, China cierra la brecha tecnológica con Estados Unidos

                  La Fundación Gates advierte que la IA podría ampliar la desigualdad; promete mil millones de dólares para ampliar el acceso

                  La Fundación Gates advierte que la IA podría ampliar la desigualdad; promete mil millones de dólares para ampliar el acceso

                  Trump califica los riesgos de IA como un "engaño" y dice que existe una "conspiración ENFERMA" contra la IA y los centros de datos

                  Trump califica los riesgos de IA como un «engaño» y dice que existe una «conspiración ENFERMA» contra la IA y los centros de datos

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                    Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

                      Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

                      Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

                      Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

                      Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

                      Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

                      Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

                      Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

                      Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

                      Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

                      Exprocurador general Jean Alain Rodríguez denuncia “manipulación” en informe de Participación Ciudadana

                      Suprema Corte ratifica condena a Jean Alain Rodríguez por daños al periodista Marino Zapete

                      Fuerza del Pueblo solicita a Estados Unidos trato especial para el arroz dominicano

                      Fuerza del Pueblo solicita a Estados Unidos trato especial para el arroz dominicano

                      Ramón Raposo: “Hay que sacar al PRM de Palacio; servicios públicos, inseguridad e inflación acaban a RD”

                      Ramón Raposo: “Hay que sacar al PRM de Palacio; servicios públicos, inseguridad e inflación acaban a RD”

                      Euclides Sánchez: “Habrían mafias en el gobierno con licitaciones; Oposición debe unirse para municipales; LF tiene hoy 43 %

                      Euclides Sánchez: “Habrían mafias en el gobierno con licitaciones; Oposición debe unirse para municipales; LF tiene hoy 43 %

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        El Senado aprobó la ley de Inocencia Fiscal II impulsada por el Gobierno de Milei

                        El Senado aprobó la ley de Inocencia Fiscal II impulsada por el Gobierno de Milei

                        La economía argentina creció 2,2% en el primer semestre en relación a igual periodo de 2025

                        La economía argentina creció 2,2% en el primer semestre en relación a igual periodo de 2025

                        La Justicia fijó fecha para los juicios orales de Cristina Kirchner y Lázaro Báez por Hotesur y Los Sauces

                        La Justicia fijó fecha para los juicios orales de Cristina Kirchner y Lázaro Báez por Hotesur y Los Sauces

                        Córdoba desde el aire: parapente, mountain bike y aventura en las sierras

                        Córdoba desde el aire: parapente, mountain bike y aventura en las sierras

                        Juliana Di Tullio rechazó hacer una autocrítica por la corrupción del kirchnerismo: “¿Por qué la debería hacer?"

                        Juliana Di Tullio rechazó hacer una autocrítica por la corrupción del kirchnerismo: “¿Por qué la debería hacer?»

                        Thomas Tuchel recordó la derrota de Inglaterra ante Argentina en el Mundial 2026: “Es mi cicatriz”

                        Thomas Tuchel recordó la derrota de Inglaterra ante Argentina en el Mundial 2026: “Es mi cicatriz”

                        Concluyó en tribunales de Córdoba el concurso de acreedores de Molino Cañuelas

                        Concluyó en tribunales de Córdoba el concurso de acreedores de Molino Cañuelas

                        Marcelo Gallardo explicó por qué aceptó dirigir a la Selección de Ecuador: "Es un desafío totalmente nuevo para mí"

                        Marcelo Gallardo explicó por qué aceptó dirigir a la Selección de Ecuador: «Es un desafío totalmente nuevo para mí»

                        Milei envió al Congreso la Ley de Defensa de la Soberanía Nacional para reforzar la causa Malvinas

                        Milei envió al Congreso la Ley de Defensa de la Soberanía Nacional para reforzar la causa Malvinas

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

                          Pedro Richardson: “Collado tiene 84 % a lo interno en PRM;llegarán más figuras; pide fondos a LA y critica a LF

                          Luis Miguel De Camps destaca nuevas oportunidades para que estudiantes continúen su formación tras concluir el bachillerato

                          Luis Miguel De Camps destaca nuevas oportunidades para que estudiantes continúen su formación tras concluir el bachillerato

                          Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

                          Frente Amplio advierte: derogar el Decreto 693-24 amenaza la producción nacional de arroz y la seguridad alimentaria

                          Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

                          Trump mantiene a RD en la lista de países de tránsito o producción de drogas; felicita a Venezuela

                          Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

                          Policía abate a dos miembros bandas «Los Fantamas» acusados dar muerte a Diddy Glow

                          Observatorio de Áreas Protegidas alerta sobre una emergencia por incendios forestales en República Dominicana

                          Observatorio de Áreas Protegidas alerta sobre una emergencia por incendios forestales en República Dominicana

                          Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

                          Vicepresidenta Raquel Peña supervisa construcción del Hospital Traumatológico Luis L. Bogaert en Mao

                          Exprocurador general Jean Alain Rodríguez denuncia “manipulación” en informe de Participación Ciudadana

                          Suprema Corte ratifica condena a Jean Alain Rodríguez por daños al periodista Marino Zapete

                          Fuerza del Pueblo solicita a Estados Unidos trato especial para el arroz dominicano

                          Fuerza del Pueblo solicita a Estados Unidos trato especial para el arroz dominicano

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Fuerza del Pueblo en Ocoa desmiente que seis personas fueran miembros activos del partido y juramentadas con Carolina Mejía

                            Fuerza del Pueblo en Ocoa desmiente que seis personas fueran miembros activos del partido y juramentadas con Carolina Mejía

                            Danilo Medina proclama en Barahona: “Ya no esperen nada de este gobierno”

                            Danilo Medina proclama en Barahona: “Ya no esperen nada de este gobierno”

                            Luis Abinader coloca formación política, capacitación y conducta ética entre los ejes de su gestión al frente del PRM

                            Luis Abinader coloca formación política, capacitación y conducta ética entre los ejes de su gestión al frente del PRM

                            ¡El rumbo de la historia ya está decidido! Fuerza del Pueblo avanza hacia el 2028 junto a Leonel Fernández

                            ¡El rumbo de la historia ya está decidido! Fuerza del Pueblo avanza hacia el 2028 junto a Leonel Fernández

                            Fuerza del Pueblo cuestiona resultados del programa social...

                            Fuerza del Pueblo cuestiona resultados del programa social…

                            Rafael Alburquerque advierte que endeudarse para comer revela la difícil realidad económica de las familias dominicanas

                            Rafael Alburquerque advierte que endeudarse para comer revela la difícil realidad económica de las familias dominicanas

                            SAN JUAN: Presidente provincial de la Fuerza del Pueblo calificó como un rotundo éxito la reciente visita del expresidente Leonel Fernandez

                            SAN JUAN: Presidente provincial de la Fuerza del Pueblo calificó como un rotundo éxito la reciente visita del expresidente Leonel Fernandez

                            Kelvin Faña asegura Luis Abinader ha salido más inteligente...

                            Kelvin Faña asegura Luis Abinader ha salido más inteligente…

                            Consulta del PLD avanza con transparencia, imparcialidad...

                            Consulta del PLD avanza con transparencia, imparcialidad…

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  US to allow Iran delegation to attend UN meetings in New York

                                  US to allow Iran delegation to attend UN meetings in New York

                                  Olympics: The Fitzroy River in Queensland has 500 crocodiles in it - but that's not the main concern

                                  Olympics: The Fitzroy River in Queensland has 500 crocodiles in it – but that’s not the main concern

                                  Wife of US scholar jailed in China asks Trump raise arrest at Xi meeting

                                  Wife of US scholar jailed in China asks Trump raise arrest at Xi meeting

                                  Warm words on Canada's EU 'associate membership' but no guarantees

                                  Warm words on Canada’s EU ‘associate membership’ but no guarantees

                                  Llaman a sanear y cruzar datos de partidos políticos, los "Vincho"

                                  Llaman a sanear y cruzar datos de partidos políticos, los «Vincho»

                                  Frente Amplio alerta por impacto del Decreto 693-24 en el arroz

                                  Frente Amplio alerta por impacto del Decreto 693-24 en el arroz

                                  Bosch y reforma agraria: "«Ni por la fuerza ni por el dinero"

                                  Bosch y reforma agraria: ««Ni por la fuerza ni por el dinero»

                                  Jurgen Klopp: New Germany coach wants to 'reclaim' flag amid elections

                                  Jurgen Klopp: New Germany coach wants to ‘reclaim’ flag amid elections

                                  Swedish PM Ulf Kristersson resigns after election loss

                                  Swedish PM Ulf Kristersson resigns after election loss

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    OpenAI alerta sobre el nuevo comportamiento de la IA y promete seguirlo más de cerca

                                    OpenAI alerta sobre el nuevo comportamiento de la IA y promete seguirlo más de cerca

                                    Una estrategia global de seguridad de la IA depende de la cooperación entre Estados Unidos y China. Cada uno ve al otro como el problema.

                                    Una estrategia global de seguridad de la IA depende de la cooperación entre Estados Unidos y China. Cada uno ve al otro como el problema.

                                    Zuckerberg distancia a Meta de los llamados a un enfoque coordinado ante la desaceleración de la IA

                                    Zuckerberg distancia a Meta de los llamados a un enfoque coordinado ante la desaceleración de la IA

                                    Los satélites muestran que la Tierra perdió más de 12 billones de toneladas de hielo de Groenlandia y la Antártida en 47 años

                                    Los satélites muestran que la Tierra perdió más de 12 billones de toneladas de hielo de Groenlandia y la Antártida en 47 años

                                    El jefe de la UE propone prohibir en todo el bloque las redes sociales para niños menores de 13 años

                                    El jefe de la UE propone prohibir en todo el bloque las redes sociales para niños menores de 13 años

                                    Los rivales de la IA llegaron a un acuerdo poco común en materia de seguridad. Ponerlo en práctica es más difícil.

                                    Los rivales de la IA llegaron a un acuerdo poco común en materia de seguridad. Ponerlo en práctica es más difícil.

                                    Mientras el mundo debate los riesgos de la IA, China cierra la brecha tecnológica con Estados Unidos

                                    Mientras el mundo debate los riesgos de la IA, China cierra la brecha tecnológica con Estados Unidos

                                    La Fundación Gates advierte que la IA podría ampliar la desigualdad; promete mil millones de dólares para ampliar el acceso

                                    La Fundación Gates advierte que la IA podría ampliar la desigualdad; promete mil millones de dólares para ampliar el acceso

                                    Trump califica los riesgos de IA como un "engaño" y dice que existe una "conspiración ENFERMA" contra la IA y los centros de datos

                                    Trump califica los riesgos de IA como un «engaño» y dice que existe una «conspiración ENFERMA» contra la IA y los centros de datos

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      Cómo crear agentes de razonamiento personalizados con una fracción del cálculo

                                      by — Redacción Despertar Matinal
                                      28 de abril de 2026
                                      in Tecnología
                                      0
                                      Cómo crear agentes de razonamiento personalizados con una fracción del cálculo
                                      0
                                      SHARES
                                      5
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.

                                      Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.

                                      Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.

                                      El problema del entrenamiento de modelos de razonamiento

                                      El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.

                                      Aprendizaje por refuerzo con recompensas verificables (RLVR)

                                      RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.

                                      Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.

                                      Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».

                                      destilación de políticas

                                      Destilación sobre políticas (OPD)

                                      La promesa y el fracaso de la autodestilación

                                      La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.

                                      Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.

                                      OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.

                                      Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».

                                      «El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».

                                      autodestilación sobre políticas

                                      Autodestilación dentro de las políticas (OPSD)

                                      Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.

                                      En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.

                                      Desacoplar la dirección de la magnitud con RLSD

                                      Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.

                                      Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.

                                      RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.

                                      RLSD

                                      Aprendizaje por refuerzo con autodestilación (RLSD) (fuente: arXiv)

                                      El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.

                                      Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.

                                      En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.

                                      «La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».

                                      Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.

                                      Poniendo a RLSD a prueba

                                      Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.

                                      Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.

                                      RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.

                                      rendimiento rlsd

                                      RLSD supera a otras técnicas en puntos de referencia clave (fuente: arXiv)

                                      Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».

                                      A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.

                                      Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».

                                      En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.

                                      Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.

                                      Cómo pueden empezar las empresas

                                      Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados ​​en preferencias», dijo Yang.

                                      Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.

                                      «Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».

                                      Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.

                                      De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.

                                      «Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.

                                      Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.

                                      Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.

                                      El problema del entrenamiento de modelos de razonamiento

                                      El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.

                                      Aprendizaje por refuerzo con recompensas verificables (RLVR)

                                      RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.

                                      Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.

                                      Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».

                                      destilación de políticas

                                      Destilación sobre políticas (OPD)

                                      La promesa y el fracaso de la autodestilación

                                      La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.

                                      Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.

                                      OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.

                                      Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».

                                      «El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».

                                      autodestilación sobre políticas

                                      Autodestilación dentro de las políticas (OPSD)

                                      Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.

                                      En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.

                                      Desacoplar la dirección de la magnitud con RLSD

                                      Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.

                                      Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.

                                      RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.

                                      RLSD

                                      Aprendizaje por refuerzo con autodestilación (RLSD) (fuente: arXiv)

                                      El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.

                                      Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.

                                      En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.

                                      «La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».

                                      Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.

                                      Poniendo a RLSD a prueba

                                      Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.

                                      Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.

                                      RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.

                                      rendimiento rlsd

                                      RLSD supera a otras técnicas en puntos de referencia clave (fuente: arXiv)

                                      Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».

                                      A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.

                                      Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».

                                      En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.

                                      Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.

                                      Cómo pueden empezar las empresas

                                      Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados ​​en preferencias», dijo Yang.

                                      Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.

                                      «Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».

                                      Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.

                                      De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.

                                      «Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.

                                      Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.

                                      Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.

                                      El problema del entrenamiento de modelos de razonamiento

                                      El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.

                                      Aprendizaje por refuerzo con recompensas verificables (RLVR)

                                      RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.

                                      Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.

                                      Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».

                                      destilación de políticas

                                      Destilación sobre políticas (OPD)

                                      La promesa y el fracaso de la autodestilación

                                      La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.

                                      Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.

                                      OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.

                                      Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».

                                      «El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».

                                      autodestilación sobre políticas

                                      Autodestilación dentro de las políticas (OPSD)

                                      Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.

                                      En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.

                                      Desacoplar la dirección de la magnitud con RLSD

                                      Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.

                                      Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.

                                      RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.

                                      RLSD

                                      Aprendizaje por refuerzo con autodestilación (RLSD) (fuente: arXiv)

                                      El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.

                                      Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.

                                      En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.

                                      «La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».

                                      Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.

                                      Poniendo a RLSD a prueba

                                      Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.

                                      Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.

                                      RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.

                                      rendimiento rlsd

                                      RLSD supera a otras técnicas en puntos de referencia clave (fuente: arXiv)

                                      Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».

                                      A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.

                                      Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».

                                      En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.

                                      Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.

                                      Cómo pueden empezar las empresas

                                      Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados ​​en preferencias», dijo Yang.

                                      Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.

                                      «Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».

                                      Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.

                                      De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.

                                      «Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.

                                      Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.

                                      Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.

                                      El problema del entrenamiento de modelos de razonamiento

                                      El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.

                                      Aprendizaje por refuerzo con recompensas verificables (RLVR)

                                      RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.

                                      Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.

                                      Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».

                                      destilación de políticas

                                      Destilación sobre políticas (OPD)

                                      La promesa y el fracaso de la autodestilación

                                      La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.

                                      Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.

                                      OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.

                                      Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».

                                      «El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».

                                      autodestilación sobre políticas

                                      Autodestilación dentro de las políticas (OPSD)

                                      Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.

                                      En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.

                                      Desacoplar la dirección de la magnitud con RLSD

                                      Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.

                                      Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.

                                      RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.

                                      RLSD

                                      Aprendizaje por refuerzo con autodestilación (RLSD) (fuente: arXiv)

                                      El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.

                                      Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.

                                      En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.

                                      «La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».

                                      Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.

                                      Poniendo a RLSD a prueba

                                      Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.

                                      Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.

                                      RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.

                                      rendimiento rlsd

                                      RLSD supera a otras técnicas en puntos de referencia clave (fuente: arXiv)

                                      Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».

                                      A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.

                                      Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».

                                      En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.

                                      Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.

                                      Cómo pueden empezar las empresas

                                      Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados ​​en preferencias», dijo Yang.

                                      Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.

                                      «Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».

                                      Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.

                                      De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.

                                      «Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.

                                      Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.

                                      Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.

                                      El problema del entrenamiento de modelos de razonamiento

                                      El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.

                                      Aprendizaje por refuerzo con recompensas verificables (RLVR)

                                      RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.

                                      Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.

                                      Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».

                                      destilación de políticas

                                      Destilación sobre políticas (OPD)

                                      La promesa y el fracaso de la autodestilación

                                      La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.

                                      Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.

                                      OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.

                                      Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».

                                      «El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».

                                      autodestilación sobre políticas

                                      Autodestilación dentro de las políticas (OPSD)

                                      Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.

                                      En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.

                                      Desacoplar la dirección de la magnitud con RLSD

                                      Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.

                                      Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.

                                      RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.

                                      RLSD

                                      Aprendizaje por refuerzo con autodestilación (RLSD) (fuente: arXiv)

                                      El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.

                                      Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.

                                      En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.

                                      «La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».

                                      Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.

                                      Poniendo a RLSD a prueba

                                      Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.

                                      Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.

                                      RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.

                                      rendimiento rlsd

                                      RLSD supera a otras técnicas en puntos de referencia clave (fuente: arXiv)

                                      Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».

                                      A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.

                                      Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».

                                      En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.

                                      Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.

                                      Cómo pueden empezar las empresas

                                      Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados ​​en preferencias», dijo Yang.

                                      Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.

                                      «Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».

                                      Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.

                                      De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.

                                      «Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.

                                      Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.

                                      Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.

                                      El problema del entrenamiento de modelos de razonamiento

                                      El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.

                                      Aprendizaje por refuerzo con recompensas verificables (RLVR)

                                      RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.

                                      Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.

                                      Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».

                                      destilación de políticas

                                      Destilación sobre políticas (OPD)

                                      La promesa y el fracaso de la autodestilación

                                      La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.

                                      Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.

                                      OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.

                                      Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».

                                      «El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».

                                      autodestilación sobre políticas

                                      Autodestilación dentro de las políticas (OPSD)

                                      Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.

                                      En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.

                                      Desacoplar la dirección de la magnitud con RLSD

                                      Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.

                                      Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.

                                      RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.

                                      RLSD

                                      Aprendizaje por refuerzo con autodestilación (RLSD) (fuente: arXiv)

                                      El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.

                                      Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.

                                      En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.

                                      «La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».

                                      Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.

                                      Poniendo a RLSD a prueba

                                      Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.

                                      Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.

                                      RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.

                                      rendimiento rlsd

                                      RLSD supera a otras técnicas en puntos de referencia clave (fuente: arXiv)

                                      Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».

                                      A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.

                                      Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».

                                      En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.

                                      Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.

                                      Cómo pueden empezar las empresas

                                      Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados ​​en preferencias», dijo Yang.

                                      Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.

                                      «Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».

                                      Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.

                                      De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.

                                      «Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.

                                      Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.

                                      Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.

                                      El problema del entrenamiento de modelos de razonamiento

                                      El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.

                                      Aprendizaje por refuerzo con recompensas verificables (RLVR)

                                      RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.

                                      Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.

                                      Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».

                                      destilación de políticas

                                      Destilación sobre políticas (OPD)

                                      La promesa y el fracaso de la autodestilación

                                      La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.

                                      Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.

                                      OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.

                                      Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».

                                      «El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».

                                      autodestilación sobre políticas

                                      Autodestilación dentro de las políticas (OPSD)

                                      Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.

                                      En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.

                                      Desacoplar la dirección de la magnitud con RLSD

                                      Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.

                                      Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.

                                      RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.

                                      RLSD

                                      Aprendizaje por refuerzo con autodestilación (RLSD) (fuente: arXiv)

                                      El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.

                                      Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.

                                      En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.

                                      «La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».

                                      Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.

                                      Poniendo a RLSD a prueba

                                      Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.

                                      Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.

                                      RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.

                                      rendimiento rlsd

                                      RLSD supera a otras técnicas en puntos de referencia clave (fuente: arXiv)

                                      Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».

                                      A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.

                                      Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».

                                      En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.

                                      Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.

                                      Cómo pueden empezar las empresas

                                      Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados ​​en preferencias», dijo Yang.

                                      Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.

                                      «Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».

                                      Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.

                                      De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.

                                      «Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Entrenar modelos de razonamiento de IA exige recursos que la mayoría de los equipos empresariales no tienen. Los equipos de ingeniería a menudo se ven obligados a elegir entre extraer conocimiento de modelos grandes y costosos o confiar en técnicas de aprendizaje por refuerzo que brindan escasa retroalimentación.

                                      Investigadores de JD.com y varias instituciones académicas introdujeron recientemente un nuevo paradigma de formación que evita este dilema. La técnica, llamada Aprendizaje por refuerzo con recompensas verificables con autodestilación (RLSD), combina el seguimiento confiable del rendimiento del aprendizaje por refuerzo con la retroalimentación granular de la autodestilación.

                                      Los experimentos indican que los modelos entrenados con RLSD superan a los construidos con algoritmos clásicos de destilación y aprendizaje por refuerzo. Para los equipos empresariales, este enfoque reduce las barreras técnicas y financieras para crear modelos de razonamiento personalizados adaptados a una lógica empresarial específica.

                                      El problema del entrenamiento de modelos de razonamiento

                                      El método estándar para entrenar modelos de razonamiento es Aprendizaje por refuerzo con recompensas verificables (RLVR). En este paradigma, el modelo aprende mediante prueba y error, guiado por un resultado final de su entorno. Un verificador automático verifica si la respuesta del modelo es correcta o incorrecta y proporciona una recompensa binaria, como 0 o 1.

                                      Aprendizaje por refuerzo con recompensas verificables (RLVR)

                                      RLVR sufre de retroalimentación escasa y uniforme. «El GRPO estándar tiene un problema de densidad de señal», dijo a VentureBeat Chenxu Yang, coautor del artículo. «Un rastro de razonamiento de varios miles de tokens obtiene una única recompensa binaria, y cada token dentro de ese rastro recibe un crédito idéntico, ya sea un paso lógico fundamental o una frase desechable». En consecuencia, el modelo nunca aprende qué pasos intermedios llevaron a su éxito o fracaso.

                                      Destilación dentro de las políticas (OPD) adopta un enfoque diferente. En lugar de esperar un resultado final, los desarrolladores combinan un modelo de estudiante más pequeño con un modelo de maestro más grande y más capaz. Para cada ejemplo de capacitación, el estudiante compara su respuesta con la del maestro ficha por ficha. Esto proporciona al estudiante retroalimentación granular sobre toda la cadena de razonamiento y el proceso de generación de respuestas.

                                      Implementar y ejecutar un modelo de docente masivo e independiente junto con el estudiante durante todo el proceso de capacitación implica una enorme sobrecarga computacional. «Hay que mantener un modelo de maestro más grande residente durante toda la capacitación, lo que aproximadamente duplica la huella de la GPU», dijo Yang. Además, los modelos de profesor y estudiante deben compartir exactamente la misma estructura de vocabulario, lo que, según Yang, «descarta silenciosamente la mayoría de las configuraciones multiarquitectura, multimodalidad o multilingües que las empresas realmente ejecutan».

                                      destilación de políticas

                                      Destilación sobre políticas (OPD)

                                      La promesa y el fracaso de la autodestilación

                                      La autodestilación dentro de las políticas (OPSD) surgió como una solución diseñada para superar las deficiencias de los otros dos enfoques. En OPSD, el mismo modelo desempeña el papel tanto del alumno como del profesor.

                                      Durante la capacitación, el estudiante recibe un mensaje estándar mientras que el maestro recibe información privilegiada, como una clave de respuestas verificada paso a paso. Esta versión del modelo para docentes bien informados luego evalúa la versión del estudiante, brindando retroalimentación token por token mientras el estudiante intenta resolver el problema usando solo el mensaje estándar.

                                      OPSD parece ser el compromiso perfecto para un presupuesto empresarial. Ofrece la guía granular paso a paso de OPD. Debido a que elimina la necesidad de un modelo de maestro externo, opera con la alta eficiencia computacional y el bajo costo de RLVR, y solo requiere un pase directo adicional para el maestro.

                                      Sin embargo, los investigadores descubrieron que OPSD sufre un fenómeno llamado «fuga de información privilegiada».

                                      «El objetivo está estructuralmente mal planteado», afirmó Yang. «Existe una brecha irreductible de información mutua que el estudiante nunca podrá cerrar… Cuando la autodestilación se configura como coincidencia de distribución, se le pide al estudiante que imite la distribución completa de la producción del maestro en un contexto privilegiado».

                                      autodestilación sobre políticas

                                      Autodestilación dentro de las políticas (OPSD)

                                      Debido a que el maestro evalúa al estudiante basándose en una clave de respuestas oculta, el objetivo de capacitación obliga al modelo del estudiante a aprender las frases o los pasos exactos del maestro en lugar de la lógica de razonamiento subyacente. Como resultado, el modelo de estudiante comienza a alucinar referencias a una solución invisible a la que no tendrá acceso en una implementación del mundo real.

                                      En la práctica, los modelos OPSD muestran un rápido aumento en el rendimiento al principio del entrenamiento, pero sus capacidades de razonamiento pronto se estabilizan y se degradan progresivamente con el tiempo.

                                      Desacoplar la dirección de la magnitud con RLSD

                                      Los investigadores detrás de RLSD se dieron cuenta de que las señales que gobiernan cómo un modelo actualiza sus parámetros tienen requisitos fundamentalmente asimétricos. Identificaron que la señal que dicta la dirección de la actualización (es decir, si reforzar o penalizar un comportamiento) puede ser escasa, pero debe ser perfectamente confiable, porque apuntar el modelo en la dirección equivocada daña su política de razonamiento.

                                      Por otro lado, la señal que dicta la magnitud de la actualización (es decir, cuánto crédito o culpa relativa merece un paso específico) se beneficia de ser extremadamente densa para permitir correcciones detalladas, paso a paso.

                                      RLSD se basa en este principio al desacoplar la dirección de actualización de la magnitud de la actualización. El marco permite que la retroalimentación ambiental verificable de la señal RLVR determine estrictamente la dirección del aprendizaje. El modelo sólo recibe refuerzo global si la respuesta final es objetivamente correcta.

                                      RLSD

                                      Aprendizaje por refuerzo con autodestilación (RLSD) (fuente: arXiv)

                                      El autodidacta queda despojado de su poder de dictar lo que el modelo debe generar. En lugar de ello, la evaluación del docente, ficha por ficha, se reutiliza para determinar la magnitud de la actualización. Simplemente distribuye el crédito o la culpa total entre los pasos individuales del camino de razonamiento del modelo.

                                      Esto altera la forma en que aprende el modelo en comparación con el paradigma OPSD clásico. En OPSD estándar, el objetivo de capacitación actúa como una clonación de comportamiento, donde el modelo se ve obligado a copiar directamente las palabras y frases exactas del maestro. Esto provoca que el estudiante alucine y filtre referencias a datos que no tiene.

                                      En lugar de obligar al modelo a copiar una solución oculta, RLSD proporciona una fuente natural y prácticamente gratuita de información crediticia por token.

                                      «La intuición: no estamos enseñando al modelo a razonar como el maestro», dijo Yang. «Le estamos diciendo al modelo, en el camino que eligió, cuáles de sus propios tokens estaban realmente haciendo el trabajo. La distribución de exploración del modelo sigue siendo la misma. Sólo se agudiza la asignación de crédito».

                                      Si una deducción específica respalda firmemente el resultado correcto, recibe una puntuación más alta. Si es sólo una palabra de relleno inútil, recibe una puntuación de referencia. RLSD elimina la necesidad de entrenar redes de recompensa auxiliares complejas, anotar manualmente datos paso a paso o mantener modelos docentes externos masivos.

                                      Poniendo a RLSD a prueba

                                      Para probar RLSD, los investigadores entrenaron el modelo de visión y lenguaje Qwen3-VL-8B de peso abierto y lo evaluaron en varios puntos de referencia de razonamiento visual. Estos incluían MMMU para preguntas multidisciplinarias de nivel universitario, MathVista, MathVision, WeMath y ZeroBench, un punto de referencia de prueba de estrés diseñado explícitamente para ser casi imposible para los modelos de frontera actuales.

                                      Compararon el modelo RLSD con el modelo base sin entrenamiento posterior, RLVR estándar a través del algoritmo GRPO, OPSD estándar y una combinación híbrida de los dos.

                                      RLSD superó significativamente a todos los demás métodos, logrando la precisión promedio más alta del 56,18 % en los cinco puntos de referencia. Superó al modelo base en un 4,69% y superó al RLVR estándar en un 2,32%. Las ganancias fueron más pronunciadas en tareas complejas de razonamiento matemático, donde RLSD superó al RLVR estándar en un 3,91 % en el punto de referencia MathVision.

                                      rendimiento rlsd

                                      RLSD supera a otras técnicas en puntos de referencia clave (fuente: arXiv)

                                      Más allá de la precisión, el marco ofrece enormes ganancias en eficiencia. «Concretamente, RLSD en 200 pasos de entrenamiento ya supera a GRPO entrenado en 400 pasos, por lo que aproximadamente el doble de velocidad de convergencia», dijo Yang. «En cuanto a los costos, el único gasto adicional más allá de una canalización GRPO normal es un paso hacia adelante adicional por respuesta para capturar los logits de los docentes. En comparación con la generación de implementación… eso es básicamente gratis».

                                      A diferencia de OPSD, que experimentó un aumento en el rendimiento y luego un colapso total debido a la fuga de información, RLSD mantuvo la estabilidad del entrenamiento a largo plazo y convergió en un techo de rendimiento más alto que los métodos estándar.

                                      Los hallazgos cualitativos resaltan cómo el modelo altera su comportamiento de aprendizaje. Por ejemplo, en una tarea compleja de conteo visual, el RLVR estándar analiza la respuesta correcta final y otorga la misma recompensa a todo el párrafo de fichas de razonamiento. RLSD aplicó quirúrgicamente recompensas a los pasos de resta matemática específicos que resolvieron el problema, mientras restaba importancia activamente al texto de relleno genérico como «Mirando la imagen, veo…».

                                      En otro ejemplo, el modelo realizó una derivación matemática incorrecta basada en un gráfico de barras. En lugar de etiquetar toda la respuesta como un fracaso, RLSD concentró la penalización más severa en el punto exacto donde el modelo leyó mal una relación del gráfico. Se mantuvo neutral respecto del resto de la configuración lógica, reconociendo que el marco inicial era válido.

                                      Esto es particularmente importante para casos de uso empresarial complicados del mundo real. Si un modelo comete un error al analizar un informe de ganancias trimestrales de 50 páginas, los desarrolladores no quieren que desaprenda todo su marco analítico. Sólo quieren que corrija la suposición específica en la que se equivocaron. RLSD permite que el modelo aprenda exactamente qué saltos lógicos son valiosos y cuáles son defectuosos, token por token. Debido a que RLSD hace esto reutilizando el modelo en sí, proporciona a los modelos capacidades de razonamiento granular y al mismo tiempo mantiene razonables los costos de capacitación.

                                      Cómo pueden empezar las empresas

                                      Para los ingenieros de datos y los equipos de orquestación de IA, integrar RLSD es sencillo, pero requiere la configuración adecuada. El requisito más crítico es una señal de recompensa verificable, como compiladores de código, verificadores matemáticos, ejecución de SQL o validadores de esquemas. «Las tareas sin recompensa verificable (diálogo abierto, redacción de la voz de la marca) pertenecen a procesos basados ​​en preferencias», dijo Yang.

                                      Sin embargo, RLSD es muy flexible con respecto a la información privilegiada que requiere. Mientras que OPSD requiere estructuralmente trazas de razonamiento intermedias completas, lo que obliga a las empresas a pagar a los anotadores o destilarse de un modelo de frontera, RLSD no lo hace.

                                      «Si tiene rastros de razonamiento completamente verificados, genial, RLSD los utilizará», dijo Yang. «Si todo lo que tienes es la respuesta final basada en la verdad, eso también funciona… OPSD no tiene esta flexibilidad».

                                      Integrar la técnica en marcos de RL multimodales de código abierto existentes como veRL o EasyR1 es increíblemente ligero. Según Yang, no requiere reescritura del marco y se integra directamente en la pila estándar. El intercambio de código implica simplemente cambiar decenas de líneas para ajustar el objetivo de GRPO y sincronizar al profesor con el alumno.

                                      De cara al futuro, RLSD ofrece una forma poderosa para que las empresas maximicen sus activos internos existentes.

                                      «Los datos patentados que las empresas mantienen dentro de su perímetro (manuales de cumplimiento, documentación interna, tickets históricos, fragmentos de códigos verificados) son esencialmente información privilegiada y gratuita», concluyó Yang. «RLSD permite a las empresas alimentar este tipo de datos directamente en un contexto privilegiado, lo que agudiza la señal de aprendizaje en modelos más pequeños sin necesidad de un profesor externo y sin enviar nada fuera de la red».

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      — Redacción Despertar Matinal

                                      — Redacción Despertar Matinal

                                      Programa radial que te conecta con la información desde temprano en la mañana.

                                      Next Post
                                      Mire en vivo: Los candidatos se enfrentan en el debate del gobernador de California de CBS antes de las primarias del 2 de junio

                                      Mire en vivo: Los candidatos se enfrentan en el debate del gobernador de California de CBS antes de las primarias del 2 de junio

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • La Justicia fijó fecha para los juicios orales de Cristina Kirchner y Lázaro Báez por Hotesur y Los Sauces

                                        La Justicia fijó fecha para los juicios orales de Cristina Kirchner y Lázaro Báez por Hotesur y Los Sauces

                                        0 shares
                                        Share 0 Tweet 0
                                      • Río Tercero celebró su 113ª aniversario con un desfile cívico militar y la presencia de Llaryora

                                        0 shares
                                        Share 0 Tweet 0
                                      • La Unión Europea endureció su postura frente a China por el creciente déficit comercial

                                        0 shares
                                        Share 0 Tweet 0
                                      • Kempton Park killings: Ninth woman’s body found in South Africa’s Dawn Park

                                        0 shares
                                        Share 0 Tweet 0
                                      • El impuestazo que Daniel Passerini intenta reflotar pese al freno de la Corte Suprema

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por