• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
miércoles, octubre 7, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    Fernando Langa agradece con humildad y reflexión el respaldo recibido para estar al frente de la Suprema

    Fernando Langa agradece con humildad y reflexión el respaldo recibido para estar al frente de la Suprema

    Fuerza del Pueblo: “El Presupuesto 2027 oculta cifras, se endeuda para pagar intereses y subsidios, pero reduce el espacio para invertir en la gente”

    Fuerza del Pueblo: “El Presupuesto 2027 oculta cifras, se endeuda para pagar intereses y subsidios, pero reduce el espacio para invertir en la gente”

    Pelegrín Castillo: “Advierto de planes de unir RD-Haití; podríamos perder el país; llama a élites RD dejar cobardía”

    Pelegrín Castillo: “Advierto de planes de unir RD-Haití; podríamos perder el país; llama a élites RD dejar cobardía”

    Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 a 16,800, proyecto estaba quebrado 16,800, proyecto estaba quebrado

    Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 a 16,800, proyecto estaba quebrado 16,800, proyecto estaba quebrado

    MP presenta acusación formal por soborno contra fiscal Aurelio Valdez Alcántara

    Ministerio Público pide enviar a juicio a exfiscal acusado de exigir US$150,000

    Aspirantes a dirigir el Colegio de Abogados convocan marcha para exigir elecciones

    Aspirantes a dirigir el Colegio de Abogados convocan marcha para exigir elecciones

    César Fernández afirma que la Fuerza del Pueblo inaugurará el monorriel de Santiago porque el Gobierno no lo terminará

    César Fernández afirma que la Fuerza del Pueblo inaugurará el monorriel de Santiago porque el Gobierno no lo terminará

    Leonel afirma que la “ineptitud” del PRM se refleja en inseguridad ciudadana y alto costo de la vida

    Leonel afirma que la “ineptitud” del PRM se refleja en inseguridad ciudadana y alto costo de la vida

    Méndez asume dirección del INTRANT con firme convicción de hacer cumplir la ley

    Sociedad Dominicana de Oncología Médica asegura CNSS dejó fuera tratamientos eficaces contra cáncer

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      GTA 6: Rockstar reveló cómo funcionarán las redes sociales y qué se podrá hacer con el celular

      GTA 6: Rockstar reveló cómo funcionarán las redes sociales y qué se podrá hacer con el celular

      Aleksandar Vučic renunció a la presidencia de Serbia y abre el camino a elecciones anticipadas

      Aleksandar Vučic renunció a la presidencia de Serbia y abre el camino a elecciones anticipadas

      Autoridades de Países Bajos revisaron a los pasajeros de Tel Aviv en busca de productos israelíes

      Autoridades de Países Bajos revisaron a los pasajeros de Tel Aviv en busca de productos israelíes

      El dictador Lula destinará millones para comprar deudas de las familias a días de las elecciones

      El dictador Lula destinará millones para comprar deudas de las familias a días de las elecciones

      Mauricio Macri intentó relanzar el PRO en Jujuy pero no fue nadie

      Mauricio Macri intentó relanzar el PRO en Jujuy pero no fue nadie

      Detuvieron a tres inmigrantes ilegales chinos en Formosa y serán deportados por el Gobierno de Milei

      Detuvieron a tres inmigrantes ilegales chinos en Formosa y serán deportados por el Gobierno de Milei

      A casi diez años de la tragedia aérea, Atlético Nacional y Chapecoense se reencontraron en un emotivo amistoso

      A casi diez años de la tragedia aérea, Atlético Nacional y Chapecoense se reencontraron en un emotivo amistoso

      Un referente de la Fórmula 1 salió a bancar a Franco Colapinto tras su accidente en Bakú: "Tienes que admirarlo"

      Un referente de la Fórmula 1 salió a bancar a Franco Colapinto tras su accidente en Bakú: «Tienes que admirarlo»

      Colombia extraditó a EEUU a un líder de la disidencia de las FARC acusado de narcotráfico

      Colombia extraditó a EEUU a un líder de la disidencia de las FARC acusado de narcotráfico

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        Fernando Langa agradece con humildad y reflexión el respaldo recibido para estar al frente de la Suprema

        Fernando Langa agradece con humildad y reflexión el respaldo recibido para estar al frente de la Suprema

        Ministerio de Trabajo y la OIT preparan Programa de Trabajo...

        Ministerio de Trabajo y la OIT preparan Programa de Trabajo…

        Conozca quienes se reúnen para impulsar la integración regional...

        Conozca quienes se reúnen para impulsar la integración regional…

        Ministerio de Trabajo y la OIT preparan Programa de Trabajo Decente de la República Dominicana

        Ministerio de Trabajo y la OIT preparan Programa de Trabajo Decente de la República Dominicana

        Fuerza del Pueblo: “El Presupuesto 2027 oculta cifras, se endeuda para pagar intereses y subsidios, pero reduce el espacio para invertir en la gente”

        Fuerza del Pueblo: “El Presupuesto 2027 oculta cifras, se endeuda para pagar intereses y subsidios, pero reduce el espacio para invertir en la gente”

        Pelegrín Castillo: “Advierto de planes de unir RD-Haití; podríamos perder el país; llama a élites RD dejar cobardía”

        Pelegrín Castillo: “Advierto de planes de unir RD-Haití; podríamos perder el país; llama a élites RD dejar cobardía”

        ONEC: El comercio sufre una disminución real acumulada entre...

        ONEC: El comercio sufre una disminución real acumulada entre…

        Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 a 16,800, proyecto estaba quebrado 16,800, proyecto estaba quebrado

        Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 a 16,800, proyecto estaba quebrado 16,800, proyecto estaba quebrado

        MP presenta acusación formal por soborno contra fiscal Aurelio Valdez Alcántara

        Ministerio Público pide enviar a juicio a exfiscal acusado de exigir US$150,000

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          FA rechaza derogación aranceles a importación de arroz y...

          FA rechaza derogación aranceles a importación de arroz y…

          Leonel Fernández acusa al PRM de “ineptitud” y fracaso en seguridad y costo de vida

          Leonel Fernández acusa al PRM de “ineptitud” y fracaso en seguridad y costo de vida

          Leonel afirma que la "ineptitud” del PRM se refleja en inseguridad ciudadana y alto costo de la vida

          Leonel afirma que la «ineptitud” del PRM se refleja en inseguridad ciudadana y alto costo de la vida

          Wellington Arnaud consolida respaldo del liderazgo perremeista...

          Wellington Arnaud consolida respaldo del liderazgo perremeista…

          José Laluz: el PLD es un "cascarón electoral"

          José Laluz: el PLD es un «cascarón electoral»

          Dos regidores de la FP anuncian su respaldo a las aspiraciones de la diputada Dulce Rojas a la Alcaldía de SDN

          Dos regidores de la FP anuncian su respaldo a las aspiraciones de la diputada Dulce Rojas a la Alcaldía de SDN

          Wellington Arnaud destaca avances en agua y saneamiento

          Wellington Arnaud destaca avances en agua y saneamiento

          Zoraima Cuello plantea RD debe asumir estrategia nacional para uso la IA en Educación

          Zoraima Cuello plantea RD debe asumir estrategia nacional para uso la IA en Educación

          Francisco Javier García dice el PLD no se detendrá hasta alcanzar el poder en el año 2028

          Francisco Javier García dice el PLD no se detendrá hasta alcanzar el poder en el año 2028

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                El voto latino no es un bloque homogéneo: así se divide

                El voto latino no es un bloque homogéneo: así se divide

                ¿Quién es Flávio Bolsonaro, candidato que lideró primera vuelta?

                ¿Quién es Flávio Bolsonaro, candidato que lideró primera vuelta?

                ¿Quién es Lula da Silva, el presidente que enfrenta ultraderecha?

                ¿Quién es Lula da Silva, el presidente que enfrenta ultraderecha?

                El retraso en la campaña electoral en Haití causa incertidumbre

                El retraso en la campaña electoral en Haití causa incertidumbre

                El separatista Partido Quebequés gana las elecciones en Quebec

                El separatista Partido Quebequés gana las elecciones en Quebec

                Carolin Matos: “La cuna de la Constitución es la cuna del olvido”

                Carolin Matos: “La cuna de la Constitución es la cuna del olvido”

                Milton Morrison y País Posible juramentan 970 nuevos en el Cibao

                Milton Morrison y País Posible juramentan 970 nuevos en el Cibao

                TSE convoca oficialmente a salvadoreños a las Elecciones 2027

                TSE convoca oficialmente a salvadoreños a las Elecciones 2027

                Pedro Sánchez convoca elecciones generales en España

                Pedro Sánchez convoca elecciones generales en España

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  Un jurado de Nuevo México declara a Facebook responsable de engañar a los usuarios sobre la protección de la privacidad

                  Un jurado de Nuevo México declara a Facebook responsable de engañar a los usuarios sobre la protección de la privacidad

                  Nave espacial privada regresa a la Tierra después de no poder rescatar el viejo telescopio de la NASA

                  Nave espacial privada regresa a la Tierra después de no poder rescatar el viejo telescopio de la NASA

                  La UE promete defender su postura contra X después de que Estados Unidos respalde una impugnación judicial de Elon Musk

                  La UE promete defender su postura contra X después de que Estados Unidos respalde una impugnación judicial de Elon Musk

                  A 40 días de las elecciones intermedias, los funcionarios electorales dicen que el nuevo plan cibernético de EE. UU. llega demasiado tarde

                  A 40 días de las elecciones intermedias, los funcionarios electorales dicen que el nuevo plan cibernético de EE. UU. llega demasiado tarde

                  Ha sido una intensa temporada de huracanes en el Pacífico y aún queda mucho camino por recorrer

                  Ha sido una intensa temporada de huracanes en el Pacífico y aún queda mucho camino por recorrer

                  Las empresas automotrices chinas avanzan en la tecnología de vehículos eléctricos y logran una carga ultrarrápida en cinco minutos

                  Las empresas automotrices chinas avanzan en la tecnología de vehículos eléctricos y logran una carga ultrarrápida en cinco minutos

                  Los hacks autónomos de IA plantean cuestiones espinosas sobre la responsabilidad legal

                  Los hacks autónomos de IA plantean cuestiones espinosas sobre la responsabilidad legal

                  Panel de la FDA respalda el primer análisis de sangre para cáncer de Grail

                  Panel de la FDA respalda el primer análisis de sangre para cáncer de Grail

                  Líderes tecnológicos a la ONU: Por el bien de la humanidad, controlen la tecnología de inteligencia artificial que creamos

                  Líderes tecnológicos a la ONU: Por el bien de la humanidad, controlen la tecnología de inteligencia artificial que creamos

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                    Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      Fernando Langa agradece con humildad y reflexión el respaldo recibido para estar al frente de la Suprema

                      Fernando Langa agradece con humildad y reflexión el respaldo recibido para estar al frente de la Suprema

                      Fuerza del Pueblo: “El Presupuesto 2027 oculta cifras, se endeuda para pagar intereses y subsidios, pero reduce el espacio para invertir en la gente”

                      Fuerza del Pueblo: “El Presupuesto 2027 oculta cifras, se endeuda para pagar intereses y subsidios, pero reduce el espacio para invertir en la gente”

                      Pelegrín Castillo: “Advierto de planes de unir RD-Haití; podríamos perder el país; llama a élites RD dejar cobardía”

                      Pelegrín Castillo: “Advierto de planes de unir RD-Haití; podríamos perder el país; llama a élites RD dejar cobardía”

                      Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 a 16,800, proyecto estaba quebrado 16,800, proyecto estaba quebrado

                      Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 a 16,800, proyecto estaba quebrado 16,800, proyecto estaba quebrado

                      MP presenta acusación formal por soborno contra fiscal Aurelio Valdez Alcántara

                      Ministerio Público pide enviar a juicio a exfiscal acusado de exigir US$150,000

                      Aspirantes a dirigir el Colegio de Abogados convocan marcha para exigir elecciones

                      Aspirantes a dirigir el Colegio de Abogados convocan marcha para exigir elecciones

                      César Fernández afirma que la Fuerza del Pueblo inaugurará el monorriel de Santiago porque el Gobierno no lo terminará

                      César Fernández afirma que la Fuerza del Pueblo inaugurará el monorriel de Santiago porque el Gobierno no lo terminará

                      Leonel afirma que la “ineptitud” del PRM se refleja en inseguridad ciudadana y alto costo de la vida

                      Leonel afirma que la “ineptitud” del PRM se refleja en inseguridad ciudadana y alto costo de la vida

                      Méndez asume dirección del INTRANT con firme convicción de hacer cumplir la ley

                      Sociedad Dominicana de Oncología Médica asegura CNSS dejó fuera tratamientos eficaces contra cáncer

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        GTA 6: Rockstar reveló cómo funcionarán las redes sociales y qué se podrá hacer con el celular

                        GTA 6: Rockstar reveló cómo funcionarán las redes sociales y qué se podrá hacer con el celular

                        Aleksandar Vučic renunció a la presidencia de Serbia y abre el camino a elecciones anticipadas

                        Aleksandar Vučic renunció a la presidencia de Serbia y abre el camino a elecciones anticipadas

                        Autoridades de Países Bajos revisaron a los pasajeros de Tel Aviv en busca de productos israelíes

                        Autoridades de Países Bajos revisaron a los pasajeros de Tel Aviv en busca de productos israelíes

                        El dictador Lula destinará millones para comprar deudas de las familias a días de las elecciones

                        El dictador Lula destinará millones para comprar deudas de las familias a días de las elecciones

                        Mauricio Macri intentó relanzar el PRO en Jujuy pero no fue nadie

                        Mauricio Macri intentó relanzar el PRO en Jujuy pero no fue nadie

                        Detuvieron a tres inmigrantes ilegales chinos en Formosa y serán deportados por el Gobierno de Milei

                        Detuvieron a tres inmigrantes ilegales chinos en Formosa y serán deportados por el Gobierno de Milei

                        A casi diez años de la tragedia aérea, Atlético Nacional y Chapecoense se reencontraron en un emotivo amistoso

                        A casi diez años de la tragedia aérea, Atlético Nacional y Chapecoense se reencontraron en un emotivo amistoso

                        Un referente de la Fórmula 1 salió a bancar a Franco Colapinto tras su accidente en Bakú: "Tienes que admirarlo"

                        Un referente de la Fórmula 1 salió a bancar a Franco Colapinto tras su accidente en Bakú: «Tienes que admirarlo»

                        Colombia extraditó a EEUU a un líder de la disidencia de las FARC acusado de narcotráfico

                        Colombia extraditó a EEUU a un líder de la disidencia de las FARC acusado de narcotráfico

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          Fernando Langa agradece con humildad y reflexión el respaldo recibido para estar al frente de la Suprema

                          Fernando Langa agradece con humildad y reflexión el respaldo recibido para estar al frente de la Suprema

                          Ministerio de Trabajo y la OIT preparan Programa de Trabajo...

                          Ministerio de Trabajo y la OIT preparan Programa de Trabajo…

                          Conozca quienes se reúnen para impulsar la integración regional...

                          Conozca quienes se reúnen para impulsar la integración regional…

                          Ministerio de Trabajo y la OIT preparan Programa de Trabajo Decente de la República Dominicana

                          Ministerio de Trabajo y la OIT preparan Programa de Trabajo Decente de la República Dominicana

                          Fuerza del Pueblo: “El Presupuesto 2027 oculta cifras, se endeuda para pagar intereses y subsidios, pero reduce el espacio para invertir en la gente”

                          Fuerza del Pueblo: “El Presupuesto 2027 oculta cifras, se endeuda para pagar intereses y subsidios, pero reduce el espacio para invertir en la gente”

                          Pelegrín Castillo: “Advierto de planes de unir RD-Haití; podríamos perder el país; llama a élites RD dejar cobardía”

                          Pelegrín Castillo: “Advierto de planes de unir RD-Haití; podríamos perder el país; llama a élites RD dejar cobardía”

                          ONEC: El comercio sufre una disminución real acumulada entre...

                          ONEC: El comercio sufre una disminución real acumulada entre…

                          Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 a 16,800, proyecto estaba quebrado 16,800, proyecto estaba quebrado

                          Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 Gobierno triplica viviendas encontradas en Ciudad Juan Bosch: pasaron de 4,600 a 16,800, proyecto estaba quebrado 16,800, proyecto estaba quebrado

                          MP presenta acusación formal por soborno contra fiscal Aurelio Valdez Alcántara

                          Ministerio Público pide enviar a juicio a exfiscal acusado de exigir US$150,000

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            FA rechaza derogación aranceles a importación de arroz y...

                            FA rechaza derogación aranceles a importación de arroz y…

                            Leonel Fernández acusa al PRM de “ineptitud” y fracaso en seguridad y costo de vida

                            Leonel Fernández acusa al PRM de “ineptitud” y fracaso en seguridad y costo de vida

                            Leonel afirma que la "ineptitud” del PRM se refleja en inseguridad ciudadana y alto costo de la vida

                            Leonel afirma que la «ineptitud” del PRM se refleja en inseguridad ciudadana y alto costo de la vida

                            Wellington Arnaud consolida respaldo del liderazgo perremeista...

                            Wellington Arnaud consolida respaldo del liderazgo perremeista…

                            José Laluz: el PLD es un "cascarón electoral"

                            José Laluz: el PLD es un «cascarón electoral»

                            Dos regidores de la FP anuncian su respaldo a las aspiraciones de la diputada Dulce Rojas a la Alcaldía de SDN

                            Dos regidores de la FP anuncian su respaldo a las aspiraciones de la diputada Dulce Rojas a la Alcaldía de SDN

                            Wellington Arnaud destaca avances en agua y saneamiento

                            Wellington Arnaud destaca avances en agua y saneamiento

                            Zoraima Cuello plantea RD debe asumir estrategia nacional para uso la IA en Educación

                            Zoraima Cuello plantea RD debe asumir estrategia nacional para uso la IA en Educación

                            Francisco Javier García dice el PLD no se detendrá hasta alcanzar el poder en el año 2028

                            Francisco Javier García dice el PLD no se detendrá hasta alcanzar el poder en el año 2028

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  El voto latino no es un bloque homogéneo: así se divide

                                  El voto latino no es un bloque homogéneo: así se divide

                                  ¿Quién es Flávio Bolsonaro, candidato que lideró primera vuelta?

                                  ¿Quién es Flávio Bolsonaro, candidato que lideró primera vuelta?

                                  ¿Quién es Lula da Silva, el presidente que enfrenta ultraderecha?

                                  ¿Quién es Lula da Silva, el presidente que enfrenta ultraderecha?

                                  El retraso en la campaña electoral en Haití causa incertidumbre

                                  El retraso en la campaña electoral en Haití causa incertidumbre

                                  El separatista Partido Quebequés gana las elecciones en Quebec

                                  El separatista Partido Quebequés gana las elecciones en Quebec

                                  Carolin Matos: “La cuna de la Constitución es la cuna del olvido”

                                  Carolin Matos: “La cuna de la Constitución es la cuna del olvido”

                                  Milton Morrison y País Posible juramentan 970 nuevos en el Cibao

                                  Milton Morrison y País Posible juramentan 970 nuevos en el Cibao

                                  TSE convoca oficialmente a salvadoreños a las Elecciones 2027

                                  TSE convoca oficialmente a salvadoreños a las Elecciones 2027

                                  Pedro Sánchez convoca elecciones generales en España

                                  Pedro Sánchez convoca elecciones generales en España

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    Un jurado de Nuevo México declara a Facebook responsable de engañar a los usuarios sobre la protección de la privacidad

                                    Un jurado de Nuevo México declara a Facebook responsable de engañar a los usuarios sobre la protección de la privacidad

                                    Nave espacial privada regresa a la Tierra después de no poder rescatar el viejo telescopio de la NASA

                                    Nave espacial privada regresa a la Tierra después de no poder rescatar el viejo telescopio de la NASA

                                    La UE promete defender su postura contra X después de que Estados Unidos respalde una impugnación judicial de Elon Musk

                                    La UE promete defender su postura contra X después de que Estados Unidos respalde una impugnación judicial de Elon Musk

                                    A 40 días de las elecciones intermedias, los funcionarios electorales dicen que el nuevo plan cibernético de EE. UU. llega demasiado tarde

                                    A 40 días de las elecciones intermedias, los funcionarios electorales dicen que el nuevo plan cibernético de EE. UU. llega demasiado tarde

                                    Ha sido una intensa temporada de huracanes en el Pacífico y aún queda mucho camino por recorrer

                                    Ha sido una intensa temporada de huracanes en el Pacífico y aún queda mucho camino por recorrer

                                    Las empresas automotrices chinas avanzan en la tecnología de vehículos eléctricos y logran una carga ultrarrápida en cinco minutos

                                    Las empresas automotrices chinas avanzan en la tecnología de vehículos eléctricos y logran una carga ultrarrápida en cinco minutos

                                    Los hacks autónomos de IA plantean cuestiones espinosas sobre la responsabilidad legal

                                    Los hacks autónomos de IA plantean cuestiones espinosas sobre la responsabilidad legal

                                    Panel de la FDA respalda el primer análisis de sangre para cáncer de Grail

                                    Panel de la FDA respalda el primer análisis de sangre para cáncer de Grail

                                    Líderes tecnológicos a la ONU: Por el bien de la humanidad, controlen la tecnología de inteligencia artificial que creamos

                                    Líderes tecnológicos a la ONU: Por el bien de la humanidad, controlen la tecnología de inteligencia artificial que creamos

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      Los investigadores presentan Self-Harness, un marco que permite a los agentes de IA reescribir sus propias reglas, aumentando el rendimiento hasta en un 60%

                                      by Jorge Polanco
                                      22 de junio de 2026
                                      in Tecnología
                                      0
                                      Los investigadores presentan Self-Harness, un marco que permite a los agentes de IA reescribir sus propias reglas, aumentando el rendimiento hasta en un 60%
                                      0
                                      SHARES
                                      15
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      Jorge Polanco

                                      Jorge Polanco

                                      Comunicador | Columnista de Opinión & Análisis especializado en turismo y gestión pública, con una mirada crítica sobre la política turística, el ordenamiento territorial y el discurso institucional del sector

                                      Next Post
                                      Por qué las empresas agentes necesitan convertirse en sistemas de aprendizaje

                                      Por qué las empresas agentes necesitan convertirse en sistemas de aprendizaje

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • Presidente Abinader encabezará este domingo Consejo de Ministros y Directores en la provincia San José de Ocoa

                                        Presidente Abinader encabezará este domingo Consejo de Ministros y Directores en la provincia San José de Ocoa

                                        0 shares
                                        Share 0 Tweet 0
                                      • Más de 300 partidos del MICFootball Punta Cana 2026 serán transmitidos en vivo para todo el mundo

                                        0 shares
                                        Share 0 Tweet 0
                                      • Ministerio de Trabajo y la OIT preparan Programa de Trabajo…

                                        0 shares
                                        Share 0 Tweet 0
                                      • Alejandro Cambiaso presenta en Guatemala el caso de éxito de República Dominicana en turismo de salud

                                        0 shares
                                        Share 0 Tweet 0
                                      • El separatista Partido Quebequés gana las elecciones en Quebec

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por