• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
viernes, agosto 21, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    ProCompetencia insta a blindar compras estatales contra la colusión

    ProCompetencia insta a blindar compras estatales contra la colusión

    Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

    Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

    PRD pasa a fase de crecimiento con miras a elecciones del 2028

    PRD pasa a fase de crecimiento con miras a elecciones del 2028

    Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

    Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

    Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

    Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

    Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

    Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

    Wilson Camacho defiende la necesidad de una prórroga para concluir investigación en caso Senasa

    Wilson Camacho defiende la necesidad de una prórroga para concluir investigación en caso Senasa

    Edward Guzmán advierte aumentan en SeNaSa las atenciones por accidentes de tránsito

    Edward Guzmán advierte aumentan en SeNaSa las atenciones por accidentes de tránsito

    Raúl Martínez pide a Ética investigar caso de Bienes Nacionales

    Raúl Martínez pide a Ética investigar caso de Bienes Nacionales

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      Netflix en septiembre de 2026: todos los estrenos de series, películas y anime

      Netflix en septiembre de 2026: todos los estrenos de series, películas y anime

      Abelardo renovó la cúpula militar y promete una ofensiva total contra el narcoterrorismo en Colombia

      Abelardo renovó la cúpula militar y promete una ofensiva total contra el narcoterrorismo en Colombia

      Alemania nombró al régimen chino como el principal promotor de la represión transnacional

      Alemania nombró al régimen chino como el principal promotor de la represión transnacional

      El Banco Central adquirió USD $89 millones y las reservas alcanzan su nivel mas alto desde 2019

      El Banco Central adquirió USD $89 millones y las reservas alcanzan su nivel mas alto desde 2019

      Filtran GTA VI y amenazan con revelar la historia: un usuario exige dinero y golpea a las acciones de Take-Two

      Filtran GTA VI y amenazan con revelar la historia: un usuario exige dinero y golpea a las acciones de Take-Two

      La Corte Suprema intervendrá en la causa por la reelección de Gildo Insfrán en Formosa

      La Corte Suprema intervendrá en la causa por la reelección de Gildo Insfrán en Formosa

      Los salarios crecieron 2,9% en junio y le ganaron a la inflación por tercer mes consecutivo

      Los salarios crecieron 2,9% en junio y le ganaron a la inflación por tercer mes consecutivo

      Franco Mastantuono habló de su salida del Real Madrid y explicó por qué eligió a la Fiorentina

      Franco Mastantuono habló de su salida del Real Madrid y explicó por qué eligió a la Fiorentina

      Una agenda para optimizar la actividad comercial en Córdoba

      Una agenda para optimizar la actividad comercial en Córdoba

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        ProCompetencia insta a blindar compras estatales contra la colusión

        ProCompetencia insta a blindar compras estatales contra la colusión

        Indotel, ADN y sector eléctrico inician retiro de 300 kilómetros...

        Indotel, ADN y sector eléctrico inician retiro de 300 kilómetros…

        Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

        Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

        PRD pasa a fase de crecimiento con miras a elecciones del 2028

        PRD pasa a fase de crecimiento con miras a elecciones del 2028

        Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

        Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

        Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

        Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

        UTECT otorgará más de nueve mil títulos de propiedad a familias...

        UTECT otorgará más de nueve mil títulos de propiedad a familias…

        Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

        Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

        Abinader dice Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia en compras del Estado

        Abinader dice Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia en compras del Estado

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Entérese quienes se integraron al proyecto presidencial de...

          Entérese quienes se integraron al proyecto presidencial de…

          FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

          FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

          Colombia Alcántara será moderadora del XIX congreso...

          Colombia Alcántara será moderadora del XIX congreso…

          Milton Morrison reafirma alianza con Abinader y anuncia nueva...

          Milton Morrison reafirma alianza con Abinader y anuncia nueva…

          Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

          Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

          PRM en Santo Domingo Norte resalta gestión del presidente...

          PRM en Santo Domingo Norte resalta gestión del presidente…

          ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

          ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

          Estados Unidos no descarta operación militar contra Cuba

          Estados Unidos no descarta operación militar contra Cuba

          Tribunal Constitucional ratifica que País Posible es la 7ma fuerza...

          Tribunal Constitucional ratifica que País Posible es la 7ma fuerza…

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                Rosenberg: Shortage of petrol but not patriotism as Russians feel growing impact of war

                Rosenberg: Shortage of petrol but not patriotism as Russians feel growing impact of war

                Bodies of two mountaineers discovered after Swiss glacier melts

                Bodies of two mountaineers discovered after Swiss glacier melts

                US debt has hit $40tn – Will that be a wake-up call?

                US debt has hit $40tn – Will that be a wake-up call?

                El Niño set to be 'strongest in living memory', says Met Office

                El Niño set to be ‘strongest in living memory’, says Met Office

                Panama Canal to cut number of ships passing through due to El Niño

                Panama Canal to cut number of ships passing through due to El Niño

                British rapper Yung Filly to face retrial on rape charges in Australia

                British rapper Yung Filly to face retrial on rape charges in Australia

                Hong Kong's Tiananmen Square activists guilty in national security trial

                Hong Kong’s Tiananmen Square activists guilty in national security trial

                Japan executes man who killed five in gaming parlour fire

                Japan executes man who killed five in gaming parlour fire

                Trump scales up Cuban sanctions targeting state-run companies

                Trump scales up Cuban sanctions targeting state-run companies

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                  Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                  Slack wants to drag AI coding out of the terminal and into the group chat

                  Slack wants to drag AI coding out of the terminal and into the group chat

                  Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                  Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                  Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                  Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                  NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                  NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                  A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                  A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                  Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                  Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                  Meta defiende sus esfuerzos por la seguridad infantil, pero los críticos dicen que el gigante de las redes sociales se queda corto

                  Meta defiende sus esfuerzos por la seguridad infantil, pero los críticos dicen que el gigante de las redes sociales se queda corto

                  Serval’s super agent Catalyst creates roving background agents to identify and fix IT issues before they’re ticketed

                  Serval’s super agent Catalyst creates roving background agents to identify and fix IT issues before they’re ticketed

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                    Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                    El jurado escucha a 'Keffe D' decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                    El jurado escucha a ‘Keffe D’ decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                    Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                    Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                    Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante 'Pulitzer on the Road'

                    Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante ‘Pulitzer on the Road’

                    Después de perder a un amigo y escribir 'Say So', Dan + Shay regresan con la autobiográfica 'Young'

                    Después de perder a un amigo y escribir ‘Say So’, Dan + Shay regresan con la autobiográfica ‘Young’

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    El Centro Kennedy dice a la corte que no intentará restaurar el nombre de Trump en el edificio antes del 8 de septiembre

                    Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane 'Keffe D' Davis

                    Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane ‘Keffe D’ Davis

                    El cofundador de ESPN, Bill Rasmussen, muere a los 93 años por los efectos de la enfermedad de Parkinson

                    El cofundador de ESPN, Bill Rasmussen, muere a los 93 años por los efectos de la enfermedad de Parkinson

                    Fox Sports transmitirá 35 partidos de voleibol femenino, incluidos 8 en Fox

                    Fox Sports transmitirá 35 partidos de voleibol femenino, incluidos 8 en Fox

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      ProCompetencia insta a blindar compras estatales contra la colusión

                      ProCompetencia insta a blindar compras estatales contra la colusión

                      Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                      Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                      PRD pasa a fase de crecimiento con miras a elecciones del 2028

                      PRD pasa a fase de crecimiento con miras a elecciones del 2028

                      Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

                      Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

                      Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

                      Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

                      Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

                      Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

                      Wilson Camacho defiende la necesidad de una prórroga para concluir investigación en caso Senasa

                      Wilson Camacho defiende la necesidad de una prórroga para concluir investigación en caso Senasa

                      Edward Guzmán advierte aumentan en SeNaSa las atenciones por accidentes de tránsito

                      Edward Guzmán advierte aumentan en SeNaSa las atenciones por accidentes de tránsito

                      Raúl Martínez pide a Ética investigar caso de Bienes Nacionales

                      Raúl Martínez pide a Ética investigar caso de Bienes Nacionales

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        Netflix en septiembre de 2026: todos los estrenos de series, películas y anime

                        Netflix en septiembre de 2026: todos los estrenos de series, películas y anime

                        Abelardo renovó la cúpula militar y promete una ofensiva total contra el narcoterrorismo en Colombia

                        Abelardo renovó la cúpula militar y promete una ofensiva total contra el narcoterrorismo en Colombia

                        Alemania nombró al régimen chino como el principal promotor de la represión transnacional

                        Alemania nombró al régimen chino como el principal promotor de la represión transnacional

                        El Banco Central adquirió USD $89 millones y las reservas alcanzan su nivel mas alto desde 2019

                        El Banco Central adquirió USD $89 millones y las reservas alcanzan su nivel mas alto desde 2019

                        Filtran GTA VI y amenazan con revelar la historia: un usuario exige dinero y golpea a las acciones de Take-Two

                        Filtran GTA VI y amenazan con revelar la historia: un usuario exige dinero y golpea a las acciones de Take-Two

                        La Corte Suprema intervendrá en la causa por la reelección de Gildo Insfrán en Formosa

                        La Corte Suprema intervendrá en la causa por la reelección de Gildo Insfrán en Formosa

                        Los salarios crecieron 2,9% en junio y le ganaron a la inflación por tercer mes consecutivo

                        Los salarios crecieron 2,9% en junio y le ganaron a la inflación por tercer mes consecutivo

                        Franco Mastantuono habló de su salida del Real Madrid y explicó por qué eligió a la Fiorentina

                        Franco Mastantuono habló de su salida del Real Madrid y explicó por qué eligió a la Fiorentina

                        Una agenda para optimizar la actividad comercial en Córdoba

                        Una agenda para optimizar la actividad comercial en Córdoba

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          ProCompetencia insta a blindar compras estatales contra la colusión

                          ProCompetencia insta a blindar compras estatales contra la colusión

                          Indotel, ADN y sector eléctrico inician retiro de 300 kilómetros...

                          Indotel, ADN y sector eléctrico inician retiro de 300 kilómetros…

                          Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                          Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                          PRD pasa a fase de crecimiento con miras a elecciones del 2028

                          PRD pasa a fase de crecimiento con miras a elecciones del 2028

                          Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

                          Juan Francisco Puello Herrera celebra 50 años de trayectoria docente en UNIBE

                          Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

                          Presidente Abinader destaca que Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia y eficiencia en las compras del Estado

                          UTECT otorgará más de nueve mil títulos de propiedad a familias...

                          UTECT otorgará más de nueve mil títulos de propiedad a familias…

                          Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

                          Winston Marte: “Inflación en la comida anda por 30%; El campo pierde 87 mil empleos; es penoso lo del mango”

                          Abinader dice Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia en compras del Estado

                          Abinader dice Ley 47-25 de Contrataciones Públicas marca nueva etapa de transparencia en compras del Estado

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Entérese quienes se integraron al proyecto presidencial de...

                            Entérese quienes se integraron al proyecto presidencial de…

                            FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

                            FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

                            Colombia Alcántara será moderadora del XIX congreso...

                            Colombia Alcántara será moderadora del XIX congreso…

                            Milton Morrison reafirma alianza con Abinader y anuncia nueva...

                            Milton Morrison reafirma alianza con Abinader y anuncia nueva…

                            Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

                            Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

                            PRM en Santo Domingo Norte resalta gestión del presidente...

                            PRM en Santo Domingo Norte resalta gestión del presidente…

                            ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

                            ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

                            Estados Unidos no descarta operación militar contra Cuba

                            Estados Unidos no descarta operación militar contra Cuba

                            Tribunal Constitucional ratifica que País Posible es la 7ma fuerza...

                            Tribunal Constitucional ratifica que País Posible es la 7ma fuerza…

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  Rosenberg: Shortage of petrol but not patriotism as Russians feel growing impact of war

                                  Rosenberg: Shortage of petrol but not patriotism as Russians feel growing impact of war

                                  Bodies of two mountaineers discovered after Swiss glacier melts

                                  Bodies of two mountaineers discovered after Swiss glacier melts

                                  US debt has hit $40tn – Will that be a wake-up call?

                                  US debt has hit $40tn – Will that be a wake-up call?

                                  El Niño set to be 'strongest in living memory', says Met Office

                                  El Niño set to be ‘strongest in living memory’, says Met Office

                                  Panama Canal to cut number of ships passing through due to El Niño

                                  Panama Canal to cut number of ships passing through due to El Niño

                                  British rapper Yung Filly to face retrial on rape charges in Australia

                                  British rapper Yung Filly to face retrial on rape charges in Australia

                                  Hong Kong's Tiananmen Square activists guilty in national security trial

                                  Hong Kong’s Tiananmen Square activists guilty in national security trial

                                  Japan executes man who killed five in gaming parlour fire

                                  Japan executes man who killed five in gaming parlour fire

                                  Trump scales up Cuban sanctions targeting state-run companies

                                  Trump scales up Cuban sanctions targeting state-run companies

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                                    Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                                    Slack wants to drag AI coding out of the terminal and into the group chat

                                    Slack wants to drag AI coding out of the terminal and into the group chat

                                    Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                                    Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                                    Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                                    Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                                    NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                                    NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                                    A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                                    A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                                    Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                                    Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                                    Meta defiende sus esfuerzos por la seguridad infantil, pero los críticos dicen que el gigante de las redes sociales se queda corto

                                    Meta defiende sus esfuerzos por la seguridad infantil, pero los críticos dicen que el gigante de las redes sociales se queda corto

                                    Serval’s super agent Catalyst creates roving background agents to identify and fix IT issues before they’re ticketed

                                    Serval’s super agent Catalyst creates roving background agents to identify and fix IT issues before they’re ticketed

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                                      Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                                      El jurado escucha a 'Keffe D' decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                                      El jurado escucha a ‘Keffe D’ decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                                      Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                                      Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                                      Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante 'Pulitzer on the Road'

                                      Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante ‘Pulitzer on the Road’

                                      Después de perder a un amigo y escribir 'Say So', Dan + Shay regresan con la autobiográfica 'Young'

                                      Después de perder a un amigo y escribir ‘Say So’, Dan + Shay regresan con la autobiográfica ‘Young’

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      El Centro Kennedy dice a la corte que no intentará restaurar el nombre de Trump en el edificio antes del 8 de septiembre

                                      Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane 'Keffe D' Davis

                                      Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane ‘Keffe D’ Davis

                                      El cofundador de ESPN, Bill Rasmussen, muere a los 93 años por los efectos de la enfermedad de Parkinson

                                      El cofundador de ESPN, Bill Rasmussen, muere a los 93 años por los efectos de la enfermedad de Parkinson

                                      Fox Sports transmitirá 35 partidos de voleibol femenino, incluidos 8 en Fox

                                      Fox Sports transmitirá 35 partidos de voleibol femenino, incluidos 8 en Fox

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      Los investigadores presentan Self-Harness, un marco que permite a los agentes de IA reescribir sus propias reglas, aumentando el rendimiento hasta en un 60%

                                      by Jorge Polanco
                                      22 de junio de 2026
                                      in Tecnología
                                      0
                                      Los investigadores presentan Self-Harness, un marco que permite a los agentes de IA reescribir sus propias reglas, aumentando el rendimiento hasta en un 60%
                                      0
                                      SHARES
                                      11
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      Jorge Polanco

                                      Jorge Polanco

                                      Comunicador | Columnista de Opinión & Análisis especializado en turismo y gestión pública, con una mirada crítica sobre la política turística, el ordenamiento territorial y el discurso institucional del sector

                                      Next Post
                                      Por qué las empresas agentes necesitan convertirse en sistemas de aprendizaje

                                      Por qué las empresas agentes necesitan convertirse en sistemas de aprendizaje

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • Boca recibió una propuesta por Kevin Lomónaco: la postura de Arruabarrena

                                        Boca recibió una propuesta por Kevin Lomónaco: la postura de Arruabarrena

                                        0 shares
                                        Share 0 Tweet 0
                                      • Carlos Peña plantea reformas políticas y electorales de cara a elecciones 2028

                                        0 shares
                                        Share 0 Tweet 0
                                      • La cruda revelación de Jonathan Gómez sobre su ludopatía que puso en jaque a su vida: «Lo perdí todo»

                                        0 shares
                                        Share 0 Tweet 0
                                      • Bodies of two mountaineers discovered after Swiss glacier melts

                                        0 shares
                                        Share 0 Tweet 0
                                      • Sueldos militares agosto 2026: la escala completa por jerarquía

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por