• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
sábado, agosto 22, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    Banreservas avanza 15 posiciones en el ranking de los 1,000 bancos más importantes del mundo

    Banreservas respaldará con financiamiento a inversionistas de dos nuevos proyectos residenciales en Punta Bergantín

    J.P. Morgan expresa intención de expandir inversiones en República Dominicana luego de encuentro con Valdez Albizu

    J.P. Morgan expresa intención de expandir inversiones en República Dominicana luego de encuentro con Valdez Albizu

    Suprema ratifica condena de 20 años a Argenis Contreras por crimen contra Yuniol Ramírez

    Suprema ratifica condena de 20 años a Argenis Contreras por crimen contra Yuniol Ramírez

    Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

    Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

    Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

    Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

    Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

    Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

    Director del TRAE asegura estar listo para inicio escolar pese a problemas puntuales con neumáticos

    Director del TRAE asegura estar listo para inicio escolar pese a problemas puntuales con neumáticos

    ProCompetencia insta a blindar compras estatales contra la colusión

    ProCompetencia insta a blindar compras estatales contra la colusión

    Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

    Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      Milei desmontó la operación kirchnerista sobre la morosidad: “Estamos entrando en el año electoral”

      Milei desmontó la operación kirchnerista sobre la morosidad: “Estamos entrando en el año electoral”

      Candela Arizaga cambiará su declaración y podría complicar a Facundo Moyano

      Candela Arizaga cambiará su declaración y podría complicar a Facundo Moyano

      Las Fuerzas Armadas argentinas comenzaron la asistencia humanitaria en Colombia

      Las Fuerzas Armadas argentinas comenzaron la asistencia humanitaria en Colombia

      Luzu TV suma un nuevo programa a su grilla de fines de semana

      Luzu TV suma un nuevo programa a su grilla de fines de semana

      El gobierno de Sánchez amenazó a los médicos de Ceuta que hablaron con los medios tras la crisis

      El gobierno de Sánchez amenazó a los médicos de Ceuta que hablaron con los medios tras la crisis

      Rafael Grossi quedó entre los tres candidatos con más respaldo para liderar la ONU

      Rafael Grossi quedó entre los tres candidatos con más respaldo para liderar la ONU

      Cita internacional: el TCR South América llega al autódromo Oscar Cabalén

      Cita internacional: el TCR South América llega al autódromo Oscar Cabalén

      Córdoba: avanza un proyecto para darle valor agregado a la industria apícola

      Córdoba: avanza un proyecto para darle valor agregado a la industria apícola

      El Gobierno de Milei avanza con la incorporación de 235 vehículos blindados Stryker para el Ejército

      El Gobierno de Milei avanza con la incorporación de 235 vehículos blindados Stryker para el Ejército

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        Banreservas avanza 15 posiciones en el ranking de los 1,000 bancos más importantes del mundo

        Banreservas respaldará con financiamiento a inversionistas de dos nuevos proyectos residenciales en Punta Bergantín

        Ministro Víctor Atallah recomienda reforzar cuidados ante las altas temperaturas

        Ministro Víctor Atallah recomienda reforzar cuidados ante las altas temperaturas

        Unesco destaca avances de República Dominicana en acceso, equidad y finalización educativa

        Unesco destaca avances de República Dominicana en acceso, equidad y finalización educativa

        J.P. Morgan expresa intención de expandir inversiones en República Dominicana luego de encuentro con Valdez Albizu

        J.P. Morgan expresa intención de expandir inversiones en República Dominicana luego de encuentro con Valdez Albizu

        Andrés Bautista juramenta a Carlos Paulino como nuevo director de la Defensa Civil

        Andrés Bautista juramenta a Carlos Paulino como nuevo director de la Defensa Civil

        Suprema ratifica condena de 20 años a Argenis Contreras por crimen contra Yuniol Ramírez

        Suprema ratifica condena de 20 años a Argenis Contreras por crimen contra Yuniol Ramírez

        Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

        Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

        Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

        Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

        Consulado dominicano inaugura nueva oficina en el Bronx EE.UU.

        Consulado dominicano inaugura nueva oficina en el Bronx EE.UU.

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Advierte año escolar iniciará con problemas de fondo ante un...

          Advierte año escolar iniciará con problemas de fondo ante un…

          Entérese quienes se integraron al proyecto presidencial de...

          Entérese quienes se integraron al proyecto presidencial de…

          FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

          FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

          Colombia Alcántara será moderadora del XIX congreso...

          Colombia Alcántara será moderadora del XIX congreso…

          Milton Morrison reafirma alianza con Abinader y anuncia nueva...

          Milton Morrison reafirma alianza con Abinader y anuncia nueva…

          Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

          Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

          PRM en Santo Domingo Norte resalta gestión del presidente...

          PRM en Santo Domingo Norte resalta gestión del presidente…

          ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

          ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

          Estados Unidos no descarta operación militar contra Cuba

          Estados Unidos no descarta operación militar contra Cuba

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                Fourteen killed in strike on Myanmar monastery

                Fourteen killed in strike on Myanmar monastery

                Father leaves 7-year-old son alone on Mount Fuji to continue hike, reports say

                Father leaves 7-year-old son alone on Mount Fuji to continue hike, reports say

                Sydney Marathon medal wrongly features Munich stadium

                Sydney Marathon medal wrongly features Munich stadium

                Canada says it will match US tariffs 'dollar for dollar' as trade talks break down

                Canada says it will match US tariffs ‘dollar for dollar’ as trade talks break down

                Lindsay Clancy suffering 'command hallucination' when she killed children, court hears

                Lindsay Clancy suffering ‘command hallucination’ when she killed children, court hears

                'We have more work to do', says Canada negotiator as US trade deadline looms

                ‘We have more work to do’, says Canada negotiator as US trade deadline looms

                As they return to the UK, Harry and Meghan search for a brand that sticks

                Why child stars like Hayden Panettiere fall into addiction

                Why child stars like Hayden Panettiere fall into addiction

                TikTok to pay $400m to US in one of largest child privacy settlements

                TikTok to pay $400m to US in one of largest child privacy settlements

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  Uber multada con casi mil millones de dólares por reguladores holandeses por suspensiones automáticas de cuentas

                  Uber multada con casi mil millones de dólares por reguladores holandeses por suspensiones automáticas de cuentas

                  Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                  Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                  Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                  Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                  Slack wants to drag AI coding out of the terminal and into the group chat

                  Slack wants to drag AI coding out of the terminal and into the group chat

                  Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                  Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                  Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                  Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                  NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                  NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                  A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                  A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                  Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                  Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    China investiga a un comediante que alteró la letra de una canción revolucionaria en el escenario

                    El príncipe Harry y otras seis personas conocerán el costo inicial del caso fallido del Daily Mail

                    El príncipe Harry y otras seis personas conocerán el costo inicial del caso fallido del Daily Mail

                    Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                    Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                    El jurado escucha a 'Keffe D' decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                    El jurado escucha a ‘Keffe D’ decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                    Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                    Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                    Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante 'Pulitzer on the Road'

                    Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante ‘Pulitzer on the Road’

                    Después de perder a un amigo y escribir 'Say So', Dan + Shay regresan con la autobiográfica 'Young'

                    Después de perder a un amigo y escribir ‘Say So’, Dan + Shay regresan con la autobiográfica ‘Young’

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    El Centro Kennedy dice a la corte que no intentará restaurar el nombre de Trump en el edificio antes del 8 de septiembre

                    Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane 'Keffe D' Davis

                    Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane ‘Keffe D’ Davis

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      Banreservas avanza 15 posiciones en el ranking de los 1,000 bancos más importantes del mundo

                      Banreservas respaldará con financiamiento a inversionistas de dos nuevos proyectos residenciales en Punta Bergantín

                      J.P. Morgan expresa intención de expandir inversiones en República Dominicana luego de encuentro con Valdez Albizu

                      J.P. Morgan expresa intención de expandir inversiones en República Dominicana luego de encuentro con Valdez Albizu

                      Suprema ratifica condena de 20 años a Argenis Contreras por crimen contra Yuniol Ramírez

                      Suprema ratifica condena de 20 años a Argenis Contreras por crimen contra Yuniol Ramírez

                      Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

                      Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

                      Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

                      Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

                      Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                      Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                      Director del TRAE asegura estar listo para inicio escolar pese a problemas puntuales con neumáticos

                      Director del TRAE asegura estar listo para inicio escolar pese a problemas puntuales con neumáticos

                      ProCompetencia insta a blindar compras estatales contra la colusión

                      ProCompetencia insta a blindar compras estatales contra la colusión

                      Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                      Nuevo director general de la PN dispone cambios en mandos regionales y direcciones centrales

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        Milei desmontó la operación kirchnerista sobre la morosidad: “Estamos entrando en el año electoral”

                        Milei desmontó la operación kirchnerista sobre la morosidad: “Estamos entrando en el año electoral”

                        Candela Arizaga cambiará su declaración y podría complicar a Facundo Moyano

                        Candela Arizaga cambiará su declaración y podría complicar a Facundo Moyano

                        Las Fuerzas Armadas argentinas comenzaron la asistencia humanitaria en Colombia

                        Las Fuerzas Armadas argentinas comenzaron la asistencia humanitaria en Colombia

                        Luzu TV suma un nuevo programa a su grilla de fines de semana

                        Luzu TV suma un nuevo programa a su grilla de fines de semana

                        El gobierno de Sánchez amenazó a los médicos de Ceuta que hablaron con los medios tras la crisis

                        El gobierno de Sánchez amenazó a los médicos de Ceuta que hablaron con los medios tras la crisis

                        Rafael Grossi quedó entre los tres candidatos con más respaldo para liderar la ONU

                        Rafael Grossi quedó entre los tres candidatos con más respaldo para liderar la ONU

                        Cita internacional: el TCR South América llega al autódromo Oscar Cabalén

                        Cita internacional: el TCR South América llega al autódromo Oscar Cabalén

                        Córdoba: avanza un proyecto para darle valor agregado a la industria apícola

                        Córdoba: avanza un proyecto para darle valor agregado a la industria apícola

                        El Gobierno de Milei avanza con la incorporación de 235 vehículos blindados Stryker para el Ejército

                        El Gobierno de Milei avanza con la incorporación de 235 vehículos blindados Stryker para el Ejército

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          Banreservas avanza 15 posiciones en el ranking de los 1,000 bancos más importantes del mundo

                          Banreservas respaldará con financiamiento a inversionistas de dos nuevos proyectos residenciales en Punta Bergantín

                          Ministro Víctor Atallah recomienda reforzar cuidados ante las altas temperaturas

                          Ministro Víctor Atallah recomienda reforzar cuidados ante las altas temperaturas

                          Unesco destaca avances de República Dominicana en acceso, equidad y finalización educativa

                          Unesco destaca avances de República Dominicana en acceso, equidad y finalización educativa

                          J.P. Morgan expresa intención de expandir inversiones en República Dominicana luego de encuentro con Valdez Albizu

                          J.P. Morgan expresa intención de expandir inversiones en República Dominicana luego de encuentro con Valdez Albizu

                          Andrés Bautista juramenta a Carlos Paulino como nuevo director de la Defensa Civil

                          Andrés Bautista juramenta a Carlos Paulino como nuevo director de la Defensa Civil

                          Suprema ratifica condena de 20 años a Argenis Contreras por crimen contra Yuniol Ramírez

                          Suprema ratifica condena de 20 años a Argenis Contreras por crimen contra Yuniol Ramírez

                          Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

                          Fuerza del Pueblo cuestiona inclusión educativa ante familias que aún buscan escuelas para sus hijos neurodivergentes

                          Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

                          Fuerza del Pueblo asegura Gobierno pudo evitar arancel de 12.5 % a exportaciones dominicanas

                          Consulado dominicano inaugura nueva oficina en el Bronx EE.UU.

                          Consulado dominicano inaugura nueva oficina en el Bronx EE.UU.

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Advierte año escolar iniciará con problemas de fondo ante un...

                            Advierte año escolar iniciará con problemas de fondo ante un…

                            Entérese quienes se integraron al proyecto presidencial de...

                            Entérese quienes se integraron al proyecto presidencial de…

                            FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

                            FP pide interpelar al ministro de Educación Luis Miguel De Camps por dificultades previo al inicio del año escolar

                            Colombia Alcántara será moderadora del XIX congreso...

                            Colombia Alcántara será moderadora del XIX congreso…

                            Milton Morrison reafirma alianza con Abinader y anuncia nueva...

                            Milton Morrison reafirma alianza con Abinader y anuncia nueva…

                            Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

                            Empresarios de Hato Mayor expresan respaldo a Leonel Fernández y fortalecen proyecto político rumbo a 2028

                            PRM en Santo Domingo Norte resalta gestión del presidente...

                            PRM en Santo Domingo Norte resalta gestión del presidente…

                            ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

                            ARTICULO: De los millones de seguidores al poder: gobernar un país no es hacer un reality en YouTube

                            Estados Unidos no descarta operación militar contra Cuba

                            Estados Unidos no descarta operación militar contra Cuba

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  Fourteen killed in strike on Myanmar monastery

                                  Fourteen killed in strike on Myanmar monastery

                                  Father leaves 7-year-old son alone on Mount Fuji to continue hike, reports say

                                  Father leaves 7-year-old son alone on Mount Fuji to continue hike, reports say

                                  Sydney Marathon medal wrongly features Munich stadium

                                  Sydney Marathon medal wrongly features Munich stadium

                                  Canada says it will match US tariffs 'dollar for dollar' as trade talks break down

                                  Canada says it will match US tariffs ‘dollar for dollar’ as trade talks break down

                                  Lindsay Clancy suffering 'command hallucination' when she killed children, court hears

                                  Lindsay Clancy suffering ‘command hallucination’ when she killed children, court hears

                                  'We have more work to do', says Canada negotiator as US trade deadline looms

                                  ‘We have more work to do’, says Canada negotiator as US trade deadline looms

                                  As they return to the UK, Harry and Meghan search for a brand that sticks

                                  Why child stars like Hayden Panettiere fall into addiction

                                  Why child stars like Hayden Panettiere fall into addiction

                                  TikTok to pay $400m to US in one of largest child privacy settlements

                                  TikTok to pay $400m to US in one of largest child privacy settlements

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    Uber multada con casi mil millones de dólares por reguladores holandeses por suspensiones automáticas de cuentas

                                    Uber multada con casi mil millones de dólares por reguladores holandeses por suspensiones automáticas de cuentas

                                    Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                                    Nvidia descubre que las matemáticas lineales simples pueden reemplazar las costosas transferencias de modelos de IA

                                    Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                                    Las escuelas están comenzando a enseñar conocimientos sobre inteligencia artificial. Para muchos, eso significa ayudar a los niños a ver los defectos de los chatbots.

                                    Slack wants to drag AI coding out of the terminal and into the group chat

                                    Slack wants to drag AI coding out of the terminal and into the group chat

                                    Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                                    Harvard acuerda un acuerdo de 53 millones de dólares por partes de cuerpos robadas y vendidas por un ex gerente de la morgue

                                    Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                                    Una de cada cinco empresas no puede detener el gasto de un agente de IA desbocado en tiempo real

                                    NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                                    NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message

                                    A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                                    A medida que aumenta la vigilancia en el lugar de trabajo, los expertos dicen que es bueno saber cómo observa su empleador

                                    Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                                    Las ganancias trimestrales de Alibaba caen un 75% a medida que crece el gasto en inversión en IA

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      China investiga a un comediante que alteró la letra de una canción revolucionaria en el escenario

                                      El príncipe Harry y otras seis personas conocerán el costo inicial del caso fallido del Daily Mail

                                      El príncipe Harry y otras seis personas conocerán el costo inicial del caso fallido del Daily Mail

                                      Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                                      Los fiscales volverán a juzgar a Yung Filly por tres cargos de violación en Australia

                                      El jurado escucha a 'Keffe D' decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                                      El jurado escucha a ‘Keffe D’ decir que su sobrino disparó fatalmente a Tupac Shakur en un tiroteo desde un vehículo en 1996

                                      Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                                      Una pregunta surge sobre el regreso de Harry al Reino Unido. ¿Podrá reconstruir su relación con el príncipe William?

                                      Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante 'Pulitzer on the Road'

                                      Pulitzers y la Asociación Estadounidense de Bibliotecas lanzan la exposición itinerante ‘Pulitzer on the Road’

                                      Después de perder a un amigo y escribir 'Say So', Dan + Shay regresan con la autobiográfica 'Young'

                                      Después de perder a un amigo y escribir ‘Say So’, Dan + Shay regresan con la autobiográfica ‘Young’

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      El Centro Kennedy dice a la corte que no intentará restaurar el nombre de Trump en el edificio antes del 8 de septiembre

                                      Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane 'Keffe D' Davis

                                      Patólogo forense detalla las heridas fatales de Tupac Shakur en el juicio de Duane ‘Keffe D’ Davis

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      Los investigadores presentan Self-Harness, un marco que permite a los agentes de IA reescribir sus propias reglas, aumentando el rendimiento hasta en un 60%

                                      by Jorge Polanco
                                      22 de junio de 2026
                                      in Tecnología
                                      0
                                      Los investigadores presentan Self-Harness, un marco que permite a los agentes de IA reescribir sus propias reglas, aumentando el rendimiento hasta en un 60%
                                      0
                                      SHARES
                                      11
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      No todas las empresas pueden o deben crear su propio modelo de lenguaje de IA de vanguardia. Sin embargo, el aprovechar controlar el modelo es algo que la mayoría de las empresas pueden y debería personalizar de acuerdo con sus objetivos específicos.

                                      Por supuesto, es más fácil decirlo que hacerlo. ALos arneses de los hombres todavía se ajustan en gran medida mediante depuración manual y ad hoc, un proceso que depende en gran medida de la intuición en lugar de circuitos de retroalimentación sistemáticos, lo que dificulta mantenerse al día con la rápida evolución de los LLM.

                                      Para resolver este desafío, investigadores del Laboratorio de Inteligencia Artificial de Shanghai introdujeron el “Self-Harness”, un nuevo paradigma en el que un agente basado en LLM mejora sistemáticamente sus propias reglas operativas. Al examinar sus propios rastros de ejecución para aplicar cambios, el sistema intercambia conjeturas manuales por evidencia empírica.

                                      Los arneses de mejora automática pueden permitir a los equipos de desarrollo implementar agentes personalizados sólidos que adapten continuamente sus propios protocolos de ejecución para superar las debilidades específicas del modelo.

                                      El desafío de la ingeniería de arneses

                                      El desempeño de un agente basado en LLM no está determinado solo por su modelo base subyacente, sino también por su aprovechamiento: el sistema circundante que proporciona contexto y permite que el modelo interactúe con el entorno. Un arnés incluye componentes como indicaciones del sistema, herramientas, memoria, reglas de verificación, políticas de ejecución, lógica de orquestación y procedimientos de recuperación de fallas.

                                      Esta capa es crucial porque muchas fallas comunes de los agentes provienen del arnés y no del modelo. Por ejemplo, un agente puede informar el éxito sin verificar la respuesta del modelo (por ejemplo, ejecutar el código para ver si pasa las pruebas) o puede volver a intentar una acción que falló varias veces. El arnés también es responsable de evitar la degradación o sobrecarga del contexto cuando el historial de interacción del agente se vuelve muy grande. Ejemplos de arneses populares incluyen SWE-agent, Claude Code, Codex y OpenHands.

                                      La ingeniería de arneses sigue siendo un desafío importante, pero el cuello de botella no se debe necesariamente a que los humanos sean demasiado lentos o incapaces.

                                      De hecho, Hangfan Zhang, autor principal del artículo Self-Harness, dijo a VentureBeat que «en muchos casos, un ingeniero experimentado con un profundo conocimiento del dominio aún puede generar mejores cambios que los que puede lograr un LLM en la actualidad».

                                      En cambio, el verdadero cuello de botella de la ingeniería manual es que depende en gran medida de la depuración ad hoc en lugar de un circuito de retroalimentación empírica verificable. «El problema más profundo es que el paradigma actual de ingeniería de arneses a menudo carece de un circuito de retroalimentación sistemático», explicó Zhang. «Muchos cambios se realizan basándose en la intuición, algunos fallos observados o una depuración ad hoc».

                                      Con el rápido lanzamiento de nuevos modelos, se está volviendo cada vez más costoso e insostenible depender de la intuición humana para ajustar manualmente los arneses específicos del modelo. Aunque algunos enfoques utilizan modelos más sólidos para mejorar las capacidades de los agentes objetivo más débiles, esta dependencia de la orientación externa presenta sus propios desafíos, ya que estos modelos pueden ser costosos, no estar disponibles para los modelos de frontera o pueden no coincidir con los modos de falla del modelo objetivo.

                                      ¿Cómo funciona el autoarnés?

                                      El paradigma Self-Harness permite a un agente basado en LLM mejorar su propio aprovechamiento sin depender de ingenieros humanos o modelos externos más potentes.

                                      Esta autoevolución continua está impulsada por un ciclo iterativo de tres pasos que transforma la evidencia de comportamiento en actualizaciones operativas:

                                      • Exploración de debilidades: A partir de un aprovechamiento inicial, el agente ejecuta un conjunto de tareas, produciendo seguimientos de ejecución con resultados verificables. El agente clasifica los rastros de fallas e intenta detectar patrones de falla específicos del modelo.

                                      • Sugerencia de arnés: Con base en estos modelos de falla, el agente utiliza un rol de «proponente» para generar un conjunto de modificaciones de arnés diversas pero pequeñas, cada una vinculada a un mecanismo de falla específico para evitar soluciones demasiado generales.

                                      • Validación de la propuesta: El sistema evalúa los cambios de candidatos mediante pruebas de regresión. Se promueve un cambio sólo si mejora el rendimiento sin causar una degradación mensurable en las tareas suspendidas. Si varios cambios candidatos pasan las pruebas de regresión, se fusionan en la siguiente versión del arnés, que luego sirve como punto de partida para la siguiente iteración.

                                      Marco de autoexplotación (fuente: arXiv)

                                      Para visualizar por qué una empresa necesitaría uno, imagine un agente automatizado de resolución de problemas que lea la documentación interna, escriba parches y abra solicitudes de extracción. Si la empresa actualiza su estilo de documentación, el agente puede fallar repentinamente, obteniendo el contexto incorrecto o escribiendo correcciones incorrectas.

                                      En la superficie, el agente simplemente parece roto. Pero Self-Harness convierte este ambiguo fracaso en un problema con solución. «Los rastros de fallas revelan dónde el agente está haciendo un mal uso del nuevo formato de documentación; el proponente puede generar una modificación específica del haz… y el evaluador puede decidir si esta modificación mejora los casos de falla sin hacer retroceder los otros casos», dijo Zhang.

                                      El autoaprovechamiento en acción

                                      Los investigadores evaluaron Self-Harness en Terminal-Bench-2.0, un punto de referencia que prueba la ejecución general basada en herramientas, incluido el manejo de artefactos, el uso de comandos, el comportamiento de verificación y la recuperación de errores de tiempo de ejecución. Aplicaron autoarnés con MiniMax M2.5, Qwen3.5-35B-A3B y GLM-5.

                                      Para aislar el impacto del arnés autoescalable, comenzaron con un arnés mínimo construido sobre el SDK de DeepAgent, que contiene solo el indicador del sistema orientado a pruebas comparativas, así como el sistema de archivos predeterminado y las herramientas de shell. El backend del modelo, el conjunto de herramientas, el entorno de referencia y el evaluador se mantuvieron sin cambios, mientras que solo se permitió variar el arnés.

                                      Los resultados cuantitativos muestran que Los oficiales mejoraron su desempeño mediante modificaciones automatizadas del arnés. Sobre las tareas retenidas, El rendimiento aumentó significativamente en todos los ámbitos, entre un 33 y un 60 por ciento. mejoras relativas para diferentes modelos.

                                      resultados de la autoexplotación

                                      La autoexplotación permite a los agentes mejorar su propio código y adaptarlo al modelo subyacente (fuente: arXiv)

                                      Es importante señalar que una regla de aceptación explícita sólo favorece los cambios que mejoran el desempeño sin introducir regresiones inaceptables. Lo que hace que Self-Harness sea poderoso para las aplicaciones empresariales es que no solo alarga el mensaje o agrega instrucciones genéricas. En cambio, introduce cambios específicos que reflejan problemas recurrentes que cada modelo encuentra cuando se ejecuta.

                                      Por ejemplo, bajo el arnés básico, MiniMax M2.5 se quedaría atascado explorando sin cesar las configuraciones del conjunto de datos hasta que expire el tiempo de espera del entorno, sin poder producir ningún entregable. Al utilizar Self-Harness, el sistema identificó esta falla específica y escribió un «interruptor de bucle» en su política de ejecución, lo que obligó al agente a detenerse y redirigir su enfoque después de 50 llamadas a la herramienta. También agregó una regla para crear una versión inicial de los artefactos requeridos lo antes posible.

                                      Por otro lado, Qwen-3.5 tenía la costumbre de encontrar un error de sobrescritura de archivos y luego volver a intentar ciegamente el mismo comando repetidamente, eliminando eventualmente los archivos necesarios en confusión antes de detenerse. El autoaprovechamiento resolvió este problema introduciendo una estricta disciplina de reintento de comandos (que prohíbe comandos duplicados exactos) y un mecanismo que requería que el agente recreara inmediatamente cualquier artefacto faltante si ocurría un error en el archivo.

                                      GLM-5 tenía dificultades para preservar los cambios de entorno en diferentes comandos y, a menudo, perdía tiempo en descargas masivas o finalizando tareas incluso cuando fallaban las comprobaciones de integridad. Su arnés autogenerado introdujo reglas que instruyen al agente a conservar las variables PATH en las sesiones del shell, limitar el cálculo externo y reparar cualquier verificación de integridad fallida antes de concluir su ejecución.

                                      Los costos ocultos de los arneses automatizados

                                      Si bien Self-Harness automatiza el tedioso trabajo de detectar fallas idiosincrásicas del modelo, los tomadores de decisiones deben ser realistas acerca de las compensaciones que deben realizarse. Reemplazar la ingeniería humana con prueba y error automatizados requiere una importante sobrecarga computacional.

                                      «El autoarnés reemplaza parte de la carga de la ingeniería humana con la generación repetida de propuestas, la evaluación paralela de candidatos y las pruebas de regresión», dijo Zhang. «Esto puede significar más tokens API, más latencia durante la optimización y más infraestructura para ejecutar tareas de evaluación».

                                      Además, este sistema depende de la precisión de su proceso de evaluación. Durante sus experimentos en Terminal-Bench-2.0, los investigadores se basaron en verificadores estrictos y deterministas para garantizar que los cambios realizados por el agente fueran realmente útiles. Sin esta rigurosa verdad sobre el terreno, un sistema automatizado corre el riesgo de favorecer malas actualizaciones. «[The] el sistema de evaluación no es un componente opcional; es lo que nos permite cambiar la intuición humana por evidencia empírica”, dijo Zhang.

                                      Esta dependencia de inspectores estrictos también dicta dónde se debe implementar el autoarnés. «Los mejores objetivos de implementación hoy en día son entornos donde se pueden medir las fallas y el ensayo y error es relativamente seguro», dijo Zhang, citando la codificación, la automatización del flujo de trabajo interno y los canales de datos de DevOps como casos de uso ideales.

                                      Por el contrario, las empresas deben evitar automatizar completamente las operaciones en áreas subjetivas o de alto riesgo. «Las señales de alerta más obvias son áreas donde la evaluación es subjetiva, retrasada, no determinista o costosa, como la toma de decisiones médicas, la infraestructura crítica para la seguridad o las decisiones legales».

                                      De diseñadores rápidos a arquitectos de retroalimentación

                                      La introducción de agentes de mejora personal no significa que la codificación o los flujos de trabajo empresariales de repente quedarán libres de la intervención humana. La calidad de la colaboración entre el ingeniero humano y la IA sigue siendo esencial y difícil de capturar con puntos de referencia automatizados.

                                      En cambio, la profesión de ingeniería avanza a través de la capa de abstracción. «El papel de los ingenieros empresariales pasará de aplicar manualmente parches individuales a avisos o llamadas de herramientas a diseñar sistemas de retroalimentación que hagan posible la mejora de los agentes», predijo Zhang. En el futuro, “el ingeniero dejará de ser un simple desarrollador y se convertirá más en un arquitecto de retroalimentación”.

                                      A medida que los diseños fundamentales se vuelvan más capaces, naturalmente absorberán muchas características que actualmente requieren ingeniería de cableado manual. «Pero una vez que eso suceda, el arnés no desaparecerá; su alcance se extenderá hacia afuera para conectar el modelo con ambientes externos más ricos», dijo Zhang. «Hasta que este límite se extienda más allá de lo que los humanos pueden evaluar, los humanos seguirán siendo proveedores esenciales de retroalimentación».

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      Jorge Polanco

                                      Jorge Polanco

                                      Comunicador | Columnista de Opinión & Análisis especializado en turismo y gestión pública, con una mirada crítica sobre la política turística, el ordenamiento territorial y el discurso institucional del sector

                                      Next Post
                                      Por qué las empresas agentes necesitan convertirse en sistemas de aprendizaje

                                      Por qué las empresas agentes necesitan convertirse en sistemas de aprendizaje

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • El gobierno de Sánchez amenazó a los médicos de Ceuta que hablaron con los medios tras la crisis

                                        El gobierno de Sánchez amenazó a los médicos de Ceuta que hablaron con los medios tras la crisis

                                        0 shares
                                        Share 0 Tweet 0
                                      • El Gobierno de Milei avanza con la incorporación de 235 vehículos blindados Stryker para el Ejército

                                        0 shares
                                        Share 0 Tweet 0
                                      • Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                                        0 shares
                                        Share 0 Tweet 0
                                      • La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                                        0 shares
                                        Share 0 Tweet 0
                                      • Several injured after sword attack at Swedish school

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por