• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
viernes, septiembre 4, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    Fuerza del Pueblo emplaza a la DGA a demostrar el destino de 3,900 contenedores en tránsito hacia Haití

    Fuerza del Pueblo emplaza a la DGA a demostrar el destino de 3,900 contenedores en tránsito hacia Haití

    Dr. Miguel Monanci: “Drama de vida o muerte; a pacientes de cáncer enfrentan dilema; 90% llegan con mal avanzado”

    Dr. Miguel Monanci: “Drama de vida o muerte; a pacientes de cáncer enfrentan dilema; 90% llegan con mal avanzado”

    Espaillat Bencosme: la mecanización permitirá reducir costos y mejorar rentabilidad del productor

    Espaillat Bencosme: la mecanización permitirá reducir costos y mejorar rentabilidad del productor

    FP Santiago: apagones y facturas revelan fracaso del PRM

    FP Santiago: apagones y facturas revelan fracaso del PRM

    Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

    Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

    AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

    AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

    Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

    Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

    Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

    Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

    Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

    Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      El Gobierno de Milei destinó más de $5 billones a reforzar jubilaciones, salud y defensa

      El Gobierno de Milei destinó más de $5 billones a reforzar jubilaciones, salud y defensa

      Los veteranos de Malvinas apoyaron los anuncios de Milei para defender la soberanía argentina

      Los veteranos de Malvinas apoyaron los anuncios de Milei para defender la soberanía argentina

      Malvinas sin guerra | La Derecha Diario

      Malvinas sin guerra | La Derecha Diario

      El día que Cristina Kirchner designó a una ciudadana británica en cargos clave de Seguridad y Defensa

      El día que Cristina Kirchner designó a una ciudadana británica en cargos clave de Seguridad y Defensa

      HBO Max: la lista completa de estrenos de series y películas en septiembre

      HBO Max: la lista completa de estrenos de series y películas en septiembre

      En qué consiste la Ley de Defensa de la Soberanía Nacional que Milei enviará al Congreso

      En qué consiste la Ley de Defensa de la Soberanía Nacional que Milei enviará al Congreso

      Pablo Quirno tras la cadena nacional de Milei: "La causa Malvinas está arriba de todo"

      Pablo Quirno tras la cadena nacional de Milei: «La causa Malvinas está arriba de todo»

      Javier Milei apuntó contra la crisis migratoria que azota al Reino Unido

      Javier Milei apuntó contra la crisis migratoria que azota al Reino Unido

      Qué es Sea Lion, el proyecto petrolero británico en Malvinas que Milei busca frenar

      Qué es Sea Lion, el proyecto petrolero británico en Malvinas que Milei busca frenar

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        Fuerza del Pueblo emplaza a la DGA a demostrar el destino de 3,900 contenedores en tránsito hacia Haití

        Fuerza del Pueblo emplaza a la DGA a demostrar el destino de 3,900 contenedores en tránsito hacia Haití

        Dr. Miguel Monanci: “Drama de vida o muerte; a pacientes de cáncer enfrentan dilema; 90% llegan con mal avanzado”

        Dr. Miguel Monanci: “Drama de vida o muerte; a pacientes de cáncer enfrentan dilema; 90% llegan con mal avanzado”

        Banco BHD fortalece sus canales digitales con nuevas...

        Banco BHD fortalece sus canales digitales con nuevas…

        Espaillat Bencosme: la mecanización permitirá reducir costos y mejorar rentabilidad del productor

        Espaillat Bencosme: la mecanización permitirá reducir costos y mejorar rentabilidad del productor

        FP Santiago: apagones y facturas revelan fracaso del PRM

        FP Santiago: apagones y facturas revelan fracaso del PRM

        Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

        Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

        AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

        AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

        Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

        Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

        República Dominicana y Haití desarrollan agenda de trabajo sobre temas de interés bilateral

        República Dominicana y Haití desarrollan agenda de trabajo sobre temas de interés bilateral

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

          Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

          ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

          ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

          Dicen proyecto presidencial de Gonzalo Castillo impacta más de 40 territorios el fin de semana

          Dicen proyecto presidencial de Gonzalo Castillo impacta más de 40 territorios el fin de semana

          Antonio Marte juramenta nuevas estructuras fortalecen PPG

          Antonio Marte juramenta nuevas estructuras fortalecen PPG

          Leonel Fernández encabeza asambleas provinciales en despliegue nacional de la Fuerza del Pueblo

          Leonel Fernández encabeza asambleas provinciales en despliegue nacional de la Fuerza del Pueblo

          Rafael Méndez “El Conde” anuncia aspiración a regidor por Fuerza del Pueblo en San Juan de la Maguana

          Rafael Méndez “El Conde” anuncia aspiración a regidor por Fuerza del Pueblo en San Juan de la Maguana

          Vicealcaldesa de Los Alcarrizos abandona el PRM y se juramenta en la Fuerza del Pueblo junto a más de 300 dirigentes

          Vicealcaldesa de Los Alcarrizos abandona el PRM y se juramenta en la Fuerza del Pueblo junto a más de 300 dirigentes

          Leonel afirma PRM no pudo mantener 24 horas de electricidad y la gente está cansada de apagones

          Leonel afirma PRM no pudo mantener 24 horas de electricidad y la gente está cansada de apagones

          Johnny Pujols afirma PLD fortalece su estructura territorial mientras PRM va en picada

          Johnny Pujols afirma PLD fortalece su estructura territorial mientras PRM va en picada

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                Russian drone hits Ukranian security headquarters, Zelensky says

                Russian drone hits Ukranian security headquarters, Zelensky says

                Trump's peace envoys to visit Moscow and Kyiv - reports say

                Trump’s peace envoys to visit Moscow and Kyiv – reports say

                Uganda's King Oyo death: Body of world's youngest traditional monarch returns amid succession row

                Uganda’s King Oyo death: Body of world’s youngest traditional monarch returns amid succession row

                Falkland Islands: UK support 'unwavering' after Argentina restates claims

                Falkland Islands: UK support ‘unwavering’ after Argentina restates claims

                US diesel prices hit an all-time-high

                US diesel prices hit an all-time-high

                How could US-Iran conflict end? Three experts give their views

                How could US-Iran conflict end? Three experts give their views

                Steve Irwin's family celebrates 'superhero' dad, 20 years after shock death

                Steve Irwin’s family celebrates ‘superhero’ dad, 20 years after shock death

                Argentine leader says oil firms working off Falklands face sanctions

                Argentine leader says oil firms working off Falklands face sanctions

                Volkswagen board approves plan to cut another 50,000 jobs

                Volkswagen board approves plan to cut another 50,000 jobs

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  El satélite de rescate se acerca al telescopio condenado de la NASA, incluso si no puede salvarlo

                  El satélite de rescate se acerca al telescopio condenado de la NASA, incluso si no puede salvarlo

                  El sitio web de la Casa Blanca estrena 5 videojuegos arcade retro que promueven la agenda de Trump

                  El sitio web de la Casa Blanca estrena 5 videojuegos arcade retro que promueven la agenda de Trump

                  Las cámaras de vigilancia de multitudes se convierten en el objetivo de la campaña de mitad de mandato mientras los votantes se resisten al poder de las empresas de tecnología

                  Las cámaras de vigilancia de multitudes se convierten en el objetivo de la campaña de mitad de mandato mientras los votantes se resisten al poder de las empresas de tecnología

                  'Welcome to the AGI era': OpenAI launches GPT-6 Astra

                  ‘Welcome to the AGI era’: OpenAI launches GPT-6 Astra

                  Los piratas informáticos vinculados a China abrieron puertas traseras a las computadoras portátiles de los ejecutivos a través de USB, explotando una solución que las empresas tenían pero que no estaban usando.

                  Los piratas informáticos vinculados a China abrieron puertas traseras a las computadoras portátiles de los ejecutivos a través de USB, explotando una solución que las empresas tenían pero que no estaban usando.

                  30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                  Científicos que estudian la leche de cucaracha y sonarse la nariz ganan premios Ig Nobel por ciencia peculiar

                  Meta dice que Muse Spark 1.3 tiene un rendimiento de vanguardia, pero sus mejores resultados provienen de un modelo que los desarrolladores aún no pueden utilizar ampliamente.

                  Meta dice que Muse Spark 1.3 tiene un rendimiento de vanguardia, pero sus mejores resultados provienen de un modelo que los desarrolladores aún no pueden utilizar ampliamente.

                  Un par de naves espaciales se acercan a Mercurio después de un viaje de casi una década

                  Un par de naves espaciales se acercan a Mercurio después de un viaje de casi una década

                  Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

                  Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                    Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      Fuerza del Pueblo emplaza a la DGA a demostrar el destino de 3,900 contenedores en tránsito hacia Haití

                      Fuerza del Pueblo emplaza a la DGA a demostrar el destino de 3,900 contenedores en tránsito hacia Haití

                      Dr. Miguel Monanci: “Drama de vida o muerte; a pacientes de cáncer enfrentan dilema; 90% llegan con mal avanzado”

                      Dr. Miguel Monanci: “Drama de vida o muerte; a pacientes de cáncer enfrentan dilema; 90% llegan con mal avanzado”

                      Espaillat Bencosme: la mecanización permitirá reducir costos y mejorar rentabilidad del productor

                      Espaillat Bencosme: la mecanización permitirá reducir costos y mejorar rentabilidad del productor

                      FP Santiago: apagones y facturas revelan fracaso del PRM

                      FP Santiago: apagones y facturas revelan fracaso del PRM

                      Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

                      Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

                      AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

                      AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

                      Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

                      Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

                      Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

                      Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

                      Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

                      Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        El Gobierno de Milei destinó más de $5 billones a reforzar jubilaciones, salud y defensa

                        El Gobierno de Milei destinó más de $5 billones a reforzar jubilaciones, salud y defensa

                        Los veteranos de Malvinas apoyaron los anuncios de Milei para defender la soberanía argentina

                        Los veteranos de Malvinas apoyaron los anuncios de Milei para defender la soberanía argentina

                        Malvinas sin guerra | La Derecha Diario

                        Malvinas sin guerra | La Derecha Diario

                        El día que Cristina Kirchner designó a una ciudadana británica en cargos clave de Seguridad y Defensa

                        El día que Cristina Kirchner designó a una ciudadana británica en cargos clave de Seguridad y Defensa

                        HBO Max: la lista completa de estrenos de series y películas en septiembre

                        HBO Max: la lista completa de estrenos de series y películas en septiembre

                        En qué consiste la Ley de Defensa de la Soberanía Nacional que Milei enviará al Congreso

                        En qué consiste la Ley de Defensa de la Soberanía Nacional que Milei enviará al Congreso

                        Pablo Quirno tras la cadena nacional de Milei: "La causa Malvinas está arriba de todo"

                        Pablo Quirno tras la cadena nacional de Milei: «La causa Malvinas está arriba de todo»

                        Javier Milei apuntó contra la crisis migratoria que azota al Reino Unido

                        Javier Milei apuntó contra la crisis migratoria que azota al Reino Unido

                        Qué es Sea Lion, el proyecto petrolero británico en Malvinas que Milei busca frenar

                        Qué es Sea Lion, el proyecto petrolero británico en Malvinas que Milei busca frenar

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          Fuerza del Pueblo emplaza a la DGA a demostrar el destino de 3,900 contenedores en tránsito hacia Haití

                          Fuerza del Pueblo emplaza a la DGA a demostrar el destino de 3,900 contenedores en tránsito hacia Haití

                          Dr. Miguel Monanci: “Drama de vida o muerte; a pacientes de cáncer enfrentan dilema; 90% llegan con mal avanzado”

                          Dr. Miguel Monanci: “Drama de vida o muerte; a pacientes de cáncer enfrentan dilema; 90% llegan con mal avanzado”

                          Banco BHD fortalece sus canales digitales con nuevas...

                          Banco BHD fortalece sus canales digitales con nuevas…

                          Espaillat Bencosme: la mecanización permitirá reducir costos y mejorar rentabilidad del productor

                          Espaillat Bencosme: la mecanización permitirá reducir costos y mejorar rentabilidad del productor

                          FP Santiago: apagones y facturas revelan fracaso del PRM

                          FP Santiago: apagones y facturas revelan fracaso del PRM

                          Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

                          Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

                          AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

                          AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

                          Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

                          Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

                          República Dominicana y Haití desarrollan agenda de trabajo sobre temas de interés bilateral

                          República Dominicana y Haití desarrollan agenda de trabajo sobre temas de interés bilateral

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

                            Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

                            ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

                            ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

                            Dicen proyecto presidencial de Gonzalo Castillo impacta más de 40 territorios el fin de semana

                            Dicen proyecto presidencial de Gonzalo Castillo impacta más de 40 territorios el fin de semana

                            Antonio Marte juramenta nuevas estructuras fortalecen PPG

                            Antonio Marte juramenta nuevas estructuras fortalecen PPG

                            Leonel Fernández encabeza asambleas provinciales en despliegue nacional de la Fuerza del Pueblo

                            Leonel Fernández encabeza asambleas provinciales en despliegue nacional de la Fuerza del Pueblo

                            Rafael Méndez “El Conde” anuncia aspiración a regidor por Fuerza del Pueblo en San Juan de la Maguana

                            Rafael Méndez “El Conde” anuncia aspiración a regidor por Fuerza del Pueblo en San Juan de la Maguana

                            Vicealcaldesa de Los Alcarrizos abandona el PRM y se juramenta en la Fuerza del Pueblo junto a más de 300 dirigentes

                            Vicealcaldesa de Los Alcarrizos abandona el PRM y se juramenta en la Fuerza del Pueblo junto a más de 300 dirigentes

                            Leonel afirma PRM no pudo mantener 24 horas de electricidad y la gente está cansada de apagones

                            Leonel afirma PRM no pudo mantener 24 horas de electricidad y la gente está cansada de apagones

                            Johnny Pujols afirma PLD fortalece su estructura territorial mientras PRM va en picada

                            Johnny Pujols afirma PLD fortalece su estructura territorial mientras PRM va en picada

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  Russian drone hits Ukranian security headquarters, Zelensky says

                                  Russian drone hits Ukranian security headquarters, Zelensky says

                                  Trump's peace envoys to visit Moscow and Kyiv - reports say

                                  Trump’s peace envoys to visit Moscow and Kyiv – reports say

                                  Uganda's King Oyo death: Body of world's youngest traditional monarch returns amid succession row

                                  Uganda’s King Oyo death: Body of world’s youngest traditional monarch returns amid succession row

                                  Falkland Islands: UK support 'unwavering' after Argentina restates claims

                                  Falkland Islands: UK support ‘unwavering’ after Argentina restates claims

                                  US diesel prices hit an all-time-high

                                  US diesel prices hit an all-time-high

                                  How could US-Iran conflict end? Three experts give their views

                                  How could US-Iran conflict end? Three experts give their views

                                  Steve Irwin's family celebrates 'superhero' dad, 20 years after shock death

                                  Steve Irwin’s family celebrates ‘superhero’ dad, 20 years after shock death

                                  Argentine leader says oil firms working off Falklands face sanctions

                                  Argentine leader says oil firms working off Falklands face sanctions

                                  Volkswagen board approves plan to cut another 50,000 jobs

                                  Volkswagen board approves plan to cut another 50,000 jobs

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    El satélite de rescate se acerca al telescopio condenado de la NASA, incluso si no puede salvarlo

                                    El satélite de rescate se acerca al telescopio condenado de la NASA, incluso si no puede salvarlo

                                    El sitio web de la Casa Blanca estrena 5 videojuegos arcade retro que promueven la agenda de Trump

                                    El sitio web de la Casa Blanca estrena 5 videojuegos arcade retro que promueven la agenda de Trump

                                    Las cámaras de vigilancia de multitudes se convierten en el objetivo de la campaña de mitad de mandato mientras los votantes se resisten al poder de las empresas de tecnología

                                    Las cámaras de vigilancia de multitudes se convierten en el objetivo de la campaña de mitad de mandato mientras los votantes se resisten al poder de las empresas de tecnología

                                    'Welcome to the AGI era': OpenAI launches GPT-6 Astra

                                    ‘Welcome to the AGI era’: OpenAI launches GPT-6 Astra

                                    Los piratas informáticos vinculados a China abrieron puertas traseras a las computadoras portátiles de los ejecutivos a través de USB, explotando una solución que las empresas tenían pero que no estaban usando.

                                    Los piratas informáticos vinculados a China abrieron puertas traseras a las computadoras portátiles de los ejecutivos a través de USB, explotando una solución que las empresas tenían pero que no estaban usando.

                                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                    Científicos que estudian la leche de cucaracha y sonarse la nariz ganan premios Ig Nobel por ciencia peculiar

                                    Meta dice que Muse Spark 1.3 tiene un rendimiento de vanguardia, pero sus mejores resultados provienen de un modelo que los desarrolladores aún no pueden utilizar ampliamente.

                                    Meta dice que Muse Spark 1.3 tiene un rendimiento de vanguardia, pero sus mejores resultados provienen de un modelo que los desarrolladores aún no pueden utilizar ampliamente.

                                    Un par de naves espaciales se acercan a Mercurio después de un viaje de casi una década

                                    Un par de naves espaciales se acercan a Mercurio después de un viaje de casi una década

                                    Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

                                    Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      SkillOpt de código abierto de Microsoft actualiza automáticamente las habilidades de los agentes de IA sin tocar los pesos del modelo

                                      by — Redacción Despertar Matinal
                                      11 de junio de 2026
                                      in Tecnología
                                      0
                                      SkillOpt de código abierto de Microsoft actualiza automáticamente las habilidades de los agentes de IA sin tocar los pesos del modelo
                                      0
                                      SHARES
                                      12
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados ​​en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.

                                      Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.

                                      Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.

                                      Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.

                                      En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.

                                      El desafío de optimizar las habilidades de los agentes

                                      Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.

                                      Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.

                                      Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.

                                      Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.

                                      «El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».

                                      Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».

                                      Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».

                                      Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.

                                      Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.

                                      Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.

                                      Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.

                                      Importar disciplina matemática al texto

                                      SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:

                                      • SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.

                                      • Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.

                                      • Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.

                                      • En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.

                                      • La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.

                                      SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.

                                      Canalización de SkillOpt

                                      Marco SkillOpt (fuente: arXiv)

                                      El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.

                                      Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.

                                      Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.

                                      SkillOpt en acción

                                      Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.

                                      La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.

                                      SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.

                                      Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.

                                      Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.

                                      «Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».

                                      Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.

                                      Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.

                                      Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.

                                      Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.

                                      Estrategias de implementación y la ‘captura’ empresarial

                                      Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.

                                      «El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.

                                      Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.

                                      SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».

                                      De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.

                                      «La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados ​​en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.

                                      Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.

                                      Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.

                                      Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.

                                      En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.

                                      El desafío de optimizar las habilidades de los agentes

                                      Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.

                                      Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.

                                      Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.

                                      Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.

                                      «El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».

                                      Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».

                                      Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».

                                      Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.

                                      Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.

                                      Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.

                                      Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.

                                      Importar disciplina matemática al texto

                                      SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:

                                      • SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.

                                      • Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.

                                      • Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.

                                      • En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.

                                      • La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.

                                      SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.

                                      Canalización de SkillOpt

                                      Marco SkillOpt (fuente: arXiv)

                                      El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.

                                      Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.

                                      Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.

                                      SkillOpt en acción

                                      Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.

                                      La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.

                                      SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.

                                      Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.

                                      Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.

                                      «Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».

                                      Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.

                                      Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.

                                      Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.

                                      Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.

                                      Estrategias de implementación y la ‘captura’ empresarial

                                      Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.

                                      «El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.

                                      Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.

                                      SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».

                                      De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.

                                      «La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados ​​en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.

                                      Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.

                                      Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.

                                      Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.

                                      En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.

                                      El desafío de optimizar las habilidades de los agentes

                                      Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.

                                      Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.

                                      Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.

                                      Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.

                                      «El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».

                                      Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».

                                      Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».

                                      Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.

                                      Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.

                                      Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.

                                      Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.

                                      Importar disciplina matemática al texto

                                      SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:

                                      • SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.

                                      • Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.

                                      • Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.

                                      • En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.

                                      • La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.

                                      SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.

                                      Canalización de SkillOpt

                                      Marco SkillOpt (fuente: arXiv)

                                      El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.

                                      Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.

                                      Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.

                                      SkillOpt en acción

                                      Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.

                                      La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.

                                      SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.

                                      Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.

                                      Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.

                                      «Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».

                                      Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.

                                      Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.

                                      Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.

                                      Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.

                                      Estrategias de implementación y la ‘captura’ empresarial

                                      Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.

                                      «El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.

                                      Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.

                                      SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».

                                      De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.

                                      «La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados ​​en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.

                                      Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.

                                      Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.

                                      Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.

                                      En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.

                                      El desafío de optimizar las habilidades de los agentes

                                      Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.

                                      Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.

                                      Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.

                                      Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.

                                      «El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».

                                      Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».

                                      Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».

                                      Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.

                                      Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.

                                      Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.

                                      Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.

                                      Importar disciplina matemática al texto

                                      SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:

                                      • SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.

                                      • Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.

                                      • Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.

                                      • En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.

                                      • La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.

                                      SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.

                                      Canalización de SkillOpt

                                      Marco SkillOpt (fuente: arXiv)

                                      El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.

                                      Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.

                                      Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.

                                      SkillOpt en acción

                                      Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.

                                      La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.

                                      SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.

                                      Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.

                                      Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.

                                      «Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».

                                      Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.

                                      Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.

                                      Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.

                                      Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.

                                      Estrategias de implementación y la ‘captura’ empresarial

                                      Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.

                                      «El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.

                                      Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.

                                      SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».

                                      De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.

                                      «La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados ​​en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.

                                      Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.

                                      Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.

                                      Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.

                                      En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.

                                      El desafío de optimizar las habilidades de los agentes

                                      Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.

                                      Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.

                                      Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.

                                      Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.

                                      «El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».

                                      Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».

                                      Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».

                                      Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.

                                      Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.

                                      Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.

                                      Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.

                                      Importar disciplina matemática al texto

                                      SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:

                                      • SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.

                                      • Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.

                                      • Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.

                                      • En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.

                                      • La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.

                                      SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.

                                      Canalización de SkillOpt

                                      Marco SkillOpt (fuente: arXiv)

                                      El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.

                                      Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.

                                      Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.

                                      SkillOpt en acción

                                      Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.

                                      La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.

                                      SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.

                                      Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.

                                      Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.

                                      «Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».

                                      Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.

                                      Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.

                                      Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.

                                      Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.

                                      Estrategias de implementación y la ‘captura’ empresarial

                                      Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.

                                      «El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.

                                      Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.

                                      SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».

                                      De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.

                                      «La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados ​​en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.

                                      Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.

                                      Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.

                                      Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.

                                      En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.

                                      El desafío de optimizar las habilidades de los agentes

                                      Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.

                                      Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.

                                      Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.

                                      Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.

                                      «El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».

                                      Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».

                                      Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».

                                      Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.

                                      Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.

                                      Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.

                                      Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.

                                      Importar disciplina matemática al texto

                                      SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:

                                      • SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.

                                      • Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.

                                      • Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.

                                      • En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.

                                      • La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.

                                      SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.

                                      Canalización de SkillOpt

                                      Marco SkillOpt (fuente: arXiv)

                                      El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.

                                      Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.

                                      Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.

                                      SkillOpt en acción

                                      Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.

                                      La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.

                                      SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.

                                      Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.

                                      Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.

                                      «Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».

                                      Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.

                                      Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.

                                      Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.

                                      Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.

                                      Estrategias de implementación y la ‘captura’ empresarial

                                      Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.

                                      «El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.

                                      Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.

                                      SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».

                                      De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.

                                      «La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados ​​en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.

                                      Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.

                                      Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.

                                      Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.

                                      En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.

                                      El desafío de optimizar las habilidades de los agentes

                                      Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.

                                      Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.

                                      Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.

                                      Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.

                                      «El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».

                                      Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».

                                      Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».

                                      Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.

                                      Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.

                                      Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.

                                      Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.

                                      Importar disciplina matemática al texto

                                      SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:

                                      • SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.

                                      • Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.

                                      • Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.

                                      • En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.

                                      • La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.

                                      SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.

                                      Canalización de SkillOpt

                                      Marco SkillOpt (fuente: arXiv)

                                      El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.

                                      Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.

                                      Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.

                                      SkillOpt en acción

                                      Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.

                                      La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.

                                      SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.

                                      Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.

                                      Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.

                                      «Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».

                                      Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.

                                      Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.

                                      Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.

                                      Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.

                                      Estrategias de implementación y la ‘captura’ empresarial

                                      Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.

                                      «El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.

                                      Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.

                                      SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».

                                      De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.

                                      «La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Habilidades del agente se han convertido en una parte importante de las aplicaciones de IA del mundo real, proporcionando un mecanismo (un conjunto de instrucciones guardadas en una carpeta de archivos de rebajas basados ​​en texto (.md), generalmente) para que los modelos se adapten a casos de uso empresarial específicos y flujos de trabajo complejos.

                                      Sin embargo, optimizar estas habilidades es un proceso lento y defectuoso, ya que no se pueden entrenar de la misma manera que los parámetros del modelo de IA subyacente. En cambio, los usuarios normalmente deben actualizarlos manualmente volviendo a escribir las instrucciones en cada archivo, jugando un «juego de adivinanzas» sobre qué cambios podrían mejorar el rendimiento de la IA agente y reducir los errores.

                                      Opción por habilidadun nuevo código abierto (Licencia MIT) desarrollado por Microsoft, hace algo mejor: introduce un optimizador diseñado para las habilidades del agente, convirtiendo el documento .md de habilidades del agente en un objeto entrenable que evoluciona en función de la retroalimentación del rendimiento.

                                      Utiliza una optimización de estilo de aprendizaje profundo para que la IA pueda explorar sistemáticamente modificaciones en el documento y encontrar la mejor combinación de instrucciones. Lo más importante es que logra esta adaptación de procedimiento sin realizar cambios en los pesos del modelo subyacente.

                                      En varios puntos de referencia de la industria, SkillOpt supera las bases existentes, lo que aumenta significativamente la precisión de modelos como GPT-5.5 y Qwen. El resultado es un conjunto de artefactos de habilidades compactos y transferibles que permiten a los agentes de IA adaptarse a nuevos dominios sin esfuerzo.

                                      El desafío de optimizar las habilidades de los agentes

                                      Las habilidades de los agentes agrupan el conocimiento de procedimientos en especificaciones de lenguaje natural, incluidas heurísticas de dominio, políticas de uso de herramientas, restricciones de salida y modos de falla conocidos. Estas habilidades proporcionan una interfaz externa para que los agentes se adapten a flujos de trabajo empresariales complejos. En la práctica, las habilidades del agente se almacenan como documentos de texto y se insertan en el contexto del agente antes de su ejecución.

                                      Uno de los beneficios clave de las habilidades es que personalizan el comportamiento del modelo subyacente sin cambiar sus pesos. Sin embargo, el documento de habilidades en sí debe modificarse y optimizarse para obtener el mejor rendimiento del agente.

                                      Mientras que el aprendizaje profundo se basa en estrictos controles matemáticos para la estabilidad, la ingeniería humana a menudo se basa en prueba y error. Al intentar actualizar automáticamente un documento de habilidades basándose en comentarios, la falta de disciplina matemática hace que el texto sea muy volátil.

                                      Yifan Yang, investigador senior SDE en Microsoft Research Asia, dijo a VentureBeat que el problema no es hacer cambios, sino garantizar que esos cambios sean matemáticamente sólidos.

                                      «El punto de quiebre no es si un equipo puede cambiar una habilidad, sino que no pueden garantizar que el cambio sea una mejora», dijo Yang. «Se repiten tres modos de falla: sin control del tamaño de los pasos, por lo que las habilidades se desvían; sin validación, por lo que se escribe una solución que se lee como razonable y puede hacer una regresión silenciosa del rendimiento; y sin memoria negativa, por lo que la misma edición fallida sigue regresando».

                                      Para ilustrar con qué facilidad puede caer el rendimiento cuando las ediciones no se validan matemáticamente, Yang señaló que «una reescritura no controlada empujó GPT-5.5 en SpreadsheetBench de 41,8 a 41,1».

                                      Según Yang, estos modos de falla se amplifican en flujos de trabajo de múltiples pasos «porque ahí es donde los modelos de frontera son más débiles. No en el razonamiento, sino en la disciplina procesal: formato, autoverificación, política de herramientas».

                                      Antes de SkillOpt, las habilidades de los agentes se elaboraban principalmente a mano, se generaban en una sola toma o evolucionaban a través de procesos de autorrevisión poco controlados que no podían mejorar de manera confiable con retroalimentación.

                                      Métodos de optimización rápidos como TextGrad y GEPA tratan los artefactos del lenguaje como objetos optimizables y utilizan retroalimentación de trayectoria para desarrollar indicaciones, pero se centran en configuraciones de indicaciones únicas en lugar de generar artefactos de habilidades persistentes y reutilizables.

                                      Mientras tanto, los métodos de descubrimiento y evolución de habilidades como EvoSkill y Trace2Skill convierten las experiencias de ejecución de agentes en lecciones de trayectoria para refinar carpetas de habilidades, crear bibliotecas específicas de dominio o realizar búsquedas evolutivas.

                                      Ninguno de ellos aplica controles de estilo de aprendizaje profundo, como tasas de aprendizaje, puertas de validación e impulso, que son necesarios para entrenar continuamente un documento de habilidades único y compacto.

                                      Importar disciplina matemática al texto

                                      SkillOpt optimiza un documento de texto a través de un ciclo iterativo de propuesta y prueba que separa el modelo que ejecuta las tareas del modelo que optimiza la habilidad. El proceso se desarrolla en varios pasos:

                                      • SkillOpt comienza con un documento de habilidades inicial y un modelo de destino congelado (o arnés), donde el modelo de destino ejecuta un lote de tareas para generar trayectorias de ejecución que actúan como evidencia para el paso actual.

                                      • Un modelo optimizador fuera de línea analiza estas trayectorias, separando los éxitos de los fracasos en minilotes. Observar un minibatch ayuda al modelo a identificar errores de procedimiento sistemáticos en lugar de anomalías únicas. En función de estos patrones, el optimizador propone ediciones estructurales para agregar, eliminar o reemplazar al documento de habilidades.

                                      • Las ediciones propuestas se revisan para filtrar duplicados o contradicciones, y luego el optimizador clasifica estas ediciones candidatas según su utilidad esperada.

                                      • En lugar de aplicar todos los cambios propuestos, SkillOpt recorta la lista a un presupuesto de edición máximo para ese paso, generando una habilidad candidata.

                                      • La habilidad del candidato se evalúa en un conjunto de validación disponible utilizando el modelo objetivo. Si el candidato mejora el puntaje de validación, es aceptado y pasa a ser la nueva habilidad actual. Si falla, las ediciones se rechazan y se envían a un búfer de ediciones rechazadas, lo que proporciona retroalimentación negativa para que el optimizador sepa que no debe repetir ese error.

                                      SkillOpt aborda directamente el problema de tratar el texto como un objeto entrenable importando conceptos matemáticos del aprendizaje profundo. Los creadores señalan que «la analogía del aprendizaje profundo es operativa más que decorativa», lo que ayuda al marco a evitar los problemas de inestabilidad asociados con otras técnicas de optimización.

                                      Canalización de SkillOpt

                                      Marco SkillOpt (fuente: arXiv)

                                      El presupuesto de edición actúa como una tasa de aprendizaje. Al limitar la cantidad de ediciones que se pueden aplicar a la vez, se evita que la versión de la habilidad se aleje demasiado de su estado anterior, lo que preserva la continuidad y permite adquirir nuevos procedimientos.

                                      Al igual que verificar la pérdida de validación en el aprendizaje profundo, los ejemplos estrictos reservados garantizan que las ediciones de texto que parezcan plausibles solo se mantengan si mejoran matemáticamente el rendimiento real del agente en la división de validación.

                                      Al final de una época, SkillOpt realiza una actualización lenta comparando tareas bajo las habilidades de la época anterior y actual. Esto actúa como un término de impulso, que transmite lecciones de procedimiento duraderas y de largo plazo, al tiempo que las aísla de las ediciones rápidas a nivel de pasos.

                                      SkillOpt en acción

                                      Para evaluar la técnica en la práctica, los investigadores probaron SkillOpt en diferentes modelos, desde modelos de frontera a gran escala como GPT-5.5 hasta modelos cerrados y abiertos más pequeños, incluidos GPT-5.4-mini y Qwen3.5-4B. También implementaron las habilidades dentro de diferentes sistemas de ejecución, utilizando chat simple y sistemas de codificación complejos como Codex CLI y Claude Code.

                                      La evaluación abarcó diversos puntos de referencia de la industria, incluida la respuesta a preguntas de una sola ronda, la generación de código de múltiples rondas que involucra el uso de herramientas y el razonamiento de documentos multimodal. SkillOpt se midió en función de múltiples puntos de referencia que van desde una configuración predeterminada sin habilidades hasta habilidades escritas por humanos y habilidades generadas por un LLM de una sola vez. También se comparó con métodos avanzados de optimización de indicaciones y evolución de habilidades, específicamente Trace2Skill, TextGrad, GEPA y EvoSkill.

                                      SkillOpt dominó en todos los ámbitos y demostró ser muy eficaz en las 52 combinaciones evaluadas de modelo, punto de referencia y arnés. Fue particularmente efectivo con los modelos fronterizos, brindando una mejora absoluta promedio de +23,5 puntos frente a la línea de base sin habilidad en GPT-5.5. Además, SkillOpt superó una base de referencia hipotética de Oracle que selecciona el mejor método competitivo para cada problema.

                                      Los modelos de destino pequeños obtuvieron inmensas ganancias relativas, lo que demuestra que un archivo de texto compacto puede proporcionar conocimientos de procedimiento del que carecen los modelos pequeños en sus pesos. Por ejemplo, GPT-5.4-nano casi duplicó su puntuación en control de calidad de documentos multimodal y triplicó su puntuación en interacción incorporada y toma de decisiones secuencial.

                                      Estos puntos de referencia académicos se corresponden con puntos críticos de la empresa. Los modelos de disparo cero a menudo alucinan con el formateo o no utilizan las herramientas correctamente en escenarios de varios pasos. Yang explicó que los mayores saltos de rendimiento se produjeron en operaciones que históricamente las empresas luchan por automatizar de forma fiable.

                                      «Extracción de datos de documentos… cifras exactas de contratos, facturas y formularios: automatización de cuentas a pagar, reclamos, cumplimiento», dijo Yang. «Lo que mejora es la confiabilidad: formato preciso, autoverificación, resultados auditables. Y las ganancias provienen del aprendizaje del procedimiento, no de la memorización de respuestas».

                                      Para los profesionales empresariales, el verdadero valor de SkillOpt radica en su portabilidad, eficiencia y compatibilidad con la infraestructura existente. Los experimentos confirman que el marco es independiente del arnés. Además del chat básico, el mismo ciclo de optimización se integró con éxito en entornos de ejecución respaldados por herramientas como Codex CLI y Claude Code, con ganancias significativas en los puntos de referencia de la industria.

                                      Los desarrolladores pueden entrenar una habilidad usando un ciclo de ejecución e implementarla en otro. Por ejemplo, una habilidad de hoja de cálculo entrenada completamente dentro del bucle Codex se movió directamente a Claude Code y generó una ganancia de +59,7 puntos sobre la línea de base nativa de Claude Code sin ningún cambio adicional.

                                      Los artefactos de SkillOpt también se transfieren limpiamente entre escalas de modelo. Se implementó una habilidad optimizada para GPT-5.4 en los modelos más pequeños GPT-5.4-mini y GPT-5.4-nano con ganancias positivas, lo que demuestra que los procedimientos aprendidos codifican flujos de trabajo reutilizables en lugar de simplemente explotar las peculiaridades de la arquitectura de un modelo específico.

                                      Finalmente, el marco es altamente eficiente con respecto al uso de tokens y el espacio de la ventana de contexto. En todos los puntos de referencia, las habilidades implementadas finales nunca superaron los 2000 tokens, con una longitud media de aproximadamente 920 tokens. Esto da como resultado artefactos altamente legibles y auditables que un profesional humano puede revisar y administrar en minutos.

                                      Estrategias de implementación y la ‘captura’ empresarial

                                      Para los líderes tecnológicos empresariales, adoptar un nuevo marco requiere comprender los gastos generales y las limitaciones. Si bien el artículo de investigación señala que los tokens de capacitación pueden alcanzar hasta 210 millones para los puntos de referencia académicos, la realidad para los casos de uso empresarial cotidianos es mucho más clara. Los elevados recuentos de tokens en las pruebas se debieron en gran medida a la nueva puntuación de conjuntos de pruebas masivos retenidos.

                                      «El verdadero trabajo inicial es el verificador y un representante dividido. El optimizador es liviano; el arnés de evaluación es hacia donde va la ingeniería», dijo Yang. Añadió que para el uso diario, «en marcos comunitarios como GBrain, donde las actualizaciones de SkillOpt se ejecutan en Claude Sonnet, entrenar una habilidad para una sola tarea cuesta en promedio entre 1 y 5 dólares». Este costo de optimización es una tarifa única que se amortiza completamente en el momento de la implementación.

                                      Sin embargo, el marco requiere condiciones específicas para funcionar de manera efectiva, es decir, unas pocas docenas de ejemplos representativos y una señal de retroalimentación puntuable. Los equipos deben evitar aplicar SkillOpt a tareas subjetivas o abiertas. «Sin un evaluador automático claro, hay que diseñar un evaluador humano o basado en un modelo y observar su estabilidad», dijo Yang.

                                      SkillOpt también se integra sin problemas con las pilas de orquestación existentes, eliminando un obstáculo importante para la adopción. Por ejemplo, los desarrolladores que ya utilizan compiladores de canalizaciones pueden ejecutar ambos sistemas de forma armoniosa. «DSPy es una capa diferente y complementaria», dijo Yang. «Compila canalizaciones de LM declarativas y optimiza la estructura del programa; SkillOpt optimiza el estado de la habilidad externa que carga un agente congelado. Pueden ejecutarse juntos».

                                      De cara al futuro, los desarrolladores de código abierto ya están programando SkillOpt para que se ejecute periódicamente sobre las trayectorias pasadas de sus agentes, creando un pequeño ecosistema de complementos de agentes de código que se optimizan automáticamente. Este ciclo de retroalimentación continua representa un cambio significativo en la forma en que se adaptan los sistemas de IA.

                                      «La versión valiosa de la superación personal es que un agente descubra de forma autónoma conocimientos para mejorar su propio comportamiento y la experiencia del usuario, bajo verificación y auditoría», dijo Yang. «Las habilidades son el primer paso más rápido, más barato y más reversible, y la misma mentalidad apunta a que los agentes eventualmente se optimicen a sí mismos, hasta llegar a su propio peso».

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      — Redacción Despertar Matinal

                                      — Redacción Despertar Matinal

                                      Programa radial que te conecta con la información desde temprano en la mañana.

                                      Next Post
                                      SkillOpt de código abierto de Microsoft actualiza automáticamente las habilidades de los agentes de IA sin tocar los pesos del modelo

                                      SkillOpt open source de Microsoft met automatiquement à niveau les compétences des agents IA sans toucher aux pondérations des modèles

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • LTX-2.5 can generate a 10-second AI video from an image in just 6.8 seconds on Nvidia superchips — and it's open weights

                                        LTX-2.5 can generate a 10-second AI video from an image in just 6.8 seconds on Nvidia superchips — and it’s open weights

                                        0 shares
                                        Share 0 Tweet 0
                                      • Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                                        0 shares
                                        Share 0 Tweet 0
                                      • Pianista surcoreano se recrea tras sufrir un derrame cerebral

                                        0 shares
                                        Share 0 Tweet 0
                                      • Roberto Ángel Salcedo destaca avances de la cultura durante seis años de Gobierno de Abinader

                                        0 shares
                                        Share 0 Tweet 0
                                      • Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por