• Nosotros
  • Publicidad
  • Trabaja con nosotros
  • Contactos
viernes, septiembre 4, 2026
  • Login
No Result
View All Result
NEWSLETTER
Despertar Matinal
  • Titulares del Día
    • All
    • En Portada
    FP Santiago: apagones y facturas revelan fracaso del PRM

    FP Santiago: apagones y facturas revelan fracaso del PRM

    Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

    Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

    AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

    AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

    Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

    Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

    Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

    Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

    Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

    Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

    Robinson Díaz: “Collado con 55% duplica a la oposición; será presidente; tiene 80% del PRM; Abinader será arbitro”

    Robinson Díaz: “Collado con 55% duplica a la oposición; será presidente; tiene 80% del PRM; Abinader será arbitro”

    “La gente está harta del Gobierno del PRM y sus fechorías”, asegura Joaquín Gerónimo

    “La gente está harta del Gobierno del PRM y sus fechorías”, asegura Joaquín Gerónimo

    Rector del ITLA anuncia que la meta para 2027 será duplicar su matrícula

    Rector del ITLA anuncia que la meta para 2027 será duplicar su matrícula

    Trending Tags

    • Mundo
      • All
      • América Latina
      • Conflictos Internacionales
      • Estados Unidos
      • Europa
      • Geopolítica
      • Haití
      • Medio Oriente
      HBO Max: la lista completa de estrenos de series y películas en septiembre

      HBO Max: la lista completa de estrenos de series y películas en septiembre

      En qué consiste la Ley de Defensa de la Soberanía Nacional que Milei enviará al Congreso

      En qué consiste la Ley de Defensa de la Soberanía Nacional que Milei enviará al Congreso

      Pablo Quirno tras la cadena nacional de Milei: "La causa Malvinas está arriba de todo"

      Pablo Quirno tras la cadena nacional de Milei: «La causa Malvinas está arriba de todo»

      Javier Milei apuntó contra la crisis migratoria que azota al Reino Unido

      Javier Milei apuntó contra la crisis migratoria que azota al Reino Unido

      Qué es Sea Lion, el proyecto petrolero británico en Malvinas que Milei busca frenar

      Qué es Sea Lion, el proyecto petrolero británico en Malvinas que Milei busca frenar

      El Banco Central adquirió USD 15 millones para sus reservas

      El Banco Central adquirió USD 15 millones para sus reservas

      Apareció muerto un exfuncionario kirchnerista que debía declarar por corrupción

      Apareció muerto un exfuncionario kirchnerista que debía declarar por corrupción

      Inesperado: un campeón del mundo con España se retiró de su selección a los 31 años

      Inesperado: un campeón del mundo con España se retiró de su selección a los 31 años

      Martín Demichelis recordó su paso por River y fue autocrítico: "Cometí errores"

      Martín Demichelis recordó su paso por River y fue autocrítico: «Cometí errores»

      Trending Tags

      • Nacionales
        • All
        • Bávaro Punta Cana
        • Educación
        • Gobierno
        • Infraestructura
        • Justicia
        • Obras Públicas
        • Opinión
        • Provincias
        • Seguridad Ciudadana
        • semana santa 2026
        • Sociedad
        • Transporte
        FP Santiago: apagones y facturas revelan fracaso del PRM

        FP Santiago: apagones y facturas revelan fracaso del PRM

        Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

        Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

        AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

        AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

        Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

        Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

        República Dominicana y Haití desarrollan agenda de trabajo sobre temas de interés bilateral

        República Dominicana y Haití desarrollan agenda de trabajo sobre temas de interés bilateral

        Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

        Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

        Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

        Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

        Robinson Díaz: “Collado con 55% duplica a la oposición; será presidente; tiene 80% del PRM; Abinader será arbitro”

        Robinson Díaz: “Collado con 55% duplica a la oposición; será presidente; tiene 80% del PRM; Abinader será arbitro”

        “La gente está harta del Gobierno del PRM y sus fechorías”, asegura Joaquín Gerónimo

        “La gente está harta del Gobierno del PRM y sus fechorías”, asegura Joaquín Gerónimo

        Trending Tags

        • Política
          • All
          • Congreso
          • Opinión Política
          • Partidos Políticos
          • Poder Municipal
          • Transparencia y Corrupción
          Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

          Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

          ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

          ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

          Dicen proyecto presidencial de Gonzalo Castillo impacta más de 40 territorios el fin de semana

          Dicen proyecto presidencial de Gonzalo Castillo impacta más de 40 territorios el fin de semana

          Antonio Marte juramenta nuevas estructuras fortalecen PPG

          Antonio Marte juramenta nuevas estructuras fortalecen PPG

          Leonel Fernández encabeza asambleas provinciales en despliegue nacional de la Fuerza del Pueblo

          Leonel Fernández encabeza asambleas provinciales en despliegue nacional de la Fuerza del Pueblo

          Rafael Méndez “El Conde” anuncia aspiración a regidor por Fuerza del Pueblo en San Juan de la Maguana

          Rafael Méndez “El Conde” anuncia aspiración a regidor por Fuerza del Pueblo en San Juan de la Maguana

          Vicealcaldesa de Los Alcarrizos abandona el PRM y se juramenta en la Fuerza del Pueblo junto a más de 300 dirigentes

          Vicealcaldesa de Los Alcarrizos abandona el PRM y se juramenta en la Fuerza del Pueblo junto a más de 300 dirigentes

          Leonel afirma PRM no pudo mantener 24 horas de electricidad y la gente está cansada de apagones

          Leonel afirma PRM no pudo mantener 24 horas de electricidad y la gente está cansada de apagones

          Johnny Pujols afirma PLD fortalece su estructura territorial mientras PRM va en picada

          Johnny Pujols afirma PLD fortalece su estructura territorial mientras PRM va en picada

          Trending Tags

          • Deportes
            • All
            • Atletas Dominicanos
            • Béisbol
            DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

            Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

            30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

            Buffalo recibe a Montreal para abrir la segunda ronda

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

            Trending Tags

            • Economía
              • All
              • Combustibles
              • Energía
              • Indicadores Económicos
              • Sector Energético
              • Turismo
              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

              Aventúrate RD 2026

              Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

              El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

              El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

              Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

              Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

              Trending Tags

              • Ciencia
                • All
                • Energía
                • Innovación
                • Investigación Científica
                • Salud y Medicina
                • Tecnología Médica
                US diesel prices hit an all-time-high

                US diesel prices hit an all-time-high

                How could US-Iran conflict end? Three experts give their views

                How could US-Iran conflict end? Three experts give their views

                Steve Irwin's family celebrates 'superhero' dad, 20 years after shock death

                Steve Irwin’s family celebrates ‘superhero’ dad, 20 years after shock death

                Argentine leader says oil firms working off Falklands face sanctions

                Argentine leader says oil firms working off Falklands face sanctions

                Volkswagen board approves plan to cut another 50,000 jobs

                Volkswagen board approves plan to cut another 50,000 jobs

                Lindsay Clancy trial tensions flare as judge declines to remove holdout juror

                Lindsay Clancy trial tensions flare as judge declines to remove holdout juror

                Kenya's milk shortage: Chai tea lovers unhappy as cows run dry

                Kenya’s milk shortage: Chai tea lovers unhappy as cows run dry

                Pig kidney works in human body for 271 days - is this the future of organ transplants?

                Pig kidney works in human body for 271 days – is this the future of organ transplants?

                Australia is becoming a data centre capital - but at what cost?

                Australia is becoming a data centre capital – but at what cost?

                Trending Tags

                • Tecnología
                  • All
                  • Aplicaciones
                  • Inteligencia Artificial
                  El sitio web de la Casa Blanca estrena 5 videojuegos arcade retro que promueven la agenda de Trump

                  El sitio web de la Casa Blanca estrena 5 videojuegos arcade retro que promueven la agenda de Trump

                  Las cámaras de vigilancia de multitudes se convierten en el objetivo de la campaña de mitad de mandato mientras los votantes se resisten al poder de las empresas de tecnología

                  Las cámaras de vigilancia de multitudes se convierten en el objetivo de la campaña de mitad de mandato mientras los votantes se resisten al poder de las empresas de tecnología

                  'Welcome to the AGI era': OpenAI launches GPT-6 Astra

                  ‘Welcome to the AGI era’: OpenAI launches GPT-6 Astra

                  Los piratas informáticos vinculados a China abrieron puertas traseras a las computadoras portátiles de los ejecutivos a través de USB, explotando una solución que las empresas tenían pero que no estaban usando.

                  Los piratas informáticos vinculados a China abrieron puertas traseras a las computadoras portátiles de los ejecutivos a través de USB, explotando una solución que las empresas tenían pero que no estaban usando.

                  30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                  Científicos que estudian la leche de cucaracha y sonarse la nariz ganan premios Ig Nobel por ciencia peculiar

                  Meta dice que Muse Spark 1.3 tiene un rendimiento de vanguardia, pero sus mejores resultados provienen de un modelo que los desarrolladores aún no pueden utilizar ampliamente.

                  Meta dice que Muse Spark 1.3 tiene un rendimiento de vanguardia, pero sus mejores resultados provienen de un modelo que los desarrolladores aún no pueden utilizar ampliamente.

                  Un par de naves espaciales se acercan a Mercurio después de un viaje de casi una década

                  Un par de naves espaciales se acercan a Mercurio después de un viaje de casi una década

                  Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

                  Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

                  La brecha de visibilidad de la IA: por qué las grandes marcas se están alejando de las respuestas de la IA

                  La brecha de visibilidad de la IA: por qué las grandes marcas se están alejando de las respuestas de la IA

                  Trending Tags

                  • Entretenimiento
                    • All
                    • Cine y Series
                    • Cultura Digital
                    • Cultura Popular
                    • Gastronomía
                    • Música
                    Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                    Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                    Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                    Trending Tags

                    • Titulares del Día
                      • All
                      • En Portada
                      FP Santiago: apagones y facturas revelan fracaso del PRM

                      FP Santiago: apagones y facturas revelan fracaso del PRM

                      Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

                      Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

                      AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

                      AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

                      Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

                      Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

                      Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

                      Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

                      Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

                      Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

                      Robinson Díaz: “Collado con 55% duplica a la oposición; será presidente; tiene 80% del PRM; Abinader será arbitro”

                      Robinson Díaz: “Collado con 55% duplica a la oposición; será presidente; tiene 80% del PRM; Abinader será arbitro”

                      “La gente está harta del Gobierno del PRM y sus fechorías”, asegura Joaquín Gerónimo

                      “La gente está harta del Gobierno del PRM y sus fechorías”, asegura Joaquín Gerónimo

                      Rector del ITLA anuncia que la meta para 2027 será duplicar su matrícula

                      Rector del ITLA anuncia que la meta para 2027 será duplicar su matrícula

                      Trending Tags

                      • Mundo
                        • All
                        • América Latina
                        • Conflictos Internacionales
                        • Estados Unidos
                        • Europa
                        • Geopolítica
                        • Haití
                        • Medio Oriente
                        HBO Max: la lista completa de estrenos de series y películas en septiembre

                        HBO Max: la lista completa de estrenos de series y películas en septiembre

                        En qué consiste la Ley de Defensa de la Soberanía Nacional que Milei enviará al Congreso

                        En qué consiste la Ley de Defensa de la Soberanía Nacional que Milei enviará al Congreso

                        Pablo Quirno tras la cadena nacional de Milei: "La causa Malvinas está arriba de todo"

                        Pablo Quirno tras la cadena nacional de Milei: «La causa Malvinas está arriba de todo»

                        Javier Milei apuntó contra la crisis migratoria que azota al Reino Unido

                        Javier Milei apuntó contra la crisis migratoria que azota al Reino Unido

                        Qué es Sea Lion, el proyecto petrolero británico en Malvinas que Milei busca frenar

                        Qué es Sea Lion, el proyecto petrolero británico en Malvinas que Milei busca frenar

                        El Banco Central adquirió USD 15 millones para sus reservas

                        El Banco Central adquirió USD 15 millones para sus reservas

                        Apareció muerto un exfuncionario kirchnerista que debía declarar por corrupción

                        Apareció muerto un exfuncionario kirchnerista que debía declarar por corrupción

                        Inesperado: un campeón del mundo con España se retiró de su selección a los 31 años

                        Inesperado: un campeón del mundo con España se retiró de su selección a los 31 años

                        Martín Demichelis recordó su paso por River y fue autocrítico: "Cometí errores"

                        Martín Demichelis recordó su paso por River y fue autocrítico: «Cometí errores»

                        Trending Tags

                        • Nacionales
                          • All
                          • Bávaro Punta Cana
                          • Educación
                          • Gobierno
                          • Infraestructura
                          • Justicia
                          • Obras Públicas
                          • Opinión
                          • Provincias
                          • Seguridad Ciudadana
                          • semana santa 2026
                          • Sociedad
                          • Transporte
                          FP Santiago: apagones y facturas revelan fracaso del PRM

                          FP Santiago: apagones y facturas revelan fracaso del PRM

                          Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

                          Procuradora General revela RD registra 62 feminicidios en lo que va de 2026; llama a reforzar prevención

                          AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

                          AIRD considera nuevo Código Penal plantea reto de fortalecer cultura de cumplimiento de las empresas en RD

                          Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

                          Presidente Abinader destaca reducción de la pobreza y avances sociales y económicos de República Dominicana

                          República Dominicana y Haití desarrollan agenda de trabajo sobre temas de interés bilateral

                          República Dominicana y Haití desarrollan agenda de trabajo sobre temas de interés bilateral

                          Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

                          Aseguran auditoría de la Cámara de Cuentas no encontró irregularidades en la gestión de Roberto Fulcar al frente del MINERD

                          Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

                          Recesan juicio de fondo contra Hugo Beras, Jochi Gómez y compartes

                          Robinson Díaz: “Collado con 55% duplica a la oposición; será presidente; tiene 80% del PRM; Abinader será arbitro”

                          Robinson Díaz: “Collado con 55% duplica a la oposición; será presidente; tiene 80% del PRM; Abinader será arbitro”

                          “La gente está harta del Gobierno del PRM y sus fechorías”, asegura Joaquín Gerónimo

                          “La gente está harta del Gobierno del PRM y sus fechorías”, asegura Joaquín Gerónimo

                          Trending Tags

                          • Política
                            • All
                            • Congreso
                            • Opinión Política
                            • Partidos Políticos
                            • Poder Municipal
                            • Transparencia y Corrupción
                            Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

                            Fuerza del Pueblo denuncia aumentan las quejas por facturación elevada y persisten los apagones

                            ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

                            ¡Leonel Fernández llega a San Juan! La Fuerza del Pueblo prepara gran acto de juramentación de nuevos miembros

                            Dicen proyecto presidencial de Gonzalo Castillo impacta más de 40 territorios el fin de semana

                            Dicen proyecto presidencial de Gonzalo Castillo impacta más de 40 territorios el fin de semana

                            Antonio Marte juramenta nuevas estructuras fortalecen PPG

                            Antonio Marte juramenta nuevas estructuras fortalecen PPG

                            Leonel Fernández encabeza asambleas provinciales en despliegue nacional de la Fuerza del Pueblo

                            Leonel Fernández encabeza asambleas provinciales en despliegue nacional de la Fuerza del Pueblo

                            Rafael Méndez “El Conde” anuncia aspiración a regidor por Fuerza del Pueblo en San Juan de la Maguana

                            Rafael Méndez “El Conde” anuncia aspiración a regidor por Fuerza del Pueblo en San Juan de la Maguana

                            Vicealcaldesa de Los Alcarrizos abandona el PRM y se juramenta en la Fuerza del Pueblo junto a más de 300 dirigentes

                            Vicealcaldesa de Los Alcarrizos abandona el PRM y se juramenta en la Fuerza del Pueblo junto a más de 300 dirigentes

                            Leonel afirma PRM no pudo mantener 24 horas de electricidad y la gente está cansada de apagones

                            Leonel afirma PRM no pudo mantener 24 horas de electricidad y la gente está cansada de apagones

                            Johnny Pujols afirma PLD fortalece su estructura territorial mientras PRM va en picada

                            Johnny Pujols afirma PLD fortalece su estructura territorial mientras PRM va en picada

                            Trending Tags

                            • Deportes
                              • All
                              • Atletas Dominicanos
                              • Béisbol
                              DR Open Kiteboarding Championship reúne atletas de 15 países y reafirma a Cabarete como capital del kitesurf del Caribe

                              Cabarete se corona como capital histórica del kitesurf con el DR Open Championship 2026

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              El impulso olímpico del billar recibe un impulso de los dos campeones mundiales consecutivos de China

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              La reboteadora líder de todos los tiempos de la WNBA, Tina Charles, se retira del baloncesto

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Sabalenka pide boicot si los jugadores no obtienen una mayor parte de los ingresos del Grand Slam

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Los 76ers tienen un cambio breve y luego una noche larga con una derrota aplastante en el Juego 1

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Ex empleado de Stefon Diggs subirá al estrado por segundo día en el juicio por agresión a un jugador de la NFL

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              Kansas City es la sede central de la Copa del Mundo y alberga a Inglaterra, Argentina y Holanda, además de 6 partidos.

                              30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                              Buffalo recibe a Montreal para abrir la segunda ronda

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Judge quiere una nueva tradición del Bronx: “¡Los Yankees ganan!” de Sterling. antes de la canción de Sinatra

                              Trending Tags

                              • Economía
                                • All
                                • Combustibles
                                • Energía
                                • Indicadores Económicos
                                • Sector Energético
                                • Turismo
                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aerodom anuncia nuevas rutas aéreas, pero la pregunta de fondo es quién fiscaliza la concesión

                                Aventúrate RD 2026

                                Aventúrate RD 2026 revela agenda oficial y consolida el turismo de aventura dominicano

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                WTTC: Una inversión de más de un billón de dólares en viajes y turismo es una muestra de confianza en el futuro del sector

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Una semana para crear en Samaná: Atelier Yubarta busca conectar arte, naturaleza y turismo en Cayo Levantado Resort

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Meta RD 2036: el plan turístico que el Gobierno aplaude sin fiscalización

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                Viva Resorts impulsa el turismo interno en República Dominicana con jornada exclusiva en Bayahibe

                                El ministerio de Turismo cierra con éxito festival gastronómico “Saborea el Paraíso” en Sánchez, Samaná

                                El Ministerio de Turismo celebra un exitoso cierre del festival gastronómico «Saborea el Paraíso» en Sánchez, Samaná

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                El Consejo Mundial de Viajes y Turismo (WTTC) informa la incorporación de Piñero como miembro global

                                Más allá del comercio: los efectos del arancel estadounidense sobre el turismo dominicano

                                Arancel de EE.UU. pone a prueba al turismo dominicano y al silencio oficial del gobierno

                                Trending Tags

                                • Ciencia
                                  • All
                                  • Energía
                                  • Innovación
                                  • Investigación Científica
                                  • Salud y Medicina
                                  • Tecnología Médica
                                  US diesel prices hit an all-time-high

                                  US diesel prices hit an all-time-high

                                  How could US-Iran conflict end? Three experts give their views

                                  How could US-Iran conflict end? Three experts give their views

                                  Steve Irwin's family celebrates 'superhero' dad, 20 years after shock death

                                  Steve Irwin’s family celebrates ‘superhero’ dad, 20 years after shock death

                                  Argentine leader says oil firms working off Falklands face sanctions

                                  Argentine leader says oil firms working off Falklands face sanctions

                                  Volkswagen board approves plan to cut another 50,000 jobs

                                  Volkswagen board approves plan to cut another 50,000 jobs

                                  Lindsay Clancy trial tensions flare as judge declines to remove holdout juror

                                  Lindsay Clancy trial tensions flare as judge declines to remove holdout juror

                                  Kenya's milk shortage: Chai tea lovers unhappy as cows run dry

                                  Kenya’s milk shortage: Chai tea lovers unhappy as cows run dry

                                  Pig kidney works in human body for 271 days - is this the future of organ transplants?

                                  Pig kidney works in human body for 271 days – is this the future of organ transplants?

                                  Australia is becoming a data centre capital - but at what cost?

                                  Australia is becoming a data centre capital – but at what cost?

                                  Trending Tags

                                  • Tecnología
                                    • All
                                    • Aplicaciones
                                    • Inteligencia Artificial
                                    El sitio web de la Casa Blanca estrena 5 videojuegos arcade retro que promueven la agenda de Trump

                                    El sitio web de la Casa Blanca estrena 5 videojuegos arcade retro que promueven la agenda de Trump

                                    Las cámaras de vigilancia de multitudes se convierten en el objetivo de la campaña de mitad de mandato mientras los votantes se resisten al poder de las empresas de tecnología

                                    Las cámaras de vigilancia de multitudes se convierten en el objetivo de la campaña de mitad de mandato mientras los votantes se resisten al poder de las empresas de tecnología

                                    'Welcome to the AGI era': OpenAI launches GPT-6 Astra

                                    ‘Welcome to the AGI era’: OpenAI launches GPT-6 Astra

                                    Los piratas informáticos vinculados a China abrieron puertas traseras a las computadoras portátiles de los ejecutivos a través de USB, explotando una solución que las empresas tenían pero que no estaban usando.

                                    Los piratas informáticos vinculados a China abrieron puertas traseras a las computadoras portátiles de los ejecutivos a través de USB, explotando una solución que las empresas tenían pero que no estaban usando.

                                    30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                    Científicos que estudian la leche de cucaracha y sonarse la nariz ganan premios Ig Nobel por ciencia peculiar

                                    Meta dice que Muse Spark 1.3 tiene un rendimiento de vanguardia, pero sus mejores resultados provienen de un modelo que los desarrolladores aún no pueden utilizar ampliamente.

                                    Meta dice que Muse Spark 1.3 tiene un rendimiento de vanguardia, pero sus mejores resultados provienen de un modelo que los desarrolladores aún no pueden utilizar ampliamente.

                                    Un par de naves espaciales se acercan a Mercurio después de un viaje de casi una década

                                    Un par de naves espaciales se acercan a Mercurio después de un viaje de casi una década

                                    Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

                                    Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

                                    La brecha de visibilidad de la IA: por qué las grandes marcas se están alejando de las respuestas de la IA

                                    La brecha de visibilidad de la IA: por qué las grandes marcas se están alejando de las respuestas de la IA

                                    Trending Tags

                                    • Entretenimiento
                                      • All
                                      • Cine y Series
                                      • Cultura Digital
                                      • Cultura Popular
                                      • Gastronomía
                                      • Música
                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo "un gran secreto"

                                      Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      La ‘Odisea’ de Emily Wilson se convirtió en un punto de inflamación cultural. Ahora ella está retraduciendo todo.

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Editor, editor y reportero de Stars and Stripes demandan al Pentágono para impugnar sus despidos

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Muere Peter Cullen, el prolífico actor de doblaje que le dio a Optimus Prime su autoritario barítono

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Juez pregunta por qué el Kennedy Center se está moviendo tan rápido para devolver el nombre de Trump al edificio

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      Un teatro reinventa la Odisea de Homero a través de la agonía de la guerra de Ucrania

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      En el conflictivo norte de Nigeria, una animada vida nocturna convive con una policía moral e inseguridad.

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      El rapero Yung Filly regresará a Gran Bretaña antes del juicio por violación en Australia el próximo año

                                      30 pasajeros son evacuados después de que un crucero encallara en un arrecife en Fiji

                                      Los británicos tienen la oportunidad de leer las memorias de Jason Arday en las librerías del Reino Unido

                                      Trending Tags

                                      No Result
                                      View All Result
                                      Despertar Matinal
                                      No Result
                                      View All Result

                                      Sorpresa sorpresa: GPT-5.5 supera a Claude Fable 5 en el brutal nuevo punto de referencia del último examen de agentes

                                      by — Redacción Despertar Matinal
                                      10 de junio de 2026
                                      in Tecnología
                                      0
                                      Sorpresa sorpresa: GPT-5.5 supera a Claude Fable 5 en el brutal nuevo punto de referencia del último examen de agentes
                                      0
                                      SHARES
                                      17
                                      VIEWS
                                      Share on FacebookShare on Twitter

                                      Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.

                                      En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.

                                      En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.

                                      Tabla completa de clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Tabla de clasificación ALE

                                      Clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles

                                      El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.

                                      Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados ​​en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.

                                      Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.

                                      ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.

                                      El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).

                                      Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.

                                      Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.

                                      Medición del desempeño de las tareas en 55 industrias

                                      ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.

                                      Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.

                                      Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.

                                      Los 5 mejores arneses agentes en la clasificación de ALE

                                      Rango

                                      Arnés de agente

                                      Modelo subyacente

                                      Tasa de aprobación

                                      Puntuación media

                                      1

                                      Códice

                                      gpt-5-5

                                      24,0%

                                      42,8%

                                      2

                                      Pero garra

                                      gpt-5-5

                                      23,0%

                                      45,8%

                                      3

                                      Código Claude

                                      claude-fabula-5

                                      22,0%

                                      40,5%

                                      4

                                      garra abierta

                                      gpt-5-5

                                      21,1%

                                      41,0%

                                      5

                                      CLI del cursor

                                      compositor-2-5

                                      20,4%

                                      38,5%

                                      La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.

                                      Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.

                                      En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.

                                      Resolviendo la contaminación de referencia

                                      Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.

                                      ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.

                                      Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.

                                      Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.

                                      Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.

                                      El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados ​​por tener acceso a software empresarial pago.

                                      Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora

                                      Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.

                                      Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.

                                      «Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».

                                      En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:

                                      «Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».

                                      A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.

                                      En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.

                                      En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.

                                      Tabla completa de clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Tabla de clasificación ALE

                                      Clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles

                                      El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.

                                      Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados ​​en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.

                                      Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.

                                      ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.

                                      El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).

                                      Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.

                                      Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.

                                      Medición del desempeño de las tareas en 55 industrias

                                      ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.

                                      Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.

                                      Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.

                                      Los 5 mejores arneses agentes en la clasificación de ALE

                                      Rango

                                      Arnés de agente

                                      Modelo subyacente

                                      Tasa de aprobación

                                      Puntuación media

                                      1

                                      Códice

                                      gpt-5-5

                                      24,0%

                                      42,8%

                                      2

                                      Pero garra

                                      gpt-5-5

                                      23,0%

                                      45,8%

                                      3

                                      Código Claude

                                      claude-fabula-5

                                      22,0%

                                      40,5%

                                      4

                                      garra abierta

                                      gpt-5-5

                                      21,1%

                                      41,0%

                                      5

                                      CLI del cursor

                                      compositor-2-5

                                      20,4%

                                      38,5%

                                      La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.

                                      Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.

                                      En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.

                                      Resolviendo la contaminación de referencia

                                      Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.

                                      ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.

                                      Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.

                                      Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.

                                      Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.

                                      El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados ​​por tener acceso a software empresarial pago.

                                      Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora

                                      Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.

                                      Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.

                                      «Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».

                                      En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:

                                      «Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».

                                      A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.

                                      En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.

                                      En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.

                                      Tabla completa de clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Tabla de clasificación ALE

                                      Clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles

                                      El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.

                                      Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados ​​en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.

                                      Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.

                                      ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.

                                      El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).

                                      Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.

                                      Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.

                                      Medición del desempeño de las tareas en 55 industrias

                                      ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.

                                      Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.

                                      Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.

                                      Los 5 mejores arneses agentes en la clasificación de ALE

                                      Rango

                                      Arnés de agente

                                      Modelo subyacente

                                      Tasa de aprobación

                                      Puntuación media

                                      1

                                      Códice

                                      gpt-5-5

                                      24,0%

                                      42,8%

                                      2

                                      Pero garra

                                      gpt-5-5

                                      23,0%

                                      45,8%

                                      3

                                      Código Claude

                                      claude-fabula-5

                                      22,0%

                                      40,5%

                                      4

                                      garra abierta

                                      gpt-5-5

                                      21,1%

                                      41,0%

                                      5

                                      CLI del cursor

                                      compositor-2-5

                                      20,4%

                                      38,5%

                                      La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.

                                      Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.

                                      En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.

                                      Resolviendo la contaminación de referencia

                                      Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.

                                      ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.

                                      Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.

                                      Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.

                                      Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.

                                      El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados ​​por tener acceso a software empresarial pago.

                                      Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora

                                      Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.

                                      Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.

                                      «Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».

                                      En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:

                                      «Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».

                                      A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.

                                      En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.

                                      En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.

                                      Tabla completa de clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Tabla de clasificación ALE

                                      Clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles

                                      El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.

                                      Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados ​​en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.

                                      Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.

                                      ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.

                                      El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).

                                      Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.

                                      Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.

                                      Medición del desempeño de las tareas en 55 industrias

                                      ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.

                                      Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.

                                      Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.

                                      Los 5 mejores arneses agentes en la clasificación de ALE

                                      Rango

                                      Arnés de agente

                                      Modelo subyacente

                                      Tasa de aprobación

                                      Puntuación media

                                      1

                                      Códice

                                      gpt-5-5

                                      24,0%

                                      42,8%

                                      2

                                      Pero garra

                                      gpt-5-5

                                      23,0%

                                      45,8%

                                      3

                                      Código Claude

                                      claude-fabula-5

                                      22,0%

                                      40,5%

                                      4

                                      garra abierta

                                      gpt-5-5

                                      21,1%

                                      41,0%

                                      5

                                      CLI del cursor

                                      compositor-2-5

                                      20,4%

                                      38,5%

                                      La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.

                                      Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.

                                      En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.

                                      Resolviendo la contaminación de referencia

                                      Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.

                                      ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.

                                      Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.

                                      Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.

                                      Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.

                                      El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados ​​por tener acceso a software empresarial pago.

                                      Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora

                                      Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.

                                      Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.

                                      «Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».

                                      En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:

                                      «Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».

                                      A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.

                                      ¡No te pierdas las noticias destacadas!

                                      Suscríbete y recibe las historias más importantes del día.

                                      Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.

                                      Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.

                                      En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.

                                      En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.

                                      Tabla completa de clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Tabla de clasificación ALE

                                      Clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles

                                      El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.

                                      Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados ​​en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.

                                      Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.

                                      ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.

                                      El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).

                                      Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.

                                      Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.

                                      Medición del desempeño de las tareas en 55 industrias

                                      ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.

                                      Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.

                                      Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.

                                      Los 5 mejores arneses agentes en la clasificación de ALE

                                      Rango

                                      Arnés de agente

                                      Modelo subyacente

                                      Tasa de aprobación

                                      Puntuación media

                                      1

                                      Códice

                                      gpt-5-5

                                      24,0%

                                      42,8%

                                      2

                                      Pero garra

                                      gpt-5-5

                                      23,0%

                                      45,8%

                                      3

                                      Código Claude

                                      claude-fabula-5

                                      22,0%

                                      40,5%

                                      4

                                      garra abierta

                                      gpt-5-5

                                      21,1%

                                      41,0%

                                      5

                                      CLI del cursor

                                      compositor-2-5

                                      20,4%

                                      38,5%

                                      La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.

                                      Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.

                                      En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.

                                      Resolviendo la contaminación de referencia

                                      Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.

                                      ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.

                                      Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.

                                      Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.

                                      Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.

                                      El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados ​​por tener acceso a software empresarial pago.

                                      Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora

                                      Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.

                                      Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.

                                      «Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».

                                      En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:

                                      «Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».

                                      A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.

                                      En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.

                                      En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.

                                      Tabla completa de clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Tabla de clasificación ALE

                                      Clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles

                                      El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.

                                      Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados ​​en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.

                                      Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.

                                      ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.

                                      El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).

                                      Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.

                                      Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.

                                      Medición del desempeño de las tareas en 55 industrias

                                      ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.

                                      Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.

                                      Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.

                                      Los 5 mejores arneses agentes en la clasificación de ALE

                                      Rango

                                      Arnés de agente

                                      Modelo subyacente

                                      Tasa de aprobación

                                      Puntuación media

                                      1

                                      Códice

                                      gpt-5-5

                                      24,0%

                                      42,8%

                                      2

                                      Pero garra

                                      gpt-5-5

                                      23,0%

                                      45,8%

                                      3

                                      Código Claude

                                      claude-fabula-5

                                      22,0%

                                      40,5%

                                      4

                                      garra abierta

                                      gpt-5-5

                                      21,1%

                                      41,0%

                                      5

                                      CLI del cursor

                                      compositor-2-5

                                      20,4%

                                      38,5%

                                      La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.

                                      Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.

                                      En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.

                                      Resolviendo la contaminación de referencia

                                      Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.

                                      ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.

                                      Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.

                                      Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.

                                      Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.

                                      El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados ​​por tener acceso a software empresarial pago.

                                      Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora

                                      Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.

                                      Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.

                                      «Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».

                                      En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:

                                      «Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».

                                      A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.

                                      Tours Colombia Todo el año Tours Colombia Todo el año Tours Colombia Todo el año

                                      Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.

                                      En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.

                                      En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.

                                      Tabla completa de clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Tabla de clasificación ALE

                                      Clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles

                                      El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.

                                      Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados ​​en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.

                                      Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.

                                      ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.

                                      El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).

                                      Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.

                                      Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.

                                      Medición del desempeño de las tareas en 55 industrias

                                      ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.

                                      Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.

                                      Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.

                                      Los 5 mejores arneses agentes en la clasificación de ALE

                                      Rango

                                      Arnés de agente

                                      Modelo subyacente

                                      Tasa de aprobación

                                      Puntuación media

                                      1

                                      Códice

                                      gpt-5-5

                                      24,0%

                                      42,8%

                                      2

                                      Pero garra

                                      gpt-5-5

                                      23,0%

                                      45,8%

                                      3

                                      Código Claude

                                      claude-fabula-5

                                      22,0%

                                      40,5%

                                      4

                                      garra abierta

                                      gpt-5-5

                                      21,1%

                                      41,0%

                                      5

                                      CLI del cursor

                                      compositor-2-5

                                      20,4%

                                      38,5%

                                      La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.

                                      Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.

                                      En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.

                                      Resolviendo la contaminación de referencia

                                      Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.

                                      ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.

                                      Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.

                                      Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.

                                      Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.

                                      El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados ​​por tener acceso a software empresarial pago.

                                      Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora

                                      Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.

                                      Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.

                                      «Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».

                                      En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:

                                      «Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».

                                      A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.

                                      Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado Tour Cayo Arena Día Feriado

                                      Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.

                                      En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.

                                      En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.

                                      Tabla completa de clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Tabla de clasificación ALE

                                      Clasificación ALE. Crédito: Último examen de agentes/UC Berkeley RDI

                                      Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles

                                      El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.

                                      Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados ​​en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.

                                      Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.

                                      ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.

                                      El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).

                                      Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.

                                      Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.

                                      Medición del desempeño de las tareas en 55 industrias

                                      ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.

                                      Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.

                                      Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.

                                      Los 5 mejores arneses agentes en la clasificación de ALE

                                      Rango

                                      Arnés de agente

                                      Modelo subyacente

                                      Tasa de aprobación

                                      Puntuación media

                                      1

                                      Códice

                                      gpt-5-5

                                      24,0%

                                      42,8%

                                      2

                                      Pero garra

                                      gpt-5-5

                                      23,0%

                                      45,8%

                                      3

                                      Código Claude

                                      claude-fabula-5

                                      22,0%

                                      40,5%

                                      4

                                      garra abierta

                                      gpt-5-5

                                      21,1%

                                      41,0%

                                      5

                                      CLI del cursor

                                      compositor-2-5

                                      20,4%

                                      38,5%

                                      La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.

                                      Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.

                                      En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.

                                      Resolviendo la contaminación de referencia

                                      Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.

                                      ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.

                                      Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.

                                      Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.

                                      Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.

                                      El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados ​​por tener acceso a software empresarial pago.

                                      Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora

                                      Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.

                                      Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.

                                      «Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».

                                      En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:

                                      «Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».

                                      A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.

                                      ● Canal oficial · Gratis
                                      ¡Recibe las noticias antes que nadie!
                                      Únete a nuestro canal de WhatsApp y mantente informado al instante, sin spam.
                                      Unirme ahora →
                                      ● Noticias al instante ● Cobertura nacional ● Periodismo real Despertar Matinal
                                      — Redacción Despertar Matinal

                                      — Redacción Despertar Matinal

                                      Programa radial que te conecta con la información desde temprano en la mañana.

                                      Next Post
                                      Senador Antonio Taveras propone eliminar prisión por difamación y derogar ultraje a funcionarios

                                      Senador Antonio Taveras propone eliminar prisión por difamación y derogar ultraje a funcionarios

                                      Deja una respuesta Cancelar la respuesta

                                      Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

                                      Canal de WhatsApp

                                      WhatsApp logo WhatsApp

                                      Canal · Despertar Matinal

                                      Únete a nuestro
                                      Canal

                                      Seguir ahora

                                      El clima

                                      Canal de YouTube

                                      YouTube

                                      Canal · Despertar Matinal

                                      Mira nuestro
                                      Canal

                                      Ver ahora

                                      Escúchanos en Spotify

                                      Spotify

                                      Podcast · Despertar Matinal

                                      Escucha nuestro
                                      Podcast

                                      Escuchar ahora

                                      Noticias Populares

                                      • LTX-2.5 can generate a 10-second AI video from an image in just 6.8 seconds on Nvidia superchips — and it's open weights

                                        LTX-2.5 can generate a 10-second AI video from an image in just 6.8 seconds on Nvidia superchips — and it’s open weights

                                        0 shares
                                        Share 0 Tweet 0
                                      • Pianista surcoreano se recrea tras sufrir un derrame cerebral

                                        0 shares
                                        Share 0 Tweet 0
                                      • Josefina Reynoso: “PN paga 118 mil millones por alquiler hotel;; El pueblo está indefenso; Policías compran uniformes por 4,500”

                                        0 shares
                                        Share 0 Tweet 0
                                      • Celine Dion está de regreso en París, pero su primera canción sigue siendo «un gran secreto»

                                        0 shares
                                        Share 0 Tweet 0
                                      • Abelardo de la Espriella saludó y agradeció a las tropas argentinas por su ayuda tras el terremoto

                                        0 shares
                                        Share 0 Tweet 0

                                      Medio digital independiente con análisis, opinión y periodismo responsable desde República Dominicana.

                                      Secciones populares

                                      • Política
                                      • Economía & Negocios
                                      • Justicia
                                      • Turismo
                                      • Tecnología
                                      • Entretenimiento
                                      • Mundo
                                      • Cine y Series
                                      • Música
                                      • Moda

                                      Contenido

                                      • Titulares del Día
                                      • Mundo
                                      • Nacionales
                                      • Política
                                      • Deportes
                                      • Economía & Negocios
                                      • Ciencia
                                      • Entretenimiento
                                      • Podcast
                                      • Opinión
                                      • Despertar Matinal TV
                                      • Editoriales

                                      Corporativo

                                      • Sobre nosotros
                                      • Publicidad
                                      • Sala de prensa
                                      • Contacto
                                      • Política de Privacidad
                                      • Eliminación de Datos

                                      Boletines

                                      Suscríbete a nuestro boletín
                                      Recibe las noticias más importantes cada mañana.

                                      • Nosotros
                                      • Publicidad
                                      • Trabaja con nosotros
                                      • Contactos

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      No Result
                                      View All Result
                                      • Home

                                      © 2025 Despertar Matinal. Aviso Legal - comunícate con nuestra redacción y obtén más información sobre Despertar Matinal..

                                      Welcome Back!

                                      Login to your account below

                                      Forgotten Password?

                                      Retrieve your password

                                      Please enter your username or email address to reset your password.

                                      Log In

                                      Desarrollado por
                                      ►
                                      Las cookies necesarias habilitan funciones esenciales del sitio como inicios de sesión seguros y ajustes de preferencias de consentimiento. No almacenan datos personales.
                                      Ninguno
                                      ►
                                      Las cookies funcionales soportan funciones como compartir contenido en redes sociales, recopilar comentarios y habilitar herramientas de terceros.
                                      Ninguno
                                      ►
                                      Las cookies analíticas rastrean las interacciones de los visitantes, proporcionando información sobre métricas como el número de visitantes, la tasa de rebote y las fuentes de tráfico.
                                      Ninguno
                                      ►
                                      Las cookies de publicidad ofrecen anuncios personalizados basados en tus visitas anteriores y analizan la efectividad de las campañas publicitarias.
                                      Ninguno
                                      ►
                                      Las cookies no clasificadas son aquellas que estamos en proceso de clasificar, junto con los proveedores de cookies individuales.
                                      Ninguno
                                      Desarrollado por