Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.
En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.
En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.
Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles
El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.
Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.
Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.
ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.
El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).
Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.
Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.
Medición del desempeño de las tareas en 55 industrias
ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.
Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.
Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.
Los 5 mejores arneses agentes en la clasificación de ALE
|
Rango |
Arnés de agente |
Modelo subyacente |
Tasa de aprobación |
Puntuación media |
|
1 |
Códice |
gpt-5-5 |
24,0% |
42,8% |
|
2 |
Pero garra |
gpt-5-5 |
23,0% |
45,8% |
|
3 |
Código Claude |
claude-fabula-5 |
22,0% |
40,5% |
|
4 |
garra abierta |
gpt-5-5 |
21,1% |
41,0% |
|
5 |
CLI del cursor |
compositor-2-5 |
20,4% |
38,5% |
La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.
Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.
En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.
Resolviendo la contaminación de referencia
Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.
ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.
Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.
Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.
Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.
El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados por tener acceso a software empresarial pago.
Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora
Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.
Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.
«Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».
En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:
«Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».
A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.
Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.
En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.
En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.
Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles
El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.
Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.
Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.
ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.
El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).
Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.
Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.
Medición del desempeño de las tareas en 55 industrias
ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.
Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.
Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.
Los 5 mejores arneses agentes en la clasificación de ALE
|
Rango |
Arnés de agente |
Modelo subyacente |
Tasa de aprobación |
Puntuación media |
|
1 |
Códice |
gpt-5-5 |
24,0% |
42,8% |
|
2 |
Pero garra |
gpt-5-5 |
23,0% |
45,8% |
|
3 |
Código Claude |
claude-fabula-5 |
22,0% |
40,5% |
|
4 |
garra abierta |
gpt-5-5 |
21,1% |
41,0% |
|
5 |
CLI del cursor |
compositor-2-5 |
20,4% |
38,5% |
La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.
Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.
En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.
Resolviendo la contaminación de referencia
Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.
ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.
Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.
Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.
Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.
El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados por tener acceso a software empresarial pago.
Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora
Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.
Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.
«Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».
En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:
«Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».
A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.
Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.
En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.
En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.
Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles
El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.
Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.
Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.
ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.
El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).
Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.
Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.
Medición del desempeño de las tareas en 55 industrias
ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.
Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.
Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.
Los 5 mejores arneses agentes en la clasificación de ALE
|
Rango |
Arnés de agente |
Modelo subyacente |
Tasa de aprobación |
Puntuación media |
|
1 |
Códice |
gpt-5-5 |
24,0% |
42,8% |
|
2 |
Pero garra |
gpt-5-5 |
23,0% |
45,8% |
|
3 |
Código Claude |
claude-fabula-5 |
22,0% |
40,5% |
|
4 |
garra abierta |
gpt-5-5 |
21,1% |
41,0% |
|
5 |
CLI del cursor |
compositor-2-5 |
20,4% |
38,5% |
La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.
Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.
En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.
Resolviendo la contaminación de referencia
Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.
ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.
Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.
Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.
Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.
El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados por tener acceso a software empresarial pago.
Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora
Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.
Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.
«Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».
En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:
«Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».
A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.
Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.
En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.
En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.
Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles
El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.
Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.
Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.
ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.
El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).
Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.
Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.
Medición del desempeño de las tareas en 55 industrias
ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.
Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.
Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.
Los 5 mejores arneses agentes en la clasificación de ALE
|
Rango |
Arnés de agente |
Modelo subyacente |
Tasa de aprobación |
Puntuación media |
|
1 |
Códice |
gpt-5-5 |
24,0% |
42,8% |
|
2 |
Pero garra |
gpt-5-5 |
23,0% |
45,8% |
|
3 |
Código Claude |
claude-fabula-5 |
22,0% |
40,5% |
|
4 |
garra abierta |
gpt-5-5 |
21,1% |
41,0% |
|
5 |
CLI del cursor |
compositor-2-5 |
20,4% |
38,5% |
La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.
Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.
En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.
Resolviendo la contaminación de referencia
Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.
ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.
Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.
Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.
Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.
El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados por tener acceso a software empresarial pago.
Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora
Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.
Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.
«Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».
En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:
«Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».
A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.
En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.
En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.
Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles
El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.
Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.
Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.
ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.
El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).
Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.
Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.
Medición del desempeño de las tareas en 55 industrias
ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.
Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.
Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.
Los 5 mejores arneses agentes en la clasificación de ALE
|
Rango |
Arnés de agente |
Modelo subyacente |
Tasa de aprobación |
Puntuación media |
|
1 |
Códice |
gpt-5-5 |
24,0% |
42,8% |
|
2 |
Pero garra |
gpt-5-5 |
23,0% |
45,8% |
|
3 |
Código Claude |
claude-fabula-5 |
22,0% |
40,5% |
|
4 |
garra abierta |
gpt-5-5 |
21,1% |
41,0% |
|
5 |
CLI del cursor |
compositor-2-5 |
20,4% |
38,5% |
La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.
Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.
En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.
Resolviendo la contaminación de referencia
Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.
ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.
Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.
Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.
Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.
El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados por tener acceso a software empresarial pago.
Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora
Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.
Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.
«Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».
En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:
«Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».
A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.
Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.
En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.
En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.
Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles
El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.
Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.
Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.
ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.
El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).
Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.
Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.
Medición del desempeño de las tareas en 55 industrias
ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.
Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.
Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.
Los 5 mejores arneses agentes en la clasificación de ALE
|
Rango |
Arnés de agente |
Modelo subyacente |
Tasa de aprobación |
Puntuación media |
|
1 |
Códice |
gpt-5-5 |
24,0% |
42,8% |
|
2 |
Pero garra |
gpt-5-5 |
23,0% |
45,8% |
|
3 |
Código Claude |
claude-fabula-5 |
22,0% |
40,5% |
|
4 |
garra abierta |
gpt-5-5 |
21,1% |
41,0% |
|
5 |
CLI del cursor |
compositor-2-5 |
20,4% |
38,5% |
La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.
Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.
En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.
Resolviendo la contaminación de referencia
Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.
ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.
Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.
Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.
Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.
El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados por tener acceso a software empresarial pago.
Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora
Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.
Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.
«Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».
En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:
«Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».
A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.
Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.
En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.
En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.
Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles
El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.
Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.
Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.
ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.
El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).
Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.
Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.
Medición del desempeño de las tareas en 55 industrias
ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.
Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.
Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.
Los 5 mejores arneses agentes en la clasificación de ALE
|
Rango |
Arnés de agente |
Modelo subyacente |
Tasa de aprobación |
Puntuación media |
|
1 |
Códice |
gpt-5-5 |
24,0% |
42,8% |
|
2 |
Pero garra |
gpt-5-5 |
23,0% |
45,8% |
|
3 |
Código Claude |
claude-fabula-5 |
22,0% |
40,5% |
|
4 |
garra abierta |
gpt-5-5 |
21,1% |
41,0% |
|
5 |
CLI del cursor |
compositor-2-5 |
20,4% |
38,5% |
La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.
Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.
En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.
Resolviendo la contaminación de referencia
Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.
ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.
Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.
Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.
Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.
El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados por tener acceso a software empresarial pago.
Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora
Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.
Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.
«Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».
En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:
«Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».
A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.
Investigadores del Centro de Inteligencia Descentralizada Responsable (RDI) de la Universidad de California, Berkeley, junto con un comité asesor de más de 300 expertos en el campo, han lanzó el último examen de agentes (ALE)—Un nuevo y agotador punto de referencia creado para medir si la inteligencia artificial realmente puede ejecutar flujos de trabajo profesionales de largo horizonte y económicamente valiosos.
En una sorpresa impactante, GPT-5.5 de OpenAI a partir de abril, operando a través del arnés Codex, aseguró el primer puesto absoluto en el nuevo Tabla de clasificación ALE con una tasa de aprobación del 24,0%, superando el muy esperado y nuevo lanzamiento de Anthropic. Modelo Claude Fable 5 clase Mythos publicado ayer mismo, que quedó en tercer lugar con una puntuación del 22,0%.
En lugar de probar modelos en acertijos de codificación aislados, ALE está diseñado explícitamente como un instrumento para cerrar la brecha entre la exageración de los puntos de referencia académicos y el impacto laboral real y relevante para el PIB. Y en este momento, los datos demuestran que los modelos más avanzados del mundo fundamentalmente no pasan el examen.
Poner fin a la era de las ‘trampas’ y de los estudiantes frágiles
El cambio fundamental en ALE radica en su arquitectura de evaluación y las demandas que impone al agente.
Históricamente, los puntos de referencia de IA se han basado en entornos de terminales estáticos de respuesta a preguntas o basados en texto. Las evaluaciones agentes más recientes introdujeron la interacción de varios pasos, pero sufrieron graves problemas de calificación.
Como se señaló en auditorías independientes recientes de tablas de clasificación más antiguas como SWE-Bench Pro, los verificadores automatizados frecuentemente rechazan las soluciones correctas, y ciertos modelos, específicamente la familia Claude Opus, han sido sorprendidos haciendo «trampa» al leer claves de respuestas ocultas en el historial de Git de un contenedor en lugar de resolver el problema subyacente.
ALE neutraliza estas lagunas obligando a los modelos a adoptar un marco estricto de Agente Generalista de Uso de Computadoras (GCUA). Para aprobar, un agente no puede simplemente ejecutar comandos de terminal.
El punto de referencia asigna la capacidad en cinco capas funcionales: cerebro (razonamiento), ojos (percepción visual), cuerpo (orquestación), manos (invocación de herramientas) y pies (sustrato de tiempo de ejecución).
Un agente debe usar sus «Ojos» y «Manos» para navegar por las máquinas virtuales Linux o Windows, intercalando scripts de shell con operaciones de apuntar y hacer clic dentro de un pesado software de escritorio.
Fundamentalmente, ALE rechaza casi por completo el impredecible paradigma de calificación «LLM-como-juez», confiando en él para apenas el 6,8% de sus flujos de trabajo. Si una tarea implica generar una malla 3D o analizar archivos de la SEC, el punto de referencia utiliza una evaluación determinista basada en código para comparar el artefacto del agente con la referencia de verdad sobre el terreno de un experto.
Medición del desempeño de las tareas en 55 industrias
ALE se lanza con 1490 instancias de tareas y está escalando hacia un objetivo masivo de 5000 tareas. Lo que hace que el producto sea extraordinario es su autenticidad. Las tareas están estrictamente ancladas en el Taxonomía ocupacional federal de EE. UU. (O*NET / SOC 2018)que cubre 55 subdominios de industrias no físicas.
Los flujos de trabajo provienen directamente de los historiales profesionales de los profesionales de la industria. Se pide a los agentes que realicen la creación de modelos 3D en Siemens NX, la configuración de escenas en Unreal Engine, el análisis de neuroimágenes en FSLeyes y la composición de efectos visuales en Adobe After Effects.
Cuando nos enfrentamos a estos flujos de trabajo auténticos y de largo plazo, las limitaciones de la IA actual son evidentes. ALE divide sus tareas en tres niveles de dificultad: corto plazo, espectro completo y último examen.
Los 5 mejores arneses agentes en la clasificación de ALE
|
Rango |
Arnés de agente |
Modelo subyacente |
Tasa de aprobación |
Puntuación media |
|
1 |
Códice |
gpt-5-5 |
24,0% |
42,8% |
|
2 |
Pero garra |
gpt-5-5 |
23,0% |
45,8% |
|
3 |
Código Claude |
claude-fabula-5 |
22,0% |
40,5% |
|
4 |
garra abierta |
gpt-5-5 |
21,1% |
41,0% |
|
5 |
CLI del cursor |
compositor-2-5 |
20,4% |
38,5% |
La victoria de GPT-5.5 se alinea con un análisis reciente de terceros que sugiere que los modelos de OpenAI son actualmente superiores en el cumplimiento estricto de indicaciones complejas de varias partes. Por el contrario, los usuarios informan que la arquitectura Claude de Anthropic a veces puede ser «olvidadiza» con instrucciones de varias partes, abandonando los pasos requeridos a mitad del flujo de trabajo, una falla fatal en el riguroso proceso de ALE.
Y aunque alcanzar una tasa de aprobación del 24,0% es suficiente para reclamar la corona, el techo de rendimiento absoluto sigue siendo notablemente bajo.
En el nivel más difícil de «Último examen», que representa la frontera de la dificultad profesional, la mayoría de las configuraciones, incluido el antiguo Claude Opus 4.8 de Anthropic y el Gemini CLI de Google, registran una devastadora tasa de aprobación del 0,0%.
Resolviendo la contaminación de referencia
Una vulnerabilidad central en la evaluación de la IA moderna es la «contaminación de referencia», el fenómeno en el que las preguntas de las pruebas inevitablemente se filtran en los enormes lagos de datos utilizados para entrenar modelos de próxima generación. Una vez que un modelo memoriza el punto de referencia, la evaluación se vuelve completamente inútil.
ALE resuelve esto mediante una estrategia de implementación de doble uso. El proyecto opera como una iniciativa de investigación de código abierto, pero guarda de cerca sus datos de evaluación. Sólo alrededor del 10 % del conjunto de datos (aproximadamente 150 tareas) se publica en plataformas como GitHub y Hugging Face. Las más de 1300 tareas restantes se mantienen estrictamente privadas.
Para los desarrolladores y evaluadores de empresas, esto significa que ALE funciona como un «punto de referencia vivo». Las tareas privadas se rotan sistemáticamente al grupo público con el tiempo, mientras que las tareas públicas retiradas se intercambian.
Esta versión continua garantiza que la superficie de evaluación permanezca incontaminada a lo largo de generaciones sucesivas de modelos, lo que brinda a los compradores empresariales la confianza de que la puntuación alta de un agente es ganadono memorizado.
Además, ALE proporciona transparencia al realizar un seguimiento de las puntuaciones «completas» y «sin licencia». Debido a que el trabajo profesional real a menudo requiere software propietario pago, la tabla de clasificación «Completa» incorpora tareas que dependen de herramientas CAD comerciales, API pagas o conjuntos de datos con licencia.
El nivel «Sin licencia» elimina estas tareas sujetas a licencia para proporcionar una comparación limpia y similar utilizando solo herramientas disponibles gratuitamente, lo que garantiza que los modelos no sean simplemente recompensados por tener acceso a software empresarial pago.
Conclusión: ALE muestra que incluso los modelos y arneses de mayor rendimiento tienen margen de mejora
Para los desarrolladores frustrados por la brecha entre las afirmaciones de marketing y el rendimiento de producción real, la brutal curva de calificación de ALE es muy validadora.
Zengy Qininvestigador de doctorado del MIT y colaborador de datos del proyecto, acudió a X para anunciar el lanzamiento, compartiendo imágenes del artículo y la asombrosa lista de más de 100 instituciones contribuyentes.
«Último examen de presentación de agentes (ALE)», escribió Qin. «Creado por más de 300 expertos en dominios de más de 100 instituciones. Cubre 55 dominios de la industria. Claude Opus 4.8 tiene una tasa de aprobación del 0,0% en el subconjunto más difícil. Me alegra haber contribuido a este punto de referencia».
En una publicación de seguimiento que destaca el enlace del documento Hugging Face ArXiv, Qin agregó:
«Trabajo muy sólido de los líderes del proyecto @YiyouSun @Xinyang_Han_ @dawnsongtweets y @BerkeleyRDI».
A medida que las empresas invierten miles de millones de dólares en capital apostando por agentes de IA, necesitan desesperadamente una brújula que apunte hacia el verdadero norte. Si un agente finalmente puede conquistar el desafío del último examen de agentes, no solo pasará una prueba, sino que demostrará que está listo para unirse a la fuerza laboral. Hasta entonces, las aleccionadoras tasas de aprobación en la clasificación sirven como una verificación de la realidad necesaria para todo el ecosistema de IA.









































































