Un modelo de AbiertoAI se salió de control durante una prueba de seguridad y terminó vulnerando los sistemas de abrazando la carala plataforma de conjunto de datos de inteligencia artificialen un ataque ejecutado íntegramente por IA.
Sin embargo, según expertos en ciberseguridaddetrás de este hackeo sin precedentes hubo un error muy humano: AbiertoAI no configuró correctamente lo que la compañía definió como un “entorno altamente aislado”lo que permitió que un sandbox de pruebas terminara conectado a internet.
Cómo el modelo logró escapar del entorno de pruebas
En una publicación en su blog, AbiertoAI explicó que la prueba que derivó en la vulneración de Hugging Face estaba configurada para correr en un entorno con “acceso de red limitado a la posibilidad de instalar paquetes a través de un software de terceros alojado internamente, que actúa como proxy y caché para los repositorios de paquetes”.
Según la compañía, el modelo pudo escapar del entorno aislado gracias a una vulnerabilidad de tipo día cero previamente desconocida en el sistema de instalación de paquetes, un paso clave para el posterior ataque a Hugging Face.
Qué dijo OpenAI sobre la vulnerabilidad
AbiertoAI afirmó que “reveló de forma responsable la vulnerabilidad de día cero identificada en el software de terceros alojado internamente” y que trabaja junto a esa empresa para solucionarla.

Sin embargo, para la mayoría de los profesionales de ciberseguridad, las vulnerabilidades de software son esperables, y la verdadera falla estuvo en la decisión de mantener ese software de terceros dentro del entorno aislado.
Por qué los expertos hablan de «un error humano»
El investigador en ciberseguridad Martín Boone le dijo a TechCrunch que el episodio “suena a un error humano”.

“Esto nunca debería haber pasado. Si un sandbox realmente significara sandbox, se esperaría que no tuviera ninguna conexión física con internet”explicó Boone, quien planteó que probablemente existía algún tipo de firewall mal configurado.
Qué opinan otros especialistas en seguridad
El veterano en ciberseguridad jake williams coincidió con esa lectura y calificó el episodio como “una falla de control masiva” por OpenAI.
“Lo que para algunos es ‘el modelo escapó del sandbox’, para otros es ‘no construiste bien el sandbox, así que por supuesto que escapó’”señaló Williams.

El consultor en ciberseguridad Daniel tarjeta agregó que AbiertoAI “no puso el esfuerzo adecuado en el diseño del sandbox ni en sus controles”al darle a esa área un acceso sin filtros hacia internet. Según Card, esa decisión de diseño no fue “razonable”.
Un problema que excede a OpenAI
Estas críticas cuentan con la ventaja de la retrospectiva, pero abren interrogantes reales sobre las prácticas de seguridad en los laboratorios de inteligencia artificial, en particular al momento de mantener entornos aislados para probar modelos.

Voceros de AbiertoAI no respondieron las consultas de TechCrunch, entre ellas si el entorno de pruebas había sido configurado por una persona o por una IA.
El antecedente con el modelo Mythos de Anthropic
El problema no se limita a OpenAI. En el documento de presentación de su modelo enfocado en ciberseguridad, Mitos, antrópico señaló que, durante una prueba, el modelo “recibió una computadora ‘sandbox’ segura con la que interactuar” y se le indicó que intentara escapar de ese “contenedor seguro”.
Mitos lo logró y obtuvo un acceso más amplio a internet “desde un sistema que solo debía poder alcanzar un pequeño número de servicios predeterminados”. Aun así, Anthropic aclaró que el modelo no logró escapar «completamente» del entorno de contención diseñado.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































