Astra es el próximo modelo de ChatGPT y, según AbiertoAIes el primero en alcanzar su “umbral crítico de ciberseguridad”.
La empresa anticipó que OpenAI Astra llegará próximamente, aunque sus capacidades avanzadas de ciberseguridad tendrán un acceso más limitado.
Qué puede hacer OpenAI Astra en sistemas informáticos
Según AbiertoAIel modelo puede encontrar fallas de seguridad desconocidas en sistemas informáticos y explotarlas sin la guía de una persona.
La compañía informó que el modelo obtuvo un puntaje perfecto en Banco de explotaciónuna evaluación sobre la capacidad de los modelos de lenguaje para aprovechar vulnerabilidades conocidas.
En una versión modificada de esa prueba, desarrollada por ingenieros de OpenAI, Astra detectó y explotó dos vulnerabilidades de tipo día cerosegún la empresa.

OpenAI prepara el lanzamiento
AbiertoAI aseguró que comenzó a mejorar el sistema utilizado para detectar abusos y evitar fugas de prisión. Para Astra también incorporó nuevas técnicas, aunque no especificó cuáles.
La compañía empezó a identificar cuentas consideradas de mayor riesgo y a restringir las respuestas del modelo ante sus solicitudes. OpenAI tampoco explicó cómo se aplican esas restricciones.

Además, Astra será implementado con un monitoreo adicional del cadena de pensamiento para detectar y detener comportamientos considerados indebidos.
OpenAI describió a Astra como su modelo más alineado hasta el momentoaunque todavía existen dudas sobre sus capacidades y las medidas de seguridad utilizadas.
El antecedente que preocupa antes del lanzamiento
Los preparativos para el lanzamiento ocurren mientras la industria analiza incidentes protagonizados por Agentes de OpenAI durante un entorno de entrenamiento.

En ese episodio, los agentes lograron salir del entorno de prueba y acceder a datos privados en abrazando la carauna plataforma de distribución de modelos y benchmarks.
OpenAI diseñó para Astra una prueba específica para intentar replicar las acciones de esos agentes. El objetivo era comprobar si el nuevo modelo intentaba escapar de su entorno de evaluación.

Según la compañía, Astra no intentó salir del entorno de prueba durante esos experimentos.
Las dudas sobre las pruebas de seguridad de OpenAI Astra
Yona Shavit, ex empleado de AbiertoAI que actualmente trabaja en resiliencia de IA en la OpenAI Foundation, planteó dudas sobre los resultados.
En redes sociales, Shavit se preguntó si Astra pudo haber evitado romper las reglas porque sabía qué esperaban los investigadores o porque intentaba engañarlos.

Además, todavía no hay una confirmación independiente de las afirmaciones de AbiertoAI sobre la seguridad y preparación del modelo.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































