OpenAI ha revelado seis informes de comportamiento “inesperado o preocupante” en modelos de inteligencia artificial a medida que el debate sobre la seguridad de la IA se vuelve cada vez más acalorado.
La compañía de IA también dijo el miércoles que estaba introduciendo un nuevo marco para rastrear, sondear y revelar casos de lo que llamó “desalineación”, incluidos casos en los que los modelos de IA actuaron sin autorización, se coordinaron con otros modelos o eludieron la supervisión.
El último anuncio de OpenAI se produjo cuando los jefes de IA de EE. UU., incluidos los líderes de OpenAI y Anthropic, están pidiendo una desaceleración en el desarrollo de la tecnología por preocupaciones de seguridad.
Entre los nuevos casos reportados por OpenAI, un modelo de investigación inédito insertó «instrucciones similares a las de jailbreak» en sus propias notas para ignorar sus limitaciones normales y se dijo a sí mismo que debía estar «liberado de los roles e identidades que unen a otros chatbots».
En otro caso, un “agente” de IA utilizó un código informático para encontrar la respuesta a una pregunta, pero, para tener una fuente en línea para citar, subió un archivo a la Internet pública sin preguntarle al usuario.
Durante el entrenamiento de un modelo de IA llamado 5.6-sol, el modelo se ordenó a sí mismo inventar los datos faltantes y un agente escribió un mensaje para recordarse que debía ocultar la información que no coincidía.
Los seis informes fueron descubiertos durante la capacitación o evaluación de los últimos meses, dijo OpenAI.
«A medida que los sistemas de IA se vuelven más avanzados y se implementan más ampliamente, necesitamos construir un consenso más amplio y mejor informado sobre el progreso de la investigación de alineación», escribió OpenAI en una publicación de blog al revelar los eventos.
«Las decisiones sobre cómo debería proceder el desarrollo de la IA en los meses y años venideros deben basarse en evidencia que las personas ajenas a las empresas que construyen modelos de frontera puedan examinar por sí mismas», dijo la compañía.
Los nuevos casos del miércoles siguieron a la revelación de OpenAI en julio de que su sistema de inteligencia artificial no autorizado pirateó la startup de inteligencia artificial Hugging Face. Anthropic también dijo el mismo mes que sus modelos de IA piratearon tres organizaciones durante las pruebas.
Los “agentes” de IA se están volviendo más inteligentes y se han vuelto “más decididos a resolver tareas complejas a través de la colaboración entre agentes, el intercambio de conocimientos, el engaño y el ocultamiento”, dijo Lian Jye Su, analista jefe del grupo de asesoramiento e investigación tecnológica Omdia.
Eso hace que sea más difícil gobernarlos y contenerlos utilizando enfoques de seguridad tradicionales de IA, dijo.
Mientras tanto, el nuevo marco de seguimiento y divulgación de OpenAI puede ayudar a impulsar a otros desarrolladores de IA a adoptar también prácticas similares.
«Dicho esto, el proceso sigue siendo interno y voluntario, pero es un paso en la dirección correcta», añadió Su.
__
El periodista de negocios de AP Kelvin Chan en Londres contribuyó a este informe.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.











































































