La deriva de datos ocurre cuando las propiedades estadísticas de los datos de entrada de un modelo de aprendizaje automático (ML) cambian con el tiempo, lo que eventualmente hace que sus predicciones sean menos precisas. Profesionales de la ciberseguridad que dependen del aprendizaje automático para tareas como la detección de malware y el análisis de amenazas de red descubren que la deriva de datos no detectada puede crear vulnerabilidades. Un modelo entrenado en viejos patrones de ataque puede no detectar las sofisticadas amenazas actuales. Reconocer los primeros signos de desviación de datos es el primer paso para mantener sistemas de seguridad confiables y eficientes.
Por qué la deriva de datos compromete los modelos de seguridad
Los modelos de ML se entrenan a partir de una instantánea de datos históricos. Cuando los datos en vivo ya no se parecen a esta instantánea, el rendimiento del modelo disminuye, creando una riesgo crítico de ciberseguridad. Un modelo de detección de amenazas puede generar más falsos negativos al pasar por alto infracciones reales o crear más falsos positivos, lo que genera fatiga en las alertas para los equipos de seguridad.
Los adversarios explotan activamente esta debilidad. En 2024, Los atacantes utilizaron técnicas de suplantación de eco. para eludir los servicios de protección de correo electrónico. Al explotar configuraciones erróneas en el sistema, enviaron millones de correos electrónicos falsos que evadieron los clasificadores de ML del proveedor. Este incidente demuestra cómo los actores de amenazas pueden manipular los datos de entrada para explotar puntos ciegos. Cuando un modelo de seguridad no logra adaptarse a las tácticas cambiantes, se convierte en un problema.
5 indicadores de deriva de datos
Los profesionales de la seguridad pueden reconocer la presencia de deriva (o su potencial) de varias maneras.
1. Una caída repentina en el rendimiento del modelo.
La exactitud, la precisión y el recuerdo son a menudo las primeras víctimas. Una disminución constante en estas métricas clave es una señal de alerta de que el modelo ya no está sincronizado con el panorama de amenazas actual.
Considere el éxito de Klarna: su asistente de inteligencia artificial manejó 2,3 millones de conversaciones de servicio al cliente en su primer mes y realizó un trabajo equivalente a 700 agentes. Esta eficiencia impulsó un 25% de disminución en consultas repetidas y tiempos de resolución reducidos a menos de dos minutos.
Ahora imagine si esos parámetros se invirtieran repentinamente debido a la deriva. En un contexto de seguridad, una caída similar en el rendimiento no sólo significa clientes descontentos, sino que también significa intrusiones exitosas y una posible filtración de datos.
2. Cambios en las distribuciones estadísticas
Equipos de seguridad Debe monitorear las propiedades estadísticas básicas de las características de entrada, como la media, la mediana y la desviación estándar. Un cambio significativo en estas métricas de los datos de entrenamiento podría indicar que los datos subyacentes han cambiado.
El seguimiento de dichos cambios permite a los equipos detectar la deriva antes de que provoque una infracción. Por ejemplo, un modelo de detección de phishing podría entrenarse en correos electrónicos con un tamaño promedio de archivos adjuntos de 2 MB. Si el tamaño promedio de los archivos adjuntos aumenta repentinamente a 10 MB debido a un nuevo método de entrega de malware, es posible que el modelo no clasifique estos correos electrónicos correctamente.
3. Cambios en el comportamiento de predicción.
Incluso si la precisión general parece estable, las distribuciones de las predicciones pueden cambiar, un fenómeno a menudo denominado deriva de las predicciones.
Por ejemplo, si un modelo de detección de fraude históricamente marcó el 1% de las transacciones como sospechosas pero de repente comienza a marcar el 5% o el 0,1%, algo ha cambiado o la naturaleza de los datos de entrada ha cambiado. Podría indicar un nuevo tipo de ataque que confunde al modelo o un cambio en el comportamiento legítimo del usuario que el modelo no fue capacitado para identificar.
4. Un aumento en la incertidumbre del modelo.
Para los modelos que proporcionan una puntuación de confianza o probabilidad con sus predicciones, una disminución general de la confianza puede ser una señal sutil de deriva.
Estudios recientes destacan la valor de cuantificación de la incertidumbre en la detección de ataques adversarios. Si el modelo se vuelve menos seguro acerca de sus pronósticos en todos los ámbitos, es probable que se enfrente a datos con los que no fue entrenado. En un entorno de ciberseguridad, esta incertidumbre es una señal temprana de una posible falla del modelo, lo que sugiere que el modelo está operando en un terreno desconocido y que sus decisiones podrían ya no ser confiables.
5. Cambios en las relaciones entre características.
La correlación entre diferentes características de entrada también puede cambiar con el tiempo. En un modelo de intrusión de red, el volumen de tráfico y el tamaño de los paquetes pueden estar muy vinculados durante las operaciones normales. Si esa correlación desaparece, puede indicar un cambio en el comportamiento de la red que el modelo tal vez no comprenda. Un desacoplamiento repentino de características podría indicar una nueva táctica de construcción de túneles o un intento sigiloso de exfiltración.
Enfoques para detectar y mitigar la desviación de datos
Los métodos de detección comunes incluyen el Kolmogorov-Smirnov (KS) y el índice de estabilidad poblacional (PSI). Estos comparan el Distribuciones de datos en vivo y de entrenamiento. para identificar desviaciones. La prueba KS determina si dos conjuntos de datos difieren significativamente, mientras que el PSI mide cuánto ha cambiado la distribución de una variable con el tiempo.
El método de mitigación elegido a menudo depende de cómo se manifiesta la deriva, ya que los cambios en la distribución pueden ocurrir repentinamente. Por ejemplo, el comportamiento de compra de los clientes puede cambiar de la noche a la mañana con el lanzamiento de un nuevo producto o una promoción. En otros casos, la deriva puede ocurrir gradualmente durante un período más prolongado. Dicho esto, los equipos de seguridad deben aprender a ajustar su cadencia de monitoreo para capturar tanto los picos rápidos como los lentos. La mitigación implicará volver a entrenar el modelo con datos más recientes para recuperar su eficacia.
Gestione proactivamente la deriva para una mayor seguridad
La deriva de datos es una realidad inevitable y los equipos de ciberseguridad pueden mantener una postura de seguridad sólida al tratar la detección como un proceso continuo y automatizado. El monitoreo proactivo y el reentrenamiento de modelos son prácticas fundamentales para garantizar que los sistemas de aprendizaje automático sigan siendo aliados confiables contra las amenazas en desarrollo.
Zac Amos es el editor de funciones en Rehackear.
¡Bienvenido a la comunidad VentureBeat!
Nuestro programa de publicaciones invitadas es donde los expertos técnicos comparten conocimientos y brindan análisis profundos neutrales y no adquiridos sobre inteligencia artificial, infraestructura de datos, ciberseguridad y otras tecnologías de vanguardia que dan forma al futuro de las empresas.
Leer más de nuestro programa de publicaciones de invitados y consulte nuestro pautas ¡Si estás interesado en contribuir con un artículo propio!
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































