Cuatro conferencias magistrales separadas del RSAC 2026 llegaron a la misma conclusión sin coordinación. Vasu Jakkal, de Microsoft, dijo a los asistentes que la confianza cero debe extenderse a la IA. Jeetu Patel de Cisco pidió un cambio del control de acceso al control de acción, diciendo en una entrevista exclusiva con VentureBeat que los agentes se comportan «más como adolescentes, sumamente inteligentes, pero sin miedo a las consecuencias». George Kurtz, de CrowdStrike, identificó la gobernanza de la IA como la mayor brecha en la tecnología empresarial. John Morgan, de Splunk, pidió un modelo de gobernanza y confianza agente. Cuatro empresas. Cuatro etapas. un problema.
Matt Caulfield, vicepresidente de Producto de Identidad y Duo de Cisco, lo expresó sin rodeos en una entrevista exclusiva de VentureBeat en RSAC. «Si bien el concepto de confianza cero es bueno, debemos ir un paso más allá», afirmó Caulfield. «No se trata sólo de autenticarse una vez y luego dejar que el agente se vuelva loco. Se trata de verificar y examinar continuamente cada acción que el agente intenta realizar, porque en cualquier momento, ese agente puede volverse rebelde».
El setenta y nueve por ciento de las organizaciones ya utilizan agentes de IA, según Encuesta de agentes de IA 2025 de PwC. Solo el 14,4% informó aprobación de seguridad total para toda su flota de agentes, según el Informe Gravitee sobre el estado de la seguridad de los agentes de IA 2026 de 919 organizaciones en febrero de 2026. A encuesta CSA presentado en RSAC encontró que solo el 26% tiene políticas de gobernanza de IA. Marco de fideicomiso agente de CSA describe la brecha resultante entre la velocidad de implementación y la preparación de la seguridad como una emergencia de gobernanza.
Los líderes de ciberseguridad y ejecutivos de la industria de RSAC coincidieron en el problema. Luego, dos empresas enviaron arquitecturas que responden a la pregunta de manera diferente. La brecha entre sus diseños revela dónde reside el riesgo real.
El problema del agente monolítico que están heredando los equipos de seguridad
El patrón de agente empresarial predeterminado es un contenedor monolítico. El modelo razona, llama a herramientas, ejecuta el código generado y mantiene las credenciales en un solo proceso. Cada componente confía en todos los demás componentes. Los tokens de OAuth, las claves de API y las credenciales de git se encuentran en el mismo entorno donde el agente ejecuta el código que escribió hace unos segundos.
Una inyección rápida le da todo al atacante. Los tokens son exfiltrables. Las sesiones se pueden generar. El radio de la explosión no es el agente. Es el contenedor completo y cada servicio conectado.
El Encuesta CSA y Aembit de 228 profesionales de TI y seguridad cuantifica cuán común sigue siendo esto: el 43 % usa cuentas de servicios compartidos para los agentes, el 52 % confía en identidades de carga de trabajo en lugar de credenciales específicas de los agentes, y el 68 % no puede distinguir la actividad de los agentes de la actividad humana en sus registros. Ninguna función reclamó la propiedad del acceso de los agentes de IA. La seguridad dijo que era responsabilidad del desarrollador. Los desarrolladores dijeron que era una responsabilidad de seguridad. Nadie era dueño.
Elia Zaitsev, CTO de CrowdStrike, en una entrevista exclusiva con VentureBeat, dijo que el patrón debería resultarle familiar. «Mucho de cómo se ven los agentes de seguridad sería muy similar a cómo se ve proteger a los usuarios altamente privilegiados. Tienen identidades, tienen acceso a los sistemas subyacentes, razonan, toman medidas», dijo Zaitsev. «Rara vez habrá una solución única que sea la solución milagrosa. Es una estrategia de defensa en profundidad».
El director ejecutivo de CrowdStrike, George Kurtz, destacó ClawHavoc (una campaña de cadena de suministro dirigida al marco agente OpenClaw) en RSAC durante su fundamental. Seguridad Koi nombró la campaña el 1 de febrero de 2026. Antiy CERT confirmó 1.184 habilidades maliciosas vinculadas a 12 cuentas de editores, según múltiple independiente Análisis de la campaña. La investigación de Snyk sobre las habilidades tóxicas descubrió que el 36,8% de las 3984 habilidades de ClawHub analizadas contienen fallas de seguridad en cualquier nivel de gravedad, y el 13,4% se calificaron como críticas. El tiempo medio de fuga se ha reducido a 29 minutos. Más rápido observado: 27 segundos. (Informe de amenazas globales CrowdStrike 2026)
Antrópico separa el cerebro de las manos.
Agentes administrados de Anthropiclanzado el 8 de abril en versión beta pública, dividió a cada agente en tres componentes que no confían entre sí: un cerebro (Claude y el arnés enrutan sus decisiones), manos (contenedores Linux desechables donde se ejecuta el código) y una sesión (un registro de eventos de solo agregar fuera de ambos).
Separar las instrucciones de la ejecución es uno de los patrones más antiguos del software. Microservicios, funciones sin servidor y colas de mensajes.
Las credenciales nunca ingresan al entorno limitado. Anthropic almacena tokens de OAuth en una bóveda externa. Cuando el agente necesita llamar a una herramienta MCP, envía un token vinculado a la sesión a un proxy dedicado. El proxy obtiene credenciales reales de la bóveda, realiza la llamada externa y devuelve el resultado. El agente nunca ve el token real. Los tokens de Git se conectan al control remoto local durante la inicialización de la zona de pruebas. Trabajo de empujar y tirar sin que el agente toque la credencial. Para los directores de seguridad, esto significa que una zona de pruebas comprometida no produce nada que un atacante pueda reutilizar.
La mejora en la seguridad llegó como efecto secundario de una corrección de rendimiento. Anthropic desacopló el cerebro de las manos para que la inferencia pudiera comenzar antes de que arrancara el contenedor. Tiempo medio hasta el primer token cayó aproximadamente un 60%. El diseño de confianza cero es también el diseño más rápido. Eso acaba con la objeción empresarial de que la seguridad añade latencia.
La durabilidad de la sesión es la tercera ganancia estructural. Un accidente de contenedor en el patrón monolítico significa pérdida total del estado. En los agentes administrados, el registro de la sesión persiste fuera del cerebro y de las manos. Si el arnés falla, se inicia uno nuevo, lee el registro de eventos y se reanuda. Ninguna pérdida de estado se convierte en una ganancia de productividad con el tiempo. Los agentes administrados incluyen seguimiento de sesiones integrado a través de Claude Consola.
Precio: 0,08 dólares por hora de sesión de tiempo de ejecución activo, excluido el tiempo de inactividad, más los costos estándar del token API. Los directores de seguridad ahora pueden modelar el costo de compromiso del agente por hora de sesión frente al costo de los controles arquitectónicos.
Nvidia bloquea la zona de pruebas y monitorea todo lo que hay dentro
NemoClaw de Nvidialanzado el 16 de marzo en una vista previa anticipada, adopta el enfoque opuesto. No separa al agente de su entorno de ejecución. Envuelve a todo el agente dentro de cuatro capas de seguridad apiladas y vigila cada movimiento. Anthropic y Nvidia son los únicos dos proveedores que han enviado públicamente arquitecturas de agentes de confianza cero al momento de escribir este artículo; otros están en desarrollo.
NemoClaw acumula cinco capas de cumplimiento entre el agente y el anfitrión. La ejecución en espacio aislado utiliza Landlock, seccomp y aislamiento del espacio de nombres de red a nivel del kernel. La red saliente denegada por defecto obliga a cada conexión externa a través de la aprobación explícita del operador a través de Política basada en YAML. El acceso se ejecuta con privilegios mínimos. Un enrutador de privacidad dirige consultas confidenciales a modelos Nemotron que se ejecutan localmente, lo que reduce a cero el costo de los tokens y la fuga de datos. La capa que más importa a los equipos de seguridad es la verificación de intenciones: el motor de políticas de OpenShell intercepta cada acción del agente antes de que toque el host. La compensación para las organizaciones que evalúan NemoClaw es sencilla. Una mayor visibilidad del tiempo de ejecución cuesta más personal de operadores.
El agente no sabe que está dentro de NemoClaw. Las acciones dentro de las políticas regresan con normalidad. Las acciones fuera de la política obtienen una denegación configurable.
La observabilidad es la capa más fuerte. Una interfaz de usuario de terminal en tiempo real registra cada acción, cada solicitud de red, cada conexión bloqueada. La pista de auditoría está completa. El problema es el costo: la carga del operador aumenta linealmente con la actividad del agente. Cada nuevo punto final requiere aprobación manual. La calidad de la observación es alta. La autonomía es baja. Esa proporción se vuelve costosa rápidamente en entornos de producción que ejecutan docenas de agentes.
La durabilidad es la brecha de la que nadie habla. El estado del agente persiste como archivos dentro del entorno limitado. Si el entorno de pruebas falla, el Estado lo seguirá. No existe ningún mecanismo externo de recuperación de sesiones. Las tareas de agentes de larga duración conllevan un riesgo de durabilidad que los equipos de seguridad deben incluir en la planificación de implementación antes de llegar a la producción.
La brecha de proximidad de credenciales
Ambas arquitecturas son un verdadero paso adelante con respecto a la monolítica predeterminada. Donde divergen es la pregunta que más importa a los equipos de seguridad: ¿qué tan cerca se encuentran las credenciales del entorno de ejecución?
Anthropic elimina por completo las credenciales del radio de explosión. Si un atacante compromete la zona de pruebas mediante una inyección rápida, obtiene un contenedor desechable sin tokens y sin estado persistente. Exfiltrar credenciales requiere un ataque de dos saltos: influir en el razonamiento del cerebro y luego convencerlo de actuar a través de un contenedor que no contiene nada que valga la pena robar. La exfiltración de un solo salto se elimina estructuralmente.
NemoClaw limita el radio de explosión y monitorea cada acción dentro de él. Cuatro capas de seguridad limitan el movimiento lateral. La red de denegación predeterminada bloquea conexiones no autorizadas. Pero el agente y el código generado comparten el mismo entorno limitado. El enrutador de privacidad de Nvidia mantiene las credenciales de inferencia en el host, fuera del entorno limitado. Pero los tokens de mensajería e integración (Telegram, Slack, Discord) se inyectan en el sandbox como variables de entorno de ejecución. Las claves de API de inferencia se transfieren a través del enrutador de privacidad y no se pasan directamente al entorno sandbox. La exposición varía según el tipo de credencial. Las credenciales están determinadas por políticas, no eliminadas estructuralmente.
Esa distinción es más importante para la inyección inmediata indirecta, donde un adversario incorpora instrucciones en el contenido que el agente consulta como parte de un trabajo legítimo. Una página web envenenada. Una respuesta API manipulada. La capa de verificación de intención evalúa lo que el agente propone hacer, no el contenido de los datos devueltos por herramientas externas. Las instrucciones inyectadas ingresan a la cadena de razonamiento como contexto confiable. Con proximidad a la ejecución.
En la arquitectura antrópica, la inyección indirecta puede influir en el razonamiento pero no puede llegar a la bóveda de credenciales. En la arquitectura NemoClaw, el contexto inyectado se ubica junto al razonamiento y la ejecución dentro del entorno limitado compartido. Esa es la brecha más amplia entre los dos diseños.
David Brauchler, director técnico y jefe de seguridad de IA/ML de NCC Group, defensores de arquitecturas de agentes cerrados construido sobre principios de segmentación de confianza donde los sistemas de IA heredan el nivel de confianza de los datos que procesan. Entradas no confiables, capacidades restringidas. Tanto Anthropic como Nvidia avanzan en esta dirección. Ninguno llega del todo.
La auditoría de arquitectura de confianza cero para agentes de IA
La cuadrícula de auditoría cubre tres patrones de proveedores en seis dimensiones de seguridad, cinco acciones por fila. Se resume en cinco prioridades:
-
Audite cada agente implementado para detectar el patrón monolítico. Marque cualquier agente que tenga tokens OAuth en su entorno de ejecución. El CSA dada muestra que el 43% utiliza cuentas de servicios compartidos. Ésos son los primeros objetivos.
-
Requerir aislamiento de credenciales en las RFP de implementación de agentes. Especifique si el proveedor elimina las credenciales de forma estructural o las controla mediante una política. Ambos reducen el riesgo. Lo reducen en diferentes cantidades con diferentes modos de falla.
-
Recuperación de la sesión de prueba antes de la producción. Mata una caja de arena a mitad de la tarea. Verifique que el estado sobreviva. Si no es así, el trabajo a largo plazo conlleva un riesgo de pérdida de datos que se agrava con la duración de la tarea.
-
Personal para el modelo de observabilidad. El seguimiento de la consola de Anthropic se integra con los flujos de trabajo de observabilidad existentes. La TUI de NemoClaw requiere un operador en el circuito. La matemática de la dotación de personal es diferente.
-
Realice un seguimiento de las hojas de ruta de inyección inmediata indirecta. Ninguna arquitectura resuelve completamente este vector. Antrópico limita el radio de explosión de una inyección exitosa. NemoClaw detecta acciones maliciosas propuestas pero no datos maliciosos devueltos. Exigir compromisos de hoja de ruta de los proveedores sobre esta brecha específica.
La confianza cero para los agentes de IA dejó de ser un tema de investigación en el momento en que se lanzaron dos arquitecturas. El incumplimiento monolítico es un pasivo. La brecha de 65 puntos entre la velocidad de implementación y la aprobación de seguridad es donde comenzará la próxima clase de infracciones.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































