Los equipos de IA empresarial están dando a los agentes más libertad justo cuando su confianza en las pruebas automatizadas está cayendo en picado.
Según la encuesta VB Pulse de junio de 2026 a 157 encuestados corporativos calificados en empresas con 100 o más empleados, la mitad de las empresas han implementado un agente de IA o una función LLM que pasó las evaluaciones internas y aun así causó una falla en el trato con el cliente (una de cada cuatro más de una vez).
La muestra es autoseleccionada y no probabilística, por lo que los resultados deben interpretarse como direccionales y no precisos.
Pero las empresas no están respondiendo frenando la automatización: El 66% de los encuestados ya permite alguna implementación de producción sin revisión humana ¿O Building Systems tiene la intención de hacerlo en los próximos 12 meses? Sólo el 5% dice que confía completamente en las revisiones automatizadas que tomarían estas decisiones de publicación.
Este desajuste es la brecha de evaluación: el techo de autonomía aumenta más rápido que el seguro por debajo de él.
Esto también encaja con una tesis más amplia que se explorará en VB Transform 2026: las empresas envían agentes primero, mientras que las capas de control en torno a la identidad, la valoración, el costo, el contexto y la orquestación vienen después. El próximo año será un ciclo de modernización, en el que los compradores cambiarán sus presupuestos hacia sistemas que hagan que los despliegues de agentes sean gobernables y confiables.
Por qué una evaluación exitosa no es un agente eficaz
Las pruebas de software tradicionales suelen preguntar si una entrada definida produce el resultado esperado. Las pruebas de agentes son más difíciles porque el sistema puede elegir su propia secuencia de pasos, llamar a herramientas, recuperar datos, cambiar el estado y reaccionar de manera diferente de una ejecución a otra.
Un agente puede tomar varias decisiones individualmente plausibles y aun así llegar a un mal resultado. Puede recuperar la cuenta correcta pero actualizar el campo incorrecto. Puede redactar una solicitud de reembolso válida pero enviarla sin aprobación. Puede llamar a cinco herramientas con éxito antes de que un sexto paso filtre información confidencial o deje un flujo de trabajo incompleto.
La encuesta muestra que las empresas ya reconocen esta limitación. La razón más común de desconfianza en la evaluación automatizada es la falta de alineación con los resultados del mundo real, citada por el 29% de los encuestados. A esto le siguen los sesgos o inconsistencias con un 21%, la falta de explicabilidad con un 18% y las fugas de datos o problemas de privacidad con un 17%.

Esta jerarquía es importante. Las empresas dicen que la puntuación a menudo no predice lo que sucede cuando un cliente, empleado o proceso de negocio se encuentra con el agente en producción, y eso no quiere decir que la puntuación automatizada sea demasiado lenta o demasiado costosa.
NIST hace un comentario similar en su Perfil de IA Generativa: Es posible que las mediciones recopiladas en entornos controlados no se transfieran limpiamente a la implementación porque el comportamiento cambia según las indicaciones, los usuarios, el contexto y las condiciones operativas. Sus directrices exigen pruebas de campo, monitoreo posterior al despliegue y procesos claros para la escalada de fallas.
VB Transform · 14-15 de julio · Menlo Park · LLM, Operaciones y Evaluaciones
Los puntos de referencia estándar fallan. En cambio, Amazon y Waymo explican lo que están probando.
La pista de evaluación profundiza en las cuatro dimensiones de la confiabilidad (consistencia, solidez, previsibilidad, seguridad) y cómo los equipos de Amazon y Waymo las implementan en producción.
Ver la agenda completa →
Capacidad no es consistencia
Una única ejecución exitosa demuestra que un agente puede completar una tarea. Esto no prueba que vaya a realizar su tarea de forma fiable.
La guía de Anthropic sobre la evaluación de agentes distingue entre medir si un sistema tiene éxito al menos una vez en intentos repetidos y si tiene éxito todas las veces. Esta distinción es esencial para los flujos de trabajo operativos o de cara al cliente. Un modelo que ocasionalmente produce una respuesta excelente puede, sin embargo, ser inaceptable si la misma tarea falla de manera impredecible en el siguiente intento.
Por lo tanto, los equipos empresariales deberían considerar la repetibilidad como una métrica premium. Esto significa ejecutar el mismo escenario varias veces, variar la redacción y el contexto, probar fallas de las herramientas y medir si el resultado comercial final sigue siendo correcto incluso cuando cambia la ruta.
El conjunto de evaluación también debe evolucionar. Cada incidente de producción debe convertirse en una prueba de regresión permanente. Las derivaciones de clientes, las llamadas fallidas a herramientas, las aprobaciones incorrectas y los errores de gestión de datos deberían repercutir en cascada a través del paquete previo a la implementación en lugar de permanecer como casos de soporte aislados.
La autonomía debe desarrollarse a través del riesgo, no de la ambición
La indagación no implica que cada acción de un agente deba requerir de una persona. La revisión humana no puede extenderse a millones de decisiones de bajas consecuencias.
Pero el funcionamiento sin intervención humana debe lograrse mediante una fiabilidad demostrada y limitado por las consecuencias de un fallo.

Acciones de bajo riesgo, como escribir resúmenes internos o categorizar documentos, pueden tolerar una mayor autonomía. Las transacciones financieras, las comunicaciones con los clientes, la implementación de códigos, los cambios en el control de acceso y la eliminación de datos requieren umbrales más estrictos, pruebas de coherencia repetidas, verificaciones de políticas, mecanismos de reversión y rutas de escalamiento humano claras.
El riesgo tampoco se distribuye uniformemente según el tamaño de la empresa. Las empresas más grandes (aquellas con 2.500 empleados o más) están avanzando más rápidamente hacia una implementación sin intervención, con un 70% frente a un 64% para las empresas más pequeñas, y también están enviando más agentes que posteriormente fallan a un cliente, con un 54% frente a un 48%.
Esta es la advertencia a los líderes empresariales. Sacar a los humanos del círculo no elimina la incertidumbre. Sin una seguridad más sólida, la incertidumbre se convierte en decisiones de producción automatizadas.
El mercado seguirá avanzando hacia una mayor autonomía porque el incentivo económico es real. Las organizaciones mejor posicionadas no serán las que reduzcan empleados más rápido: serán las que se tomen las pruebas de repetibilidad y regresión tan en serio como la velocidad de implementación.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.











































































