Presentado por Nutanix
A medida que las empresas pasan de la experimentación con IA al despliegue de producción, el principal generador de costos se ha alejado de los modelos base de capacitación y se ha centrado en la infraestructura necesaria para ejecutar miles de cargas de trabajo de inferencia simultáneas a escala, con la IA agente como acelerador.
Si bien los primeros proyectos de IA empresarial implicaban un puñado de grandes trabajos de capacitación programados, los entornos de agentes de producción requieren soporte continuo para consultas impredecibles y de corta duración que consumen recursos de GPU, red y almacenamiento de maneras que la infraestructura tradicional nunca fue diseñada para manejar. Para los líderes tecnológicos empresariales, este cambio convierte la eficiencia de la infraestructura en un factor decisivo en la economía de la IA.
«Cada empleado con un asistente de IA, cada flujo de trabajo automatizado, cada canal de agentes necesita modelos de inferencia y genera muchos tokens», afirma Anindo Sengupta, vicepresidente de producto de Nutanix. «Estas consultas de inferencia aterrizan en la infraestructura de GPU, atraviesan redes especializadas y extraen datos de sistemas de almacenamiento diseñados específicamente para soportar estas cargas de trabajo de IA».
Por qué el costo por token se está convirtiendo en una métrica de infraestructura esencial
Los costos de inferencia por token han caído aproximadamente en un orden de magnitud en los últimos dos años, impulsados por la mejora de la eficiencia de los modelos y la presión competitiva entre los proveedores de la nube. Se esperaría que la IA empresarial fuera más barata. En cambio, los costos totales aumentan, dice Sengupta, señalando lo que los economistas llaman la paradoja de Jevons: cuando un recurso se vuelve más barato de usar, el consumo tiende a aumentar más rápido de lo que caen los precios.
Entonces, si bien el costo por token se ha reducido casi 10 veces en los últimos dos años, el consumo ha aumentado más de 100 veces. El resultado es que el costo por token y la utilización de GPU se están convirtiendo en las principales métricas operativas para la informática empresarial, junto con las métricas tradicionales como la disponibilidad y el rendimiento.
«El costo por token en realidad se refiere al costo total de propiedad de los modelos de inferencia», dice Sengupta. «La utilización consiste en garantizar que una vez que se tienen activos de GPU, se obtiene el máximo rendimiento sobre ellos. Estas métricas serán fundamentales para los líderes de TI empresariales».
Lo que dificulta esto es la cantidad de variables involucradas. Los costos de los tokens varían según los modelos que ejecuta una organización, dónde se ejecutan las cargas de trabajo y cómo se estructuran las indicaciones.
«Los costos tienen demasiadas variables para gestionarlos de forma intuitiva», añade Sengupta. «Optimizarlo es un problema de ingeniería que requiere un ajuste continuo».
Las cargas de trabajo de los agentes exponen las limitaciones de la infraestructura tradicional
La IA de producción agente introduce un perfil de carga de trabajo para el cual la infraestructura empresarial tradicional no fue diseñada. Las implementaciones de centros de datos tradicionales se basan en cargas predecibles y ciclos de planificación prolongados. Los entornos agentes producen ráfagas impredecibles y de alta frecuencia de consultas de inferencia breves, imponen nuevos requisitos de red y almacenamiento y escalan más rápido de lo que permiten la mayoría de los ciclos de aprovisionamiento.
La infraestructura que soporta la IA agente también es estructuralmente diferente de la informática basada en CPU. La topología de GPU, las interconexiones de alta velocidad, los sistemas de almacenamiento paralelo para la memoria del agente y la caché KV y las arquitecturas de red capaces de manejar la descarga de DPU representan nuevas capacidades que requieren nuevas habilidades operativas.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
La infraestructura aislada agrava estos desafíos. Cuando los recursos de la GPU, las redes y el acceso a los datos se administran de forma independiente, se acumulan ineficiencias en la programación, la utilización disminuye y los costos aumentan. Las organizaciones que ejecutan pilas dispersas tienden a subutilizar costosos recursos de GPU y, al mismo tiempo, obstaculizan el almacenamiento y el rendimiento de la red.
Pilas integradas y el caso de una arquitectura de pila completa
La respuesta que está surgiendo entre los proveedores de infraestructura es un movimiento hacia plataformas full-stack estrechamente integradas y validadas, diseñadas específicamente para cargas de trabajo de producción de IA. La premisa es que la optimización de extremo a extremo de las capas de computación, redes, almacenamiento y software produce una mejor utilización y menores costos por token que ensamblar los mejores componentes de proveedores separados.
La solución Agentic AI de Nutanix representa un enfoque para este problema. Construida sobre el hipervisor Nutanix AHV, Nutanix Enterprise AI y Nutanix Kubernetes Platform, la solución está diseñada para manejar tanto la capa informática tradicional donde se ejecuta la orquestación de agentes como la capa informática acelerada donde se ejecuta la inferencia. La compañía introdujo mejoras de AHV con reconocimiento de topología de NVIDIA que optimizan automáticamente la forma en que las GPU, CPU, memoria y DPU se asignan a las máquinas virtuales, y descargó la red virtual Nutanix Flow a las DPU de BlueField para liberar ciclos de GPU y mantener el rendimiento sin comprometer la seguridad.
La solución admite la implementación instantánea de microservicios NIM de NVIDIA y modelos de código abierto, incluido Nemotron, e integra una puerta de enlace de IA que gobierna el acceso a los LLM en la nube fronteriza de Anthropic, Google, OpenAI y otros. La puerta de enlace también implementa el Protocolo de contexto modelo (MCP) para permitir que los agentes se conecten a datos empresariales con controles de acceso granulares. La solución se ejecuta en la infraestructura de Cisco, lo que permite a las organizaciones implementarla en la infraestructura que ya operan.
«Al integrar todo, desde el hipervisor AHV y Flow Virtual Networking hasta la plataforma Kubernetes, se eliminan los silos que ralentizan los proyectos de IA», afirma Sengupta.
Los equipos de plataforma y la agilidad de los desarrolladores no se pueden negociar entre sí
Una tensión organizacional que está creciendo con la adopción de la IA agente es la relación entre los equipos de la plataforma que administran la infraestructura compartida y los desarrolladores que crean y ejecutan aplicaciones de agente sobre ella. Históricamente, estos grupos han operado con diferentes herramientas, diferentes prioridades y diferentes horizontes temporales, pero Sengupta sostiene que la dinámica fundamental no ha cambiado, incluso cuando la tecnología ha cambiado.
«Los equipos de plataforma seguirán ofreciendo un catálogo de capacidades de IA de autoservicio que también están alineadas con las necesidades empresariales y pueden ser utilizadas por creadores de IA agentes», afirma Sengupta. «Los equipos maduros de IA harán un gran trabajo no sólo aprovechando las GPU, sino también creando un modelo operativo que permita una rápida entrega de infraestructura de IA para cumplir con el ritmo de innovación que desean los desarrolladores. Esto es lo que es fundamental para el éxito».
Las organizaciones que gestionan el uso de GPU de forma más eficaz tienden a estar más avanzadas en su proceso de adopción de la IA, con modelos operativos más establecidos y una responsabilidad de costes más clara. Para las organizaciones que se encuentran en las primeras etapas del viaje, las decisiones sobre el diseño de infraestructura y el modelo operativo que se tomen ahora determinarán si los proyectos de IA pueden pasar de la etapa piloto a la producción sin que el costo o la complejidad se conviertan en un factor limitante.
El modelo operativo de fábrica de IA
El marco emergente para la infraestructura de IA empresarial es AI Factory, un entorno diseñado específicamente para producir y ejecutar cargas de trabajo de IA a escala. El desafío es que la mayoría de las organizaciones necesitarán operar simultáneamente computación tradicional y acelerada durante años, lo que requerirá un modelo operativo común que abarque ambos paradigmas tecnológicos sin sacrificar la agilidad.
Con Nutanix, ejecutándose en Cisco como parte de Cisco AI Pods, impulsado por Intel y optimizado para la arquitectura de referencia de NVIDIA, las organizaciones tienen una base completa lista para la producción al permitir que miles de agentes compartan de forma segura y eficiente las fábricas de IA, logrando los costos más bajos por token. La solución cierra la brecha entre los equipos de ingeniería de infraestructura y plataforma que administran el hardware y la ingeniería de IA y los equipos de desarrolladores de IA agente que crean y ejecutan aplicaciones de IA agente, haciendo que la ejecución de IA a escala sea realmente asequible.
«Las métricas que determinarán si una organización puede mantener y escalar su inversión en IA (costo por token, utilización de GPU, eficiencia de programación) son métricas de infraestructura», afirma Sengupta. «Gestionarlos bien es cada vez más un requisito previo para que la IA sea viable, no sólo funcional».
Asegure y amplíe su fábrica de IA: explore el enfoque completo aquí.
Los artículos patrocinados son contenidos producidos por una empresa que paga por la publicación o tiene una relación comercial con VentureBeat y siempre están claramente marcados. Para más información, póngase en contacto ventas@venturebeat.com.











































































