Las empresas que utilizan agentes de IA siempre activos se enfrentan al mismo compromiso. Envíe cada tarea a un modelo de vanguardia y la factura se acumula rápidamente. Cree una lógica de enrutamiento personalizada para enviar tareas sencillas a modelos más económicos y se convertirá en su propio proyecto de ingeniería, que debe mantenerse cada vez que cambia un flujo de trabajo.
Nvidia tiene una solución que aborda ambos extremos de este problema a la vez. La compañía lanzará el martes Nemotron 3.5 Lightning, un modelo de combinación experta abierta de 30 mil millones de parámetros diseñado para tareas de agentes especializados de gran volumen, junto con NeMo Switchyard, una biblioteca de código abierto que dirige cada paso del flujo de trabajo de un agente al modelo que mejor se adapta a él.
Los grandes números: según Nvidia, Lightning ofrece resultados hasta 4 veces más rápidos que modelos comparables de su clase, completando tareas de agente aproximadamente un 30 % más rápido que Qwen3.6-35B con una precisión equivalente. Junto con Switchyard, Nvidia afirma que la combinación puede realizar tareas de nivel fronterizo y al mismo tiempo reducir los costos de referencia a aproximadamente un tercio de los de Opus 4.8 solo.
Este momento coloca a Nvidia en medio del período de mayor actividad abierta que la industria ha visto en meses. Alibaba, Moonshot, Zhipu y DeepSeek han enviado modelos abiertos competitivos fuera de China desde la primavera, varios de ellos en o cerca de la frontera de rendimiento, al tiempo que rebajan a los laboratorios estadounidenses en tamaño o precio. Meta aumentó esta presión al lanzar su propio modelo de agente abierto de 30 mil millones de parámetros, Muse Glimmer. Los pesos abiertos pasaron de ser un diferenciador a estar en juego en cuestión de meses, y el lanzamiento de Nvidia se ubica más bien en ese cambio que antes.
El emparejamiento es el punto. Un modelo por sí solo no resuelve el problema del coste, y un enrutador por sí solo no tiene nada eficiente a lo que enrutar. Nvidia apuesta a que el código abierto, aplicado tanto a la capa de modelo como a la capa de enrutamiento, es lo que realmente impulsa el costo de la IA agente, no un solo modelo más barato o un enrutador más inteligente en la pila de otra persona.
Los verdaderos rivales de Switchyard no son otros modelos abiertos: son Not Diamond, que ya impulsa el modo Auto de OpenRouter, y RouteLLM, el marco de código abierto de UC Berkeley y LMSYS. Ninguno envía su propio modelo. La apuesta de Nvidia es que poseer ambos lados de la decisión, bajo una única licencia abierta, es algo que un competidor de solo enrutador o modelo no puede igualar.
«Este es el poder de un sistema modelo, hacer coincidir el modelo correcto con cada paso del flujo de trabajo», dijo durante una sesión informativa Kari Briski, vicepresidente de IA generativa de Nvidia.
Cómo el enrutador realmente cambia el flujo de trabajo
El enrutamiento de modelos no es una categoría nueva. OpenRouter, LiteLLM y un puñado de nuevas empresas de enrutamiento independientes ya permiten a los desarrolladores dirigir el tráfico a múltiples proveedores. Switchyard se conecta a varios de ellos en lugar de reemplazarlos por completo.
El principal problema que resuelve Switchyard es que el modelo correcto cambia cuando un agente completa una tarea. El estado de un agente cambia a medida que las herramientas devuelven resultados, aparecen errores o un paso se vuelve rutinario en lugar de complejo, y una elección de modelo fija no puede acomodar nada de esto.
Briski describió estrategias de enrutamiento que responden a este estado cambiante en lugar de a una categoría de tarea estática.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
«Hay muchos tipos de estrategias de enrutamiento», dijo Briski. «Puede tener un enrutador aleatorio, lo cual no es tan bueno, o puede tener una ruta de estado de agente o una ruta de clasificador. Dependiendo de su estrategia de enrutamiento, quiere elegir el mejor modelo. En algunos casos, desea utilizar un modelo como Lightning para tareas realmente eficientes, y el enrutador elegirá Lightning si está configurado en su grupo de modelos».
El costo entra directamente en la decisión de ruta, no como una ocurrencia tardía. En respuesta a una pregunta de VentureBeatBriski dijo que Switchyard puede evaluar la verbosidad del modelo, que es cuántos tokens tiende a producir un modelo determinado para una tarea, y usar esa predicción para dirigir el trabajo hacia la opción más barata antes de tomar la decisión.
La parte que impide que esto se convierta en su propio proyecto de integración es la ubicación de Switchyard. Nvidia ha dividido a sus socios en dos grupos: marcos de agentes que llaman directamente a Switchyard, incluidos Cognition, LangChain y Nous Research, y puertas de enlace LLM que han integrado el soporte de Switchyard en sus propios productos, incluidos Kong, LiteLLM y OpenRouter. Kong envía Switchyard de forma nativa en Kong AI Gateway. Briski destacó esta misma lista de socios de puerta de enlace al describir cómo encaja la biblioteca en el ecosistema de enrutamiento existente.
«Somos amantes del ecosistema y queremos asegurarnos de que estamos integrados», dijo Briski. «Hemos trabajado con OpenRouter, LiteLLM y Kong, y ellos ya han integrado nuestro algoritmo de enrutamiento, para que pueda retomarlo donde ya está utilizando las mejores herramientas».
Nvidia compartió los resultados de nueve empresas que probaron Switchyard, varias de ellas con números específicos adjuntos. LangChain informó una reducción de costos del 74 % en 145 tareas de agentes profundos de múltiples rondas al enrutar solo el 7 % de las llamadas a un modelo de frontera, con una compensación de precisión del 6 %. Ramp dijo que igualaba el rendimiento de un modelo fronterizo en Ramp SWE-Bench y al mismo tiempo reducía el costo en un 58 % y el tiempo de ejecución en un 33 %. Cognition integró el enrutador por etapas de Switchyard en Devin Desktop para uso interno e informó un rendimiento cercano al borde en FrontierCode Main, al tiempo que redujo el costo promedio en un 28 % en comparación con enrutar todo a un modelo de borde único.
Arquitectura Lightning y mejoras de rendimiento
Nemotron 3.5 Lightning es un modelo abierto independiente y completo, diseñado para tareas de agentes especializados de gran volumen en lugar de uso general.
Amplía la arquitectura híbrida experta de mezcla latente Mamba-Transformer introducida por Nvidia con la familia Nemotron 3 en diciembre de 2025, la misma línea detrás de Nemotron 3 Super, que Nvidia utiliza como base de Lightning en sus comparaciones posteriores al entrenamiento. Ubicado en una configuración de enrutamiento como Switchyard, está diseñado para estar en el extremo rápido y económico de la decisión en lugar de en el extremo fronterizo, pero opera y se envía independientemente de cualquier enrutador.
Según el Índice de Inteligencia de Análisis Artificial, un punto de referencia de capacidades generales que cubre nueve evaluaciones, Lightning obtiene una puntuación de 24, empatado con gpt-oss-120b y detrás de Nemotron 3 Super, Gemma 4 31B, Claude 4.5 Haiku y Mistral Medium 3.5, todos con 30. Lightning no es líder en inteligencia general en su categoría de tamaño, y Nvidia no afirma que lo sea.
La afirmación real es más limitada: según los datos de PinchBench proporcionados por Nvidia, Lightning iguala la precisión de Qwen3.6-35B aproximadamente un 30% más rápido y supera la precisión de Gemma 4 26B en un tiempo de finalización similar en PinchBench, un punto de referencia de tareas de agentes del mundo real que cubren codificación, búsqueda y administración de archivos. Se trata de un equilibrio entre velocidad y precisión, no de una ganancia de capacidad.
Según Nvidia, es después del entrenamiento cuando aparecen las mayores ganancias. La compañía compartió números de antes y después de cuatro socios de acceso temprano: la retirada de contenido malicioso de CrowdStrike contra una línea de base de Nemotron 3 Super, el enrutador de codificación de CodeRabbit contra una línea de base de GPT 5.4 Nano, la finalización del trabajo legal de Harvey y Trajectory contra una línea de base de Opus 4.6 y el trabajo de simulación de energía de Lila Sciences contra una línea de base de Opus 4.8. El caso de CodeRabbit es el más específico: Nvidia afirma que la receta estándar para el modelo NeMo Auto, entrenada para una época, se integra en un agente de enrutador funcional por $85 en aproximadamente dos horas.

Qué significa esto para las empresas
No faltan ofertas competitivas en el creciente mercado de modelos abiertos. La nueva versión de Nemotron Lightning será otra opción a considerar por las organizaciones.
En cuanto al modelo, el propio gráfico de referencia de Lightning elige Qwen3.6-35B como punto de comparación directo. Cuando VentureBeat le preguntó directamente cómo se compara Lightning con los modelos chinos en general, Briski no ofreció una comparación directa, sino que señaló la apertura y la personalización como un diferenciador.
«Nuestra propuesta de valor no sólo es abierta y muy personalizable», dijo Briski.
Para las empresas que construyen infraestructura agente, se destacan tres tendencias:
La decisión de enrutamiento se vuelve dinámica en lugar de estática. Las empresas que han creado canales de agentes en torno a un único modelo predeterminado se ven empujadas a un enrutamiento por etapas basado en señales en vivo, como el estado del agente y el costo del token, no en una asignación fija definida en el momento del diseño.
El código abierto es ahora una palanca de costos de dos niveles, no sólo uno. Emparejar un modelo abierto con un enrutador abierto que un proveedor controla de extremo a extremo es un argumento más nuevo que los pesos más baratos por sí solos, y vale la pena observarlo para ver si otros laboratorios están siguiendo el mismo modelo.
La cuestión de la competencia pasa del mejor modelo al mejor sistema. A medida que las bibliotecas de enrutamiento evolucionan, el diferenciador pasa del modelo predeterminado de una empresa a cómo su capa de enrutamiento asigna los modelos a las tareas de producción, algo más difícil de comparar y de comercializar.












































































