Los equipos empresariales que ejecutan agentes de IA a escala están descubriendo que un solo modelo maneja mal todas las tareas: o el modelo es demasiado costoso para preguntas simples o no es lo suficientemente capaz para las difíciles. El enrutamiento de modelos, que selecciona automáticamente el modelo correcto para cada tarea, se está convirtiendo en la solución.
Cortex AI Gateway de Snowflake ahora ofrece enrutamiento de modelos dinámicos para abordar eso: las empresas pueden seleccionar «automático» en lugar de un modelo fijo, y el sistema enruta cada tarea al modelo que ofrezca la mejor combinación de calidad y costo. Snowflake dijo que la capacidad puede reducir los costos simbólicos hasta 3 veces en algunas cargas de trabajo (una cifra de las propias pruebas internas de la compañía) después de descubrir que las preguntas simples a menudo eran manejadas por su modelo más capaz, lo que hacía que las respuestas fueran más costosas y más lentas de lo necesario.
La medida se produce en medio de un cambio más amplio de la industria hacia el enrutamiento de modelos automatizado. Databricks, AWS, Google Cloud y Nvidia han anunciado algún tipo de tecnología de enrutamiento de modelos. Snowflake sostiene que el enrutamiento de modelos es más complejo que solo el precio y el rendimiento; también tiene que ver con la gobernanza y el contexto.
«Para crear agentes de alta calidad y de nivel empresarial, es crucial conseguir el contexto y la gobernanza adecuados», dijo a VentureBeat Baris Gultekin, vicepresidente de IA de Snowflake. «El contexto, la confianza y la elección del modelo van de la mano».
Dos mecanismos deciden hacia dónde va una tarea
La capacidad se basa en Cortex AI Gateway, que Snowflake lanzó en julio de 2026 como una capa de gobernanza para el tráfico de agentes y modelos. Antes del enrutamiento dinámico, la selección de modelos se realizaba a partir de una lista estática por tarea en lugar de un verdadero sistema de respaldo, dijo Gultekin.
Según Gultekin, el enrutamiento dinámico se ejecuta mediante dos mecanismos.
Un modelo pequeño lo intenta primero. Según lo que Snowflake llama patrón de asesor, un modelo más pequeño intenta realizar una tarea primero. Si no puede terminar el trabajo, llama a un modelo más grande como herramienta y continúa desde allí.
Un clasificador ordena por historial de tareas. Un clasificador independiente, capacitado en consultas anteriores, dirige automáticamente las preguntas sencillas a modelos más simples.
Los clientes aún pueden fijar un modelo. El enrutamiento automático es opcional. Los clientes pueden restringir el enrutamiento a un modelo o a un conjunto definido de modelos, y el sistema enruta solo dentro de ese límite.
No hay una tarifa separada. Snowflake valora la IA únicamente en función del uso de tokens. La ruta a un modelo más barato produce una factura más barata, sin cargos adicionales por la decisión de ruta en sí.
Los controles de acceso siguen la tarea, no solo los datos
Snowflake vincula el enrutamiento a los mismos controles de acceso que ya utiliza para el gobierno de datos.
La gobernanza comienza en el nivel de datos con controles de acceso basados en roles. A continuación se extiende a los modelos, donde los roles de los clientes se asignan a grupos de modelos aprobados. Se extiende nuevamente a los agentes, donde un agente puede tener privilegios más limitados que los del usuario que lo invoca.
Los modelos abiertos pueden ejecutarse desde la propia región de un cliente para satisfacer los requisitos de residencia de datos. Gultekin dijo que toda inferencia, tanto abierta como propietaria, permanece dentro de los límites de seguridad de Snowflake en lugar de dirigirse a un proveedor externo. Esa configuración regional y perimetral es importante específicamente para los modelos abiertos con orígenes fuera de EE. UU., incluidos DeepSeek-V4-Flash y GLM-5.3, ambos desarrollados en China.
Copo de nieve adquisición reciente de Natoma añade otra capa. El acuerdo incluye más de 100 conectores MCP con acceso gobernado y con alcance. Un agente podría obtener acceso de solo lectura a una herramienta conectada como el correo electrónico, por ejemplo, en lugar de permisos más amplios.
El contexto permite que un modelo más barato haga el trabajo
Snowflake anunció recientemente su Contexto del horizonte y sentido de la corteza herramientas que proporcionan capacidades de contexto.
Sin un buen contexto, un modelo tiene que hacer el trabajo exploratorio por sí mismo, escribiendo y probando SQL, buscando datos y reintentando cuando algo no funciona. Gultekin explicó que el proceso es costoso y, para hacerlo bien, normalmente se requiere un modelo más capaz. Presentar el contexto de antemano elimina ese paso exploratorio, lo que significa que un modelo más simple y económico a menudo puede realizar la misma tarea.
Snowflake también incorpora la memoria del agente en ese contexto. A medida que un agente se utiliza repetidamente, su memoria se actualiza y se vuelve a incluir en consultas futuras. El sistema no resuelve el mismo problema desde cero cada vez. La memoria se convierte en parte del contexto pasado al modelo.
OpenRouter, Databricks y Nvidia persiguen el mismo problema
No hay escasez de tecnologías en el espacio de enrutamiento de modelos. OpenRouter es una de las opciones más conocidas y proporciona una plataforma que permite a las organizaciones realizar rutas en función del costo y el rendimiento. Nvidia anunció el 11 de agosto Switchyard como capa tecnológica para ayudar a encaminar la elección del modelo de IA. Databricks también ofrece Smart Routing para su Unity AI Gateway. «Lo interesante es lo que dice sobre hacia dónde se ha movido la diferenciación», dijo a VentureBeat Sanjeev Mohan, director y fundador de SanjMo. «Snowflake no vende realmente enrutamiento, sino enrutamiento que nunca sale de los límites de datos gobernados, con controles de acceso, etiquetado y atribución de costos ya adjuntos».
Mohan agregó que para una empresa cuyos datos y cumplimiento ya se centran en Snowflake, el enrutamiento que mantiene los datos en su lugar y los atributos gastados por equipo es una palanca real para ese problema. Para una empresa sin ese centro de gravedad, una puerta de enlace neutral puede atravesar más modelos con menos fricción.
Mohan enmarca el mercado como tres campos distintos en lugar de un campo competitivo. Databricks aborda la gobernanza desde la ingeniería de datos y el linaje de ML. Su Unity Catalog gobierna datos, modelos y canalizaciones para modelos de formación y creación de equipos. Snowflake aborda la gobernanza desde el análisis y el control de acceso, gobernando quién puede tocar qué datos y atribuyendo el uso entre las unidades de negocio. Un tercer campo incluye puertas de enlace neutrales como OpenRouter, LiteLLM, Portkey y enrutadores hiperescaladores como Azure AI Foundry. Estos compiten en la amplitud del modelo y evitando el bloqueo en lugar de una gobernanza profunda.
Elegir un enrutador significa elegir un modelo de gobernanza
El enrutamiento de modelos es ahora algo en juego para las empresas. La decisión que importa es qué modelo de gobernanza ya se adapta a cómo están organizados sus datos y equipos, no qué enrutador de proveedor es más rápido o más barato.
La selección manual de modelos se está convirtiendo en un costo pasivo a escala de agente. Lo que funcionó cuando un equipo dirigía un puñado de agentes se desmorona a gran escala. Cientos de agentes que realizan llamadas de modelos de rutina sin una verificación de costos automatizada se suman rápidamente.
Evalúe el modelo de gobernanza, no la lista de funciones del enrutador. La verdadera pregunta, según Mohan, es qué modelo de gobernanza coincide con el conjunto de datos que ya existe y cuál ofrece la visibilidad de costos necesaria para evitar una sorpresa desagradable.
El punto de partida correcto depende de dónde ya se encuentran los datos de una empresa. Según Mohan, una tienda Snowflake obtiene más valor del enrutamiento en la plataforma que respeta su modelo de acceso existente y factura a los centros de costos que de la amplitud del modelo bruto. Un equipo centrado en Databricks preocupado por el linaje entre el entrenamiento y la implementación se beneficiará mejor de una puerta de enlace construida en torno a ese mismo linaje. Un equipo multiplataforma o que prioriza el modelo y que quiere la máxima elección con un mínimo de dependencia encaja mejor con una puerta de enlace neutral, el mismo argumento detrás de la valoración de OpenRouter.
«Para un profesional, no comience con el enrutador, comience con el lugar donde ya se encuentran sus datos gobernados y su compromiso de plataforma, y con qué tan expuestos están sus márgenes al costo de inferencia», dijo Mohan.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































