Cientos de líderes empresariales y expertos técnicos llenaron el salón principal del lujoso Hotel Nia en Menlo Park esta semana para Transformación VB 2026la conferencia más importante del año sobre el uso de agentes generativos de IA para impulsar los resultados comerciales.
Rachad Alao, vicepresidente de ingeniería de productos de la emergente empresa canadiense de inteligencia artificial Cohere, se unió al director ejecutivo y editor en jefe de VentureBeat. marshall matt para una charla informal sobre la creación de sistemas agentes sin ceder datos confidenciales, control de infraestructura o la capacidad de cambiar de proveedor.
Alao, quien anteriormente dirigió equipos responsables de inteligencia artificial y de ingeniería de confianza y seguridad en Google y Meta, argumentó que la soberanía de la inteligencia artificial significa más que descargar un modelo abierto o ejecutar una aplicación detrás de un firewall corporativo.
Cuando se le preguntó cómo define Cohere la soberanía, Alao señaló las organizaciones que operan sistemas de misión crítica, incluidos bancos, hospitales y gobiernos.
«Es importante tener un control muy estricto sobre dónde residen los datos, tener un control estricto sobre la IA», dijo, y agregó que las operaciones de IA deben tener lugar en jurisdicciones que una organización comprenda o controle directamente.
Esto se extiende desde las GPU y la infraestructura de nube privada hasta los sistemas de gobernanza que enrutan las solicitudes entre modelos, así como los conectores, las herramientas de búsqueda y los marcos de agentes que actúan sobre los datos empresariales.
«Quieres tener control sobre toda la pila», dijo Alao.
Las cargas de trabajo de los agentes podrían superar la caída de los precios de los tokens
Marshall cuestionó uno de los argumentos económicos centrales a favor de modelos más pequeños implementados localmente: los precios de inferencia continúan cayendo rápidamente, lo que potencialmente debilita los argumentos a favor de optimizar cada token.
Alao respondió que el consumo total está aumentando aún más rápido a medida que las empresas pasan de chatbots relativamente simples a agentes que razonan problemas, llaman a herramientas, buscan sistemas internos y toman múltiples pasos antes de devolver una respuesta.
«La utilización de tokens está aumentando exponencialmente porque se trata de casos de uso de agentes cada vez más complejos», dijo. Esos flujos de trabajo requieren “mucho procesamiento, pensamiento e interacción de herramientas” para completar sus objetivos, añadió.
Alao también hizo un contraste entre los proveedores que facturan a los clientes según el consumo de tokens y el enfoque de Cohere.
«Si toda su forma de cobrar a los clientes es por la utilización de tokens, desea maximizar la utilización de tokens», dijo. «No vendemos nuestros modelos ni nuestra plataforma de esa manera».
En cambio, Alao dijo que Cohere intenta ayudar a las empresas a resolver sus problemas más difíciles de forma privada y segura, al tiempo que reduce el uso innecesario de modelos. Su receta fue sencilla: «Utilice el modelo adecuado para la tarea en cuestión».
En lugar de enviar cada solicitud al modelo de frontera más grande disponible, las empresas deberían encaminar el trabajo de acuerdo con la inteligencia requerida y la sensibilidad o carga regulatoria asociada a la tarea.
Alao citó a un banco canadiense anónimo que utiliza los modelos locales de Cohere para cargas de trabajo altamente reguladas, mientras envía tareas menos sensibles que requieren mayor inteligencia a través de la plataforma Norte de Cohere a modelos de frontera más grandes.
«Por lo tanto, el enrutamiento de modelos puede resultar muy útil», afirmó.
Modelos más pequeños para la mayoría del trabajo empresarial
Cuando un miembro de la audiencia le preguntó cómo funciona el código abierto de Cohere. Mini Código Nortelanzado el mes pasado, podría competir con modelos de codificación patentados, Alao reconoció que los modelos de frontera más grandes pueden funcionar algo mejor en las tareas más difíciles.
Pero tal vez esa ventaja no justifique su uso indiscriminado.
«Para el 80% de los casos de uso que necesitaban, esto fue mucho más efectivo y mucho más barato», dijo Alao sobre los desarrolladores que adoptaron el modelo.
North Mini Code de Cohere se ejecuta en una única GPU Nvidia H100 y apunta a la ingeniería de software agente, incluido el trabajo de terminal, la revisión de código y el uso de herramientas.
La compañía también ha lanzado Comando A+un modelo de combinación de expertos de 218 mil millones de parámetros con solo 25 mil millones de parámetros activos durante cada paso de generación.
Su versión comprimida de cuatro bits reduce el hardware necesario para la implementación privada, mientras que su licencia Apache 2.0 brinda a las empresas amplia libertad para operarlo y modificarlo.
La búsqueda pasa a formar parte del agente
Cuando se le preguntó sobre el trabajo de larga data de Cohere en incrustaciones y búsqueda empresarial, Alao dijo que el campo está yendo más allá de recuperar texto e insertarlo en la ventana contextual de un modelo.
“Hoy en día, lo más avanzado es la búsqueda multimodal”, dijo. «Va más allá de la modalidad de texto».
La búsqueda en documentos, imágenes y otras formas de información se está convirtiendo en «un componente integral de su flujo de trabajo agente», agregó Alao, y el modelo decide cuándo y cómo utilizar la recuperación como cualquier otra herramienta.
Cuando se le preguntó qué persuadiría a las empresas a ir más allá de los servicios de IA integrados de los proveedores de nube existentes, Alao volvió al control y la portabilidad de los datos.
«Si estás interesado en la soberanía, quieres tener más control sobre tus datos», dijo. La capa de gobernanza de Cohere, añadió, permite a los clientes dirigir el tráfico a los modelos apropiados, «rompiendo la preocupación de depender de un proveedor que tienen muchos de nuestros clientes».
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































