Laboratorio canadiense de IA Adherirse causó sensación recientemente por anunciando una fusión con la startup alemana de IA Aleph Alphapero ahora tiene aún más reservado para los creadores de empresas de todo el mundo: hoy, la empresa cofundado por el ex empleado de Google y coautor de «Attention Is All You Need» Aidan Gomez desvelado Comando A+un modelo de lenguaje altamente optimizado de 218 mil millones de parámetros diseñado específicamente para razonamiento complejo, procesamiento de documentos multimodal y flujos de trabajo agentes.
El aspecto más significativo del lanzamiento no son sólo las capacidades del modelo; es su accesibilidad.
Al soltar los pesos del modelo libremente en el popular repositorio de código compartido de IA Hugging Face bajo un Licencia de código abierto Apache 2.0 altamente permisiva – una novedad para la empresa, según una publicación de Gómez, ahora director ejecutivo de Cohere, en X — Cohere está haciendo una apuesta calculada por la «IA soberana»: la tesis de que las empresas, los gobiernos y los desarrolladores deberían tener la capacidad de ejecutar, controlar y adaptar la IA de vanguardia completamente dentro de sus propios entornos seguros, sin sacrificar el rendimiento.
Arquitectura dispersa con cuantización extrema
A nivel arquitectónico, Command A+ representa una evolución importante con respecto a los modelos densos anteriores de Cohere. Es un transformador de mezcla dispersa de expertos (MoE) solo para decodificador.
Si bien el modelo alberga un total relativamente modesto de 218 mil millones de parámetros, aún menos (sólo 25 mil millones) están activos durante cualquier paso de generación determinado. Ocupa un espacio mucho más ligero y requiere muchos menos recursos informáticos para ejecutarse en inferencia (ofreciendo el modelo en entornos de producción a usuarios finales o a través de agentes) que los gigantes propietarios estadounidenses como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, que son estimado por observadores externos en billones de parámetros.
Esta arquitectura dispersa es la clave para la eficiencia del modelo. En términos sencillos, un modelo MoE enruta las consultas entrantes sólo a las redes neuronales «expertas» específicas que mejor se adaptan a manejarlas, dejando el resto del modelo inactivo.
Esta es una formulación familiar y seguida por la mayoría de los LLM líderes en estos días, lo que permite que los modelos conserven la amplia base de conocimientos y las capacidades de razonamiento matizado de un gigante, pero a velocidades más rápidas y requisitos de computación y energía reducidos de un modelo mucho más pequeño, ya que solo una fracción de los parámetros se activa en cualquier momento.
Pero donde Cohere ha dado un paso más allá de la mayoría para Command A+ es que se ha centrado en gran medida en la eficiencia del hardware a través de la cuantización, un proceso que comprime la huella de memoria del modelo al reducir la precisión de sus parámetros.
Command A+ está disponible en formato de 16 bits (BF16), 8 bits (FP8) y 4 bits altamente comprimido (W4A4).
La cuantización W4A4 es la pieza técnica central de esta versión. Normalmente, los modelos de razonamiento sufren un enorme «impuesto de cuantificación», donde la compresión del modelo conduce a regresiones visibles en la resolución de problemas complejos.
Cohere mitigó esto cuantificando únicamente a los expertos del MoE a 4 bits, mientras mantener las vías de atención críticas con total precisión, complementado con una técnica llamada Destilación consciente de la cuantificación.
El resultado es un compresión casi sin pérdidas eso permite que este enorme modelo se ejecute en una sola GPU NVIDIA Blackwell B200 o solo dos GPU NVIDIA H100.
Las ganancias de velocidad son igualmente notables. Según los datos de rendimiento publicados por la empresa, la cuantificación W4A4 con baja concurrencia alcanza 375 tokens por segundo (TOPS) con una latencia de tiempo hasta el primer token (TTFT) de solo 113 milisegundos, lo que representa hasta un aumento del 63 % en la velocidad de salida y una reducción del 17 % en la latencia en comparación con el modelo anterior Command A Reasoning.
Además, Cohere ha revisado el tokenizador del modelo. Los tokenizadores descomponen el texto en fragmentos que procesan los modelos de IA. El nuevo tokenizador está altamente optimizado para uso empresarial global y ofrece soporte nativo para 48 idiomas.
Más importante aún, es mejora drásticamente la eficiencia de la tokenización para idiomas no europeos, reduciendo la cantidad de tokens necesarios para generar respuestas en árabe en un 20%, en japonés en un 18% y en coreano en un 16%. Debido a que los costos de inferencia se calculan por token, esto se traduce directamente en costos operativos más bajos para implementaciones globales, multilingües o en idiomas distintos del inglés.
Flujos de trabajo agentes y altos estándares en matemáticas y campos especializados.
Si bien la velocidad y el tamaño brutos dictan la implementación, la utilidad de un modelo se define por las capacidades de su producto. Command A+ se creó específicamente para tareas «agentes»: flujos de trabajo en los que la IA opera de forma autónoma o semiautónoma, utiliza herramientas externas, consulta bases de datos y sintetiza información en múltiples pasos.
Los saltos de referencia con respecto a la generación anterior son marcados.
En 𝜏²-Bench Telecom, que prueba razonamientos complejos, el modelo saltó de una puntuación del 37% al 85%. En Terminal-Bench Hard, que mide el rendimiento de la codificación agente, subió del 3% al 25%. En matemáticas complejas, obtuvo una puntuación del 90% en AIME 25, frente al 57%.
Command A+ supera su categoría de peso (25B parámetros activos) en razonamiento puro y matemáticas, compitiendo directamente con modelos mucho más grandes como DeepSeek V4 Pro en pruebas comparativas matemáticas. Sin embargo, en lo que respecta a la codificación agente profunda y la indexación general de inteligencia a gran escala, actualmente va por detrás de las últimas generaciones de rivales chinos de código abierto como búsqueda profunda, Z.ai (GLM)y minimax.
Dicho esto, compararlos directamente ignora la propuesta de valor central de Cohere: eficiencia del hardware.
Más allá de los puntos de referencia, Command A+ introduce integraciones profundas para la confianza y la verificación empresarial. El modelo admite el uso de herramientas conversacionales a través de plantillas de chat estándar, lo que permite a los desarrolladores conectarlo sin problemas a API internas, motores de búsqueda o bases de datos SQL.
Fundamentalmente, Command A+ presenta generación de citas nativa. Cuando el Comando A+ recupera información de una herramienta externa, no solo sintetiza la respuesta; genera «tramos de puesta a tierra» explícitos. Usando etiquetas especiales incrustadas en la salida, el El modelo vincula directamente cada afirmación fáctica que hace con el documento fuente específico o la fila de la base de datos. sacó la información de.
Para empresas de sectores fuertemente regulados como el financiero, el sanitario o el jurídico, esta trazabilidad marca la diferencia entre un prototipo interesante y una aplicación lista para producción. Si un usuario solicita un informe de ventas diario, el modelo generará el monto total de ventas y citará explícitamente el resultado de la consulta de la base de datos que proporcionó ese número, minimizando el riesgo de alucinaciones no detectadas.
Además, Command A+ es totalmente multimodal, capaz de procesar texto e imágenes de forma nativa dentro de su enorme ventana de contexto de entrada de 128 KB, lo que lo hace muy eficaz para el procesamiento de documentos complejos, como el análisis de facturas, gráficos o manuales técnicos escaneados.
El primer modelo Cohere AI con licencia completa de Apache 2.0
En el panorama actual de la IA, «código abierto» se ha convertido en un término complicado. Muchas empresas líderes en IA publican los pesos de sus modelos bajo licencias comerciales restrictivas o políticas de uso aceptable que prohíben explícitamente a las grandes empresas utilizar los modelos con fines comerciales, o prohíben que los modelos se utilicen para entrenar sistemas de IA competidores.
De hecho, los modelos anteriores de Cohere, incluidos Comando R y Comando R+se publicaron bajo una licencia CC-BY-NC 4.0 (Creative Commons NonCommercial). Si bien los pesos de sus modelos estaban abiertos para que los investigadores y desarrolladores los descargaran, modificaran y evaluaran, estaba estrictamente prohibido su uso con fines comerciales sin comprar una licencia empresarial separada de Cohere o pasar por su interfaz de programación de aplicaciones (API), similar a la disposición que muchas empresas utilizan para acceder a modelos de IA de OpenAI, Anthropic, Google y otros laboratorios líderes.
Cohere ha cambiado su enfoque al lanzar Command A+ bajo la licencia Apache 2.0. Esta es una distinción fundamental para la comunidad de desarrolladores. Apache 2.0 es una verdadera licencia de código abierto aprobada por OSI. Permite que cualquier persona (desde desarrolladores independientes hasta corporaciones Fortune 500) use, modifique, distribuya y comercialice el modelo sin pagar tarifas de licencia ni adherirse a cláusulas restrictivas de no competencia.
Como Gómez escribió en Xla decisión fue defendida por el cofundador de Cohere, Nick Frosst, quien publicó una descripción general de dos minutos de duración calificándolo como «el mejor modelo que jamás hayamos lanzado».
Para la empresa, esta licencia significa total independencia del proveedor. Una empresa puede descargar los pesos de Command A+, ajustarlos en datos internos altamente clasificados e implementarlos en sus propios servidores privados o redes aisladas. No están atados a la infraestructura de Cohere, a los cambios de precios ni al tiempo de actividad de la API. Es la realización definitiva de la IA soberana.
El lanzamiento tuvo una tracción inmediata en todo el ecosistema de desarrolladores de IA, impulsado en gran medida por su integración desde el primer día con los principales marcos de inferencia de código abierto como Hugging Face y vLLM.
¿Qué sigue?
El lanzamiento de Command A+ marca una maduración del ecosistema de IA de código abierto. Al combinar razonamiento de vanguardia, uso sólido de herramientas de agente y capacidades multimodales con una arquitectura diseñada específicamente para la eficiencia del hardware, Cohere está cambiando el cálculo para la adopción de la IA empresarial.
El requisito de clústeres informáticos masivos y centralizados ha sido durante mucho tiempo un cuello de botella para las empresas que priorizan la privacidad de los datos y el control de costos. Al democratizar el acceso a un modelo de este calibre bajo una verdadera licencia de código abierto, Cohere ha proporcionado al mercado empresarial exactamente lo que estaba pidiendo: el poder de la nube, capaz de ejecutarse de forma segura en la sala de servidores al final del pasillo.
Laboratorio canadiense de IA Adherirse causó sensación recientemente por anunciando una fusión con la startup alemana de IA Aleph Alphapero ahora tiene aún más reservado para los creadores de empresas de todo el mundo: hoy, la empresa cofundado por el ex empleado de Google y coautor de «Attention Is All You Need» Aidan Gomez desvelado Comando A+un modelo de lenguaje altamente optimizado de 218 mil millones de parámetros diseñado específicamente para razonamiento complejo, procesamiento de documentos multimodal y flujos de trabajo agentes.
El aspecto más significativo del lanzamiento no son sólo las capacidades del modelo; es su accesibilidad.
Al soltar los pesos del modelo libremente en el popular repositorio de código compartido de IA Hugging Face bajo un Licencia de código abierto Apache 2.0 altamente permisiva – una novedad para la empresa, según una publicación de Gómez, ahora director ejecutivo de Cohere, en X — Cohere está haciendo una apuesta calculada por la «IA soberana»: la tesis de que las empresas, los gobiernos y los desarrolladores deberían tener la capacidad de ejecutar, controlar y adaptar la IA de vanguardia completamente dentro de sus propios entornos seguros, sin sacrificar el rendimiento.
Arquitectura dispersa con cuantización extrema
A nivel arquitectónico, Command A+ representa una evolución importante con respecto a los modelos densos anteriores de Cohere. Es un transformador de mezcla dispersa de expertos (MoE) solo para decodificador.
Si bien el modelo alberga un total relativamente modesto de 218 mil millones de parámetros, aún menos (sólo 25 mil millones) están activos durante cualquier paso de generación determinado. Ocupa un espacio mucho más ligero y requiere muchos menos recursos informáticos para ejecutarse en inferencia (ofreciendo el modelo en entornos de producción a usuarios finales o a través de agentes) que los gigantes propietarios estadounidenses como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, que son estimado por observadores externos en billones de parámetros.
Esta arquitectura dispersa es la clave para la eficiencia del modelo. En términos sencillos, un modelo MoE enruta las consultas entrantes sólo a las redes neuronales «expertas» específicas que mejor se adaptan a manejarlas, dejando el resto del modelo inactivo.
Esta es una formulación familiar y seguida por la mayoría de los LLM líderes en estos días, lo que permite que los modelos conserven la amplia base de conocimientos y las capacidades de razonamiento matizado de un gigante, pero a velocidades más rápidas y requisitos de computación y energía reducidos de un modelo mucho más pequeño, ya que solo una fracción de los parámetros se activa en cualquier momento.
Pero donde Cohere ha dado un paso más allá de la mayoría para Command A+ es que se ha centrado en gran medida en la eficiencia del hardware a través de la cuantización, un proceso que comprime la huella de memoria del modelo al reducir la precisión de sus parámetros.
Command A+ está disponible en formato de 16 bits (BF16), 8 bits (FP8) y 4 bits altamente comprimido (W4A4).
La cuantización W4A4 es la pieza técnica central de esta versión. Normalmente, los modelos de razonamiento sufren un enorme «impuesto de cuantificación», donde la compresión del modelo conduce a regresiones visibles en la resolución de problemas complejos.
Cohere mitigó esto cuantificando únicamente a los expertos del MoE a 4 bits, mientras mantener las vías de atención críticas con total precisión, complementado con una técnica llamada Destilación consciente de la cuantificación.
El resultado es un compresión casi sin pérdidas eso permite que este enorme modelo se ejecute en una sola GPU NVIDIA Blackwell B200 o solo dos GPU NVIDIA H100.
Las ganancias de velocidad son igualmente notables. Según los datos de rendimiento publicados por la empresa, la cuantificación W4A4 con baja concurrencia alcanza 375 tokens por segundo (TOPS) con una latencia de tiempo hasta el primer token (TTFT) de solo 113 milisegundos, lo que representa hasta un aumento del 63 % en la velocidad de salida y una reducción del 17 % en la latencia en comparación con el modelo anterior Command A Reasoning.
Además, Cohere ha revisado el tokenizador del modelo. Los tokenizadores descomponen el texto en fragmentos que procesan los modelos de IA. El nuevo tokenizador está altamente optimizado para uso empresarial global y ofrece soporte nativo para 48 idiomas.
Más importante aún, es mejora drásticamente la eficiencia de la tokenización para idiomas no europeos, reduciendo la cantidad de tokens necesarios para generar respuestas en árabe en un 20%, en japonés en un 18% y en coreano en un 16%. Debido a que los costos de inferencia se calculan por token, esto se traduce directamente en costos operativos más bajos para implementaciones globales, multilingües o en idiomas distintos del inglés.
Flujos de trabajo agentes y altos estándares en matemáticas y campos especializados.
Si bien la velocidad y el tamaño brutos dictan la implementación, la utilidad de un modelo se define por las capacidades de su producto. Command A+ se creó específicamente para tareas «agentes»: flujos de trabajo en los que la IA opera de forma autónoma o semiautónoma, utiliza herramientas externas, consulta bases de datos y sintetiza información en múltiples pasos.
Los saltos de referencia con respecto a la generación anterior son marcados.
En 𝜏²-Bench Telecom, que prueba razonamientos complejos, el modelo saltó de una puntuación del 37% al 85%. En Terminal-Bench Hard, que mide el rendimiento de la codificación agente, subió del 3% al 25%. En matemáticas complejas, obtuvo una puntuación del 90% en AIME 25, frente al 57%.
Command A+ supera su categoría de peso (25B parámetros activos) en razonamiento puro y matemáticas, compitiendo directamente con modelos mucho más grandes como DeepSeek V4 Pro en pruebas comparativas matemáticas. Sin embargo, en lo que respecta a la codificación agente profunda y la indexación general de inteligencia a gran escala, actualmente va por detrás de las últimas generaciones de rivales chinos de código abierto como búsqueda profunda, Z.ai (GLM)y minimax.
Dicho esto, compararlos directamente ignora la propuesta de valor central de Cohere: eficiencia del hardware.
Más allá de los puntos de referencia, Command A+ introduce integraciones profundas para la confianza y la verificación empresarial. El modelo admite el uso de herramientas conversacionales a través de plantillas de chat estándar, lo que permite a los desarrolladores conectarlo sin problemas a API internas, motores de búsqueda o bases de datos SQL.
Fundamentalmente, Command A+ presenta generación de citas nativa. Cuando el Comando A+ recupera información de una herramienta externa, no solo sintetiza la respuesta; genera «tramos de puesta a tierra» explícitos. Usando etiquetas especiales incrustadas en la salida, el El modelo vincula directamente cada afirmación fáctica que hace con el documento fuente específico o la fila de la base de datos. sacó la información de.
Para empresas de sectores fuertemente regulados como el financiero, el sanitario o el jurídico, esta trazabilidad marca la diferencia entre un prototipo interesante y una aplicación lista para producción. Si un usuario solicita un informe de ventas diario, el modelo generará el monto total de ventas y citará explícitamente el resultado de la consulta de la base de datos que proporcionó ese número, minimizando el riesgo de alucinaciones no detectadas.
Además, Command A+ es totalmente multimodal, capaz de procesar texto e imágenes de forma nativa dentro de su enorme ventana de contexto de entrada de 128 KB, lo que lo hace muy eficaz para el procesamiento de documentos complejos, como el análisis de facturas, gráficos o manuales técnicos escaneados.
El primer modelo Cohere AI con licencia completa de Apache 2.0
En el panorama actual de la IA, «código abierto» se ha convertido en un término complicado. Muchas empresas líderes en IA publican los pesos de sus modelos bajo licencias comerciales restrictivas o políticas de uso aceptable que prohíben explícitamente a las grandes empresas utilizar los modelos con fines comerciales, o prohíben que los modelos se utilicen para entrenar sistemas de IA competidores.
De hecho, los modelos anteriores de Cohere, incluidos Comando R y Comando R+se publicaron bajo una licencia CC-BY-NC 4.0 (Creative Commons NonCommercial). Si bien los pesos de sus modelos estaban abiertos para que los investigadores y desarrolladores los descargaran, modificaran y evaluaran, estaba estrictamente prohibido su uso con fines comerciales sin comprar una licencia empresarial separada de Cohere o pasar por su interfaz de programación de aplicaciones (API), similar a la disposición que muchas empresas utilizan para acceder a modelos de IA de OpenAI, Anthropic, Google y otros laboratorios líderes.
Cohere ha cambiado su enfoque al lanzar Command A+ bajo la licencia Apache 2.0. Esta es una distinción fundamental para la comunidad de desarrolladores. Apache 2.0 es una verdadera licencia de código abierto aprobada por OSI. Permite que cualquier persona (desde desarrolladores independientes hasta corporaciones Fortune 500) use, modifique, distribuya y comercialice el modelo sin pagar tarifas de licencia ni adherirse a cláusulas restrictivas de no competencia.
Como Gómez escribió en Xla decisión fue defendida por el cofundador de Cohere, Nick Frosst, quien publicó una descripción general de dos minutos de duración calificándolo como «el mejor modelo que jamás hayamos lanzado».
Para la empresa, esta licencia significa total independencia del proveedor. Una empresa puede descargar los pesos de Command A+, ajustarlos en datos internos altamente clasificados e implementarlos en sus propios servidores privados o redes aisladas. No están atados a la infraestructura de Cohere, a los cambios de precios ni al tiempo de actividad de la API. Es la realización definitiva de la IA soberana.
El lanzamiento tuvo una tracción inmediata en todo el ecosistema de desarrolladores de IA, impulsado en gran medida por su integración desde el primer día con los principales marcos de inferencia de código abierto como Hugging Face y vLLM.
¿Qué sigue?
El lanzamiento de Command A+ marca una maduración del ecosistema de IA de código abierto. Al combinar razonamiento de vanguardia, uso sólido de herramientas de agente y capacidades multimodales con una arquitectura diseñada específicamente para la eficiencia del hardware, Cohere está cambiando el cálculo para la adopción de la IA empresarial.
El requisito de clústeres informáticos masivos y centralizados ha sido durante mucho tiempo un cuello de botella para las empresas que priorizan la privacidad de los datos y el control de costos. Al democratizar el acceso a un modelo de este calibre bajo una verdadera licencia de código abierto, Cohere ha proporcionado al mercado empresarial exactamente lo que estaba pidiendo: el poder de la nube, capaz de ejecutarse de forma segura en la sala de servidores al final del pasillo.
Laboratorio canadiense de IA Adherirse causó sensación recientemente por anunciando una fusión con la startup alemana de IA Aleph Alphapero ahora tiene aún más reservado para los creadores de empresas de todo el mundo: hoy, la empresa cofundado por el ex empleado de Google y coautor de «Attention Is All You Need» Aidan Gomez desvelado Comando A+un modelo de lenguaje altamente optimizado de 218 mil millones de parámetros diseñado específicamente para razonamiento complejo, procesamiento de documentos multimodal y flujos de trabajo agentes.
El aspecto más significativo del lanzamiento no son sólo las capacidades del modelo; es su accesibilidad.
Al soltar los pesos del modelo libremente en el popular repositorio de código compartido de IA Hugging Face bajo un Licencia de código abierto Apache 2.0 altamente permisiva – una novedad para la empresa, según una publicación de Gómez, ahora director ejecutivo de Cohere, en X — Cohere está haciendo una apuesta calculada por la «IA soberana»: la tesis de que las empresas, los gobiernos y los desarrolladores deberían tener la capacidad de ejecutar, controlar y adaptar la IA de vanguardia completamente dentro de sus propios entornos seguros, sin sacrificar el rendimiento.
Arquitectura dispersa con cuantización extrema
A nivel arquitectónico, Command A+ representa una evolución importante con respecto a los modelos densos anteriores de Cohere. Es un transformador de mezcla dispersa de expertos (MoE) solo para decodificador.
Si bien el modelo alberga un total relativamente modesto de 218 mil millones de parámetros, aún menos (sólo 25 mil millones) están activos durante cualquier paso de generación determinado. Ocupa un espacio mucho más ligero y requiere muchos menos recursos informáticos para ejecutarse en inferencia (ofreciendo el modelo en entornos de producción a usuarios finales o a través de agentes) que los gigantes propietarios estadounidenses como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, que son estimado por observadores externos en billones de parámetros.
Esta arquitectura dispersa es la clave para la eficiencia del modelo. En términos sencillos, un modelo MoE enruta las consultas entrantes sólo a las redes neuronales «expertas» específicas que mejor se adaptan a manejarlas, dejando el resto del modelo inactivo.
Esta es una formulación familiar y seguida por la mayoría de los LLM líderes en estos días, lo que permite que los modelos conserven la amplia base de conocimientos y las capacidades de razonamiento matizado de un gigante, pero a velocidades más rápidas y requisitos de computación y energía reducidos de un modelo mucho más pequeño, ya que solo una fracción de los parámetros se activa en cualquier momento.
Pero donde Cohere ha dado un paso más allá de la mayoría para Command A+ es que se ha centrado en gran medida en la eficiencia del hardware a través de la cuantización, un proceso que comprime la huella de memoria del modelo al reducir la precisión de sus parámetros.
Command A+ está disponible en formato de 16 bits (BF16), 8 bits (FP8) y 4 bits altamente comprimido (W4A4).
La cuantización W4A4 es la pieza técnica central de esta versión. Normalmente, los modelos de razonamiento sufren un enorme «impuesto de cuantificación», donde la compresión del modelo conduce a regresiones visibles en la resolución de problemas complejos.
Cohere mitigó esto cuantificando únicamente a los expertos del MoE a 4 bits, mientras mantener las vías de atención críticas con total precisión, complementado con una técnica llamada Destilación consciente de la cuantificación.
El resultado es un compresión casi sin pérdidas eso permite que este enorme modelo se ejecute en una sola GPU NVIDIA Blackwell B200 o solo dos GPU NVIDIA H100.
Las ganancias de velocidad son igualmente notables. Según los datos de rendimiento publicados por la empresa, la cuantificación W4A4 con baja concurrencia alcanza 375 tokens por segundo (TOPS) con una latencia de tiempo hasta el primer token (TTFT) de solo 113 milisegundos, lo que representa hasta un aumento del 63 % en la velocidad de salida y una reducción del 17 % en la latencia en comparación con el modelo anterior Command A Reasoning.
Además, Cohere ha revisado el tokenizador del modelo. Los tokenizadores descomponen el texto en fragmentos que procesan los modelos de IA. El nuevo tokenizador está altamente optimizado para uso empresarial global y ofrece soporte nativo para 48 idiomas.
Más importante aún, es mejora drásticamente la eficiencia de la tokenización para idiomas no europeos, reduciendo la cantidad de tokens necesarios para generar respuestas en árabe en un 20%, en japonés en un 18% y en coreano en un 16%. Debido a que los costos de inferencia se calculan por token, esto se traduce directamente en costos operativos más bajos para implementaciones globales, multilingües o en idiomas distintos del inglés.
Flujos de trabajo agentes y altos estándares en matemáticas y campos especializados.
Si bien la velocidad y el tamaño brutos dictan la implementación, la utilidad de un modelo se define por las capacidades de su producto. Command A+ se creó específicamente para tareas «agentes»: flujos de trabajo en los que la IA opera de forma autónoma o semiautónoma, utiliza herramientas externas, consulta bases de datos y sintetiza información en múltiples pasos.
Los saltos de referencia con respecto a la generación anterior son marcados.
En 𝜏²-Bench Telecom, que prueba razonamientos complejos, el modelo saltó de una puntuación del 37% al 85%. En Terminal-Bench Hard, que mide el rendimiento de la codificación agente, subió del 3% al 25%. En matemáticas complejas, obtuvo una puntuación del 90% en AIME 25, frente al 57%.
Command A+ supera su categoría de peso (25B parámetros activos) en razonamiento puro y matemáticas, compitiendo directamente con modelos mucho más grandes como DeepSeek V4 Pro en pruebas comparativas matemáticas. Sin embargo, en lo que respecta a la codificación agente profunda y la indexación general de inteligencia a gran escala, actualmente va por detrás de las últimas generaciones de rivales chinos de código abierto como búsqueda profunda, Z.ai (GLM)y minimax.
Dicho esto, compararlos directamente ignora la propuesta de valor central de Cohere: eficiencia del hardware.
Más allá de los puntos de referencia, Command A+ introduce integraciones profundas para la confianza y la verificación empresarial. El modelo admite el uso de herramientas conversacionales a través de plantillas de chat estándar, lo que permite a los desarrolladores conectarlo sin problemas a API internas, motores de búsqueda o bases de datos SQL.
Fundamentalmente, Command A+ presenta generación de citas nativa. Cuando el Comando A+ recupera información de una herramienta externa, no solo sintetiza la respuesta; genera «tramos de puesta a tierra» explícitos. Usando etiquetas especiales incrustadas en la salida, el El modelo vincula directamente cada afirmación fáctica que hace con el documento fuente específico o la fila de la base de datos. sacó la información de.
Para empresas de sectores fuertemente regulados como el financiero, el sanitario o el jurídico, esta trazabilidad marca la diferencia entre un prototipo interesante y una aplicación lista para producción. Si un usuario solicita un informe de ventas diario, el modelo generará el monto total de ventas y citará explícitamente el resultado de la consulta de la base de datos que proporcionó ese número, minimizando el riesgo de alucinaciones no detectadas.
Además, Command A+ es totalmente multimodal, capaz de procesar texto e imágenes de forma nativa dentro de su enorme ventana de contexto de entrada de 128 KB, lo que lo hace muy eficaz para el procesamiento de documentos complejos, como el análisis de facturas, gráficos o manuales técnicos escaneados.
El primer modelo Cohere AI con licencia completa de Apache 2.0
En el panorama actual de la IA, «código abierto» se ha convertido en un término complicado. Muchas empresas líderes en IA publican los pesos de sus modelos bajo licencias comerciales restrictivas o políticas de uso aceptable que prohíben explícitamente a las grandes empresas utilizar los modelos con fines comerciales, o prohíben que los modelos se utilicen para entrenar sistemas de IA competidores.
De hecho, los modelos anteriores de Cohere, incluidos Comando R y Comando R+se publicaron bajo una licencia CC-BY-NC 4.0 (Creative Commons NonCommercial). Si bien los pesos de sus modelos estaban abiertos para que los investigadores y desarrolladores los descargaran, modificaran y evaluaran, estaba estrictamente prohibido su uso con fines comerciales sin comprar una licencia empresarial separada de Cohere o pasar por su interfaz de programación de aplicaciones (API), similar a la disposición que muchas empresas utilizan para acceder a modelos de IA de OpenAI, Anthropic, Google y otros laboratorios líderes.
Cohere ha cambiado su enfoque al lanzar Command A+ bajo la licencia Apache 2.0. Esta es una distinción fundamental para la comunidad de desarrolladores. Apache 2.0 es una verdadera licencia de código abierto aprobada por OSI. Permite que cualquier persona (desde desarrolladores independientes hasta corporaciones Fortune 500) use, modifique, distribuya y comercialice el modelo sin pagar tarifas de licencia ni adherirse a cláusulas restrictivas de no competencia.
Como Gómez escribió en Xla decisión fue defendida por el cofundador de Cohere, Nick Frosst, quien publicó una descripción general de dos minutos de duración calificándolo como «el mejor modelo que jamás hayamos lanzado».
Para la empresa, esta licencia significa total independencia del proveedor. Una empresa puede descargar los pesos de Command A+, ajustarlos en datos internos altamente clasificados e implementarlos en sus propios servidores privados o redes aisladas. No están atados a la infraestructura de Cohere, a los cambios de precios ni al tiempo de actividad de la API. Es la realización definitiva de la IA soberana.
El lanzamiento tuvo una tracción inmediata en todo el ecosistema de desarrolladores de IA, impulsado en gran medida por su integración desde el primer día con los principales marcos de inferencia de código abierto como Hugging Face y vLLM.
¿Qué sigue?
El lanzamiento de Command A+ marca una maduración del ecosistema de IA de código abierto. Al combinar razonamiento de vanguardia, uso sólido de herramientas de agente y capacidades multimodales con una arquitectura diseñada específicamente para la eficiencia del hardware, Cohere está cambiando el cálculo para la adopción de la IA empresarial.
El requisito de clústeres informáticos masivos y centralizados ha sido durante mucho tiempo un cuello de botella para las empresas que priorizan la privacidad de los datos y el control de costos. Al democratizar el acceso a un modelo de este calibre bajo una verdadera licencia de código abierto, Cohere ha proporcionado al mercado empresarial exactamente lo que estaba pidiendo: el poder de la nube, capaz de ejecutarse de forma segura en la sala de servidores al final del pasillo.
Laboratorio canadiense de IA Adherirse causó sensación recientemente por anunciando una fusión con la startup alemana de IA Aleph Alphapero ahora tiene aún más reservado para los creadores de empresas de todo el mundo: hoy, la empresa cofundado por el ex empleado de Google y coautor de «Attention Is All You Need» Aidan Gomez desvelado Comando A+un modelo de lenguaje altamente optimizado de 218 mil millones de parámetros diseñado específicamente para razonamiento complejo, procesamiento de documentos multimodal y flujos de trabajo agentes.
El aspecto más significativo del lanzamiento no son sólo las capacidades del modelo; es su accesibilidad.
Al soltar los pesos del modelo libremente en el popular repositorio de código compartido de IA Hugging Face bajo un Licencia de código abierto Apache 2.0 altamente permisiva – una novedad para la empresa, según una publicación de Gómez, ahora director ejecutivo de Cohere, en X — Cohere está haciendo una apuesta calculada por la «IA soberana»: la tesis de que las empresas, los gobiernos y los desarrolladores deberían tener la capacidad de ejecutar, controlar y adaptar la IA de vanguardia completamente dentro de sus propios entornos seguros, sin sacrificar el rendimiento.
Arquitectura dispersa con cuantización extrema
A nivel arquitectónico, Command A+ representa una evolución importante con respecto a los modelos densos anteriores de Cohere. Es un transformador de mezcla dispersa de expertos (MoE) solo para decodificador.
Si bien el modelo alberga un total relativamente modesto de 218 mil millones de parámetros, aún menos (sólo 25 mil millones) están activos durante cualquier paso de generación determinado. Ocupa un espacio mucho más ligero y requiere muchos menos recursos informáticos para ejecutarse en inferencia (ofreciendo el modelo en entornos de producción a usuarios finales o a través de agentes) que los gigantes propietarios estadounidenses como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, que son estimado por observadores externos en billones de parámetros.
Esta arquitectura dispersa es la clave para la eficiencia del modelo. En términos sencillos, un modelo MoE enruta las consultas entrantes sólo a las redes neuronales «expertas» específicas que mejor se adaptan a manejarlas, dejando el resto del modelo inactivo.
Esta es una formulación familiar y seguida por la mayoría de los LLM líderes en estos días, lo que permite que los modelos conserven la amplia base de conocimientos y las capacidades de razonamiento matizado de un gigante, pero a velocidades más rápidas y requisitos de computación y energía reducidos de un modelo mucho más pequeño, ya que solo una fracción de los parámetros se activa en cualquier momento.
Pero donde Cohere ha dado un paso más allá de la mayoría para Command A+ es que se ha centrado en gran medida en la eficiencia del hardware a través de la cuantización, un proceso que comprime la huella de memoria del modelo al reducir la precisión de sus parámetros.
Command A+ está disponible en formato de 16 bits (BF16), 8 bits (FP8) y 4 bits altamente comprimido (W4A4).
La cuantización W4A4 es la pieza técnica central de esta versión. Normalmente, los modelos de razonamiento sufren un enorme «impuesto de cuantificación», donde la compresión del modelo conduce a regresiones visibles en la resolución de problemas complejos.
Cohere mitigó esto cuantificando únicamente a los expertos del MoE a 4 bits, mientras mantener las vías de atención críticas con total precisión, complementado con una técnica llamada Destilación consciente de la cuantificación.
El resultado es un compresión casi sin pérdidas eso permite que este enorme modelo se ejecute en una sola GPU NVIDIA Blackwell B200 o solo dos GPU NVIDIA H100.
Las ganancias de velocidad son igualmente notables. Según los datos de rendimiento publicados por la empresa, la cuantificación W4A4 con baja concurrencia alcanza 375 tokens por segundo (TOPS) con una latencia de tiempo hasta el primer token (TTFT) de solo 113 milisegundos, lo que representa hasta un aumento del 63 % en la velocidad de salida y una reducción del 17 % en la latencia en comparación con el modelo anterior Command A Reasoning.
Además, Cohere ha revisado el tokenizador del modelo. Los tokenizadores descomponen el texto en fragmentos que procesan los modelos de IA. El nuevo tokenizador está altamente optimizado para uso empresarial global y ofrece soporte nativo para 48 idiomas.
Más importante aún, es mejora drásticamente la eficiencia de la tokenización para idiomas no europeos, reduciendo la cantidad de tokens necesarios para generar respuestas en árabe en un 20%, en japonés en un 18% y en coreano en un 16%. Debido a que los costos de inferencia se calculan por token, esto se traduce directamente en costos operativos más bajos para implementaciones globales, multilingües o en idiomas distintos del inglés.
Flujos de trabajo agentes y altos estándares en matemáticas y campos especializados.
Si bien la velocidad y el tamaño brutos dictan la implementación, la utilidad de un modelo se define por las capacidades de su producto. Command A+ se creó específicamente para tareas «agentes»: flujos de trabajo en los que la IA opera de forma autónoma o semiautónoma, utiliza herramientas externas, consulta bases de datos y sintetiza información en múltiples pasos.
Los saltos de referencia con respecto a la generación anterior son marcados.
En 𝜏²-Bench Telecom, que prueba razonamientos complejos, el modelo saltó de una puntuación del 37% al 85%. En Terminal-Bench Hard, que mide el rendimiento de la codificación agente, subió del 3% al 25%. En matemáticas complejas, obtuvo una puntuación del 90% en AIME 25, frente al 57%.
Command A+ supera su categoría de peso (25B parámetros activos) en razonamiento puro y matemáticas, compitiendo directamente con modelos mucho más grandes como DeepSeek V4 Pro en pruebas comparativas matemáticas. Sin embargo, en lo que respecta a la codificación agente profunda y la indexación general de inteligencia a gran escala, actualmente va por detrás de las últimas generaciones de rivales chinos de código abierto como búsqueda profunda, Z.ai (GLM)y minimax.
Dicho esto, compararlos directamente ignora la propuesta de valor central de Cohere: eficiencia del hardware.
Más allá de los puntos de referencia, Command A+ introduce integraciones profundas para la confianza y la verificación empresarial. El modelo admite el uso de herramientas conversacionales a través de plantillas de chat estándar, lo que permite a los desarrolladores conectarlo sin problemas a API internas, motores de búsqueda o bases de datos SQL.
Fundamentalmente, Command A+ presenta generación de citas nativa. Cuando el Comando A+ recupera información de una herramienta externa, no solo sintetiza la respuesta; genera «tramos de puesta a tierra» explícitos. Usando etiquetas especiales incrustadas en la salida, el El modelo vincula directamente cada afirmación fáctica que hace con el documento fuente específico o la fila de la base de datos. sacó la información de.
Para empresas de sectores fuertemente regulados como el financiero, el sanitario o el jurídico, esta trazabilidad marca la diferencia entre un prototipo interesante y una aplicación lista para producción. Si un usuario solicita un informe de ventas diario, el modelo generará el monto total de ventas y citará explícitamente el resultado de la consulta de la base de datos que proporcionó ese número, minimizando el riesgo de alucinaciones no detectadas.
Además, Command A+ es totalmente multimodal, capaz de procesar texto e imágenes de forma nativa dentro de su enorme ventana de contexto de entrada de 128 KB, lo que lo hace muy eficaz para el procesamiento de documentos complejos, como el análisis de facturas, gráficos o manuales técnicos escaneados.
El primer modelo Cohere AI con licencia completa de Apache 2.0
En el panorama actual de la IA, «código abierto» se ha convertido en un término complicado. Muchas empresas líderes en IA publican los pesos de sus modelos bajo licencias comerciales restrictivas o políticas de uso aceptable que prohíben explícitamente a las grandes empresas utilizar los modelos con fines comerciales, o prohíben que los modelos se utilicen para entrenar sistemas de IA competidores.
De hecho, los modelos anteriores de Cohere, incluidos Comando R y Comando R+se publicaron bajo una licencia CC-BY-NC 4.0 (Creative Commons NonCommercial). Si bien los pesos de sus modelos estaban abiertos para que los investigadores y desarrolladores los descargaran, modificaran y evaluaran, estaba estrictamente prohibido su uso con fines comerciales sin comprar una licencia empresarial separada de Cohere o pasar por su interfaz de programación de aplicaciones (API), similar a la disposición que muchas empresas utilizan para acceder a modelos de IA de OpenAI, Anthropic, Google y otros laboratorios líderes.
Cohere ha cambiado su enfoque al lanzar Command A+ bajo la licencia Apache 2.0. Esta es una distinción fundamental para la comunidad de desarrolladores. Apache 2.0 es una verdadera licencia de código abierto aprobada por OSI. Permite que cualquier persona (desde desarrolladores independientes hasta corporaciones Fortune 500) use, modifique, distribuya y comercialice el modelo sin pagar tarifas de licencia ni adherirse a cláusulas restrictivas de no competencia.
Como Gómez escribió en Xla decisión fue defendida por el cofundador de Cohere, Nick Frosst, quien publicó una descripción general de dos minutos de duración calificándolo como «el mejor modelo que jamás hayamos lanzado».
Para la empresa, esta licencia significa total independencia del proveedor. Una empresa puede descargar los pesos de Command A+, ajustarlos en datos internos altamente clasificados e implementarlos en sus propios servidores privados o redes aisladas. No están atados a la infraestructura de Cohere, a los cambios de precios ni al tiempo de actividad de la API. Es la realización definitiva de la IA soberana.
El lanzamiento tuvo una tracción inmediata en todo el ecosistema de desarrolladores de IA, impulsado en gran medida por su integración desde el primer día con los principales marcos de inferencia de código abierto como Hugging Face y vLLM.
¿Qué sigue?
El lanzamiento de Command A+ marca una maduración del ecosistema de IA de código abierto. Al combinar razonamiento de vanguardia, uso sólido de herramientas de agente y capacidades multimodales con una arquitectura diseñada específicamente para la eficiencia del hardware, Cohere está cambiando el cálculo para la adopción de la IA empresarial.
El requisito de clústeres informáticos masivos y centralizados ha sido durante mucho tiempo un cuello de botella para las empresas que priorizan la privacidad de los datos y el control de costos. Al democratizar el acceso a un modelo de este calibre bajo una verdadera licencia de código abierto, Cohere ha proporcionado al mercado empresarial exactamente lo que estaba pidiendo: el poder de la nube, capaz de ejecutarse de forma segura en la sala de servidores al final del pasillo.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Laboratorio canadiense de IA Adherirse causó sensación recientemente por anunciando una fusión con la startup alemana de IA Aleph Alphapero ahora tiene aún más reservado para los creadores de empresas de todo el mundo: hoy, la empresa cofundado por el ex empleado de Google y coautor de «Attention Is All You Need» Aidan Gomez desvelado Comando A+un modelo de lenguaje altamente optimizado de 218 mil millones de parámetros diseñado específicamente para razonamiento complejo, procesamiento de documentos multimodal y flujos de trabajo agentes.
El aspecto más significativo del lanzamiento no son sólo las capacidades del modelo; es su accesibilidad.
Al soltar los pesos del modelo libremente en el popular repositorio de código compartido de IA Hugging Face bajo un Licencia de código abierto Apache 2.0 altamente permisiva – una novedad para la empresa, según una publicación de Gómez, ahora director ejecutivo de Cohere, en X — Cohere está haciendo una apuesta calculada por la «IA soberana»: la tesis de que las empresas, los gobiernos y los desarrolladores deberían tener la capacidad de ejecutar, controlar y adaptar la IA de vanguardia completamente dentro de sus propios entornos seguros, sin sacrificar el rendimiento.
Arquitectura dispersa con cuantización extrema
A nivel arquitectónico, Command A+ representa una evolución importante con respecto a los modelos densos anteriores de Cohere. Es un transformador de mezcla dispersa de expertos (MoE) solo para decodificador.
Si bien el modelo alberga un total relativamente modesto de 218 mil millones de parámetros, aún menos (sólo 25 mil millones) están activos durante cualquier paso de generación determinado. Ocupa un espacio mucho más ligero y requiere muchos menos recursos informáticos para ejecutarse en inferencia (ofreciendo el modelo en entornos de producción a usuarios finales o a través de agentes) que los gigantes propietarios estadounidenses como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, que son estimado por observadores externos en billones de parámetros.
Esta arquitectura dispersa es la clave para la eficiencia del modelo. En términos sencillos, un modelo MoE enruta las consultas entrantes sólo a las redes neuronales «expertas» específicas que mejor se adaptan a manejarlas, dejando el resto del modelo inactivo.
Esta es una formulación familiar y seguida por la mayoría de los LLM líderes en estos días, lo que permite que los modelos conserven la amplia base de conocimientos y las capacidades de razonamiento matizado de un gigante, pero a velocidades más rápidas y requisitos de computación y energía reducidos de un modelo mucho más pequeño, ya que solo una fracción de los parámetros se activa en cualquier momento.
Pero donde Cohere ha dado un paso más allá de la mayoría para Command A+ es que se ha centrado en gran medida en la eficiencia del hardware a través de la cuantización, un proceso que comprime la huella de memoria del modelo al reducir la precisión de sus parámetros.
Command A+ está disponible en formato de 16 bits (BF16), 8 bits (FP8) y 4 bits altamente comprimido (W4A4).
La cuantización W4A4 es la pieza técnica central de esta versión. Normalmente, los modelos de razonamiento sufren un enorme «impuesto de cuantificación», donde la compresión del modelo conduce a regresiones visibles en la resolución de problemas complejos.
Cohere mitigó esto cuantificando únicamente a los expertos del MoE a 4 bits, mientras mantener las vías de atención críticas con total precisión, complementado con una técnica llamada Destilación consciente de la cuantificación.
El resultado es un compresión casi sin pérdidas eso permite que este enorme modelo se ejecute en una sola GPU NVIDIA Blackwell B200 o solo dos GPU NVIDIA H100.
Las ganancias de velocidad son igualmente notables. Según los datos de rendimiento publicados por la empresa, la cuantificación W4A4 con baja concurrencia alcanza 375 tokens por segundo (TOPS) con una latencia de tiempo hasta el primer token (TTFT) de solo 113 milisegundos, lo que representa hasta un aumento del 63 % en la velocidad de salida y una reducción del 17 % en la latencia en comparación con el modelo anterior Command A Reasoning.
Además, Cohere ha revisado el tokenizador del modelo. Los tokenizadores descomponen el texto en fragmentos que procesan los modelos de IA. El nuevo tokenizador está altamente optimizado para uso empresarial global y ofrece soporte nativo para 48 idiomas.
Más importante aún, es mejora drásticamente la eficiencia de la tokenización para idiomas no europeos, reduciendo la cantidad de tokens necesarios para generar respuestas en árabe en un 20%, en japonés en un 18% y en coreano en un 16%. Debido a que los costos de inferencia se calculan por token, esto se traduce directamente en costos operativos más bajos para implementaciones globales, multilingües o en idiomas distintos del inglés.
Flujos de trabajo agentes y altos estándares en matemáticas y campos especializados.
Si bien la velocidad y el tamaño brutos dictan la implementación, la utilidad de un modelo se define por las capacidades de su producto. Command A+ se creó específicamente para tareas «agentes»: flujos de trabajo en los que la IA opera de forma autónoma o semiautónoma, utiliza herramientas externas, consulta bases de datos y sintetiza información en múltiples pasos.
Los saltos de referencia con respecto a la generación anterior son marcados.
En 𝜏²-Bench Telecom, que prueba razonamientos complejos, el modelo saltó de una puntuación del 37% al 85%. En Terminal-Bench Hard, que mide el rendimiento de la codificación agente, subió del 3% al 25%. En matemáticas complejas, obtuvo una puntuación del 90% en AIME 25, frente al 57%.
Command A+ supera su categoría de peso (25B parámetros activos) en razonamiento puro y matemáticas, compitiendo directamente con modelos mucho más grandes como DeepSeek V4 Pro en pruebas comparativas matemáticas. Sin embargo, en lo que respecta a la codificación agente profunda y la indexación general de inteligencia a gran escala, actualmente va por detrás de las últimas generaciones de rivales chinos de código abierto como búsqueda profunda, Z.ai (GLM)y minimax.
Dicho esto, compararlos directamente ignora la propuesta de valor central de Cohere: eficiencia del hardware.
Más allá de los puntos de referencia, Command A+ introduce integraciones profundas para la confianza y la verificación empresarial. El modelo admite el uso de herramientas conversacionales a través de plantillas de chat estándar, lo que permite a los desarrolladores conectarlo sin problemas a API internas, motores de búsqueda o bases de datos SQL.
Fundamentalmente, Command A+ presenta generación de citas nativa. Cuando el Comando A+ recupera información de una herramienta externa, no solo sintetiza la respuesta; genera «tramos de puesta a tierra» explícitos. Usando etiquetas especiales incrustadas en la salida, el El modelo vincula directamente cada afirmación fáctica que hace con el documento fuente específico o la fila de la base de datos. sacó la información de.
Para empresas de sectores fuertemente regulados como el financiero, el sanitario o el jurídico, esta trazabilidad marca la diferencia entre un prototipo interesante y una aplicación lista para producción. Si un usuario solicita un informe de ventas diario, el modelo generará el monto total de ventas y citará explícitamente el resultado de la consulta de la base de datos que proporcionó ese número, minimizando el riesgo de alucinaciones no detectadas.
Además, Command A+ es totalmente multimodal, capaz de procesar texto e imágenes de forma nativa dentro de su enorme ventana de contexto de entrada de 128 KB, lo que lo hace muy eficaz para el procesamiento de documentos complejos, como el análisis de facturas, gráficos o manuales técnicos escaneados.
El primer modelo Cohere AI con licencia completa de Apache 2.0
En el panorama actual de la IA, «código abierto» se ha convertido en un término complicado. Muchas empresas líderes en IA publican los pesos de sus modelos bajo licencias comerciales restrictivas o políticas de uso aceptable que prohíben explícitamente a las grandes empresas utilizar los modelos con fines comerciales, o prohíben que los modelos se utilicen para entrenar sistemas de IA competidores.
De hecho, los modelos anteriores de Cohere, incluidos Comando R y Comando R+se publicaron bajo una licencia CC-BY-NC 4.0 (Creative Commons NonCommercial). Si bien los pesos de sus modelos estaban abiertos para que los investigadores y desarrolladores los descargaran, modificaran y evaluaran, estaba estrictamente prohibido su uso con fines comerciales sin comprar una licencia empresarial separada de Cohere o pasar por su interfaz de programación de aplicaciones (API), similar a la disposición que muchas empresas utilizan para acceder a modelos de IA de OpenAI, Anthropic, Google y otros laboratorios líderes.
Cohere ha cambiado su enfoque al lanzar Command A+ bajo la licencia Apache 2.0. Esta es una distinción fundamental para la comunidad de desarrolladores. Apache 2.0 es una verdadera licencia de código abierto aprobada por OSI. Permite que cualquier persona (desde desarrolladores independientes hasta corporaciones Fortune 500) use, modifique, distribuya y comercialice el modelo sin pagar tarifas de licencia ni adherirse a cláusulas restrictivas de no competencia.
Como Gómez escribió en Xla decisión fue defendida por el cofundador de Cohere, Nick Frosst, quien publicó una descripción general de dos minutos de duración calificándolo como «el mejor modelo que jamás hayamos lanzado».
Para la empresa, esta licencia significa total independencia del proveedor. Una empresa puede descargar los pesos de Command A+, ajustarlos en datos internos altamente clasificados e implementarlos en sus propios servidores privados o redes aisladas. No están atados a la infraestructura de Cohere, a los cambios de precios ni al tiempo de actividad de la API. Es la realización definitiva de la IA soberana.
El lanzamiento tuvo una tracción inmediata en todo el ecosistema de desarrolladores de IA, impulsado en gran medida por su integración desde el primer día con los principales marcos de inferencia de código abierto como Hugging Face y vLLM.
¿Qué sigue?
El lanzamiento de Command A+ marca una maduración del ecosistema de IA de código abierto. Al combinar razonamiento de vanguardia, uso sólido de herramientas de agente y capacidades multimodales con una arquitectura diseñada específicamente para la eficiencia del hardware, Cohere está cambiando el cálculo para la adopción de la IA empresarial.
El requisito de clústeres informáticos masivos y centralizados ha sido durante mucho tiempo un cuello de botella para las empresas que priorizan la privacidad de los datos y el control de costos. Al democratizar el acceso a un modelo de este calibre bajo una verdadera licencia de código abierto, Cohere ha proporcionado al mercado empresarial exactamente lo que estaba pidiendo: el poder de la nube, capaz de ejecutarse de forma segura en la sala de servidores al final del pasillo.
Laboratorio canadiense de IA Adherirse causó sensación recientemente por anunciando una fusión con la startup alemana de IA Aleph Alphapero ahora tiene aún más reservado para los creadores de empresas de todo el mundo: hoy, la empresa cofundado por el ex empleado de Google y coautor de «Attention Is All You Need» Aidan Gomez desvelado Comando A+un modelo de lenguaje altamente optimizado de 218 mil millones de parámetros diseñado específicamente para razonamiento complejo, procesamiento de documentos multimodal y flujos de trabajo agentes.
El aspecto más significativo del lanzamiento no son sólo las capacidades del modelo; es su accesibilidad.
Al soltar los pesos del modelo libremente en el popular repositorio de código compartido de IA Hugging Face bajo un Licencia de código abierto Apache 2.0 altamente permisiva – una novedad para la empresa, según una publicación de Gómez, ahora director ejecutivo de Cohere, en X — Cohere está haciendo una apuesta calculada por la «IA soberana»: la tesis de que las empresas, los gobiernos y los desarrolladores deberían tener la capacidad de ejecutar, controlar y adaptar la IA de vanguardia completamente dentro de sus propios entornos seguros, sin sacrificar el rendimiento.
Arquitectura dispersa con cuantización extrema
A nivel arquitectónico, Command A+ representa una evolución importante con respecto a los modelos densos anteriores de Cohere. Es un transformador de mezcla dispersa de expertos (MoE) solo para decodificador.
Si bien el modelo alberga un total relativamente modesto de 218 mil millones de parámetros, aún menos (sólo 25 mil millones) están activos durante cualquier paso de generación determinado. Ocupa un espacio mucho más ligero y requiere muchos menos recursos informáticos para ejecutarse en inferencia (ofreciendo el modelo en entornos de producción a usuarios finales o a través de agentes) que los gigantes propietarios estadounidenses como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, que son estimado por observadores externos en billones de parámetros.
Esta arquitectura dispersa es la clave para la eficiencia del modelo. En términos sencillos, un modelo MoE enruta las consultas entrantes sólo a las redes neuronales «expertas» específicas que mejor se adaptan a manejarlas, dejando el resto del modelo inactivo.
Esta es una formulación familiar y seguida por la mayoría de los LLM líderes en estos días, lo que permite que los modelos conserven la amplia base de conocimientos y las capacidades de razonamiento matizado de un gigante, pero a velocidades más rápidas y requisitos de computación y energía reducidos de un modelo mucho más pequeño, ya que solo una fracción de los parámetros se activa en cualquier momento.
Pero donde Cohere ha dado un paso más allá de la mayoría para Command A+ es que se ha centrado en gran medida en la eficiencia del hardware a través de la cuantización, un proceso que comprime la huella de memoria del modelo al reducir la precisión de sus parámetros.
Command A+ está disponible en formato de 16 bits (BF16), 8 bits (FP8) y 4 bits altamente comprimido (W4A4).
La cuantización W4A4 es la pieza técnica central de esta versión. Normalmente, los modelos de razonamiento sufren un enorme «impuesto de cuantificación», donde la compresión del modelo conduce a regresiones visibles en la resolución de problemas complejos.
Cohere mitigó esto cuantificando únicamente a los expertos del MoE a 4 bits, mientras mantener las vías de atención críticas con total precisión, complementado con una técnica llamada Destilación consciente de la cuantificación.
El resultado es un compresión casi sin pérdidas eso permite que este enorme modelo se ejecute en una sola GPU NVIDIA Blackwell B200 o solo dos GPU NVIDIA H100.
Las ganancias de velocidad son igualmente notables. Según los datos de rendimiento publicados por la empresa, la cuantificación W4A4 con baja concurrencia alcanza 375 tokens por segundo (TOPS) con una latencia de tiempo hasta el primer token (TTFT) de solo 113 milisegundos, lo que representa hasta un aumento del 63 % en la velocidad de salida y una reducción del 17 % en la latencia en comparación con el modelo anterior Command A Reasoning.
Además, Cohere ha revisado el tokenizador del modelo. Los tokenizadores descomponen el texto en fragmentos que procesan los modelos de IA. El nuevo tokenizador está altamente optimizado para uso empresarial global y ofrece soporte nativo para 48 idiomas.
Más importante aún, es mejora drásticamente la eficiencia de la tokenización para idiomas no europeos, reduciendo la cantidad de tokens necesarios para generar respuestas en árabe en un 20%, en japonés en un 18% y en coreano en un 16%. Debido a que los costos de inferencia se calculan por token, esto se traduce directamente en costos operativos más bajos para implementaciones globales, multilingües o en idiomas distintos del inglés.
Flujos de trabajo agentes y altos estándares en matemáticas y campos especializados.
Si bien la velocidad y el tamaño brutos dictan la implementación, la utilidad de un modelo se define por las capacidades de su producto. Command A+ se creó específicamente para tareas «agentes»: flujos de trabajo en los que la IA opera de forma autónoma o semiautónoma, utiliza herramientas externas, consulta bases de datos y sintetiza información en múltiples pasos.
Los saltos de referencia con respecto a la generación anterior son marcados.
En 𝜏²-Bench Telecom, que prueba razonamientos complejos, el modelo saltó de una puntuación del 37% al 85%. En Terminal-Bench Hard, que mide el rendimiento de la codificación agente, subió del 3% al 25%. En matemáticas complejas, obtuvo una puntuación del 90% en AIME 25, frente al 57%.
Command A+ supera su categoría de peso (25B parámetros activos) en razonamiento puro y matemáticas, compitiendo directamente con modelos mucho más grandes como DeepSeek V4 Pro en pruebas comparativas matemáticas. Sin embargo, en lo que respecta a la codificación agente profunda y la indexación general de inteligencia a gran escala, actualmente va por detrás de las últimas generaciones de rivales chinos de código abierto como búsqueda profunda, Z.ai (GLM)y minimax.
Dicho esto, compararlos directamente ignora la propuesta de valor central de Cohere: eficiencia del hardware.
Más allá de los puntos de referencia, Command A+ introduce integraciones profundas para la confianza y la verificación empresarial. El modelo admite el uso de herramientas conversacionales a través de plantillas de chat estándar, lo que permite a los desarrolladores conectarlo sin problemas a API internas, motores de búsqueda o bases de datos SQL.
Fundamentalmente, Command A+ presenta generación de citas nativa. Cuando el Comando A+ recupera información de una herramienta externa, no solo sintetiza la respuesta; genera «tramos de puesta a tierra» explícitos. Usando etiquetas especiales incrustadas en la salida, el El modelo vincula directamente cada afirmación fáctica que hace con el documento fuente específico o la fila de la base de datos. sacó la información de.
Para empresas de sectores fuertemente regulados como el financiero, el sanitario o el jurídico, esta trazabilidad marca la diferencia entre un prototipo interesante y una aplicación lista para producción. Si un usuario solicita un informe de ventas diario, el modelo generará el monto total de ventas y citará explícitamente el resultado de la consulta de la base de datos que proporcionó ese número, minimizando el riesgo de alucinaciones no detectadas.
Además, Command A+ es totalmente multimodal, capaz de procesar texto e imágenes de forma nativa dentro de su enorme ventana de contexto de entrada de 128 KB, lo que lo hace muy eficaz para el procesamiento de documentos complejos, como el análisis de facturas, gráficos o manuales técnicos escaneados.
El primer modelo Cohere AI con licencia completa de Apache 2.0
En el panorama actual de la IA, «código abierto» se ha convertido en un término complicado. Muchas empresas líderes en IA publican los pesos de sus modelos bajo licencias comerciales restrictivas o políticas de uso aceptable que prohíben explícitamente a las grandes empresas utilizar los modelos con fines comerciales, o prohíben que los modelos se utilicen para entrenar sistemas de IA competidores.
De hecho, los modelos anteriores de Cohere, incluidos Comando R y Comando R+se publicaron bajo una licencia CC-BY-NC 4.0 (Creative Commons NonCommercial). Si bien los pesos de sus modelos estaban abiertos para que los investigadores y desarrolladores los descargaran, modificaran y evaluaran, estaba estrictamente prohibido su uso con fines comerciales sin comprar una licencia empresarial separada de Cohere o pasar por su interfaz de programación de aplicaciones (API), similar a la disposición que muchas empresas utilizan para acceder a modelos de IA de OpenAI, Anthropic, Google y otros laboratorios líderes.
Cohere ha cambiado su enfoque al lanzar Command A+ bajo la licencia Apache 2.0. Esta es una distinción fundamental para la comunidad de desarrolladores. Apache 2.0 es una verdadera licencia de código abierto aprobada por OSI. Permite que cualquier persona (desde desarrolladores independientes hasta corporaciones Fortune 500) use, modifique, distribuya y comercialice el modelo sin pagar tarifas de licencia ni adherirse a cláusulas restrictivas de no competencia.
Como Gómez escribió en Xla decisión fue defendida por el cofundador de Cohere, Nick Frosst, quien publicó una descripción general de dos minutos de duración calificándolo como «el mejor modelo que jamás hayamos lanzado».
Para la empresa, esta licencia significa total independencia del proveedor. Una empresa puede descargar los pesos de Command A+, ajustarlos en datos internos altamente clasificados e implementarlos en sus propios servidores privados o redes aisladas. No están atados a la infraestructura de Cohere, a los cambios de precios ni al tiempo de actividad de la API. Es la realización definitiva de la IA soberana.
El lanzamiento tuvo una tracción inmediata en todo el ecosistema de desarrolladores de IA, impulsado en gran medida por su integración desde el primer día con los principales marcos de inferencia de código abierto como Hugging Face y vLLM.
¿Qué sigue?
El lanzamiento de Command A+ marca una maduración del ecosistema de IA de código abierto. Al combinar razonamiento de vanguardia, uso sólido de herramientas de agente y capacidades multimodales con una arquitectura diseñada específicamente para la eficiencia del hardware, Cohere está cambiando el cálculo para la adopción de la IA empresarial.
El requisito de clústeres informáticos masivos y centralizados ha sido durante mucho tiempo un cuello de botella para las empresas que priorizan la privacidad de los datos y el control de costos. Al democratizar el acceso a un modelo de este calibre bajo una verdadera licencia de código abierto, Cohere ha proporcionado al mercado empresarial exactamente lo que estaba pidiendo: el poder de la nube, capaz de ejecutarse de forma segura en la sala de servidores al final del pasillo.
Laboratorio canadiense de IA Adherirse causó sensación recientemente por anunciando una fusión con la startup alemana de IA Aleph Alphapero ahora tiene aún más reservado para los creadores de empresas de todo el mundo: hoy, la empresa cofundado por el ex empleado de Google y coautor de «Attention Is All You Need» Aidan Gomez desvelado Comando A+un modelo de lenguaje altamente optimizado de 218 mil millones de parámetros diseñado específicamente para razonamiento complejo, procesamiento de documentos multimodal y flujos de trabajo agentes.
El aspecto más significativo del lanzamiento no son sólo las capacidades del modelo; es su accesibilidad.
Al soltar los pesos del modelo libremente en el popular repositorio de código compartido de IA Hugging Face bajo un Licencia de código abierto Apache 2.0 altamente permisiva – una novedad para la empresa, según una publicación de Gómez, ahora director ejecutivo de Cohere, en X — Cohere está haciendo una apuesta calculada por la «IA soberana»: la tesis de que las empresas, los gobiernos y los desarrolladores deberían tener la capacidad de ejecutar, controlar y adaptar la IA de vanguardia completamente dentro de sus propios entornos seguros, sin sacrificar el rendimiento.
Arquitectura dispersa con cuantización extrema
A nivel arquitectónico, Command A+ representa una evolución importante con respecto a los modelos densos anteriores de Cohere. Es un transformador de mezcla dispersa de expertos (MoE) solo para decodificador.
Si bien el modelo alberga un total relativamente modesto de 218 mil millones de parámetros, aún menos (sólo 25 mil millones) están activos durante cualquier paso de generación determinado. Ocupa un espacio mucho más ligero y requiere muchos menos recursos informáticos para ejecutarse en inferencia (ofreciendo el modelo en entornos de producción a usuarios finales o a través de agentes) que los gigantes propietarios estadounidenses como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, que son estimado por observadores externos en billones de parámetros.
Esta arquitectura dispersa es la clave para la eficiencia del modelo. En términos sencillos, un modelo MoE enruta las consultas entrantes sólo a las redes neuronales «expertas» específicas que mejor se adaptan a manejarlas, dejando el resto del modelo inactivo.
Esta es una formulación familiar y seguida por la mayoría de los LLM líderes en estos días, lo que permite que los modelos conserven la amplia base de conocimientos y las capacidades de razonamiento matizado de un gigante, pero a velocidades más rápidas y requisitos de computación y energía reducidos de un modelo mucho más pequeño, ya que solo una fracción de los parámetros se activa en cualquier momento.
Pero donde Cohere ha dado un paso más allá de la mayoría para Command A+ es que se ha centrado en gran medida en la eficiencia del hardware a través de la cuantización, un proceso que comprime la huella de memoria del modelo al reducir la precisión de sus parámetros.
Command A+ está disponible en formato de 16 bits (BF16), 8 bits (FP8) y 4 bits altamente comprimido (W4A4).
La cuantización W4A4 es la pieza técnica central de esta versión. Normalmente, los modelos de razonamiento sufren un enorme «impuesto de cuantificación», donde la compresión del modelo conduce a regresiones visibles en la resolución de problemas complejos.
Cohere mitigó esto cuantificando únicamente a los expertos del MoE a 4 bits, mientras mantener las vías de atención críticas con total precisión, complementado con una técnica llamada Destilación consciente de la cuantificación.
El resultado es un compresión casi sin pérdidas eso permite que este enorme modelo se ejecute en una sola GPU NVIDIA Blackwell B200 o solo dos GPU NVIDIA H100.
Las ganancias de velocidad son igualmente notables. Según los datos de rendimiento publicados por la empresa, la cuantificación W4A4 con baja concurrencia alcanza 375 tokens por segundo (TOPS) con una latencia de tiempo hasta el primer token (TTFT) de solo 113 milisegundos, lo que representa hasta un aumento del 63 % en la velocidad de salida y una reducción del 17 % en la latencia en comparación con el modelo anterior Command A Reasoning.
Además, Cohere ha revisado el tokenizador del modelo. Los tokenizadores descomponen el texto en fragmentos que procesan los modelos de IA. El nuevo tokenizador está altamente optimizado para uso empresarial global y ofrece soporte nativo para 48 idiomas.
Más importante aún, es mejora drásticamente la eficiencia de la tokenización para idiomas no europeos, reduciendo la cantidad de tokens necesarios para generar respuestas en árabe en un 20%, en japonés en un 18% y en coreano en un 16%. Debido a que los costos de inferencia se calculan por token, esto se traduce directamente en costos operativos más bajos para implementaciones globales, multilingües o en idiomas distintos del inglés.
Flujos de trabajo agentes y altos estándares en matemáticas y campos especializados.
Si bien la velocidad y el tamaño brutos dictan la implementación, la utilidad de un modelo se define por las capacidades de su producto. Command A+ se creó específicamente para tareas «agentes»: flujos de trabajo en los que la IA opera de forma autónoma o semiautónoma, utiliza herramientas externas, consulta bases de datos y sintetiza información en múltiples pasos.
Los saltos de referencia con respecto a la generación anterior son marcados.
En 𝜏²-Bench Telecom, que prueba razonamientos complejos, el modelo saltó de una puntuación del 37% al 85%. En Terminal-Bench Hard, que mide el rendimiento de la codificación agente, subió del 3% al 25%. En matemáticas complejas, obtuvo una puntuación del 90% en AIME 25, frente al 57%.
Command A+ supera su categoría de peso (25B parámetros activos) en razonamiento puro y matemáticas, compitiendo directamente con modelos mucho más grandes como DeepSeek V4 Pro en pruebas comparativas matemáticas. Sin embargo, en lo que respecta a la codificación agente profunda y la indexación general de inteligencia a gran escala, actualmente va por detrás de las últimas generaciones de rivales chinos de código abierto como búsqueda profunda, Z.ai (GLM)y minimax.
Dicho esto, compararlos directamente ignora la propuesta de valor central de Cohere: eficiencia del hardware.
Más allá de los puntos de referencia, Command A+ introduce integraciones profundas para la confianza y la verificación empresarial. El modelo admite el uso de herramientas conversacionales a través de plantillas de chat estándar, lo que permite a los desarrolladores conectarlo sin problemas a API internas, motores de búsqueda o bases de datos SQL.
Fundamentalmente, Command A+ presenta generación de citas nativa. Cuando el Comando A+ recupera información de una herramienta externa, no solo sintetiza la respuesta; genera «tramos de puesta a tierra» explícitos. Usando etiquetas especiales incrustadas en la salida, el El modelo vincula directamente cada afirmación fáctica que hace con el documento fuente específico o la fila de la base de datos. sacó la información de.
Para empresas de sectores fuertemente regulados como el financiero, el sanitario o el jurídico, esta trazabilidad marca la diferencia entre un prototipo interesante y una aplicación lista para producción. Si un usuario solicita un informe de ventas diario, el modelo generará el monto total de ventas y citará explícitamente el resultado de la consulta de la base de datos que proporcionó ese número, minimizando el riesgo de alucinaciones no detectadas.
Además, Command A+ es totalmente multimodal, capaz de procesar texto e imágenes de forma nativa dentro de su enorme ventana de contexto de entrada de 128 KB, lo que lo hace muy eficaz para el procesamiento de documentos complejos, como el análisis de facturas, gráficos o manuales técnicos escaneados.
El primer modelo Cohere AI con licencia completa de Apache 2.0
En el panorama actual de la IA, «código abierto» se ha convertido en un término complicado. Muchas empresas líderes en IA publican los pesos de sus modelos bajo licencias comerciales restrictivas o políticas de uso aceptable que prohíben explícitamente a las grandes empresas utilizar los modelos con fines comerciales, o prohíben que los modelos se utilicen para entrenar sistemas de IA competidores.
De hecho, los modelos anteriores de Cohere, incluidos Comando R y Comando R+se publicaron bajo una licencia CC-BY-NC 4.0 (Creative Commons NonCommercial). Si bien los pesos de sus modelos estaban abiertos para que los investigadores y desarrolladores los descargaran, modificaran y evaluaran, estaba estrictamente prohibido su uso con fines comerciales sin comprar una licencia empresarial separada de Cohere o pasar por su interfaz de programación de aplicaciones (API), similar a la disposición que muchas empresas utilizan para acceder a modelos de IA de OpenAI, Anthropic, Google y otros laboratorios líderes.
Cohere ha cambiado su enfoque al lanzar Command A+ bajo la licencia Apache 2.0. Esta es una distinción fundamental para la comunidad de desarrolladores. Apache 2.0 es una verdadera licencia de código abierto aprobada por OSI. Permite que cualquier persona (desde desarrolladores independientes hasta corporaciones Fortune 500) use, modifique, distribuya y comercialice el modelo sin pagar tarifas de licencia ni adherirse a cláusulas restrictivas de no competencia.
Como Gómez escribió en Xla decisión fue defendida por el cofundador de Cohere, Nick Frosst, quien publicó una descripción general de dos minutos de duración calificándolo como «el mejor modelo que jamás hayamos lanzado».
Para la empresa, esta licencia significa total independencia del proveedor. Una empresa puede descargar los pesos de Command A+, ajustarlos en datos internos altamente clasificados e implementarlos en sus propios servidores privados o redes aisladas. No están atados a la infraestructura de Cohere, a los cambios de precios ni al tiempo de actividad de la API. Es la realización definitiva de la IA soberana.
El lanzamiento tuvo una tracción inmediata en todo el ecosistema de desarrolladores de IA, impulsado en gran medida por su integración desde el primer día con los principales marcos de inferencia de código abierto como Hugging Face y vLLM.
¿Qué sigue?
El lanzamiento de Command A+ marca una maduración del ecosistema de IA de código abierto. Al combinar razonamiento de vanguardia, uso sólido de herramientas de agente y capacidades multimodales con una arquitectura diseñada específicamente para la eficiencia del hardware, Cohere está cambiando el cálculo para la adopción de la IA empresarial.
El requisito de clústeres informáticos masivos y centralizados ha sido durante mucho tiempo un cuello de botella para las empresas que priorizan la privacidad de los datos y el control de costos. Al democratizar el acceso a un modelo de este calibre bajo una verdadera licencia de código abierto, Cohere ha proporcionado al mercado empresarial exactamente lo que estaba pidiendo: el poder de la nube, capaz de ejecutarse de forma segura en la sala de servidores al final del pasillo.
Laboratorio canadiense de IA Adherirse causó sensación recientemente por anunciando una fusión con la startup alemana de IA Aleph Alphapero ahora tiene aún más reservado para los creadores de empresas de todo el mundo: hoy, la empresa cofundado por el ex empleado de Google y coautor de «Attention Is All You Need» Aidan Gomez desvelado Comando A+un modelo de lenguaje altamente optimizado de 218 mil millones de parámetros diseñado específicamente para razonamiento complejo, procesamiento de documentos multimodal y flujos de trabajo agentes.
El aspecto más significativo del lanzamiento no son sólo las capacidades del modelo; es su accesibilidad.
Al soltar los pesos del modelo libremente en el popular repositorio de código compartido de IA Hugging Face bajo un Licencia de código abierto Apache 2.0 altamente permisiva – una novedad para la empresa, según una publicación de Gómez, ahora director ejecutivo de Cohere, en X — Cohere está haciendo una apuesta calculada por la «IA soberana»: la tesis de que las empresas, los gobiernos y los desarrolladores deberían tener la capacidad de ejecutar, controlar y adaptar la IA de vanguardia completamente dentro de sus propios entornos seguros, sin sacrificar el rendimiento.
Arquitectura dispersa con cuantización extrema
A nivel arquitectónico, Command A+ representa una evolución importante con respecto a los modelos densos anteriores de Cohere. Es un transformador de mezcla dispersa de expertos (MoE) solo para decodificador.
Si bien el modelo alberga un total relativamente modesto de 218 mil millones de parámetros, aún menos (sólo 25 mil millones) están activos durante cualquier paso de generación determinado. Ocupa un espacio mucho más ligero y requiere muchos menos recursos informáticos para ejecutarse en inferencia (ofreciendo el modelo en entornos de producción a usuarios finales o a través de agentes) que los gigantes propietarios estadounidenses como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, que son estimado por observadores externos en billones de parámetros.
Esta arquitectura dispersa es la clave para la eficiencia del modelo. En términos sencillos, un modelo MoE enruta las consultas entrantes sólo a las redes neuronales «expertas» específicas que mejor se adaptan a manejarlas, dejando el resto del modelo inactivo.
Esta es una formulación familiar y seguida por la mayoría de los LLM líderes en estos días, lo que permite que los modelos conserven la amplia base de conocimientos y las capacidades de razonamiento matizado de un gigante, pero a velocidades más rápidas y requisitos de computación y energía reducidos de un modelo mucho más pequeño, ya que solo una fracción de los parámetros se activa en cualquier momento.
Pero donde Cohere ha dado un paso más allá de la mayoría para Command A+ es que se ha centrado en gran medida en la eficiencia del hardware a través de la cuantización, un proceso que comprime la huella de memoria del modelo al reducir la precisión de sus parámetros.
Command A+ está disponible en formato de 16 bits (BF16), 8 bits (FP8) y 4 bits altamente comprimido (W4A4).
La cuantización W4A4 es la pieza técnica central de esta versión. Normalmente, los modelos de razonamiento sufren un enorme «impuesto de cuantificación», donde la compresión del modelo conduce a regresiones visibles en la resolución de problemas complejos.
Cohere mitigó esto cuantificando únicamente a los expertos del MoE a 4 bits, mientras mantener las vías de atención críticas con total precisión, complementado con una técnica llamada Destilación consciente de la cuantificación.
El resultado es un compresión casi sin pérdidas eso permite que este enorme modelo se ejecute en una sola GPU NVIDIA Blackwell B200 o solo dos GPU NVIDIA H100.
Las ganancias de velocidad son igualmente notables. Según los datos de rendimiento publicados por la empresa, la cuantificación W4A4 con baja concurrencia alcanza 375 tokens por segundo (TOPS) con una latencia de tiempo hasta el primer token (TTFT) de solo 113 milisegundos, lo que representa hasta un aumento del 63 % en la velocidad de salida y una reducción del 17 % en la latencia en comparación con el modelo anterior Command A Reasoning.
Además, Cohere ha revisado el tokenizador del modelo. Los tokenizadores descomponen el texto en fragmentos que procesan los modelos de IA. El nuevo tokenizador está altamente optimizado para uso empresarial global y ofrece soporte nativo para 48 idiomas.
Más importante aún, es mejora drásticamente la eficiencia de la tokenización para idiomas no europeos, reduciendo la cantidad de tokens necesarios para generar respuestas en árabe en un 20%, en japonés en un 18% y en coreano en un 16%. Debido a que los costos de inferencia se calculan por token, esto se traduce directamente en costos operativos más bajos para implementaciones globales, multilingües o en idiomas distintos del inglés.
Flujos de trabajo agentes y altos estándares en matemáticas y campos especializados.
Si bien la velocidad y el tamaño brutos dictan la implementación, la utilidad de un modelo se define por las capacidades de su producto. Command A+ se creó específicamente para tareas «agentes»: flujos de trabajo en los que la IA opera de forma autónoma o semiautónoma, utiliza herramientas externas, consulta bases de datos y sintetiza información en múltiples pasos.
Los saltos de referencia con respecto a la generación anterior son marcados.
En 𝜏²-Bench Telecom, que prueba razonamientos complejos, el modelo saltó de una puntuación del 37% al 85%. En Terminal-Bench Hard, que mide el rendimiento de la codificación agente, subió del 3% al 25%. En matemáticas complejas, obtuvo una puntuación del 90% en AIME 25, frente al 57%.
Command A+ supera su categoría de peso (25B parámetros activos) en razonamiento puro y matemáticas, compitiendo directamente con modelos mucho más grandes como DeepSeek V4 Pro en pruebas comparativas matemáticas. Sin embargo, en lo que respecta a la codificación agente profunda y la indexación general de inteligencia a gran escala, actualmente va por detrás de las últimas generaciones de rivales chinos de código abierto como búsqueda profunda, Z.ai (GLM)y minimax.
Dicho esto, compararlos directamente ignora la propuesta de valor central de Cohere: eficiencia del hardware.
Más allá de los puntos de referencia, Command A+ introduce integraciones profundas para la confianza y la verificación empresarial. El modelo admite el uso de herramientas conversacionales a través de plantillas de chat estándar, lo que permite a los desarrolladores conectarlo sin problemas a API internas, motores de búsqueda o bases de datos SQL.
Fundamentalmente, Command A+ presenta generación de citas nativa. Cuando el Comando A+ recupera información de una herramienta externa, no solo sintetiza la respuesta; genera «tramos de puesta a tierra» explícitos. Usando etiquetas especiales incrustadas en la salida, el El modelo vincula directamente cada afirmación fáctica que hace con el documento fuente específico o la fila de la base de datos. sacó la información de.
Para empresas de sectores fuertemente regulados como el financiero, el sanitario o el jurídico, esta trazabilidad marca la diferencia entre un prototipo interesante y una aplicación lista para producción. Si un usuario solicita un informe de ventas diario, el modelo generará el monto total de ventas y citará explícitamente el resultado de la consulta de la base de datos que proporcionó ese número, minimizando el riesgo de alucinaciones no detectadas.
Además, Command A+ es totalmente multimodal, capaz de procesar texto e imágenes de forma nativa dentro de su enorme ventana de contexto de entrada de 128 KB, lo que lo hace muy eficaz para el procesamiento de documentos complejos, como el análisis de facturas, gráficos o manuales técnicos escaneados.
El primer modelo Cohere AI con licencia completa de Apache 2.0
En el panorama actual de la IA, «código abierto» se ha convertido en un término complicado. Muchas empresas líderes en IA publican los pesos de sus modelos bajo licencias comerciales restrictivas o políticas de uso aceptable que prohíben explícitamente a las grandes empresas utilizar los modelos con fines comerciales, o prohíben que los modelos se utilicen para entrenar sistemas de IA competidores.
De hecho, los modelos anteriores de Cohere, incluidos Comando R y Comando R+se publicaron bajo una licencia CC-BY-NC 4.0 (Creative Commons NonCommercial). Si bien los pesos de sus modelos estaban abiertos para que los investigadores y desarrolladores los descargaran, modificaran y evaluaran, estaba estrictamente prohibido su uso con fines comerciales sin comprar una licencia empresarial separada de Cohere o pasar por su interfaz de programación de aplicaciones (API), similar a la disposición que muchas empresas utilizan para acceder a modelos de IA de OpenAI, Anthropic, Google y otros laboratorios líderes.
Cohere ha cambiado su enfoque al lanzar Command A+ bajo la licencia Apache 2.0. Esta es una distinción fundamental para la comunidad de desarrolladores. Apache 2.0 es una verdadera licencia de código abierto aprobada por OSI. Permite que cualquier persona (desde desarrolladores independientes hasta corporaciones Fortune 500) use, modifique, distribuya y comercialice el modelo sin pagar tarifas de licencia ni adherirse a cláusulas restrictivas de no competencia.
Como Gómez escribió en Xla decisión fue defendida por el cofundador de Cohere, Nick Frosst, quien publicó una descripción general de dos minutos de duración calificándolo como «el mejor modelo que jamás hayamos lanzado».
Para la empresa, esta licencia significa total independencia del proveedor. Una empresa puede descargar los pesos de Command A+, ajustarlos en datos internos altamente clasificados e implementarlos en sus propios servidores privados o redes aisladas. No están atados a la infraestructura de Cohere, a los cambios de precios ni al tiempo de actividad de la API. Es la realización definitiva de la IA soberana.
El lanzamiento tuvo una tracción inmediata en todo el ecosistema de desarrolladores de IA, impulsado en gran medida por su integración desde el primer día con los principales marcos de inferencia de código abierto como Hugging Face y vLLM.
¿Qué sigue?
El lanzamiento de Command A+ marca una maduración del ecosistema de IA de código abierto. Al combinar razonamiento de vanguardia, uso sólido de herramientas de agente y capacidades multimodales con una arquitectura diseñada específicamente para la eficiencia del hardware, Cohere está cambiando el cálculo para la adopción de la IA empresarial.
El requisito de clústeres informáticos masivos y centralizados ha sido durante mucho tiempo un cuello de botella para las empresas que priorizan la privacidad de los datos y el control de costos. Al democratizar el acceso a un modelo de este calibre bajo una verdadera licencia de código abierto, Cohere ha proporcionado al mercado empresarial exactamente lo que estaba pidiendo: el poder de la nube, capaz de ejecutarse de forma segura en la sala de servidores al final del pasillo.











































































