Los equipos de ingeniería que crean canales de codificación de agentes ahora tienen una alternativa concreta de código abierto a los modelos administrados como Claude Fable 5, que se ejecuta en un solo H100. La compensación: el North Mini Code de Cohere, lanzado el martes, generó tres veces más tokens de salida que modelos comparables en pruebas independientes, un costo de verbosidad que empeora en cargas de trabajo de producción de alto volumen.
El nuevo modelo de código abierto es un modelo de Mezcla de Expertos (MoE) de 30 mil millones de parámetros con 3 mil millones de parámetros activos por token, diseñado para ingeniería de software agente, incluida la orquestación de subagente, mapeo de arquitectura, revisión de código y trabajo de punto final. El modelo admite una ventana emergente de 256 000 tokens con una longitud de generación máxima de 64 000 tokens y está disponible en Hugging Face bajo una licencia Apache 2.0.
Qué puede hacer el Mini Código Norte
North Mini Code se dirige a la pila completa de codificación de agentes. Esto es lo que hace el modelo y en qué funciona.
Ingeniería de software. Cohere creó North Mini Code específicamente para la ingeniería de software agente, no escalado desde una base de propósito general. Incorpora capacidades de uso de herramientas y admite el pensamiento entrelazado, lo que, según Cohere, mejora el rendimiento en el trabajo agente de varios pasos.
Mapeo de arquitectura y revisión de código. North Mini Code puede analizar y mapear la arquitectura de sistemas, detectar dependencias y realizar revisiones de código en bases de código grandes. Con una ventana emergente de 256.000 tokens, puede contener grandes proyectos de varios archivos en una sola pasada de ventana emergente.
Tarea de agente basada en terminals. El modelo está entrenado para entornos de terminal, manejo de interacciones de shell, scripts de paquetes y herramientas de línea de comandos. Cohere lo comparó con Terminal-Bench v2, que prueba agentes en entornos de terminales reales en lugar de tareas de generación de código sintético.
como fue construido
North Mini Code es un modelo experto mixto con 128 expertos, 8 de los cuales están habilitados para tokens. Los requisitos computacionales en el momento de la inferencia están más cerca de un modelo de 3 mil millones de parámetros a pesar de un total de 30 mil millones de parámetros. Nick Frosst, cofundador de Cohere, demostró esto ejecutándose en una Mac Studio a través de MLX con alrededor de 20 GB de RAM, la misma máquina que usa para su propio trabajo de codificación local.
Cohere entrenó el modelo a través de dos etapas de ajuste supervisado, seguidas de aprendizaje reforzado con recompensas verificables en más de 70.000 tareas verificables repartidas en aproximadamente 5.000 repositorios, deduplicadas en SWE-Bench.
En lugar de optimizar su sistema con un solo agente, Cohere se entrenó con tres. SWE-Agent utiliza una CLI rica con comandos especializados. Mini-SWE-Agent utiliza una única herramienta bash con salida de shell sin formato. OpenCode utiliza herramientas escritas individualmente que devuelven JSON estructurado. Cohere informa una ganancia de 10 puntos porcentuales en el punto de referencia OpenCode utilizando el enfoque multihaz mientras mantiene el rendimiento de SWE-Agent.
¿Dónde encaja?
North Mini Code está ingresando a un mercado que ahora incluye Mistral Devstral Small 2, GitHub Copilot, Cursor y Claude Fable 5, cada uno con distintas compensaciones de costos e implementación.
La principal comparación de referencia de Cohere es Mistral Devstral Small 2, un modelo denso con 24 mil millones de parámetros. En las pruebas internas informadas por los proveedores, Cohere afirma un rendimiento de salida 2,8 veces mayor y una ventaja de latencia entre tokens del 30% sobre el Devstral Small 2 en pruebas internas bajo configuraciones de hardware idénticas. Cohere también afirma, en su artículo técnico Hugging Face, que North Mini Code supera a los modelos de código abierto hasta cuatro veces su número de parámetros en sus puntos de referencia informados, incluidos modelos con 120 mil millones de parámetros.
El análisis artificial lo ubica de forma independiente en el octavo lugar entre 127 modelos de peso abierto comparables en velocidad de salida de 210 tokens por segundo, con un tiempo hasta el primer token de 0,25 segundos frente a una mediana de clase de 1,95 segundos. Ocupa el puesto 18 entre 127 en el Índice de Inteligencia Analítica Artificial. Un indicador de los mismos datos: el modelo generó 75 millones de tokens de salida para completar el índice de inteligencia frente a una media de clase de 25 millones. En canalizaciones de agentes de gran volumen, esta verbosidad aumenta el costo de inferencia y la latencia.
«De repente la gente se pregunta: ¿Estoy obteniendo suficiente valor económico de los tokens de un modelo? » dijo Frosst durante el vídeo de lanzamiento. «El despliegue local es una forma de empoderar a las personas y hacer de la IA algo que realmente funcione para ellos».
GitHub Copilot, Cursor y Claude Code funcionan con precios de pago por uso o de suscripción, sin opción local. Claude Fable 5 de Anthropic, ahora el modelo de codificación gestionada disponible públicamente de mayor rendimiento, cuesta 50 dólares por millón de tokens de salida. Para Frosst, el modelo es lo opuesto a Fable.
«Es Apache 2.0 pequeño, rentable y desplegable localmente. Así es como deberían funcionar los LLM: pequeños, de código abierto, transparentes y soberanos, versus grandes, costosos, propietarios y hegemónicos», escribió Frosst en un artículo sobre X.
Qué significa esto para las empresas
Para los equipos que crean procesos de codificación de agentes de producción, el lanzamiento de North Mini Code aclara una serie de decisiones que se han tomado durante meses.
La capacitación de agentes especialmente diseñada ahora proporciona un punto de referencia contra el cual evaluar. La distinción entre modelos ajustados para código y modelos entrenados específicamente para flujos de trabajo agentes, con llamadas de herramientas verificadas y solidez de múltiples arneses, es ahora un factor importante en las decisiones en proceso. Cualquier proveedor de modelos que afirme tener capacidad de codificación agente debería poder responder si su capacitación utilizó tareas agentes verificables o se adaptó a partir de una base de propósito general.
La verbosidad es un costo oculto del proceso que los puntos de referencia no revelan. El análisis artificial midió que North Mini Code generaba tres veces más tokens de salida que modelos comparables. Esta verbosidad aumenta el costo de inferencia y la latencia en canalizaciones de gran volumen. Probar el rendimiento frente al volumen de carga de trabajo real es el paso de evaluación que se saltan las clasificaciones de referencia.
La distribución de los precios en frontera es hoy una verdadera decisión arquitectónica. Fable 5 a 50 dólares por millón de tokens de salida y North Mini Code en un solo H100 representan un compromiso real entre el control de costos y la residencia de datos, por un lado, y la sobrecarga de infraestructura administrada, por el otro. Los equipos que ejecutan procesos de codificación de agentes de gran volumen deben modelar ambas rutas de costos en función de su carga de trabajo real antes de comprometerse con cualquiera de ellas.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.













































































