Entre las muchas empresas y laboratorios chinos de IA que compiten por participación de mercado y atención (sin juego de palabras) en el mercado global, minimax destaca por su compromiso de proporcionar inteligencia de vanguardia en una variedad de modalidades, incluidos texto, codificación y video (a través de su Hailuo serie de modelos), a menudo bajo licencias de código abierto estándar, permisivas y amigables para las empresas.
Ahora, MiniMax vuelve a llamar la atención de los usuarios avanzados y desarrolladores de IA de todo el mundo al lanzar un nuevo informe técnico en profundidad sobre la fabricación de su popular serie M2 de modelos de lenguaje (M2, M2.5y M2.7) arrojando luz sobre sus numerosas innovaciones de ingeniería y enfoques inteligentes, mientras que la empresa y sus líderes también adelantaron un nuevo enfoque de escasa atención para su próxima serie de modelos MiniMax M3que según dice produce una velocidad de decodificación (o respuesta LLM) hasta 15,6 veces más rápida en contextos largos (un millón de tokens) al adoptar un marco subcuadrático personalizado. Al hacerlo, MiniMax ha diseñado M3 para hacer económicamente viable la implementación de agentes de IA en contextos ultralargos.
El informe M2 es digno de mención para cualquier empresa que trabaje con modelos de IA, y especialmente para aquellas que buscan perfeccionar y entrenar los suyos propios internamente. Después de todo, los modelos de la serie M2 de MiniMax a menudo alcanzaron los mejores puntos de referencia del mundo en rendimiento de IA de código abierto cuando fueron lanzados.
Si bien el título ha sido desde entonces eclipsado Por varios otros laboratorios chinos, incluidos DeepSeek y Xiaomi, el nuevo informe de MiniMax ofrece un modelo que puede utilizarse para mejorar el modelo de IA y el rendimiento de los agentes en empresas de todo el mundo.
Como Adina Yakup de Hugging Face observado en X«Más allá de los puntos de referencia, han realizado un trabajo realmente sólido en la eficiencia del MoE y el diseño orientado a agentes. ¡Estoy emocionado de ver hacia dónde irá M3 a continuación!»
El dilema de la atención
La arquitectura técnica central de la serie M2 se basa en un diseño de transformador escaso de decodificador exclusivo de mezcla de expertos (MoE) utilizado por muchos otros LLM de última generación.
La columna vertebral fundamental alberga 229,9 mil millones de parámetros totales, pero mantiene una huella operativa notablemente reducida al activar solo 9,8 mil millones de parámetros por token en 256 expertos detallados.
Sin embargo, para optimizar el enrutamiento y evitar problemas de equilibrio de carga estándar, MiniMax implementó una activación sigmoidea combinada con términos de sesgo específicos de expertos que se pueden aprender, lo que reduce en gran medida la dependencia de pérdidas auxiliares restrictivas.
La decisión de ingeniería más definitiva documentada en el artículo de M2 fue el estricto cumplimiento de la atención total de múltiples cabezales con Atención de consultas agrupadas (GQA) en las 62 capas.
En modelos de lenguaje grandes, la «escala cuadrática» se refiere a la realidad computacionalmente costosa de los mecanismos estándar de atención total, donde cada token en una secuencia debe conectarse matemáticamente con todos los demás tokens. Para usar una analogía del mundo real, es similar a asistir a un evento de networking y verse obligado a tener una conversación profunda con cada persona en la sala mientras se monitorean simultáneamente todas las demás conversaciones en curso.
Si bien este enfoque produce un contexto increíblemente completo, la potencia de procesamiento y la memoria requeridas explotan en el cuadrado de la longitud de entrada, creando un grave cuello de botella en el hardware cuando los modelos intentan ingerir cientos de miles de palabras.
El problema de la escala subcuadrática
El escalado «subcuadrático» introduce atajos arquitectónicos diseñados para evitar esta carga computacional exponencial. En lugar de mapear todas las conexiones posibles, los métodos subcuadráticos, como la atención de ventana deslizante o la atención lineal comprimida, podrían analizar solo una ventana localizada de palabras cercanas o generar un resumen comprimido del texto más amplio.
Estos métodos eficientes reducen drásticamente los costos de hardware y permiten que los modelos procesen documentos masivos a altas velocidades, pero históricamente introducen graves compromisos en la precisión, lo que a menudo hace que la IA pierda el «panorama general» o pierda la noción del contexto distante.
Este dilema matemático define la evolución arquitectónica desde el M2 de MiniMax hasta su próxima serie M3. Durante el desarrollo de M2, los investigadores probaron rigurosamente los atajos subcuadráticos, pero descubrieron que paralizaban el «razonamiento de múltiples saltos» del modelo (su capacidad para conectar pistas dispares a lo largo de un documento largo), lo que obligó al equipo a absorber el enorme costo computacional de la atención cuadrática completa para mantener una inteligencia de nivel de frontera.
De hecho, compararon agresivamente alternativas de atención eficiente durante el entrenamiento previo, pero las descartaron intencionalmente. Experimentaron ampliamente con configuraciones híbridas, entrelazando atención total con arquitecturas subcuadráticas como Lightning Attention o configuraciones híbridas Sliding Window Attention (SWA).
Los resultados empíricos fueron definitivos: a mayor escala, las variantes de atención lineal y en ventana exhibieron graves déficits de razonamiento.
En evaluaciones que excedieron las ventanas de contexto de 32K, las variantes SWA obtuvieron resultados significativamente peores que la atención total, cayendo de una puntuación inicial de 90,0 a 72,0 en la tarea de extracción de palabras complejas RULER 128K.
Las configuraciones subcuadráticas demostraron ser propensas a limitaciones de memoria durante el entrenamiento, carecían de soporte de almacenamiento en caché de prefijos nativo y no lograron alinearse sin problemas con los módulos de predicción de múltiples tokens (MTP) utilizados para la decodificación especulativa. Se consideró necesaria toda la atención para preservar la capacidad de razonamiento de múltiples saltos.
Sin embargo, reconociendo que los límites del hardware físico no pueden sostener el escalamiento cuadrático indefinidamente, MiniMax está diseñando la serie M3 en torno a un novedoso marco subcuadrático para finalmente ofrecer procesamiento de alta velocidad y razonamiento sin concesiones.
MiniMax Sparse Attention (MSA) y escalado subcuadrático entrante
El próximo MiniMax-M3 rompe con las limitaciones de computación de su predecesor. Como lo reveló el equipo de ingeniería de MiniMax bajo el lema «Algo GRANDE está por llegar», M3 presenta «MiniMax Sparse Attention» (MSA).
A diferencia de la atención latente de cabezales múltiples (MLA) de DeepSeek, que comprime claves y valores en un espacio latente de baja dimensión, MSA opera en una red troncal GQA estándar pero utiliza selección a nivel de bloque en valores-clave reales sin comprimir.
Elie Bakouch en el laboratorio de plataforma e infraestructura de capacitación de IA Prime Intellect publicado en X señalando que los cambios principales incluyen «selección de nivel de bloque como en CSA, pero la atención se centra en el KV real, no en [compressed space]».
Esto resuelve los obstáculos de pérdida de precisión y almacenamiento en caché de prefijos observados en el documento M2. Al filtrar y seleccionar dinámicamente secuencias a nivel de bloque, MSA ofrece un salto arquitectónico: la creación temprana de perfiles de hardware indica una aceleración de 9,7 veces en la latencia de precarga y una enorme aceleración de 15,6 veces durante las fases de decodificación con una longitud de secuencia de 1 millón de tokens en comparación con la arquitectura M2 de atención total.
Para comprender por qué una aceleración en la «fase de decodificación» es tan significativa, es útil analizar cómo una IA realmente lee y escribe información. Cuando interactúas con una IA, el procesamiento se produce en dos pasos distintos: precarga y decodificación.
Cuando le entregas un mensaje a una IA, ya sea una oración corta o un documento enorme de 1000 páginas, procesa ese fragmento completo de texto de una sola vez en paralelo, lo que se conoce como «relleno previo». Básicamente, «lee» la información de un gran trago para desarrollar su comprensión inicial y establecer el contexto.
Para generar una respuesta, la IA debe entrar en una «fase de decodificación». Para predecir la primera palabra de su respuesta, mira el mensaje. Para predecir la segunda palabra, debe mirar el mensaje. más la primera palabra. Para predecir la centésima palabra, debe volver a calcular el contexto del mensaje y las 99 palabras anteriores que acaba de escribir. Por lo tanto, la respuesta en realidad se vuelve más difícil de generar a medida que avanza, y al final se requiere una revisión completa de todas las partes anteriores.
Para un profano, imagine leer un informe legal denso (relleno previo) y luego verse obligado a escribir un informe resumido en el que, antes de escribir cada palabra nueva, debe volver a leer rápidamente todo el informe más todo lo que ha escrito hasta ahora para asegurarse de que la siguiente palabra tenga sentido (decodificación).
Debido a que la IA debe mirar hacia atrás de manera constante y repetitiva para generar cada nuevo paso hacia adelante, la fase de decodificación es el cuello de botella computacional más grave en la generación de texto. Es por eso que los modelos de IA a menudo escriben sus respuestas palabra por palabra y por qué se ralentizan significativamente a medida que las conversaciones se hacen más largas.
Por lo tanto, cuando el pasaje establece que la nueva arquitectura logra una enorme aceleración de 15,6 veces durante la fase de decodificación con una longitud de secuencia de 1 millón de tokens, significa que el modelo ha encontrado un atajo estructural para generar su respuesta, token por token, casi 16 veces más rápido. Resuelve directamente el cuello de botella exacto que normalmente hace que los chatbots de IA se congelen o tartamudeen cuando manejan cantidades masivas de información.
La evolución de la serie MiniMax M y la creación de ‘Forge’
A nivel de producto, MiniMax ha evolucionado constantemente sus modelos desde simples interfaces de generación de texto hasta trabajadores autónomos.
La serie M2 fue pionera en un protocolo de «pensamiento entrelazado» en el que el modelo alterna entre trazas de planificación de lenguaje natural e invocaciones explícitas de herramientas dentro de una única trayectoria. En lugar de eliminar los bloques intermedios de la cadena de pensamiento entre los turnos de ejecución, M2 agrega el historial de pensamiento completo directamente al contexto de la conversación. Esta persistencia de la planificación evita la deriva del estado, lo que permite que el modelo se recupere sin problemas de los errores de tiempo de ejecución y revise sus estrategias en función de la retroalimentación del entorno.
Para entrenar estos flujos de trabajo a largo plazo, MiniMax creó «Forge», un sistema de aprendizaje por refuerzo escalable nativo del agente. Forge desacopla la ejecución en tres módulos independientes: el lado del agente, la capa de abstracción de middleware (servidor de puerta de enlace y grupo de datos) y los motores de entrenamiento/inferencia.
Como ingeniero de MiniMax Olive Song explicó en el podcast de ThursdAI«Lo que nos dimos cuenta es que hay mucho potencial con un modelo pequeño como este si entrenamos el aprendizaje por refuerzo con una gran cantidad de entornos y agentes… Pero no es algo muy fácil de hacer», y agregó que esta capacitación ambiental fue donde el equipo pasó una parte importante de su cronograma de desarrollo. Para absorber la variación extrema de la longitud de la trayectoria común en entornos de agentes de varios pasos, Forge implementa dos soluciones de ingeniería vitales:
-
Programación FIFO en ventana: Un programador de entrenamiento que asigna una ventana deslizante sobre la cola de generación. Permite la recuperación codiciosa y de alto rendimiento de tareas completadas dentro de la ventana para evitar el tiempo de inactividad del clúster, al tiempo que aplica estrictamente los límites FIFO para mantener la estabilidad distributiva y evitar la oscilación del gradiente.
-
Fusión de árbol de prefijos: Una optimización que reestructura el entrenamiento por lotes en cálculo de árbol. Las terminaciones que comparten prefijos de conversación idénticos se calculan exactamente una vez en el paso directo antes de la bifurcación. Esto elimina cálculos redundantes, generando una aceleración del entrenamiento de hasta 40 veces con error de aproximación cero.
Esta infraestructura de refuerzo generó directamente el punto de control M2.7, moviendo la serie hacia la «autoevolución». Operando dentro de un arnés de agente automatizado, M2.7 funciona como un ingeniero de aprendizaje automático independiente. El modelo perfila sus propias ejecuciones de entrenamiento activo, diagnostica anomalías, lee registros y modifica automáticamente su propia base de código y configuraciones.
Según MiniMax, M2.7 manejó con éxito entre el 30% y el 50% de su propio flujo de trabajo de desarrollo.
En la rigurosa suite MLE Bench Lite de OpenAI, que prueba la capacidad de investigación de ML autónoma, M2.7 logró una tasa de medalla del 66,6 % en pruebas independientes de 24 horas, empatando efectivamente con el peso cerrado Gemini 3.1 Pro de Google.
La cadencia continua de M2 a M2.5, que completó el 30% de las tareas internas y el 80% del código recién comprometido en MiniMax HQ, subraya una visión más amplia.
Como señaló el equipo de MiniMax durante esa fase de implementación, «creemos que M2.5 ofrece posibilidades prácticamente ilimitadas para el desarrollo y operación de agentes en la economía».
Con el informe técnico que codifica los éxitos de la generación M2 y el blog de tecnología de MSA en el horizonte, MiniMax está señalando que la próxima frontera de la IA consiste explícitamente en traducir una huella de miniactivación en máxima inteligencia del mundo real.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































