¿Está China retomando el liderazgo en la IA de código abierto?
Z.ai, también conocida como Zhupai AI, una startup china de inteligencia artificial conocida principalmente por su potente familia de modelos de código abierto GLM, ha presentado hoy GLM-5.1 bajo una licencia MIT permisiva, lo que permite a las empresas descargarlo, personalizarlo y utilizarlo con fines comerciales. Pueden hacerlo a través de Hugging Face.
Esto sigue al lanzamiento el mes pasado de GLM-5 Turbo, una versión más rápida, pero bajo una licencia propietaria.
El nuevo GLM-5.1 está diseñado para trabajar de forma autónoma durante hasta ocho horas en una sola tarea, lo que marca un cambio definitivo del “vibe coding” hacia la ingeniería basada en agentes.
Este lanzamiento representa un momento clave en la evolución de la inteligencia artificial. Mientras que los competidores se han centrado en aumentar los tokens de razonamiento para mejorar la lógica, Z.ai está optimizando los horizontes productivos.
GLM-5.1 es un modelo Mixture-of-Experts de 754 mil millones de parámetros, diseñado para mantener la alineación con los objetivos durante ejecuciones prolongadas que abarcan miles de llamadas a herramientas.
“Los agentes podían hacer alrededor de 20 pasos a finales del año pasado”, escribió Lou, líder de Z.ai, en X. “GLM-5.1 puede hacer 1,700 ahora. El tiempo de trabajo autónomo puede ser la curva más importante después de las leyes de escalado. GLM-5.1 será el primer punto en esa curva que la comunidad de código abierto podrá verificar por sí misma. Espero que les guste ^^”.
En un mercado cada vez más saturado de modelos rápidos, Z.ai apuesta por la resistencia a largo plazo. La empresa, que cotizó en la Bolsa de Hong Kong a principios de 2026 con una capitalización de mercado de 52.83 mil millones de dólares, utiliza este lanzamiento para consolidar su posición como el principal desarrollador independiente de modelos de lenguaje en la región.
Tecnología: el patrón de optimización en escalera
El avance tecnológico central de GLM-5.1 no es solo su escala —aunque sus 754 mil millones de parámetros y su ventana de contexto de 202,752 tokens son impresionantes— sino su capacidad para evitar el efecto de estancamiento observado en modelos anteriores.
En los flujos de trabajo tradicionales basados en agentes, un modelo suele aplicar algunas técnicas conocidas para obtener ganancias rápidas al inicio y luego se estanca. Darle más tiempo o más llamadas a herramientas generalmente produce rendimientos decrecientes o desviaciones en la estrategia.
La investigación de Z.ai demuestra que GLM-5.1 opera mediante lo que denominan un “patrón en escalera”, caracterizado por periodos de ajustes incrementales dentro de una estrategia fija, interrumpidos por cambios estructurales que desplazan el límite del rendimiento.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
En el Escenario 1 de su informe técnico, el modelo fue encargado de optimizar una base de datos vectorial de alto rendimiento, un reto conocido como VectorDBBench.
El modelo recibe una estructura base en Rust con implementaciones vacías, y luego utiliza agentes basados en llamadas a herramientas para editar código, compilar, probar y analizar rendimiento. Mientras que resultados previos de modelos como Claude Opus 4.6 alcanzaban un límite de 3,547 consultas por segundo, GLM-5.1 ejecutó 655 iteraciones y más de 6,000 llamadas a herramientas. La trayectoria de optimización no fue lineal, sino marcada por avances estructurales.
En la iteración 90, el modelo cambió de un escaneo completo del corpus a una exploración por clústeres IVF con compresión de vectores f16, reduciendo el ancho de banda por vector de 512 bytes a 256 bytes y elevando el rendimiento a 6,400 consultas por segundo.
Para la iteración 240, introdujo de forma autónoma un pipeline de dos etapas con preevaluación u8 y reordenamiento f16, alcanzando 13,400 consultas por segundo. Finalmente, identificó y resolvió seis cuellos de botella estructurales, incluyendo enrutamiento jerárquico mediante superclústeres y enrutamiento cuantizado usando puntuación de centroides con VNNI. Todo esto culminó en un resultado final de 21,500 consultas por segundo, aproximadamente seis veces el mejor resultado logrado en una sola sesión de 50 interacciones.
Esto demuestra un modelo que funciona como su propio departamento de investigación y desarrollo, descomponiendo problemas complejos y ejecutando experimentos con gran precisión.
El modelo también optimizó la ejecución, reduciendo la sobrecarga de planificación y mejorando la localidad de caché. Durante la optimización de búsqueda de vecinos más cercanos aproximados, eliminó paralelismo anidado y rediseñó el sistema con ejecución por consulta en un solo hilo y concurrencia externa.
Cuando el modelo detectó iteraciones donde la precisión caía por debajo del 95 %, diagnosticó el problema, ajustó parámetros e implementó compensaciones para recuperar la exactitud. Este nivel de corrección autónoma distingue a GLM-5.1 de modelos que solo generan código sin probarlo en entornos reales.
KernelBench: empujando la frontera del machine learning
La resistencia del modelo también fue evaluada en KernelBench Nivel 3, que requiere la optimización completa de arquitecturas de aprendizaje automático como MobileNet, VGG, MiniGPT y Mamba.
En este entorno, el objetivo es producir un kernel de GPU más rápido que la implementación de referencia en PyTorch, manteniendo resultados idénticos. Cada uno de los 50 problemas se ejecuta en contenedores Docker aislados con una GPU H100, y se limita a 1,200 iteraciones de uso de herramientas.
Los resultados muestran una diferencia significativa frente a modelos anteriores. Mientras que GLM-5 mejoraba rápidamente pero se estancaba temprano con una aceleración de 2.6x, GLM-5.1 mantuvo su proceso de optimización durante mucho más tiempo, alcanzando finalmente una mejora media geométrica de 3.6x en 50 problemas, incluso después de más de 1,000 iteraciones.
Aunque Claude Opus 4.6 sigue liderando este benchmark con 4.2x, GLM-5.1 ha ampliado significativamente el horizonte productivo de los modelos de código abierto.
Esta capacidad no se basa solo en una mayor ventana de contexto, sino en mantener la alineación con objetivos durante ejecuciones prolongadas, reduciendo desviaciones, acumulación de errores y pruebas ineficientes. Uno de los avances clave es su capacidad de crear ciclos autónomos de experimentación, análisis y optimización.
Estrategia de producto: suscripción y subsidios
GLM-5.1 está diseñado como una herramienta de ingeniería, no como un chatbot para consumidores. Para respaldarlo, Z.ai lo ha integrado en un ecosistema de desarrollo llamado Coding Plan, orientado a competir con herramientas avanzadas para desarrolladores.
La oferta se divide en tres niveles de suscripción, todos con acceso gratuito a herramientas como análisis de visión, búsqueda web, lectura web y lectura de documentos.
- El plan Lite (27 USD por trimestre) está orientado a cargas ligeras y ofrece tres veces el uso de un plan equivalente de Claude Pro.
- El plan Pro (81 USD por trimestre) está diseñado para cargas complejas, con cinco veces más uso que Lite y entre 40 % y 60 % más velocidad.
- El plan Max (216 USD por trimestre) está dirigido a desarrolladores avanzados con alta demanda, garantizando rendimiento incluso en horas pico.
Para quienes usan la API directamente o mediante plataformas como OpenRouter o Requesty, el precio es de 1.40 USD por millón de tokens de entrada y 4.40 USD por millón de tokens de salida, con descuentos en caché de 0.26 USD por millón de tokens de entrada.












































































