La startup china de IA Z.ai, conocida internacionalmente por su creciente gama de potentes modelos de lenguaje GLM de código abierto en gran medida, hoy lanzado GLM-5.3 con ganancias sustanciales en la codificación a largo plazo y un salto más importante (y potencialmente sensible) en las capacidades de ciberseguridad.
Las capacidades cibernéticas de GLM-5.3 ya han encontrado una «vulnerabilidad potencialmente grave en Cursor», la startup de codificación de IA recientemente adquirido por SpaceXsegún Lou, defensor de los desarrolladores de z.ai, publicando en X. VentureBeat también etiquetó a Cursor para confirmar X y está esperando respuesta.
GLM-5.3 está disponible inicialmente solo a través del Plan de codificación GLM y el entorno de codificación ZCode de la compañía, mientras que el acceso a API y los pesos abiertos llegarán más tarde, «una vez que se completen la evaluación y el endurecimiento de la seguridad», según la compañía.
Z.ai dice que planea lanzar pesas aproximadamente dos semanas después del lanzamiento.
Para los desarrolladores empresariales, la parte notable del lanzamiento no es simplemente otra ronda de mejoras comparativas. Z.ai dice que GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de la ampliación posterior al entrenamiento en más entornos, tareas más diversas y computación adicional de aprendizaje por refuerzo.
Eso convierte al GLM-5.3 en una especie de prueba de hasta qué punto se puede llevar un modelo base a escala fronteriza sin otro costoso ciclo de preentrenamiento.
«Escalar después del entrenamiento es todo lo que hicimos para GLM-5.3», escribió Z.ai en su anuncio técnico.
Los resultados sugieren un margen de maniobra considerable. Pero también han producido un problema inusual para un desarrollador de modelo abierto: según Z.ai, las capacidades de ciberseguridad mejoraron más rápido de lo previsto a medida que aumentaba la capacitación, particularmente a medida que las tareas avanzaban desde la identificación de vulnerabilidades hasta la construcción de cadenas de explotación completas.
Reuters informó el viernes que Z.ai también está introduciendo controles en torno a algunas de las capacidades más avanzadas del modelo, incluido un enfoque de «acceso confiable» para funciones sensibles.
Un gran salto en la codificación sin otro modelo base
GLM-5.3 se basa en el modelo base a escala de 743 mil millones de parámetros detrás del GLM-5.2 en lugar de reemplazarlo. En cambio, Z.ai amplió el sistema posterior al entrenamiento que ya había creado en torno al aprendizaje por refuerzo a largo plazo.
Esos entornos se parecen cada vez más a trabajos de ingeniería completos en lugar de ejercicios de programación aislados.
Z.ai describe escenarios en los que un agente recibe acceso a bases de código, documentación, clústeres de computación, sistemas de almacenamiento y resultados experimentales, luego tiene que diagnosticar problemas, modificar sistemas, ejecutar experimentos y demostrar una mejora mensurable preservando la corrección. Algunas tareas están diseñadas para aproximarse a varios días de trabajo para un ingeniero experimentado.
El enfoque produjo mejoras considerables de generación en generación en las evaluaciones reportadas por Z.ai.
GLM-5.3 salta de 4,6 a 28,3 en Terminal-Bench 3.0, de 46,2 a 66,9 en DeepSWE v1.1 y de 26,2 a 48,2 en AutomationBench. En la CLI del último examen de los agentes, mejora de 23,8 a 28,5.
El modelo no domina a todos los competidores fronterizos. La propia tabla de referencia de Z.ai muestra GPT-5.6 Sol con 34,6 y Claude Fable 5 con 33,7 en Terminal-Bench 3.0, en comparación con los 28,3 de GLM-5.3. En DeepSWE v1.1, GLM-5.3 obtiene una puntuación de 66,9, en comparación con 72,7 de GPT-5.6 Sol y 69,7 de Fable 5.
Pero Z.ai también enfatiza la eficiencia en lugar de solo la posición de referencia.
En su banco de código privado Z.ai, GLM-5.3 alcanza un resultado del 34,5% en su configuración de razonamiento Max mientras consume aproximadamente 75.000 tokens de salida por tarea. GLM-5.2 alcanza el 23,4% y consume aproximadamente 96.000. Con un esfuerzo alto, GLM-5.3 alcanza el 31,4% con aproximadamente 50.000 tokens de salida, en comparación con el 29,5% informado por Z.ai para Claude Opus 4.8 con 120.000.
Debido a que Code Bench es la evaluación privada de Z.ai, esas comparaciones deben tratarse como resultados informados por la empresa en lugar de mediciones independientes. Aún así, reducir el consumo de tokens y al mismo tiempo mejorar la finalización de tareas es operativamente importante para las empresas que implementan agentes de codificación, donde los bucles de larga duración pueden hacer que el costo de inferencia y la latencia se agraven rápidamente.
Las capacidades cibernéticas se desarrollaron más rápido de lo que esperaba Z.ai
El desarrollo más inusual es la ciberseguridad.
Z.ai introdujo entornos de descubrimiento de vulnerabilidades en la combinación posterior al entrenamiento de GLM-5.3, esperando que el modelo mejorara en la búsqueda de fallas de software. En cambio, la compañía dice que la capacidad comenzó a progresar más a lo largo de la cadena de explotación.
«A medida que escalamos después de la capacitación, la capacidad cibernética se desarrolló más rápido de lo que esperábamos», escribió Z.ai.
En CyberGym, que prueba el descubrimiento y validación de vulnerabilidades contra el código fuente, GLM-5.3 obtiene una puntuación del 84,5%, en comparación con el 77,2% de GLM-5.2. Eso también supera las puntuaciones reportadas por Z.ai para GPT-5.6 Sol con 83,6% y Mythos 5 con 83,8%.
La ventaja no se extiende a toda la pila de explotación. GLM-5.3 obtiene una puntuación del 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, pero se mantiene muy por detrás del 76,5% que informa Z.ai para GPT-5.6 Sol y el 78% de Mythos 5.
De manera similar, en ExploitGym, GLM-5.3 completa 105 tareas con un presupuesto normalizado de dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Fable 5 llega a 181 y 247, mientras que GPT-5.6 Sol llega a 216 y 293.
La dirección de viaje puede importar más que la posición en la tabla de clasificación.
Z.ai dice que el trabajo con equipos de seguridad en China ha dado como resultado 2.436 hallazgos de vulnerabilidad en 269 proyectos después de la revisión, detección y deduplicación de expertos. Su libro de divulgación enumera 1.097 como críticos o de alta gravedad, 53 divulgados públicamente y 2.383 aún bajo embargo en el momento de la publicación.
Esto crea una tensión que enfrentan cada vez más los proveedores de modelos fronterizos: las mismas capacidades de agentes de largo plazo que hacen que los modelos sean más útiles para la ingeniería de software también pueden convertirlos en investigadores de seguridad más capaces y, potencialmente, en operadores ofensivos más capaces.
GLM-5.3 también requiere que los desarrolladores cambien la forma en que llaman al modelo
Los desarrolladores que migran aplicaciones GLM existentes deben prestar atención a un comportamiento disruptivo de la API.
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max – con max la configuración predeterminada y recomendada de Z.ai para la codificación. Pero a diferencia de versiones anteriores, el pensamiento no se puede desactivar.
Aplicaciones que se envían actualmente thinking.type: "disabled" debe cambiar el valor a enabled y especifique un esfuerzo de razonamiento antes de cambiar el identificador del modelo a GLM-5.3. De lo contrario, Z.ai dice que la solicitud fallará.
Eso hace que GLM-5.3 sea una migración real en lugar de simplemente una sustitución del nombre del modelo para algunas aplicaciones de producción.
De GLM-4.5 a GLM-5.3: el rápido avance de Z.ai hacia la ingeniería agente
GLM-5.3 es el último paso en un rápido cambio de Z.ai (anteriormente conocido como Zhipu AI) hacia agentes de codificación y cargas de trabajo de ingeniería autónomas de larga duración.
GLM-4.5, lanzado en julio de 2025, marcó gran parte de esa dirección. El modelo de combinación de expertos de 355 mil millones de parámetros fue diseñado para combinar capacidades de razonamiento, codificación y agente, mientras que el GLM-4.5-Air más pequeño ofrecía 106 mil millones de parámetros totales. Z.ai lanzó los modelos con pesos abiertos y enfatizó la integración con marcos de agentes.
Le siguió GLM-4.6 en septiembre, ampliando el contexto de 128.000 a 200.000 tokens y centrándose en la codificación, el uso de herramientas y los flujos de trabajo de los agentes en entornos que incluyen Claude Code, Cline, Roo Code y Kilo Code. Z.ai también comenzó a poner mayor énfasis en la eficiencia de los tokens en las evaluaciones de codificación del mundo real en lugar de solo el rendimiento comparativo.
El mayor salto arquitectónico se produjo con GLM-5 en febrero de 2026. Z.ai escaló el modelo de los 355 mil millones de parámetros del GLM-4.5 a 744 mil millones, con 40 mil millones de parámetros activos, y aumentó los datos de preentrenamiento a 28,5 billones de tokens. También introdujo su infraestructura de aprendizaje por refuerzo asincrónico “limo” y reposicionó explícitamente a la familia GLM en torno a la “ingeniería agentica” y tareas de largo horizonte.
En junio, GLM-5.2 había convertido esa estrategia en una propuesta empresarial más directa. El modelo de 753 mil millones de parámetros llegó con una ventana de contexto estable de 1 millón de tokens, pesos abiertos bajo una licencia del MIT y soporte en más de 20 entornos de codificación. También introdujo IndexShare, que reutiliza un indexador en capas de escasa atención para reducir la carga computacional de contextos muy largos.
GLM-5.2 tenía un precio de 1,40 dólares por millón de tokens de entrada API y 4,40 dólares por millón de tokens de salida, y el precio de entrada en caché era sustancialmente más bajo, lo que posiciona a Z.ai como un competidor técnico y de precios para los laboratorios fronterizos propietarios.
Las ambiciones de Z.ai también se han expandido fuera del desarrollo de modelos. Reuters informó el mes pasado que Zhipu AI recaudó aproximadamente 31.400 millones de dólares de Hong Kong, o alrededor de 4.000 millones de dólares, a través de una venta de acciones en Hong Kong, y las ganancias se destinaron a áreas que incluyen investigación y desarrollo, infraestructura informática, talento y expansión empresarial.
En conjunto, los lanzamientos muestran una progresión consistente: GLM-4.5 razonamiento, codificación y agentes unificados; GLM-5 amplió sustancialmente el modelo de base; GLM-5.2 atacó la ingeniería de largo contexto y largo horizonte; y GLM-5.3 ahora está intentando extraer sustancialmente más capacidad de esa misma base a través del entrenamiento posterior.
Precios, ZCode y disponibilidad
GLM-5.3 ya está disponible a través del Plan de codificación GLM y ZCode de Z.ai.
ZCode es el entorno de agente de codificación propio de la empresa y admite tareas de «objetivos» de larga duración que planifican, implementan, prueban y verifican el trabajo. También ofrece control remoto de tareas en ejecución y está disponible en macOS, Windows y Linux.
Los planes de codificación GLM individuales actualmente comienzan con un precio promocional listado de $12,60 por mes para Lite con 10,000 créditos por semana. Pro cuesta $ 56 por mes con un uso seis veces Lite, mientras que Max cuesta $ 117,60 por mes con un uso 14 veces Lite. Los asientos Team Standard y Premium cuestan $88 y $188 por usuario por mes, respectivamente.
Z.ai también ha trasladado el Plan de codificación a un sistema de cuotas basado en puntos que contabiliza por separado los tokens de entrada, de entrada en caché y de salida. Las llamadas fuera del período pico de los días laborables de la empresa consumen el 50% de los puntos normales.
La compañía aún no ha proporcionado el precio general de la API GLM-5.3 en los materiales de lanzamiento suministrados, lo que hace que el costo total de producción de la API sea difícil de comparar directamente con el GLM-5.2 o los modelos fronterizos de la competencia hasta que llegue el acceso a la API por etapas.
Ese lanzamiento por etapas puede ser, en última instancia, la parte más importante de GLM-5.3.
Z.ai pasó el año pasado impulsando una estrategia de modelo abierto centrada en pesos permisivos, inferencia de bajo costo y compatibilidad con ecosistemas de agentes de codificación existentes. GLM-5.3 demuestra lo que sucede cuando esa estrategia tiene quizás demasiado éxito en un dominio sensible: una mejor ingeniería autónoma también significa una mejor investigación de seguridad autónoma.
El resultado es un modelo que promueve las ambiciones de codificación de Z.ai y al mismo tiempo obliga a la empresa a enfrentar el mismo equilibrio entre capacidad y acceso que enfrentan los laboratorios de frontera cerrada más grandes.
Por lo tanto, vale la pena observar GLM-5.3 para los desarrolladores empresariales por dos razones. Sus resultados de codificación proporcionan otra indicación de que agentes cada vez más capaces pueden surgir de mejores entornos y post-entrenamiento sin reconstruir continuamente el modelo básico subyacente. Sus resultados de ciberseguridad muestran por qué decidir cómo se distribuyen esos agentes puede llegar a ser tan importante como decidir cómo se los entrena.
La startup china de IA Z.ai, conocida internacionalmente por su creciente gama de potentes modelos de lenguaje GLM de código abierto en gran medida, hoy lanzado GLM-5.3 con ganancias sustanciales en la codificación a largo plazo y un salto más importante (y potencialmente sensible) en las capacidades de ciberseguridad.
Las capacidades cibernéticas de GLM-5.3 ya han encontrado una «vulnerabilidad potencialmente grave en Cursor», la startup de codificación de IA recientemente adquirido por SpaceXsegún Lou, defensor de los desarrolladores de z.ai, publicando en X. VentureBeat también etiquetó a Cursor para confirmar X y está esperando respuesta.
GLM-5.3 está disponible inicialmente solo a través del Plan de codificación GLM y el entorno de codificación ZCode de la compañía, mientras que el acceso a API y los pesos abiertos llegarán más tarde, «una vez que se completen la evaluación y el endurecimiento de la seguridad», según la compañía.
Z.ai dice que planea lanzar pesas aproximadamente dos semanas después del lanzamiento.
Para los desarrolladores empresariales, la parte notable del lanzamiento no es simplemente otra ronda de mejoras comparativas. Z.ai dice que GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de la ampliación posterior al entrenamiento en más entornos, tareas más diversas y computación adicional de aprendizaje por refuerzo.
Eso convierte al GLM-5.3 en una especie de prueba de hasta qué punto se puede llevar un modelo base a escala fronteriza sin otro costoso ciclo de preentrenamiento.
«Escalar después del entrenamiento es todo lo que hicimos para GLM-5.3», escribió Z.ai en su anuncio técnico.
Los resultados sugieren un margen de maniobra considerable. Pero también han producido un problema inusual para un desarrollador de modelo abierto: según Z.ai, las capacidades de ciberseguridad mejoraron más rápido de lo previsto a medida que aumentaba la capacitación, particularmente a medida que las tareas avanzaban desde la identificación de vulnerabilidades hasta la construcción de cadenas de explotación completas.
Reuters informó el viernes que Z.ai también está introduciendo controles en torno a algunas de las capacidades más avanzadas del modelo, incluido un enfoque de «acceso confiable» para funciones sensibles.
Un gran salto en la codificación sin otro modelo base
GLM-5.3 se basa en el modelo base a escala de 743 mil millones de parámetros detrás del GLM-5.2 en lugar de reemplazarlo. En cambio, Z.ai amplió el sistema posterior al entrenamiento que ya había creado en torno al aprendizaje por refuerzo a largo plazo.
Esos entornos se parecen cada vez más a trabajos de ingeniería completos en lugar de ejercicios de programación aislados.
Z.ai describe escenarios en los que un agente recibe acceso a bases de código, documentación, clústeres de computación, sistemas de almacenamiento y resultados experimentales, luego tiene que diagnosticar problemas, modificar sistemas, ejecutar experimentos y demostrar una mejora mensurable preservando la corrección. Algunas tareas están diseñadas para aproximarse a varios días de trabajo para un ingeniero experimentado.
El enfoque produjo mejoras considerables de generación en generación en las evaluaciones reportadas por Z.ai.
GLM-5.3 salta de 4,6 a 28,3 en Terminal-Bench 3.0, de 46,2 a 66,9 en DeepSWE v1.1 y de 26,2 a 48,2 en AutomationBench. En la CLI del último examen de los agentes, mejora de 23,8 a 28,5.
El modelo no domina a todos los competidores fronterizos. La propia tabla de referencia de Z.ai muestra GPT-5.6 Sol con 34,6 y Claude Fable 5 con 33,7 en Terminal-Bench 3.0, en comparación con los 28,3 de GLM-5.3. En DeepSWE v1.1, GLM-5.3 obtiene una puntuación de 66,9, en comparación con 72,7 de GPT-5.6 Sol y 69,7 de Fable 5.
Pero Z.ai también enfatiza la eficiencia en lugar de solo la posición de referencia.
En su banco de código privado Z.ai, GLM-5.3 alcanza un resultado del 34,5% en su configuración de razonamiento Max mientras consume aproximadamente 75.000 tokens de salida por tarea. GLM-5.2 alcanza el 23,4% y consume aproximadamente 96.000. Con un esfuerzo alto, GLM-5.3 alcanza el 31,4% con aproximadamente 50.000 tokens de salida, en comparación con el 29,5% informado por Z.ai para Claude Opus 4.8 con 120.000.
Debido a que Code Bench es la evaluación privada de Z.ai, esas comparaciones deben tratarse como resultados informados por la empresa en lugar de mediciones independientes. Aún así, reducir el consumo de tokens y al mismo tiempo mejorar la finalización de tareas es operativamente importante para las empresas que implementan agentes de codificación, donde los bucles de larga duración pueden hacer que el costo de inferencia y la latencia se agraven rápidamente.
Las capacidades cibernéticas se desarrollaron más rápido de lo que esperaba Z.ai
El desarrollo más inusual es la ciberseguridad.
Z.ai introdujo entornos de descubrimiento de vulnerabilidades en la combinación posterior al entrenamiento de GLM-5.3, esperando que el modelo mejorara en la búsqueda de fallas de software. En cambio, la compañía dice que la capacidad comenzó a progresar más a lo largo de la cadena de explotación.
«A medida que escalamos después de la capacitación, la capacidad cibernética se desarrolló más rápido de lo que esperábamos», escribió Z.ai.
En CyberGym, que prueba el descubrimiento y validación de vulnerabilidades contra el código fuente, GLM-5.3 obtiene una puntuación del 84,5%, en comparación con el 77,2% de GLM-5.2. Eso también supera las puntuaciones reportadas por Z.ai para GPT-5.6 Sol con 83,6% y Mythos 5 con 83,8%.
La ventaja no se extiende a toda la pila de explotación. GLM-5.3 obtiene una puntuación del 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, pero se mantiene muy por detrás del 76,5% que informa Z.ai para GPT-5.6 Sol y el 78% de Mythos 5.
De manera similar, en ExploitGym, GLM-5.3 completa 105 tareas con un presupuesto normalizado de dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Fable 5 llega a 181 y 247, mientras que GPT-5.6 Sol llega a 216 y 293.
La dirección de viaje puede importar más que la posición en la tabla de clasificación.
Z.ai dice que el trabajo con equipos de seguridad en China ha dado como resultado 2.436 hallazgos de vulnerabilidad en 269 proyectos después de la revisión, detección y deduplicación de expertos. Su libro de divulgación enumera 1.097 como críticos o de alta gravedad, 53 divulgados públicamente y 2.383 aún bajo embargo en el momento de la publicación.
Esto crea una tensión que enfrentan cada vez más los proveedores de modelos fronterizos: las mismas capacidades de agentes de largo plazo que hacen que los modelos sean más útiles para la ingeniería de software también pueden convertirlos en investigadores de seguridad más capaces y, potencialmente, en operadores ofensivos más capaces.
GLM-5.3 también requiere que los desarrolladores cambien la forma en que llaman al modelo
Los desarrolladores que migran aplicaciones GLM existentes deben prestar atención a un comportamiento disruptivo de la API.
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max – con max la configuración predeterminada y recomendada de Z.ai para la codificación. Pero a diferencia de versiones anteriores, el pensamiento no se puede desactivar.
Aplicaciones que se envían actualmente thinking.type: "disabled" debe cambiar el valor a enabled y especifique un esfuerzo de razonamiento antes de cambiar el identificador del modelo a GLM-5.3. De lo contrario, Z.ai dice que la solicitud fallará.
Eso hace que GLM-5.3 sea una migración real en lugar de simplemente una sustitución del nombre del modelo para algunas aplicaciones de producción.
De GLM-4.5 a GLM-5.3: el rápido avance de Z.ai hacia la ingeniería agente
GLM-5.3 es el último paso en un rápido cambio de Z.ai (anteriormente conocido como Zhipu AI) hacia agentes de codificación y cargas de trabajo de ingeniería autónomas de larga duración.
GLM-4.5, lanzado en julio de 2025, marcó gran parte de esa dirección. El modelo de combinación de expertos de 355 mil millones de parámetros fue diseñado para combinar capacidades de razonamiento, codificación y agente, mientras que el GLM-4.5-Air más pequeño ofrecía 106 mil millones de parámetros totales. Z.ai lanzó los modelos con pesos abiertos y enfatizó la integración con marcos de agentes.
Le siguió GLM-4.6 en septiembre, ampliando el contexto de 128.000 a 200.000 tokens y centrándose en la codificación, el uso de herramientas y los flujos de trabajo de los agentes en entornos que incluyen Claude Code, Cline, Roo Code y Kilo Code. Z.ai también comenzó a poner mayor énfasis en la eficiencia de los tokens en las evaluaciones de codificación del mundo real en lugar de solo el rendimiento comparativo.
El mayor salto arquitectónico se produjo con GLM-5 en febrero de 2026. Z.ai escaló el modelo de los 355 mil millones de parámetros del GLM-4.5 a 744 mil millones, con 40 mil millones de parámetros activos, y aumentó los datos de preentrenamiento a 28,5 billones de tokens. También introdujo su infraestructura de aprendizaje por refuerzo asincrónico “limo” y reposicionó explícitamente a la familia GLM en torno a la “ingeniería agentica” y tareas de largo horizonte.
En junio, GLM-5.2 había convertido esa estrategia en una propuesta empresarial más directa. El modelo de 753 mil millones de parámetros llegó con una ventana de contexto estable de 1 millón de tokens, pesos abiertos bajo una licencia del MIT y soporte en más de 20 entornos de codificación. También introdujo IndexShare, que reutiliza un indexador en capas de escasa atención para reducir la carga computacional de contextos muy largos.
GLM-5.2 tenía un precio de 1,40 dólares por millón de tokens de entrada API y 4,40 dólares por millón de tokens de salida, y el precio de entrada en caché era sustancialmente más bajo, lo que posiciona a Z.ai como un competidor técnico y de precios para los laboratorios fronterizos propietarios.
Las ambiciones de Z.ai también se han expandido fuera del desarrollo de modelos. Reuters informó el mes pasado que Zhipu AI recaudó aproximadamente 31.400 millones de dólares de Hong Kong, o alrededor de 4.000 millones de dólares, a través de una venta de acciones en Hong Kong, y las ganancias se destinaron a áreas que incluyen investigación y desarrollo, infraestructura informática, talento y expansión empresarial.
En conjunto, los lanzamientos muestran una progresión consistente: GLM-4.5 razonamiento, codificación y agentes unificados; GLM-5 amplió sustancialmente el modelo de base; GLM-5.2 atacó la ingeniería de largo contexto y largo horizonte; y GLM-5.3 ahora está intentando extraer sustancialmente más capacidad de esa misma base a través del entrenamiento posterior.
Precios, ZCode y disponibilidad
GLM-5.3 ya está disponible a través del Plan de codificación GLM y ZCode de Z.ai.
ZCode es el entorno de agente de codificación propio de la empresa y admite tareas de «objetivos» de larga duración que planifican, implementan, prueban y verifican el trabajo. También ofrece control remoto de tareas en ejecución y está disponible en macOS, Windows y Linux.
Los planes de codificación GLM individuales actualmente comienzan con un precio promocional listado de $12,60 por mes para Lite con 10,000 créditos por semana. Pro cuesta $ 56 por mes con un uso seis veces Lite, mientras que Max cuesta $ 117,60 por mes con un uso 14 veces Lite. Los asientos Team Standard y Premium cuestan $88 y $188 por usuario por mes, respectivamente.
Z.ai también ha trasladado el Plan de codificación a un sistema de cuotas basado en puntos que contabiliza por separado los tokens de entrada, de entrada en caché y de salida. Las llamadas fuera del período pico de los días laborables de la empresa consumen el 50% de los puntos normales.
La compañía aún no ha proporcionado el precio general de la API GLM-5.3 en los materiales de lanzamiento suministrados, lo que hace que el costo total de producción de la API sea difícil de comparar directamente con el GLM-5.2 o los modelos fronterizos de la competencia hasta que llegue el acceso a la API por etapas.
Ese lanzamiento por etapas puede ser, en última instancia, la parte más importante de GLM-5.3.
Z.ai pasó el año pasado impulsando una estrategia de modelo abierto centrada en pesos permisivos, inferencia de bajo costo y compatibilidad con ecosistemas de agentes de codificación existentes. GLM-5.3 demuestra lo que sucede cuando esa estrategia tiene quizás demasiado éxito en un dominio sensible: una mejor ingeniería autónoma también significa una mejor investigación de seguridad autónoma.
El resultado es un modelo que promueve las ambiciones de codificación de Z.ai y al mismo tiempo obliga a la empresa a enfrentar el mismo equilibrio entre capacidad y acceso que enfrentan los laboratorios de frontera cerrada más grandes.
Por lo tanto, vale la pena observar GLM-5.3 para los desarrolladores empresariales por dos razones. Sus resultados de codificación proporcionan otra indicación de que agentes cada vez más capaces pueden surgir de mejores entornos y post-entrenamiento sin reconstruir continuamente el modelo básico subyacente. Sus resultados de ciberseguridad muestran por qué decidir cómo se distribuyen esos agentes puede llegar a ser tan importante como decidir cómo se los entrena.
La startup china de IA Z.ai, conocida internacionalmente por su creciente gama de potentes modelos de lenguaje GLM de código abierto en gran medida, hoy lanzado GLM-5.3 con ganancias sustanciales en la codificación a largo plazo y un salto más importante (y potencialmente sensible) en las capacidades de ciberseguridad.
Las capacidades cibernéticas de GLM-5.3 ya han encontrado una «vulnerabilidad potencialmente grave en Cursor», la startup de codificación de IA recientemente adquirido por SpaceXsegún Lou, defensor de los desarrolladores de z.ai, publicando en X. VentureBeat también etiquetó a Cursor para confirmar X y está esperando respuesta.
GLM-5.3 está disponible inicialmente solo a través del Plan de codificación GLM y el entorno de codificación ZCode de la compañía, mientras que el acceso a API y los pesos abiertos llegarán más tarde, «una vez que se completen la evaluación y el endurecimiento de la seguridad», según la compañía.
Z.ai dice que planea lanzar pesas aproximadamente dos semanas después del lanzamiento.
Para los desarrolladores empresariales, la parte notable del lanzamiento no es simplemente otra ronda de mejoras comparativas. Z.ai dice que GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de la ampliación posterior al entrenamiento en más entornos, tareas más diversas y computación adicional de aprendizaje por refuerzo.
Eso convierte al GLM-5.3 en una especie de prueba de hasta qué punto se puede llevar un modelo base a escala fronteriza sin otro costoso ciclo de preentrenamiento.
«Escalar después del entrenamiento es todo lo que hicimos para GLM-5.3», escribió Z.ai en su anuncio técnico.
Los resultados sugieren un margen de maniobra considerable. Pero también han producido un problema inusual para un desarrollador de modelo abierto: según Z.ai, las capacidades de ciberseguridad mejoraron más rápido de lo previsto a medida que aumentaba la capacitación, particularmente a medida que las tareas avanzaban desde la identificación de vulnerabilidades hasta la construcción de cadenas de explotación completas.
Reuters informó el viernes que Z.ai también está introduciendo controles en torno a algunas de las capacidades más avanzadas del modelo, incluido un enfoque de «acceso confiable» para funciones sensibles.
Un gran salto en la codificación sin otro modelo base
GLM-5.3 se basa en el modelo base a escala de 743 mil millones de parámetros detrás del GLM-5.2 en lugar de reemplazarlo. En cambio, Z.ai amplió el sistema posterior al entrenamiento que ya había creado en torno al aprendizaje por refuerzo a largo plazo.
Esos entornos se parecen cada vez más a trabajos de ingeniería completos en lugar de ejercicios de programación aislados.
Z.ai describe escenarios en los que un agente recibe acceso a bases de código, documentación, clústeres de computación, sistemas de almacenamiento y resultados experimentales, luego tiene que diagnosticar problemas, modificar sistemas, ejecutar experimentos y demostrar una mejora mensurable preservando la corrección. Algunas tareas están diseñadas para aproximarse a varios días de trabajo para un ingeniero experimentado.
El enfoque produjo mejoras considerables de generación en generación en las evaluaciones reportadas por Z.ai.
GLM-5.3 salta de 4,6 a 28,3 en Terminal-Bench 3.0, de 46,2 a 66,9 en DeepSWE v1.1 y de 26,2 a 48,2 en AutomationBench. En la CLI del último examen de los agentes, mejora de 23,8 a 28,5.
El modelo no domina a todos los competidores fronterizos. La propia tabla de referencia de Z.ai muestra GPT-5.6 Sol con 34,6 y Claude Fable 5 con 33,7 en Terminal-Bench 3.0, en comparación con los 28,3 de GLM-5.3. En DeepSWE v1.1, GLM-5.3 obtiene una puntuación de 66,9, en comparación con 72,7 de GPT-5.6 Sol y 69,7 de Fable 5.
Pero Z.ai también enfatiza la eficiencia en lugar de solo la posición de referencia.
En su banco de código privado Z.ai, GLM-5.3 alcanza un resultado del 34,5% en su configuración de razonamiento Max mientras consume aproximadamente 75.000 tokens de salida por tarea. GLM-5.2 alcanza el 23,4% y consume aproximadamente 96.000. Con un esfuerzo alto, GLM-5.3 alcanza el 31,4% con aproximadamente 50.000 tokens de salida, en comparación con el 29,5% informado por Z.ai para Claude Opus 4.8 con 120.000.
Debido a que Code Bench es la evaluación privada de Z.ai, esas comparaciones deben tratarse como resultados informados por la empresa en lugar de mediciones independientes. Aún así, reducir el consumo de tokens y al mismo tiempo mejorar la finalización de tareas es operativamente importante para las empresas que implementan agentes de codificación, donde los bucles de larga duración pueden hacer que el costo de inferencia y la latencia se agraven rápidamente.
Las capacidades cibernéticas se desarrollaron más rápido de lo que esperaba Z.ai
El desarrollo más inusual es la ciberseguridad.
Z.ai introdujo entornos de descubrimiento de vulnerabilidades en la combinación posterior al entrenamiento de GLM-5.3, esperando que el modelo mejorara en la búsqueda de fallas de software. En cambio, la compañía dice que la capacidad comenzó a progresar más a lo largo de la cadena de explotación.
«A medida que escalamos después de la capacitación, la capacidad cibernética se desarrolló más rápido de lo que esperábamos», escribió Z.ai.
En CyberGym, que prueba el descubrimiento y validación de vulnerabilidades contra el código fuente, GLM-5.3 obtiene una puntuación del 84,5%, en comparación con el 77,2% de GLM-5.2. Eso también supera las puntuaciones reportadas por Z.ai para GPT-5.6 Sol con 83,6% y Mythos 5 con 83,8%.
La ventaja no se extiende a toda la pila de explotación. GLM-5.3 obtiene una puntuación del 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, pero se mantiene muy por detrás del 76,5% que informa Z.ai para GPT-5.6 Sol y el 78% de Mythos 5.
De manera similar, en ExploitGym, GLM-5.3 completa 105 tareas con un presupuesto normalizado de dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Fable 5 llega a 181 y 247, mientras que GPT-5.6 Sol llega a 216 y 293.
La dirección de viaje puede importar más que la posición en la tabla de clasificación.
Z.ai dice que el trabajo con equipos de seguridad en China ha dado como resultado 2.436 hallazgos de vulnerabilidad en 269 proyectos después de la revisión, detección y deduplicación de expertos. Su libro de divulgación enumera 1.097 como críticos o de alta gravedad, 53 divulgados públicamente y 2.383 aún bajo embargo en el momento de la publicación.
Esto crea una tensión que enfrentan cada vez más los proveedores de modelos fronterizos: las mismas capacidades de agentes de largo plazo que hacen que los modelos sean más útiles para la ingeniería de software también pueden convertirlos en investigadores de seguridad más capaces y, potencialmente, en operadores ofensivos más capaces.
GLM-5.3 también requiere que los desarrolladores cambien la forma en que llaman al modelo
Los desarrolladores que migran aplicaciones GLM existentes deben prestar atención a un comportamiento disruptivo de la API.
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max – con max la configuración predeterminada y recomendada de Z.ai para la codificación. Pero a diferencia de versiones anteriores, el pensamiento no se puede desactivar.
Aplicaciones que se envían actualmente thinking.type: "disabled" debe cambiar el valor a enabled y especifique un esfuerzo de razonamiento antes de cambiar el identificador del modelo a GLM-5.3. De lo contrario, Z.ai dice que la solicitud fallará.
Eso hace que GLM-5.3 sea una migración real en lugar de simplemente una sustitución del nombre del modelo para algunas aplicaciones de producción.
De GLM-4.5 a GLM-5.3: el rápido avance de Z.ai hacia la ingeniería agente
GLM-5.3 es el último paso en un rápido cambio de Z.ai (anteriormente conocido como Zhipu AI) hacia agentes de codificación y cargas de trabajo de ingeniería autónomas de larga duración.
GLM-4.5, lanzado en julio de 2025, marcó gran parte de esa dirección. El modelo de combinación de expertos de 355 mil millones de parámetros fue diseñado para combinar capacidades de razonamiento, codificación y agente, mientras que el GLM-4.5-Air más pequeño ofrecía 106 mil millones de parámetros totales. Z.ai lanzó los modelos con pesos abiertos y enfatizó la integración con marcos de agentes.
Le siguió GLM-4.6 en septiembre, ampliando el contexto de 128.000 a 200.000 tokens y centrándose en la codificación, el uso de herramientas y los flujos de trabajo de los agentes en entornos que incluyen Claude Code, Cline, Roo Code y Kilo Code. Z.ai también comenzó a poner mayor énfasis en la eficiencia de los tokens en las evaluaciones de codificación del mundo real en lugar de solo el rendimiento comparativo.
El mayor salto arquitectónico se produjo con GLM-5 en febrero de 2026. Z.ai escaló el modelo de los 355 mil millones de parámetros del GLM-4.5 a 744 mil millones, con 40 mil millones de parámetros activos, y aumentó los datos de preentrenamiento a 28,5 billones de tokens. También introdujo su infraestructura de aprendizaje por refuerzo asincrónico “limo” y reposicionó explícitamente a la familia GLM en torno a la “ingeniería agentica” y tareas de largo horizonte.
En junio, GLM-5.2 había convertido esa estrategia en una propuesta empresarial más directa. El modelo de 753 mil millones de parámetros llegó con una ventana de contexto estable de 1 millón de tokens, pesos abiertos bajo una licencia del MIT y soporte en más de 20 entornos de codificación. También introdujo IndexShare, que reutiliza un indexador en capas de escasa atención para reducir la carga computacional de contextos muy largos.
GLM-5.2 tenía un precio de 1,40 dólares por millón de tokens de entrada API y 4,40 dólares por millón de tokens de salida, y el precio de entrada en caché era sustancialmente más bajo, lo que posiciona a Z.ai como un competidor técnico y de precios para los laboratorios fronterizos propietarios.
Las ambiciones de Z.ai también se han expandido fuera del desarrollo de modelos. Reuters informó el mes pasado que Zhipu AI recaudó aproximadamente 31.400 millones de dólares de Hong Kong, o alrededor de 4.000 millones de dólares, a través de una venta de acciones en Hong Kong, y las ganancias se destinaron a áreas que incluyen investigación y desarrollo, infraestructura informática, talento y expansión empresarial.
En conjunto, los lanzamientos muestran una progresión consistente: GLM-4.5 razonamiento, codificación y agentes unificados; GLM-5 amplió sustancialmente el modelo de base; GLM-5.2 atacó la ingeniería de largo contexto y largo horizonte; y GLM-5.3 ahora está intentando extraer sustancialmente más capacidad de esa misma base a través del entrenamiento posterior.
Precios, ZCode y disponibilidad
GLM-5.3 ya está disponible a través del Plan de codificación GLM y ZCode de Z.ai.
ZCode es el entorno de agente de codificación propio de la empresa y admite tareas de «objetivos» de larga duración que planifican, implementan, prueban y verifican el trabajo. También ofrece control remoto de tareas en ejecución y está disponible en macOS, Windows y Linux.
Los planes de codificación GLM individuales actualmente comienzan con un precio promocional listado de $12,60 por mes para Lite con 10,000 créditos por semana. Pro cuesta $ 56 por mes con un uso seis veces Lite, mientras que Max cuesta $ 117,60 por mes con un uso 14 veces Lite. Los asientos Team Standard y Premium cuestan $88 y $188 por usuario por mes, respectivamente.
Z.ai también ha trasladado el Plan de codificación a un sistema de cuotas basado en puntos que contabiliza por separado los tokens de entrada, de entrada en caché y de salida. Las llamadas fuera del período pico de los días laborables de la empresa consumen el 50% de los puntos normales.
La compañía aún no ha proporcionado el precio general de la API GLM-5.3 en los materiales de lanzamiento suministrados, lo que hace que el costo total de producción de la API sea difícil de comparar directamente con el GLM-5.2 o los modelos fronterizos de la competencia hasta que llegue el acceso a la API por etapas.
Ese lanzamiento por etapas puede ser, en última instancia, la parte más importante de GLM-5.3.
Z.ai pasó el año pasado impulsando una estrategia de modelo abierto centrada en pesos permisivos, inferencia de bajo costo y compatibilidad con ecosistemas de agentes de codificación existentes. GLM-5.3 demuestra lo que sucede cuando esa estrategia tiene quizás demasiado éxito en un dominio sensible: una mejor ingeniería autónoma también significa una mejor investigación de seguridad autónoma.
El resultado es un modelo que promueve las ambiciones de codificación de Z.ai y al mismo tiempo obliga a la empresa a enfrentar el mismo equilibrio entre capacidad y acceso que enfrentan los laboratorios de frontera cerrada más grandes.
Por lo tanto, vale la pena observar GLM-5.3 para los desarrolladores empresariales por dos razones. Sus resultados de codificación proporcionan otra indicación de que agentes cada vez más capaces pueden surgir de mejores entornos y post-entrenamiento sin reconstruir continuamente el modelo básico subyacente. Sus resultados de ciberseguridad muestran por qué decidir cómo se distribuyen esos agentes puede llegar a ser tan importante como decidir cómo se los entrena.
La startup china de IA Z.ai, conocida internacionalmente por su creciente gama de potentes modelos de lenguaje GLM de código abierto en gran medida, hoy lanzado GLM-5.3 con ganancias sustanciales en la codificación a largo plazo y un salto más importante (y potencialmente sensible) en las capacidades de ciberseguridad.
Las capacidades cibernéticas de GLM-5.3 ya han encontrado una «vulnerabilidad potencialmente grave en Cursor», la startup de codificación de IA recientemente adquirido por SpaceXsegún Lou, defensor de los desarrolladores de z.ai, publicando en X. VentureBeat también etiquetó a Cursor para confirmar X y está esperando respuesta.
GLM-5.3 está disponible inicialmente solo a través del Plan de codificación GLM y el entorno de codificación ZCode de la compañía, mientras que el acceso a API y los pesos abiertos llegarán más tarde, «una vez que se completen la evaluación y el endurecimiento de la seguridad», según la compañía.
Z.ai dice que planea lanzar pesas aproximadamente dos semanas después del lanzamiento.
Para los desarrolladores empresariales, la parte notable del lanzamiento no es simplemente otra ronda de mejoras comparativas. Z.ai dice que GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de la ampliación posterior al entrenamiento en más entornos, tareas más diversas y computación adicional de aprendizaje por refuerzo.
Eso convierte al GLM-5.3 en una especie de prueba de hasta qué punto se puede llevar un modelo base a escala fronteriza sin otro costoso ciclo de preentrenamiento.
«Escalar después del entrenamiento es todo lo que hicimos para GLM-5.3», escribió Z.ai en su anuncio técnico.
Los resultados sugieren un margen de maniobra considerable. Pero también han producido un problema inusual para un desarrollador de modelo abierto: según Z.ai, las capacidades de ciberseguridad mejoraron más rápido de lo previsto a medida que aumentaba la capacitación, particularmente a medida que las tareas avanzaban desde la identificación de vulnerabilidades hasta la construcción de cadenas de explotación completas.
Reuters informó el viernes que Z.ai también está introduciendo controles en torno a algunas de las capacidades más avanzadas del modelo, incluido un enfoque de «acceso confiable» para funciones sensibles.
Un gran salto en la codificación sin otro modelo base
GLM-5.3 se basa en el modelo base a escala de 743 mil millones de parámetros detrás del GLM-5.2 en lugar de reemplazarlo. En cambio, Z.ai amplió el sistema posterior al entrenamiento que ya había creado en torno al aprendizaje por refuerzo a largo plazo.
Esos entornos se parecen cada vez más a trabajos de ingeniería completos en lugar de ejercicios de programación aislados.
Z.ai describe escenarios en los que un agente recibe acceso a bases de código, documentación, clústeres de computación, sistemas de almacenamiento y resultados experimentales, luego tiene que diagnosticar problemas, modificar sistemas, ejecutar experimentos y demostrar una mejora mensurable preservando la corrección. Algunas tareas están diseñadas para aproximarse a varios días de trabajo para un ingeniero experimentado.
El enfoque produjo mejoras considerables de generación en generación en las evaluaciones reportadas por Z.ai.
GLM-5.3 salta de 4,6 a 28,3 en Terminal-Bench 3.0, de 46,2 a 66,9 en DeepSWE v1.1 y de 26,2 a 48,2 en AutomationBench. En la CLI del último examen de los agentes, mejora de 23,8 a 28,5.
El modelo no domina a todos los competidores fronterizos. La propia tabla de referencia de Z.ai muestra GPT-5.6 Sol con 34,6 y Claude Fable 5 con 33,7 en Terminal-Bench 3.0, en comparación con los 28,3 de GLM-5.3. En DeepSWE v1.1, GLM-5.3 obtiene una puntuación de 66,9, en comparación con 72,7 de GPT-5.6 Sol y 69,7 de Fable 5.
Pero Z.ai también enfatiza la eficiencia en lugar de solo la posición de referencia.
En su banco de código privado Z.ai, GLM-5.3 alcanza un resultado del 34,5% en su configuración de razonamiento Max mientras consume aproximadamente 75.000 tokens de salida por tarea. GLM-5.2 alcanza el 23,4% y consume aproximadamente 96.000. Con un esfuerzo alto, GLM-5.3 alcanza el 31,4% con aproximadamente 50.000 tokens de salida, en comparación con el 29,5% informado por Z.ai para Claude Opus 4.8 con 120.000.
Debido a que Code Bench es la evaluación privada de Z.ai, esas comparaciones deben tratarse como resultados informados por la empresa en lugar de mediciones independientes. Aún así, reducir el consumo de tokens y al mismo tiempo mejorar la finalización de tareas es operativamente importante para las empresas que implementan agentes de codificación, donde los bucles de larga duración pueden hacer que el costo de inferencia y la latencia se agraven rápidamente.
Las capacidades cibernéticas se desarrollaron más rápido de lo que esperaba Z.ai
El desarrollo más inusual es la ciberseguridad.
Z.ai introdujo entornos de descubrimiento de vulnerabilidades en la combinación posterior al entrenamiento de GLM-5.3, esperando que el modelo mejorara en la búsqueda de fallas de software. En cambio, la compañía dice que la capacidad comenzó a progresar más a lo largo de la cadena de explotación.
«A medida que escalamos después de la capacitación, la capacidad cibernética se desarrolló más rápido de lo que esperábamos», escribió Z.ai.
En CyberGym, que prueba el descubrimiento y validación de vulnerabilidades contra el código fuente, GLM-5.3 obtiene una puntuación del 84,5%, en comparación con el 77,2% de GLM-5.2. Eso también supera las puntuaciones reportadas por Z.ai para GPT-5.6 Sol con 83,6% y Mythos 5 con 83,8%.
La ventaja no se extiende a toda la pila de explotación. GLM-5.3 obtiene una puntuación del 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, pero se mantiene muy por detrás del 76,5% que informa Z.ai para GPT-5.6 Sol y el 78% de Mythos 5.
De manera similar, en ExploitGym, GLM-5.3 completa 105 tareas con un presupuesto normalizado de dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Fable 5 llega a 181 y 247, mientras que GPT-5.6 Sol llega a 216 y 293.
La dirección de viaje puede importar más que la posición en la tabla de clasificación.
Z.ai dice que el trabajo con equipos de seguridad en China ha dado como resultado 2.436 hallazgos de vulnerabilidad en 269 proyectos después de la revisión, detección y deduplicación de expertos. Su libro de divulgación enumera 1.097 como críticos o de alta gravedad, 53 divulgados públicamente y 2.383 aún bajo embargo en el momento de la publicación.
Esto crea una tensión que enfrentan cada vez más los proveedores de modelos fronterizos: las mismas capacidades de agentes de largo plazo que hacen que los modelos sean más útiles para la ingeniería de software también pueden convertirlos en investigadores de seguridad más capaces y, potencialmente, en operadores ofensivos más capaces.
GLM-5.3 también requiere que los desarrolladores cambien la forma en que llaman al modelo
Los desarrolladores que migran aplicaciones GLM existentes deben prestar atención a un comportamiento disruptivo de la API.
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max – con max la configuración predeterminada y recomendada de Z.ai para la codificación. Pero a diferencia de versiones anteriores, el pensamiento no se puede desactivar.
Aplicaciones que se envían actualmente thinking.type: "disabled" debe cambiar el valor a enabled y especifique un esfuerzo de razonamiento antes de cambiar el identificador del modelo a GLM-5.3. De lo contrario, Z.ai dice que la solicitud fallará.
Eso hace que GLM-5.3 sea una migración real en lugar de simplemente una sustitución del nombre del modelo para algunas aplicaciones de producción.
De GLM-4.5 a GLM-5.3: el rápido avance de Z.ai hacia la ingeniería agente
GLM-5.3 es el último paso en un rápido cambio de Z.ai (anteriormente conocido como Zhipu AI) hacia agentes de codificación y cargas de trabajo de ingeniería autónomas de larga duración.
GLM-4.5, lanzado en julio de 2025, marcó gran parte de esa dirección. El modelo de combinación de expertos de 355 mil millones de parámetros fue diseñado para combinar capacidades de razonamiento, codificación y agente, mientras que el GLM-4.5-Air más pequeño ofrecía 106 mil millones de parámetros totales. Z.ai lanzó los modelos con pesos abiertos y enfatizó la integración con marcos de agentes.
Le siguió GLM-4.6 en septiembre, ampliando el contexto de 128.000 a 200.000 tokens y centrándose en la codificación, el uso de herramientas y los flujos de trabajo de los agentes en entornos que incluyen Claude Code, Cline, Roo Code y Kilo Code. Z.ai también comenzó a poner mayor énfasis en la eficiencia de los tokens en las evaluaciones de codificación del mundo real en lugar de solo el rendimiento comparativo.
El mayor salto arquitectónico se produjo con GLM-5 en febrero de 2026. Z.ai escaló el modelo de los 355 mil millones de parámetros del GLM-4.5 a 744 mil millones, con 40 mil millones de parámetros activos, y aumentó los datos de preentrenamiento a 28,5 billones de tokens. También introdujo su infraestructura de aprendizaje por refuerzo asincrónico “limo” y reposicionó explícitamente a la familia GLM en torno a la “ingeniería agentica” y tareas de largo horizonte.
En junio, GLM-5.2 había convertido esa estrategia en una propuesta empresarial más directa. El modelo de 753 mil millones de parámetros llegó con una ventana de contexto estable de 1 millón de tokens, pesos abiertos bajo una licencia del MIT y soporte en más de 20 entornos de codificación. También introdujo IndexShare, que reutiliza un indexador en capas de escasa atención para reducir la carga computacional de contextos muy largos.
GLM-5.2 tenía un precio de 1,40 dólares por millón de tokens de entrada API y 4,40 dólares por millón de tokens de salida, y el precio de entrada en caché era sustancialmente más bajo, lo que posiciona a Z.ai como un competidor técnico y de precios para los laboratorios fronterizos propietarios.
Las ambiciones de Z.ai también se han expandido fuera del desarrollo de modelos. Reuters informó el mes pasado que Zhipu AI recaudó aproximadamente 31.400 millones de dólares de Hong Kong, o alrededor de 4.000 millones de dólares, a través de una venta de acciones en Hong Kong, y las ganancias se destinaron a áreas que incluyen investigación y desarrollo, infraestructura informática, talento y expansión empresarial.
En conjunto, los lanzamientos muestran una progresión consistente: GLM-4.5 razonamiento, codificación y agentes unificados; GLM-5 amplió sustancialmente el modelo de base; GLM-5.2 atacó la ingeniería de largo contexto y largo horizonte; y GLM-5.3 ahora está intentando extraer sustancialmente más capacidad de esa misma base a través del entrenamiento posterior.
Precios, ZCode y disponibilidad
GLM-5.3 ya está disponible a través del Plan de codificación GLM y ZCode de Z.ai.
ZCode es el entorno de agente de codificación propio de la empresa y admite tareas de «objetivos» de larga duración que planifican, implementan, prueban y verifican el trabajo. También ofrece control remoto de tareas en ejecución y está disponible en macOS, Windows y Linux.
Los planes de codificación GLM individuales actualmente comienzan con un precio promocional listado de $12,60 por mes para Lite con 10,000 créditos por semana. Pro cuesta $ 56 por mes con un uso seis veces Lite, mientras que Max cuesta $ 117,60 por mes con un uso 14 veces Lite. Los asientos Team Standard y Premium cuestan $88 y $188 por usuario por mes, respectivamente.
Z.ai también ha trasladado el Plan de codificación a un sistema de cuotas basado en puntos que contabiliza por separado los tokens de entrada, de entrada en caché y de salida. Las llamadas fuera del período pico de los días laborables de la empresa consumen el 50% de los puntos normales.
La compañía aún no ha proporcionado el precio general de la API GLM-5.3 en los materiales de lanzamiento suministrados, lo que hace que el costo total de producción de la API sea difícil de comparar directamente con el GLM-5.2 o los modelos fronterizos de la competencia hasta que llegue el acceso a la API por etapas.
Ese lanzamiento por etapas puede ser, en última instancia, la parte más importante de GLM-5.3.
Z.ai pasó el año pasado impulsando una estrategia de modelo abierto centrada en pesos permisivos, inferencia de bajo costo y compatibilidad con ecosistemas de agentes de codificación existentes. GLM-5.3 demuestra lo que sucede cuando esa estrategia tiene quizás demasiado éxito en un dominio sensible: una mejor ingeniería autónoma también significa una mejor investigación de seguridad autónoma.
El resultado es un modelo que promueve las ambiciones de codificación de Z.ai y al mismo tiempo obliga a la empresa a enfrentar el mismo equilibrio entre capacidad y acceso que enfrentan los laboratorios de frontera cerrada más grandes.
Por lo tanto, vale la pena observar GLM-5.3 para los desarrolladores empresariales por dos razones. Sus resultados de codificación proporcionan otra indicación de que agentes cada vez más capaces pueden surgir de mejores entornos y post-entrenamiento sin reconstruir continuamente el modelo básico subyacente. Sus resultados de ciberseguridad muestran por qué decidir cómo se distribuyen esos agentes puede llegar a ser tan importante como decidir cómo se los entrena.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
La startup china de IA Z.ai, conocida internacionalmente por su creciente gama de potentes modelos de lenguaje GLM de código abierto en gran medida, hoy lanzado GLM-5.3 con ganancias sustanciales en la codificación a largo plazo y un salto más importante (y potencialmente sensible) en las capacidades de ciberseguridad.
Las capacidades cibernéticas de GLM-5.3 ya han encontrado una «vulnerabilidad potencialmente grave en Cursor», la startup de codificación de IA recientemente adquirido por SpaceXsegún Lou, defensor de los desarrolladores de z.ai, publicando en X. VentureBeat también etiquetó a Cursor para confirmar X y está esperando respuesta.
GLM-5.3 está disponible inicialmente solo a través del Plan de codificación GLM y el entorno de codificación ZCode de la compañía, mientras que el acceso a API y los pesos abiertos llegarán más tarde, «una vez que se completen la evaluación y el endurecimiento de la seguridad», según la compañía.
Z.ai dice que planea lanzar pesas aproximadamente dos semanas después del lanzamiento.
Para los desarrolladores empresariales, la parte notable del lanzamiento no es simplemente otra ronda de mejoras comparativas. Z.ai dice que GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de la ampliación posterior al entrenamiento en más entornos, tareas más diversas y computación adicional de aprendizaje por refuerzo.
Eso convierte al GLM-5.3 en una especie de prueba de hasta qué punto se puede llevar un modelo base a escala fronteriza sin otro costoso ciclo de preentrenamiento.
«Escalar después del entrenamiento es todo lo que hicimos para GLM-5.3», escribió Z.ai en su anuncio técnico.
Los resultados sugieren un margen de maniobra considerable. Pero también han producido un problema inusual para un desarrollador de modelo abierto: según Z.ai, las capacidades de ciberseguridad mejoraron más rápido de lo previsto a medida que aumentaba la capacitación, particularmente a medida que las tareas avanzaban desde la identificación de vulnerabilidades hasta la construcción de cadenas de explotación completas.
Reuters informó el viernes que Z.ai también está introduciendo controles en torno a algunas de las capacidades más avanzadas del modelo, incluido un enfoque de «acceso confiable» para funciones sensibles.
Un gran salto en la codificación sin otro modelo base
GLM-5.3 se basa en el modelo base a escala de 743 mil millones de parámetros detrás del GLM-5.2 en lugar de reemplazarlo. En cambio, Z.ai amplió el sistema posterior al entrenamiento que ya había creado en torno al aprendizaje por refuerzo a largo plazo.
Esos entornos se parecen cada vez más a trabajos de ingeniería completos en lugar de ejercicios de programación aislados.
Z.ai describe escenarios en los que un agente recibe acceso a bases de código, documentación, clústeres de computación, sistemas de almacenamiento y resultados experimentales, luego tiene que diagnosticar problemas, modificar sistemas, ejecutar experimentos y demostrar una mejora mensurable preservando la corrección. Algunas tareas están diseñadas para aproximarse a varios días de trabajo para un ingeniero experimentado.
El enfoque produjo mejoras considerables de generación en generación en las evaluaciones reportadas por Z.ai.
GLM-5.3 salta de 4,6 a 28,3 en Terminal-Bench 3.0, de 46,2 a 66,9 en DeepSWE v1.1 y de 26,2 a 48,2 en AutomationBench. En la CLI del último examen de los agentes, mejora de 23,8 a 28,5.
El modelo no domina a todos los competidores fronterizos. La propia tabla de referencia de Z.ai muestra GPT-5.6 Sol con 34,6 y Claude Fable 5 con 33,7 en Terminal-Bench 3.0, en comparación con los 28,3 de GLM-5.3. En DeepSWE v1.1, GLM-5.3 obtiene una puntuación de 66,9, en comparación con 72,7 de GPT-5.6 Sol y 69,7 de Fable 5.
Pero Z.ai también enfatiza la eficiencia en lugar de solo la posición de referencia.
En su banco de código privado Z.ai, GLM-5.3 alcanza un resultado del 34,5% en su configuración de razonamiento Max mientras consume aproximadamente 75.000 tokens de salida por tarea. GLM-5.2 alcanza el 23,4% y consume aproximadamente 96.000. Con un esfuerzo alto, GLM-5.3 alcanza el 31,4% con aproximadamente 50.000 tokens de salida, en comparación con el 29,5% informado por Z.ai para Claude Opus 4.8 con 120.000.
Debido a que Code Bench es la evaluación privada de Z.ai, esas comparaciones deben tratarse como resultados informados por la empresa en lugar de mediciones independientes. Aún así, reducir el consumo de tokens y al mismo tiempo mejorar la finalización de tareas es operativamente importante para las empresas que implementan agentes de codificación, donde los bucles de larga duración pueden hacer que el costo de inferencia y la latencia se agraven rápidamente.
Las capacidades cibernéticas se desarrollaron más rápido de lo que esperaba Z.ai
El desarrollo más inusual es la ciberseguridad.
Z.ai introdujo entornos de descubrimiento de vulnerabilidades en la combinación posterior al entrenamiento de GLM-5.3, esperando que el modelo mejorara en la búsqueda de fallas de software. En cambio, la compañía dice que la capacidad comenzó a progresar más a lo largo de la cadena de explotación.
«A medida que escalamos después de la capacitación, la capacidad cibernética se desarrolló más rápido de lo que esperábamos», escribió Z.ai.
En CyberGym, que prueba el descubrimiento y validación de vulnerabilidades contra el código fuente, GLM-5.3 obtiene una puntuación del 84,5%, en comparación con el 77,2% de GLM-5.2. Eso también supera las puntuaciones reportadas por Z.ai para GPT-5.6 Sol con 83,6% y Mythos 5 con 83,8%.
La ventaja no se extiende a toda la pila de explotación. GLM-5.3 obtiene una puntuación del 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, pero se mantiene muy por detrás del 76,5% que informa Z.ai para GPT-5.6 Sol y el 78% de Mythos 5.
De manera similar, en ExploitGym, GLM-5.3 completa 105 tareas con un presupuesto normalizado de dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Fable 5 llega a 181 y 247, mientras que GPT-5.6 Sol llega a 216 y 293.
La dirección de viaje puede importar más que la posición en la tabla de clasificación.
Z.ai dice que el trabajo con equipos de seguridad en China ha dado como resultado 2.436 hallazgos de vulnerabilidad en 269 proyectos después de la revisión, detección y deduplicación de expertos. Su libro de divulgación enumera 1.097 como críticos o de alta gravedad, 53 divulgados públicamente y 2.383 aún bajo embargo en el momento de la publicación.
Esto crea una tensión que enfrentan cada vez más los proveedores de modelos fronterizos: las mismas capacidades de agentes de largo plazo que hacen que los modelos sean más útiles para la ingeniería de software también pueden convertirlos en investigadores de seguridad más capaces y, potencialmente, en operadores ofensivos más capaces.
GLM-5.3 también requiere que los desarrolladores cambien la forma en que llaman al modelo
Los desarrolladores que migran aplicaciones GLM existentes deben prestar atención a un comportamiento disruptivo de la API.
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max – con max la configuración predeterminada y recomendada de Z.ai para la codificación. Pero a diferencia de versiones anteriores, el pensamiento no se puede desactivar.
Aplicaciones que se envían actualmente thinking.type: "disabled" debe cambiar el valor a enabled y especifique un esfuerzo de razonamiento antes de cambiar el identificador del modelo a GLM-5.3. De lo contrario, Z.ai dice que la solicitud fallará.
Eso hace que GLM-5.3 sea una migración real en lugar de simplemente una sustitución del nombre del modelo para algunas aplicaciones de producción.
De GLM-4.5 a GLM-5.3: el rápido avance de Z.ai hacia la ingeniería agente
GLM-5.3 es el último paso en un rápido cambio de Z.ai (anteriormente conocido como Zhipu AI) hacia agentes de codificación y cargas de trabajo de ingeniería autónomas de larga duración.
GLM-4.5, lanzado en julio de 2025, marcó gran parte de esa dirección. El modelo de combinación de expertos de 355 mil millones de parámetros fue diseñado para combinar capacidades de razonamiento, codificación y agente, mientras que el GLM-4.5-Air más pequeño ofrecía 106 mil millones de parámetros totales. Z.ai lanzó los modelos con pesos abiertos y enfatizó la integración con marcos de agentes.
Le siguió GLM-4.6 en septiembre, ampliando el contexto de 128.000 a 200.000 tokens y centrándose en la codificación, el uso de herramientas y los flujos de trabajo de los agentes en entornos que incluyen Claude Code, Cline, Roo Code y Kilo Code. Z.ai también comenzó a poner mayor énfasis en la eficiencia de los tokens en las evaluaciones de codificación del mundo real en lugar de solo el rendimiento comparativo.
El mayor salto arquitectónico se produjo con GLM-5 en febrero de 2026. Z.ai escaló el modelo de los 355 mil millones de parámetros del GLM-4.5 a 744 mil millones, con 40 mil millones de parámetros activos, y aumentó los datos de preentrenamiento a 28,5 billones de tokens. También introdujo su infraestructura de aprendizaje por refuerzo asincrónico “limo” y reposicionó explícitamente a la familia GLM en torno a la “ingeniería agentica” y tareas de largo horizonte.
En junio, GLM-5.2 había convertido esa estrategia en una propuesta empresarial más directa. El modelo de 753 mil millones de parámetros llegó con una ventana de contexto estable de 1 millón de tokens, pesos abiertos bajo una licencia del MIT y soporte en más de 20 entornos de codificación. También introdujo IndexShare, que reutiliza un indexador en capas de escasa atención para reducir la carga computacional de contextos muy largos.
GLM-5.2 tenía un precio de 1,40 dólares por millón de tokens de entrada API y 4,40 dólares por millón de tokens de salida, y el precio de entrada en caché era sustancialmente más bajo, lo que posiciona a Z.ai como un competidor técnico y de precios para los laboratorios fronterizos propietarios.
Las ambiciones de Z.ai también se han expandido fuera del desarrollo de modelos. Reuters informó el mes pasado que Zhipu AI recaudó aproximadamente 31.400 millones de dólares de Hong Kong, o alrededor de 4.000 millones de dólares, a través de una venta de acciones en Hong Kong, y las ganancias se destinaron a áreas que incluyen investigación y desarrollo, infraestructura informática, talento y expansión empresarial.
En conjunto, los lanzamientos muestran una progresión consistente: GLM-4.5 razonamiento, codificación y agentes unificados; GLM-5 amplió sustancialmente el modelo de base; GLM-5.2 atacó la ingeniería de largo contexto y largo horizonte; y GLM-5.3 ahora está intentando extraer sustancialmente más capacidad de esa misma base a través del entrenamiento posterior.
Precios, ZCode y disponibilidad
GLM-5.3 ya está disponible a través del Plan de codificación GLM y ZCode de Z.ai.
ZCode es el entorno de agente de codificación propio de la empresa y admite tareas de «objetivos» de larga duración que planifican, implementan, prueban y verifican el trabajo. También ofrece control remoto de tareas en ejecución y está disponible en macOS, Windows y Linux.
Los planes de codificación GLM individuales actualmente comienzan con un precio promocional listado de $12,60 por mes para Lite con 10,000 créditos por semana. Pro cuesta $ 56 por mes con un uso seis veces Lite, mientras que Max cuesta $ 117,60 por mes con un uso 14 veces Lite. Los asientos Team Standard y Premium cuestan $88 y $188 por usuario por mes, respectivamente.
Z.ai también ha trasladado el Plan de codificación a un sistema de cuotas basado en puntos que contabiliza por separado los tokens de entrada, de entrada en caché y de salida. Las llamadas fuera del período pico de los días laborables de la empresa consumen el 50% de los puntos normales.
La compañía aún no ha proporcionado el precio general de la API GLM-5.3 en los materiales de lanzamiento suministrados, lo que hace que el costo total de producción de la API sea difícil de comparar directamente con el GLM-5.2 o los modelos fronterizos de la competencia hasta que llegue el acceso a la API por etapas.
Ese lanzamiento por etapas puede ser, en última instancia, la parte más importante de GLM-5.3.
Z.ai pasó el año pasado impulsando una estrategia de modelo abierto centrada en pesos permisivos, inferencia de bajo costo y compatibilidad con ecosistemas de agentes de codificación existentes. GLM-5.3 demuestra lo que sucede cuando esa estrategia tiene quizás demasiado éxito en un dominio sensible: una mejor ingeniería autónoma también significa una mejor investigación de seguridad autónoma.
El resultado es un modelo que promueve las ambiciones de codificación de Z.ai y al mismo tiempo obliga a la empresa a enfrentar el mismo equilibrio entre capacidad y acceso que enfrentan los laboratorios de frontera cerrada más grandes.
Por lo tanto, vale la pena observar GLM-5.3 para los desarrolladores empresariales por dos razones. Sus resultados de codificación proporcionan otra indicación de que agentes cada vez más capaces pueden surgir de mejores entornos y post-entrenamiento sin reconstruir continuamente el modelo básico subyacente. Sus resultados de ciberseguridad muestran por qué decidir cómo se distribuyen esos agentes puede llegar a ser tan importante como decidir cómo se los entrena.
La startup china de IA Z.ai, conocida internacionalmente por su creciente gama de potentes modelos de lenguaje GLM de código abierto en gran medida, hoy lanzado GLM-5.3 con ganancias sustanciales en la codificación a largo plazo y un salto más importante (y potencialmente sensible) en las capacidades de ciberseguridad.
Las capacidades cibernéticas de GLM-5.3 ya han encontrado una «vulnerabilidad potencialmente grave en Cursor», la startup de codificación de IA recientemente adquirido por SpaceXsegún Lou, defensor de los desarrolladores de z.ai, publicando en X. VentureBeat también etiquetó a Cursor para confirmar X y está esperando respuesta.
GLM-5.3 está disponible inicialmente solo a través del Plan de codificación GLM y el entorno de codificación ZCode de la compañía, mientras que el acceso a API y los pesos abiertos llegarán más tarde, «una vez que se completen la evaluación y el endurecimiento de la seguridad», según la compañía.
Z.ai dice que planea lanzar pesas aproximadamente dos semanas después del lanzamiento.
Para los desarrolladores empresariales, la parte notable del lanzamiento no es simplemente otra ronda de mejoras comparativas. Z.ai dice que GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de la ampliación posterior al entrenamiento en más entornos, tareas más diversas y computación adicional de aprendizaje por refuerzo.
Eso convierte al GLM-5.3 en una especie de prueba de hasta qué punto se puede llevar un modelo base a escala fronteriza sin otro costoso ciclo de preentrenamiento.
«Escalar después del entrenamiento es todo lo que hicimos para GLM-5.3», escribió Z.ai en su anuncio técnico.
Los resultados sugieren un margen de maniobra considerable. Pero también han producido un problema inusual para un desarrollador de modelo abierto: según Z.ai, las capacidades de ciberseguridad mejoraron más rápido de lo previsto a medida que aumentaba la capacitación, particularmente a medida que las tareas avanzaban desde la identificación de vulnerabilidades hasta la construcción de cadenas de explotación completas.
Reuters informó el viernes que Z.ai también está introduciendo controles en torno a algunas de las capacidades más avanzadas del modelo, incluido un enfoque de «acceso confiable» para funciones sensibles.
Un gran salto en la codificación sin otro modelo base
GLM-5.3 se basa en el modelo base a escala de 743 mil millones de parámetros detrás del GLM-5.2 en lugar de reemplazarlo. En cambio, Z.ai amplió el sistema posterior al entrenamiento que ya había creado en torno al aprendizaje por refuerzo a largo plazo.
Esos entornos se parecen cada vez más a trabajos de ingeniería completos en lugar de ejercicios de programación aislados.
Z.ai describe escenarios en los que un agente recibe acceso a bases de código, documentación, clústeres de computación, sistemas de almacenamiento y resultados experimentales, luego tiene que diagnosticar problemas, modificar sistemas, ejecutar experimentos y demostrar una mejora mensurable preservando la corrección. Algunas tareas están diseñadas para aproximarse a varios días de trabajo para un ingeniero experimentado.
El enfoque produjo mejoras considerables de generación en generación en las evaluaciones reportadas por Z.ai.
GLM-5.3 salta de 4,6 a 28,3 en Terminal-Bench 3.0, de 46,2 a 66,9 en DeepSWE v1.1 y de 26,2 a 48,2 en AutomationBench. En la CLI del último examen de los agentes, mejora de 23,8 a 28,5.
El modelo no domina a todos los competidores fronterizos. La propia tabla de referencia de Z.ai muestra GPT-5.6 Sol con 34,6 y Claude Fable 5 con 33,7 en Terminal-Bench 3.0, en comparación con los 28,3 de GLM-5.3. En DeepSWE v1.1, GLM-5.3 obtiene una puntuación de 66,9, en comparación con 72,7 de GPT-5.6 Sol y 69,7 de Fable 5.
Pero Z.ai también enfatiza la eficiencia en lugar de solo la posición de referencia.
En su banco de código privado Z.ai, GLM-5.3 alcanza un resultado del 34,5% en su configuración de razonamiento Max mientras consume aproximadamente 75.000 tokens de salida por tarea. GLM-5.2 alcanza el 23,4% y consume aproximadamente 96.000. Con un esfuerzo alto, GLM-5.3 alcanza el 31,4% con aproximadamente 50.000 tokens de salida, en comparación con el 29,5% informado por Z.ai para Claude Opus 4.8 con 120.000.
Debido a que Code Bench es la evaluación privada de Z.ai, esas comparaciones deben tratarse como resultados informados por la empresa en lugar de mediciones independientes. Aún así, reducir el consumo de tokens y al mismo tiempo mejorar la finalización de tareas es operativamente importante para las empresas que implementan agentes de codificación, donde los bucles de larga duración pueden hacer que el costo de inferencia y la latencia se agraven rápidamente.
Las capacidades cibernéticas se desarrollaron más rápido de lo que esperaba Z.ai
El desarrollo más inusual es la ciberseguridad.
Z.ai introdujo entornos de descubrimiento de vulnerabilidades en la combinación posterior al entrenamiento de GLM-5.3, esperando que el modelo mejorara en la búsqueda de fallas de software. En cambio, la compañía dice que la capacidad comenzó a progresar más a lo largo de la cadena de explotación.
«A medida que escalamos después de la capacitación, la capacidad cibernética se desarrolló más rápido de lo que esperábamos», escribió Z.ai.
En CyberGym, que prueba el descubrimiento y validación de vulnerabilidades contra el código fuente, GLM-5.3 obtiene una puntuación del 84,5%, en comparación con el 77,2% de GLM-5.2. Eso también supera las puntuaciones reportadas por Z.ai para GPT-5.6 Sol con 83,6% y Mythos 5 con 83,8%.
La ventaja no se extiende a toda la pila de explotación. GLM-5.3 obtiene una puntuación del 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, pero se mantiene muy por detrás del 76,5% que informa Z.ai para GPT-5.6 Sol y el 78% de Mythos 5.
De manera similar, en ExploitGym, GLM-5.3 completa 105 tareas con un presupuesto normalizado de dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Fable 5 llega a 181 y 247, mientras que GPT-5.6 Sol llega a 216 y 293.
La dirección de viaje puede importar más que la posición en la tabla de clasificación.
Z.ai dice que el trabajo con equipos de seguridad en China ha dado como resultado 2.436 hallazgos de vulnerabilidad en 269 proyectos después de la revisión, detección y deduplicación de expertos. Su libro de divulgación enumera 1.097 como críticos o de alta gravedad, 53 divulgados públicamente y 2.383 aún bajo embargo en el momento de la publicación.
Esto crea una tensión que enfrentan cada vez más los proveedores de modelos fronterizos: las mismas capacidades de agentes de largo plazo que hacen que los modelos sean más útiles para la ingeniería de software también pueden convertirlos en investigadores de seguridad más capaces y, potencialmente, en operadores ofensivos más capaces.
GLM-5.3 también requiere que los desarrolladores cambien la forma en que llaman al modelo
Los desarrolladores que migran aplicaciones GLM existentes deben prestar atención a un comportamiento disruptivo de la API.
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max – con max la configuración predeterminada y recomendada de Z.ai para la codificación. Pero a diferencia de versiones anteriores, el pensamiento no se puede desactivar.
Aplicaciones que se envían actualmente thinking.type: "disabled" debe cambiar el valor a enabled y especifique un esfuerzo de razonamiento antes de cambiar el identificador del modelo a GLM-5.3. De lo contrario, Z.ai dice que la solicitud fallará.
Eso hace que GLM-5.3 sea una migración real en lugar de simplemente una sustitución del nombre del modelo para algunas aplicaciones de producción.
De GLM-4.5 a GLM-5.3: el rápido avance de Z.ai hacia la ingeniería agente
GLM-5.3 es el último paso en un rápido cambio de Z.ai (anteriormente conocido como Zhipu AI) hacia agentes de codificación y cargas de trabajo de ingeniería autónomas de larga duración.
GLM-4.5, lanzado en julio de 2025, marcó gran parte de esa dirección. El modelo de combinación de expertos de 355 mil millones de parámetros fue diseñado para combinar capacidades de razonamiento, codificación y agente, mientras que el GLM-4.5-Air más pequeño ofrecía 106 mil millones de parámetros totales. Z.ai lanzó los modelos con pesos abiertos y enfatizó la integración con marcos de agentes.
Le siguió GLM-4.6 en septiembre, ampliando el contexto de 128.000 a 200.000 tokens y centrándose en la codificación, el uso de herramientas y los flujos de trabajo de los agentes en entornos que incluyen Claude Code, Cline, Roo Code y Kilo Code. Z.ai también comenzó a poner mayor énfasis en la eficiencia de los tokens en las evaluaciones de codificación del mundo real en lugar de solo el rendimiento comparativo.
El mayor salto arquitectónico se produjo con GLM-5 en febrero de 2026. Z.ai escaló el modelo de los 355 mil millones de parámetros del GLM-4.5 a 744 mil millones, con 40 mil millones de parámetros activos, y aumentó los datos de preentrenamiento a 28,5 billones de tokens. También introdujo su infraestructura de aprendizaje por refuerzo asincrónico “limo” y reposicionó explícitamente a la familia GLM en torno a la “ingeniería agentica” y tareas de largo horizonte.
En junio, GLM-5.2 había convertido esa estrategia en una propuesta empresarial más directa. El modelo de 753 mil millones de parámetros llegó con una ventana de contexto estable de 1 millón de tokens, pesos abiertos bajo una licencia del MIT y soporte en más de 20 entornos de codificación. También introdujo IndexShare, que reutiliza un indexador en capas de escasa atención para reducir la carga computacional de contextos muy largos.
GLM-5.2 tenía un precio de 1,40 dólares por millón de tokens de entrada API y 4,40 dólares por millón de tokens de salida, y el precio de entrada en caché era sustancialmente más bajo, lo que posiciona a Z.ai como un competidor técnico y de precios para los laboratorios fronterizos propietarios.
Las ambiciones de Z.ai también se han expandido fuera del desarrollo de modelos. Reuters informó el mes pasado que Zhipu AI recaudó aproximadamente 31.400 millones de dólares de Hong Kong, o alrededor de 4.000 millones de dólares, a través de una venta de acciones en Hong Kong, y las ganancias se destinaron a áreas que incluyen investigación y desarrollo, infraestructura informática, talento y expansión empresarial.
En conjunto, los lanzamientos muestran una progresión consistente: GLM-4.5 razonamiento, codificación y agentes unificados; GLM-5 amplió sustancialmente el modelo de base; GLM-5.2 atacó la ingeniería de largo contexto y largo horizonte; y GLM-5.3 ahora está intentando extraer sustancialmente más capacidad de esa misma base a través del entrenamiento posterior.
Precios, ZCode y disponibilidad
GLM-5.3 ya está disponible a través del Plan de codificación GLM y ZCode de Z.ai.
ZCode es el entorno de agente de codificación propio de la empresa y admite tareas de «objetivos» de larga duración que planifican, implementan, prueban y verifican el trabajo. También ofrece control remoto de tareas en ejecución y está disponible en macOS, Windows y Linux.
Los planes de codificación GLM individuales actualmente comienzan con un precio promocional listado de $12,60 por mes para Lite con 10,000 créditos por semana. Pro cuesta $ 56 por mes con un uso seis veces Lite, mientras que Max cuesta $ 117,60 por mes con un uso 14 veces Lite. Los asientos Team Standard y Premium cuestan $88 y $188 por usuario por mes, respectivamente.
Z.ai también ha trasladado el Plan de codificación a un sistema de cuotas basado en puntos que contabiliza por separado los tokens de entrada, de entrada en caché y de salida. Las llamadas fuera del período pico de los días laborables de la empresa consumen el 50% de los puntos normales.
La compañía aún no ha proporcionado el precio general de la API GLM-5.3 en los materiales de lanzamiento suministrados, lo que hace que el costo total de producción de la API sea difícil de comparar directamente con el GLM-5.2 o los modelos fronterizos de la competencia hasta que llegue el acceso a la API por etapas.
Ese lanzamiento por etapas puede ser, en última instancia, la parte más importante de GLM-5.3.
Z.ai pasó el año pasado impulsando una estrategia de modelo abierto centrada en pesos permisivos, inferencia de bajo costo y compatibilidad con ecosistemas de agentes de codificación existentes. GLM-5.3 demuestra lo que sucede cuando esa estrategia tiene quizás demasiado éxito en un dominio sensible: una mejor ingeniería autónoma también significa una mejor investigación de seguridad autónoma.
El resultado es un modelo que promueve las ambiciones de codificación de Z.ai y al mismo tiempo obliga a la empresa a enfrentar el mismo equilibrio entre capacidad y acceso que enfrentan los laboratorios de frontera cerrada más grandes.
Por lo tanto, vale la pena observar GLM-5.3 para los desarrolladores empresariales por dos razones. Sus resultados de codificación proporcionan otra indicación de que agentes cada vez más capaces pueden surgir de mejores entornos y post-entrenamiento sin reconstruir continuamente el modelo básico subyacente. Sus resultados de ciberseguridad muestran por qué decidir cómo se distribuyen esos agentes puede llegar a ser tan importante como decidir cómo se los entrena.
La startup china de IA Z.ai, conocida internacionalmente por su creciente gama de potentes modelos de lenguaje GLM de código abierto en gran medida, hoy lanzado GLM-5.3 con ganancias sustanciales en la codificación a largo plazo y un salto más importante (y potencialmente sensible) en las capacidades de ciberseguridad.
Las capacidades cibernéticas de GLM-5.3 ya han encontrado una «vulnerabilidad potencialmente grave en Cursor», la startup de codificación de IA recientemente adquirido por SpaceXsegún Lou, defensor de los desarrolladores de z.ai, publicando en X. VentureBeat también etiquetó a Cursor para confirmar X y está esperando respuesta.
GLM-5.3 está disponible inicialmente solo a través del Plan de codificación GLM y el entorno de codificación ZCode de la compañía, mientras que el acceso a API y los pesos abiertos llegarán más tarde, «una vez que se completen la evaluación y el endurecimiento de la seguridad», según la compañía.
Z.ai dice que planea lanzar pesas aproximadamente dos semanas después del lanzamiento.
Para los desarrolladores empresariales, la parte notable del lanzamiento no es simplemente otra ronda de mejoras comparativas. Z.ai dice que GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de la ampliación posterior al entrenamiento en más entornos, tareas más diversas y computación adicional de aprendizaje por refuerzo.
Eso convierte al GLM-5.3 en una especie de prueba de hasta qué punto se puede llevar un modelo base a escala fronteriza sin otro costoso ciclo de preentrenamiento.
«Escalar después del entrenamiento es todo lo que hicimos para GLM-5.3», escribió Z.ai en su anuncio técnico.
Los resultados sugieren un margen de maniobra considerable. Pero también han producido un problema inusual para un desarrollador de modelo abierto: según Z.ai, las capacidades de ciberseguridad mejoraron más rápido de lo previsto a medida que aumentaba la capacitación, particularmente a medida que las tareas avanzaban desde la identificación de vulnerabilidades hasta la construcción de cadenas de explotación completas.
Reuters informó el viernes que Z.ai también está introduciendo controles en torno a algunas de las capacidades más avanzadas del modelo, incluido un enfoque de «acceso confiable» para funciones sensibles.
Un gran salto en la codificación sin otro modelo base
GLM-5.3 se basa en el modelo base a escala de 743 mil millones de parámetros detrás del GLM-5.2 en lugar de reemplazarlo. En cambio, Z.ai amplió el sistema posterior al entrenamiento que ya había creado en torno al aprendizaje por refuerzo a largo plazo.
Esos entornos se parecen cada vez más a trabajos de ingeniería completos en lugar de ejercicios de programación aislados.
Z.ai describe escenarios en los que un agente recibe acceso a bases de código, documentación, clústeres de computación, sistemas de almacenamiento y resultados experimentales, luego tiene que diagnosticar problemas, modificar sistemas, ejecutar experimentos y demostrar una mejora mensurable preservando la corrección. Algunas tareas están diseñadas para aproximarse a varios días de trabajo para un ingeniero experimentado.
El enfoque produjo mejoras considerables de generación en generación en las evaluaciones reportadas por Z.ai.
GLM-5.3 salta de 4,6 a 28,3 en Terminal-Bench 3.0, de 46,2 a 66,9 en DeepSWE v1.1 y de 26,2 a 48,2 en AutomationBench. En la CLI del último examen de los agentes, mejora de 23,8 a 28,5.
El modelo no domina a todos los competidores fronterizos. La propia tabla de referencia de Z.ai muestra GPT-5.6 Sol con 34,6 y Claude Fable 5 con 33,7 en Terminal-Bench 3.0, en comparación con los 28,3 de GLM-5.3. En DeepSWE v1.1, GLM-5.3 obtiene una puntuación de 66,9, en comparación con 72,7 de GPT-5.6 Sol y 69,7 de Fable 5.
Pero Z.ai también enfatiza la eficiencia en lugar de solo la posición de referencia.
En su banco de código privado Z.ai, GLM-5.3 alcanza un resultado del 34,5% en su configuración de razonamiento Max mientras consume aproximadamente 75.000 tokens de salida por tarea. GLM-5.2 alcanza el 23,4% y consume aproximadamente 96.000. Con un esfuerzo alto, GLM-5.3 alcanza el 31,4% con aproximadamente 50.000 tokens de salida, en comparación con el 29,5% informado por Z.ai para Claude Opus 4.8 con 120.000.
Debido a que Code Bench es la evaluación privada de Z.ai, esas comparaciones deben tratarse como resultados informados por la empresa en lugar de mediciones independientes. Aún así, reducir el consumo de tokens y al mismo tiempo mejorar la finalización de tareas es operativamente importante para las empresas que implementan agentes de codificación, donde los bucles de larga duración pueden hacer que el costo de inferencia y la latencia se agraven rápidamente.
Las capacidades cibernéticas se desarrollaron más rápido de lo que esperaba Z.ai
El desarrollo más inusual es la ciberseguridad.
Z.ai introdujo entornos de descubrimiento de vulnerabilidades en la combinación posterior al entrenamiento de GLM-5.3, esperando que el modelo mejorara en la búsqueda de fallas de software. En cambio, la compañía dice que la capacidad comenzó a progresar más a lo largo de la cadena de explotación.
«A medida que escalamos después de la capacitación, la capacidad cibernética se desarrolló más rápido de lo que esperábamos», escribió Z.ai.
En CyberGym, que prueba el descubrimiento y validación de vulnerabilidades contra el código fuente, GLM-5.3 obtiene una puntuación del 84,5%, en comparación con el 77,2% de GLM-5.2. Eso también supera las puntuaciones reportadas por Z.ai para GPT-5.6 Sol con 83,6% y Mythos 5 con 83,8%.
La ventaja no se extiende a toda la pila de explotación. GLM-5.3 obtiene una puntuación del 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, pero se mantiene muy por detrás del 76,5% que informa Z.ai para GPT-5.6 Sol y el 78% de Mythos 5.
De manera similar, en ExploitGym, GLM-5.3 completa 105 tareas con un presupuesto normalizado de dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Fable 5 llega a 181 y 247, mientras que GPT-5.6 Sol llega a 216 y 293.
La dirección de viaje puede importar más que la posición en la tabla de clasificación.
Z.ai dice que el trabajo con equipos de seguridad en China ha dado como resultado 2.436 hallazgos de vulnerabilidad en 269 proyectos después de la revisión, detección y deduplicación de expertos. Su libro de divulgación enumera 1.097 como críticos o de alta gravedad, 53 divulgados públicamente y 2.383 aún bajo embargo en el momento de la publicación.
Esto crea una tensión que enfrentan cada vez más los proveedores de modelos fronterizos: las mismas capacidades de agentes de largo plazo que hacen que los modelos sean más útiles para la ingeniería de software también pueden convertirlos en investigadores de seguridad más capaces y, potencialmente, en operadores ofensivos más capaces.
GLM-5.3 también requiere que los desarrolladores cambien la forma en que llaman al modelo
Los desarrolladores que migran aplicaciones GLM existentes deben prestar atención a un comportamiento disruptivo de la API.
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max – con max la configuración predeterminada y recomendada de Z.ai para la codificación. Pero a diferencia de versiones anteriores, el pensamiento no se puede desactivar.
Aplicaciones que se envían actualmente thinking.type: "disabled" debe cambiar el valor a enabled y especifique un esfuerzo de razonamiento antes de cambiar el identificador del modelo a GLM-5.3. De lo contrario, Z.ai dice que la solicitud fallará.
Eso hace que GLM-5.3 sea una migración real en lugar de simplemente una sustitución del nombre del modelo para algunas aplicaciones de producción.
De GLM-4.5 a GLM-5.3: el rápido avance de Z.ai hacia la ingeniería agente
GLM-5.3 es el último paso en un rápido cambio de Z.ai (anteriormente conocido como Zhipu AI) hacia agentes de codificación y cargas de trabajo de ingeniería autónomas de larga duración.
GLM-4.5, lanzado en julio de 2025, marcó gran parte de esa dirección. El modelo de combinación de expertos de 355 mil millones de parámetros fue diseñado para combinar capacidades de razonamiento, codificación y agente, mientras que el GLM-4.5-Air más pequeño ofrecía 106 mil millones de parámetros totales. Z.ai lanzó los modelos con pesos abiertos y enfatizó la integración con marcos de agentes.
Le siguió GLM-4.6 en septiembre, ampliando el contexto de 128.000 a 200.000 tokens y centrándose en la codificación, el uso de herramientas y los flujos de trabajo de los agentes en entornos que incluyen Claude Code, Cline, Roo Code y Kilo Code. Z.ai también comenzó a poner mayor énfasis en la eficiencia de los tokens en las evaluaciones de codificación del mundo real en lugar de solo el rendimiento comparativo.
El mayor salto arquitectónico se produjo con GLM-5 en febrero de 2026. Z.ai escaló el modelo de los 355 mil millones de parámetros del GLM-4.5 a 744 mil millones, con 40 mil millones de parámetros activos, y aumentó los datos de preentrenamiento a 28,5 billones de tokens. También introdujo su infraestructura de aprendizaje por refuerzo asincrónico “limo” y reposicionó explícitamente a la familia GLM en torno a la “ingeniería agentica” y tareas de largo horizonte.
En junio, GLM-5.2 había convertido esa estrategia en una propuesta empresarial más directa. El modelo de 753 mil millones de parámetros llegó con una ventana de contexto estable de 1 millón de tokens, pesos abiertos bajo una licencia del MIT y soporte en más de 20 entornos de codificación. También introdujo IndexShare, que reutiliza un indexador en capas de escasa atención para reducir la carga computacional de contextos muy largos.
GLM-5.2 tenía un precio de 1,40 dólares por millón de tokens de entrada API y 4,40 dólares por millón de tokens de salida, y el precio de entrada en caché era sustancialmente más bajo, lo que posiciona a Z.ai como un competidor técnico y de precios para los laboratorios fronterizos propietarios.
Las ambiciones de Z.ai también se han expandido fuera del desarrollo de modelos. Reuters informó el mes pasado que Zhipu AI recaudó aproximadamente 31.400 millones de dólares de Hong Kong, o alrededor de 4.000 millones de dólares, a través de una venta de acciones en Hong Kong, y las ganancias se destinaron a áreas que incluyen investigación y desarrollo, infraestructura informática, talento y expansión empresarial.
En conjunto, los lanzamientos muestran una progresión consistente: GLM-4.5 razonamiento, codificación y agentes unificados; GLM-5 amplió sustancialmente el modelo de base; GLM-5.2 atacó la ingeniería de largo contexto y largo horizonte; y GLM-5.3 ahora está intentando extraer sustancialmente más capacidad de esa misma base a través del entrenamiento posterior.
Precios, ZCode y disponibilidad
GLM-5.3 ya está disponible a través del Plan de codificación GLM y ZCode de Z.ai.
ZCode es el entorno de agente de codificación propio de la empresa y admite tareas de «objetivos» de larga duración que planifican, implementan, prueban y verifican el trabajo. También ofrece control remoto de tareas en ejecución y está disponible en macOS, Windows y Linux.
Los planes de codificación GLM individuales actualmente comienzan con un precio promocional listado de $12,60 por mes para Lite con 10,000 créditos por semana. Pro cuesta $ 56 por mes con un uso seis veces Lite, mientras que Max cuesta $ 117,60 por mes con un uso 14 veces Lite. Los asientos Team Standard y Premium cuestan $88 y $188 por usuario por mes, respectivamente.
Z.ai también ha trasladado el Plan de codificación a un sistema de cuotas basado en puntos que contabiliza por separado los tokens de entrada, de entrada en caché y de salida. Las llamadas fuera del período pico de los días laborables de la empresa consumen el 50% de los puntos normales.
La compañía aún no ha proporcionado el precio general de la API GLM-5.3 en los materiales de lanzamiento suministrados, lo que hace que el costo total de producción de la API sea difícil de comparar directamente con el GLM-5.2 o los modelos fronterizos de la competencia hasta que llegue el acceso a la API por etapas.
Ese lanzamiento por etapas puede ser, en última instancia, la parte más importante de GLM-5.3.
Z.ai pasó el año pasado impulsando una estrategia de modelo abierto centrada en pesos permisivos, inferencia de bajo costo y compatibilidad con ecosistemas de agentes de codificación existentes. GLM-5.3 demuestra lo que sucede cuando esa estrategia tiene quizás demasiado éxito en un dominio sensible: una mejor ingeniería autónoma también significa una mejor investigación de seguridad autónoma.
El resultado es un modelo que promueve las ambiciones de codificación de Z.ai y al mismo tiempo obliga a la empresa a enfrentar el mismo equilibrio entre capacidad y acceso que enfrentan los laboratorios de frontera cerrada más grandes.
Por lo tanto, vale la pena observar GLM-5.3 para los desarrolladores empresariales por dos razones. Sus resultados de codificación proporcionan otra indicación de que agentes cada vez más capaces pueden surgir de mejores entornos y post-entrenamiento sin reconstruir continuamente el modelo básico subyacente. Sus resultados de ciberseguridad muestran por qué decidir cómo se distribuyen esos agentes puede llegar a ser tan importante como decidir cómo se los entrena.
La startup china de IA Z.ai, conocida internacionalmente por su creciente gama de potentes modelos de lenguaje GLM de código abierto en gran medida, hoy lanzado GLM-5.3 con ganancias sustanciales en la codificación a largo plazo y un salto más importante (y potencialmente sensible) en las capacidades de ciberseguridad.
Las capacidades cibernéticas de GLM-5.3 ya han encontrado una «vulnerabilidad potencialmente grave en Cursor», la startup de codificación de IA recientemente adquirido por SpaceXsegún Lou, defensor de los desarrolladores de z.ai, publicando en X. VentureBeat también etiquetó a Cursor para confirmar X y está esperando respuesta.
GLM-5.3 está disponible inicialmente solo a través del Plan de codificación GLM y el entorno de codificación ZCode de la compañía, mientras que el acceso a API y los pesos abiertos llegarán más tarde, «una vez que se completen la evaluación y el endurecimiento de la seguridad», según la compañía.
Z.ai dice que planea lanzar pesas aproximadamente dos semanas después del lanzamiento.
Para los desarrolladores empresariales, la parte notable del lanzamiento no es simplemente otra ronda de mejoras comparativas. Z.ai dice que GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y que las mejoras provienen enteramente de la ampliación posterior al entrenamiento en más entornos, tareas más diversas y computación adicional de aprendizaje por refuerzo.
Eso convierte al GLM-5.3 en una especie de prueba de hasta qué punto se puede llevar un modelo base a escala fronteriza sin otro costoso ciclo de preentrenamiento.
«Escalar después del entrenamiento es todo lo que hicimos para GLM-5.3», escribió Z.ai en su anuncio técnico.
Los resultados sugieren un margen de maniobra considerable. Pero también han producido un problema inusual para un desarrollador de modelo abierto: según Z.ai, las capacidades de ciberseguridad mejoraron más rápido de lo previsto a medida que aumentaba la capacitación, particularmente a medida que las tareas avanzaban desde la identificación de vulnerabilidades hasta la construcción de cadenas de explotación completas.
Reuters informó el viernes que Z.ai también está introduciendo controles en torno a algunas de las capacidades más avanzadas del modelo, incluido un enfoque de «acceso confiable» para funciones sensibles.
Un gran salto en la codificación sin otro modelo base
GLM-5.3 se basa en el modelo base a escala de 743 mil millones de parámetros detrás del GLM-5.2 en lugar de reemplazarlo. En cambio, Z.ai amplió el sistema posterior al entrenamiento que ya había creado en torno al aprendizaje por refuerzo a largo plazo.
Esos entornos se parecen cada vez más a trabajos de ingeniería completos en lugar de ejercicios de programación aislados.
Z.ai describe escenarios en los que un agente recibe acceso a bases de código, documentación, clústeres de computación, sistemas de almacenamiento y resultados experimentales, luego tiene que diagnosticar problemas, modificar sistemas, ejecutar experimentos y demostrar una mejora mensurable preservando la corrección. Algunas tareas están diseñadas para aproximarse a varios días de trabajo para un ingeniero experimentado.
El enfoque produjo mejoras considerables de generación en generación en las evaluaciones reportadas por Z.ai.
GLM-5.3 salta de 4,6 a 28,3 en Terminal-Bench 3.0, de 46,2 a 66,9 en DeepSWE v1.1 y de 26,2 a 48,2 en AutomationBench. En la CLI del último examen de los agentes, mejora de 23,8 a 28,5.
El modelo no domina a todos los competidores fronterizos. La propia tabla de referencia de Z.ai muestra GPT-5.6 Sol con 34,6 y Claude Fable 5 con 33,7 en Terminal-Bench 3.0, en comparación con los 28,3 de GLM-5.3. En DeepSWE v1.1, GLM-5.3 obtiene una puntuación de 66,9, en comparación con 72,7 de GPT-5.6 Sol y 69,7 de Fable 5.
Pero Z.ai también enfatiza la eficiencia en lugar de solo la posición de referencia.
En su banco de código privado Z.ai, GLM-5.3 alcanza un resultado del 34,5% en su configuración de razonamiento Max mientras consume aproximadamente 75.000 tokens de salida por tarea. GLM-5.2 alcanza el 23,4% y consume aproximadamente 96.000. Con un esfuerzo alto, GLM-5.3 alcanza el 31,4% con aproximadamente 50.000 tokens de salida, en comparación con el 29,5% informado por Z.ai para Claude Opus 4.8 con 120.000.
Debido a que Code Bench es la evaluación privada de Z.ai, esas comparaciones deben tratarse como resultados informados por la empresa en lugar de mediciones independientes. Aún así, reducir el consumo de tokens y al mismo tiempo mejorar la finalización de tareas es operativamente importante para las empresas que implementan agentes de codificación, donde los bucles de larga duración pueden hacer que el costo de inferencia y la latencia se agraven rápidamente.
Las capacidades cibernéticas se desarrollaron más rápido de lo que esperaba Z.ai
El desarrollo más inusual es la ciberseguridad.
Z.ai introdujo entornos de descubrimiento de vulnerabilidades en la combinación posterior al entrenamiento de GLM-5.3, esperando que el modelo mejorara en la búsqueda de fallas de software. En cambio, la compañía dice que la capacidad comenzó a progresar más a lo largo de la cadena de explotación.
«A medida que escalamos después de la capacitación, la capacidad cibernética se desarrolló más rápido de lo que esperábamos», escribió Z.ai.
En CyberGym, que prueba el descubrimiento y validación de vulnerabilidades contra el código fuente, GLM-5.3 obtiene una puntuación del 84,5%, en comparación con el 77,2% de GLM-5.2. Eso también supera las puntuaciones reportadas por Z.ai para GPT-5.6 Sol con 83,6% y Mythos 5 con 83,8%.
La ventaja no se extiende a toda la pila de explotación. GLM-5.3 obtiene una puntuación del 54,4% en ExploitBench, más del doble del 24,4% de GLM-5.2, pero se mantiene muy por detrás del 76,5% que informa Z.ai para GPT-5.6 Sol y el 78% de Mythos 5.
De manera similar, en ExploitGym, GLM-5.3 completa 105 tareas con un presupuesto normalizado de dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Fable 5 llega a 181 y 247, mientras que GPT-5.6 Sol llega a 216 y 293.
La dirección de viaje puede importar más que la posición en la tabla de clasificación.
Z.ai dice que el trabajo con equipos de seguridad en China ha dado como resultado 2.436 hallazgos de vulnerabilidad en 269 proyectos después de la revisión, detección y deduplicación de expertos. Su libro de divulgación enumera 1.097 como críticos o de alta gravedad, 53 divulgados públicamente y 2.383 aún bajo embargo en el momento de la publicación.
Esto crea una tensión que enfrentan cada vez más los proveedores de modelos fronterizos: las mismas capacidades de agentes de largo plazo que hacen que los modelos sean más útiles para la ingeniería de software también pueden convertirlos en investigadores de seguridad más capaces y, potencialmente, en operadores ofensivos más capaces.
GLM-5.3 también requiere que los desarrolladores cambien la forma en que llaman al modelo
Los desarrolladores que migran aplicaciones GLM existentes deben prestar atención a un comportamiento disruptivo de la API.
GLM-5.3 admite tres niveles de esfuerzo de razonamiento: low, high y max – con max la configuración predeterminada y recomendada de Z.ai para la codificación. Pero a diferencia de versiones anteriores, el pensamiento no se puede desactivar.
Aplicaciones que se envían actualmente thinking.type: "disabled" debe cambiar el valor a enabled y especifique un esfuerzo de razonamiento antes de cambiar el identificador del modelo a GLM-5.3. De lo contrario, Z.ai dice que la solicitud fallará.
Eso hace que GLM-5.3 sea una migración real en lugar de simplemente una sustitución del nombre del modelo para algunas aplicaciones de producción.
De GLM-4.5 a GLM-5.3: el rápido avance de Z.ai hacia la ingeniería agente
GLM-5.3 es el último paso en un rápido cambio de Z.ai (anteriormente conocido como Zhipu AI) hacia agentes de codificación y cargas de trabajo de ingeniería autónomas de larga duración.
GLM-4.5, lanzado en julio de 2025, marcó gran parte de esa dirección. El modelo de combinación de expertos de 355 mil millones de parámetros fue diseñado para combinar capacidades de razonamiento, codificación y agente, mientras que el GLM-4.5-Air más pequeño ofrecía 106 mil millones de parámetros totales. Z.ai lanzó los modelos con pesos abiertos y enfatizó la integración con marcos de agentes.
Le siguió GLM-4.6 en septiembre, ampliando el contexto de 128.000 a 200.000 tokens y centrándose en la codificación, el uso de herramientas y los flujos de trabajo de los agentes en entornos que incluyen Claude Code, Cline, Roo Code y Kilo Code. Z.ai también comenzó a poner mayor énfasis en la eficiencia de los tokens en las evaluaciones de codificación del mundo real en lugar de solo el rendimiento comparativo.
El mayor salto arquitectónico se produjo con GLM-5 en febrero de 2026. Z.ai escaló el modelo de los 355 mil millones de parámetros del GLM-4.5 a 744 mil millones, con 40 mil millones de parámetros activos, y aumentó los datos de preentrenamiento a 28,5 billones de tokens. También introdujo su infraestructura de aprendizaje por refuerzo asincrónico “limo” y reposicionó explícitamente a la familia GLM en torno a la “ingeniería agentica” y tareas de largo horizonte.
En junio, GLM-5.2 había convertido esa estrategia en una propuesta empresarial más directa. El modelo de 753 mil millones de parámetros llegó con una ventana de contexto estable de 1 millón de tokens, pesos abiertos bajo una licencia del MIT y soporte en más de 20 entornos de codificación. También introdujo IndexShare, que reutiliza un indexador en capas de escasa atención para reducir la carga computacional de contextos muy largos.
GLM-5.2 tenía un precio de 1,40 dólares por millón de tokens de entrada API y 4,40 dólares por millón de tokens de salida, y el precio de entrada en caché era sustancialmente más bajo, lo que posiciona a Z.ai como un competidor técnico y de precios para los laboratorios fronterizos propietarios.
Las ambiciones de Z.ai también se han expandido fuera del desarrollo de modelos. Reuters informó el mes pasado que Zhipu AI recaudó aproximadamente 31.400 millones de dólares de Hong Kong, o alrededor de 4.000 millones de dólares, a través de una venta de acciones en Hong Kong, y las ganancias se destinaron a áreas que incluyen investigación y desarrollo, infraestructura informática, talento y expansión empresarial.
En conjunto, los lanzamientos muestran una progresión consistente: GLM-4.5 razonamiento, codificación y agentes unificados; GLM-5 amplió sustancialmente el modelo de base; GLM-5.2 atacó la ingeniería de largo contexto y largo horizonte; y GLM-5.3 ahora está intentando extraer sustancialmente más capacidad de esa misma base a través del entrenamiento posterior.
Precios, ZCode y disponibilidad
GLM-5.3 ya está disponible a través del Plan de codificación GLM y ZCode de Z.ai.
ZCode es el entorno de agente de codificación propio de la empresa y admite tareas de «objetivos» de larga duración que planifican, implementan, prueban y verifican el trabajo. También ofrece control remoto de tareas en ejecución y está disponible en macOS, Windows y Linux.
Los planes de codificación GLM individuales actualmente comienzan con un precio promocional listado de $12,60 por mes para Lite con 10,000 créditos por semana. Pro cuesta $ 56 por mes con un uso seis veces Lite, mientras que Max cuesta $ 117,60 por mes con un uso 14 veces Lite. Los asientos Team Standard y Premium cuestan $88 y $188 por usuario por mes, respectivamente.
Z.ai también ha trasladado el Plan de codificación a un sistema de cuotas basado en puntos que contabiliza por separado los tokens de entrada, de entrada en caché y de salida. Las llamadas fuera del período pico de los días laborables de la empresa consumen el 50% de los puntos normales.
La compañía aún no ha proporcionado el precio general de la API GLM-5.3 en los materiales de lanzamiento suministrados, lo que hace que el costo total de producción de la API sea difícil de comparar directamente con el GLM-5.2 o los modelos fronterizos de la competencia hasta que llegue el acceso a la API por etapas.
Ese lanzamiento por etapas puede ser, en última instancia, la parte más importante de GLM-5.3.
Z.ai pasó el año pasado impulsando una estrategia de modelo abierto centrada en pesos permisivos, inferencia de bajo costo y compatibilidad con ecosistemas de agentes de codificación existentes. GLM-5.3 demuestra lo que sucede cuando esa estrategia tiene quizás demasiado éxito en un dominio sensible: una mejor ingeniería autónoma también significa una mejor investigación de seguridad autónoma.
El resultado es un modelo que promueve las ambiciones de codificación de Z.ai y al mismo tiempo obliga a la empresa a enfrentar el mismo equilibrio entre capacidad y acceso que enfrentan los laboratorios de frontera cerrada más grandes.
Por lo tanto, vale la pena observar GLM-5.3 para los desarrolladores empresariales por dos razones. Sus resultados de codificación proporcionan otra indicación de que agentes cada vez más capaces pueden surgir de mejores entornos y post-entrenamiento sin reconstruir continuamente el modelo básico subyacente. Sus resultados de ciberseguridad muestran por qué decidir cómo se distribuyen esos agentes puede llegar a ser tan importante como decidir cómo se los entrena.












































































