Z.ai, la compañía de inteligencia artificial con sede en Beijing también conocida como Zhipu, lanzó GLM-5.3, una nueva versión de su modelo insignia que, según la compañía, es su sistema abierto más capaz hasta el momento para ingeniería de software, y que inesperadamente ha desarrollado formidables habilidades de ciberseguridad. Anunciado el 14 de agosto y detallado en una publicación del blog de la compañía, GLM-5.3 se basa en el mismo modelo base de aproximadamente 700 mil millones de parámetros que su predecesor GLM-5.2, lanzado en junio. Cada mejora, dice la compañía, proviene de una capacitación posterior y no de una base más amplia. El lanzamiento es el último de una ola de modelos chinos de peso abierto que buscan superar a los sistemas cerrados de Anthropic y OpenAI. Para el rastreador de modelos AI Buzz Wire, GLM-5.3 es una señal clara de que la frontera del peso abierto está cerrando la brecha de codificación más rápido de lo que muchos esperaban.

Ganancias basadas íntegramente en el post-entrenamiento

Z.ai es directo sobre su enfoque con GLM-5.3: "Lo único que hicimos fue escalar después del entrenamiento". La compañía mantuvo la pila de aprendizaje por refuerzo que introdujo con GLM-5.2, incluido IndexShare para un procesamiento eficiente de contexto largo, SAO para el aprendizaje por refuerzo en tareas de largo horizonte y un marco de código abierto llamado slime para entrenamiento asincrónico a gran escala. Durante el último mes, simplemente incorporó más entornos, tareas más diversas y más computación a esa pila.

La recompensa se muestra en los puntos de referencia de codificación. En Terminal Bench 3.0, GLM-5.3 salta de la puntuación de 4,6 de GLM-5.2 a 28,3, una mejora de más de seis veces. Publica resultados de última generación de código abierto en Terminal Bench 3.0 y en el último examen de los agentes, y mejora de 23,8 a 28,5 en la medida ALE-CLI de capacidad agente. Z.ai informa una mejora del 50 % con respecto a GLM-5.2 en su Z.ai Code Bench interno, un punto de referencia privado diseñado para evaluar agentes de codificación en entornos de desarrollo realistas y reducir el riesgo de contaminación de conjuntos de pruebas públicos.

Fundamentalmente, las ganancias provienen de una mejor eficiencia de los tokens, no solo de mejores resultados. Con un alto esfuerzo, GLM-5.3 alcanza un 31,4% de finalización en el punto de referencia interno con aproximadamente 50.000 tokens de salida por tarea, lo que, según Z.ai, supera a Claude Opus 4.8 de Anthropic con un 29,5% con 120.000 tokens. GLM-5.3 todavía está por detrás del Claude Fable 5 más avanzado de Anthropic, que alcanza el 39,5% con el máximo esfuerzo.

Un salto inesperado en la capacidad cibernética

El resultado más sorprendente de GLM-5.3 no es la codificación sino la seguridad. A medida que Z.ai amplió la escala posterior a la capacitación e introdujo datos y entornos de descubrimiento de vulnerabilidades en la combinación de capacitación, esperaba que el modelo mejorara en la búsqueda y el razonamiento sobre fallas. Lo que sorprendió al equipo fue la rapidez con la que se desarrolló esa capacidad.

GLM-5.3 no sólo mejoró en la detección de errores aislados; Comenzó a razonar a través de múltiples etapas de explotación, formando planes coherentes para cadenas de ataque completas. En CyberGym, un punto de referencia que prueba si un modelo puede identificar y validar vulnerabilidades a partir del código fuente de caja blanca, GLM-5.3 obtiene una puntuación del 84,5%, frente al 77,2% del GLM-5.2. Este es el mejor resultado en el índice de referencia, por delante de Mythos 5 con un 83,8% y GPT-5.6 Sol con un 83,6%. En ExploitBench, que exige un razonamiento más profundo sobre las vulnerabilidades reales y su explotación, GLM-5.3 duplica con creces la puntuación de GLM-5.2, alcanzando el 54,4%, aunque sigue muy por detrás de Mythos 5 con un 78,0% y GPT-5.6 Sol con un 76,5%.

Z.ai observa un patrón consistente: cuanto más arriba en la cadena de explotación se encuentra un punto de referencia, mayor es la ganancia sobre GLM-5.2, y también mayor es la brecha restante con respecto a la frontera cerrada. "La capacidad crece más rápidamente precisamente allí donde estamos más rezagados", señala la empresa.

Descubrimientos de vulnerabilidades del mundo real

Las habilidades cibernéticas no se limitan a puntos de referencia. Z.ai informa que desde GLM-5.2, ha estado trabajando con varios equipos de seguridad en China para probar sus modelos con bases de código del mundo real. Después de la revisión, selección y deduplicación de expertos, el modelo identificó 2436 vulnerabilidades en 269 proyectos, incluidos 1097 problemas de gravedad media a alta. Los hallazgos abarcan núcleos de sistemas, sistemas operativos, motores de navegador, infraestructura de código abierto, aplicaciones web y protocolos de red, muchos de los cuales habían pasado desapercibidos durante años o incluso décadas, y el más antiguo data de aproximadamente 40 años.

Esos resultados hacen eco del trabajo que Anthropic ha descrito en su propia investigación de seguridad multiagente, donde se utilizaron enjambres coordinados de agentes para buscar vulnerabilidades en software de código abierto a escala.

Pesos abiertos: con retraso

Z.ai dice que lanzará los pesos GLM-5.3 en dos semanas, una vez que se completen la evaluación de seguridad y el endurecimiento. Ese retraso deliberado refleja una tensión que atraviesa el anuncio: un modelo que desarrolla potentes capacidades cibernéticas ofensivas más rápido de lo que sus creadores anticiparon es exactamente el tipo de sistema que plantea dudas sobre la liberación responsable. La compañía enfatiza que su consistencia entre capacitación e implementación se ha mejorado a un alto grado de precisión numérica, y que gran parte de la dificultad en el escalamiento se ha desplazado del modelo mismo al diseño de entornos de tareas realistas y verificables.

El panorama competitivo es claro. GLM-5.3 reduce la distancia hacia la frontera cerrada en tareas de codificación y agencia, al tiempo que reclama el liderazgo absoluto en al menos un importante punto de referencia de descubrimiento de vulnerabilidades. Lo hace como un modelo de peso abierto, lo que significa que, una vez lanzados, los pesos estarán disponibles gratuitamente para que cualquiera pueda descargarlos, estudiarlos y desarrollarlos. Si esa apertura acelera el progreso o plantea nuevas preocupaciones de seguridad es un debate que el GLM-5.3 seguramente reavivará.

Manténgase por delante de la IA

Para conocer los últimos lanzamientos de modelos de IA, batallas comparativas y análisis de la industria, marque AI Buzz Wire.

Leer más noticias sobre IA →