GLM-5.3 de Z.ai revoluciona la programación y refuerza la ciberseguridad global
GLM-5.3 sorprende: su entrenamiento dispara capacidades ofensivas en ciberseguridad más allá de lo previsto. Z.ai revela que el post-training, y no un nuevo…
El escalamiento del entrenamiento de GLM-5.3, el nuevo modelo de Z.ai, ha revelado un efecto colateral inesperado: sus capacidades ofensivas en ciberseguridad crecieron a un ritmo superior al previsto, superando en algunas métricas a versiones de modelos cerrados sin salvaguardas, según datos de la compañía china.
Z.ai asegura que GLM-5.3 no parte de un nuevo modelo base, sino que utiliza el mismo que su predecesor, GLM-5.2, y que todas las mejoras provienen del post-training. Durante el último mes, la firma amplió los entornos de entrenamiento, diversificó las tareas y dedicó más cómputo a trabajos largos y complejos, similares a los de un ingeniero. En esa mezcla incluyó deliberadamente datos sobre vulnerabilidades, lo que explica la mejora en ciberseguridad, pero lo que sorprendió a la compañía fue la velocidad con la que esa faceta avanzó al seguir escalando el proceso.
Los resultados publicados muestran una progresión clara: la mejora frente a GLM-5.2 se amplía cuanto más se avanza en la cadena de explotación. En Cyber Gym, el modelo pasa del 77,2% al 84,5%, pero la diferencia es más acusada en Exploit Gym, donde completa 105 tareas con un presupuesto de dos horas y 130 con seis, frente a las 29 y 39 de su predecesor. La comparación con Mythos 5, una versión de Claude Fable 5 sin salvaguardas de ciberseguridad, revela que GLM-5.3 compite en las fases iniciales de análisis, pero queda por detrás en la explotación funcional: obtiene un 54,4% en Bench frente al 78% de Anthropic, y completa 105 tareas frente a 181 en Exploit Gym.
Z.ai afirma que estos avances ya se han aplicado en entornos reales, trabajando con equipos de seguridad chinos para identificar 2.436 vulnerabilidades en 269 proyectos. Además, Hugging Face utilizó GLM-5.2 para analizar una intrusión en su infraestructura, lo que demuestra su utilidad tanto para explotar fallos como para comprenderlos y corregirlos. La compañía prevé publicar los pesos del modelo tras completar las evaluaciones de seguridad, un paso que podría acercar capacidades de frontera a modelos descargables, con menos control por parte del proveedor.
Fuente original: consultar publicación original.