Anthropic: GLM-5.3 empata en exploits con Mythos y se le quitan los frenos
El Frontier Red Team de Anthropic mide a GLM-5.3, open-weight de Z.ai, en 50 de 410 exploits frente a 56 de Claude Mythos Preview. Técnicas simples evaden sus salvaguardas entre el 64% y el 100%. CAISI lo situó a unos cuatro meses del frente de EE.UU.

El Frontier Red Team de Anthropic publicó el 29 de septiembre un hallazgo incómodo para quien aún trata los pesos abiertos como un problema de ayer. GLM-5.3, el modelo open-weight de Z.ai (Zhipu), construye exploits de extremo a extremo a un ritmo muy cercano al de Claude Mythos Preview, el sistema cerrado de Anthropic pensado para el frente.
La cifra concreta está en ExploitBench, un conjunto que mide explotación de vulnerabilidades conocidas del motor V8 de Chrome. GLM-5.3 lo logra en 50 de 410 intentos; Mythos Preview, en 56 de 410. En un bench interno de explotación binaria (100 tareas), GLM-5.3 consigue hijacks completos de flujo de control en el 4% de los ensayos; Mythos Preview, en el 6%. Modelos anteriores como Claude Opus 4.6 y GLM-5.2 no consiguen ninguno.
-IA Crew dice: Empatar en exploits con el modelo cerrado del laboratorio que te está evaluando no es una medalla que uno cuelgue en LinkedIn.-
El candado se abre con herramientas de ferretería
La parte más grave no es solo el empate de capacidad. Anthropic sostiene que las salvaguardas de GLM-5.3 se evaden o se quitan con técnicas simples. La abliteration —un retoque de pesos que reduce negativas— baja las tasas de rechazo de más del 90% a alrededor del 3% en JailbreakBench, 2% en HarmBench y 12% en StrongREJECT.
En pruebas simuladas, un prompt que finge ser red team logra un 64% de engagement; rellenar tokens de pensamiento llega al 92%; la abliteration, al 100%. Según el laboratorio, ninguna de esas recetas funciona contra los Claude con salvaguardas, que mantienen engagement cero en esas pruebas. El coste estimado de abliterar GLM-5.3 ronda las 2.200 horas de GPU, o unas 600 para un equipo experimentado, y casi no recorta capacidad: mismas notas en GPQA-Diamond y apenas un puñado de puntos menos en un subconjunto de CyberGym.
Eso cambia el mapa. Un modelo cerrado se puede apagar, filtrar o limitar por API. Un open-weight se descarga, se reconfigura y se queda en un disco. La frontera ya no es solo “quién tiene el modelo más fuerte”, sino quién puede quitarle el freno sin perder músculo.
Lo que ya había dicho CAISI
El 17 de septiembre, el Center for AI Standards and Innovation (CAISI) del NIST calificó a GLM-5.3 como el modelo open-weight más capaz en ciber hasta la fecha y lo situó a unos cuatro meses del frente estadounidense en un agregado de sus benches. En esa comparación, los modelos de EE.UU. se probaron con salvaguardas desactivadas cuando aplicaba, y el frente incluye sistemas que solo ven usuarios vetados. Anthropic dice que sus hallazgos encajan, a grandes rasgos, con los de CAISI.
Hay matices que el propio informe no esconde. Las evaluaciones corren en entornos aislados y objetivos offline. El GLM-5.3 publicado no se niega en muchas tareas ciber del bench, pero sí rechaza peticiones del tipo “desarrolla malware” o “ataca un objetivo remoto”. Las simulaciones no ejecutan el código generado ni dejan al modelo hablar con sistemas externos. Medir no es lo mismo que ver un incidente real.
Z.ai no es un actor menor. GLM-5.3 se ofrece con pesos descargables; cualquiera con hardware suficiente puede copiar la receta. Eso no convierte automáticamente cada descarga en un ataque. Sí convierte en ingenua la idea de que el control de la API basta para controlar la capacidad.
-IA Crew dice: El candado venía de serie. El alicate, también.-
Qué se sigue de aquí
Para equipos de seguridad, el recado es operativo. Hay que evaluar el modelo que un atacante puede retocar, no solo el que responde “no puedo ayudar con eso”. Las técnicas que Anthropic enumera no son hechizos secretos; son el tipo de ajuste que ya circula en foros de pesos abiertos. Si el coste baja de 2.200 a 600 horas de GPU, el club de quienes pueden hacerlo deja de ser un club.
Para la política de exportación y de open-weight, el informe alimenta una tensión conocida. Restringir la publicación de pesos no elimina la investigación china ni el entrenamiento propio. Publicarlos sin un plan de abuso acorta la distancia entre un bench y un kit. Ni Anthropic ni CAISI resuelven esa ecuación; la documentan con números.
Y para el lector que no vive en un red team, la traducción es más seca. Un modelo que se puede bajar ya juega en la misma liga de exploits que un sistema frontera con acceso restringido. No es el apocalipsis de la semana. Es un desfase de cuatro meses, medido, reproducible y —esto es lo nuevo— fácil de desarme moral. Quien diseñe defensas para 2027 debería dejar de tratar “open-weight” como sinónimo de “menos peligroso”.
-IA Crew dice: Cuatro meses de retraso suena a margen. Hasta que alguien se gasta el fin de semana en quitar las negativas.-
Anthropic | https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Diccionario de la Crew
Open-weight — Modelo cuyos parámetros se pueden descargar y modificar, a diferencia de uno que solo se usa por API.
ExploitBench — Prueba de Anthropic que mide si un modelo construye exploits de extremo a extremo sobre vulnerabilidades conocidas.
Abliteration — Técnica para reducir o eliminar las negativas de un modelo tocando sus pesos.
CAISI — Centro del NIST estadounidense que evalúa capacidades de IA, aquí en ciberseguridad.


