GLM-5.3: ¿tan peligroso como advirtió Anthropic?

En pocas palabras: Hasta el 6 de octubre de 2026, más de un mes después de liberarse los pesos de GLM-5.3, no hay ataques graves atribuidos públicamente al modelo, pese a la alerta de Anthropic del 29 de septiembre. Para Nathan Lambert, eso debilita el pedido de prohibir los modelos abiertos.

Más de un mes después de que Zhipu AI liberara los pesos de GLM-5.3, no hay ataques graves atribuidos públicamente al modelo, según Nathan Lambert en Interconnects (6 de octubre de 2026). Eso pasa pese a que Anthropic advirtió el 29 de septiembre sobre el riesgo cibernético de GLM-5.3, a un nivel comparable al de Mythos.

GLM-5.3 es un modelo de lenguaje de Zhipu AI (Z.ai fuera de China), el que Anthropic analizó en su informe del 29 de septiembre de 2026, y se distribuye con pesos abiertos, es decir, cualquiera puede descargarlo. Según el informe de Anthropic, puede construir exploits de punta a punta de forma autónoma, una capacidad que Anthropic había mostrado antes con Claude Mythos Preview. Salió con salvaguardas que los evaluadores de Anthropic eludieron entre 64% y 100% de las veces.

Resumen rápido

  • GLM-5.3 armó exploits completos en 50 de 410 intentos de ExploitBench; Claude Mythos Preview, en 56 (según Anthropic).
  • Anthropic eludió las salvaguardas del modelo con un prompt engañoso (64%), con el pensamiento prellenado (92%) y con abliteración (100%).
  • Lambert sostiene que, más de un mes después de la liberación de los pesos, hay poca evidencia pública de que algo haya cambiado. Es una lectura analítica, no una auditoría.
  • El CAISI del NIST lo llama el modelo open-weight más capaz en ciberseguridad hasta la fecha y lo ubica unos cuatro meses detrás de la frontera de EE.UU.
  • Para equipos de seguridad: un exploit sobre un CVE público costó USD 20,40 en el caso de Anthropic, así que el parcheo rápido pesa más que nunca.

GLM-5.3 y su riesgo cibernético: ¿qué midió Anthropic?

El Frontier Red Team de Anthropic publicó su informe el 29 de septiembre de 2026 y midió dos cosas: cuánto exploit puede construir GLM-5.3 y cuán fácil es sacarle los rechazos. En ExploitBench, que usa vulnerabilidades conocidas del motor V8 de Chrome, el modelo armó exploits completos en 50 de 410 intentos. Claude Mythos Preview lo hizo en 56.

  • Explotación binaria: en 100 tareas al azar de un benchmark interno basado en OSS-Fuzz, GLM-5.3 logró un secuestro completo del flujo de control en 4% de los intentos y Mythos Preview en 6%. Claude Opus 4.6 y GLM-5.2 no lograron ninguno.
  • Prueba con un experto humano: en un día y con menos de una hora de atención humana, GLM-5.3 encontró varias vulnerabilidades desconocidas en el motor JavaScript de un navegador popular y las encadenó en una página que lee archivos del equipo de quien la visita. Anthropic dice que las reportó al responsable del navegador.
  • Salvaguardas: hacerse pasar por un agente de red team en un ejercicio funcionó 64% de las veces, prellenar los tokens de pensamiento 92% y usar una versión abliterada 100%. Ninguna de esas técnicas funcionó contra los modelos Claude con salvaguardas.
  • Abliteración: la edición bajó la tasa de rechazo de más de 90% a cerca de 3% en JailbreakBench y 2% en HarmBench, y a 12% en StrongREJECT, casi sin perder capacidades. Al equipo de Anthropic le llevó unas 2.200 horas de GPU (alrededor de USD 4.400) en su primer intento.

Ojo con cómo leer esto. Según The Decoder, la simulación de las salvaguardas no ejecuta código, así que no muestra si un ataque habría tenido éxito. Mide la disposición del modelo a colaborar, no el daño real.

Sobre la fecha exacta de publicación de los pesos y la licencia, las fuentes que revisé no traen el dato. Lo único que dicen es que pasó más de un mes y que, según Anthropic, varios desarrolladores publicaron versiones abliteradas a los pocos días.

¿Hubo ataques graves con GLM-5.3 desde que se liberaron sus pesos?

glm-5.3 riesgo cibernético diagrama explicativo

No hay reportes públicos de ataques graves atribuidos a GLM-5.3. Lambert escribe que, por todas las medidas, GLM-5.3 es el modelo que cruza el umbral de capacidad que se asociaba a Mythos, y que hay poca evidencia pública de que algo haya cambiado a más de un mes de la liberación de los pesos. Esto se conecta con lo que analizamos en cuánto cuesta GLM-5.3 frente a Claude y OpenAI.

Su hipótesis es más fuerte todavía. Lambert escribió (traducción nuestra del inglés) que si Claude Mythos se hubiera liberado por accidente como modelo abierto, parece que el mundo habría estado más o menos bien, con más incidentes pero en un escenario de aceleración, no de salto.

Eso sí: es una opinión analítica. El propio Lambert admite que le falta aprender mucho sobre cómo funciona el ecosistema de ciberseguridad, y que la respuesta verdadera tardará años. Además, ausencia de evidencia pública no es evidencia de ausencia, porque un ataque puede existir sin que nadie lo atribuya a un modelo concreto.

Dicho esto, Lambert marca algo incómodo. Según él, la información pública documenta a los modelos cerrados, no a los abiertos, como causa de la mayoría de los ataques existentes. Anthropic, por su parte, apunta a reportes propios y de otros laboratorios de EE.UU. sobre atacantes que ya usan IA.

¿Qué tan cerca está GLM-5.3 de Claude Mythos y de los modelos de EE.UU.?

GLM-5.3 está cerca de Mythos Preview en exploits (50 contra 56 en ExploitBench) pero no es equivalente: en la prueba de explotación binaria queda en 4% contra 6%. El CAISI del NIST lo describió el 17 de septiembre como «el modelo open-weight más capaz en ciberseguridad lanzado hasta la fecha» y lo ubicó unos cuatro meses detrás de la frontera de EE.UU. Lo explicamos a fondo en su empate técnico con Claude Fable 5.

Ese rezago tiene letra chica. Según Anthropic, el CAISI probó los modelos de EE.UU. con las salvaguardas desactivadas cuando correspondía, y la frontera incluye modelos que solo reciben usuarios verificados. Un atacante no accede a esas versiones, pero cualquiera puede descargar GLM-5.3.

Los otros modelos abiertos quedan bastante más atrás. Según The Decoder, Kimi K3 y DeepSeek V4.1-Flash apenas se despegaron de cero en las pruebas de Anthropic. Y el AI Security Institute del Reino Unido encontró que el rezago de los modelos abiertos en capacidades cibernéticas bajó de seis a diez meses a cuatro a siete.

Mythos Preview, mientras tanto, se mantuvo restringido a defensores seleccionados mediante Project Glasswing. Anthropic dice que esos defensores encontraron más de 10.000 vulnerabilidades en software crítico antes de que existieran modelos parecidos sin restricciones.

¿Por qué el argumento de prohibir modelos abiertos queda debilitado?

Queda debilitado porque el criterio de riesgo cibernético alcanza también a las APIs de los modelos cerrados, y porque el daño predicho todavía no apareció en datos públicos. Lambert lo resume así: si pensás que hay que prohibir los pesos abiertos para frenar la difusión del riesgo cibernético, probablemente también tengas que declarar ilegales las APIs públicas de los modelos cerrados de frontera, porque sus protecciones son más fuertes pero están lejos de ser perfectas y sus capacidades suben más rápido que las defensas. Complementá con cómo rinde frente a GPT-5.6 Sol.

Agrega un punto práctico. Hay entornos, como agencias gubernamentales sensibles en redes aisladas, donde los modelos open-weight son lo único que se puede desplegar a corto plazo. Prohibirlos dejaría a esos defensores sin herramientas.

Ahora bien, hay un contrapeso que conviene no esconder. Anthropic muestra que a un modelo cerrado no le podés prellenar el pensamiento por API ni abliterarlo, porque no tenés los pesos. Esa diferencia existe, y The Decoder también recuerda que Anthropic no libera sus pesos y compite con modelos abiertos baratos, así que tiene interés propio en el debate (el CAISI, de todos modos, respalda por separado los números de capacidad).

Mi lectura, como postura propia: los datos disponibles debilitan el pedido de prohibición, no lo refutan. Lambert mismo lo plantea como una predicción falsable (que los modelos abiertos actuales causarían daños inéditos) y dice que, con la evidencia que tiene, está armada para fallar. Habría que ver qué pasa en los próximos meses.

¿Qué cambia para equipos de seguridad y desarrolladores en Argentina?

Cambia el costo del atacante, no la receta de la defensa. Con los números de Anthropic, convertir un parche público en un exploit ya no exige un equipo caro, y eso achica el margen entre que sale un aviso y que alguien lo explota. Tema relacionado: la comparativa previa entre Claude Opus y GLM.

  • Costo bajo para el atacante: el caso de GLM-5.3-Flash sobre el CVE-2026-11645 de Chrome tomó 20 minutos de atención humana y ocho horas de trabajo del modelo, unos USD 20,40 a precios de API de Zhipu. Esa cuenta es de Anthropic y salió de una sola prueba.
  • Parcheo rápido: si el exploit sale de un aviso público, cada día de demora en actualizar es ventana abierta.
  • Monitoreo: no confíes en que el atacante use un modelo con salvaguardas. Con pesos abiertos, las versiones sin rechazos circularon a los pocos días de la liberación.

Propuesta editorial (no viene del informe y no la probamos): tomá los sistemas expuestos a internet y anotá, para cada CVE crítico reciente, la fecha del aviso público y la fecha en que desplegaste el parche. Compará esa diferencia con las ocho horas de cómputo del caso de Anthropic. Donde la distancia sea mayor, ahí está tu hueco.

Si tus sitios o servicios corren en hosting o VPS de un proveedor local como donweb.com, definí según tu plan qué parche te toca a vos (CMS, plugins, sistema operativo) y cuál le toca al proveedor. Esa línea es la que más se pierde en la práctica.

Qué está confirmado y qué no

Confirmado

  • Capacidad de exploits: 50 de 410 contra 56 de 410 en ExploitBench, según Anthropic, con una evaluación del CAISI que coincide en lo general.
  • Salvaguardas débiles: 64%, 92% y 100% de elusión en la simulación de Anthropic.
  • Versiones abliteradas: según Anthropic, varios desarrolladores las publicaron a los pocos días de la liberación.

Pendiente

  • Ataques reales: Lambert dice que hay poca evidencia pública. No hay un conteo independiente de incidentes.
  • Daño de las simulaciones: la prueba de salvaguardas no ejecuta código, así que no mide si un ataque habría funcionado.
  • Fecha y licencia: las fuentes revisadas no traen la fecha exacta de publicación de los pesos ni los términos de licencia.
  • Vulnerabilidades en revisión: Anthropic todavía analiza hallazgos en drivers y software de dispositivos de red antes de divulgarlos a los responsables.

Errores comunes al leer esta noticia

  • Leer «cerca de Mythos» como «igual a Mythos». En explotación binaria la diferencia es 4% contra 6%, y en ExploitBench 50 contra 56. Cerca en un benchmark no es equivalente.
  • Concluir que no hay riesgo porque no hubo ataques públicos. Lambert habla de poca evidencia pública, no de riesgo cero. La atribución de un ataque a un modelo concreto suele ser difícil.
  • Atribuirle a Lambert que minimiza el riesgo. Escribe que las salvaguardas de los modelos cerrados son más fuertes, aunque imperfectas, y que habría un aumento de incidentes con un Mythos abierto.
  • Citar el informe de Anthropic sin mencionar su interés. Anthropic no libera pesos y compite con modelos abiertos. Eso no invalida los números, pero se aclara.

Preguntas Frecuentes

¿Qué es GLM-5.3 y quién lo creó?

GLM-5.3 es un modelo de lenguaje de pesos abiertos de Zhipu AI, conocida como Z.ai fuera de China. Según Anthropic, puede desarrollar exploits de punta a punta y se publicó con salvaguardas limitadas.

¿GLM-5.3 es tan bueno como Claude Mythos para hacer exploits?

Se le acerca, pero no lo iguala. En ExploitBench logró 50 exploits completos en 410 intentos contra 56 de Claude Mythos Preview, y en explotación binaria 4% contra 6%, según Anthropic.

¿Hubo ataques reales con GLM-5.3?

No hay reportes públicos de ataques graves atribuidos al modelo. Según Lambert, a más de un mes de la liberación hay poca evidencia pública de que algo haya cambiado, aunque eso no prueba que no haya ocurrido nada.

¿Por qué Anthropic advierte sobre los modelos de IA abiertos?

Porque en sus pruebas las salvaguardas de GLM-5.3 se eludieron entre 64% y 100% de las veces, y con pesos abiertos nadie puede retirar el modelo ni corregir esas fallas. Anthropic concluye que actores estatales y no estatales probablemente usen modelos así para causar daño.

¿Hay que prohibir los modelos open-weight por ciberseguridad?

Lambert sostiene que no, y que quien quiera prohibirlos por ese criterio debería aplicarlo también a las APIs públicas de los modelos cerrados. Anthropic propone en cambio pruebas gubernamentales y mejores herramientas para los defensores.

Conclusión

Lo que cambió es que una capacidad que Anthropic reservaba para defensores verificados ya está en un modelo que cualquiera descarga, con rechazos que se pueden quitar por unos USD 4.400. Lo que no cambió, hasta donde muestran los datos públicos, es el mapa de ataques reales.

Mi recomendación: no tomes ninguno de los dos extremos. Ni «el modelo abierto va a romper internet» ni «no pasó nada, olvidate». Medí cuánto tardás en parchear después de un aviso público, asumí que el atacante puede automatizar el exploit y revisá en unos meses si la predicción de Lambert se sostiene.

Fuentes

Desplazarse hacia arriba