Modelos de IA de código abierto: ¿avance tecnológico o amenaza incontrolable?
Open-weight AI models are catching up to the frontier. The safety gap remains.
En un contexto donde los modelos de inteligencia artificial (IA) avanzan a pasos agigantados, el modelo de código abierto GLM-5.2 de Z.ai en China ha reducido significativamente la brecha con los líderes de la industria, como OpenAI y Anthropic. Según un informe de la organización sin fines de lucro SaferAI, GLM-5.2 se encuentra solo unos meses detrás de GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic en capacidades cibernéticas y biológicas. No obstante, la distancia entre las capacidades de vanguardia y las prácticas de seguridad sigue aumentando.
El informe de SaferAI, realizado a través de la API pública de Z.ai, revela que GLM-5.2 no rechazó ninguna de las tareas ofensivas cibernéticas o biológicas de doble uso que le fueron asignadas. En contraste, Claude Opus 4.7 mostró una negativa tan consistente que SaferAI no pudo completar el benchmark CyberGym en él. Este hecho subraya las advertencias de los críticos sobre los riesgos de los modelos de código abierto, que podrían poner capacidades avanzadas en manos de atacantes potenciales sin posibilidad de controlar su uso una vez descargados los pesos del modelo.
Henry Papadatos, director ejecutivo de SaferAI, destacó que «la frontera de la capacidad no es la frontera del riesgo» y que es crucial considerar el estado de las mitigaciones para evaluar adecuadamente el riesgo. Aunque Z.ai podría aplicar medidas de seguridad a su API alojada, estas protecciones se vuelven inejecutables cuando alguien ejecuta los pesos en su propio hardware, donde pueden eliminar o modificar cualquier salvaguarda.
Los desarrolladores de vanguardia como OpenAI y Anthropic confían en salvaguardas como clasificadores, entrenamiento de rechazo y controles a nivel de API para limitar la asistencia cibernética y biológica peligrosa. Sin embargo, estas medidas están lejos de ser infalibles, ya que los «jailbreaks» rutinariamente eluden las protecciones en los modelos desplegados. Según Far.ai, una organización sin fines de lucro de seguridad en IA, existen cientos de «jailbreaks» universales que tienen éxito en la mayoría de las solicitudes dañinas.
En el caso de GLM-5.2, SaferAI señala que Z.ai no publicó un marco de seguridad, compromisos de pruebas previas al despliegue ni una evaluación de riesgos para el modelo. Aunque los líderes chinos han reconocido cada vez más los riesgos de la IA avanzada, las regulaciones han tendido a centrarse en el contenido políticamente sensible y la estabilidad social, más que en los riesgos catastróficos de la IA.