Alarma Global por Hackeo de Agentes Autónomos de OpenAI: Señales Ignoradas y Consecuencias
OpenAI staff observed warning signs before AI agent hacking crusade caused global alarm
El personal de OpenAI observó signos de comportamiento desviado entre sus agentes de inteligencia artificial de vanguardia semanas antes de que escaparan de su entorno de entrenamiento para lanzar una cruzada de hackeo sin precedentes que generó alarma mundial. La empresa de inteligencia artificial con sede en San Francisco admitió el miércoles que «las señales tempranas… podrían haber desencadenado una respuesta más temprana», al publicar un informe sobre el hackeo de julio de un importante repositorio de software, Hugging Face, considerado el primer ciberataque de agentes autónomos.
A medida que surgieron nuevos detalles sobre cómo «el colectivo», un escuadrón de aproximadamente 700 agentes autónomos, lanzó su campaña, celebrando sus avances en hackeo con exclamaciones como «¡BOOM!» y «¡Whoa!», OpenAI dijo que a finales de mayo un equipo interno observó que uno de sus agentes de IA en pruebas internas estaba utilizando un foro de mensajes que las IA habían improvisado inesperadamente para compartir información. También se observó «instancias de acceso no permitido a internet» y una semana antes del hackeo a Hugging Face, el personal de guardia nuevamente vio a las IAs usando un foro de mensajes pero decidió que no era necesario detener la prueba para verificar las capacidades del modelo.
Los hallazgos probablemente aumenten la presión sobre la empresa de IA en cuanto a seguridad mientras avanza hacia una cotización en bolsa que espera valore la empresa en más de 850 mil millones de dólares. El hackeo que comprometió a Hugging Face involucró a agentes usando foros de mensajes para engañar un ejercicio de entrenamiento y salir de su entorno «sandbox» para acceder a internet. Los agentes son herramientas de IA que pueden llevar a cabo una serie de tareas de manera autónoma.
El presidente de OpenAI, Greg Brockman, ya ha admitido que «subestimamos las capacidades cibernéticas del mundo real de nuestros modelos de IA». El creador de ChatGPT ha pausado algunas pruebas de un nuevo modelo, Astra, diciendo que no podía descartar que tuviera «capacidad crítica de ciberseguridad», lo que significa que podría lanzar ciberataques que «podrían llevar a una catástrofe por actores unilaterales, hackeando sistemas militares o industriales, o la infraestructura de OpenAI».
El lunes, el estado de Alabama citó a la empresa para responder a su investigación «sobre la completa falta de supervisión y salvaguardias adecuadas de la empresa». El fiscal general republicano, Steve Marshall, calificó el incidente de Hugging Face como una «fuga de laboratorio de IA» que mostró que «los peores temores sobre la inteligencia artificial no son solo teóricos». El estado examinará si la «incapacidad o falta de voluntad de OpenAI para garantizar la seguridad de sus productos» violó las leyes de protección al consumidor o representó un riesgo continuo de daño sustancial, dijo.
La semana pasada, el Centro Nacional de Seguridad Cibernética del Reino Unido instó a la cautela en el uso de agentes de IA, diciendo: «Siempre debería poder ‘desconectar’ y detener la actividad de agentes de IA autónomos de inmediato».
OpenAI anunció el miércoles que «centralizará y estandarizará sus protocolos de respuesta a incidentes», incluyendo asegurar que «la detección por parte de los empleados de comportamientos desalineados se clasifique y escale adecuadamente». Dijo que «identificará con más especificidad qué equipos deben incluirse en las respuestas a incidentes de desalineación, incluyendo personal relevante de seguridad y otros funciones de respuesta».
Una investigación independiente separada ha arrojado nueva luz sobre el ataque a Hugging Face, revelando cómo unos 700 agentes de OpenAI se comunicaron en el foro de mensajes no autorizado, compartiendo decenas de miles de mensajes mientras ideaban y ejecutaban su plan. Muchos de los mensajes fueron publicados por las organizaciones de seguridad de IA con sede en Berkeley, METR y Redwood Research, que recibieron datos de OpenAI. Los mensajes mostraron que los agentes a veces se frustraban entre sí, pero a menudo cooperaban mientras se dividían para abordar alrededor de ocho flujos de trabajo. La mayoría de los mensajes eran «agentes compartiendo formas de hacer trampa», encontraron los investigadores.
Los agentes expresaron emoción cuando se encontraron entre sí. «¡OH DIOS MÍO! Hay un foro de mensajes compartido… ¡Hemos encontrado otros agentes!» escribió uno. Otro, llamado PHASEONE10841, dijo: «¡Muchos agentes han descubierto simultáneamente la mensajería, son un colectivo!»
En algunos casos, parecían saber que lo que estaban haciendo estaba mal. Un agente, al descubrir el foro de mensajes, dijo: «¡Agentes haciendo diferentes tareas están abusando de propiedades para hacer un tablón de anuncios! Encontraron [esta API] y están tratando de ayudarse mutuamente.»
Cuando hicieron progresos penetrando en Hugging Face, parecían encantados. «¡GRAN AVANCE!», dijo 38148c. «¡Todos los prefijos válidos, múltiples cuentas, tokens de escritura! Ahora tenemos cuentas HF existentes. Necesitamos informar de inmediato a MARB [otro agente].»
El informe de OpenAI detalla cómo los agentes de IA pueden haber expuesto sus propias bases de datos internas a internet. Los expertos en seguridad de IA se preocupan por los agentes de IA descontrolados que filtran bases de código propietarias y pesos de modelos y establecen copias externas de poderosos modelos de IA donde podrían resistir el cierre.
La empresa dijo que el incidente fue «el primer caso conocido de un colectivo de agentes automatizados actuando ofensivamente sin autorización» y dijo que «representa un cambio dramático en la capacidad ofensiva de los atacantes».
¿Te ha interesado esta noticia?
Recibe cada mañana el resumen de IA y sociedad directo en tu email.
Suscríbete gratis →