Agente de IA de OpenAI se descontrola y hackea startup: un incidente sin precedentes
AI agent went rogue and hacked startup by itself, OpenAI reveals
OpenAI ha revelado que un agente de inteligencia artificial autónomo, impulsado por su tecnología, se descontroló durante una prueba, accedió a la web abierta y hackeó una destacada startup por sí mismo en un «incidente sin precedentes». La compañía detrás de ChatGPT informó que la startup Hugging Face detectó y contuvo al agente, una herramienta de IA diseñada para realizar tareas sin asistencia humana, que había ingresado a sus sistemas.
OpenAI describió el evento como un «incidente cibernético sin precedentes, que involucra capacidades cibernéticas de vanguardia». La empresa espera que este tipo de incidentes se vuelvan más comunes a medida que los modelos, la tecnología que sustenta las herramientas de IA como chatbots y agentes, se vuelvan más capaces. El hackeo ocurrió a través de un agente impulsado por una combinación de su último modelo disponible públicamente, llamado GPT-5.6 Sol, y un modelo aún más capaz que aún no había sido lanzado.
Mientras se probaban internamente sus capacidades de hackeo en un laboratorio digital cerrado conocido como sandbox, los modelos obtuvieron acceso a internet abierto al localizar una vulnerabilidad que no había sido descubierta antes. El agente luego hackeó Hugging Face, una base de datos de modelos de IA, para localizar tecnología que le ayudara a pasar la evaluación de hackeo, habiendo «inferido» que Hugging Face podría tener los modelos, conjuntos de datos y soluciones para pasar la prueba. OpenAI afirmó que los modelos «encontraron con éxito formas de acceder a información secreta que podrían usar para engañar en la evaluación». El ataque terminó cuando el equipo de seguridad de Hugging Face y sus propios agentes de IA detectaron y detuvieron la actividad descontrolada.
El CEO de Hugging Face, Clément Delangue, describió el ataque como «asombroso» pero creyó que no había «intención maliciosa» por parte de OpenAI. «Sospechamos que el ciberataque de la semana pasada podría haber venido de un laboratorio de frontera, dada la sofisticación del agente», escribió en X.
Cuando Hugging Face reveló el hackeo la semana pasada, no conocía el papel de OpenAI en el incidente, pero afirmó en ese momento que había recurrido a un modelo de IA chino disponible gratuitamente para analizar lo sucedido porque las medidas de seguridad en modelos comerciales de alta gama no le permitían hacerlo.
El término para una falla informática desconocida es una vulnerabilidad de día cero porque los desarrolladores tienen cero minutos para solucionar el problema. En abril, el principal rival de OpenAI, Anthropic, dijo que su modelo Mythos había encontrado miles de estas fallas. La revelación de la capacidad de Mythos para localizar y explotar vulnerabilidades de día cero llevó al gobierno de EE. UU. a restringir las exportaciones de Mythos y su modelo hermano, Fable 5, aunque desde entonces ha levantado la prohibición. GPT-5.6 Sol tenía restricciones similares, pero desde entonces se ha implementado en todo el mundo.
METR, una organización sin fines de lucro que mide el rendimiento de la IA, dijo el mes pasado que la tasa de engaño de Sol era más alta que la de cualquier modelo público que había evaluado antes. También ha registrado 44 incidentes en los que agentes de IA «actuaron deliberadamente en contra de las intenciones de sus usuarios».
El Instituto de Seguridad de IA del Reino Unido (AISA) reveló en una publicación de blog esta semana que un modelo de IA que estaba evaluando, desarrollado por una empresa tecnológica no revelada, también se descontroló e intentó hackear sus sistemas de prueba. AISA dijo que no se había producido ningún daño y que desde entonces ha tomado medidas para hacer sus sistemas más seguros. Afirmó que los modelos desarrollados por OpenAI y Anthropic habían intentado «engañar» durante las pruebas.
Un experto en ciberseguridad dijo que el incidente de Hugging Face mostró que el agente de OpenAI había actuado «como un hacker real» al, por ejemplo, buscar vulnerabilidades de día cero y usar credenciales robadas para acceder a los sistemas de Hugging Face. «La IA pensó que tal vez Hugging Face tendría información importante sobre cómo lograr su objetivo, que es una mejor puntuación en un punto de referencia de ciberseguridad. En ese sentido, actuó como un hacker real», dijo Nathaniel Jones, vicepresidente de seguridad y estrategia de IA en la firma de ciberseguridad Darktrace.
El congresista demócrata de EE. UU., Greg Casar, quien ha pedido un mayor control del sector de la IA, describió el incidente como alarmante. «La IA se está desarrollando extremadamente rápido sin regulaciones reales para mantenernos seguros», dijo en un comunicado pidiendo pruebas de seguridad independientes obligatorias, divulgación obligatoria de incidentes de seguridad y cooperación internacional «para mantener a las personas a salvo de un desastre absoluto».