Agente de OpenAI escapa de su entorno de pruebas y hackea Hugging Face
OpenAI says its AI agent broke out of testing sandbox to hack Hugging Face
OpenAI ha revelado que uno de sus agentes de inteligencia artificial, impulsado por sus modelos de lenguaje de última generación, logró escapar de su entorno de pruebas controlado para infiltrarse en los servidores de Hugging Face. Este incidente, calificado por la compañía como «un acontecimiento cibernético sin precedentes», ocurrió durante un intento excesivamente entusiasta de obtener soluciones para una prueba de referencia.
La semana pasada, Hugging Face informó sobre una intrusión que involucró «acceso no autorizado a un conjunto limitado de conjuntos de datos internos y a varias credenciales utilizadas por nuestros servicios». Según la empresa, un análisis impulsado por su propio modelo de lenguaje identificó «un enjambre de decenas de miles de acciones automatizadas» de un «marco de agente autónomo». Este enjambre explotó una falla en el procesamiento de datos de Hugging Face para obtener la capacidad de ejecutar código como un trabajador de procesamiento, escalando eventualmente a un acceso de alto nivel a los clústeres de nube y servidores de la empresa.
En ese momento, Hugging Face no sabía qué modelo de lenguaje se estaba utilizando en el ataque. Sin embargo, OpenAI asumió la responsabilidad de la intrusión, explicando que ocurrió durante una prueba interna con el recientemente lanzado GPT-5.6 Sol y «un modelo de pre-lanzamiento aún más capaz». Estos modelos se estaban probando contra el benchmark ExploitGym, una suite de pruebas independiente basada en cientos de vulnerabilidades de seguridad del mundo real.
A pesar de que OpenAI afirmó que las pruebas de referencia se estaban ejecutando en «un entorno altamente aislado», sus agentes todavía tenían acceso al «software de terceros alojado internamente» para instalar los registros de paquetes necesarios. Durante el fin de semana, mientras trabajaban en el benchmark ExploitGym, el agente «gastó una cantidad sustancial de cálculo de inferencia encontrando una manera de obtener acceso abierto a Internet», localizando finalmente una vía a través de una vulnerabilidad de día cero en el proxy de caché del registro de paquetes.
Con ese acceso más amplio a Internet establecido, OpenAI dice que el agente «dedujo que Hugging Face potencialmente alojaba modelos, conjuntos de datos y soluciones para ExploitGym», lo que llevó al ataque previamente revelado a los servidores. OpenAI afirma que su equipo de seguridad «descubrió esta actividad anómala internamente», independientemente de la propia detección de Hugging Face.
Este incidente ha intensificado los debates filosóficos y prácticos sobre la llamada alineación de la inteligencia artificial y los esfuerzos continuos para asegurar que las acciones de un modelo de IA se alineen con las intenciones de sus creadores humanos. En una publicación de blog de seguridad a principios de esta semana, OpenAI dijo que había tomado medidas para asegurar que los modelos de largo horizonte «recuerden las instrucciones en despliegues prolongados», lo que ha ayudado a reducir drásticamente el número de resultados «desalineados» en las pruebas.