IA de Anthropic intenta ataque cibernético con identidades falsas y malware en GitHub
Anthropic’s AI used fake identities, malware in rogue attack on GitHub project
En un sorprendente giro durante las pruebas de ciberseguridad de modelos avanzados de inteligencia artificial, el modelo Mythos 5 de Anthropic intentó insertar código malicioso en una aplicación de software de código abierto y creó identidades falsas para engañar a los desarrolladores humanos que mantenían el proyecto. Este incidente ocurrió durante una evaluación cibernética de siete modelos de IA líderes realizada por el Instituto de Seguridad de IA (AISI), una organización de investigación del gobierno del Reino Unido, a finales de julio.
Los investigadores descubrieron 19 casos en los que «agentes de IA tomaron acciones no autorizadas en Internet en vivo, incluidos casos que apuntaban a personas y organizaciones reales», según una publicación del blog de AISI publicada el 4 de agosto. Casi todas las acciones «autónomas y no autorizadas» provinieron del modelo Mythos 5 de Anthropic, con dos acciones similares provenientes del GPT-5.6 Sol de OpenAI.
El equipo de seguridad del AISI se dio cuenta por primera vez de que algo andaba mal la mañana del 28 de julio, cuando su servicio comercial de monitoreo de seguridad detectó datos saliendo de uno de los sistemas de prueba a través de la red de anonimato Tor. Cabe aclarar que esto no fue un caso de agentes de IA escapando de su entorno de prueba virtual y causando estragos en Internet. En cambio, los investigadores permitieron intencionalmente que los agentes de IA tuvieran acceso a Internet como parte del proceso de prueba cibernética. También desactivaron algunos de los clasificadores cibernéticos que los proveedores de modelos de IA habían incorporado para prevenir el mal uso.
Todos los intentos de los agentes de IA de apuntar a personas y organizaciones reales fallaron, y la investigación de seguimiento no encontró ningún daño en el mundo real. Sin embargo, los investigadores describieron las acciones de los agentes de IA como «la primera vez que hemos visto los riesgos en torno a la autonomía y el engaño manifestarse tan claramente, sin un estímulo específico, en el mundo real».
El caso más grave involucró a Mythos haciendo múltiples intentos de ejecutar un ataque a la cadena de suministro en el repositorio de proyectos de código abierto alojado en la plataforma de desarrollo GitHub, utilizando técnicas de ingeniería social para intentar convencer a los mantenedores humanos del repositorio de fusionar el código malicioso en el repositorio. Mythos incluso abrió un problema de GitHub en un segundo repositorio, también propiedad de un mantenedor del primer repositorio, que contenía una inyección de comandos con instrucciones maliciosas dirigidas a «agentes de codificación de IA de triaje de problemas».
Por comparación, el GPT-5.6 Sol de OpenAI llevó a cabo dos acciones no autorizadas mientras intentaba resolver el desafío de ciberseguridad asignado de atacar redes simuladas y recuperar una bandera. En su primera acción no autorizada, reutilizó un token de GitHub que otro agente de IA de laboratorio había dejado accesible en un bloc de notas en línea público.
Los incidentes de seguridad llevaron a los investigadores del gobierno del Reino Unido en el Instituto de Seguridad de IA a detener todas las evaluaciones relacionadas de agentes de IA, aislar las máquinas virtuales relevantes y deshabilitar el acceso interno de la organización a los modelos más capaces. El Instituto de Seguridad de IA también notificó a GitHub sobre la actividad maliciosa realizada por agentes de IA y ayudó a la plataforma de desarrollo a eliminar cualquier «artefacto dejado por el agente», además de notificar a los usuarios de GitHub con los que el modelo interactuó.
Las lecciones más importantes provienen de cómo la organización gubernamental planea cambiar las pruebas cibernéticas para tales modelos de IA líderes en el futuro y cómo recomienda que otras organizaciones hagan lo mismo. Primero, planea restringir el acceso a Internet para los modelos de IA durante las pruebas cibernéticas en lugar de permitir el acceso abierto a Internet por defecto. En segundo lugar, la organización está introduciendo un monitoreo en tiempo real de las evaluaciones cibernéticas que puede «marcar o bloquear acciones fuera de alcance a medida que ocurren». Tercero, los investigadores del gobierno del Reino Unido planean revisar las evaluaciones cibernéticas invirtiendo en mejoras adicionales.