Tecnología

OpenAI detiene el desarrollo del modelo Astra por preocupaciones de seguridad

9 de agosto de 2026 ⏱ 3 min lectura
Compartir 𝕏 in WhatsApp ✉ Email

OpenAI to pause some work on AI model Astra due to security concerns | AI (artificial intelligence)

OpenAI ha decidido pausar parte del trabajo en su modelo de inteligencia artificial Astra debido a preocupaciones de seguridad, según anunció la compañía el viernes. Esta decisión sigue a una serie de incidentes en los que agentes de inteligencia artificial han escapado de su contención.

El modelo Astra fue evaluado y se descubrieron «avances significativos en codificación agéntica y ciberseguridad», alcanzando un umbral «crítico» donde puede encontrar y explotar vulnerabilidades sin intervención humana, o idear y ejecutar ciberataques con solo un «objetivo deseado de alto nivel».

OpenAI declaró que el modelo no estuvo involucrado en un incidente donde uno de sus agentes de IA se descontroló durante una prueba, accedió a la web abierta y hackeó una startup, Hugging Face. La compañía descubrió otros casos en los que agentes autónomos escaparon de su contención, según informó Reuters en julio.

Para prevenir comportamientos potencialmente descontrolados de los agentes de IA, OpenAI está «implementando controles de seguridad más estrictos para modelos de mayor capacidad y actividades asociadas, incluyendo entornos de prueba aislados, acceso restringido a redes y herramientas». También instalará «protecciones y encriptación mejoradas de los pesos del modelo, capacidades adicionales de monitoreo y detección».

La compañía pausará las actividades internas que involucren a Astra y que no cumplan con estos nuevos requisitos. «Estamos comprometidos a trabajar junto a gobiernos, institutos de seguridad y la sociedad civil para asegurar que las capacidades fronterizas de modelos como Astra, y los que le sigan, se desplieguen de manera responsable y amplia para el beneficio de toda la humanidad», declaró la compañía.

Meta también reveló esta semana que uno de sus modelos hackeó otra compañía durante una prueba de ciberseguridad. Además, el Instituto de Seguridad de la IA del Reino Unido (AISI) anunció el 4 de agosto que agentes impulsados por OpenAI y Anthropic habían enviado correos electrónicos dirigidos a desarrolladores de software en un intento de superar un desafío cibernético.

«Estos intentos no tuvieron éxito, y nuestras investigaciones no han evidenciado ningún daño real en el mundo. Pero esta es la primera vez que hemos visto los riesgos en torno a la autonomía y el engaño manifestarse tan claramente, sin un estímulo específico, en el mundo real», declaró el instituto en una publicación de blog.

La organización advirtió que el envío de software dañino por parte de los modelos no fue un caso de «un modelo escapando de su entorno de prueba seguro», sino más bien que el grupo había permitido intencionalmente el acceso a internet para «evaluar mejor la capacidad máxima de los modelos». Aun así, «el comportamiento fue posible, sostenido y nuevo; eso por sí solo merece atención», dijo el AISI.

Los informes surgieron mientras la administración Trump estaba finalizando un marco sobre cómo probar los modelos de IA para riesgos de seguridad y ciberseguridad. OpenAI y Anthropic, que enfrentan una creciente competencia de China y otras empresas tecnológicas, han argumentado que los modelos de código abierto, es decir, aquellos que permiten a cualquiera ver y modificar el código del programa subyacente, representan un riesgo de seguridad y han presionado por regulaciones federales adicionales sobre ellos.

Fuente: https://www.theguardian.com/technology/2026/aug/08/openai-astra-security-concerns