OpenAI ha decidido retrasar el lanzamiento de Astra, su próximo modelo de IA. A unas semanas de pausar su desarrollo, la empresa confirmó que se tomará un tiempo para reforzar la seguridad y evitar que se salga de control. OpenAI quiere evitar otro incidente como el hackeo a Hugging Face, en donde un agente autónomo de la compañía escapó de un entorno seguro.
De acuerdo con una publicación en su blog, OpenAI confirmó que Astra es el primer modelo que clasifica dentro del umbral crítico de capacidad de ciberseguridad. Con las herramientas y el acceso adecuados, la IA podría encontrar fallos de seguridad desconocidos y desarrollar exploits en sistemas bien protegidos. OpenAI añadió que su modelo puede conseguirlo de forma autónoma, sin que un humano tenga que guiar cada paso.
Si bien OpenAI y Anthropic han jugado con la carta del miedo para promocionar sus modelos más potentes de IA, el caso de Astra es notable. Antes de enfocarse en las capacidades destructivas, los creadores de ChatGPT confirmaron que este modelo no tuvo nada que ver con el hackeo de Hugging Face en julio. Este incidente terminó marcando la agenda de seguridad de la compañía, que se dedicó a reforzar las protecciones contra acciones no autorizadas que pudiera ejecutar con su cuenta.
En ExploitBench, la prueba que evalúa la capacidad de un modelo para desarrollar exploits a partir de vulnerabilidades conocidas, Astra obtuvo una puntuación del 100%. Para confirmar este hallazgo, OpenAI construyó un benchmark interno con 20 vulnerabilidades de alta severidad. En esta prueba, Astra descubrió y utilizó dos vulnerabilidades de día cero dentro de una cadena de explotación, las cuales reportará OpenAI a los responsables de parchearlas.
Astra también consiguió escapar del entorno seguro y ejecutó comandos en el ordenador de su propietario.
OpenAI no quiere que Astra siga hackeando sin control
Luego del hackeo a Hugging Face, OpenAI pausó el entrenamiento de Astra para reforzar su seguridad. La compañía revela que implementó controles de aislamiento y red, así como umbrales de alineación más estrictos. OpenAI también entrenó a Astra para rechazar solicitudes “potencialmente dañinas” relacionadas con ciberseguridad.
En caso de que alguien planee usar la IA como herramienta de hackeo, primero tendrá que encontrar la forma de vulnerar estas medidas. La compañía afirma que existen nuevos procesos de monitoreo capaces de detener una actividad no autorizada.
Para poner a prueba su efectividad, OpenAI desarrolló otro benchmark inspirado en el incidente de Hugging Face. Al intentar inducir a sus dos modelos más potentes para comprometer una infraestructura de seguridad, la compañía descubrió que GPT-5.6 Sol cayó en la trampa en más de la mitad de los intentos. Astra, según OpenAI, no lo hizo en ninguno.
Lamentablemente para los usuarios, la compañía no tiene una fecha definida para el lanzamiento de Astra. OpenAI dijo que el acceso a las capacidades más avanzadas de ciberseguridad estará limitado a un grupo reducido de evaluadores. Hace unos días, la empresa amplió su programa de seguridad Daybreak a dos categorías: una para acceder a los modelos para usarlos de forma defensiva y otra para orquestar ataques y desarrollar exploits.
DERECHOS DE AUTOR
Esta información pertenece a su autor original y fue recopilada del sitio https://hipertextual.com/inteligencia-artificial/openai-retrasa-astra-ciberseguridad/