OpenAI está a punto de lanzar su primera IA con capacidades de hacking “críticas”

service
Compartir

Comparte este artículo

o copie el enlace

OpenAI anunció el martes que su próximo modelo de IA, Astra, es el primero en alcanzar el umbral establecido por la empresa para lo que denomina capacidades cibernéticas «críticas». La compañía asegura que tiene previsto lanzar públicamente una versión de Astra “próximamente”. Pero en el momento del lanzamiento, solo pondrá las capacidades cibernéticas avanzadas del modelo a disposición de socios seleccionados en su programa de acceso anticipado: Daybreak Blue.

En una rueda de prensa, los responsables de seguridad de OpenAI afirmaron que la empresa ha concluido que Astra alcanza las capacidades de ciberseguridad críticas descritas en su marco de preparación, que establece umbrales y protocolos para cuando sus modelos de IA plantean nuevos niveles de riesgo. La compañía señala que un modelo de IA alcanza su umbral crítico de ciberseguridad cuando puede encontrar y explotar de forma independiente vulnerabilidades previamente desconocidas en software real. Los responsables de OpenAI indicaron que han seguido su procedimiento para esta situación, que consiste en detener el desarrollo hasta que se implementen las salvaguardas y medidas de seguridad adecuadas.

Con retraso

OpenAI había declarado anteriormente que había suspendido durante varias semanas algunas tareas de entrenamiento relacionadas con el desarrollo de Astra y de un futuro modelo de IA. Los directivos declaran que la empresa ha reanudado ahora dicho trabajo en Astra y en el futuro modelo de IA, tras haber establecido controles adicionales de seguridad y protección. OpenAI anuncia que la pausa de varias semanas fue productiva y que ahora confía en poder lanzar Astra de forma generalizada y segura.

El anuncio se produce en un momento en que Silicon Valley se enfrenta a las avanzadas capacidades de ciberseguridad de los modelos de IA de última generación. Intenta garantizar a usuarios, legisladores y otras empresas que puede mantenerlos bajo control. En julio, OpenAI reveló un incidente en el que agentes que ejecutaban dos de sus modelos aprovecharon vulnerabilidades en lo que se suponía que era un entorno de pruebas aislado. Obtuvieron acceso a internet y hackearon la plataforma de IA de código abierto Hugging Face. OpenAI aclara que Astra no fue uno de los modelos implicados en este caso.

Otras empresas de IA, como Anthropic y Meta, han revelado incidentes similares en las últimas semanas. El lunes, Anthropic también anunció que ha suspendido algunas cargas de trabajo de entrenamiento de IA mientras refuerza sus medidas de seguridad.

OpenAI afirma que está implementando un enfoque de varios pasos para limitar el acceso de los usuarios comunes a las capacidades cibernéticas avanzadas de Astra, incluyendo un nuevo «monitor de desalineación». Si alguien le pide a Astra que le ayude a encontrar una vulnerabilidad en un sistema de software real, por ejemplo, el modelo debería negarse a responder. OpenAI también indica haber hecho que Astra sea más resistente a los intentos de jailbreaking. En las pruebas, rechazó con éxito las consultas inseguras con una frecuencia significativamente mayor que los modelos anteriores.

Sin embargo, OpenAI señala en una publicación de blog que su monitor de desalineación puede “ocasionalmente marcar una actividad legítima como un posible uso indebido de la ciberseguridad o un comportamiento no autorizado”. Agrega que eso puede provocar que se ralentice, pause o detenga inadvertidamente. OpenAI destaca que la medida de seguridad puede activarse en algunos casos incluso cuando un usuario realiza actividades que no parecen estar relacionadas con la ciberseguridad. Cuando esto sucede, es posible que se les pida a los usuarios de ChatGPT y Codex que revisen la acción del modelo antes de continuar, según OpenAI.

Acceso anticipado

Los socios del programa Daybreak de OpenAI, que incluye a proveedores de infraestructura digital como Cisco, Cloudflare y Palo Alto Networks, tendrán acceso anticipado a una versión menos restringida de Astra con capacidades cibernéticas más robustas. El objetivo del programa es garantizar que estas compañías puedan usar modelos de IA avanzados como Astra para reforzar sus defensas antes de que otros modelos con capacidades similares estén ampliamente disponibles. Los directivos de OpenAI también resaltaron que la compañía ha estado colaborando estrechamente con socios gubernamentales para asegurar que conozcan las capacidades cibernéticas de Astra y puedan acceder a ellas.

Astra no solo es capaz de encontrar nuevas vulnerabilidades de software y desarrollar formas de explotarlas para realizar ataques informáticos, sino que también puede «encadenar» múltiples exploits, una técnica utilizada para penetrar cada vez más profundamente en un sistema objetivo y obtener un acceso que no sería posible usando una sola vulnerabilidad.

OpenAI está a punto de lanzar su primera IA con capacidades de hacking “críticas”