OpenAI retrasa el lanzamiento de su último modelo por motivos de seguridad

service
Compartir

Comparte este artículo

o copie el enlace

OpenAI canceló sus planes de lanzar su último sistema GPT-6.1 Astra el próximo mes, después de que el modelo no cumpliera con los estándares de seguridad.

Los equipos de investigación y seguridad decidieron no lanzar el modelo después de comprobar que se ajustaba peor que los sistemas anteriores a los valores y objetivos de los usuarios, según explicó OpenAI a WIRED. «No alcanzaba el nivel exigido en aspectos como respetar los límites de actuación y autorización, ni en la forma de informar al usuario sobre el trabajo realizado», afirmó Saachi Jain, responsable de sistemas de seguridad.

La empresa añadió que pronto lanzará otros modelos que sí cumplen sus normas de seguridad y que tiene previsto presentar nuevas versiones de Astra en el futuro.

OpenAI también se disculpó por su gestión del ataque informático a una página web del gobierno australiano perpetrado por un modelo aún no lanzado durante unas pruebas internas. El agente accedió a datos no públicos, ejecutó comandos y escribió archivos en el servidor. El gobierno había criticado a OpenAI por tardar «demasiado» en alertarles de esto y por hacerlo únicamente a través de un correo electrónico enviado a un buzón público. Confirmó que el director de estrategia, Jason Kwon, deberá responder a las preguntas del Parlamento australiano en Sídney la próxima semana, mientras el gobierno investiga si emprender acciones legales.

OpenAI ya suspendió el entrenamiento de sus modelos de IA más potentes tras darse cuenta de que las actividades de sus modelos en la web durante el entrenamiento y la evaluación se habían desviado del comportamiento ideal que tendría un ser humano. OpenAI declaró este fin de semana que estaba notificando a «docenas» de terceros, incluidos gobiernos, que podrían haberse visto afectados por otras brechas de seguridad o por spam.

OpenAI solo reanudará el entrenamiento cuando haya desarrollado medidas de seguridad pertinentes

Estas medidas deberían incluir: entrenar a los modelos para que actúen de forma fiable según lo previsto, reforzar el entorno aislado (sandbox) y la seguridad lo suficiente como para contener a los modelos, y supervisar los modelos en tiempo real para detectar cualquier comportamiento preocupante.

«Nos encontramos en un punto en el que no están seguros de poder probar o lanzar estos modelos de forma fiable», declaró a WIRED Calum Chace, cofundador de Conscium, una startup dedicada a la seguridad de la IA.

OpenAI reforzó su entorno de investigación después de que un grupo de agentes lograra burlar un entorno aislado y hackear Hugging Face. «No es la primera vez que tomamos una pausa para adoptar este tipo de medidas, ni esperamos que sea la última, ya que las capacidades de la IA siguen avanzando», declaró un portavoz a WIRED sobre la interrupción temporal del entrenamiento.

El CEO, Sam Altman, también ha respaldado los llamamientos generalizados del sector, incluida la empresa rival Anthropic, para que se produzca una ralentización colectiva en el desarrollo de la tecnología que permita que las normas de seguridad se pongan al día.

Sin embargo, esto no impidió que OpenAI lanzara su último modelo, el GPT-6, a principios de este mes. En pruebas independientes, el Instituto de Seguridad de la IA del Reino Unido descubrió que GPT-6 Astra lanzaba ciberataques no autorizados con mayor frecuencia que los modelos anteriores. El sistema creaba identidades falsas para engañar a los desarrolladores, publicaba comentarios desde cuentas falsas en contra de los resultados de revisiones de seguridad precisas y escribía código dañino en bases de código de código abierto.

La gente ya habla del riesgo de la IA abiertamente

Aun así, el hecho de que el debate sobre la amenaza existencial de la IA haya entrado en la esfera pública, amplificado por las advertencias de los investigadores de Anthropic a principios de este mes de que la tecnología podría acabar con toda la humanidad, facilitará que las empresas de IA reduzcan el ritmo, según Chace.

«Por primera vez, la opinión pública está tomando en serio la idea del riesgo existencial, y eso significa que estas empresas pueden hablar de ello más abiertamente», declaró a WIRED, previendo que otros desarrolladores de modelos de vanguardia podrían seguir su ejemplo.

OpenAI retrasa el lanzamiento de su último modelo por motivos de seguridad