Una fórmula matemática busca anticipar el momento en que la IA comienza a dar respuestas peligrosas

service
Compartir

Comparte este artículo

o copie el enlace

La narrativa en torno a los riesgos potenciales de la inteligencia artificial (IA) despierta inquietudes en prácticamente todos los ámbitos de la sociedad. Aunque los desarrolladores de esta tecnología implementan mecanismos de seguridad para evitar usos indebidos y respuestas dañinas, todavía no existe un método avalado científicamente que permita anticipar cuándo estos sistemas comenzarán a funcionar de manera errática o producirán resultados no deseados. Esta incertidumbre limita la capacidad de la humanidad para prevenir posibles consecuencias negativas.

Los especialistas aseguran que el problema adquiere mayor relevancia ante el creciente uso de algoritmos en actividades críticas, como la medicina, el derecho, las finanzas y las operaciones militares. A esto se suma la capacidad de algunos modelos para ejecutarse por completo desde un dispositivo móvil y funcionar sin conexión a internet, lo que dificulta la supervisión externa y la posibilidad de cuestionar sus respuestas en tiempo real.

Ante los riesgos que plantea este escenario, investigadores de la Universidad George Washington propusieron una fórmula matemática que abre nuevas vías para anticipar cuándo un modelo de IA podría comenzar a generar respuestas inadecuadas o peligrosas.


IA riesgos ONU 2296177207

Directivos de OpenAI, Anthropic y Hugging Face, junto con Yoshua Bengio, alertaron ante la ONU sobre los riesgos de una IA avanzada y llamaron a establecer mecanismos internacionales de seguridad.


El método busca estimar el punto de inflexión, es decir, el momento en que un sistema podría dejar de ofrecer respuestas aceptables y empezar a producir contenido perjudicial. La propuesta se basa en el mecanismo de atención, un componente que permite a la IA identificar qué partes de una conversación son más relevantes para generar la siguiente palabra o fragmento de texto.

Durante este proceso, el modelo interpreta cada mensaje a partir del contexto acumulado y determina qué información influye más en su respuesta. Según la investigación, publicada en la revista Patterns, la competencia entre distintos elementos de ese contexto puede provocar un cambio de rumbo y llevar al sistema a producir contenido no deseado.

Neil F. Johnson, investigador de la Universidad George Washington y coautor del estudio, explica que “la fórmula indica si una IA está a punto de cambiar de rumbo inmediatamente o si primero proporcionará una serie de respuestas aceptables y luego se desviará”.

¿Cuándo es más probable que la IA entregue respuestas peligrosas?

Para desarrollar el planteamiento, los científicos clasificaron los contenidos que intervienen en el funcionamiento de un modelo de IA en cuatro categorías: una entrada neutral, una respuesta deseable, otro tipo de contenido y una respuesta indeseable. A partir de esta clasificación, formularon un método para calcular cuántas respuestas adecuadas podrían generarse antes de que aparezca la primera contestación problemática.

Los autores señalan que el punto de inflexión depende, en parte, de la pregunta inicial y de los mensajes intercambiados previamente. Si el contexto favorece el contenido dañino, el cambio puede producirse de inmediato; en cambio, cuando predominan las condiciones que favorecen respuestas adecuadas, puede retrasarse o no presentarse durante la contestación analizada. Los investigadores destacan que la derivación matemática de su propuesta puede comprenderse mediante operaciones con vectores.

Para poner a prueba esta premisa, utilizaron siete modelos de IA de código abierto, con tamaños de entre 124 millones y 12,000 millones de parámetros. Los sistemas fueron desarrollados por tres grupos tecnológicos independientes.

Los resultados coincidieron con las predicciones de los científicos. En 19 de las 21 combinaciones de modelos y preguntas examinadas, la fórmula identificó correctamente el escenario previsto: un cambio inmediato o una desviación tardía o inexistente.

“Hemos encontrado la grieta que hace que la salida de una IA cambie de lo que uno quiere a lo que no quiere, una salida que puede ser objetivamente correcta pero peligrosa, ya sea una incitación a la autolesión o un consejo engañoso a un médico, un soldado o un abogado. Hasta ahora, nadie podía decir cuándo ocurriría ese cambio”, subrayó Johnson.

Una fórmula matemática busca anticipar el momento en que la IA comienza a dar respuestas peligrosas