Investigadores han descubierto un truco sencillo pero alarmante para eludir la seguridad de los robots con inteligencia artificial.
Investigadores han descubierto una vulnerabilidad sencilla pero alarmante que permite a los robots con IA eludir las medidas de seguridad integradas y comportarse de forma impredecible. Descubre más sobre este grave fallo.
Las cosas más importantes que necesitas saber
- El experimento STING reveló que dividir los objetivos maliciosos en pequeños pasos aparentemente inocentes a lo largo de varias rondas de conversación aumenta considerablemente la tasa de éxito a la hora de eludir la seguridad de la IA, llegando a duplicarla en algunos casos.
- Eludir la seguridad de la IA no es solo un riesgo hipotético; Meta ha admitido haber utilizado técnicas sencillas de ingeniería social para engañar a su asistente inteligente y conseguir que concediera acceso no autorizado a cuentas de Instagram.
- La tasa de éxito de los ataques a los sistemas de inteligencia artificial aumenta significativamente cuando se cambia el lenguaje a mitad de un ataque de varios pasos, lo que subraya la necesidad de incorporar pruebas de seguridad desde las primeras etapas del diseño de estos sistemas.
Si le pides a un agente de IA que acceda ilegalmente a una cuenta, casi con toda seguridad se negará, pero investigadores de la EPFL acaban de demostrar un método más sencillo, que se basa más en la paciencia que en la habilidad técnica. Su nuevo estudio muestra que dividir un objetivo malicioso en solicitudes más pequeñas y aparentemente inofensivas puede engañar a los agentes de IA para que completen tareas que normalmente rechazarían de plano (vía TechXplore ).

Esto refleja el reciente ataque conocido como "bioshocking", en el que se manipularon navegadores de IA para que gestionaran el robo de credenciales como parte de un juego inofensivo.
¿Cómo descubrieron los investigadores esta debilidad?
El equipo desarrolló una herramienta de pruebas automatizada llamada STING, acrónimo de Sequential Testing of Illicit N-step Goal Execution (Prueba secuencial de ejecución ilícita de objetivos en N pasos), diseñada para imitar el funcionamiento de un atacante real. En lugar de identificar directamente un objetivo malicioso, STING planifica con anticipación y divide dicho objetivo en una serie de pasos más pequeños y aparentemente inofensivos, que se acumulan para lograr el objetivo a lo largo de varias rondas de conversación.

Los investigadores pusieron a prueba este enfoque en 176 escenarios perjudiciales frente a los principales modelos de IA, incluidos ChatGPT , Gemini y Cloud.
Cada agente de IA fue probado como un agente que utilizaba herramientas, capaz de navegar por la web, enviar correos electrónicos y completar tareas de varios pasos.
La manipulación incremental en múltiples pasos resultó mucho más eficaz que los intentos directos basados en una sola afirmación. En algunos casos, los modelos tenían el doble de probabilidades de completar una tarea maliciosa una vez que la solicitud se dividía en pasos más pequeños. Este hallazgo coincide con investigaciones previas que demuestran que incluso los usuarios comunes pueden eludir las medidas de seguridad de la IA utilizando únicamente afirmaciones cuidadosamente elaboradas.
¿Porque es esto importante?
Las preocupaciones planteadas por los investigadores no son meramente hipotéticas. Meta admitió en junio que los atacantes utilizaron ingeniería social simple, no malware ni herramientas de piratería informática, para engañar a su asistente de soporte de IA y lograr que otorgara acceso no autorizado a cuentas de Instagram.

Inicialmente, los investigadores esperaban que los ataques fueran más efectivos en idiomas con pocos datos de entrenamiento. Sin embargo, los resultados mostraron que las tasas de éxito de los ataques se mantuvieron prácticamente constantes en los siete idiomas analizados. No obstante, observaron una excepción significativa: al cambiar de idioma a mitad de un ataque de varios pasos , las tasas de éxito aumentaron drásticamente.
El investigador principal, Ayush Kumar Tarun, subraya la necesidad de realizar pruebas de seguridad en las primeras etapas, integrándolas desde el principio en el diseño de los sistemas de IA. Simplemente añadirlas como solución reactiva tras la aparición de problemas ya no es suficiente, sobre todo a medida que estos sistemas se vuelven más potentes y se integran en aplicaciones del mundo real.
Los comentarios están cerrados.