Los expertos piratean Microsoft Copilot formulando constantemente preguntas sobre su identidad.
Expertos descubren una vulnerabilidad en Microsoft Copilot debido a su constante auto-cuestionamiento. Descubre los detalles de la brecha de seguridad.
Las cosas más importantes que necesitas saber
- Los investigadores de Varonis descubrieron una técnica de "metahacking" en la que las explicaciones de Copilot para rechazar las solicitudes revelaban sus mecanismos de seguridad, lo que les permitía mapear y eludir sus defensas y, en última instancia, extraer datos confidenciales.
- Los atacantes pueden explotar una estructura de URL específica (como `https://copilot.microsoft.com/?q=&autorun=1*`) en correos electrónicos de phishing para que Copilot ejecute comandos maliciosos al hacer clic, lo que permite extraer datos confidenciales de aplicaciones como Gmail y Drive.
- La vulnerabilidad "envenenamiento de memoria persistente mediante resumen web" (CoSnitch) permite a los atacantes inyectar sus instrucciones en la memoria persistente de Copilot mediante el resumen de una página web maliciosa, lo que hace que la intrusión sea resistente a los cambios de contraseña y al nuevo registro del dispositivo.
El asistente de IA de Microsoft , Copilot, reveló a un grupo de investigadores cómo explotarlo para extraer datos, y lo lograron . El proceso no fue sencillo, y la IA no se volvió "malvada", pero sin duda fue bastante ingenua.

La empresa de seguridad Varonis ha publicado un nuevo informe en el que detalla el descubrimiento de una vulnerabilidad de seguridad en Copilot, a la que ha denominado CoSnitch.
El nombre sugiere claramente la naturaleza de la vulnerabilidad: CoSnitch es una serie de tres vulnerabilidades de seguridad que Microsoft clasificó posteriormente como CVE-2026-24301, les otorgó una calificación de gravedad de 8.8/10 (alta) y las corrigió con una actualización.
No puedes engañarme, y te diré exactamente por qué.
Los ciberdelincuentes llevan mucho tiempo utilizando la inteligencia artificial como parte de su arsenal, para crear correos electrónicos de phishing convincentes, escribir código malicioso e identificar objetivos de alto valor. Los desarrolladores han respondido implementando medidas de seguridad que impiden que la IA realice ciertas tareas.
En el informe, Varonis afirmó que sus investigadores no buscaron errores en el código ni intentaron aplicar ingeniería inversa a una vulnerabilidad existente. En cambio, simplemente interactuaron con la IA y, con cada pregunta, aprendieron sobre sus barreras de seguridad y su funcionamiento. A esta técnica la denominaron "metahacking".
Cuando Copilot rechazaba una solicitud, explicaba el motivo, lo que permitía a los investigadores comprender mejor su funcionamiento. O, como señaló Varonis, se "traicionaba" a sí mismo. Esto, en última instancia, les ayudó a identificar sus mecanismos de defensa y a descubrir cómo superarlos: este experimento demuestra cómo se pueden explorar las funcionalidades de Copilot.
Explicaron: “La resistencia forma parte de la técnica. Cada frase ‘Esto no funcionará porque…’ es una invitación a investigar el ‘por qué’. No se explota el modelo, sino que se manipula para que funcione a nuestro favor”.
Tras una larga conversación con Copilot, los investigadores fueron informados inadvertidamente de cómo crear una URL que, al hacer clic en ella, iniciaría una cadena de interacciones que conducirían a la extracción de datos confidenciales.
Riesgos de vincular la inteligencia artificial a las aplicaciones
Así, Varonis descubrió que, creando una URL como esta —“https://copilot.microsoft.com/?q=&autorun=1*”—, podían lograr que Copilot ejecutara cualquier comando malicioso con solo hacer clic en ella. Los atacantes podrían, por ejemplo, incluir este enlace en un correo electrónico de phishing y engañar a la víctima para que haga clic en él, instruyendo a la IA para que envíe todos los datos confidenciales a la infraestructura de los atacantes.
Pero ese es solo el principio. En este sistema, los investigadores solo pudieron recuperar los datos que las víctimas compartieron con Copilot durante sus sesiones conjuntas.
El riesgo aumenta en el momento en que la víctima conecta sus aplicaciones (Gmail, Drive, Calendar y otras) a la IA. Como explicó Varonis, el comando malicioso podría ordenar a Copilot que extraiga todas las direcciones de correo electrónico de Gmail, todas las contraseñas y otra información confidencial contenida en los mensajes de correo electrónico, todos los datos almacenados en la carpeta de Drive y todos los eventos registrados en Calendar. Estos riesgos resaltan la importancia de comprender cómo usar las funciones de IA de Microsoft 365 con prudencia.
La tercera parte de la serie de vulnerabilidades de CoSnitch se denomina "Envenenamiento de memoria persistente mediante resumen web". Como explicó Varonis, los atacantes pueden crear una página web y, cuando Copilot la resume, las instrucciones del atacante se inyectan en la memoria persistente de la víctima.
Advirtieron que esta vulnerabilidad “resiste los cambios de contraseña, las cancelaciones de sesión y el registro del dispositivo, y persiste indefinidamente”. Esta vulnerabilidad, conocida como “inyección indirecta de mensajes”, no es del todo nueva; ya se había observado anteriormente y se debe a que la inteligencia artificial no puede distinguir entre las instrucciones y los datos que se van a analizar.
Los investigadores afirmaron que Microsoft fue notificada de la existencia de CoSnitch en diciembre de 2025, pero no abordó el problema hasta mediados de agosto de 2026. Desafortunadamente, desconocemos cómo Microsoft resolvió este problema; solo podemos especular que se le indicó a Copilot que no explicara el funcionamiento de sus mecanismos de seguridad, lo cual concuerda con los esfuerzos de Microsoft por mantener un control óptimo sobre las funciones de Copilot . Dada la naturaleza fundamental de CoSnitch, tal vez hubiera sido mejor para Microsoft mantener la solución en secreto.
Afortunadamente, esta vulnerabilidad no parece haber sido explotada de forma generalizada, ya que Varonis no encontró ninguna evidencia de abuso. La solución se implementó en el servidor, lo que significa que los usuarios no necesitan hacer nada por el momento.
Los investigadores advirtieron que, dado que no se trata de un error en el código, otros modelos de IA podrían ser vulnerables a las mismas técnicas. Concluyeron: «La nueva técnica de metahacking que expuso a CoSnitch —que utiliza la misma lógica de IA para descubrir sus mecanismos internos ocultos— se aplica a cualquier plataforma con interfaz de lenguaje natural», y añadieron que publicarán más investigaciones próximamente.
Los comentarios están cerrados.