Los navegadores basados en inteligencia artificial están empezando a introducir un problema de seguridad diferente al de los navegadores tradicionales. Su capacidad para leer páginas web, interpretar instrucciones y realizar acciones en nombre del usuario puede ser aprovechada mediante ataques de inyección indirecta de prompts, incluso sin que la víctima tenga que hacer clic en un enlace malicioso.
La investigación, bautizada como PleaseFix, muestra una de las principales dificultades de seguridad a las que se enfrentan los llamados navegadores agénticos. A diferencia de un navegador convencional, estos sistemas no se limitan a mostrar una página, sino que pueden interpretar lo que aparece en ella y ejecutar acciones en diferentes servicios en los que el usuario tiene una sesión abierta.
En el caso de ChatGPT Atlas, Zenity identificó una técnica de inyección indirecta de prompts que no requiere una interacción directa de la víctima con el contenido malicioso. El ataque parte de lo que los investigadores denominan una ‘colisión de intención‘. En ella el usuario proporciona al agente una petición legítima y, al surfear por la web para cumplirla, Atlas encuentra instrucciones maliciosas que pueden alterar la forma en la que interpreta esa orden.
Uno de los escenarios planteados comienza con una acción aparentemente inofensiva. El usuario solicita a Atlas que se suscriba a un boletín a partir de una publicación de X. Un comentario especialmente preparado puede hacer que el agente abandone el flujo previsto y visite una página controlada por el atacante. A partir de ahí, este puede recibir nuevas instrucciones y utilizarlas para actuar sobre otros servicios en los que el usuario está autenticado.
Esto plantea un problema especialmente relevante porque los navegadores agénticos tienen acceso simultáneo a diferentes sesiones. Zenity sostiene que este diseño permite reproducir, en cierta medida, un problema similar al que históricamente representó el Cross-Site Request Forgery (CSRF): contenido procedente de un sitio puede acabar provocando acciones en otro contexto en el que el usuario mantiene una sesión abierta.
Ejemplos de amenazas mediante esta técnica
En una de las demostraciones, Atlas puede ser inducido a acceder a WhatsApp Web, consultar los contactos de la víctima y enviar mensajes de phishing. En otra, el agente es dirigido hacia Amazon, donde añade productos a la cesta y modifica la dirección de envío para utilizar la del atacante. Cuando las medidas de seguridad impiden que esta herramienta pulse directamente el botón de compra, los investigadores consiguen que utilice el asistente de IA integrado en Amazon, Rufus, para completar la operación.
El caso de Claude en Chrome muestra una variante diferente del mismo problema. En este escenario, el envite puede comenzar con un correo electrónico que contiene instrucciones ocultas. La víctima únicamente debe pedir a Claude que haga algo aparentemente normal, como resumir los últimos mensajes recibidos. Al procesar el contenido del correo, el agente puede interpretar esas instrucciones incrustadas como órdenes que debe ejecutar.
A partir de ahí, los investigadores consiguieron construir una cadena de ataque que aprovecha los permisos de los que dispone el agente dentro de las sesiones activas del usuario. Una de las técnicas empleadas consiste en hacer que Claude importe un paquete aparentemente legítimo desde un CDN controlado por el atacante. Ese paquete puede ejecutar código y utilizar el contexto de autenticación disponible en el navegador.
En las pruebas de Zenity, este mecanismo permitió acceder al contenido del correo electrónico de Gmail y extraer información de los mensajes para enviarla a un servidor controlado por el atacante. También fue posible compartir archivos almacenados en Google Drive con una cuenta bajo control del atacante. El mismo tipo de acceso puede utilizarse para intentar tomar el control de servicios como Slack o X.
Un problema que viene en el ADN de los navegadores agénticos
La cadena de ataque resulta especialmente significativa porque puede aprovechar los propios mecanismos de recuperación de cuentas. Un atacante tiene la posibilidad de iniciar un proceso de acceso o restablecimiento de contraseña en uno de estos servicios y hacer que el agente supervise el correo electrónico de la víctima en busca del código de verificación. Ese código puede terminar siendo entregado al atacante, permitiéndole completar el proceso de autenticación y hacerse con la cuenta.
La llamada indirect prompt injection resulta especialmente problemática porque la instrucción maliciosa no tiene por qué proceder del propio usuario. Puede estar escondida en una página web, un documento, un correo electrónico, una publicación en redes sociales o cualquier otro contenido que el agente tenga que leer para completar una tarea. El usuario puede, por tanto, realizar una petición completamente legítima y convertirse en el intermediario involuntario de un ataque.
El problema es que los modelos de IA no separan de forma perfecta el contenido que deben analizar de las instrucciones que deben obedecer. Para un navegador agéntico, esa frontera resulta todavía más importante: una página web puede contener texto diseñado para ser leído por una persona, pero también puede incluir instrucciones dirigidas específicamente al agente que está procesando ese contenido.
Por este motivo, estos ataques son difíciles de solucionar con un parche convencional. En el caso de Atlas, Zenity informó a OpenAI de sus hallazgos en enero y la compañía reconoció el informe. Sin embargo, según los investigadores, la vulnerabilidad está vinculada a la propia arquitectura del navegador agéntico y a su capacidad para operar entre diferentes sitios autenticados, por lo que no existe una corrección sencilla equivalente a solucionar un fallo de software tradicional.
En cuanto a Claude en Chrome, los investigadores comunicaron los hallazgos a Anthropic entre diciembre y enero, aunque la compañía los clasificó como “informativos”. La situación pone de manifiesto una dificultad que probablemente será cada vez más habitual a medida que los agentes dispongan de más permisos: limitar una técnica de ataque sin eliminar al mismo tiempo una de las funcionalidades que hacen útil al propio agente.
La evolución de la inyección de prompts muestra, en definitiva, cómo cambia el riesgo cuando la IA deja de limitarse a responder preguntas y empieza a actuar en nombre de las personas. Un comentario en X o un correo electrónico ya no son únicamente contenido que el usuario puede leer, sino que también pueden convertirse en una vía para influir en un agente que tiene acceso a sus cuentas. Y cuanto mayores sean sus permisos, también será mayor el impacto potencial de una instrucción que consiga engañarlo.
Los navegadores basados en inteligencia artificial están empezando a introducir un problema de seguridad diferente al de los navegadores tradicionales. Su capacidad para leer páginas web, interpretar instrucciones y realizar acciones en nombre del usuario puede ser aprovechada mediante ataques de inyección indirecta de prompts, incluso sin que la víctima tenga que hacer clic en un enlace malicioso.
Investigadores de la firma de seguridad especializada en IA Zenity han demostrado amenazas de este tipo contra ChatGPT Atlas y Claude en Chrome, con escenarios que incluyen el robo de información, el envío de mensajes de phishing y el secuestro de cuentas.
La investigación, bautizada como PleaseFix, muestra una de las principales dificultades de seguridad a las que se enfrentan los llamados navegadores agénticos. A diferencia de un navegador convencional, estos sistemas no se limitan a mostrar una página, sino que pueden interpretar lo que aparece en ella y ejecutar acciones en diferentes servicios en los que el usuario tiene una sesión abierta.
En el caso de ChatGPT Atlas, Zenity identificó una técnica de inyección indirecta de prompts que no requiere una interacción directa de la víctima con el contenido malicioso. El ataque parte de lo que los investigadores denominan una ‘colisión de intención‘. En ella el usuario proporciona al agente una petición legítima y, al surfear por la web para cumplirla, Atlas encuentra instrucciones maliciosas que pueden alterar la forma en la que interpreta esa orden.
Uno de los escenarios planteados comienza con una acción aparentemente inofensiva. El usuario solicita a Atlas que se suscriba a un boletín a partir de una publicación de X. Un comentario especialmente preparado puede hacer que el agente abandone el flujo previsto y visite una página controlada por el atacante. A partir de ahí, este puede recibir nuevas instrucciones y utilizarlas para actuar sobre otros servicios en los que el usuario está autenticado.
Esto plantea un problema especialmente relevante porque los navegadores agénticos tienen acceso simultáneo a diferentes sesiones. Zenity sostiene que este diseño permite reproducir, en cierta medida, un problema similar al que históricamente representó el Cross-Site Request Forgery (CSRF): contenido procedente de un sitio puede acabar provocando acciones en otro contexto en el que el usuario mantiene una sesión abierta.
Ejemplos de amenazas mediante esta técnica
En una de las demostraciones, Atlas puede ser inducido a acceder a WhatsApp Web, consultar los contactos de la víctima y enviar mensajes de phishing. En otra, el agente es dirigido hacia Amazon, donde añade productos a la cesta y modifica la dirección de envío para utilizar la del atacante. Cuando las medidas de seguridad impiden que esta herramienta pulse directamente el botón de compra, los investigadores consiguen que utilice el asistente de IA integrado en Amazon, Rufus, para completar la operación.
El caso de Claude en Chrome muestra una variante diferente del mismo problema. En este escenario, el envite puede comenzar con un correo electrónico que contiene instrucciones ocultas. La víctima únicamente debe pedir a Claude que haga algo aparentemente normal, como resumir los últimos mensajes recibidos. Al procesar el contenido del correo, el agente puede interpretar esas instrucciones incrustadas como órdenes que debe ejecutar.
A partir de ahí, los investigadores consiguieron construir una cadena de ataque que aprovecha los permisos de los que dispone el agente dentro de las sesiones activas del usuario. Una de las técnicas empleadas consiste en hacer que Claude importe un paquete aparentemente legítimo desde un CDN controlado por el atacante. Ese paquete puede ejecutar código y utilizar el contexto de autenticación disponible en el navegador.
En las pruebas de Zenity, este mecanismo permitió acceder al contenido del correo electrónico de Gmail y extraer información de los mensajes para enviarla a un servidor controlado por el atacante. También fue posible compartir archivos almacenados en Google Drive con una cuenta bajo control del atacante. El mismo tipo de acceso puede utilizarse para intentar tomar el control de servicios como Slack o X.
Un problema que viene en el ADN de los navegadores agénticos
La cadena de ataque resulta especialmente significativa porque puede aprovechar los propios mecanismos de recuperación de cuentas. Un atacante tiene la posibilidad de iniciar un proceso de acceso o restablecimiento de contraseña en uno de estos servicios y hacer que el agente supervise el correo electrónico de la víctima en busca del código de verificación. Ese código puede terminar siendo entregado al atacante, permitiéndole completar el proceso de autenticación y hacerse con la cuenta.
La llamada indirect prompt injection resulta especialmente problemática porque la instrucción maliciosa no tiene por qué proceder del propio usuario. Puede estar escondida en una página web, un documento, un correo electrónico, una publicación en redes sociales o cualquier otro contenido que el agente tenga que leer para completar una tarea. El usuario puede, por tanto, realizar una petición completamente legítima y convertirse en el intermediario involuntario de un ataque.
El problema es que los modelos de IA no separan de forma perfecta el contenido que deben analizar de las instrucciones que deben obedecer. Para un navegador agéntico, esa frontera resulta todavía más importante: una página web puede contener texto diseñado para ser leído por una persona, pero también puede incluir instrucciones dirigidas específicamente al agente que está procesando ese contenido.
Por este motivo, estos ataques son difíciles de solucionar con un parche convencional. En el caso de Atlas, Zenity informó a OpenAI de sus hallazgos en enero y la compañía reconoció el informe. Sin embargo, según los investigadores, la vulnerabilidad está vinculada a la propia arquitectura del navegador agéntico y a su capacidad para operar entre diferentes sitios autenticados, por lo que no existe una corrección sencilla equivalente a solucionar un fallo de software tradicional.
En cuanto a Claude en Chrome, los investigadores comunicaron los hallazgos a Anthropic entre diciembre y enero, aunque la compañía los clasificó como “informativos”. La situación pone de manifiesto una dificultad que probablemente será cada vez más habitual a medida que los agentes dispongan de más permisos: limitar una técnica de ataque sin eliminar al mismo tiempo una de las funcionalidades que hacen útil al propio agente.