Ciberseguridad

Cómo construye Google capas de seguridad para las capacidades de navegación agencial en Chrome

Google explica una arquitectura de seguridad multicapa para proteger las capacidades agenciales de Gemini en Chrome frente a la inyección indirecta de instrucciones, la filtración de datos y la ejecución de acciones no deseadas. La arquitectura incluye un modelo independiente para revisar la compatibilidad de las acciones con el objetivo del usuario y grupos que restringen los recursos que el agente puede leer o modificar, además de confirmaciones del usuario y pruebas continuas.

2025-12-08
8 min de lectura
7 visitas
فريق تحرير certi.news
Cómo construye Google capas de seguridad para las capacidades de navegación agencial en Chrome

Google presenta una arquitectura de seguridad multicapa para las capacidades de navegación agencial en Chrome, centrada en la principal amenaza para los navegadores capaces de ejecutar tareas automáticamente: la inyección indirecta de instrucciones. Este tipo de ataque puede aparecer en sitios maliciosos o en contenido de terceros dentro de iframes o reseñas de usuarios, y después inducir al agente a ejecutar acciones que no coinciden con el objetivo del usuario, como iniciar transacciones financieras o extraer datos confidenciales.

Google afirma que el diseño de navegación agencial segura en Chrome se benefició de la colaboración con expertos en seguridad de la empresa, así como de las protecciones existentes en Gemini y de los principios de seguridad de los agentes. La arquitectura propuesta combina defensas deterministas y probabilísticas con el objetivo de hacer más difícil y costosa la explotación del agente, manteniendo al usuario dentro del circuito de control al ejecutar acciones importantes.

Un modelo independiente para revisar las acciones del agente

Gemini utiliza, durante la fase de planificación, el contenido de las páginas que Chrome comparte con él para determinar el siguiente paso. Sin embargo, este contenido no es fiable por naturaleza, por lo que el modelo de planificación sigue siendo vulnerable a intentos de influencia destinados a cambiar el curso de la tarea. Google utiliza técnicas como Spotlighting para orientar al modelo a priorizar las instrucciones del usuario y del sistema sobre las instrucciones presentes en la página, y también ha incluido ataques conocidos en el entrenamiento de Gemini para ayudarlo a evitarlos.

Para añadir otra capa, Google presenta un componente llamado User Alignment Critic, un modelo independiente basado en Gemini que funciona como componente de alta confianza. Este modelo interviene una vez completada la planificación para examinar cada acción propuesta y se centra en una pregunta concreta: ¿sirve la acción al objetivo definido por el usuario? Si considera que la acción no es compatible con el objetivo, puede rechazarla.

Este componente no ve el contenido web sin filtrar, sino que consulta metadatos asociados con la acción propuesta. Esta arquitectura le proporciona menos contexto, pero mantiene su tarea más sencilla y más aislada del contenido malicioso: aprobar o rechazar. Cuando rechaza una acción, el crítico envía sus observaciones al modelo de planificación para reformular el plan, mientras que el sistema puede devolver el control al usuario si los fallos se repiten.

Restringir el alcance de los sitios a los que puede acceder el agente

Google extiende los principios de aislamiento de sitios y de la política del mismo origen al entorno de los agentes mediante el concepto de Agent Origin Sets. Los agentes necesitan operar en más de un sitio, por ejemplo, recopilar componentes de un sitio y después llenar un carrito de compras en otro. Sin embargo, conceder a un agente comprometido una capacidad ilimitada para interactuar con sitios aleatorios podría convertirlo en una vía para eludir el aislamiento de sitios y filtrar datos de sesiones locales con inicio de sesión.

Una función de control confiable identifica los orígenes asociados con la tarea y los divide para cada sesión en dos grupos claros:

  • Orígenes de solo lectura: se permite que Gemini consuma su contenido, mientras que el modelo no ve el contenido de un iframe si su origen no pertenece a este grupo.
  • Orígenes de lectura y escritura: se permite que el agente los lea y ejecute acciones en ellos, como hacer clic y escribir.

Esta separación reduce la posibilidad de transferir datos entre orígenes no relacionados con la tarea y también permite que el navegador no envíe al modelo los datos que quedan fuera del conjunto de lectura. El modelo de planificación no puede añadir nuevos orígenes por iniciativa propia; la función de control debe aprobarlos. Se aplica una separación similar al contenido no web, como las llamadas a herramientas, mediante la distinción entre llamadas de lectura y escritura y la verificación de su adecuación a la tarea.

Las transiciones a nuevos orígenes también están sujetas a revisión. Si el planificador propone pasar a un origen que no está en el conjunto de lectura, una instancia de User Alignment Critic verifica su relación con la tarea antes de añadirlo e iniciar la transición. Chrome también utiliza una comprobación determinista para restringir las URL generadas por el modelo a URL públicas conocidas, ya que las URL diseñadas por el modelo podrían utilizarse para extraer información privada. Si la página navega automáticamente a un nuevo origen, este se somete a la misma revisión.

Google reconoce que ajustar estos límites desde el primer intento es difícil antes de conocer cómo interactúan con ellos las tareas de los usuarios. Por ello, inicialmente implementó una versión más sencilla del control de recursos que supervisa los conjuntos de lectura y escritura, con planes para ajustar las funciones de control y el resto de los elementos del sistema con el fin de reducir la fricción y mejorar la seguridad.

Confirmaciones del usuario y supervisión de acciones sensibles

Chrome muestra los pasos del agente en un registro de actividad dentro de la pestaña, de modo que el usuario puede seguir lo que ocurre momento a momento, y también puede detener la tarea o recuperar el control en cualquier momento. Esta transparencia se complementa con un conjunto de comprobaciones deterministas y basadas en modelos que solicitan la confirmación del usuario antes de acciones importantes.

Los principales puntos de pausa son los siguientes:

  • Solicitar confirmación antes de navegar a sitios sensibles, como sitios relacionados con transacciones bancarias o información médica personal, basándose en una comprobación determinista de una lista de sitios sensibles.
  • Solicitar confirmación antes de iniciar sesión en un sitio mediante Google Password Manager, sin poner las contraseñas almacenadas directamente a disposición del modelo.
  • Detenerse antes de acciones como completar una compra o un pago, enviar un mensaje o realizar cualquier acción con consecuencias, y después solicitar permiso o pedir al usuario que ejecute el siguiente paso.

Detección, pruebas y respuesta

El sistema examina cada página que ve el agente en busca de inyección indirecta de instrucciones, en paralelo con la comprobación en tiempo real de Chrome mediante Safe Browsing y la inteligencia artificial en el dispositivo para detectar fraudes tradicionales. Un clasificador de inyección de instrucciones funciona en paralelo con la inferencia del modelo de planificación y puede bloquear las acciones que determina que el contenido de la página indujo con el objetivo de alejar al agente de la intención del usuario. Google reconoce que el clasificador no detectará todas las posibles influencias maliciosas, pero representa una capa adicional dentro de una defensa multicapa.

Para comprobar la eficacia de estos controles, Google creó sistemas automatizados de pruebas ofensivas que generan sitios maliciosos aislados e intentan desviar al agente de su curso. Las pruebas comienzan con ataques redactados por investigadores de seguridad y después los amplían mediante modelos lingüísticos y una técnica adaptada para agentes de navegador. Las pruebas se centran en contenido ampliamente difundido, como publicaciones de usuarios en redes sociales y anuncios, así como en ataques que podrían causar daños persistentes, como transacciones financieras o filtraciones de credenciales. Google utiliza la tasa de éxito de los ataques para evaluar los cambios de ingeniería y evitar regresiones, mientras que las actualizaciones automáticas de Chrome ayudan a distribuir las correcciones rápidamente.

Google actualizó las directrices de su programa de recompensas por vulnerabilidades para aclarar cómo pueden los investigadores externos centrarse en las capacidades agenciales de Chrome, y afirma que pagará hasta 20.000 dólares por vulnerabilidades críticas que demuestren una violación de los límites de seguridad. La empresa subraya que la seguridad de los agentes web sigue siendo un campo emergente y que estas protecciones evolucionarán a medida que continúen las pruebas y la colaboración con la comunidad de investigación de seguridad.

Fuente de la noticia
Google Security Blog
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias