Google предлагает многоуровневую концепцию безопасности для агентских возможностей просмотра в Chrome, уделяя основное внимание главной угрозе для браузеров, способных автоматически выполнять задачи: косвенному внедрению команд. Такие атаки могут появляться на вредоносных сайтах или в стороннем содержимом внутри iframe либо пользовательских отзывах, а затем побуждать агента выполнять действия, не соответствующие цели пользователя, например начинать финансовые операции или выводить конфиденциальные данные.
Google заявляет, что безопасный дизайн агентского просмотра в Chrome основан на сотрудничестве экспертов компании по безопасности, существующих средствах защиты Gemini и принципах безопасности агентов. Предлагаемая архитектура объединяет детерминированные и вероятностные средства защиты, чтобы сделать эксплуатацию агента более сложной и затратной, сохраняя при этом контроль пользователя над выполнением значимых действий.
Отдельная модель для проверки действий агента
На этапе планирования Gemini использует содержимое страниц, которым Chrome делится с ним, чтобы определить следующий шаг. Однако это содержимое по своей природе ненадёжно, поэтому модель планирования остаётся уязвимой для попыток повлиять на неё и изменить ход задачи. Google использует такие методы, как Spotlighting, чтобы направить модель на предпочтение инструкций пользователя и системы инструкциям, содержащимся на странице, а также включила известные атаки в обучение Gemini, чтобы помочь ему избегать их.
Для добавления ещё одного уровня Google представляет компонент под названием User Alignment Critic — отдельную модель, созданную на базе Gemini и работающую как компонент с высоким уровнем доверия. Эта модель подключается после завершения планирования, чтобы проверить каждое предложенное действие, сосредотачиваясь на конкретном вопросе: служит ли действие цели, заданной пользователем? Если действие признаётся несовместимым с целью, модель может отклонить его.
Этот компонент не видит нефильтрованное веб-содержимое, а получает метаданные, связанные с предложенным действием. Такая архитектура предоставляет ему меньше контекста, но делает его задачу проще и лучше изолирует от вредоносного содержимого: одобрить или отклонить. При отклонении действия критик отправляет свои замечания модели планирования для переработки плана, а при повторных сбоях система может вернуть управление пользователю.
Ограничение набора сайтов, к которым агент может получить доступ
Google распространяет принципы изоляции сайтов и политики одного источника на агентскую среду через концепцию Agent Origin Sets. Агентам необходимо работать с несколькими сайтами — например, собирать компоненты на одном сайте, а затем заполнять корзину на другом, — однако предоставление взломанному агенту неограниченной возможности взаимодействовать со случайными сайтами может превратить его в канал обхода изоляции сайтов и утечки данных из локальных сеансов с выполненным входом.
Надёжная функция управления определяет источники, связанные с задачей, и для каждого сеанса разделяет их на две чёткие группы:
- Источники только для чтения: Gemini разрешено использовать их содержимое, при этом содержимое iframe не показывается модели, если его источник не входит в эту группу.
- Источники для чтения и записи: агенту разрешено читать из них и выполнять на них действия, например нажимать кнопки и вводить текст.
Такое разделение снижает вероятность передачи данных между источниками, не связанными с задачей, а также позволяет браузеру вообще не отправлять модели данные, находящиеся за пределами группы чтения. Модель планирования не может самостоятельно добавлять новые источники: их должна одобрить функция управления. Аналогичное разделение применяется к содержимому, не связанному с вебом, например к вызовам инструментов, с различением вызовов для чтения и записи и проверкой их соответствия задаче.
Переходы к новым источникам также проходят проверку. Если планировщик предлагает перейти к источнику, отсутствующему в группе чтения, копия User Alignment Critic проверяет его связь с задачей перед добавлением и началом перехода. Chrome также использует детерминированную проверку, ограничивающую URL, создаваемые моделью, известными общедоступными адресами, поскольку специально созданные моделью адреса могут использоваться для вывода частной информации. Если страница автоматически переходит к новому источнику, этот источник проходит ту же проверку.
Google признаёт, что с первого раза трудно установить такие границы, не зная, как с ними будут взаимодействовать пользовательские задачи. Поэтому изначально компания внедрила более простую версию управления активами, которая отслеживает группы чтения и записи, и планирует настроить функции управления и остальные элементы системы, чтобы уменьшить трение и повысить безопасность.
Подтверждения пользователя и контроль чувствительных действий
Chrome отображает действия агента в журнале работы внутри вкладки, поэтому пользователь может отслеживать происходящее в реальном времени, а также в любой момент остановить задачу или вернуть себе управление. Эту прозрачность дополняет набор детерминированных проверок и проверок на основе моделей, которые запрашивают подтверждение пользователя перед значимыми действиями.
Основные точки остановки включают:
- Запрос подтверждения перед переходом на чувствительные сайты, например сайты, связанные с банковскими операциями или персональной медицинской информацией, на основе детерминированной проверки списка чувствительных сайтов.
- Запрос подтверждения перед входом на сайт с использованием Google Password Manager, при этом сохранённые пароли напрямую модели не предоставляются.
- Остановку перед такими действиями, как завершение покупки или платежа, отправка сообщения или любое действие с последствиями, после чего запрашивается разрешение либо пользователю предлагается выполнить следующий шаг.
Обнаружение, тестирование и реагирование
Система проверяет каждую страницу, которую видит агент, на наличие косвенного внедрения команд. Параллельно Chrome выполняет оперативную проверку с помощью Safe Browsing и искусственного интеллекта на устройстве для обнаружения традиционного мошенничества. Классификатор внедрения команд работает параллельно с выводом модели планирования и может блокировать действия, которые, по его определению, были вызваны содержимым страницы с целью отклонить агента от намерения пользователя. Google признаёт, что классификатор не обнаружит каждое потенциально вредоносное воздействие, однако он представляет собой дополнительный уровень многоуровневой защиты.
Чтобы проверить эффективность этих средств контроля, Google создала автоматизированные системы атакующего тестирования, которые генерируют изолированные вредоносные сайты и пытаются сбить агента с курса. Тесты начинаются с атак, разработанных исследователями безопасности, а затем расширяются с помощью языковых моделей и технологии, адаптированной для браузерных агентов. Тестирование сосредоточено на широко распространённом содержимом, например пользовательских публикациях в социальных сетях и рекламе, а также на атаках, способных причинить устойчивый ущерб, таких как финансовые операции или утечка учётных данных. Google использует показатель успешности атак для оценки инженерных изменений и предотвращения регрессий, а автоматические обновления Chrome помогают быстро доставлять исправления.
Google обновила рекомендации своей программы вознаграждений за поиск уязвимостей, чтобы разъяснить, как внешние исследователи могут сосредоточиться на агентских возможностях Chrome, и заявляет, что выплатит до 20 000 долларов за критические уязвимости, демонстрирующие обход границ безопасности. Компания подчёркивает, что безопасность веб-агентов остаётся новой областью, а эти средства защиты будут развиваться по мере продолжения тестирования и сотрудничества с сообществом исследователей безопасности.