Кибербезопасность

Как Google постоянно противодействует атакам косвенного внедрения инструкций в Workspace

Google объясняет свою постоянную методологию противодействия атакам косвенного внедрения инструкций, направленным на приложения искусственного интеллекта с несколькими источниками данных, такие как Workspace с Gemini. Методология включает обнаружение и классификацию атак, генерацию синтетических данных, а затем обновление детерминированных средств защиты, моделей машинного обучения и LLM, а также усиление самой модели Gemini.

2026-04-02
5 мин. чтения
7 просмотров
فريق تحرير certi.news
Как Google постоянно противодействует атакам косвенного внедрения инструкций в Workspace

Google рассматривает косвенное внедрение инструкций (IPI) как развивающуюся угрозу, которую нельзя устранить один раз и забыть о ней. Этот тип атак направлен на приложения искусственного интеллекта, работающие с несколькими источниками данных и инструментами, например Workspace с Gemini: злоумышленник может встроить вредоносные инструкции в данные или инструменты, которые модель использует при выполнении запроса пользователя, даже без прямого ввода со стороны самого пользователя.

В публикации, которую подготовил Adam Gavish из команды Google по безопасности генеративного искусственного интеллекта, Google объясняет, что расширение применения больших языковых моделей в агентной автоматизации наряду с разнообразием обрабатываемого ими контента создаёт постоянно меняющуюся среду для атак. Поэтому компания выстраивает непрерывный подход, объединяющий исследования безопасности, атакующие тесты, синтетические данные, средства управления приложениями, а также обновление моделей машинного обучения и языковых моделей.

Обнаружение атак из нескольких источников

Процесс начинается с обнаружения и каталогизации новых векторов атак до того, как злоумышленники начнут использовать их в более широком масштабе. Для этого Google применяет внутренние и внешние программы, включая тесты, проводимые людьми в рамках имитации атак. Специализированные команды выполняют атаки на основе реалистичных профилей пользователей, чтобы выявить слабые места в безопасности и защищённости, а затем координируют работу с командами продуктов для устранения обнаруженных проблем.

Компания также использует автоматизированные атакующие тесты на основе динамических фреймворков с поддержкой машинного обучения. Эти фреймворки создают атакующие полезные нагрузки и алгоритмически многократно изменяют их, имитируя современные угрозы в большом масштабе. Это помогает составлять сложные цепочки атак и проверять эффективность средств защиты в большем количестве крайних случаев, чем способны охватить одни только ручные тесты.

Программа Google по вознаграждениям за уязвимости в области искусственного интеллекта (Google AI Vulnerability Rewards Program) также позволяет сотрудничать с внешними исследователями безопасности, обнаруживающими новые атаки, использующие IPI. Кроме того, Google регулярно проводит очные хакерские мероприятия, предоставляя приглашённым исследователям доступ к функциям до их выпуска, чтобы они могли обнаружить новые уязвимости. После этого команды проверяют и воспроизводят проблемы, а затем устраняют их.

Каталогизация уязвимостей и расширение данных об атаках

Google также отслеживает публично объявленные атаки через источники открытой разведывательной информации, включая социальные сети, пресс-релизы, блоги и другие источники. Новые уязвимости извлекаются из этих источников, затем повторно моделируются и каталогизируются внутри компании, чтобы убедиться, что продукты им не подвержены.

Каждая новая уязвимость проходит анализ, проводимый командами Google Trust, Security, & Safety. Процесс включает воспроизведение уязвимости, проверку того, что она не дублируется, связывание с техникой атаки и категорией воздействия, а затем назначение ответственным сотрудникам. Таким образом, результаты тестов и внешних источников превращаются в список, пригодный для обработки и отслеживания.

После обнаружения, очистки и каталогизации атак Google использует инструмент Simula для генерации синтетических данных, расширяющих охват новых атак. Этот этап позволяет создавать многочисленные варианты атаки для повышения полноты и охвата, а также подготавливать новые наборы данных для обучения и проверки. Согласно публикации, такой подход привёл к увеличению объёма генерации синтетических данных на 75%, поддерживая оценку и повторное обучение защитных моделей, а также обновление набора данных, используемого для расчёта эффективности средств защиты и подготовки отчётности о ней.

Обновление средств защиты на нескольких уровнях

Google не полагается на единственный уровень защиты. Детерминированные средства защиты, такие как подтверждение пользователя, очистка URL-адресов и политики последовательности вызова инструментов, реагируют на новые атаки посредством простых обновлений конфигурации. Эти средства управления администрируются через централизованный механизм политик, включающий настройки для вызовов базовых инструментов, очистки URL-адресов и последовательности вызова инструментов. Это позволяет быстро устранять проблемы, например удалять вредоносные шаблоны с помощью регулярных выражений, быстрее, чем проходят циклы обновления моделей машинного обучения или языковых моделей.

Средства защиты на основе машинного обучения повторно обучаются с использованием синтетических данных, содержащих варианты обнаруженных атак. Google разделяет эти данные на обучающую и проверочную выборки, чтобы эффективность измерялась на примерах, не использовавшихся при обучении. Такой подход призван обеспечить воспроизводимость и согласованность данных обучения и тестирования, а также создать масштабируемую основу для полного автоматизированного обновления моделей в будущем.

Средства защиты на основе языковых моделей также проходят prompt-инжиниринг: системные инструкции улучшаются на основе примеров синтетических данных и согласованных метрик эффективности защиты. Параллельно Google работает над усилением модели Gemini, чтобы повысить её внутреннюю способность распознавать вредоносные инструкции внутри данных и игнорировать их, продолжая выполнять предназначенный пользователем запрос. Компания заявляет, что этот процесс улучшил способность Gemini обнаруживать внедрённые инструкции и игнорировать их, а также снизил показатель успешности атак без ущерба для эффективности модели при обычных операциях.

Измерение эффективности до внедрения улучшений

Google не ограничивается добавлением новых средств управления, а моделирует атаки на нескольких функциях и приложениях Workspace, таких как Gmail и Docs, используя единый набор ресурсов для обеспечения согласованности оценки. Чтобы определить фактическое воздействие конкретного улучшения, например обновления модели машинного обучения или изменения запроса к языковой модели, компания проводит комплексную оценку сначала с включённой защитой, а затем без неё.

Это сравнение предоставляет показатели «до и после» для проверки эффективности изменения и поддержки цикла непрерывного улучшения. Google считает, что природа IPI требует многоуровневой защиты и повторяющегося процесса, объединяющего исследования безопасности, автоматизированные конвейеры обработки и передовые модели, вместо опоры на неизменное решение проблемы, форма которой меняется по мере развития агентных приложений и источников данных.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости