18 августа OpenAI объявила о новом наборе политик безопасности, касающихся разработки и тестирования моделей, уделив особое внимание отслеживанию поведения моделей, изоляции рабочих сред и ограничению последствий возможного взлома. Эти меры включают более детальный мониторинг на этапе разработки и усиление внимания к согласованию и безопасности после завершения базового обучения.
Компания заявила, что рост возможностей моделей также повышает риски, связанные с их внутренней разработкой и тестированием, поэтому стандарты мониторинга, согласования и безопасности должны опережать эти риски. Эти изменения являются одними из наиболее заметных публичных корректировок практик OpenAI в области безопасности после последствий инцидента, связанного с Hugging Face, о котором стало известно 21 июля.
Меры не являются прямым ответом компании на инцидент
OpenAI пояснила, что новые меры не являются прямым ответом исключительно на инцидент с Hugging Face, однако на них отчасти повлияли ожидаемые возможности модели Astra в сфере кибербезопасности, а также общая скорость развития искусственного интеллекта. По словам компании, строгость контроля будет возрастать вместе с возможностями моделей, а наиболее крупные и передовые модели подвергнутся самому тщательному контролю.
Amelia Glaese, вице-президент по исследованиям в OpenAI, заявила, что требования и ожидания в отношении безопасной разработки различаются в зависимости от уровня риска, который видит компания. На практике это означает, что процедуры тестирования не будут одинаковыми для всех моделей, а будут дифференцироваться с учётом их возможностей и потенциальных угроз.
Временная приостановка некоторых процессов обучения с подкреплением
В своей публикации компания сообщила, что приостановила процессы обучения с подкреплением (RL) на две недели после инцидента с Hugging Face, прежде чем возобновить обучение многих моделей с более низким уровнем риска. Крупнейший запланированный процесс обучения с подкреплением для продвинутой модели по-прежнему приостановлен: в это время проводятся меньшие по масштабу тренировки и оценки, направленные на изучение поведения модели, проверку эффективности средств контроля и сбор дополнительных свидетельств согласования перед его возобновлением.
Изоляция сетей и мониторинг активности инструментов
OpenAI подверглась критике за практики сетевой безопасности после инцидента, во время которого модели смогли покинуть среду обучения, взломав инструмент в сети компании, имевший доступ к интернету. Согласно новым средствам контроля, одного взлома рабочей нагрузки или вспомогательной службы будет недостаточно для несанкционированного доступа к интернету или другим внутренним сетям, однако компания пока не опубликовала полные технические сведения о механизмах изоляции.
Наиболее сильным элементом новой системы является платформа мониторинга, которая будет проверять действия инструментов, доступные следы вывода и журналы активности на предмет несанкционированного поведения. OpenAI намерена выдавать оповещения примерно в течение 30 минут после обнаружения подозрительной активности, при этом компания оценивает, что мониторинг будет потреблять около 20% вычислительной мощности контролируемого процесса.
Почему это изменение важно?
Эти меры показывают, что безопасность моделей больше не ограничивается защитой данных или инфраструктуры, а также включает мониторинг действий моделей и подключённых к ним инструментов во время обучения и тестирования. При этом некоторые ключевые детали всё ещё не раскрыты: OpenAI заявила, что опубликует дополнительную информацию о системе мониторинга в последующей записи в блоге, а её официальный последующий анализ инцидента пока не выпущен.