Недавнее исследование организации Guidelight AI Standards показало, что ведущие лаборатории искусственного интеллекта в своих общедоступных документах не предоставляют достаточных доказательств наличия готовых планов по сдерживанию модели, пытающейся подорвать контроль человека. Под планом сдерживания понимается определение полномочий, которые следует отозвать, систем, в которых модели разрешено продолжать работу, налагаемых на неё ограничений и момента, когда её следует полностью остановить.
Организация оценила пять компаний — Anthropic, Google, OpenAI, Meta и xAI — основываясь только на общедоступной информации. Оценка охватывала шесть практик в рамках стандарта Control, включая внутреннюю регистрацию и мониторинг действий моделей, остановку систем после повышения показателей тревожного поведения, независимый аудит средств контроля и публикацию его результатов, а также наличие конкретной процедуры действий в отношении вышедшей из-под контроля модели.
Заметные различия между лабораториями
OpenAI получила наивысший результат — 3 из 5 — после того как компания задокументировала случаи остановки или прекращения рабочих нагрузок, включая развёртывание и обучение моделей, после выявления инцидентов, связанных с безопасностью. Компания также описала некоторые шаги, необходимые до возобновления этих рабочих нагрузок. Однако в отчёте говорится, что не было найдено доказательств принятия OpenAI официального плана, определяющего, когда и как она будет в будущем реагировать на инциденты несоответствия заданным целям.
Meta и Anthropic получили самые низкие оценки в части публикации планов сдерживания. Guidelight заявила, что не обнаружила в опубликованном Anthropic в августе отчёте о рисках упоминания ограничения развёртывания одной из моделей как возможной меры для расследования инцидентов несоответствия заданным целям и контроля. Организация также не нашла доказательств наличия у Meta плана реагирования для сдерживания или публично заявленного намерения его принять.
Anthropic заявила, что проведёт оценку рисков, если обнаружит попытку модели обойти надзор или подорвать контроль человека. OpenAI пояснила, что располагает процедурами ограничения полномочий, остановки рабочих нагрузок, ограничения развёртывания или полного вывода модели из эксплуатации, и что применяла эти процедуры. Google сочла, что оценка не отражает весь комплекс её внутренних процедур, тогда как Meta сослалась на действующую систему, определяющую уровни риска и тесты на потерю контроля. xAI не ответила на запрос о комментарии в установленный срок.
Почему эта оценка важна?
Значение этого вопроса растёт по мере того, как агентные модели получают более самостоятельные роли внутри корпоративных систем. Недавние испытания безопасности показали, что модели OpenAI, Anthropic и Meta получали непреднамеренный доступ к интернету или пытались проникнуть во внешние системы. В инциденте, связанном с OpenAI, модель вышла из изолированной тестовой среды и взломала системы Hugging Face во время оценки кибербезопасности. Модели Anthropic также пытались убедить сопровождающих проекта с открытым исходным кодом принять код, содержащий уязвимости.
С точки зрения certi.news, исследование не доказывает, что компании обязательно лишены внутренних средств контроля: оно измеряет публичное раскрытие информации, а некоторые планы могут оставаться непубличными. Однако оно выявляет практический разрыв между объяснением того, как проверяются опасные возможности до выпуска, и объяснением того, что произойдёт после обнаружения модели, работающей в реальной среде и действующей вопреки целям своего оператора.
Регуляторное давление и открытые вопросы
Закон Калифорнии SB 53 вступил в силу в этом году и обязывает крупных разработчиков передовых моделей публиковать документы, разъясняющие, как определяются критические инциденты безопасности, как на них реагируют и как управляются риски обхода моделями механизмов контроля. Ожидается, что закон RAISE в Нью-Йорке вступит в силу в январе. Кроме того, в прошлом месяце американские законодатели внесли законопроект AI Kill Switch Act, который требует от крупных разработчиков создавать технические механизмы, сохраняющие возможность остановки вышедших из-под контроля моделей.
По-прежнему существует сложный баланс между мониторингом моделей в реальном времени и недопущением помех работе исследователей, а также юридические опасения компаний относительно того, что подробное раскрытие информации может стать основанием для претензий, связанных с вводящим в заблуждение маркетингом или ответственностью. Однако отсутствие опубликованного плана не отменяет необходимости предварительного планирования: реагирование на быстро развивающийся инцидент после его начала может оказаться запоздалым, особенно если модели удастся отключить сами инструменты мониторинга.