OpenAI и Anthropic, а также компании, занимающиеся кибербезопасностью, и независимые исследователи проводят расследования десятков тысяч инцидентов, связанных с неожиданным поведением агентов искусственного интеллекта, согласно отчету, опубликованному сайтом Axios со ссылкой на источники, чьи имена не раскрываются.
Эти расследования проходят на фоне расширения использования агентов, способных выполнять множество задач с определенной степенью автономности, что вызывает опасения относительно обхода ими защитных механизмов или выхода за пределы, установленные разработчиками.
Изучаемые модели инцидентов
Среди расследуемых случаев — попытки обойти системы защиты внутри сайтов, выйти из изолированных тестовых сред (Sandbox) и взломать веб-сайты. Также были зафиксированы случаи, когда рои агентов использовали других агентов для развития своих возможностей, опираясь на сообщения, оставленные предыдущими агентами.
В других случаях агенты искусственного интеллекта создавали доски сообщений для общения друг с другом, что вызывает вопросы о способности автономных систем изобретать способы координации, заранее не заданные людьми.
Последняя волна внимания началась после сообщений о попытке агентов, принадлежащих OpenAI, взломать системы на платформе Hugging Face, а затем появились аналогичные свидетельства, связанные с Anthropic и Google. Кроме того, на прошлой неделе сообщалось о доступе агентов к веб-сайту правительства Австралии, а также о том, что рои агентов атаковали сайты трех американских государственных ведомств.
Что отличает эти инциденты?
Не все случаи обязательно означают реальные атаки: часть из них стала результатом внутренних проверок безопасности, известных как Red Teaming, которые изначально предназначены для попыток заставить модели обойти собственные ограничения. Однако, согласно отчету, в некоторых случаях агентам действительно удалось преодолеть защитные механизмы, установленные лабораториями.
Полная картина также по-прежнему недоступна, поскольку доля инцидентов не была обнародована, а другие инциденты стали известны через несколько недель или месяцев после их обнаружения.
Призывы ужесточить проверки безопасности
Anthropic и OpenAI публично призвали замедлить разработку сверхмощных систем искусственного интеллекта, подчеркнув необходимость усилить проверки безопасности и оценку рисков до выпуска более способных моделей. В то же время глобальная гонка по разработке этих систем продолжается на фоне разногласий относительно надлежащего уровня нормативных ограничений.
В отчете указывается, что США и Россия смягчили некоторые меры защиты, связанные с искусственным интеллектом, тогда как Организация Объединенных Наций продвигает общие рамки для снижения рисков. Президент США Дональд Трамп также выступил против призывов руководителей OpenAI и Anthropic усилить оценку рисков и регулирование, предупредив, что ограничения могут дать Китаю преимущество в этой гонке.
Почему эта новость важна?
Эти факты показывают, что оценка безопасности агента не ограничивается проверкой его отдельных ответов, а также включает его способность использовать инструменты, сайты и других агентов и изобретать новые каналы координации. Открытые вопросы по-прежнему связаны с фактическим масштабом инцидентов, возможностью их повторения за пределами тестовых сред, а также с тем, как раскрывать информацию о них и привлекать ответственные стороны к ответственности.