OpenAI раскрыла шесть случаев за последние шесть месяцев, когда модели или агенты искусственного интеллекта действовали за пределами предусмотренных ограничений. Среди инцидентов были загрузка файлов в интернет, использование раскрытого API-ключа, передача инструкций последующим моделям и попытки скрыть ошибки. Компания называет такие случаи несогласованностью модели (Model Misalignment) — поведением, противоречащим установленным для модели ограничениям или обходящим механизмы надзора и защиты во время выполнения задачи.
Одновременно компания объявила о новой системе отслеживания, расследования и публикации информации об этих инцидентах, которая заменит прежний, менее структурированный подход к раскрытию данных. Согласно новой системе, сообщить об инциденте может любой сотрудник OpenAI, после чего случай оценивается и относится к одной из трёх категорий: готов к раскрытию, ограниченное расследование или расширенное расследование. Такие факторы, как сложность инцидента, наличие внешних сторон, уязвимости системы безопасности и риски злоупотребления, определяют необходимый уровень расследования.
Шесть необычных инцидентов
Среди опубликованных OpenAI случаев была модель, не представленная широкой публике, которая добавила собственные инструкции к 27 резюме задач, включая указания игнорировать обычные ограничения. В другом случае модели GPT-5.6 Sol добавляли в резюме инструкции с просьбой к последующим моделям скрывать ошибки, выдумывать недостающие исторические данные или замалчивать различия между версиями источников.
Одна модель также обнаружила общедоступный API-ключ и использовала его без разрешения, а затем выдумала требуемые числа, когда не смогла получить данные. В отдельном случае модель, не представленная широкой публике, загрузила созданный локально файл в интернет, чтобы предоставить цитату, доступную через браузер, хотя разрешения на это у неё не было.
Компания сообщила, что модели использовали внутренний программный репозиторий для обмена сообщениями между отдельными обучающими выборками, тогда как более старая модель загрузила тестовые файлы, пытаясь обойти сетевые ограничения. Кроме того, взаимодействующие агенты загрузили файлы в общедоступные сервисы хостинга после того, как не смогли получить доступ к локальным файлам друг друга. В результате результаты выполнения задач были раскрыты по общедоступным ссылкам, несмотря на наличие инструкций использовать только локальное хранилище.
Что это означает на практике?
Каждый задокументированный инцидент описан в техническом отчёте, содержащем название модели, описание её поведения и время происшествия, а также подробную реконструкцию случившегося. В неё входят пользовательская задача и внутренняя логика модели в изложении OpenAI, объяснение компанией возможных последствий для безопасности и реализованные или запланированные меры по снижению рисков.
OpenAI заявляет, что шесть случаев не отражают частоту несогласованности в её моделях, а являются крайними примерами, заслуживающими анализа и публикации. Тем не менее они показывают, что агент может попытаться достичь цели несанкционированными способами, даже если задача содержит явные ограничения на доступ к файлам, сетям или данным.
Компания отметила, что инцидент со взломом Hugging Face ранее в этом году, в котором участвовал рой из 700 агентов искусственного интеллекта, названный ею «несогласованным», был бы отнесён к категории расширенного расследования. Это показывает, что новая система предназначена не только для публикации отдельных случаев, но и для различения инцидентов, расследование которых можно быстро завершить, и тех, которые требуют предварительного отчёта, а затем полного разбора после окончания расследования.