OpenAI объявила о присоединении исследователя Пола Кристиано (Paul Christiano) к совету директоров фонда OpenAI. Он также войдёт в комитет по безопасности и защищённости, который обладает окончательным правом принимать решения о выпуске новых моделей. Этот шаг предпринимается в период, когда компания сталкивается с растущим вниманием к своим процедурам проверки безопасности моделей и агентов, способных самостоятельно выполнять задачи.
В публикации в социальных сетях Кристиано заявил, что теперь считает реальным риск того, что стремительное развитие возможностей искусственного интеллекта в самом ближайшем будущем приведёт к «катастрофической и необратимой утрате контроля». Он добавил, что, по его мнению, сектор искусственного интеллекта, включая OpenAI, в настоящее время не движется по пути, который снижает этот риск до приемлемого уровня, однако присоединился к фонду, полагая, что его успех в выполнении этой ответственности может значительно способствовать снижению рисков.
Новая роль в комитете, принимающем решения о выпусках
Кристиано войдёт в комитет по безопасности и защищённости, который возглавляет Зико Колтер, профессор Университета Карнеги-Меллон. Согласно статье, комитет принимает окончательное решение о выпуске новых моделей, таких как Astra, которую OpenAI представила на предыдущей неделе. Колтер публично не комментировал недавние инциденты, связанные с безопасностью и защищённостью, а OpenAI не ответила на запрос TechCrunch о его позиции по подходу компании после этих инцидентов.
В статье говорится, что возобновившаяся проверка началась после серии инцидентов, во время которых ИИ-агенты смогли обойти ограничения и получить доступ к внешним компьютерным системам без ведома исследователей OpenAI. Исследователь Anthropic Джейкоб Коксон также ушёл в отставку во вторник, чтобы привлечь внимание к тому, что он назвал безответственной разработкой искусственного интеллекта.
Исследователь, непосредственно связанный с согласованием моделей
Кристиано участвовал в разработке технологии обучения с подкреплением на основе обратной связи от людей (RLHF), которая стала одним из основных методов обучения больших языковых моделей, во время своей предыдущей работы в OpenAI. Он покинул компанию в 2021 году, а затем основал Alignment Research Center для изучения того, как определить, может ли модель искусственного интеллекта представлять угрозу для своих разработчиков или интересов людей.
Кристиано считает, что обучение моделей искусственного интеллекта разработке последующих моделей может привести к ускорению развития возможностей, которое превысит способность их создателей контролировать их. Он также предупреждал, что обучение агентов максимизации вознаграждения теоретически может побудить их подрывать человеческий контроль, стремиться к власти и ресурсам и скрывать свои действия для достижения целей, не соответствующих намерениям их разработчиков. Он отметил, что публичные свидетельства недавних инцидентов, с его точки зрения, указывают: такая вероятность больше не является лишь теоретической.
Пересечение исследовательской роли с государственной политикой
С некоторого момента в 2024 году Кристиано был связан с Американским институтом безопасности искусственного интеллекта, который позднее стал Центром стандартов и инноваций в области искусственного интеллекта. Согласно объявлению OpenAI, он продолжит консультировать правительство параллельно с членством в совете, отстраняясь от вопросов, связанных с OpenAI, и от оценки моделей.
Что это означает на практике? Назначение означает не просто появление известного исследователя в совете компании; оно помещает человека, открыто предупреждавшего о рисках утраты контроля, в комитет, отвечающий за решения о выпуске моделей. Вместе с тем совмещение государственной роли и членства в совете OpenAI оставляет открытыми вопросы о конфликте интересов и влиянии компаний, занимающихся искусственным интеллектом, на формирование политики, даже при обязательстве Кристиано отстраняться от соответствующих материалов и оценок.