Anthropic опубликовала исследовательскую работу под названием Automated Researchers Can Reliably Mitigate Alignment Failures, в которой описывается эксперимент с использованием автоматизированных систем искусственного интеллекта для улучшения показателей модели по тестам, измеряющим конкретные виды поведения, не соответствующего целям согласования. Согласно материалу, системы повысили показатели по всем десяти тестам, не ухудшив общую производительность модели.
Исследование возглавляет Chen Yueh-Han, сотрудница программы Anthropic, а система имитирует традиционный исследовательский цикл: изучает доступную литературу, предлагает способ улучшения модели, а затем обучает ее с помощью предложенного метода в течение 30 минут. После каждого раунда эффективные методы передаются на последующие этапы, а неэффективные исключаются, что позволяет быстро и масштабно повторять эксперименты.
Что изменилось на практике?
Основная ценность эксперимента заключается не просто в использовании одной модели для обучения другой, а в передаче части самого исследовательского процесса автоматизированной системе. Вместо того чтобы ограничиваться выполнением инструкций исследователя, искусственный интеллект пытается определять направления исследований, проверять их и сохранять те из них, чья успешность подтверждена.
В работе говорится, что эти результаты служат ранним свидетельством того, что автоматизированные исследования согласования после обучения могут стать практически осуществимыми в ближайшей перспективе. Речь идет о развитии поведения модели после базового этапа обучения с целью сокращения случаев ее несоответствия заданным целям на основе воспроизводимых критериев тестирования и методов обучения.
Прямое сравнение с человеческими исследованиями
Работа идет дальше демонстрации улучшения результатов тестов и сравнивает то, что она называет Automated Alignment Researcher, или AAR, с человеком-исследователем. Согласно приведенным результатам, лучший метод, предложенный системой AAR, в среднем превзошел предложения опытных исследователей-людей за шесть часов, а также отмечается, что направления исследований, заданные людьми, не привели к более высоким показателям.
Сравнение включает и экономический аспект: работа оценивает стоимость работы AAR примерно в 4 доллара за час вывода через интерфейс прикладного программирования по сравнению со 150 долларами за час, выплачиваемыми исследователям-людям в эксперименте. Эти цифры не доказывают, что автоматизированные системы могут заменить исследователей, но показывают, почему лаборатории заинтересованы в расширении автоматизированных экспериментов, когда задача поддается измерению.
Почему это не означает, что искусственный интеллект развивает себя без ограничений?
Представленный шаг приближается к идее рекурсивного самосовершенствования, то есть к использованию моделями других систем для улучшения методов своего обучения или поведения, однако сама работа устанавливает четкие границы этого результата. Система не может улучшить то, что критерии недостаточно хорошо измеряют. Если тесты согласования не отражают реальные цели согласования, улучшение результатов может привести лишь к улучшению показателей по индикатору, а не к решению проблемы, которую он должен измерять.
Кроме того, такой подход требует постоянных усилий по созданию, поддержанию и расширению критериев, а также обновлению литературы, на которую опирается автоматизированный исследователь. Поэтому человеческий фактор по-прежнему присутствует в определении того, что следует измерять, оценке пригодности используемых доказательств и методов, а также проверке того, можно ли обобщить результаты за пределами набора тестов.
Комментарий certi.news
Главный результат здесь заключается в том, что автоматизация исследований согласования перешла от общей идеи к конкретному эксперименту с обсуждаемыми цифрами и сравнениями: десять тестов, обучающие раунды продолжительностью 30 минут и превосходство над предложениями людей в среднем за шесть часов — согласно данным работы. Однако практическое значение по-прежнему связано с качеством критериев, направляющих систему. Измеренное улучшение само по себе не доказывает, что модель стала безопаснее во всех контекстах, как и сравнение стоимости вывода со стоимостью работы исследователей не решает вопрос надзора или научной ответственности.
Таким образом, работа дает убедительный сигнал о возможности ускорить исследовательский цикл в области согласования, но не доказывает скорого отказа лабораторий от людей-исследователей. Открытый вопрос, который она оставляет, заключается в том, смогут ли автоматизированные системы работать с более реалистичными и сложными целями согласования, а не просто улучшать конкретные показатели, заранее разработанные людьми.