OpenAI опубликовала на GitHub набор из 722 математических исследований, созданных внутренней моделью искусственного интеллекта, которую компания пока не предоставила для общего использования. Набор охватывает 372 семейства результатов, включая попытки решить открытые задачи, остававшиеся нерешёнными в течение длительного времени, согласно оценке независимой группы Advisory Group on Mathematics and Artificial Intelligence (AGMAI).
Однако публикация этих работ не означает, что они признаны окончательными математическими достижениями. OpenAI поясняет, что результаты находятся на разных этапах проверки, а некоторые неофициальные исследования могут содержать ошибки. Все они нуждаются в проверке математическим сообществом и подтверждении через обычные академические каналы.
От примерно 4 тысяч задач к 722 исследованиям
В ходе оценки модель протестировали примерно на 4 тысячах математических задач. После фильтрации результатов по уровню значимости OpenAI выбрала опубликованный набор, состоящий из 372 семейств и 722 исследований. Компания утверждает, что создание одного результата в среднем требовало вычислительных ресурсов, эквивалентных примерно трём часам доступной пользователям ChatGPT Pro мощности рассуждения.
Чтобы повысить возможность проверки, OpenAI опубликовала дополнительные данные о 10 задачах, включая краткие сводки хода рассуждений, оценки использованных вычислительных ресурсов и количество задач, для которых предпринимались попытки решения. Примеры относятся к различным областям, среди которых мера иррациональности числа π, гипотезы Mahler, гипотеза Kaplansky о прямой конечности и трёхмерная релятивистская система Vlasov-Maxwell.
Проверка с использованием Lean не является полной
Значительная часть опубликованных доказательств прошла проверку с использованием Lean — системы математической верификации, которая позволяет компьютеру проверять логическую непротиворечивость доказательства. Тем не менее не все исследования из набора пока имеют формальную проверку с помощью Lean.
OpenAI намерена обновлять репозиторий GitHub по мере завершения процессов формальной проверки. Компания утверждает, что большинство результатов было создано по единой процедуре, однако имеются исключения: одно из исследований, посвящённых области отсутствия нулей дзета-функции Римана, было получено другим способом, а его текст был отредактирован человеком для повышения удобства чтения.
Почему эта новость важна?
Основная ценность набора заключается не только в количестве исследований, но и в проверке нового способа создания математических результатов, поддающихся анализу. Доступность файлов, данных о вычислительных затратах, сводок рассуждений и частичной автоматической проверки предоставляет исследователям элементы, необходимые для оценки того, создаёт ли модель открытия, которые можно перепроверить, или лишь убедительные на вид тексты.
В то же время сохраняются очевидные ограничения: проверка не завершена, человеческая и академическая экспертиза ещё не окончены, а результаты модели пока не представляют собой систему, доступную исследователям, или общедоступный продукт. AGMAI призывает компании, занимающиеся искусственным интеллектом, публиковать математические результаты через академические каналы, раскрывать использованные модели, затраты и методы и не превращать открытия исключительно в маркетинговый инструмент.
OpenAI также объявила, что будет финансировать семинары, конференции и специальные программы для изучения важных результатов, создаваемых искусственным интеллектом, параллельно работая над ответственным предоставлением доступа к внутренней модели. Поэтому нынешний набор представляет собой экспериментальный шаг в том, как документировать научные результаты, созданные автоматически, а не окончательную оценку математических способностей модели.