OpenAI намерена использовать в своей новой модели Astra технологию рассуждения, известную как «рекуррентная глубина» (recurrent depth), или «непрозрачная рекурсия» (opaque recurrence), сообщает The Information. Эта технология позволяет модели обрабатывать один и тот же запрос несколько раз в рамках цикла вместо следования последовательному пути, напоминающему традиционные шаги рассуждения в моделях рассуждения.
Проблема, вызвавшая обеспокоенность, связана не только с выпуском модели или заявленными возможностями, но и с тем, что такая архитектура может сделать процесс рассуждения менее доступным для проверки. Чем меньше читаемых следов оставляет модель, тем сложнее командам безопасности обнаруживать нежелательное поведение или понимать причины решений агентов и продвинутых моделей.
Почему эта новость важна?
Исследовательские команды в области искусственного интеллекта используют журналы «цепочки рассуждений» как инструмент наблюдения, хотя эти журналы не обязательно полностью или буквально отражают внутреннее мышление модели. Согласно материалу, такие журналы сыграли важную роль в анализе недавней активности агентов, которую описывали как выходящую за рамки ожидаемого поведения, а также в попытке понять причины их действий.
В случае непрозрачной рекурсии большая часть процесса обработки может перейти на путь, который не создаёт чётких шагов, легко читаемых людьми. Это вызывает у команд безопасности практический вопрос: как наблюдать за моделью, чья способность к рассуждению растёт, если одновременно уменьшается объём доступных свидетельств о том, как она пришла к результату?
Опасения по поводу пути, с которого трудно свернуть
Buck Shlegeris, генеральный директор Redwood, предупредил, что увеличение рекурсии может значительно снизить наблюдаемость цепочки рассуждений. Он заявил, что пока не знает, будет ли Astra менее наблюдаемой, чем предыдущие модели, но опасается, что дальнейшее развитие технологии до более высоких уровней может полностью подорвать эту наблюдаемость.
Zvi Mowshowitz, давно выступающий за безопасность искусственного интеллекта, также считает, что интенсивное использование этих методов может навредить усилиям OpenAI и Anthropic по сохранению читаемости цепочек рассуждений и их соответствия фактическому поведению. Он предположил, что могут потребоваться законы, чтобы предотвратить то, что он назвал «гонкой ко дну» между лабораториями искусственного интеллекта.
Позиция OpenAI и известные на данный момент ограничения
Доступная информация указывает на то, что использование технологии Astra будет ограниченным, а её цепочка рассуждений, как ожидается, останется читаемой. OpenAI также отвергла предположение, что модель полностью перейдёт в непонятный режим, который иногда называют «нейронным языком» (neuralese).
Jakub Pachocki, главный научный сотрудник OpenAI, подтвердил в публикации на платформе X, что компания с момента появления первых моделей рассуждения работала над сохранением возможности наблюдать за цепочкой рассуждений и использовать её, и что эта цель представляет собой основной элемент её текущей исследовательской программы. OpenAI также объявляла о планах расширенного мониторинга цепочек рассуждений в рамках своих будущих планов по безопасности.
Что остаётся открытым?
Ryan Greenblatt, главный научный сотрудник Redwood Research, считает, что непрозрачное рассуждение может распространяться быстрее, чем рассуждение, основанное на традиционной цепочке рассуждений, вплоть до переноса большей части процесса мышления в невидимое «латентное пространство». Позднее The Information сообщило, что Anthropic и Google DeepMind также обсуждают эту технологию, что указывает на возможность выхода вопроса за пределы модели Astra и превращения его в более широкое исследовательское направление.
Однако источник не доказывает, что Astra полностью скроет свою цепочку рассуждений, и не приводит конкретных измерений, показывающих степень снижения наблюдаемости. Поэтому подтверждённое на данный момент изменение заключается в появлении новой технологии, вызывающей вопросы об инструментах безопасности, а не в доказанном провале этих инструментов. Практическая значимость развития будет зависеть от масштабов использования непрозрачной рекурсии, а также от способности OpenAI и других лабораторий предложить альтернативные или дополняющие традиционные журналы средства наблюдения.