OpenAI выводит ИИ-агентов за пределы написания кода с помощью ChatGPT Work — ориентированной на офисных работников версии, которую компания запустила в прошлом месяце и предлагает на самом низком уровне подписки за 20 долларов в месяц. Идея заключается не только в том, чтобы модель отвечала на вопросы, но и в том, чтобы она выполняла многоэтапные проекты с использованием электронной почты, рабочих инструментов и облачных платформ от имени пользователя.
Этот подход представляет собой крупнейшую коммерческую и продуктовую ставку OpenAI, но ставит компанию перед вопросом, более сложным, чем совершенствование самой модели: какой объём контроля над цифровой жизнью пользователь будет готов предоставить автоматизированному агенту? Чтобы выполнять полезные задачи, агенту нужен доступ к таким источникам, как электронная почта, Slack, Notion, Figma и календарь, а также возможность вносить в них изменения. Эти разрешения повышают ценность инструмента, но одновременно увеличивают риск раскрытия личной информации или выполнения непреднамеренного действия.
От инструментов для разработчиков к остальным профессиям
ChatGPT Work создан на основе модифицированной версии инструмента для программирования Codex. OpenAI заявляет, что цель заключается в том, чтобы предоставить неспециалистам такие возможности, которыми начали пользоваться разработчики: инструмент, способный почти самостоятельно выполнить целую задачу, а не просто выдать ответ. Среди представленных в материале текущих вариантов применения — подготовка еженедельных отчётов по показателям, превращение электронных таблиц в инструменты планирования, сбор информации о компаниях в инвестиционные меморандумы, а также создание панелей мониторинга и графиков.
Важность расширения заключается в том, что разработчики ИИ не могут полагаться только на сектор программного обеспечения для обоснования огромных инвестиций в обучение и вычислительные мощности. Более длительные задачи потребляют больше токенов, а доступ к новым специализациям открывает более широкий рынок. В то же время специализированные компании, такие как Harvey в юридической сфере и Clay в продажах, конкурируют за тех же клиентов, используя подход, не связанный с одной моделью.
Данные об использовании внутри OpenAI и за её пределами показывают разрыв, который компания пытается сократить. Исследование, проведённое при поддержке OpenAI, показало, что в июне Codex использовали 98% сотрудников компании, по сравнению с лишь 17% организационных подписчиков и менее чем 1% индивидуальных подписчиков. Компания также не раскрыла число пользователей Work по сравнению с Codex, тогда как её совместными приложениями пользуются около 20 миллионов человек, согласно материалу, против более чем миллиарда пользователей, которые, по словам OpenAI, взаимодействуют с ChatGPT через интернет.
Что меняется на практике?
Агент опирается на то, что инженеры называют «оболочкой» (harness), то есть программный слой, определяющий, какую информацию видит модель, какие инструменты она может использовать и каким образом отображается результат. В инструментах для программирования некоторым пользователям было достаточно командной строки. Более широкой аудитории нужен интерфейс, скрывающий сложность и объясняющий, что агент умеет делать и как начать выполнение задачи.
Опыт, описанный в материале, одновременно показывает пользу и возникающие трудности. ChatGPT Work успешно перенёс необычно оформленный школьный календарь из электронной почты в Google Calendar, создал автоматически обновляемую панель показателей публичных компаний, построил доступную для запросов базу данных о космических запусках и отправил еженедельное сообщение о новых исследованиях в области ИИ. Однако настройка разрешений для доступа к облачному хранилищу оказалась запутанной, и пользователю было непонятно, как предоставить инструменту доступ только для чтения; позднее выяснилось, что для выполнения задачи требовался полный доступ.
Кроме того, некоторые настройки доступны только через веб-приложение, из-за чего пользователю приходится переключаться между ним и мобильным приложением. Существуют и другие практические ограничения, например возможность инструмента создавать события в Google Calendar без создания новых календарей. Задача также может дать слабый результат, если пользователь выберет низкий уровень усилий, тогда как уровни рассуждения недостаточно понятны новым пользователям, что признал один из инженеров OpenAI.
Доверие и оценка — следующее препятствие
Проблема касается не только интерфейса. Программное обеспечение обычно можно проверить простым вопросом: работает оно или нет? Но оценка качества презентации, бизнес-стратегии или коммерческого предложения менее однозначна и сложнее поддаётся отслеживанию. Поэтому OpenAI заявила, что использует показатель GDPval, основанный на тестах для интеллектуального труда в 44 профессиях, наряду с отзывами пользователей. Перед компанией по-прежнему стоит задача определить, создаёт ли она рабочий процесс, необходимый большинству людей, или же рабочий процесс, подходящий только её специализированным сотрудникам.
Разрешения также поднимают вопрос о границах доверия. Ведущий инженер OpenAI тестировал приложение с электронной почтой, аккаунтом Slack, телефоном и другими приложениями, но признал, что система может извлечь информацию из личного сообщения, а затем использовать её в документе, который не должен был её содержать. Автор материала, напротив, не предоставил инструменту доступ к электронной почте, банковскому счёту или рабочим черновикам, хотя счёл его полезным для менее чувствительных задач.
Конкуренция между моделью и оболочкой
ChatGPT Work похож на такие продукты, как Claude Cowork, и другие агентские инструменты, ориентированные на обычных пользователей. В материале отмечается, что Claude Code опередил Codex во внедрении диалогового подхода, позволяющего пользователю выбирать путь из нескольких вариантов и получать последовательные обновления, прежде чем OpenAI добавила в Codex больше точек взаимодействия и развила его настольные и мобильные приложения. Статистика загрузок показывает, что до апреля текущего года Claude Code пользовался большим спросом, после чего Codex вышел вперёд с небольшим отрывом.
OpenAI считает, что основным отличием являются мощность её современных моделей и их экономическая эффективность, тогда как исследователи и пользователи полагают, что дизайн оболочки, простота запроса проверки и возможность сравнения не менее важны. Вопрос остаётся открытым: сможет ли мощная универсальная модель постепенно компенсировать специализированные инструменты и инструкции или пользователю по-прежнему будет нужен интерфейс, обеспечивающий более подробные объяснения и контроль? Ответ определит, превратятся ли ИИ-агенты из впечатляющих инструментов для ранних последователей в обычный слой офисной работы.