Китайская компания X Square Robot, работающая в области воплощённого искусственного интеллекта, предлагает ясное видение создания универсальных роботов, способных переходить между задачами и платформами: интегрированный стек начинается с данных взаимодействия, проходит через модель физического мира и завершается моделью действий, объединяющей восприятие, планирование, рассуждение и принятие решений для формирования исполнимого поведения. Этот подход появляется в период, когда роботы по-прежнему в основном используют раздельные компоненты, которые не обязательно обеспечивают универсальную способность, переносимую с одной задачи на другую или с одной машины на другую.
В отличие от больших языковых моделей, которые воспользовались рецептом, основанным на предварительном обучении на обширных данных, в области робототехники пока нет согласия относительно соответствующего рецепта создания общего воплощённого интеллекта. X Square Robot делает ставку на то, что этот рецепт заключается не в одной всеобъемлющей модели, а во взаимосвязанных слоях, работающих в рамках более широкого направления, которое компания называет World Unified Model и которое объединяет зрение, язык, действие и прогнозирование физических изменений.
Взаимодействие вместо траектории движения
В основе видения компании лежат три главных принципа. Первый заключается в том, что базовой единицей робототехнических данных должно быть взаимодействие, а не только траектория движения: демонстрация считается успешной не просто потому, что суставы переместились, а когда она изменяет мир намеченным образом. Второй принцип состоит в том, что предварительное обучение должно формировать пригодную к использованию способность, а не просто отправную точку, требующую интенсивной тонкой настройки. Третий принцип заключается в организации поведения вокруг физических событий, а не вокруг фиксированных временных отрезков.
Эти принципы связывают слои стека между собой. Данные без участия робота, используемые для обучения модели действий, также организуются для подачи в модель мира. При этом компания поясняет, что модель мира и модель действий являются независимыми и взаимодополняющими семействами моделей, использующими общую программную основу в рамках более широкой архитектуры World Unified Model.
Менее дорогие и более контролируемые данные
X Square Robot считает, что узкое место на пути к универсальным роботам связано не столько с количеством параметров, сколько со стоимостью и качеством данных взаимодействия. Поэтому компания разработала систему сбора данных QUANXTA Zero Series — интерфейс для взаимодействия с роботами, в котором люди надевают платформу с двумя захватами вместо дистанционного управления роботом во время записи демонстраций.
Ключевое отличие заключается во включении физической проверки в контур контроля качества. Платформа записывает траектории, после чего их выборка воспроизводится на реальном роботе; учитываются только демонстрации, в которых задача действительно выполнена. Закрытие захвата на долю секунды раньше может выглядеть в данных как успешное захватывание, но в реальности способно оттолкнуть объект. По данным компании, доля пригодных данных в её конвейере составила около 85%.
Компания также сочетает большое количество записанных без робота человеческих демонстраций с небольшим объёмом данных реального робота, чтобы адаптировать модель к динамике конкретной машины. По её словам, такой подход обеспечивает производительность, близкую к производительности набора данных, полностью основанного на роботе, при снижении стоимости сбора примерно в 20 раз; главным образом это объясняется более низкой стоимостью носимой платформы по сравнению с конфигурациями дистанционного управления. Однако наиболее сильные из приведённых результатов измерялись на роботах компании и с использованием её линий сбора данных, поэтому для проверки обобщаемости необходимы более широкие независимые испытания.
Модель мира, основанная на событиях
Модель мира компании называется WALL-WM и использует связанные с действием семантические события в качестве базовой единицы. К ним относятся согласованные виды поведения, такие как протягивание руки к объекту, захватывание или размещение объекта; эти действия можно описать языком, увидеть на видео и выполнить в виде движения.
Этот подход критикует разбиение поведения на фиксированные временные окна, поскольку граница окна может проходить посреди одного движения или объединять два разных движения. Поэтому WALL-WM работает в режиме событий с фрагментами переменной длины, подходящими для рассуждения о долгосрочных задачах, а также предоставляет режим фиксированной длины для стабильной генерации актуальных выходных данных, которые может использовать модуль управления.
Чтобы сохранить визуальные знания, присутствующие в больших видеомоделях, в конструкции модель преобразования текста в видео соединена с недавно адаптированной сетью действий, которая считывает признаки видео, не перезаписывая их. Компания утверждает, что её эксперименты включали проверку обобщения на долгосрочные задачи в условиях, не встречавшихся во время обучения, и что модель превзошла базовые модели, настроенные на релевантных данных, в рамках разработанного компанией эталона для реальных роботов. Однако, согласно материалу, эти результаты по-прежнему измерялись на внутреннем эталоне, тогда как публикация кода позволяет сообществу протестировать и воспроизвести их.
Модель действий, пригодная для развёртывания, и семантическое кодирование
Wall-OSS-0.5 представляет собой модель компании для зрения, языка и действий. X Square Robot устанавливает для себя строгий критерий: предварительно обученная модель должна работать на реальном роботе до выполнения какой-либо специальной для задачи тонкой настройки.
Модель одновременно обучается по трём целям: отдельным токенам действий, связыванию языка с действием и генерации непрерывных действий; при этом градиенты проходят через эти компоненты, а отдельные части сети не замораживаются. Компания ссылается на поведение без тонкой настройки, включающее приближение, захватывание и восстановление, в том числе на задачу с деформируемыми объектами, которые не входили в обучающие данные.
Интерфейс действий X-Tokenizer переосмысливает преобразование непрерывного движения в токены как обучение семантического интерфейса. Старший токен выражает намерение движения, тогда как младшие токены несут тонкие детали; эти представления согласуются с признаками языковой модели. Согласно описанию компании, внесение шума в действие приводит лишь к небольшому изменению токена намерения, что помогает повторно использовать инструмент токенизации на разных роботах без его перенастройки.
Что ещё необходимо доказать?
В материале отмечается, что сочетание контроля качества данных посредством физического воспроизведения, моделирования на основе событий и критерия пригодности к развёртыванию до тонкой настройки придаёт подходу X Square Robot заметную целостность. Однако это пока не решает вопрос масштабирования за пределами экосистемы компании. Стоимость компании превысила 20 миллиардов юаней, то есть около 2,9 миллиарда долларов, что свидетельствует о доверии инвесторов к важности инфраструктуры данных, базовых моделей и масштабируемых систем обучения для воплощённого искусственного интеллекта, но само по себе не является доказательством технической производительности.
Компания предлагает исследователям проверить три аспекта: насколько представления на основе событий обобщаются на разные задачи, сцены, объекты, роботов и условия отказа; сохраняет ли предварительное обучение эффективность на роботах, которых модель не видела во время обучения; и возможно ли создать общий тест для реальных роботов, который сравнивал бы не только показатели успешности, но и определял причины неудач, такие как неправильное понимание инструкций, сбой восприятия или слабое восстановление.
Согласно видению X Square Robot, для появления роботов в домах потребуется больше, чем повышение показателя успешности в одной задаче. Надёжный домашний робот должен понимать свою неопределённость, замедляться при необходимости, просить о помощи и возвращать окружающую среду в безопасное состояние после падения объекта или неправильного понимания запроса. Ему также нужна осторожная персонализация, позволяющая изучать распорядок и предпочтения семьи, при этом безопасность и доверие должны оставаться приоритетом. С учётом того, что существующие доказательства в значительной степени основаны на роботах и эталонах компании, это видение пока остаётся важным техническим тезисом, ожидающим более широкой проверки со стороны исследовательского сообщества.