Компания Encord проверяет использование мозговых волн для улучшения данных, на которых обучаются складские и человекоподобные роботы, стремясь решить одну из самых сложных проблем физического искусственного интеллекта: нехватку реалистичных и достаточных обучающих данных. На объекте компании в городе Сан-Леандро, штат Калифорния, инструктор Эндрю Сеха снимал детали с башни из игры «Дженга», надевая шлем с камерой и датчиками, измеряющими его мозговые волны.
Этот эксперимент проводится совместно с Zander Labs, немецким стартапом в области нейронауки. Шлем предназначен не для чтения мыслей, а для измерения активности мозга с целью выявления таких психических состояний, как ошибка, намерение и удивление. Партнёрство пока находится на начальном экспериментальном этапе: Encord хочет создать набор данных, размеченный данными о мозговых волнах, а затем передать его роботизированным моделям клиентов, чтобы выяснить, улучшает ли он производительность, прежде чем принимать решение о расширении использования.
Проблема данных в физическом искусственном интеллекте
Encord была основана для помощи компаниям, разрабатывающим приложения компьютерного зрения, в разметке данных и оценке моделей. Однако по мере того как её клиенты переходили к обучению универсальных моделей для задач захвата и манипуляции объектами, компания поняла, что одного управления данными недостаточно и что ей также необходимо участвовать в их производстве.
По словам Винита Вила Моргана, руководителя направления роботизированного обучения в Encord, необходимые данные просто отсутствуют. Стремление сделать для роботов то же, чего генеративный искусственный интеллект добился для чат-ботов, сталкивается с потребностью в реальных данных из физического мира — данных, которые трудно собирать и масштабировать. Компании, создающие беспилотные автомобили, самостоятельно собирают данные из реального мира, но такой подход дорог и плохо масштабируется, тогда как одного обучения на видео может быть недостаточно для требуемой точности.
Вил Морган оценивает, что преодоление этого препятствия может потребовать набора данных примерно в пять раз больше коллекции видеороликов YouTube. Эти оценки помогают объяснить, почему производство данных для роботов превращается в отдельную коммерческую деятельность, а не остаётся лишь исследовательской задачей внутри лабораторий.
От видео, ориентированного на человека, к мозговым волнам
Компании, разрабатывающие «мозги» роботов, сейчас опираются на два основных источника данных. Первый — видео, ориентированное на человека, которое записывают рабочие, носящие камеры, с добавлением других ракурсов и различных измерений. Второй — данные, создаваемые роботами под дистанционным управлением людей. Encord использует оба подхода: собирает видео на нескольких заводах по всему миру и применяет свой объект в Сан-Леандро для испытания новых методов, таких как мозговые волны, или создания наборов данных для конкретных навыков с целью настройки моделей.
Во время посещения объекта инструкторы использовали платформы типа «ведущий—ведомый», состоящие из двух роботизированных рук: человек управлял первой, а вторая повторяла её движения. Эти платформы применяются для записи таких задач, как наливание кофе в чашки и складывание фишек для покера. В число задач также входило подключение и отключение кабелей Ethernet на задней панели сервера — это может помочь операторам центров обработки данных, если роботы смогут выполнять её с необходимой точностью.
Эти задачи выявляют ограничения нынешних роботов: роботизированные захваты менее искусны, чем человеческие пальцы, и лишены степеней свободы, которые мы используем естественным образом. Поэтому на объекте хранятся различные материалы и инструменты — от искусственных цветов, книг и пластиковых овощей до лотков с кошачьим наполнителем и пакетов с проводами, — чтобы обучать роботов бытовым задачам и навыкам манипуляции объектами.
Датчики мышц и плотная разметка
Encord также работает над другим методом, использующим датчики, закрепляемые на предплечье для регистрации электрических сигналов в мышцах. Видео, на котором руки перемещают предметы, может не показывать руку целиком, поэтому Вил Морган надеется использовать сигналы предплечья для построения трёхмерного представления положения руки в каждый момент, что даст моделям более полное понимание движения.
Наборы данных Encord размечаются точными физическими описаниями того, что видно на видео, например: «правая рука затягивает винт», — чтобы помочь моделям на основе больших языковых моделей понять происходящее. Вил Морган оценивает, что такой тип плотной разметки при обучении конкретным задачам в 100 раз ценнее низкокачественных «данных, ориентированных на человека», тогда как его производство стоит лишь в 20 раз дороже, что теоретически он считает приемлемым компромиссом.
Экономика производства данных
Однако высокая стоимость остаётся основным вызовом. Сбор текстов из интернета — подход, который помог лабораториям искусственного интеллекта обучать языковые модели на таких источниках, как Stack Overflow и веб-сайты, — обходится почти несопоставимо дешевле производства данных для обучения физического искусственного интеллекта. Данные для роботов необходимо создавать, выполняя реальные задачи, записывая и размечая их, что радикально меняет экономику построения моделей.
Encord считает, что её присутствие на площадке, где работают несколько робототехнических компаний, позволяет отслеживать методы, набирающие популярность в отрасли, а также то, что успешно или безуспешно улучшает модели физического искусственного интеллекта. Однако эксперимент с мозговыми волнами пока не доказал, что он повышает производительность моделей, и результаты испытаний с клиентами определят, превратятся ли эти данные из передового эксперимента в масштабируемую часть процесса обучения роботов.