Generalist AI представила свою базовую робототехническую модель GEN-1.5, которая позволяет роботу обучаться новым физическим задачам по одной короткой демонстрации вместо использования специализированного программирования или отдельных процессов обучения и тонкой настройки для каждой задачи. Согласно опубликованной компанией информации, модель способна анализировать демонстрацию продолжительностью от 3 до 12 секунд и выполнять задачу без поэтапных обновлений или дополнительной тонкой настройки.
Generalist AI называет такие примеры «физическим промптом» — контекстом, объединяющим данные сенсоров и последовательности движений, использованные в демонстрации. GEN-1.5 обрабатывает видеокадры вместе с данными сенсоров, языком, а также информацией о положении и движении робота. Модель использует 30-секундное контекстное окно и генерирует до 100 команд движения в секунду.
Первые результаты с заметной неоднородностью производительности
Компания протестировала модель в 10 коротких задачах манипулирования, и при использовании одной демонстрации средний показатель успешности составил 59%. После адаптации на данных продолжительностью пять минут, включавших около 50 демонстраций для каждой задачи и 10 поэтапных шагов, показатель вырос до 83%. В другом тесте, основанном на одной минуте данных и одном поэтапном шаге, модель продемонстрировала успешность 66,5%.
Эти показатели свидетельствуют о том, что GEN-1.5 способен использовать небольшое количество примеров, но также показывают, что производительность по-прежнему частично зависит от объёма данных и степени адаптации. Generalist AI признаёт, что протестированные ею задачи относительно просты и коротки, а текущие показатели успешности всё ещё ограничены.
От имитации движения к построению новой последовательности
Модель не ограничивается повторением увиденного движения. Когда ей отдельно показали сцену открытия молнии пенала и сцену извлечения из него монет, она смогла объединить физические промпты в одну непрерывную последовательность. Она также создавала переходные движения, отсутствовавшие в демонстрациях, например перемещение и исправление ошибок.
Примеры компании продемонстрировали способность модели менять стратегию при столкновении с непредвиденными обстоятельствами. В задаче, целью которой было с помощью щётки столкнуть предмет в контейнер, GEN-1.5 использовала банан как временный инструмент для достижения той же цели. Столкнувшись с лопаткой, модель не продолжила толкать ею, а подняла предмет и положила его в контейнер. Она также справилась с листом бумаги, закрывавшим контейнер, и удалила деталь Lego, застрявшую у неё на пальце, другой рукой.
Обучение в симуляции и на движениях людей
Модель также позволяет переносить демонстрацию, записанную в среде симуляции, на реального робота без дополнительных примеров, хотя данные симуляции не входили в этап предварительного обучения. В некоторых задачах она могла наблюдать движения, которые люди выполняли руками перед камерами робота, а затем воспроизводить задачу с помощью рук робота.
Что меняется на практике?
Значение этого подхода заключается в возможности сократить потребность в отдельном программировании каждой робототехнической задачи. Вместо подготовки специализированной системы в течение нескольких месяцев в будущем может быть достаточно показать роботу требуемое действие в течение нескольких секунд. Однако этот вывод не означает, что проблема решена: компания говорит, что предварительное обучение GEN-1.5 продолжается уже более восьми месяцев, а модель по-прежнему тестируется на ограниченном наборе задач и демонстрирует неполные показатели успешности.
По словам Generalist AI, после обучения на широком спектре данных о физических взаимодействиях модель начала адаптироваться к новым задачам с использованием меньшего объёма данных и вычислительных ресурсов. Компания утверждает, что способности к обучению в контексте и импровизации возникли в ходе предварительного обучения автоматически, без специального метода обучения или дополнительной цели, предназначенной для этих способностей.