Generalist AI 发布了其机器人基础模型 GEN-1.5,使机器人能够通过一次简短演示学习新的物理任务,而不必依赖专门编程,或针对每项任务分别进行训练和微调。根据公司公布的信息,该模型能够分析一段时长 3 至 12 秒的演示,并执行任务,无需渐进式更新或额外微调过程。
Generalist AI 将这类示例称为“物理提示词”,即汇集演示中所使用的传感器数据与运动序列的上下文。GEN-1.5 会处理视频画面,以及传感器数据、语言、机器人位置和运动信息。该模型使用时长为 30 秒的上下文窗口,每秒最多生成 100 条运动指令。
初步结果显示出明显的性能差异
公司在 10 项短时操作任务中测试了该模型。仅使用一次演示时,模型取得了 59% 的平均成功率。在使用时长 5 分钟的数据进行适配后,成功率提升至 83%;这些数据包含每项任务约 50 次演示,并经历 10 个渐进式步骤。在另一项基于 1 分钟数据和一个渐进式步骤的测试中,模型的成功率为 66.5%。
这些数字表明,GEN-1.5 能够利用少量示例,但也说明其性能仍在一定程度上取决于数据量和适配程度。Generalist AI 承认,其测试的任务相对简单且持续时间较短,当前成功率仍然有限。
从模仿动作到构建新序列
该模型并不局限于重复所看到的动作。当分别向它展示打开铅笔盒拉链和从中取出硬币的场景时,它能够将两个物理提示词合并为一个连续序列。它还生成了演示中不存在的过渡动作,例如重新定位和处理错误。
公司的示例显示,该模型在面对意外情况时能够改变策略。在一项旨在使用刷子将物体推入容器的任务中,GEN-1.5 使用香蕉作为临时工具来实现相同目的。当面对铲子时,它没有继续用铲子推动物体,而是抬起物体并将其放入容器中。它还处理了覆盖容器的纸张,并使用另一只手移除了卡在手指上的一块 Lego。
从模拟和人类动作中学习
该模型还能够将模拟环境中录制的演示迁移到真实机器人上,而无需额外示例,尽管模拟数据并未参与预训练阶段。在一些任务中,它能够通过机器人摄像头观察人们用手执行的动作,然后使用机器人的双手重新执行该任务。
实际会发生什么变化?
这种方法的重要性在于,它有可能减少为每项机器人任务分别编程的需求。未来,与其花费数月设置专用系统,不如只需在机器人面前演示几秒钟所需的操作。但这一结论并不意味着问题已经解决;该公司表示,GEN-1.5 的预训练已经持续了八个多月,而该模型目前仍仅在有限任务上进行测试,成功率也尚未达到完整水平。
据 Generalist AI 称,该模型在使用大规模物理交互数据进行训练后,开始以更少的数据和更低的计算能力适应新任务。公司表示,上下文学习和即兴应变能力是在预训练过程中自动出现的,无需专门的训练方法或针对这些能力设定额外目标。