机器人与自动化

Generalist AI 发布 GEN-1.5,可在数秒内教会机器人新任务

Generalist AI 发布了 GEN-1.5 模型,该模型能够仅通过一次时长 3 至 12 秒的演示学习新的物理任务,无需额外训练或微调。该模型在一组短时操作任务中的平均成功率达到 59%,经过额外数据适配后提升至 83%。

2026-08-20
1 分钟阅读
13 浏览量
certi.news
Generalist AI 发布 GEN-1.5,可在数秒内教会机器人新任务

Generalist AI 发布了其机器人基础模型 GEN-1.5,使机器人能够通过一次简短演示学习新的物理任务,而不必依赖专门编程,或针对每项任务分别进行训练和微调。根据公司公布的信息,该模型能够分析一段时长 3 至 12 秒的演示,并执行任务,无需渐进式更新或额外微调过程。

Generalist AI 将这类示例称为“物理提示词”,即汇集演示中所使用的传感器数据与运动序列的上下文。GEN-1.5 会处理视频画面,以及传感器数据、语言、机器人位置和运动信息。该模型使用时长为 30 秒的上下文窗口,每秒最多生成 100 条运动指令。

初步结果显示出明显的性能差异

公司在 10 项短时操作任务中测试了该模型。仅使用一次演示时,模型取得了 59% 的平均成功率。在使用时长 5 分钟的数据进行适配后,成功率提升至 83%;这些数据包含每项任务约 50 次演示,并经历 10 个渐进式步骤。在另一项基于 1 分钟数据和一个渐进式步骤的测试中,模型的成功率为 66.5%。

这些数字表明,GEN-1.5 能够利用少量示例,但也说明其性能仍在一定程度上取决于数据量和适配程度。Generalist AI 承认,其测试的任务相对简单且持续时间较短,当前成功率仍然有限。

从模仿动作到构建新序列

该模型并不局限于重复所看到的动作。当分别向它展示打开铅笔盒拉链和从中取出硬币的场景时,它能够将两个物理提示词合并为一个连续序列。它还生成了演示中不存在的过渡动作,例如重新定位和处理错误。

公司的示例显示,该模型在面对意外情况时能够改变策略。在一项旨在使用刷子将物体推入容器的任务中,GEN-1.5 使用香蕉作为临时工具来实现相同目的。当面对铲子时,它没有继续用铲子推动物体,而是抬起物体并将其放入容器中。它还处理了覆盖容器的纸张,并使用另一只手移除了卡在手指上的一块 Lego。

从模拟和人类动作中学习

该模型还能够将模拟环境中录制的演示迁移到真实机器人上,而无需额外示例,尽管模拟数据并未参与预训练阶段。在一些任务中,它能够通过机器人摄像头观察人们用手执行的动作,然后使用机器人的双手重新执行该任务。

实际会发生什么变化?

这种方法的重要性在于,它有可能减少为每项机器人任务分别编程的需求。未来,与其花费数月设置专用系统,不如只需在机器人面前演示几秒钟所需的操作。但这一结论并不意味着问题已经解决;该公司表示,GEN-1.5 的预训练已经持续了八个多月,而该模型目前仍仅在有限任务上进行测试,成功率也尚未达到完整水平。

据 Generalist AI 称,该模型在使用大规模物理交互数据进行训练后,开始以更少的数据和更低的计算能力适应新任务。公司表示,上下文学习和即兴应变能力是在预训练过程中自动出现的,无需专门的训练方法或针对这些能力设定额外目标。

新闻来源
c
作者

certi.news

同一分类

你可能还喜欢

查看所有新闻