一家名为 Generalist AI 的初创公司正在开发一种新型机器人,它能够通过观看简短的教学视频或人类演示来快速学习并执行物理任务,无需针对特定任务进行专门训练。这种方法模仿了人类,尤其是儿童的学习方式,让机器人展现出令人惊讶的即兴发挥和物理世界的直觉能力。尽管目前该技术的成功率约为 59%,尚未达到商业部署所需的 99% 以上的可靠性,但它展示了创造更通用、更具适应性机器人的巨大潜力,有望在制造业等领域引发变革。
像人一样学习的机器人
传统的机器人训练方法需要输入数千个任务案例,而且一旦环境(如光线)发生微小变化,机器人就可能失败。Generalist AI 的机器人则完全不同,它们能通过观察快速掌握新技能。
- 即兴发挥: 在一项任务中,机器人被要求用刷子和簸箕将一个物块扫入碗中。当研究人员拿走刷子后,机器人竟即兴地用簸箕像刷子一样,将物块弹入碗中。
- 灵活应变: 另一个双臂机器人在观看了一段人类拉开钱包拉链并取出钞票的视频后,成功地对一个不同类型的钱包完成了同样的操作。当一只手抓取失败时,它自主切换到另一只手,以获得更好的角度。
- 意外发现: 研究人员常常对机器人的行为感到惊讶。例如,当一根香蕉被放在机器人面前时,它选择用香蕉来清扫物品。
“这正是 GPT-3 出现时人们感到兴奋的那种事情,” Generalist 的联合创始人兼首席执行官 Pete Florence 说。“你可以直接给模型一个新任务的提示,它就有很大希望能完成它。”
核心方法:高质量的物理交互数据
这种能力的背后,是该公司对 “物理智能” 的关注,即让机器人像人类一样对物理世界有直观的理解。为了实现这一点,Generalist AI 采取了一种独特的数据收集方式。
- 特制手套: 公司设计了带有摄像头的特制手套,外形类似机器人的夹爪。
- 人类演示: 操作员(分布在墨西哥等地)会戴上这些手套来完成各种家务和操作任务。
- 大规模数据收集: 通过这种方式,公司收集了大量高质量的物理交互数据。这些数据不与任何特定的机器人绑定,使其具有更强的通用性。
与依赖现有开源模型的公司不同,Generalist AI 完全从零开始构建自己的人工智能模型,这使他们对技术有更强的掌控力。
专家观点与未来潜力
多位机器人专家对 Generalist AI 的方法给予了高度评价。佐治亚理工学院的机器人专家 Danfei Xu 指出,该公司“将这种(数据驱动)方法推向了极致”,并且在执行上做得非常出色,认为他们是“最接近可部署商业应用的公司”。
斯坦福大学的机器人专家 Karen Liu 也认为,该公司“大规模收集物理交互数据而不将其与特定机器人紧密绑定”的策略似乎正在奏效。
尽管前景广阔,但这项技术仍处于早期阶段。
- 成功率问题: 目前,机器人完成被展示过的任务的平均成功率仅为 59%,远低于商业化应用所需的 99% 以上。
- 通用性限制: 这些技能能否推广到所有可以想象的任务和环境中,目前尚不清楚。
即便如此,这项技术在制造业等领域的潜力是巨大的。一个生动的例子是,一名工程师深夜在机器人面前堆叠杯子,机器人观察后突然自发地加入进来,用它的两个夹爪一起堆叠。当机器人将所有杯子堆成整齐的一摞时,那名工程师兴奋地大喊起来,为机器人的这一举动感到惊喜。