谷歌在 2023 年发布的 RT-2 模型是机器人技术的一个转折点,它首次将大型语言模型的能力与机器人的物理操作直接结合,实现了类似 GPT-3 在人工智能领域的突破。通过在海量互联网数据上进行预训练,RT-2 模型能够理解抽象指令并将其转化为精确的机器人动作,即使面对从未见过的物体或概念(如认出泰勒·斯威夫特的照片)也能完成任务。尽管 RT-2 的能力在当时令人瞩目,但其在精细操控等方面仍有局限,这激发了一波机器人技术创业热潮,包括由前谷歌团队成员创立的 Physical Intelligence 公司,他们正致力于解决这些早期模型的不足,推动技术走向成熟。
机器人的“GPT-3 时刻”:RT-2 的诞生
人工智能领域的一个关键突破是 GPT-3 的出现,它证明了一个足够大的模型可以泛化并执行多种任务,而无需针对每个任务进行专门训练。机器人技术在 2023 年也迎来了类似的时刻,标志性事件就是谷歌发布的 RT-2 模型。
与前代模型 RT-1 的 3500 万参数相比,RT-2 拥有数十亿参数,规模的巨大提升带来了质的飞跃。RT-2 表现出了强大的泛化能力和“涌现能力”,这些能力继承自其在网络规模的视觉和语言数据上的预训练。
一个经典的例子是,研究人员让机器人将可乐罐移动到泰勒·斯威夫特的照片旁。
“机器人模型的数据中从未有过任何关于泰勒·斯威夫特的信息。它必须理解‘泰勒·斯威夫特’这个概念,将其与图像联系起来,然后再关联到正确的动作……这一切都来自互联网数据。”
这个实验的成功让研究团队意识到,将大型语言模型从互联网中获得的先验知识与机器人运动连接起来是完全可行的。谷歌将这种模型命名为视觉-语言-行动 (VLA) 模型,这一概念很快成为行业标准。
RT-2 如何工作:视觉-语言-行动模型
RT-2 的前身 PaLM-E 是一个视觉语言模型(VLM),它能理解图像和文本,但只能生成自然语言指令(如“把蓝色方块向左移动”),无法直接控制机器人。而 RT-2 的核心创新在于训练模型直接生成底层的机器人动作指令。
其工作流程如下:
- 远程控制: 由于模型体积过大,RT-2 在谷歌数据中心运行,通过网络向机器人发送指令。
- 循环指令: 整个任务被分解成一系列微小的步骤。在每个步骤中:
- 模型接收到一个指令提示(如“机器人应该采取什么行动来移动可乐罐?”)和机器人摄像头的实时图像。
- 模型输出一串数字,这些数字代表机械臂的目标坐标、旋转角度和夹爪的开合程度。
- 机器人执行这个微小的动作。
- 整个循环重复,直到任务完成。
为了让模型学会生成这些动作指令,谷歌进行了大规模的数据收集。在 17 个月里,工作人员通过远程操控 13 台机器人在测试厨房中执行了超过 13 万次任务,例如拿起物体、打开抽屉等。用这些数据训练后的 RT-2 获得了惊人的能力,可以在新环境和杂乱的台面上操作它从未见过的物体。
从谷歌出走:创业公司推动技术发展
尽管 RT-2 取得了突破,但其能力仍有限。团队成员 Karol Hausman 认为,这项技术需要一个专门的组织来全力推动。
“很明显,要实现这个目标,就需要创建一个以解决物理智能为唯一目的的组织。它不能在另一个组织里作为第 20 优先事项来解决。”
因此,Hausman 和其他四名 RT-2 团队成员离开谷歌,创立了名为 Physical Intelligence (PI) 的创业公司。他们的目标是专注于解决机器人技术的根本性难题,而不是追求短期收入。
未来方向:提升精细操控与新架构探索
RT-2 的成功开启了机器人技术的繁荣期,但它也只是一个开始。Hausman 坦言,虽然移动可乐罐的演示在当时令人兴奋,但从机器人真正能做到的事情来看,这又是一个“相当可悲的演示”。
在过去几年中,以 Physical Intelligence 为代表的研究机构和公司一直在努力弥补这一差距,主要集中在以下几个方面:
- 提升精细运动控制能力,使机器人能够执行更复杂、更灵巧的操作。
- 实现长时程、多步骤任务,让机器人可以完成持续数分钟的复杂工作流程。
- 探索从视频中学习,让模型能够通过观察人类执行任务的视频来学习新技能。
此外,行业也在探索被称为“世界模型”的新架构,它可能成为超越 VLA 模型的新范式,进一步推动物理智能的发展。