Synth Daily

Gemini Robotics 2 问世:赋予机器人“全身智能”

Gemini Robotics 2 旨在为机器人赋予“全身智能”,使其不再局限于预设的重复性任务。这套新的人工智能模型层让机器人能够实现智能的全身控制、精细的手部操作以及多机器人协同工作。其核心是通过视觉语言动作(VLA)、具身推理(ER)和设备端(On-Device)三类模型,让机器人能理解指令、规划复杂任务并适应不同形态的硬件,标志着通用物理人工智能的发展迈出了重要一步。

传统机器人大多被预先编程或远程遥控,只能执行狭窄、重复的任务序列。它们缺乏自主学习或适应不可预测环境的能力。

从编程到思考:新一代机器人智能

Gemini Robotics 2 作为一个智能层,旨在解决机器人领域长期存在的挑战。它赋予各种形态的机器人思考、行动和智能交互的能力,使其能够安全地完成任务。这套系统让机器人能够理解每一个动作背后的原因,从而解锁了广泛的应用场景。例如,一个人形机器人可以利用它来行走、下蹲、伸展和操作物体,以清理一个凌乱的房间,甚至能与其他机器人合作以提高效率。

核心能力:三大模型协同工作

这一进步是通过三个功能强大的模型实现的:

  • Gemini Robotics 2 (VLA): 这是最先进的视觉-语言-动作模型,能将视觉和语言输入转化为电机控制指令,驱动机器人行动。它能够控制从脚到指尖的完整人形机器人,并实现了更高水平的双手灵巧操作。
  • Gemini Robotics ER 2 (ER): 这是功能最强的具身推理模型,作为机器人的“大脑”或代理。它使机器人能与人交流、理解物理世界,并规划持续数分钟的多步骤任务。
  • Gemini Robotics On-Device 2 (VLA): 这是最高效的设备端模型,经过优化可在机器人设备上本地运行。它能够仅用几小时的数据就快速适应全新的机器人身体。

“全身智能”:从桌面任务到全身协调

现实世界是为人类的活动方式而构建的,要求我们在狭窄、杂乱的空间中伸手、弯腰和保持平衡。与之前仅控制上半身的模型不同,Gemini Robotics 2 将物理人工智能扩展到了 全身运动

当控制 Apptronik 的 Apollo 2 人形机器人时,我们可以指示它“把水壶放到下面架子的绿色箱子里”。机器人会处理指令,走到桌子旁拿起水壶,再走几步到架子前,准确地将其放入目标位置。这标志着机器人向完成需要全身协调的复杂现实任务迈出了重要一步。

指尖上的精细操作

为了在家庭和工作场所中真正发挥作用,机器人需要精细的操作能力。Gemini Robotics 2 提升了机器人在不同末端执行器上的物理灵巧度,无论是使用多指手还是夹爪。

  • 该模型可以控制 Apollo 2 机器人上具有 22 个自由度的五指手,完成 打结密封自封袋 等精细动作。
  • 它也可以操作标准的双指夹爪,在 Franka Duo 平台上执行 紧密堆叠 等复杂的灵巧任务。

智能代理与多机器人协作

现实世界中的大多数任务都需要在较长时间内分多个步骤完成。为了管理这种复杂性,具身推理模型 Gemini Robotics ER 2 充当机器人的高级大脑,负责:

  • 处理用户指令并与人类沟通。
  • 观察环境,推理完成任务所需的步骤
  • 协调 VLA 模型执行具体动作。
  • 跟踪任务进度,直到完成。

此外,该系统引入了 多机器人协作 的能力。这使得不同类型的机器人可以相互沟通、协同工作,以解决单个机器人无法独立完成的复杂流程。

快速适应与本地化运行

许多机器人应用需要在没有网络延迟或互联网连接的环境下运行。Gemini Robotics On-Device 2 专为此类限制而设计,它可以在机器人设备上本地运行。该模型能够以极高的效率适应新的机器人身体,通常 只需几个小时的适应时间和少于 200 个示例数据,即使是面对外形、传感器和自由度差异巨大的新机器人也同样有效。

安全是基础

随着机器人物理能力的增强,确保端到端的安全至关重要。Gemini Robotics 2 在应对现实世界的不确定性和与人类协作方面提升了机器人的安全性。

我们引入了 ASIMOV-Agentic,这是一个用于代理安全编排和不确定性解决的新基准。它能衡量推理代理拒绝不安全指令的能力,并主动在不确定时请求人类干预。

同时,增强的具身推理能力使 Gemini Robotics ER 2 成为迄今为止最安全的机器人模型。它能更好地检测附近的人类,并在有人靠近时触发安全措施,使机器人安全停止,这是协作安全标准的一项关键要求。