具身智能(Physical AI)正处于发展的十字路口,其发展现状类似于大语言模型诞生前的“GPT-2时代”。尽管机器人硬件能力不断提升,但其智能水平仍无法胜任有价值的实际工作,这背后的核心瓶颈是高质量训练数据的严重匮乏,即“机器人数据危机”。行业内存在两种主要发展路径的争论:一是开发通用型机器人,二是专注于特定垂直任务以实现商业化。对于具身智能的“ChatGPT时刻”何时到来,业内专家们持有不同看法,从面向消费者的突破性产品到开箱即用的可靠操控能力,各有解读。
发展的困境:期望与现实的差距
尽管具身智能是风险投资的热门领域,但机器人硬件能力的进步与其创造实际价值的能力之间存在明显脱节。
- 市场表现波动: 中国机器人制造商优必选(Unitree)的股价在IPO后大幅下跌,反映出市场对其机器人虽身体能力强但缺乏实用“头脑”的担忧。
- 行业核心矛盾: 开发者大会规模迅速扩大,显示出行业的巨大热情。然而,一个展位上“解决机器人数据危机”的标语也揭示了行业面临的根本挑战——缺乏高质量的训练数据来构建可靠的AI模型。
- 商业化难题: 无论是通用型机器人的研发,还是针对特定任务的端到端学习,都尚未能交付性能可靠的商业化产品。
“没有客户关心成功率只有80%的通用机器人。”
机器人的“GPT-2时代”与数据危机
当前具身智能的发展阶段被业内人士比作“GPT-2时代”,即在大模型实现突破性进展之前。要实现跨越式发展,需要解决数据和算力问题。
- 数据是关键瓶颈: 开发人员认为,模仿前沿AI实验室的成功路径是关键,即寻找或创造更多样化的数据集,并优化训练方案。
- 模拟环境的重要性: 为了获得高质量数据,需要用于创建高保真模拟环境的工具,这尤其依赖于为光线追踪优化的GPU。
- 自动驾驶的启示: 自动驾驶领域之所以领先,部分原因在于能够从人类驾驶的汽车中收集大量相关数据。该领域积累的数据处理工具和基础设施正被应用于机器人研发。
两条路径的争论:通用 VS 垂直
关于如何推进具身智能业务,行业内存在两种截然不同的策略。
垂直深耕,快速落地:
- 一些公司选择专注于特定任务,如 Gritt 建造太阳能农场、Agility 在工业环境中部署机器人、Bedrock 自动操作挖掘机。
- 这种策略的优势在于能更快地产生收入并获得宝贵的真实世界部署数据。
- 但其风险在于,基于当前“GPT-2”水平的技术构建的狭窄应用,未来可能会被基于“GPT-4”水平的通用技术所颠覆。
通用模型,着眼未来:
- 另一些公司则致力于开发通用人形机器人,但这些产品目前还走不出实验室。
- 自动驾驶公司如 Wayve 和 Uber 也已成立机器人实验室,押注其在数据和模拟方面的积累能够帮助它们在通用机器人领域取得优势。
Wayve 的首席执行官 Alex Kendall 认为:“操控机器人技术就像五年前的自动驾驶。” 他相信数据基础设施和模拟平台可以共享,但需要为不同的机器人形态调整模型。
何为机器人的“ChatGPT时刻”?
对于具身智能领域何时能迎来像 ChatGPT 那样的引爆点,行业领袖们给出了不同的答案。
消费者层面的兴奋点: Alex Kendall (Wayve CEO) 认为,真正的突破是能让消费者感到兴奋的产品,而非仅仅是投资者。他举例说:“当你在汽车上以低于1000美元的硬件成本实现‘脱眼’自动驾驶时,就是一个例子。”
开箱即用的可靠操控: Théophile Gervet (Genesis AI CEO) 的看法是,当机器人能够开箱即用地完成各种基本操控任务时,那一刻就到来了。
“你可以用自然语言与机器人交谈,让它完成任何基本的操控任务,比如推、拉、合上笔记本电脑、清理桌子……并且能达到80%以上的可靠性——这大致就是你的ChatGPT体验。”
“Apple II 时刻”而非“ChatGPT 时刻”: Adrian Macneil (Foxglove CEO) 则提出了一个独特的观点,他认为机器人领域不会有“ChatGPT时刻”。 > “让ChatGPT成为一个历史性时刻的是它的分发方式——用户量在一周内从零增长到百万级……而物理世界的分发要困难得多。我更期待机器人领域的‘Apple II时刻’或‘IBM PC时刻’。那时我能买到一个可以做些有用又有趣事情的家用机器人。”