引言:一个婴儿和一本书,哪个更聪明?

想象两个"学习者"。

第一个,从出生起就坐在一个装满书籍的房间里,从未动过一下。它读完了所有书,能背诵百科全书,能回答任何理论问题——“重力是什么?““火为什么是热的?"——答案完美无误。

第二个,一个刚出生的婴儿。它什么书都没读过,但它在爬、在摸、在摔、在把东西塞进嘴里。它发现拍打水面会溅起水花,推倒积木会发出响声,松开手里的球,球会掉到地上。

现在问题来了:这两个"学习者"中,谁更有可能真正理解这个世界?

直觉告诉我们,婴儿虽然知识少,但它对世界的理解是"活的”——它知道重量、温度、因果、空间,这些不是从书上学来的,而是从身体的互动中"长"出来的。

这就引出了一个深刻的问题:AI要真正理解世界,是否需要一具身体?


一、从"离身"到"具身”——一场认知革命

传统AI从诞生之初就是"离身"的。

它坐在计算机里,处理的是符号、数字、文本,从未"触碰"过物理世界。它知道"杯子是圆柱形的,可以盛水”,但这个"知道"和人类对杯子的知道完全不同——你拿起杯子时能感受到它的重量、材质、温度,你知道杯柄应该怎么握,你知道倒热水时杯壁会变烫。

这些"知道"不是来自书本,而是来自身体的直接体验

20世纪80年代,认知科学发生了一场革命:认知不是"大脑"的独立活动,而是"大脑-身体-环境"三方互动的产物。 这就是具身认知理论。

它的核心主张很简单:你的身体形态决定了你如何思考。一个没有手的人,对"拿"的理解和有手的人完全不同。一个只会爬行的生物,和能飞行的生物,对"空间"的理解截然不同。你的身体是你理解世界的"硬件接口"——它决定了你接收什么信息,形成什么概念。

人类的视觉系统不是被动接收图像的照相机,而是主动搜索的探照灯——眼睛不停地跳动,头转向声音的方向,手伸出去触摸。你的身体不是在"被动感知",而是在主动构建感知。

这就是"离身"AI的根本局限:它缺少了感知-行动闭环这个最基础的学习回路。


二、感知-认知-行动:智能的"三角循环"

具身智能的工作方式,可以用一个简单的三角循环来理解:

感知 → 认知 → 行动 → 感知 → 认知 → 行动……

每一步都依赖前一步,也改变着下一步。

感知:摄像头看到前方有一个障碍物,激光雷达测出距离,触觉传感器感受到地面摩擦力。

认知:大脑处理这些信息——“这是个台阶,高度15厘米,表面是光滑的。我可以跨过去,但需要调整步幅,小心打滑。”

行动:双腿调整步态,重心前移,跨过台阶。

新的感知:脚落地了,触觉反馈"地面稳固",视觉确认"已经跨过"。

这个循环持续运转,每一轮都让系统更了解环境,也更了解自己。智能不是"想"出来的,而是在这个循环中"长"出来的。

你可能会说:“这不就是机器人控制吗?有什么特别的?”

特别之处在于:在这个循环中,行动不是为了完成任务,而是为了验证预测、获取信息。

举个简单的例子。你走进一个黑暗的房间,你伸手去摸墙上的开关。你的手不是在"随机搜索",而是在做一连串的预测——“开关应该在门框右边30厘米处,高度约1.4米。“你的手移动到那个位置,摸了摸——没有。于是你更新预测:“可能开关在左边。“手又移动过去。

这个过程的本质是什么?你在通过行动,主动地减少不确定性。 你不是在"接收"信息,而是在"搜索"信息。

这就是具身智能最核心的洞察:行动是认知的一部分,而不是认知的结果。 你"思考"的方式,受限于你"行动"的方式——你"做"什么,决定了你"知道"什么。


三、大模型给了AI"大脑”,但身体呢?

2022年以来,大语言模型(LLM)的爆发让AI的"大脑"突飞猛进。GPT-4、Claude、Gemini能写诗、能编程、能推理——它们看起来"聪明"极了。

但仔细想想,这些AI的生活是什么样的?

它们没有身体,没有感官,永远生活在文本世界里。它们"知道"苹果是甜的,但从未尝过甜味;“知道"火是烫的,但从未感受过灼烧;“知道"落体是加速的,但从未体验过失重。

AI的"知识"是"二手"的——从人类留下的文字中习得的,不是从亲身经历中长出来的。

这导致了一个有趣的现象:大语言模型在某些方面"聪明得可怕”,在另一些方面"笨得令人发指”。

给它一个复杂的数学题,它可能轻松解决;但问它"一杯水从桌边掉下来会怎样”,它虽然能回答"会摔碎”,但它真的"理解"重力、惯性、冲击力这些概念吗?还是只是在复述训练数据中的模式?

具身智能就是要解决这个问题:给AI一具身体,让它从物理世界的交互中,获得"第一手"的认知。

这正在成为现实。2023-2024年,具身智能成为AI领域最热的方向之一。Google的PaLM-E将语言模型与机器人结合,让机器人理解自然语言指令并执行复杂任务。特斯拉的Optimus、Figure AI的人形机器人,都在探索"AI大脑+机器身体"的融合路径。

大模型扮演"大脑"的角色——负责高层规划、语义理解、常识推理。它说"把桌上的苹果拿过来”。

机器人扮演"身体"的角色——负责感知环境、执行动作、反馈结果。它走到桌前,识别苹果,伸手去拿,握住,返回。

大脑和身体通过"感知-行动循环"持续交互,形成一个完整的智能系统。


四、为什么"行万里路"比"读万卷书"更难?

你可能想问:既然大模型这么聪明,给它装个身体不就行了?为什么具身智能还没普及?

因为真正的难点不在于"装身体",而在于"让身体和大脑协同工作"

第一个挑战:仿真到现实的鸿沟。

在虚拟世界中训练的机器人,到了真实世界往往寸步难行。虚拟世界没有摩擦力、没有光线变化、没有传感器噪声、没有突发状况。一个在仿真环境中熟练的"抓取"动作,到了现实世界可能因为阳光角度不同、物体材质不同、甚至地面的一点点不平整就失败。

这就像一个人在模拟器里学会了开车,但第一次上路还是紧张得手心冒汗。 真实世界太复杂了,永远无法完美模拟。

第二个挑战:样本效率。

大语言模型可以读几万亿个token学习——文本数据几乎无限。但机器人不一样,在真实世界"训练"一次,一秒就是一秒,无法加速。让机器人学会"抓杯子",可能需要数万次尝试,每次都是实打实的物理成本。

第三个挑战:泛化能力。

一个学会"抓红色杯子"的机器人,换成一个白色杯子,可能就抓不住了。换一个光照环境,可能就识别不出来了。换一个位置,手臂轨迹可能就撞到旁边的障碍物了。

人类可以毫不费力地把"抓杯子"这个技能泛化到任何杯子上——陶瓷杯、塑料杯、玻璃杯、大的、小的、有柄的、无柄的——但机器人做不到。 这种"泛化"能力,是具身智能面临的核心难题。


五、具身智能的终极意义:重新定义"理解"

回到文章开头的问题:AI真的需要一具身体吗?

如果我们只想要一个"能回答问题"的AI,那确实不需要。GPT-4已经能答得比大多数人类好了。

但如果我们想要一个真正理解世界的AI——

一个能理解"重"意味着什么(不只是"质量大"的定义,而是手臂需要用力气的体感), 一个能理解"热"意味着什么(不只是"温度高"的数值,而是靠近时会本能地缩手的反应), 一个能理解"因果"意味着什么(不只是"A导致B"的逻辑关系,而是推倒积木后积木真的会倒下的物理体验),

那么,它可能需要一具身体。

理解不是"知道",而是"经历过"。

具身智能的终极意义,不是让AI更像人,而是让AI获得一种更本质的"理解"——不是从符号到符号的推理,而是从身体到世界的互动。

一个没有身体的AI,可以写出世界上最美的关于"风"的诗。但它永远不知道,风拂过脸庞是什么感觉。

而在我看来,知道"风"的意思,和知道"风"的感觉,是两个完全不同的"知道"。 真正的智能,不应该只满足于前者。


参考资料

  • Brooks, R. A. (1991). “Intelligence without representation.” Artificial Intelligence, 47(1-3), 139-159.
  • Varela, F. J., Thompson, E., & Rosch, E. (1991). The Embodied Mind: Cognitive Science and Human Experience. MIT Press.
  • Dourish, P. (2001). Where the Action Is: The Foundations of Embodied Interaction. MIT Press.
  • Ahn, M., et al. (2022). “Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.” arXiv:2204.01691.
  • 本文核心论证素材来源于具身智能论证卡与主动推理论证卡,经Ω-CFI审查框架校验。