<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>感知行动循环 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E6%84%9F%E7%9F%A5%E8%A1%8C%E5%8A%A8%E5%BE%AA%E7%8E%AF/</link>
		<description>Recent content in 感知行动循环 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sat, 29 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E6%84%9F%E7%9F%A5%E8%A1%8C%E5%8A%A8%E5%BE%AA%E7%8E%AF/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI没有身体，能真正理解这个世界吗？——具身智能的边界与可能性</title>
				<link>https://lingyu7.com/posts/embodied-ai-can-machines-understand-without-a-body/</link>
				<pubDate>Sat, 29 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/embodied-ai-can-machines-understand-without-a-body/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你试过用一只手拧开一瓶矿泉水吗？&lt;/p&gt;&#xA;&lt;p&gt;瓶盖拧不动，你下意识地把瓶子夹在腿间，腾出两只手一起拧。或者你把毛巾裹在瓶盖上增加摩擦力。再或者，你干脆放弃了——把瓶子递给身边力气大的人。&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的动作，其实包含了惊人的智能：你感知到了瓶盖的阻力（触觉），判断了自身的能力（自我认知），想到了多种解决方案（规划能力），选择了最合适的一种（决策），然后用精确的动作去执行（运动控制）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;现在问题来了：如果让AI来做这件事，它需要什么？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个摄像头？不够。它需要知道&amp;quot;拧不开&amp;quot;是什么感觉。&lt;/p&gt;&#xA;&lt;p&gt;一个数据库？不够。它需要知道&amp;quot;毛巾裹住瓶盖&amp;quot;这个方案为什么可行。&lt;/p&gt;&#xA;&lt;p&gt;一段代码？不够。它需要知道力的传递、摩擦系数、手的姿态……&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是具身智能（Embodied AI）要回答的核心问题：如果AI没有身体，它能真正理解物理世界吗？还是说，理解世界这件事，本身就离不开身体？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点智能不是想出来的是做出来的&#34;&gt;核心观点：智能不是&amp;quot;想&amp;quot;出来的，是&amp;quot;做&amp;quot;出来的&lt;/h2&gt;&#xA;&lt;p&gt;传统上，我们总认为智能是大脑的事情——思考、推理、计算，这些都是大脑的专属工作。身体只是执行大脑命令的&amp;quot;工具&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但具身智能理论提出了一个反直觉的观点：&lt;strong&gt;身体不是智能的附属品，身体本身就是智能的塑造者。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会问：这有什么区别？&lt;/p&gt;&#xA;&lt;p&gt;举个例子。一个传统AI和一个具身AI同时被要求&amp;quot;学会开门&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;传统AI的做法&lt;/strong&gt;：它被喂入成千上万张门的图片，学习&amp;quot;门&amp;quot;的视觉特征；它被输入开门动作的数学模型，计算最优的把手旋转角度和推力大小。但它从来没有真正&amp;quot;开过&amp;quot;一扇门。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;具身AI的做法&lt;/strong&gt;：它被放在一扇真实的门前，自己尝试去推、去拉、去旋转把手。它发现有些门是推的，有些是拉的，有些需要先下压把手再推。它摔过跤、卡住过、失败过，但每一次失败都让它更懂&amp;quot;门&amp;quot;是什么。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;哪个更接近人类的智能？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;显然是后者。因为人类理解&amp;quot;开门&amp;quot;这件事，从来不是通过背诵定义，而是通过无数次真实的尝试——小时候你踮着脚尖去够门把手，试过&amp;quot;推&amp;quot;和&amp;quot;拉&amp;quot;的区别，试过不同的力度。你对&amp;quot;门&amp;quot;的认知，是身体经验和感知经验共同塑造的。&lt;/p&gt;&#xA;&lt;p&gt;这就是具身智能的核心思想：&lt;strong&gt;智能不是脱离身体的抽象存在，而是在身体与环境的互动中形成和发展的。感知的方式、行动的能力、与环境互动的模式，都深刻地塑造了智能的形态和内容。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么没有身体的ai会有局限&#34;&gt;为什么&amp;quot;没有身体&amp;quot;的AI会有局限？&lt;/h2&gt;&#xA;&lt;p&gt;你可能在想：大语言模型不是很厉害吗？ChatGPT能写诗、能编程、能推理，它还需要身体吗？&lt;/p&gt;&#xA;&lt;p&gt;这是个好问题。让我们看看大语言模型和人类在理解&amp;quot;杯子&amp;quot;这件事上的根本区别。&lt;/p&gt;&#xA;&lt;h3 id=&#34;人类对杯子的理解&#34;&gt;人类对&amp;quot;杯子&amp;quot;的理解&lt;/h3&gt;&#xA;&lt;p&gt;你对&amp;quot;杯子&amp;quot;的理解是多维度的：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;视觉&lt;/strong&gt;：你见过各种形状、颜色、材质的杯子&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;触觉&lt;/strong&gt;：你握过杯子，知道它的温度、重量、质感&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动觉&lt;/strong&gt;：你端过杯子，知道需要多大的力才能把它拿稳&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;功能&lt;/strong&gt;：你用它喝过水、喝过咖啡、喝过茶&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;社会性&lt;/strong&gt;：你知道在别人家做客时，用完杯子要放在哪里&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;所有这些经验交织在一起，形成了一个丰富、立体、有温度的&amp;quot;杯子&amp;quot;概念。&lt;/p&gt;&#xA;&lt;h3 id=&#34;ai对杯子的理解&#34;&gt;AI对&amp;quot;杯子&amp;quot;的理解&lt;/h3&gt;&#xA;&lt;p&gt;大语言模型对&amp;quot;杯子&amp;quot;的理解，来自它读过的数十亿个文本。它知道&amp;quot;杯子是一种容器，用于盛放饮料&amp;quot;，知道&amp;quot;杯子通常由陶瓷、玻璃或塑料制成&amp;quot;，知道&amp;quot;杯子的同义词包括水杯、茶杯、马克杯&amp;quot;……&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但AI从来没有摸过杯子。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当AI说&amp;quot;杯子&amp;quot;时，它只是在操纵符号——&amp;ldquo;杯子&amp;quot;这个词和&amp;quot;容器&amp;rdquo;、&amp;ldquo;饮料&amp;rdquo;、&amp;ldquo;陶瓷&amp;quot;这些词之间的统计关联。它没有触觉记忆，没有温度感知，没有握持经验。它的&amp;quot;杯子&amp;quot;概念，是一个脱离了真实世界的符号抽象。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像一个人从没吃过苹果，但读完了所有关于苹果的书。他可以滔滔不绝地讲苹果的种类、产地、营养成分，但他永远不知道苹果是什么味道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;符号接地问题&amp;rdquo;——AI的符号系统悬浮在语言层面，没有扎根于真实的物理经验。&lt;/p&gt;&#xA;&lt;h3 id=&#34;为什么这个问题重要&#34;&gt;为什么这个问题重要？&lt;/h3&gt;&#xA;&lt;p&gt;因为&lt;strong&gt;物理世界有它自己的逻辑&lt;/strong&gt;，而这种逻辑不是在文本中能完整学到的。&lt;/p&gt;&#xA;&lt;p&gt;文本中会写&amp;quot;水在100°C沸腾&amp;quot;，但文本不会写&amp;quot;把手放在沸水上方会感觉到热浪&amp;quot;——因为这对人类来说太&amp;quot;常识&amp;quot;了，不需要写。但AI恰恰缺少的就是这种常识级的物理直觉。&lt;/p&gt;&#xA;&lt;p&gt;2016年，AI研究者给当时的视觉系统做了一项测试：给AI看一张图，图中有一些积木，然后问&amp;quot;如果把红色的积木推到蓝色积木的左边，会发生什么？&amp;quot;&lt;/p&gt;&#xA;&lt;p&gt;人类一秒钟就能回答。但当时的AI需要复杂的推理链，而且经常出错。&lt;strong&gt;为什么？因为人类有物理直觉——我们知道物体会移动、会碰撞、会堆叠，这些直觉来自我们从小玩积木的身体经验。而AI没有这种经验。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;具身智能如何工作感知-认知-行动的永动循环&#34;&gt;具身智能如何工作？——&amp;ldquo;感知-认知-行动&amp;quot;的永动循环&lt;/h2&gt;&#xA;&lt;p&gt;具身智能系统的工作方式，可以概括为三个字：&lt;strong&gt;做中学&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，它是一个永不停歇的循环：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：感知。&lt;/strong&gt; 机器人通过摄像头看到前面的桌子，通过力传感器感觉到自己的机械臂的位置，通过触觉传感器感觉到桌面的高度。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：认知。&lt;/strong&gt; 机器人判断：&amp;ldquo;我需要把杯子放在桌子上。桌子高度70厘米，我的手臂目前位置偏高，需要下调15厘米。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三步：行动。&lt;/strong&gt; 机器人调整手臂位置，平稳地将杯子放到桌面上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但这不是结束。&lt;/strong&gt; 行动之后，机器人会通过新的感知来判断行动是否成功：杯子放稳了吗？桌子表面是平的还是有倾斜？如果失败了，它会调整策略，再试一次。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就形成了一个&amp;quot;感知-认知-行动&amp;quot;的循环。每一次循环，机器人都对这个世界多了一分理解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来是不是很像人类学习的过程？你学骑自行车的时候，不就是不断地感知（看路、感觉平衡）、判断（该往左偏还是右偏）、行动（调整身体重心），然后从失败中学习吗？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;大模型时代具身智能的iphone时刻&#34;&gt;大模型时代：具身智能的&amp;quot;iPhone时刻&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;具身智能并不是一个新概念——早在1980年代，MIT的罗德尼·布鲁克斯（Rodney Brooks）就提出了&amp;quot;包容架构&amp;quot;，主张智能应该从底层行为开始构建，而不是从高层推理开始。他造出了不需要&amp;quot;大脑&amp;quot;就能灵活走路的六足机器人。&lt;/p&gt;&#xA;&lt;p&gt;但那个时代的具身智能，能力有限，只能实现&amp;quot;昆虫级别&amp;quot;的智能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;真正让具身智能发生质变的，是大语言模型（LLM）的兴起。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来可能有点矛盾——我刚才不是说大语言模型没有身体吗？但正是大语言模型的&amp;quot;通才&amp;quot;能力，给了具身智能一个&amp;quot;大脑&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革一自然语言交互&#34;&gt;变革一：自然语言交互&lt;/h3&gt;&#xA;&lt;p&gt;2022年，Google推出了PaLM-E——一个将语言模型与机器人感知结合的系统。你只需要对机器人说&amp;quot;帮我把桌子上的苹果拿过来&amp;quot;，它就能理解这句话，并自主规划完成这个任务所需的一系列动作。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt; 以前，让机器人做一件事，需要工程师写几千行代码。现在，你对机器人说句话就行。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革二世界模型&#34;&gt;变革二：世界模型&lt;/h3&gt;&#xA;&lt;p&gt;大语言模型在训练中积累了海量的世界知识，这些知识可以被迁移到具身场景中。&lt;/p&gt;&#xA;&lt;p&gt;比如，如果你想教机器人&amp;quot;倒水&amp;quot;这个动作，不需要从头训练。AI已经知道&amp;quot;水是液体&amp;quot;、&amp;ldquo;倒水时杯子要倾斜&amp;rdquo;、&amp;ldquo;水会溢出&amp;rdquo;——这些知识来自文本学习。它只需要在真实世界中微调这些知识，把它变成具体的肌肉记忆。&lt;/p&gt;&#xA;&lt;h3 id=&#34;变革三代码生成&#34;&gt;变革三：代码生成&lt;/h3&gt;&#xA;&lt;p&gt;更令人兴奋的是，AI可以自己写代码来控制自己。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
