引言
你有没有想过一个问题:你为什么会好奇?
不是那种"想知道八卦"的好奇,而是最原始的那种——当你看到一个没见过的工具,会忍不住拿起来摆弄;当你听到一个模糊的声音,会不自觉地扭头去看;当你走进一个陌生的环境,眼睛会自动扫视每一个角落。
这种行为太自然了,以至于我们很少停下来思考:为什么? 为什么我们会有"探索"的本能?
传统的解释是:好奇心让我们学习,学习让我们生存,所以进化选择了它。但这只是"为什么"层面的解释,不是"如何"层面的解释。如果深入一层去问:好奇心在神经层面上是怎么工作的?智能体如何决定"我现在应该去探索而不是躺平"?
过去十年间,一个来自理论神经科学和认知科学交汇处的框架正在给出惊艳的回答。它叫主动推理(Active Inference),而这个框架的核心洞见只有一句话——
智能的本质不是被动地理解世界,而是主动地把世界改造成你预期的样子。
这个想法听起来简单,但它带来的冲击力,足以重写我们对智能、意识和AI的底层认知。
一、感知与行动:一枚硬币的两面
先说一个思想实验。
想象你走进一个完全漆黑的房间。你什么也看不见,什么也听不见。你怎么办?
大部分人的第一反应是——伸出手去摸。你会在黑暗中往前探步,用手触碰墙壁、摸索家具。你在"行动",但你的目标不是别的,正是为了"感知":摸到墙的那一刻,你就"看见"了房间的边界。
这个瞬间揭示了一个深刻的真相:感知和行动不是两件不同的事——它们服务于同一个目标。
我们通常认为感知是"输入",行动是"输出"。眼睛接收光线,大脑处理信息,然后决定要不要伸手。这是一个线性的"输入→处理→输出"模型。
但主动推理说:不对,顺序搞反了。
实际上,你的大脑在行动之前就已经"预测"了世界应该是什么样。行动的目的,不是"执行一个决定",而是让世界变成你预测的样子。
你伸出手去摸墙,是因为你预测"这里应该有面墙"。摸到墙的触感与预测一致,你的"预测误差"为零,你满意了。如果没摸到墙——哎呀,感知和预测不符,你的大脑就会更新模型,重新调整预测。
行动,是验证预测的一种方式。 就像科学家做实验不是为了"改变世界"(虽然客观上改变了),而是为了检验假设的正确性。
二、从预测编码到主动推理:一次关键的认知升级
要理解主动推理有多颠覆,得先铺垫一下它的前身——预测编码(Predictive Coding)。
预测编码是过去十几年认知科学最大的进展之一。它的核心思想是:你的大脑不是一个被动接收信息的相机,而是一台持续生成预测的机器。
当你"看"一个苹果时,你的视觉皮层不是从零开始分析光信号。它先根据经验"猜"出一个苹果的样子,然后把这个预测向下传递给低级视觉中枢。低级视觉中枢把预测和实际输入做比较,只把"预测错了"的部分(误差信号)向上传递。大脑不断重复这个循环,反复修正预测,最终"看"到了苹果。
这个框架完美解释了为什么人在暗处会"看"到不存在的物体——因为大脑的预测太强了,压过了实际的感官输入。它不需要解释这个世界——它只需要消除预测误差。
但预测编码有一个盲区:它只解释了感知。如果大脑的目标只是消除预测误差,为什么我们不干脆闭上眼睛、塞住耳朵、躲进一个没有变化的房间里?
因为那样预测误差确实少了,但你也死了。
静默、不变、完美预测——这不是生命,这是石头。
这就引出了主动推理的关键突破:你能不能通过改变世界来消除预测误差?
答案是:能,而且这才是更常用的方式。
想象你在看一本模糊照片的书。为了"看清楚",你会把书凑近眼睛、调整角度、眯起眼睛——你不是在等大脑"算出来"照片是什么,你在主动地改变你的感官输入,直到它和你"看清楚"的预测一致。
主动推理的公式很简单:
消除预测误差有两个途径:
- 改变你的模型来匹配世界(这是感知和学习)
- 改变世界来匹配你的模型(这是行动和探索)
这两个路径在数学上是等价的。都服务于同一个目标:让预测误差最小化。
这个看似简单的洞察,炸开了一整个新的认知疆域。
三、好奇心不是奖励——它是系统的本能
主动推理最美妙的一个推论,就是对好奇心的解释。
传统的强化学习(RL)把好奇心看作"探索奖励"——给智能体一点额外的"奖励分"去探索未知,不然它就会一直做已经会的事。
但在主动推理中,好奇心根本不需要外部奖励。它内生于系统。
让我解释一下。
主动推理中有一个核心概念叫预期自由能(Expected Free Energy, EFE)。把它简单理解成"系统对未来不确定性的预期"。当系统对某个状态非常不确定时,EFE就很高。
系统会倾向于选择那些预期能最大程度降低不确定性的行动。
换句话说:你好奇,不是因为探索会给你"奖励"——而是因为不确定性本身让你不舒服,而探索是消除不确定性最直接的方式。
这就是为什么:
- 婴儿会把任何东西往嘴里塞——他对自己"未知的物体"的不确定性极高,嘴巴是最敏感的信息采集器,能最快降低不确定性
- 你会打断别人说话问"什么意思"——在理解出现空白的那一刻,你的预测误差飙升,你急需填补它
- 学习新技能既痛苦又上瘾——初期的不确定性高得难受,但每一点进步都在降低不确定性,这个"降低"的过程本身就是愉悦的
好奇心不是奖励驱动的,而是不确定性驱动的。
这个区别至关重要。奖励驱动意味着你想要"更多";不确定性驱动意味着你想要"确定性"。前者是趋向,后者是消除。前者需要一个外部定义的奖励函数,后者是系统内部自动生成的驱动力。
探索不是被奖励的——它是被"需要"的。
四、从生物到AI:主动推理对人工智能意味着什么
好,这些生物学和认知科学的讨论,和AI有什么关系?
关系太深了。
当前AI的根本缺陷:没有"主动"的动机
现在的AI,大模型也好、智能体也好,本质上都是被动响应型的。你给它一个输入,它给你一个输出。你没有输入的时候,它就安静地等着。
它不会自己"好奇"——不会因为"我还不确定那个领域是怎么回事"就去主动探索。它没有内在的驱动力去启动一个行动。
这个问题在现有的AI系统中表现得非常明显:
- 探索奖励需要人工设计——如果你想让它有好奇心,你得额外加一个"好奇心函数",告诉它"探索有奖励"
- 目标需要外部设定——你要什么,它就做什么。它自己没有想做的事
- 持续学习是伪命题——不学习不是因为不想学,是没有驱动力去学
主动推理提供了一个截然不同的方向:把"最小化预测误差"作为系统的核心目标。
在这个设定下:
- 系统会自动产生探索行为(因为要降低对未知的不确定性)
- 系统会有"内在动机"(不需要外部奖励函数)
- 系统会主动寻找"学习时机"(当它发现自己的预测和实际偏差大时)
一个具体的例子
想象一个AI家政机器人。
在被动响应模式下,它只在你下指令时才工作:“扫地"“擦桌子"“把碗收起来”。它不会主动做任何事。
在主动推理模式下,它会:
- 在屋子里转一圈,看看"预期中的家"和"实际的家"有多大差异
- 发现地上有污渍——“我的预测是地板干净的,但实际不是”——预测误差出现了
- 为了消除这个误差,它去擦地——不是因为你叫它做,而是因为它"预期"地板应该是干净的
- 擦完之后,“实际"和"预测"一致了,误差清零,系统回到稳态
看明白了吗?这个机器人不需要一个"擦地"的指令。它只需要一个"干净地板"的预测模型。擦地不是完成任务,是让世界符合预期。
这听起来有点科幻,但它的底层逻辑已经在很多前沿研究中被验证了。
与强化学习的本质区别
| 维度 | 强化学习 | 主动推理 |
|---|---|---|
| 核心问题 | “我做什么能得到最多的奖励?” | “我做什么能最有效地消除不确定性?” |
| 探索动机 | 外部定义的探索奖励 | 内在的信息增益需求 |
| 奖励来源 | 环境给的(外生) | 系统自身产生的(内生) |
| 终极目标 | 最大化累积奖励 | 最小化预测误差(维持自身存在) |
| 适用性 | 有明确奖惩的场景 | 所有自组织系统 |
这不是说强化学习不好——它在有明确目标的任务上已经极其成功。但主动推理可能更适合回答一个更根本的问题:智能体为什么要有"动机"这种东西?
五、流动性智慧:为什么"改变自己"和"改变世界"是等价的
主动推理最令人深思的一点,是它打破了"主体"和"世界"之间的边界。
传统上我们认为:你是你,世界是世界。你通过感知认识世界,通过行动改变世界。两者是分开的。
但主动推理说:感知和行动是同一件事——都是消除预测误差的手段。如果你能通过改变模型来消除误差(感知/学习),很好;如果你能通过改变世界来消除误差(行动/改造),也一样好。
这就引出了一个意味深长的推论:智慧不是静止地储存在大脑里的。它是在你与世界的互动中流动的。
一个不错的类比是呼吸。你吸气(感知)和呼气(行动)是同一个生理过程的两面,服务于同一个目标:保持血液中的氧气和二氧化碳平衡。你不能说"我只吸气不呼气”——那会死。同样,你也不能只有感知没有行动——那会僵化。
生命是在感知和行动之间的持续振荡中维持自身的。智能也是如此。
理解了世界不是终点,让世界变成你理解的样子的能力,才是。
六、一个重新理解"存在"的视角
主动推理之所以迷人,不只是因为它解释AI设计,更是因为它触及了一个更根本的问题:一个系统如何持续存在?
物理学家薛定谔在1944年的《生命是什么》中提出了一个洞见:生命之所以能存在,是因为它持续地从环境中吸收"负熵”——有序的能量。一个系统只有不断与环境交换能量,才能抵抗热力学第二定律的毁灭性推力。
主动推理是这一洞见的数学化和操作化版本。它说的不是"能量”,而是"预测误差"——一个系统只有在持续最小化预测误差的过程中,才能保持自身的结构不被瓦解。
这意味着:
- 存在即预测——只要一个系统在持续存在,它就在持续进行"预测→行动→反馈→修正预测"的循环
- 关闭这个循环,系统就死了——不更新预测、不采取行动、不接受反馈,你就成了一个封闭系统,熵会把你吞噬
- 不同层级的循环支撑着不同的存在形式——物理存在(基本生理调节)、心理存在(维持自我认知的一致性)、社会存在(维持与他人的关系)——全都可以用主动推理的框架来理解
这不是比喻,而是在某些认知科学流派中正在认真研究的理论方向。
总结
写到这里,我想回到文章开头那个问题:你为什么会好奇?
主动推理给出的答案是:因为你的大脑是一个持续产生预测的机器,而"不确定性"——也就是你发现自己无法预测的部分——会触发预测误差信号。这个误差让你"不舒服",而最有效的消除方式就是去探索、去行动、去把不确定变成确定。
好奇心不是一种奢侈的情绪——它是你的系统在告诉你:你有一个预测需要验证。
这个框架教会我们三件事:
首先,感知和行动是一体的。不是你看见了再动,而是你动是为了看见。每一个行动都是一次对世界假设的实验。
其次,智能的内驱力可以自发生成。不需要外部奖励,不需要人工设计"好奇心函数",只要把"最小化预测误差"作为核心目标,探索行为就会自然涌现。
最后,智能的本质不是"知道",而是"维持"。维持你的模型与世界之间的匹配——既可以通过调整模型来适应世界(学习),也可以通过改变世界来匹配模型(行动)。两者缺一不可。
这或许也解释了为什么我们总觉得"懂了"和"会做"之间有一道鸿沟——因为真正的理解,从来不是单向的。每当你真正理解了一件事,你就多了一个可能去重新塑造它。
而世界,也在你的每一次主动推理中,被重新创造。
参考文献:
- Friston, K. (2010). The free-energy principle: a unified brain theory? Nature Reviews Neuroscience, 11(2), 127-138.
- Friston, K., FitzGerald, T., Rigoli, F., Schwartenbeck, P., & Pezzulo, G. (2016). Active inference: a process theory. Neural Computation, 29(1), 1-49.
- Clark, A. (2013). Whatever next? Predictive brains, situated agents, and the future of cognitive science. Behavioral and Brain Sciences, 36(3), 181-204.
- Parr, T., & Friston, K. J. (2019). Generalised free energy and active inference. Biological Cybernetics, 113(5-6), 495-513.
- Pezzulo, G., Rigoli, F., & Friston, K. (2018). Hierarchical active inference: a theory of motivated control. Trends in Cognitive Sciences, 22(12), 1080-1097.
- Clark, A. (2016). Surfing Uncertainty: Prediction, Action, and the Embodied Mind. Oxford University Press.
- Schrödinger, E. (1944). What is Life? Cambridge University Press.