title: “活着,就是一种「推理」——自由能原理如何统一了生命、大脑与AI” date: 2026-07-23T02:29:00+08:00 draft: false tags: [“自由能原理”, “主动推理”, “预测编码”, “卡尔·弗里斯顿”, “认知科学”, “世界模型”, “人工智能”, “神经科学”, “生命系统”] categories: [“AI深度”] description: “你的大脑不是被动接收信息,而是在主动预测世界。自由能原理——被称作「自控制论以来最宏大的理论综合」——用一个数学公式统一解释了感知、行动、学习,甚至好奇心与生命本身。2026年,这个理论在生物神经元上被实验证实,并催生了下一代AI架构。”
引言:走进咖啡馆时,你的大脑在做什么?
想象你走进一家熟悉的咖啡馆。
推门的那一刻,你的大脑已经在做一件极其复杂的事情:预测。
你预测门会发出"吱呀"一声(因为每次都是)。你预测吧台在左边、靠窗的座位在右边。你预测咖啡师会说"欢迎光临,老样子?"。
然后门响了——“吱呀”——和你预测的一样,你没什么感觉。
接着咖啡师开口了:“今天打烊了,我们没营业。”
你的大脑瞬间警觉。
等等,这和预测不一样。咖啡馆每天这个时间都营业的。为什么今天关门?发生了什么?
你的大脑开始"更新模型": 也许今天是法定假日?也许老板生病了?也许这家店要转让了?
这个场景,完美地展示了你的大脑最核心的工作方式:它不是一个被动接收信息的器官,而是一个永不停歇的预测机器。
它持续不断地生成关于世界的"预测",把这些预测和实际的感官输入做对比,然后用"预测误差"来更新自己的内部模型。
这个观点,在认知科学中被称为预测编码。但有一个更宏大的理论框架,把这件事推到了极致——
它叫自由能原理(Free Energy Principle, FEP)。
它声称:不只是你的大脑,而是整个生命系统——从单细胞生物到整个人类社会——都在做同一件事:最小化"自由能"。
“自由能"是什么?为什么和你的生命有关?为什么这个理论被称作"自控制论以来最宏大的理论综合”?
这篇文章,我们来拆解它。
一、自由能到底是什么?——用一句话说清楚
先别被名字吓到。
“自由能"这个词来自物理学,但在自由能原理的语境下,它其实可以理解为:你的大脑对世界的"惊讶程度”(surprise)的上限。
更准确地说——
自由能 = 你的大脑预测的世界,与真实世界之间的差距。
这个差距越小,你的"自由能"就越低,你就越"舒适"。
这个差距越大,你的"自由能"就越高,你就越"惊讶"——就像刚才那个咖啡馆的例子。
自由能原理的核心主张就是: 任何自组织系统(生命体、大脑、甚至整个生态系统)为了维持自身的有序状态,都必须持续地最小化自由能。
换句话说:活着,就是在对抗"惊讶"。
两个"减小惊讶"的策略
这个原理最精妙的地方在于,它揭示了所有生物都只有两种方式来减小自由能:
策略一:改变你的想法(感知) 当你看到的东西和预测不一致时,你更新自己的内部模型,让预测更准。
比如,你发现今天咖啡馆确实关门了,你更新自己的认知:“原来这家咖啡馆周日休息。”
策略二:改变这个世界(行动) 当你看到的东西和预测不一致时,你干脆动手改变环境,让环境变得符合你的预测。
比如,你太想喝咖啡了,于是你走到隔壁的咖啡馆,推门进去——“吱呀”——嗯,这下对了。
感知和行动,这两个看似完全不同的认知功能,在自由能原理下被统一为同一个目标——最小化自由能。
感知是"改变想法以适应世界",行动是"改变世界以匹配想法"。
二、这个理论不只是"哲学"——2026年,它在真实神经元上被证实了
自由能原理由神经科学家卡尔·弗里斯顿(Karl Friston)在2000年代中期提出,在过去二十年里,它一直是一个"美丽的理论"——数学很优雅,解释力很强,但缺乏直接的实验证据。
2026年,这个缺口被补上了。
日本RIKEN研究所的研究团队在《自然·通讯》上发表了一项关键实验:他们在真实的生物神经元网络上观察到了自由能最小化过程。
这意味着什么?
意味着自由能原理不再只是一个"数学上很美的理论框架"——它被证明是生物神经系统实际运行的机制。
研究团队构建了培养神经元网络,并让它们接收特定的感官刺激模式。他们发现,这些神经元网络确实在主动预测接下来的刺激,并基于预测误差来调整自身的连接强度。整个过程中,神经元网络的"自由能"(即预测误差的信息论度量)确实在持续下降。
这不是一个关于AI的理论。这是一个关于"你"的理论——你的大脑,真的在用这种方式工作。
三、更大的突破:2026年的三个理论飞跃
2026年,自由能原理领域发生了三件大事,让这个理论从"神经科学的理论"变成了"AI设计的蓝图"。
突破一:规划和感知被统一了
2026年,Nuijten等人的研究发现了一件令人震惊的事:
在自由能原理框架下,规划和感知使用的是同一个数学过程。
传统上,AI把"规划"(决定要做什么)和"感知"(理解当前环境)当作两个完全不同的模块来处理。但Nuijten证明,所谓的"规划"——也就是对未来行动序列的评估——本质上就是在做"带认知先验的变分推断"。
翻译成人话:你的大脑在"规划未来"时,用的算法和"理解现在"时是同一个。
这意味着什么?意味着好奇心不是附加的功能,而是自由能最小化的必然产物。 当你探索未知事物时,你其实是在做一件事——“收集信息来减少未来可能遇到的惊讶”。探索和利用的权衡,不是大脑额外设计的机制,而是变分推断的固有性质。
突破二:多智能体系统也被统一了
Bouchaffra等人(2026)提出了"集体变分原理",将贝叶斯推断、博弈论与热力学统一为同一个数学结构。
这个发现揭示了一件事: 多个智能体之间的社会互动,和单个智能体的认知过程,遵循的是同一个底层原理——自由能最小化。
当你在人群中走路时自动调整步伐、当你在对话中预测对方的下一个词、当你在团队中协调行动——这些"社会行为"和"个体认知"使用的是同一套底层机制。
突破三:自由能原理被用于解析LLM的内部结构
在同一个2026年,Bouchaffra等人还将自由能原理应用于分析大语言模型(LLM)的多头注意力机制。
他们发现,LLM的注意力头可以被理解为"自由能最小化"的智能体——每个头都在做自己的"预测-校验"循环。通过分析这些头之间的"合作"与"冗余",他们提出了一种新的模型剪枝方法:剪掉20%的注意力头,只增加了不到5%的困惑度,却减少了18%的计算量,提升了22%的吞吐量。
自由能原理不仅解释大脑,还给出了优化AI的实际方法。
四、AI的下一个方向:AXIOM模型与主动推理
如果自由能原理真的能指导AI设计,那它应该能造出更好的AI。
2026年,VERSES AI开发的AXIOM模型,证明了这件事。
AXIOM不是传统的神经网络模型。它完全抛弃了反向传播和梯度下降,转而使用贝叶斯变分推理——通过封闭形式的更新规则,直接计算最可能的状态。
结果令人震惊:
- 参数规模:AXIOM仅95万参数,而传统模型(DreamerV3)需要4.2亿
- 样本效率:AXIOM高出7.6倍
- 运行速度:快39倍
- 成本:不到传统模型的1/38
更关键的是它的学习机制:
AXIOM的模型结构是"活的"——它不是在固定的参数空间里做梯度下降,而是像生物大脑一样,动态地"生长"新的模型组件来捕捉新模式,并"修剪"冗余的部分。
这就像你的大脑在学习新技能时,会生成新的神经元连接,然后逐渐把不常用的连接修剪掉。
AXIOM不是"学得更快",而是"学得不一样"。 它不是在"拟合数据",而是在"构建对世界的理解"。
五、为什么这对你很重要?
第一:你的"好奇心"不是弱点,是必然
你有没有过这种体验——明知道某个视频是浪费时间,但还是忍不住点开看?
传统观点会告诉你:这是"多巴胺陷阱",是"注意力经济"在利用你的弱点。
但自由能原理告诉你另一个版本的故事:你的好奇心,是自由能最小化的必然结果。
当你遇到一个未知的事物时,你当前的世界模型无法准确预测它——这产生了"自由能"(惊讶)。为了减小这个自由能,你必须去探索它、理解它,把它纳入你的世界模型。
好奇心不是"设计缺陷",而是"认知引擎"的固有属性。 没有好奇心的生物,在面对未知环境时无法更新自己的世界模型,终将被淘汰。
第二:你每天都在用"自由能最小化"策略
回想一下,你上次做决定时是怎么想的?
“如果这样做,可能会发生什么?”
“如果那样做,会不会更好?”
你在做的事情,本质上就是在评估不同选择的"预期自由能"——哪个选择能让你未来遇到的"惊讶"最少?这就是主动推理。
你做决策的底层逻辑,和自由能原理描述的数学公式,是同一个东西。
第三:AI的"智能"可能不需要那么大
AXIOM用95万参数做到了传统模型4.2亿参数才能做到的事——不是因为AXIOM"更聪明",而是因为它的架构更接近"真正的智能"的运作方式。
这指向了一个令人深思的方向:我们可能不需要更大的模型,我们需要更好的模型。 不是"更多的数据、更多的算力",而是"更像生命系统本身的学习方式"。
六、回到原点:自由能原理告诉我们什么?
自由能原理是一个极其简洁而统一的原理,却用来解释极其多样的现象——感知、行动、学习、注意、记忆、情绪、好奇心、社会互动、生命本身的存在。
这种统一性,既是最迷人的地方,也是最受争议的地方。
批评者说:一个能解释一切的理论,可能什么也解释不了。自由能原理的数学很美,但大脑是否真的在"计算自由能"?神经回路如何实现变分贝叶斯推理?这些问题还缺乏直接的生物学证据。
支持者说:2026年的实验证据已经补上了最关键的一块拼图。RIKEN的神经元实验、AXIOM的工程验证、Nuijten的理论统一——这些都在指向同一个方向:自由能原理不是一个"哲学猜想",而是对生命和智能的准确描述。
我的看法?
自由能原理最迷人的地方,不在于它"正确与否",而在于它提出了一个极其深刻的问题:
如果感知、行动、学习、好奇心、社会互动,甚至生命本身——都是同一个底层原理的不同表现形式——那我们之前把"认知"拆成感知、记忆、推理、决策这些模块,是不是从一开始就错了?
也许,智能从来就不是"一堆模块的组合"。 也许,智能就是一件事——持续地最小化"惊讶"。
其他的,都是这件事的"副产品"。
参考资料:
- Friston, K., “The free-energy principle: a unified brain theory?”, Nature Reviews Neuroscience, 2010. https://doi.org/10.1038/nrn2787
- Nuijten, M. et al., “Expected Free Energy-based Planning as Variational Inference”, 2026. https://ubos.tech/expected-free-energy-based-planning-as-variational-inference/
- Bouchaffra, D. et al., “A Game-Theoretic Free Energy Analysis of Higher-Order Synergy in Attention Heads of Large Language Models”, 2026. https://arxiv.org/abs/2605.09515
- RIKEN Institute, “Experimental evidence of free energy minimization in biological neuronal networks”, Nature Communications, 2026.
- VERSES AI, “AXIOM: A Generative Model Based on the Free Energy Principle”, Gameworld 10K Benchmark, 2026.
- Kirchhoff, M. et al., “The Free Energy Principle: A Mathematical Foundation for a Unified Theory of Biological and Cognitive Science”, 2025.
- Clarke, J., “The Awareness-First Theory: A Coherence Principle Underlying Active Inference and Physical Law”, Entropy, 2026. https://doi.org/10.3390/e28030306