<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>内在动机 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E5%86%85%E5%9C%A8%E5%8A%A8%E6%9C%BA/</link>
		<description>Recent content in 内在动机 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Thu, 27 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E5%86%85%E5%9C%A8%E5%8A%A8%E6%9C%BA/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的好奇心——机器如何学会主动探索未知世界</title>
				<link>https://lingyu7.com/posts/ai-curiosity-exploration/</link>
				<pubDate>Thu, 27 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-curiosity-exploration/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过，为什么孩子会不停地问&amp;quot;为什么&amp;quot;？&lt;/p&gt;&#xA;&lt;p&gt;没有老师奖励他，没有考试分数，他纯粹就是想知道——想知道树叶为什么会落下来，想知道蚂蚁为什么排成一排走，想知道天黑之后太阳去了哪里。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;想知道&amp;quot;的冲动，我们叫它&lt;strong&gt;好奇心&lt;/strong&gt;。它是人类最强大的学习驱动力之一，甚至比外部奖励更持久。一个孩子可以因为好奇心花几个小时观察一只蜗牛，而没有任何外部奖励。&lt;/p&gt;&#xA;&lt;p&gt;那么问题来了：&lt;strong&gt;AI能不能也拥有&amp;quot;好奇心&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果机器能像孩子一样，对未知产生&amp;quot;想知道&amp;quot;的冲动，主动探索它不理解的世界——那会怎样？&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻。2017年，加州大学伯克利分校的研究者发表了一篇论文，标题就叫《好奇心驱动的探索》。他们给了AI一个&amp;quot;好奇心模块&amp;quot;，让AI在没有外部奖励的情况下，自己学会了玩游戏、探索新环境。&lt;/p&gt;&#xA;&lt;p&gt;今天，我们就来聊聊这个有趣的话题——&lt;strong&gt;AI的好奇心从何而来，它如何改变机器学习的游戏规则。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;核心观点好奇心不是情绪而是预测误差&#34;&gt;核心观点：好奇心不是情绪，而是&amp;quot;预测误差&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先澄清一个常见的误解。&lt;/p&gt;&#xA;&lt;p&gt;当我们说&amp;quot;AI有好奇心&amp;quot;时，不是说AI&amp;quot;感觉&amp;quot;到了好奇——像人类那样有&amp;quot;好想知道&amp;quot;的主观体验。AI没有感受，至少目前没有。&lt;/p&gt;&#xA;&lt;p&gt;但AI可以拥有好奇心的&lt;strong&gt;功能等价物&lt;/strong&gt;：一种驱动探索的内在机制。&lt;/p&gt;&#xA;&lt;p&gt;这个机制的核心，是一个简单的数学概念——&lt;strong&gt;预测误差（Prediction Error）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你走进一个房间。你预测门后是客厅，打开门，果然——客厅。你没有任何感觉，一切如常。&lt;/p&gt;&#xA;&lt;p&gt;但如果门后是一堵墙呢？你的大脑会立刻产生一个信号：&amp;ldquo;等等，这和预测不一样！&amp;ldquo;这个信号，就是预测误差。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心，本质上就是大脑对&amp;quot;预测误差&amp;quot;的敏感和追逐。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你的大脑天生不喜欢&amp;quot;意外&amp;rdquo;——但不是因为害怕，而是因为&amp;quot;意外&amp;quot;意味着&amp;quot;有东西我还没学会&amp;rdquo;。学会这件事，本身就是一种&amp;quot;奖励&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;神经科学家发现，大脑的奖励系统——多巴胺通路——不仅在外在奖励（食物、金钱）时被激活，在&lt;strong&gt;获取新信息&lt;/strong&gt;时同样被激活。你学到新东西时，大脑会释放多巴胺，给你一种&amp;quot;愉悦感&amp;quot;。这就是为什么&amp;quot;恍然大悟&amp;quot;的那一刻是那么爽。&lt;/p&gt;&#xA;&lt;p&gt;AI研究者把这个发现搬到了机器学习中。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从被动学习到主动探索&#34;&gt;从&amp;quot;被动学习&amp;quot;到&amp;quot;主动探索&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;传统的机器学习，或者说强化学习，是一种&amp;quot;被动学习&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象一个被困在迷宫里的机器人。它随机走，偶尔撞到墙，偶尔发现出口。每次发现出口，它得到一个&amp;quot;奖励&amp;quot;（比如+1分），然后它的算法会调整——&amp;ldquo;走到出口的动作应该被强化&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这套方法在简单环境里很有效，有一个巨大的问题：&lt;strong&gt;如果奖励太稀疏呢？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如玩一个复杂的游戏——Montezuma&amp;rsquo;s Revenge。这是一个经典的Atari游戏，玩家需要穿过多个房间、避开各种敌人、收集钥匙、打开门，最后才能拿到奖励。整个过程中，绝大多数时间你没有任何&amp;quot;得分&amp;quot;——但你一直在做有意义的事情：探索、学习、尝试。&lt;/p&gt;&#xA;&lt;p&gt;给传统AI玩这个游戏，结果是什么？&lt;strong&gt;它永远不会得分。&lt;/strong&gt; 因为在它看来，99.9%的时间都在&amp;quot;做没用的事&amp;quot;——没有奖励，没有反馈，它不知道自己在做什么。它就像在空房间里打了1000次墙，然后说&amp;quot;这里什么都没有&amp;quot;，放弃了。&lt;/p&gt;&#xA;&lt;p&gt;但人类不一样。人类进入这个游戏的第一分钟，就会产生好奇心——&amp;ldquo;这扇门后面是什么？&amp;ldquo;&amp;ldquo;那个钥匙有什么用？&amp;ldquo;&amp;ldquo;我能不能跳过去？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心让人类在没有任何外部奖励的情况下，仍然保持探索的欲望。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;好奇心模块ai的内在奖励系统&#34;&gt;好奇心模块：AI的&amp;quot;内在奖励系统&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;那么，如何给AI装上&amp;quot;好奇心&amp;rdquo;？&lt;/p&gt;&#xA;&lt;p&gt;伯克利团队的方法，出人意料地简单。&lt;/p&gt;&#xA;&lt;p&gt;他们给AI增加了一个额外的&amp;quot;好奇心模块&amp;rdquo;，这个模块的核心是一个&lt;strong&gt;预测模型&lt;/strong&gt;——AI每做一个动作，这个模型就预测&amp;quot;接下来会发生什么&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;然后，AI把预测和实际结果做对比。如果预测对了，说明AI&amp;quot;已经懂了这个场景&amp;quot;，好奇心模块给出低奖励。如果预测错了，说明&amp;quot;这个场景是新的，我还不太懂&amp;quot;，好奇心模块给出高奖励。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个&amp;quot;预测误差&amp;quot;就是AI的内在奖励——好奇心。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个机制让AI的行为发生了质变：&lt;/p&gt;&#xA;&lt;p&gt;在没有好奇心的情况下，AI只会做&amp;quot;可能获得外部奖励&amp;quot;的动作。在Montezuma&amp;rsquo;s Revenge的早期关卡，它找不到任何外部奖励，于是它什么也不做，或者随机碰撞，永远不会突破第一关。&lt;/p&gt;&#xA;&lt;p&gt;有了好奇心之后，AI开始主动探索——&amp;ldquo;咦，这个走廊我还没走过，走进去看看会发生什么？&amp;ldquo;&amp;ldquo;咦，这个按钮我没按过，按一下会怎样？&amp;ldquo;它不需要知道&amp;quot;为什么要这么做&amp;rdquo;，只需要知道&amp;quot;这个东西我还没搞懂&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;结果令人震惊：&lt;strong&gt;在Montezuma&amp;rsquo;s Revenge上，传统AI的得分是0，而带好奇心模块的AI第一次突破了1000分。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它自己学会了打开门、躲避敌人、收集钥匙——没有外部奖励，纯粹是因为&amp;quot;想知道&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一个微妙的问题noisy-tv困境&#34;&gt;一个微妙的问题：Noisy TV困境&lt;/h2&gt;&#xA;&lt;p&gt;但好奇心驱动的AI也面临一个有趣的挑战，研究者称之为&amp;rdquo;&lt;strong&gt;Noisy TV问题&lt;/strong&gt;&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象你面前有一台老式电视机，屏幕上是雪花——纯粹的白噪音。如果你盯着它看，每秒钟屏幕上的画面都在随机变化，每一次变化都&amp;quot;出乎意料&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;对于好奇心驱动的AI来说，这台电视机就是&amp;quot;无限知识&amp;quot;——它永远无法预测雪花的下一个画面，所以永远有预测误差，永远有&amp;quot;好奇心奖励&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;结果呢？&lt;strong&gt;AI可能永远坐在电视机前，再也不去探索有意义的世界了。&lt;/strong&gt; 它被&amp;quot;虚假的新奇&amp;quot;困住了，就像人类刷短视频刷到停不下来——不是因为内容有多好，而是因为&amp;quot;下一个可能更有趣&amp;quot;的预期一直在驱动你。&lt;/p&gt;&#xA;&lt;p&gt;研究者如何解决这个问题？答案很巧妙。&lt;/p&gt;&#xA;&lt;p&gt;他们让AI不对&amp;quot;原始画面&amp;quot;做预测，而是对**经过特征提取后的&amp;quot;抽象表示&amp;quot;**做预测。具体来说，AI同时训练一个&amp;quot;逆动力学模型&amp;quot;——给定当前画面和下一帧画面，判断&amp;quot;中间发生了什么动作&amp;quot;。这个模型提取的是&amp;quot;与动作相关的特征&amp;quot;，而不是&amp;quot;画面中的随机噪声&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;决定性的特征被保留下，随机噪声被过滤掉。&lt;/strong&gt; AI的好奇心不再被&amp;quot;雪花&amp;quot;吸引，而只关注&amp;quot;真正有意义的新奇&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个设计让AI的好奇心变得&amp;quot;聪明&amp;quot;——它不追逐随机变化，而是追逐&amp;quot;有结构的新知&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从atari游戏到现实世界&#34;&gt;从Atari游戏到现实世界&lt;/h2&gt;&#xA;&lt;p&gt;好奇心驱动的探索，不仅仅是一个游戏AI的&amp;quot;玩具&amp;quot;。它正在深刻改变AI的应用方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景一：机器人自主探索&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一个机器人被扔进一个陌生的房间。它没有地图，没有说明书，没有任何外部指令。但因为它有好奇心，它会自动开始探索——推动椅子、打开抽屉、触碰不同物体。&lt;/p&gt;&#xA;&lt;p&gt;每一次互动，如果结果&amp;quot;出乎意料&amp;quot;（比如&amp;quot;原来椅子可以推动&amp;quot;&amp;ldquo;原来这个抽屉是空的&amp;rdquo;），它就会产生&amp;quot;好奇心奖励&amp;quot;，驱动它继续探索。&lt;/p&gt;&#xA;&lt;p&gt;几个小时后，机器人对房间的&amp;quot;世界模型&amp;quot;已经相当完整——它知道房间里有什么、它们之间如何互动。&lt;strong&gt;而这些知识，完全是它&amp;quot;自己好奇&amp;quot;的结果。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景二：自动驾驶中的好奇心&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;自动驾驶汽车每天都会遇到&amp;quot;新场景&amp;quot;——一个有临时交通标志的路口、一个在非人行横道位置过马路的行人、一个被雪覆盖的限速牌。&lt;/p&gt;&#xA;&lt;p&gt;如果AI只依赖&amp;quot;已标注的驾驶数据&amp;quot;，它永远无法应对这些&amp;quot;没见过的情况&amp;quot;。但如果AI有&amp;quot;好奇心&amp;quot;，它会主动关注那些&amp;quot;异常&amp;quot;——&amp;ldquo;这个行人的行为模式和我预测的不一样，我要记住这个场景，学习它的规律。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;好奇心让AI从&amp;quot;死记硬背&amp;quot;走向&amp;quot;主动学习&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;场景三：AI科学家的好奇心&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2023年，有研究者将好奇心机制应用于材料科学。AI被要求预测新材料的性质，但传统方法只关心&amp;quot;预测准确性&amp;quot;。当引入好奇心机制后，AI开始主动选择&amp;quot;那些预测误差最大的材料&amp;quot;进行研究——不是因为它们&amp;quot;更容易预测&amp;quot;，而是因为&amp;quot;它们最让我意外&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;结果，AI发现了几个原本被忽略但具有特殊性质的新材料。&lt;strong&gt;好奇心驱动AI去探索&amp;quot;未知的未知&amp;quot;，而不仅仅是&amp;quot;已知的未知&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;边界与局限好奇心不是万能药&#34;&gt;边界与局限：好奇心不是万能药&lt;/h2&gt;&#xA;&lt;p&gt;当然，好奇心驱动的AI也有它的边界。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
