<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>泛化能力 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E6%B3%9B%E5%8C%96%E8%83%BD%E5%8A%9B/</link>
		<description>Recent content in 泛化能力 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sat, 25 Jul 2026 02:29:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E6%B3%9B%E5%8C%96%E8%83%BD%E5%8A%9B/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的「遗忘」艺术——为什么学会丢掉信息，才是真正的智能</title>
				<link>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</link>
				<pubDate>Sat, 25 Jul 2026 02:29:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai%E7%9A%84-%E9%81%97%E5%BF%98-%E8%89%BA%E6%9C%AF-%E4%B8%BA%E4%BB%80%E4%B9%88%E5%AD%A6%E4%BC%9A%E4%B8%A2%E6%8E%89%E4%BF%A1%E6%81%AF-%E6%89%8D%E6%98%AF%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%99%BA%E8%83%BD/</guid>
				<description>&lt;h2 id=&#34;引言你的大脑是一个遗忘大师&#34;&gt;引言：你的大脑，是一个&amp;quot;遗忘大师&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;我们来做一个小实验。&lt;/p&gt;&#xA;&lt;p&gt;回想一下，上周三的午饭你吃了什么？如果你能立刻回答出来，那你属于少数人。大多数人需要想一会儿，甚至根本想不起来。&lt;/p&gt;&#xA;&lt;p&gt;但这不是问题——&lt;strong&gt;这是优点。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你每天摄入海量的信息：看到的、听到的、闻到的、触摸到的、思考到的。如果全部记住，你的大脑会迅速被撑爆。所以你的大脑做了一个极其聪明的选择：&lt;strong&gt;只保留&amp;quot;可能有用&amp;quot;的信息，扔掉其余的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可以准确说出自己家的地址，但记不住昨天路过的那家便利店门口垃圾桶的颜色。&lt;/p&gt;&#xA;&lt;p&gt;你可以认出朋友的脸，但记不住他上周三穿的是什么颜色的袜子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;你之所以智能，不是因为你会记住，而是因为你学会了遗忘。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个看似简单的道理，其实是AI领域最深刻的理论之一。它有一个名字，叫&lt;strong&gt;信息瓶颈（Information Bottleneck）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一信息瓶颈是什么一个抄笔记的隐喻&#34;&gt;一、信息瓶颈是什么？——一个&amp;quot;抄笔记&amp;quot;的隐喻&lt;/h2&gt;&#xA;&lt;p&gt;想象你在上数学课。&lt;/p&gt;&#xA;&lt;p&gt;老师讲了一道很复杂的微积分题，你需要在有限的时间内记笔记。&lt;/p&gt;&#xA;&lt;p&gt;你有两种记法：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种：逐字逐句地记。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;老师说的每一个字你都记下来——&amp;ldquo;好，我们来看这道题，第一步，先求导……&amp;ldquo;你连老师的语气词都没放过。下课后，你的笔记本比老师的教案还厚。&lt;/p&gt;&#xA;&lt;p&gt;但问题是，你记了这么多，&lt;strong&gt;真正有用的信息被淹没在大量废话里了。&lt;/strong&gt; 考试的时候，你根本找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种：只记关键步骤。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你快速判断：这道题的核心是&amp;quot;链式法则&amp;rdquo;。你只记下关键公式和两个关键步骤，其他的都忽略。笔记只有三行，但每一行都是精华。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论要回答的，就是这个问题：如何找到&amp;quot;最优的笔记&amp;rdquo;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它正式的定义是这样的：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;给定输入X（老师讲的全部内容）和输出Y（考试要考的知识点），找到一个压缩表示Z（你的笔记），使得：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Z尽可能小（压缩率高，笔记简洁）&lt;/li&gt;&#xA;&lt;li&gt;Z尽可能保留关于Y的信息（预测能力强，考试能拿分）&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;这两个目标相互矛盾。&lt;/strong&gt; 笔记越简洁，丢失的信息越多，预测能力可能下降；笔记越详细，预测能力越强，但压缩率差。&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论的核心贡献是：&lt;strong&gt;它给出了这个权衡的数学最优解。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个公式道尽智能的本质&#34;&gt;二、一个公式，道尽智能的本质&lt;/h2&gt;&#xA;&lt;p&gt;信息瓶颈的核心公式，其实只有一行：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;最小化：I(X;Z) — β × I(Z;Y)&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;不要被公式吓到——它表达的是一种我们每天都在做的直觉判断。&lt;/p&gt;&#xA;&lt;p&gt;让我们拆解一下：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(X;Z)&lt;/strong&gt;：你的笔记（Z）包含的原始信息（X）的量。这个值越小，说明你的笔记越&amp;quot;压缩&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;I(Z;Y)&lt;/strong&gt;：你的笔记（Z）能预测考试内容（Y）的能力。这个值越大，说明你的笔记越&amp;quot;有用&amp;quot;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;β&lt;/strong&gt;：一个调节旋钮，控制你更看重&amp;quot;简洁&amp;quot;还是&amp;quot;准确&amp;quot;。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个公式的哲学是：最优的智能，不是&amp;quot;记住最多信息&amp;quot;，而是&amp;quot;用最少的信息，保留最多的价值&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;β=0时，你只关心压缩，笔记只有一行&amp;quot;今天上了数学课&amp;quot;——考试肯定挂。&lt;/p&gt;&#xA;&lt;p&gt;β=很大时，你只关心预测，笔记有几万字——信息过载，考试时找不到重点。&lt;/p&gt;&#xA;&lt;p&gt;β=最优值时，你的笔记刚好记下关键点——考试时思路清晰，效率最高。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这个&amp;quot;最优值&amp;quot;对应的笔记，就是信息瓶颈理论所说的&amp;quot;最优表征&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三深度学习本质上就在做这件事&#34;&gt;三、深度学习，本质上就在做这件事&lt;/h2&gt;&#xA;&lt;p&gt;2015年，信息论专家纳夫塔利·蒂什比（Naftali Tishby）提出了一个大胆的观点：&lt;strong&gt;深度神经网络训练的过程，本质上就是在解信息瓶颈问题。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;他做了一个实验，让一个神经网络在手写数字识别任务上训练，然后观察每一层神经元在训练过程中的变化。&lt;/p&gt;&#xA;&lt;p&gt;结果非常有趣：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：拟合（Fitting）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;刚开始训练时，网络在&amp;quot;记住&amp;quot;训练数据。每一层的神经元都在努力获取关于输入X的信息——I(X;Z)迅速上升。&lt;/p&gt;&#xA;&lt;p&gt;这就像你刚开始听课时的状态——拼命记笔记，生怕漏掉一个字。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：压缩（Compression）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;训练到一定阶段后，网络开始&amp;quot;遗忘&amp;quot;。它不再关注输入中的无关细节，而是只保留对分类有用的特征。&lt;/p&gt;&#xA;&lt;p&gt;I(X;Z)下降，但I(Z;Y)保持不变甚至上升——&lt;strong&gt;你丢掉了废话，留下了精华。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是深度学习成功的秘密：它不是在学习&amp;quot;记住所有东西&amp;quot;，而是在学习&amp;quot;忘记不重要的东西&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个没有经过充分训练的AI，就像那个逐字逐句记笔记的学生——它记住了训练数据的每一个细节，但换一个场景就不知所措了（这就是我们说的&amp;quot;过拟合&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;一个训练充分的AI，就像那个只记关键点的学生——它抓住了问题的本质，即使面对新情况也能灵活应对（这就是&amp;quot;泛化能力&amp;quot;）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;信息瓶颈理论告诉我们：泛化能力，本质上就是压缩能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四为什么忘记比记住更难&#34;&gt;四、为什么&amp;quot;忘记&amp;quot;比&amp;quot;记住&amp;quot;更难？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：既然压缩这么重要，那让AI使劲压缩不就行了？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;没那么简单。因为压缩的前提是：你知道什么该保留，什么该丢弃。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;一个刚出生的婴儿，分不清&amp;quot;妈妈的脸&amp;quot;和&amp;quot;天花板的颜色&amp;quot;哪个更重要。他需要大量的学习和经验，才能建立起&amp;quot;哪些信息值得保留&amp;quot;的判断力。&lt;/p&gt;&#xA;&lt;p&gt;同样，AI在训练初期也不知道什么特征重要。它需要反复试错，才能学会&amp;quot;压缩&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是为什么深度学习需要海量数据——不是为了让AI记住更多，而是为了让AI学会该忘记什么。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;信息瓶颈理论揭示了另一个惊人的事实：&lt;strong&gt;最优的压缩，会自然地出现在神经网络的不同层之间。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果你把神经网络看成一个流水线：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;第一层：处理最原始的信息（像素级别的颜色、边缘）&lt;/li&gt;&#xA;&lt;li&gt;中间层：开始提取有意义的模式（形状、纹理）&lt;/li&gt;&#xA;&lt;li&gt;最后一层：只保留最&amp;quot;有用&amp;quot;的特征（&amp;ldquo;这是一只猫&amp;quot;的判断）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;每一层都在做一次信息瓶颈——压缩输入，保留对下一层有用的信息。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
