<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>过拟合 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E8%BF%87%E6%8B%9F%E5%90%88/</link>
		<description>Recent content in 过拟合 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Mon, 07 Sep 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E8%BF%87%E6%8B%9F%E5%90%88/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI真的学会了吗？——从过拟合到泛化，机器学习中最致命的矛盾</title>
				<link>https://lingyu7.com/posts/does-ai-really-learn-generalization-overfitting/</link>
				<pubDate>Mon, 07 Sep 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/does-ai-really-learn-generalization-overfitting/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象你正在教一个孩子认识猫。&lt;/p&gt;&#xA;&lt;p&gt;你拿出了一百张照片，每张都是橘猫、坐在沙发上、白天拍摄。孩子学得很好——所有照片都认对了。&lt;/p&gt;&#xA;&lt;p&gt;然后你拿出一张新照片：黑猫，在草地上，晚上拍的。&lt;/p&gt;&#xA;&lt;p&gt;孩子说：&amp;ldquo;这不是猫，没有橘色，背景也不对。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个场景，在机器学习中每天都在发生，而且有个专业名字——&lt;strong&gt;过拟合（Overfitting）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;它不是某个AI产品的Bug，而是整个深度学习时代最核心、最致命的矛盾：&lt;strong&gt;AI越是精确地记住训练数据，它在面对新数据时越容易犯错。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;听起来像是悖论，对吧？但这就是AI世界里的&amp;quot;聪明反被聪明误&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一ai的学霸困境为什么考满分反而是坏事&#34;&gt;一、AI的&amp;quot;学霸困境&amp;quot;：为什么考满分反而是坏事&lt;/h2&gt;&#xA;&lt;p&gt;2017年，MIT的研究人员做了一个实验。他们训练了一个图像分类模型来识别&amp;quot;狼&amp;quot;和&amp;quot;哈士奇&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;模型在测试集上表现惊人：准确率接近100%。&lt;/p&gt;&#xA;&lt;p&gt;但研究人员发现了一个诡异的现象——&lt;strong&gt;所有标注为&amp;quot;狼&amp;quot;的照片背景里都有雪，而&amp;quot;哈士奇&amp;quot;的照片大多没有雪。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;于是他们做了一件事：把&amp;quot;雪&amp;quot;从照片中P掉。结果模型准确率骤降到60%出头。&lt;/p&gt;&#xA;&lt;p&gt;这个模型根本没有学会区分狼和哈士奇，它学会了&amp;quot;辨别雪&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这不是模型笨，而是它太&amp;quot;聪明&amp;quot;了——它找到了一个训练数据中100%正确的捷径，但这个捷径对真正的问题毫无意义。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是过拟合的本质：模型不是在&amp;quot;学习规律&amp;quot;，而是在&amp;quot;死记硬背答案&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;更扎心的是，模型自己没有能力区分&amp;quot;真正的规律&amp;quot;和&amp;quot;碰巧相关的特征&amp;quot;。在它看来，狼身上有毛、有鼻子、四条腿、背景有雪——所有这些特征权重都一样。它不知道&amp;quot;雪&amp;quot;只是个巧合。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二为什么越大越容易过拟合参数的自由度陷阱&#34;&gt;二、为什么越大越容易&amp;quot;过拟合&amp;quot;？——参数的自由度陷阱&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：那让模型小一点不就完了？&lt;/p&gt;&#xA;&lt;p&gt;事情没那么简单。深度学习取得突破的核心原因之一，就是&lt;strong&gt;模型足够大&lt;/strong&gt;——参数越多，模型能捕获的规律越复杂。&lt;/p&gt;&#xA;&lt;p&gt;但这也带来了一个两难局面：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;参数越多，模型&amp;quot;记住&amp;quot;训练数据的能力就越强，它就越容易走捷径。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下：你让一个学生用100个公式去解释10个数据点。他当然可以轻松做到——每个数据点配一个公式，完美拟合。但这时候你给他第11个数据点，他所有公式全都用不上。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;过参数化&amp;quot;的陷阱。&lt;/p&gt;&#xA;&lt;p&gt;2018年，有一篇著名的论文叫《The Lottery Ticket Hypothesis》——彩票假说。它发现，在一个大模型中，其实只有一小部分参数（约10-20%）是真正有用的。其余参数就像是&amp;quot;空转&amp;quot;的神经元，它们的存在让模型更容易找到捷径，而不是真正理解问题。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但问题是：我们不知道哪些参数是&amp;quot;有用的&amp;quot;，哪些是&amp;quot;空转的&amp;quot;。&lt;/strong&gt; 所以只能把整个大模型都训练出来，然后祈祷它学到的是真正的规律，而不是训练数据中的&amp;quot;噪音&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三泛化之谜为什么神经网络反而越学越好&#34;&gt;三、泛化之谜：为什么神经网络反而&amp;quot;越学越好&amp;quot;？&lt;/h2&gt;&#xA;&lt;p&gt;这里有一个让很多研究者困惑的谜题。&lt;/p&gt;&#xA;&lt;p&gt;按照经典统计学理论，模型参数越多，过拟合越严重，泛化能力应该越差。这是&amp;quot;奥卡姆剃刀&amp;quot;的数学版本——简单模型通常更好。&lt;/p&gt;&#xA;&lt;p&gt;但深度学习的实践告诉我们一个反直觉的事实：&lt;strong&gt;大型神经网络虽然参数多到离谱，但它们的泛化能力往往出奇的好。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如GPT-3有1750亿个参数，训练数据是几千亿个token——按理说它应该把训练数据一字不差地背下来，但实际它展示出了相当强的泛化能力，甚至能完成从未见过的任务（零样本学习）。&lt;/p&gt;&#xA;&lt;p&gt;这怎么解释？&lt;/p&gt;&#xA;&lt;p&gt;2020年，Belkin等人在《PNAS》上发表了一篇论文，提出了一个&amp;quot;双峰风险曲线&amp;quot;（Double Descent）的理论：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;传统理解是：模型复杂度增加 → 先降低误差 → 然后升高误差（过拟合）→ 曲线是U形。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但深度学习的实际情况是：模型复杂度继续增加 → 误差反而再次下降——曲线是一个&amp;quot;双谷&amp;quot;形状。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;也就是说，当模型大到一定程度，它会越过&amp;quot;过拟合谷底&amp;quot;，进入一个&amp;quot;过度参数化&amp;quot;的新区域——在这个区域，模型反而开始真正地&amp;quot;理解&amp;quot;数据了。&lt;/p&gt;&#xA;&lt;p&gt;这个发现震撼了学术界。它意味着：&lt;strong&gt;&amp;ldquo;大就是好&amp;quot;不只是工程上的选择，它有深刻的数学基础。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但问题是，我们至今没有完全理解&amp;quot;为什么&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四对抗样本最残酷的泛化测试&#34;&gt;四、对抗样本：最残酷的泛化测试&lt;/h2&gt;&#xA;&lt;p&gt;如果你觉得过拟合只是个理论问题，那对抗样本（Adversarial Examples）会把你拉回现实。&lt;/p&gt;&#xA;&lt;p&gt;2014年，Szegedy等人发现了一个惊人的现象：&lt;strong&gt;对一张熊猫的照片加上肉眼完全看不出的噪点，AI就会以99.9%的置信度认为这是一只&amp;quot;长臂猿&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;对抗性扰动&amp;quot;小到你肉眼完全感觉不到差别，但模型的决策却发生了180度大转弯。&lt;/p&gt;&#xA;&lt;p&gt;这说明了什么？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;理解&amp;quot;和我们人类完全不同。&lt;/strong&gt; 人类看到一张熊猫照片，会提取&amp;quot;黑白色、圆脸、吃竹子&amp;quot;等高层次特征。而AI看到的是几十万个像素值——模型的决策空间，是这些像素值的超高维组合。&lt;/p&gt;&#xA;&lt;p&gt;在人的认知空间里，熊猫和长臂猿相距十万八千里。但在AI的像素空间里，一个小到人类感知不到的扰动，就足以把&amp;quot;熊猫&amp;quot;推到&amp;quot;长臂猿&amp;quot;的区域。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是泛化能力最脆弱的体现：模型在训练数据分布内（In-Distribution）表现很好，但一旦输入稍微偏离训练数据的分布，就会彻底崩溃。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;打个比方：一个在游泳池里训练了1000小时的游泳冠军，放到海里一个浪就呛水了——不是他游泳技术不好，是他只学会了&amp;quot;游泳池模式下&amp;quot;的游泳。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;五让ai学会举一反三对抗泛化困境的几种武器&#34;&gt;五、让AI学会&amp;quot;举一反三&amp;quot;：对抗泛化困境的几种武器&lt;/h2&gt;&#xA;&lt;p&gt;好消息是，研究者们已经找到了一些对抗过拟合的有效方法：&lt;/p&gt;&#xA;&lt;h3 id=&#34;1-数据增强data-augmentation&#34;&gt;1. 数据增强（Data Augmentation）&lt;/h3&gt;&#xA;&lt;p&gt;最简单的办法是&amp;quot;增加训练数据的多样性&amp;quot;。比如训练图像识别时，把每张照片随机旋转、裁剪、调色、加噪——让模型在&amp;quot;变着花样&amp;quot;的数据中学习，它就没法走捷径了。&lt;/p&gt;&#xA;&lt;h3 id=&#34;2-正则化regularization&#34;&gt;2. 正则化（Regularization）&lt;/h3&gt;&#xA;&lt;p&gt;给模型&amp;quot;加约束&amp;quot;，不让它太自由。就像教学生解题时，要求他必须写出推导过程，不能只写答案。L1/L2正则化、Dropout、Batch Normalization都是这个思路。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
