<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>数据重复 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E6%95%B0%E6%8D%AE%E9%87%8D%E5%A4%8D/</link>
		<description>Recent content in 数据重复 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Wed, 23 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E6%95%B0%E6%8D%AE%E9%87%8D%E5%A4%8D/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的“偷懒”陷阱：更聪明的模型架构，为什么反而更容易“死记硬背”？</title>
				<link>https://lingyu7.com/posts/ai-moe-data-repetition-overfitting/</link>
				<pubDate>Wed, 23 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-moe-data-repetition-overfitting/</guid>
				<description>&lt;h2 id=&#34;引言一个你可能没注意过的反常识&#34;&gt;引言：一个你可能没注意过的&amp;quot;反常识&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;如果你关注AI新闻，一定听说过这些名字：GPT-4、Mixtral、小米MiMo-V2.6——它们最近都很火，而且都有一个共同点：底层用了一种叫&amp;quot;混合专家模型&amp;quot;（Mixture-of-Experts，简称MoE）的架构。&lt;/p&gt;&#xA;&lt;p&gt;这种架构的核心思路特别像一个大公司的运作方式：公司有一万名员工，但每次只叫来三个最对口的人处理你的问题。虽然总共有一万人的&amp;quot;知识库&amp;quot;，但干活的时候只动用一小部分人，所以又快又省成本。&lt;/p&gt;&#xA;&lt;p&gt;AI也是这样——MoE模型可能有上万亿的总参数，但每次处理一段文字时只激活其中很小一部分。这就让它在保持强大能力的同时，推理速度更快、消耗的算力更少。&lt;/p&gt;&#xA;&lt;p&gt;听起来很完美对吧？&lt;/p&gt;&#xA;&lt;p&gt;但2026年9月，斯坦福大学和Meta的研究团队发表了一篇论文，揭示了一个让人不安的事实：&lt;strong&gt;这种&amp;quot;偷懒&amp;quot;的架构，在一种特定情况下会比老老实实用全部参数的传统模型差得多——而这种情况，恰恰是整个AI行业正在面对的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;数据快不够用了ai行业的隐秘焦虑&#34;&gt;数据快不够用了：AI行业的隐秘焦虑&lt;/h2&gt;&#xA;&lt;p&gt;先说一个你可能不太了解的背景。&lt;/p&gt;&#xA;&lt;p&gt;训练一个强大的AI模型，需要海量的&amp;quot;好数据&amp;quot;——人类写的文章、书籍、代码、论文、对话。这些数据就像是AI的&amp;quot;教科书&amp;quot;，教科书的质量直接决定了AI的水平。&lt;/p&gt;&#xA;&lt;p&gt;但问题是，&lt;strong&gt;人类写的好数据快被用完了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这不是夸张。各大AI公司已经把互联网上几乎所有公开的文字都翻过一遍了。怎么办？一个&amp;quot;心照不宣&amp;quot;的做法是：把已有的数据重复用好几遍。训练一遍不够？那就训练四遍、八遍、甚至三十二遍。&lt;/p&gt;&#xA;&lt;p&gt;听起来好像有点道理——人类学习不也是&amp;quot;重复练习&amp;quot;嘛？&lt;/p&gt;&#xA;&lt;p&gt;但对于MoE模型来说，重复练习的效果远比想象中糟糕。&lt;/p&gt;&#xA;&lt;h2 id=&#34;实验一场精心设计的数据注水测试&#34;&gt;实验：一场精心设计的&amp;quot;数据注水&amp;quot;测试&lt;/h2&gt;&#xA;&lt;p&gt;研究团队做了一个非常直观的对比实验。&lt;/p&gt;&#xA;&lt;p&gt;他们准备了从8000万到10亿参数不等的模型，既有&amp;quot;老实人&amp;quot;（传统密集模型，每次计算都用全部参数），也有&amp;quot;聪明人&amp;quot;（MoE模型，每次只激活一部分参数），总参数规模最大到85亿。&lt;/p&gt;&#xA;&lt;p&gt;然后，他们故意把训练数据重复不同的次数——2倍、4倍、8倍、16倍、32倍、64倍——来模拟&amp;quot;数据不够，重复来凑&amp;quot;的场景。&lt;/p&gt;&#xA;&lt;p&gt;结果非常清晰：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;密集模型（&amp;ldquo;老实人&amp;rdquo;）：&lt;/strong&gt; 数据重复8次以内，几乎看不出性能下降。就像一个勤奋的学生，课本读了8遍，每次都能学到新东西。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MoE模型（&amp;ldquo;聪明人&amp;rdquo;）：&lt;/strong&gt; 数据重复到4次就开始明显退化，到32次时甚至不如那些&amp;quot;笨&amp;quot;的密集模型。就像一个聪明但偷懒的学生，课本读了4遍就开始&amp;quot;背答案&amp;quot;而不是&amp;quot;理解内容&amp;quot;，到32遍的时候已经变成了鹦鹉学舌。&lt;/p&gt;&#xA;&lt;p&gt;更关键的是，这种退化不是随机的——&lt;strong&gt;模型越是&amp;quot;稀疏&amp;quot;（每次激活的参数占比越小），退化就越严重。&lt;/strong&gt; 也就是说，越是追求效率的MoE架构，在这个问题上就越脆弱。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么会这样专业分工的双刃剑&#34;&gt;为什么会这样？&amp;ldquo;专业分工&amp;quot;的双刃剑&lt;/h2&gt;&#xA;&lt;p&gt;要理解这个问题，我们得回到MoE架构的核心机制。&lt;/p&gt;&#xA;&lt;p&gt;想象一个大型医院。密集模型就像一个全科医生——每次看病都要动用自己所有的医学知识，虽然慢一些，但每次都会综合分析。而MoE模型就像一个拥有100个专科医生的超级医院——你来看头疼，它只叫来神经内科的3个专家，其他97个科室的医生完全不参与。&lt;/p&gt;&#xA;&lt;p&gt;日常情况下，这种&amp;quot;按需叫人&amp;quot;的模式效率极高。但问题出在&amp;quot;重复学习&amp;quot;上。&lt;/p&gt;&#xA;&lt;p&gt;当同一条数据反复出现时，MoE模型的&amp;quot;分诊台&amp;rdquo;（学术上叫&lt;strong&gt;路由器&lt;/strong&gt;）会越来越快地形成固定判断：&amp;ldquo;这种类型的文字，交给这几个专家就行。&amp;ldquo;研究发现，&lt;strong&gt;MoE的路由决策在训练很早阶段就&amp;quot;固化&amp;quot;了——一旦形成习惯，就不再改变。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就相当于医院的分诊台在第4次看到同一类病人后，就彻底锁死了分诊规则。之后不管来多少遍，都是同样的3个医生看同样的病，用同样的方式治。他们不再综合其他科室的意见，而是开始&amp;quot;背治疗方案&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;用论文的话说：&lt;strong&gt;&amp;ldquo;专家的专业化程度越高，对重复数据的过拟合就越严重。&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这是一种精妙的讽刺——MoE之所以高效，正是因为它的专家足够&amp;quot;专&amp;rdquo;；但正是这种&amp;quot;专&amp;quot;，让它在面对重复数据时变成了&amp;quot;死记硬背&amp;quot;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;这对普通人意味着什么&#34;&gt;这对普通人意味着什么？&lt;/h2&gt;&#xA;&lt;p&gt;你可能觉得这只是学术圈的烦恼，但它其实和你的日常体验密切相关。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，你用的AI产品可能正在&amp;quot;变笨&amp;quot;。&lt;/strong&gt; 当你发现某个AI模型在特定话题上总是给出雷同的、越来越&amp;quot;套路化&amp;quot;的回答时，这可能不是巧合。如果它底层是MoE架构，而训练数据又反复使用，那那些&amp;quot;专家&amp;quot;可能真的在背答案。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，&amp;ldquo;更大&amp;quot;不等于&amp;quot;更好&amp;rdquo;。&lt;/strong&gt; 2026年9月，小米刚发布了1万亿参数的MiMo-V2.6-Pro，每次只激活420亿参数。这是MoE架构的极致体现——参数越多、激活比例越低、效率越高。但斯坦福的研究告诉我们，这种极致效率的背后，是对数据重复更深的脆弱性。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，AI训练数据的&amp;quot;枯竭&amp;quot;不是未来的问题，是现在的问题。&lt;/strong&gt; 当整个行业都在重复使用越来越少的独特数据时，那些最高效的架构反而最先受伤。这意味着AI能力的提升可能会遇到一个之前被低估的天花板。&lt;/p&gt;&#xA;&lt;h2 id=&#34;有没有解药&#34;&gt;有没有解药？&lt;/h2&gt;&#xA;&lt;p&gt;好消息是，研究团队找到了一些缓解方法。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;Dropout（随机失活）&lt;/strong&gt;——在训练过程中随机&amp;quot;关掉&amp;quot;一部分专家，迫使模型不要过度依赖某几个固定专家。这相当于强制医院的分诊台时不时换一种分诊方式，让不同的医生也有机会参与。&lt;/p&gt;&#xA;&lt;p&gt;实验表明，加上足够强的正则化手段后，MoE模型即使在数据重复64次的情况下，依然能保持比密集模型更好的性能。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但坏消息是：没有任何方法能完全恢复到&amp;quot;只用不重复数据&amp;quot;的效果。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;也就是说，数据重复造成的伤害是真实存在的，我们能做的只是减少伤害，而不能完全消除。&lt;/p&gt;&#xA;&lt;h2 id=&#34;一个更深层的思考&#34;&gt;一个更深层的思考&lt;/h2&gt;&#xA;&lt;p&gt;这项研究让我想到一个更深层的问题：&lt;strong&gt;效率与鲁棒性之间的权衡，可能比我们想象的更普遍。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;MoE模型选择了效率——用更少的计算达到同样甚至更好的效果。但代价是对数据质量更敏感，对重复数据更脆弱。&lt;/p&gt;&#xA;&lt;p&gt;这其实和很多现实系统很像。一个高度专业化的经济体效率极高，但在供应链冲击面前特别脆弱。一个只种单一作物的农场产量最高，但面对病虫害时最容易全军覆没。&lt;/p&gt;&#xA;&lt;p&gt;AI架构设计也是如此。当我们越来越追求&amp;quot;用更少的算力做更多的事&amp;quot;时，是不是也在不知不觉中牺牲了某种&amp;quot;冗余&amp;quot;——那种看似浪费、实则提供稳健性的冗余？&lt;/p&gt;&#xA;&lt;p&gt;也许未来的AI架构需要在效率和多样性之间找到更好的平衡。不是所有参数都应该&amp;quot;专业化&amp;quot;，有些&amp;quot;通用&amp;quot;的能力可能正是对抗数据枯竭的解药。&lt;/p&gt;&#xA;&lt;p&gt;毕竟，在这个人类文字即将被&amp;quot;用完&amp;quot;的时代，&lt;strong&gt;AI是选择做一个只精通几科的&amp;quot;专家门诊&amp;quot;，还是做一个虽然慢一点但每次都能融会贯通的&amp;quot;全科医生&amp;quot;——这个问题的答案，可能决定了下一代AI能走多远。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;参考来源&#34;&gt;参考来源&lt;/h2&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;Jha, A., Li, M., Leskovec, J., Liang, P., &amp;amp; Zettlemoyer, L. (2026). &amp;ldquo;Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data.&amp;rdquo; arXiv:2609.11917. &lt;a href=&#34;https://arxiv.org/abs/2609.11917&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Labzin, K., et al. (2026). &amp;ldquo;Evidence for Shared Routing Geometry and Dynamics in Sparse Mixture-of-Experts.&amp;rdquo; arXiv:2609.02404. &lt;a href=&#34;https://arxiv.org/abs/2609.02404&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ul&gt;</description>
			</item>
	</channel>
</rss>
