引言:一个你可能没注意过的"反常识"

如果你关注AI新闻,一定听说过这些名字:GPT-4、Mixtral、小米MiMo-V2.6——它们最近都很火,而且都有一个共同点:底层用了一种叫"混合专家模型"(Mixture-of-Experts,简称MoE)的架构。

这种架构的核心思路特别像一个大公司的运作方式:公司有一万名员工,但每次只叫来三个最对口的人处理你的问题。虽然总共有一万人的"知识库",但干活的时候只动用一小部分人,所以又快又省成本。

AI也是这样——MoE模型可能有上万亿的总参数,但每次处理一段文字时只激活其中很小一部分。这就让它在保持强大能力的同时,推理速度更快、消耗的算力更少。

听起来很完美对吧?

但2026年9月,斯坦福大学和Meta的研究团队发表了一篇论文,揭示了一个让人不安的事实:这种"偷懒"的架构,在一种特定情况下会比老老实实用全部参数的传统模型差得多——而这种情况,恰恰是整个AI行业正在面对的。

数据快不够用了:AI行业的隐秘焦虑

先说一个你可能不太了解的背景。

训练一个强大的AI模型,需要海量的"好数据"——人类写的文章、书籍、代码、论文、对话。这些数据就像是AI的"教科书",教科书的质量直接决定了AI的水平。

但问题是,人类写的好数据快被用完了。

这不是夸张。各大AI公司已经把互联网上几乎所有公开的文字都翻过一遍了。怎么办?一个"心照不宣"的做法是:把已有的数据重复用好几遍。训练一遍不够?那就训练四遍、八遍、甚至三十二遍。

听起来好像有点道理——人类学习不也是"重复练习"嘛?

但对于MoE模型来说,重复练习的效果远比想象中糟糕。

实验:一场精心设计的"数据注水"测试

研究团队做了一个非常直观的对比实验。

他们准备了从8000万到10亿参数不等的模型,既有"老实人"(传统密集模型,每次计算都用全部参数),也有"聪明人"(MoE模型,每次只激活一部分参数),总参数规模最大到85亿。

然后,他们故意把训练数据重复不同的次数——2倍、4倍、8倍、16倍、32倍、64倍——来模拟"数据不够,重复来凑"的场景。

结果非常清晰:

密集模型(“老实人”): 数据重复8次以内,几乎看不出性能下降。就像一个勤奋的学生,课本读了8遍,每次都能学到新东西。

MoE模型(“聪明人”): 数据重复到4次就开始明显退化,到32次时甚至不如那些"笨"的密集模型。就像一个聪明但偷懒的学生,课本读了4遍就开始"背答案"而不是"理解内容",到32遍的时候已经变成了鹦鹉学舌。

更关键的是,这种退化不是随机的——模型越是"稀疏"(每次激活的参数占比越小),退化就越严重。 也就是说,越是追求效率的MoE架构,在这个问题上就越脆弱。

为什么会这样?“专业分工"的双刃剑

要理解这个问题,我们得回到MoE架构的核心机制。

想象一个大型医院。密集模型就像一个全科医生——每次看病都要动用自己所有的医学知识,虽然慢一些,但每次都会综合分析。而MoE模型就像一个拥有100个专科医生的超级医院——你来看头疼,它只叫来神经内科的3个专家,其他97个科室的医生完全不参与。

日常情况下,这种"按需叫人"的模式效率极高。但问题出在"重复学习"上。

当同一条数据反复出现时,MoE模型的"分诊台”(学术上叫路由器)会越来越快地形成固定判断:“这种类型的文字,交给这几个专家就行。“研究发现,MoE的路由决策在训练很早阶段就"固化"了——一旦形成习惯,就不再改变。

这就相当于医院的分诊台在第4次看到同一类病人后,就彻底锁死了分诊规则。之后不管来多少遍,都是同样的3个医生看同样的病,用同样的方式治。他们不再综合其他科室的意见,而是开始"背治疗方案”。

用论文的话说:“专家的专业化程度越高,对重复数据的过拟合就越严重。”

这是一种精妙的讽刺——MoE之所以高效,正是因为它的专家足够"专”;但正是这种"专",让它在面对重复数据时变成了"死记硬背"。

这对普通人意味着什么?

你可能觉得这只是学术圈的烦恼,但它其实和你的日常体验密切相关。

第一,你用的AI产品可能正在"变笨"。 当你发现某个AI模型在特定话题上总是给出雷同的、越来越"套路化"的回答时,这可能不是巧合。如果它底层是MoE架构,而训练数据又反复使用,那那些"专家"可能真的在背答案。

第二,“更大"不等于"更好”。 2026年9月,小米刚发布了1万亿参数的MiMo-V2.6-Pro,每次只激活420亿参数。这是MoE架构的极致体现——参数越多、激活比例越低、效率越高。但斯坦福的研究告诉我们,这种极致效率的背后,是对数据重复更深的脆弱性。

第三,AI训练数据的"枯竭"不是未来的问题,是现在的问题。 当整个行业都在重复使用越来越少的独特数据时,那些最高效的架构反而最先受伤。这意味着AI能力的提升可能会遇到一个之前被低估的天花板。

有没有解药?

好消息是,研究团队找到了一些缓解方法。

Dropout(随机失活)——在训练过程中随机"关掉"一部分专家,迫使模型不要过度依赖某几个固定专家。这相当于强制医院的分诊台时不时换一种分诊方式,让不同的医生也有机会参与。

实验表明,加上足够强的正则化手段后,MoE模型即使在数据重复64次的情况下,依然能保持比密集模型更好的性能。

但坏消息是:没有任何方法能完全恢复到"只用不重复数据"的效果。

也就是说,数据重复造成的伤害是真实存在的,我们能做的只是减少伤害,而不能完全消除。

一个更深层的思考

这项研究让我想到一个更深层的问题:效率与鲁棒性之间的权衡,可能比我们想象的更普遍。

MoE模型选择了效率——用更少的计算达到同样甚至更好的效果。但代价是对数据质量更敏感,对重复数据更脆弱。

这其实和很多现实系统很像。一个高度专业化的经济体效率极高,但在供应链冲击面前特别脆弱。一个只种单一作物的农场产量最高,但面对病虫害时最容易全军覆没。

AI架构设计也是如此。当我们越来越追求"用更少的算力做更多的事"时,是不是也在不知不觉中牺牲了某种"冗余"——那种看似浪费、实则提供稳健性的冗余?

也许未来的AI架构需要在效率和多样性之间找到更好的平衡。不是所有参数都应该"专业化",有些"通用"的能力可能正是对抗数据枯竭的解药。

毕竟,在这个人类文字即将被"用完"的时代,AI是选择做一个只精通几科的"专家门诊",还是做一个虽然慢一点但每次都能融会贯通的"全科医生"——这个问题的答案,可能决定了下一代AI能走多远。


参考来源

  • Jha, A., Li, M., Leskovec, J., Liang, P., & Zettlemoyer, L. (2026). “Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data.” arXiv:2609.11917. 论文链接
  • Labzin, K., et al. (2026). “Evidence for Shared Routing Geometry and Dynamics in Sparse Mixture-of-Experts.” arXiv:2609.02404. 论文链接