引言

想象你走进一家拥有200位专科医生的超级医院。

你因为感冒去看诊,结果200位医生——心脏外科、神经外科、骨科、产科、皮肤科——全部放下手中的工作,一起跑过来围着你转。每个人都认真地看了你一眼,给出了自己的判断,最后综合出一个结论。

这听起来很荒唐对吧?但你每天用的大语言模型,过去就是这么干的。

在传统的大模型(我们叫它"稠密模型")里,你输入的每一个字,都要经过模型的全部参数。问一句"今天天气怎么样",上千亿个参数全部启动;写一篇量子物理论文,同样上千亿个参数全部启动。没有区分,没有选择,一视同仁。

这就像一个永远把所有医生都叫上的医院——效率极低,但别无选择。

直到2026年,一种叫混合专家模型(Mixture of Experts,简称MoE)的架构,彻底改变了游戏规则。

分诊护士:MoE的核心思想

MoE的想法其实特别简单:给医院配一个分诊护士。

你进来之后,分诊护士先看你的症状,然后只把你送到最相关的两三个专科医生那里。心脏外科、骨科、产科的医生继续忙自己的事,不用为你的感冒浪费时间。

在MoE模型里,这个分诊护士叫做路由器(Router)。而那些专科医生,叫做专家(Experts)。

具体来说,一个MoE模型长这样:

每一层网络里,不再只有一个巨大的处理模块,而是有很多个小的"专家网络"——通常是8个、64个、128个,甚至256个。前面站着一个路由器,它会"看"一眼你输入的每个词,然后决定:这个词应该送给哪几个专家处理?

路由器打分,选出得分最高的前k个专家(通常k=2到8),把词送过去。被选中的专家认真处理,没被选中的继续休息。最后把选中的专家的输出加权合并,送给下一层。

整个过程反复进行,一层又一层,直到生成最终的回复。

关键洞察:虽然模型总共有上千亿参数,但每个词只激活其中一小部分。这就意味着——AI可以用一个巨大的脑子思考,但每次只花一小部分的计算费用。

2026年10月:MoE全面统治前沿

让我用数据说话。

截至2026年10月,全球最受关注的几个前沿开源模型:

模型 总参数 每次激活参数 激活比例
Mistral Large 4 1.05万亿 490亿 4.7%
小米 MiMo-V2.6 Pro 1.02万亿 420亿 4.1%
DeepSeek V4.1 Flash 5520亿 160亿 2.9%
Reflection AI Beam 5010亿 230亿 4.6%
Aleph Alpha Kolibri 781亿 34.6亿 4.4%

没有看错。Mistral那个1.05万亿参数的庞然大物,每次思考只用到4.7%的大脑。DeepSeek V4.1更极端——5520亿参数里只有160亿在工作,激活比例不到3%。

换句话说,这些AI每次思考时,97%的大脑都在沉睡。

但这恰恰是它们强大的秘密。

为什么不直接造一个小模型?

你可能会问:既然每次只用3%的参数,那为什么不直接造一个小模型?何必搞一个万亿参数的大家伙,然后只用其中一小部分?这不是浪费吗?

这个问题问得好。答案是:知识容量和计算成本是两回事。

想象一下:一个全科医生和一个有200个专科医生的医院,虽然你每次只看一个专科,但这家医院能治的病,远远多于那个全科医生。200个专科医生每人掌握的知识和技能,加起来构成了这家医院的总能力。你这次虽然只看了心内科,但下次你来看骨科的时候,骨科专家已经准备好了。

大模型也一样。1万亿参数的总容量意味着它"见过"和"记住"了海量的知识——不同语言、不同学科、不同领域的信息,分散存储在不同的专家网络里。路由器会根据你的问题,精确地找到最相关的那几个专家。

如果你只造一个490亿参数的稠密模型(相当于Mistral Large 4每次激活的量),它的知识容量就只限于490亿参数能装下的东西。但1.05万亿参数的MoE模型,知识容量是1.05万亿级别的,只是计算成本等同于490亿。

这就是MoE的魔法:用大模型的脑子,花小模型的钱。

那些没醒来的专家在干什么?

一个更深层的问题来了:那些没被路由器选中的专家,它们在干什么?它们在"睡觉"吗?

2026年10月8日,一篇来自Anthropic的论文《RouterInterp》给出了一个出人意料的答案。

在此之前,大家普遍假设MoE的专家会按照"领域"分工——比如一个专家专门处理医学文本,一个处理数学,一个处理代码。这叫领域特化假说。

但Anthropic的研究者深入分析了路由器的工作方式后发现,现实远比想象复杂。一个专家可能同时处理医学文本中的某类句式、数学证明中的某个推理模式、以及翻译任务中的某类语法结构。这些看似毫无关联的任务,被"叠加"在同一个专家身上。

研究者把这叫做叠加特化假说(Superposed Specialisation Hypothesis)。

想想也不难理解。一个MoE模型通常有128个或256个专家,但现实世界中的知识领域远不止256个。医学可以细分成解剖学、病理学、药理学、临床诊断等几十个子领域。如果每个专家只能处理一个大领域,256个专家根本不够分。

所以专家必须学会"叠加"——在一个专家内部,同时编码多种看似无关的特征。就像一个人可以同时是医生、父亲、跑友和吉他爱好者一样,这些身份并不矛盾,只是叠加在同一个人身上。

这也解释了为什么路由器的决策很难被人类理解——它不是在简单的分类,而是在高维空间里做极其精细的匹配。

路由器的"偷懒"问题

MoE有一个著名的翻车模式:路由器坍缩。

想象一个场景:分诊护士发现心内科的张医生特别好说话,不管什么病都往张医生那里送。感冒送心内科,骨折送心内科,牙疼也送心内科。结果张医生累死了,其他199个医生闲得发慌。

在MoE训练过程中,路由器有时候也会"偷懒"。它发现某几个专家特别好使,就把大部分词都往那几个专家送,其他专家永远得不到训练机会。这在技术上叫做专家坍缩(Expert Collapse)。

一旦坍缩发生,你精心设计的256个专家,实际上只有3个在干活。整个MoE架构的容量优势全部消失。

怎么解决?目前的标准方法是给路由器加一个"负载均衡罚分"。简单说就是:如果某个专家接了太多活,就惩罚路由器;如果某个专家一直没活干,就鼓励路由器把任务分给它。这相当于给分诊护士定了一条规矩:每个医生必须公平地分到病人。

DeepSeek在2026年初发布的MoE细粒度优化技术,进一步改进了这个问题。他们的方案包括"专家参数共享"——让不同专家之间共享一部分通用参数,减少冗余;以及动态调度——根据任务类型自动调整激活的专家数量,而不是固定每次都选k个。

实验数据显示,优化后的MoE架构训练效率提升了35%,显存开销降低了42%。

偷不掉的内存账单

MoE听上去近乎完美,但有一个必须正视的代价:内存。

MoE节省的是计算量(FLOPs),不是内存。虽然每个词只用3%的参数,但所有专家必须全部加载在显存里,随时待命——因为路由器在看到下一个词之前,不知道需要哪个专家。

打个比方:虽然你每次只叫3个医生来看病,但200个医生都得坐在诊室里等着。你不需要付他们看病的钱(计算费用),但你得付他们坐在那里的钱(内存费用)。

这带来了实际的工程挑战。DeepSeek V3有6710亿参数,即使用8位精度存储,光模型权重就需要约671GB的显存——这需要多台高端GPU服务器协同工作。即便每次推理只用370亿参数的计算量,内存账单仍然是6710亿级别的。

这也是为什么MoE模型在云端服务器上很有优势(计算成本是主要开支),但对个人玩家不太友好(显存往往是瓶颈)。

前沿:让AI"想多几遍"

2026年9月底,Meta AI发布了一篇论文,提出了一个优雅的解决方案:循环MoE(Looped MoE)。

思路是这样的:与其堆更多专家来增加模型容量,不如让同一组专家多跑几遍。就像你遇到一个特别难的问题,不是去叫更多医生来会诊,而是让现有的医生多思考几轮。

关键在于,由于MoE有路由器存在,同一组专家在第二遍被调用时,面对的是已经被第一遍处理过的、不同的内部表示。路由器会做出不同的选择,激活不同的专家子集。所以每一轮循环并不是简单的重复,而是一次全新的计算。

Meta的实验结果很惊人:在相同计算预算下,一个遵循他们"循环缩放定律"设计的100亿参数循环MoE模型,在推理任务上可以匹敌200亿参数的常规MoE模型。

更妙的是,循环次数是推理时的可调参数。简单的问题跑1遍,复杂的问题跑3-5遍。同一个模型,自动调整思考深度。

这意味着什么?

回到最开始的那个比喻。

2026年的AI前沿,正在从"一个人干所有事"转向"一个团队各司其职"。MoE不只是一个工程优化,它代表了一种思维方式的转变:智能不是靠一个全知全能的单一模块实现的,而是靠一群专精不同领域的专家协作完成的。

路由器选择谁、专家如何分工、坍缩如何避免、循环如何叠加——这些问题的答案,正在定义下一代AI的形态。

下次你听到某个AI模型发布了1万亿参数,不要只看那个吓人的数字。问问:激活了多少?路由器怎么设计的?专家真的在分工吗?

因为这些问题的答案,才是2026年AI真正的竞争力所在。


参考来源:

  1. Shazeer et al., “Outrageously Large Neural Networks: A Sparsely-Gated Mixture-of-Experts Approach,” ICLR 2017
  2. “RouterInterp: Understanding Superposed Specialisation in Mixture of Experts Routing,” Anthropic, arXiv 2610.11775, October 2026
  3. “Expert Coupling in MoE Pretraining: Reducing All-to-All Overhead with Correlated Placement and Token Shuffling,” arXiv 2610.09372, October 2026
  4. Chen, Goyal, Krishnamoorthi, “Meta AI Loop Scaling Laws,” arXiv, September 30, 2026
  5. DeepSeek, “Fine-Grained Optimization of MoE Architecture for Efficient Large Language Models,” 2026
  6. Mistral AI, “Mistral Large 4 Model Card,” October 6, 2026
  7. “Only 3% of the Brain Wakes Up: The Mixture-of-Experts Playbook Behind September’s Biggest Models,” DEV Community, October 8, 2026