<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>稀疏模型 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E7%A8%80%E7%96%8F%E6%A8%A1%E5%9E%8B/</link>
		<description>Recent content in 稀疏模型 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sat, 10 Oct 2026 02:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E7%A8%80%E7%96%8F%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的万亿大脑里，每次只有3%的神经元会醒来——混合专家模型（MoE）如何悄悄统治了2026年的AI前沿</title>
				<link>https://lingyu7.com/posts/moe-mixture-of-experts-2026-frontier/</link>
				<pubDate>Sat, 10 Oct 2026 02:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/moe-mixture-of-experts-2026-frontier/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象你走进一家拥有200位专科医生的超级医院。&lt;/p&gt;&#xA;&lt;p&gt;你因为感冒去看诊，结果200位医生——心脏外科、神经外科、骨科、产科、皮肤科——全部放下手中的工作，一起跑过来围着你转。每个人都认真地看了你一眼，给出了自己的判断，最后综合出一个结论。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很荒唐对吧？但你每天用的大语言模型，过去就是这么干的。&lt;/p&gt;&#xA;&lt;p&gt;在传统的大模型（我们叫它&amp;quot;稠密模型&amp;quot;）里，你输入的每一个字，都要经过模型的全部参数。问一句&amp;quot;今天天气怎么样&amp;quot;，上千亿个参数全部启动；写一篇量子物理论文，同样上千亿个参数全部启动。没有区分，没有选择，一视同仁。&lt;/p&gt;&#xA;&lt;p&gt;这就像一个永远把所有医生都叫上的医院——效率极低，但别无选择。&lt;/p&gt;&#xA;&lt;p&gt;直到2026年，一种叫&lt;strong&gt;混合专家模型&lt;/strong&gt;（Mixture of Experts，简称MoE）的架构，彻底改变了游戏规则。&lt;/p&gt;&#xA;&lt;h2 id=&#34;分诊护士moe的核心思想&#34;&gt;分诊护士：MoE的核心思想&lt;/h2&gt;&#xA;&lt;p&gt;MoE的想法其实特别简单：给医院配一个分诊护士。&lt;/p&gt;&#xA;&lt;p&gt;你进来之后，分诊护士先看你的症状，然后只把你送到最相关的两三个专科医生那里。心脏外科、骨科、产科的医生继续忙自己的事，不用为你的感冒浪费时间。&lt;/p&gt;&#xA;&lt;p&gt;在MoE模型里，这个分诊护士叫做&lt;strong&gt;路由器&lt;/strong&gt;（Router）。而那些专科医生，叫做&lt;strong&gt;专家&lt;/strong&gt;（Experts）。&lt;/p&gt;&#xA;&lt;p&gt;具体来说，一个MoE模型长这样：&lt;/p&gt;&#xA;&lt;p&gt;每一层网络里，不再只有一个巨大的处理模块，而是有很多个小的&amp;quot;专家网络&amp;quot;——通常是8个、64个、128个，甚至256个。前面站着一个路由器，它会&amp;quot;看&amp;quot;一眼你输入的每个词，然后决定：这个词应该送给哪几个专家处理？&lt;/p&gt;&#xA;&lt;p&gt;路由器打分，选出得分最高的前k个专家（通常k=2到8），把词送过去。被选中的专家认真处理，没被选中的继续休息。最后把选中的专家的输出加权合并，送给下一层。&lt;/p&gt;&#xA;&lt;p&gt;整个过程反复进行，一层又一层，直到生成最终的回复。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键洞察&lt;/strong&gt;：虽然模型总共有上千亿参数，但每个词只激活其中一小部分。这就意味着——AI可以用一个巨大的脑子思考，但每次只花一小部分的计算费用。&lt;/p&gt;&#xA;&lt;h2 id=&#34;2026年10月moe全面统治前沿&#34;&gt;2026年10月：MoE全面统治前沿&lt;/h2&gt;&#xA;&lt;p&gt;让我用数据说话。&lt;/p&gt;&#xA;&lt;p&gt;截至2026年10月，全球最受关注的几个前沿开源模型：&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;模型&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;总参数&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;每次激活参数&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;激活比例&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Mistral Large 4&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;1.05万亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;490亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;4.7%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;小米 MiMo-V2.6 Pro&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;1.02万亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;420亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;4.1%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;DeepSeek V4.1 Flash&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;5520亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;160亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;2.9%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Reflection AI Beam&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;5010亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;230亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;4.6%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Aleph Alpha Kolibri&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;781亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;34.6亿&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;4.4%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;没有看错。Mistral那个1.05万亿参数的庞然大物，每次思考只用到4.7%的大脑。DeepSeek V4.1更极端——5520亿参数里只有160亿在工作，激活比例不到3%。&lt;/p&gt;&#xA;&lt;p&gt;换句话说，&lt;strong&gt;这些AI每次思考时，97%的大脑都在沉睡&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;但这恰恰是它们强大的秘密。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么不直接造一个小模型&#34;&gt;为什么不直接造一个小模型？&lt;/h2&gt;&#xA;&lt;p&gt;你可能会问：既然每次只用3%的参数，那为什么不直接造一个小模型？何必搞一个万亿参数的大家伙，然后只用其中一小部分？这不是浪费吗？&lt;/p&gt;&#xA;&lt;p&gt;这个问题问得好。答案是：&lt;strong&gt;知识容量和计算成本是两回事&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下：一个全科医生和一个有200个专科医生的医院，虽然你每次只看一个专科，但这家医院能治的病，远远多于那个全科医生。200个专科医生每人掌握的知识和技能，加起来构成了这家医院的总能力。你这次虽然只看了心内科，但下次你来看骨科的时候，骨科专家已经准备好了。&lt;/p&gt;&#xA;&lt;p&gt;大模型也一样。1万亿参数的总容量意味着它&amp;quot;见过&amp;quot;和&amp;quot;记住&amp;quot;了海量的知识——不同语言、不同学科、不同领域的信息，分散存储在不同的专家网络里。路由器会根据你的问题，精确地找到最相关的那几个专家。&lt;/p&gt;&#xA;&lt;p&gt;如果你只造一个490亿参数的稠密模型（相当于Mistral Large 4每次激活的量），它的知识容量就只限于490亿参数能装下的东西。但1.05万亿参数的MoE模型，知识容量是1.05万亿级别的，只是计算成本等同于490亿。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是MoE的魔法：用大模型的脑子，花小模型的钱。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;那些没醒来的专家在干什么&#34;&gt;那些没醒来的专家在干什么？&lt;/h2&gt;&#xA;&lt;p&gt;一个更深层的问题来了：那些没被路由器选中的专家，它们在干什么？它们在&amp;quot;睡觉&amp;quot;吗？&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
