有些小伙伴可能会发现一个盲点:“上一节提到的 DeepSeek-671B,可是有 6710 亿参数啊!按前面的公式,岂不是需要 1300 多 GB 的显存、十几张顶级显卡才能跑起来?那为什么那么多企业能在本地把它跑起来呢?”
这里就要引出目前 AI 界最火的另一项黑科技——MoE 架构了。
什么是 MoE架构?
MoE,全称是 “Mixture of Experts(混合专家模型)”。它的核心思路,其实特别符合我们的直觉。
- 传统的稠密模型(Dense):就像是一个 “全科医生”。每次你问一个问题,这个全科医生大脑里的所有细胞(所有参数)都要全部转动一遍来思考——既耗脑力(算力),速度还慢。
- MoE 模型:就像是一所 “大型综合医院”。它的 6710 亿总参数被划分成了很多个 “专科科室”。每次你提问时,系统会先通过一个 “分诊台”,判断这是一个数学问题还是代码问题。如果是数学问题,系统就只唤醒数学科室的几个专家(比如只激活其中 370 亿个参数)来回答,其他几千亿个参数全部处于“休眠”状态。

正是靠着 MoE 架构,像 ChatGPT、Claude 这种参数巨兽在实际干活时,每次只需要动用一小部分参数,所以又快又省算力。这也是目前所有科技巨头(包括 OpenAI、Google),都在疯狂押注的最前沿技术。
提示: “MoE 架构” 和 “MoE 模型” 这两种说法都是可行的。“MoE 架构” 是从架构划分的角度,而 “MoE 模型” 是从模型划分的角度。
MoE 架构到底是怎么省的?
看懂了医院这个比方,我们就能抓住 MoE 最精髓的地方了——它把 “总参数” 和 “激活参数” 这两件事,给彻底拆开了:
- 总参数(Total Parameters):指的是这家 “医院” 里,所有专家加起来的全部参数。这个数字代表了模型的 “知识总量” 和 “脑容量”,自然是越大越好。
- 激活参数(Activated Parameters):指的是针对你这一个具体问题,真正被 “叫起来干活” 的那几位专家的参数。它代表了模型这一次实际花掉的力气,自然是越小越省。
对于传统的 “稠密模型” 来说,总参数和激活参数是相等的。每次都得全员上阵。而 MoE 的妙处就在于:总参数可以堆得非常大(所以很聪明),但每次只激活其中一小部分(所以很高效)。鱼和熊掌,它是真的想全都要。

举个真实的例子:DeepSeek
实际上,咱们的 “国产之光”——DeepSeek 的模型,就是 MoE 架构的典型代表。
以 DeepSeek 的 V3 / R1 为例:它的总参数高达 6710 亿(671B),这让它拥有了媲美顶级模型的庞大知识储备。但我们每问一个问题时,它实际只激活其中约 370 亿(37B)参数来干活。
这是什么概念?相当于它顶着一个 6710 亿的超级大脑,干起活来却只花了 370 亿的力气和成本。这正是 DeepSeek 既能这么聪明、又能把价格打到那么低的核心秘密之一。
以后我们再去看模型介绍时,会碰到 “671B-A37B” 这样的写法。其实它一点都不神秘——前面的 671B 是总参数,后面的 A37B(A 即 Activated,激活)就是激活参数。看懂了这个,你就比很多人更懂行了。

除了 DeepSeek,像 Meta 的 Llama 4,以及当下很多最新的顶级模型,也都纷纷用上了 MoE 架构。可以说,MoE 已经成了如今大模型的主流设计之一。
两个常见的误解
关于 MoE 架构,初学者很容易踩两个误区,这里特别指出一下。
- 误解一:以为 “专家” 是按学科分的。很多人以为 MoE 里真有一个 “数学专家”、一个 “历史专家”,其实并非如此。这些 “专家” 是模型在训练中自己摸索着分工出来的,具体哪个专家擅长啥,往往连研究人员也说不清,并不像人类的科室那样泾渭分明。“专家” 只是个方便我们理解的比喻而已。
- 误解二:以为 MoE 既省算力、又省内存。并不是。虽然 MoE 每次只 “算” 一小部分参数(省下的是算力、是速度),但所有专家平时都得 “待在医院里随时候命” ——也就是说,那 6710 亿参数,仍然要被完整地加载进显存里。所以 MoE 省的是 “计算成本”,却并不省 “内存(显存)成本”。

总结一下:MoE 用 “分科室、按需叫人” 这个聪明办法,让大模型在 “脑容量” 和 “运行效率” 之间,找到了一个绝佳的平衡点,这也正是它能成为主流的原因。
不过要注意,MoE 解决的是 “模型本身怎么搭” 的问题。模型搭好了,还得经过 “训练” 才能真正变聪明。从下一节开始,我们就正式踏上大模型的 “修炼之路” 了。
