前面几节,我们介绍了大模型从预训练、SFT 到 RLHF 的完整修炼过程。但这么辛苦练出来的顶级大模型,往往有个甜蜜的烦恼——太大了。动辄几千亿参数,跑一次又贵又慢,很多场景(比如手机、便宜的服务器)根本就带不动。
那我们能不能搞一个 “小一号” 的模型,既轻快、又便宜,还差不多聪明呢?当然可以,这就需要用到——大模型蒸馏了。
什么是大模型蒸馏?
大模型蒸馏,其实是日常交流中的一种通俗说法,它在学术界全称是 “知识蒸馏”(Knowledge Distillation,简称 KD)。
“蒸馏” 这个词听着挺玄乎,其实非常简单,你可以理解成: “名师带徒弟” 或 “满级大佬开小号”。知识蒸馏主要包含 2 个核心角色:
- 教师模型(Teacher Model):相当于一位博学多才的 “老教授”。这就是我们常说的超级大模型(比如拥有数千亿参数的 GPT、Claude 或 DeepSeek)。它极其聪明,但缺点是体量太庞大、运行成本极高、推理速度较慢。
- 学生模型(Student Model):相当于一个年轻聪明的 “学生”。这是一个参数量小得多(比如只有 7B 或 8B 参数)的模型。它原本的能力比较普通,但它的优点是运行速度极快、部署成本极低(甚至能在普通电脑或手机上运行)。

如果只让小模型(学生)自己去看海量的数据自学(从头预训练),它很难学到极高的水平。
“蒸馏”的过程,就是让大模型(老师)手把手教小模型(学生)的过程。在传统的训练中,模型只知道 “标准答案”(比如 1 + 1 = 2)。但在蒸馏过程中,老教授不仅会给出最终答案,还会把自己的 “解题思路” 和 “思考过程” 告诉学生。
我们这样去比喻就很好理解了:学徒想要跟大厨学做菜,其实有两条路。一条是自己埋头啃几千本菜谱、从零摸索(这就相当于从头训练一个大模型,又慢又费时费力);另一条,是让大厨手把手地直接演示,学徒在旁边照着学、跟着模仿。显然第二条路又快又省,学出来的水平还不差。

大模型蒸馏,走的就是第二条路:用一个已经很强的 “大模型” 当老师,去教一个 “小模型” 当学生,让小模型去模仿老师的输出,最终用小得多的身材,学到老师大部分的真本事。
大模型蒸馏具体是怎么 “教” 的?
那么,老师到底是怎么把本事传给学生的呢?简单来说,就两步。
- 第一步,老师出题、给答案。让庞大的教师模型去回答海量的问题,生成大量高质量的标准答案。
- 第二步,学生照着学。让小小的学生模型,去反复模仿老师的这些回答,直到自己答得越来越像老师为止。

这里还有个精妙之处:老师传授的,不只是 “最终答案”,还有它思考时的那份 “分寸感”。比如同一道选择题,老师不光告诉学生 “选 B”,还会顺带透露 “我有 80% 的把握选 B、但 C 也有 15% 的可能”。正是这种带着 “软性判断” 的细腻信息(行话叫 “软标签”),让学生学得比单纯死背标准答案,更扎实、也更聪明。
举个真实的例子:DeepSeek-R1 的 “徒弟们”
一个特别有名的例子,还是 DeepSeek。
大名鼎鼎的推理模型 DeepSeek-R1 本身很大、也很能思考(还记得前面讲过的 “推理模型” 吗?)。于是 DeepSeek 把 R1 这一身推理功夫,蒸馏进了一批小得多的模型里,比如基于 Qwen、Llama 蒸馏出来的 7B、32B 等 “R1 蒸馏版”。

神奇的是,这些小徒弟靠着名师 R1 的真传,在不少推理任务上的表现,竟然能反超那些块头比它们大得多、却没经过这种调教的普通模型。这就是蒸馏的威力——小身材,大能量。
这也解释了一个现象——为什么有些只有几 B 参数、能在你自己电脑上跑的小模型,做起题来却出奇地聪明?很可能,它背后就站着一位被 “蒸馏” 过来的名师。
蒸馏、量化、微调之间的区别
学到这儿,有几个 “听起来都像在改模型” 的词,特别容易让人犯迷糊。我们在这里一次性帮大家理清楚:
- 蒸馏(本节):用大模型当老师,教出一个全新的、更小的模型。改变的是模型的 “块头”——从大变小。
- 量化(下一节):不换模型,而是把同一个模型里的参数数字 “压缩、降精度”,让它变得更轻便。
- 微调(后面章节):也不改块头,而是拿一个现成的模型,喂它一些专业数据,让它在某个特定领域更内行。
一句话区分:蒸馏是 “换一个小个子徒弟”,量化是 “给同一个人减肥瘦身”,微调是 “送同一个人去进修个专业”。

总之,蒸馏让我们能用一个小模型,享受到接近大模型的聪明,是把 AI 装进千家万户(尤其是手机、本地电脑)的关键技术。
大模型之间是否存在相互 “蒸馏”?
很多小伙伴在看新闻资讯的时候,经常会看到一个有意思的地方,比如 “Claude 把 DeepSeek 和 Qwen 给蒸馏了”(如下图所示)。

然后过了一阵子,又看到:Claude 母公司 Anthropic 控诉深度求索(DeepSeek)、月之暗面(Moonshot AI)和稀宇科技(MiniMax)三家中国AI企业,对其旗下的Claude模型发动了 “工业级蒸馏攻击”(如下图所示)。

实际上,大模型之间不仅存在相互 “蒸馏”,而且这已经是当前 AI 行业内心照不宣的常态和核心技术手段。虽然大家嘴上都不承认,但心里都懂得。
但对于位列全球第一梯队的 “神仙” 选手(如 OpenAI、Anthropic Claude、DeepSeek、Google Gemini)而言,它们的核心竞争力在于独家的底层架构(如混合专家 MoE 的优化)、独有的高质量私有数据,以及极其复杂的强化学习算法(RLHF)。
当然了,从另外一个角度来看:在目前的 AI 生态中,“相互蒸馏” 是技术发展的加速器,尤其是开源小模型对顶级模型的蒸馏,极大地推动了 AI 的普及。
