大模型蒸馏(知识蒸馏)

前面几节,我们介绍了大模型从预训练SFTRLHF 的完整修炼过程。但这么辛苦练出来的顶级大模型,往往有个甜蜜的烦恼——太大了。动辄几千亿参数,跑一次又贵又慢,很多场景(比如手机、便宜的服务器)根本就带不动。

那我们能不能搞一个 “小一号” 的模型,既轻快、又便宜,还差不多聪明呢?当然可以,这就需要用到——大模型蒸馏了。

什么是大模型蒸馏?

大模型蒸馏,其实是日常交流中的一种通俗说法,它在学术界全称是 “知识蒸馏”(Knowledge Distillation,简称 KD)。

“蒸馏” 这个词听着挺玄乎,其实非常简单,你可以理解成: “名师带徒弟” 或 “满级大佬开小号”。知识蒸馏主要包含 2 个核心角色:

  • 教师模型(Teacher Model):相当于一位博学多才的 “老教授”。这就是我们常说的超级大模型(比如拥有数千亿参数的 GPT、Claude 或 DeepSeek)。它极其聪明,但缺点是体量太庞大、运行成本极高、推理速度较慢。
  • 学生模型(Student Model):相当于一个年轻聪明的 “学生”。这是一个参数量小得多(比如只有 7B 或 8B 参数)的模型。它原本的能力比较普通,但它的优点是运行速度极快、部署成本极低(甚至能在普通电脑或手机上运行)。

什么是大模型知识蒸馏?教师大模型 vs 学生小模型

如果只让小模型(学生)自己去看海量的数据自学(从头预训练),它很难学到极高的水平。

“蒸馏”的过程,就是让大模型(老师)手把手教小模型(学生)的过程。在传统的训练中,模型只知道 “标准答案”(比如 1 + 1 = 2)。但在蒸馏过程中,老教授不仅会给出最终答案,还会把自己的 “解题思路” 和 “思考过程” 告诉学生。

我们这样去比喻就很好理解了:学徒想要跟大厨学做菜,其实有两条路。一条是自己埋头啃几千本菜谱、从零摸索(这就相当于从头训练一个大模型,又慢又费时费力);另一条,是让大厨手把手地直接演示,学徒在旁边照着学、跟着模仿。显然第二条路又快又省,学出来的水平还不差。

大模型蒸馏通俗比喻:大厨手把手教 vs 自己摸索

大模型蒸馏,走的就是第二条路:用一个已经很强的 “大模型” 当老师,去教一个 “小模型” 当学生,让小模型去模仿老师的输出,最终用小得多的身材,学到老师大部分的真本事。

大模型蒸馏具体是怎么 “教” 的?

那么,老师到底是怎么把本事传给学生的呢?简单来说,就两步。

  • 第一步,老师出题、给答案。让庞大的教师模型去回答海量的问题,生成大量高质量的标准答案。
  • 第二步,学生照着学。让小小的学生模型,去反复模仿老师的这些回答,直到自己答得越来越像老师为止。

大模型蒸馏的具体教学流程:教师大模型生成标准答案,学生小模型反复模仿学习

这里还有个精妙之处:老师传授的,不只是 “最终答案”,还有它思考时的那份 “分寸感”。比如同一道选择题,老师不光告诉学生 “选 B”,还会顺带透露 “我有 80% 的把握选 B、但 C 也有 15% 的可能”。正是这种带着 “软性判断” 的细腻信息(行话叫 “软标签”),让学生学得比单纯死背标准答案,更扎实、也更聪明。

举个真实的例子:DeepSeek-R1 的 “徒弟们”

一个特别有名的例子,还是 DeepSeek。

大名鼎鼎的推理模型 DeepSeek-R1 本身很大、也很能思考(还记得前面讲过的 “推理模型” 吗?)。于是 DeepSeek 把 R1 这一身推理功夫,蒸馏进了一批小得多的模型里,比如基于 Qwen、Llama 蒸馏出来的 7B、32B 等 “R1 蒸馏版”。

大模型蒸馏真实案例:DeepSeek-R1 推理大模型将能力蒸馏给 7B 和 32B 等小模型的图解

神奇的是,这些小徒弟靠着名师 R1 的真传,在不少推理任务上的表现,竟然能反超那些块头比它们大得多、却没经过这种调教的普通模型。这就是蒸馏的威力——小身材,大能量。

这也解释了一个现象——为什么有些只有几 B 参数、能在你自己电脑上跑的小模型,做起题来却出奇地聪明?很可能,它背后就站着一位被 “蒸馏” 过来的名师。

蒸馏、量化、微调之间的区别

学到这儿,有几个 “听起来都像在改模型” 的词,特别容易让人犯迷糊。我们在这里一次性帮大家理清楚:

  • 蒸馏(本节):用大模型当老师,教出一个全新的、更小的模型。改变的是模型的 “块头”——从大变小。
  • 量化(下一节):不换模型,而是把同一个模型里的参数数字 “压缩、降精度”,让它变得更轻便。
  • 微调(后面章节):也不改块头,而是拿一个现成的模型,喂它一些专业数据,让它在某个特定领域更内行。

一句话区分:蒸馏是 “换一个小个子徒弟”,量化是 “给同一个人减肥瘦身”,微调是 “送同一个人去进修个专业”。

大模型三种优化方式对比:大模型蒸馏、大模型量化、大模型微调

总之,蒸馏让我们能用一个小模型,享受到接近大模型的聪明,是把 AI 装进千家万户(尤其是手机、本地电脑)的关键技术。

大模型之间是否存在相互 “蒸馏”?

很多小伙伴在看新闻资讯的时候,经常会看到一个有意思的地方,比如 “Claude 把 DeepSeek 和 Qwen 给蒸馏了”(如下图所示)。

大模型相互蒸馏现象:Claude 模型接口输出自称是通义千问的 JSON 数据截图,引发其蒸馏 DeepSeek 与中文大模型的争议

然后过了一阵子,又看到:Claude 母公司 Anthropic 控诉深度求索(DeepSeek)、月之暗面(Moonshot AI)和稀宇科技(MiniMax)三家中国AI企业,对其旗下的Claude模型发动了 “工业级蒸馏攻击”(如下图所示)。

大模型蒸馏之战新闻截图:Anthropic 控诉深度求索(DeepSeek)、月之暗面等中国 AI 企业发动工业级蒸馏攻击

实际上,大模型之间不仅存在相互 “蒸馏”,而且这已经是当前 AI 行业内心照不宣的常态和核心技术手段。虽然大家嘴上都不承认,但心里都懂得。

但对于位列全球第一梯队的 “神仙” 选手(如 OpenAI、Anthropic Claude、DeepSeek、Google Gemini)而言,它们的核心竞争力在于独家的底层架构(如混合专家 MoE 的优化)、独有的高质量私有数据,以及极其复杂的强化学习算法(RLHF)。

当然了,从另外一个角度来看:在目前的 AI 生态中,“相互蒸馏” 是技术发展的加速器,尤其是开源小模型对顶级模型的蒸馏,极大地推动了 AI 的普及。

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号