大模型的微调手段,大体可以分成以下 2 类:
- 全量微调:把模型里所有的参数都重新训练一遍。
- 高效微调:更加省钱,更加高效。其中最常用、最有名的,就是下一节要讲的 LoRA 微调。
这一节,咱们先来认识一下最 “豪” 的那一种——全量微调。

什么是全量微调?
所谓的 “全量微调”,其实非常简单,它指的是:把大模型里 “所有的参数”,全部拿出来重新训练一遍。
我们在之前 “大模型参数量” 这一节中说过,大模型的参数量动不动就是几十亿、上百亿(比如 7B 代表 70 亿个参数)。做全量微调时,系统会读取你准备好的成千上万条问答数据集,然后把这 70 亿个参数的 “保护锁” 全部解开。再根据你的数据,把模型内部的每一个参数旋钮都重新算一遍、调一遍。

正因为每一个参数都跟着你的新数据动了,因此全量微调出来的模型,跟你业务的契合度往往是最高的——你给的新技能、新格式、新行业逻辑,它都能吸收得最充分。
这也是为什么金融、医疗这些领域的巨头公司,在不差钱的情况下,仍然愿意砸重金去做全量微调,专门打造 “金融大模型”、“医疗大模型” 的根本原因。
咱们可以把全量微调理解成一次彻底的 “房屋大翻新”:为了把一套毛坯房(通用模型)改造成一间专业的手术室(垂直领域专家),它的做法是把所有墙皮砸掉、管线全刨出来,从里到外完完整整重装一遍。

为什么普通人玩不起 “全量微调”?
虽然全量微调的效果是最好的,但我们并不建议普通开发者去碰它。主要有以下 3 个方面的原因:
1. 高昂的算力与显存成本
大模型平时回答问题(也就是 “推理”)时,需要的显卡内存(显存)其实并不多。比如一个 7B 的模型,大约 8GB 显存就能跑起来。
可一旦要做全量微调,情况就完全不一样了。训练时,显卡里不光要装下这 70 亿个参数,还得同时塞进海量的梯度、优化器状态、中间计算结果等等。
业界有一个常被引用的粗略估算:
全量微调所需要的显存,大约是模型本身大小的 4 到 8 倍
也就是说,哪怕我们只是想全量微调一个最小的 7B 模型,也需要多张昂贵的企业级专业显卡(比如 80GB 显存的 A100 显卡)。光是这笔硬件采购的钱,就直接劝退了 99% 的普通开发者和中小企业。

2. 灾难性遗忘(Catastrophic Forgetting)
这是全量微调在技术上最让人头疼的一个问题。
因为你把几十亿个参数全部打乱重调了,大模型在拼命学习你的新业务知识时,很容易把预训练时学到的通用知识给 “挤掉”。
打个比方,你使用大量的 “写代码” 数据去全量微调它,调完一看,代码能力确实变强了,但它可能连最基本的 “把一段英文翻译成中文” 都不会了。这种捡了芝麻丢了西瓜的现象,在全量微调中是很容易发生的。

3. 存储成本高
当我们跑完全量微调后,系统会吐出一个全新的模型文件。既然是 “全量” 更新,这个新文件的体积和原模型是一样大的(动不动好几十 GB)。
假设你们公司有 5 个不同的业务部门(客服部、法务部、财务部……),然后你需要为它们分别微调 5 个不同的模型。那么你就必须在服务器上保存 5 份几十 GB 的完整大模型文件。这不仅会占用大量硬盘空间,而且在多任务切换、上线部署时也非常笨重。

给开发者的建议
对于咱们普通开发者、或者中小企业的技术负责人来说,在做技术选型时一定要记住一条铁律:
永远不要把 “全量微调” 作为你的首选方案
大模型的全量微调,是 OpenAI、DeepSeek、阿里、腾讯等科技巨头们才玩得起的 “基础设施游戏”。对于绝大多数的商业落地项目来说,全量微调的投入产出比极低,根本就是一笔划不来的买卖。

那么问题来了:既然全量微调又贵又容易忘事,那咱们普通人到底该怎么给大模型做业务定制呢?此时就需要用到下一节介绍的——LoRA 微调技术了。
