刚刚搭好 Transformer 架构的大模型,这时候还只是个刚出生的婴儿,大脑一片空白,连一个字、一个单词都不认识。
那么,OpenAI、Google 以及国内的各大 AI 巨头们,到底是做了什么,才能把这个 “新生婴儿”,一步步养成了无所不知的 “超级学霸” 呢?
其实,大模型的炼成之路,和咱们人的成长之路差不多,都得经历 3 个残酷又烧钱的阶段:
- 预训练(Pre-training):九年义务教育。
- 有监督微调(SFT):一对一的职场培训。
- 人类反馈强化学习(RLHF):三观树立的社会毒打。

第一阶段:预训练(Pre-training)
核心任务:疯狂阅读、疯狂吸收,学会 “文字接龙” 的底层规律。
训练过程:研究人员会把全网能找到的高质量文字(比如维基百科、新闻、GitHub代码库、电子书等)全部打包,一股脑塞进大模型的脑子里。
它唯一的学习方式,就是 “猜下一个词”。它会不停地猜,猜错了就回头调整底层的参数,如此循环往复,直到把全人类语言的逻辑和通用知识都摸得滚瓜烂熟。
成果与代价:这一步极其烧钱,动不动就要几万张顶级显卡(GPU)连续跑上好几个月,烧掉数千万美元。熬过这一步,大模型才算顺利毕业,业界称它为 “底座模型(Base Model)”。
致命缺陷:这时的底座模型虽然知识渊博,却根本不懂什么叫 “聊天”。你要是问它 “中国的首都是哪里?”,它多半不会乖乖回答 “北京”,而是顺着你的语感往下接龙:“美国的首都是哪里?英国的首都是哪里?”——因为此刻的它,只学会了概率接龙,还压根听不懂人类的提问。
预训练这一步,也正是 “涌现能力” 里讲的 “参数跨过临界点” 发生的地方——正是靠着海量的数据,加上巨大的参数量,那些没人专门教过的新能力,才会在这一阶段悄悄 “冒” 出来。

第二阶段:有监督微调(SFT)
核心任务:学会听懂人类的指令,并给出对应的回答。
训练过程:科技巨头公司会雇佣大量人类专家,手工编写成千上万个高质量的问答对(Prompt 与 Completion)。比如明确告诉大模型:如果提示词是 “帮我写一封向老板请病假的邮件”,你必须直接输出邮件正文,而不是反问 “你要请几天病假?”。这就相当于给刚入职的大学生做一对一的岗前培训,教它学会执行任务、给出结果。
核心成果:这个过程在业界被称为 “有监督微调(SFT)”。搞定这一步,大模型就彻底脱胎换骨,从一个死记硬背的 “书呆子”,变成了听得懂人话、能干活的 “实习生”。

Base 模型与 Instruct 模型(开发者必看)
如果小伙伴们以后去开源社区(如 Hugging Face)下载大模型,会发现同一个模型通常会有两个版本,比如 Llama-3-8B-Base 和 Llama-3-8B-Instruct。
- Base 版:指的是只完成了第一阶段 “预训练” 的底座模型。如果你下载了它,它只会疯狂地跟你玩 “文字接龙”,根本不会正经回答你的问题。
- Instruct 版(或 Chat 版):指的是完成了第二阶段 “微调(SFT)” 甚至第三阶段强化学习的对话模型。这才是我们平时用来当客服、当助手、帮你写代码的那个形态。
因此,我们在下载模型部署时,一定要认准带有 Instruct 或 Chat 后缀的版本。
第三阶段:人类反馈强化学习(RLHF)
核心任务:懂礼貌、知底线,和人类的价值观完美 “对齐(Alignment)”。
训练过程:这个 “实习生” 虽然会干活了,但有时候说话不知轻重。要是有人不怀好意地问它“怎么制造炸药?”,它可能真的会毫无保留地把化学配方写出来——这就太危险了。
于是,研究人员引入了最后一步——人类反馈强化学习(RLHF)。大模型每给出一个回答,人类考核员就会给它打分:回答得安全、礼貌、有帮助,就给个“赞”(奖励);要是回答了违禁内容、或者出现了严重的 “幻觉”,就狠狠给个 “踩”(惩罚)。
核心成果:经过千万次这样的奖惩调教,大模型终于被驯化得服服帖帖,变成了一个情商更高、回答也更安全、更有分寸的 AI 助手。
第三阶段的 “对齐”,也是导致不同公司的大模型 “性格” 各不相同的根本原因——有的更活泼、有的更谨慎、有的对某些问题特别容易拒绝。因为每一家在这一步定的 “奖惩标准”,本来就不一样。

直接偏好优化(DPO)
由于 RLHF 需要一支非常庞大的人工打分团队,成本高得吓人。在目前最新的大模型前沿研发中,研究者们正在大面积推广一种叫 “DPO(直接偏好优化)” 的新技术。
它相当于跳过了繁琐的打分环节,改成直接给模型两份回答(一份好、一份坏),让它自己去对比、去揣摩“人类更偏爱哪一个”。相信小伙伴们在用 ChatGPT、Gemini 时,也碰到过让你从两个答案里挑一个的情况。
DPO 这门技术不仅极大地降低了训练成本,还让大模型的迭代速度变得越来越快。
简单来说,大模型的训练过程,就像是一部学霸的进化史。
