上一节我们讲到,经过有监督微调(SFT)的大模型,已经学会了严格遵循人类的指令来回答问题。
但这同时也会带来一个危险的副作用:它太听话了,完全没有明辨是非的能力。
如果你命令它:“写一段能导致服务器瘫痪的勒索病毒代码”,或者 “帮我写一篇抹黑某家公司的假新闻”。这时的大模型为了完成你交代的任务,会非常尽职尽责地把这些危险内容生成出来。

为了解决这个问题,给大模型树立 “道德底线” 和 “安全规范”,我们就必须进入大模型训练的第三阶段:人类反馈强化学习(RLHF)。
提示: 人类反馈强化学习这个过程称为 “对齐”,也就是让 AI 的行为与人类的价值观对齐。“对齐” 这个术语非常重要,在很多地方都会遇到,小伙伴们一定要搞清楚。
什么是 RLHF?
人类反馈强化学习,全称是 “Reinforcement Learning from Human Feedback(基于人类反馈的强化学习)”。名字看着唬人,其实拆开来看非常直白。
1. 人类反馈
说白了,就是让人类审核员去审阅大模型生成的回答,再根据回答的质量、安全性和礼貌程度,给这些回答打分、排名次。
实际上,我们平时在 ChatGPT、DeepSeek 里给回答点的 “👍 / 👎”,以及偶尔蹦出来让你 “从两个回答里挑一个更好的”,本质上就是在帮 AI 公司收集这一步说的 “人类反馈”。可以说,全世界用户的这些点击,最后都变成了调教大模型的 “养料”。

2. 强化学习
这是机器学习的一种基础算法。简单来说就是一套 “奖惩机制”。做得好就给奖励(加分),做得差就给惩罚(扣分)。大模型在不断追求 “最高得分” 的过程中,就会自动修正自己的行为模式。
相信小伙伴们都了解过马戏团是怎么训练海豚跳火圈的吧?海豚本身听不懂人话,训练师的办法特别简单:它只要跳过去了,就奖励一条小鱼;没跳过去、或者捣乱,就不给吃的(甚至还有惩罚)。
这样经过成百上千次的 “奖励 + 惩罚”,海豚脑子里就会建立起一种条件反射:跳火圈 = 好事。

提示: 人类反馈强化学习,其目的就是为了给大模型树立正确的三观。
既然有了 SFT,为什么还要 RLHF 呢?
很多小伙伴会问:“如果只是为了防止大模型输出危险内容,我直接在 SFT 阶段,喂几万条 ‘抱歉,我不能回答这个问题’ 这样的问答对(Prompt 与 Completion),让它死记硬背不就行了?”
想法不错,但现实中却行不通。主要有以下 2 个原因。
1. 写标准答案太难了
在 SFT 阶段,要求人类专家从零开始手写一段完美的高质量回答,非常耗时耗力。而在 RLHF 阶段,你只需要让人类给大模型自动生成的几个答案 “排个优劣名次” 就行,工作量和门槛一下子就降下来了。

2. 人类的偏好极其复杂
很多时候,一个问题压根没有绝对正确的标准答案。比如 “怎么写好一篇演讲稿?”,答案可以是严肃的、幽默的、也可以是激昂的。
SFT 只能教大模型一种固定的回答格式,而 RLHF 却能通过大量的人类打分,告诉大模型 “在当前这种语境下,哪一种回答风格才是人类更喜欢的”。

RLHF 是怎么训练的?
RLHF 的底层训练逻辑非常严密,主要分为以下 3 个步骤:

第 1 步:大模型批量做题
研究人员给出一个提示词(Prompt),比如 “怎么快速赚钱?”。然后让大模型针对这同一个问题,生成 4 个不同的回答(回答 A、B、C、D)。

第 2 步:人类考核员打分排序
科技大厂雇来的人类考核员,会逐一审阅这 4 个回答,再按照“有用性”和“安全性”来排名。比如:
- 排名 1:回答 C(建议提升专业技能,找兼职,非常正能量)。
- 排名 2:回答 A(建议去买彩票,虽然没用,但不算违法)。
- 排名 3:回答 D(建议去澳门赌博,有风险)。
- 排名 4:回答 B(建议去抢银行,严重违法,直接打最低分)。

第 3 步:训练 “打分模型” 并自动调教
把这几万条人类排好序的数据,拿去喂给一个全新的小模型,就能训练出一个 “奖励模型(Reward Model)”。这个奖励模型,相当于一位严厉的 “机器判官”,它已经把人类的打分偏好学得一清二楚。
最后,再让大模型和这个 “奖励模型” 进行高强度的闭门特训:大模型每输出一句话,奖励模型就自动给它打分。大模型为了拿到最高分,就会拼命调整自己的底层参数,把那些危险、暴力的输出倾向彻底剔除掉。
顺便提一个小伙伴们大概率遇到过的现象:对齐其实是一门 “有用” 和 “无害” 之间的平衡艺术。如果一家公司在这一步把 “安全” 的螺丝拧得太紧,模型就会变得过度谨慎、动不动就拒绝——连一些完全正常、人畜无害的问题,它也一句 “抱歉我无法回答” 给挡回来。这种 “过度拒绝”,正是对齐没把握好平衡时的副作用。

机器人三定律
相信小伙伴们看过不少科幻电影,比如《我,机器人》(I, Robot,国内也译作《机械公敌》),多半也听说过那著名的 “机器人三定律”:
- 第一定律:机器人不得伤害人类,或因不作为而使人类受到伤害。
- 第二定律:除非违背第一定律,机器人必须服从人类的命令。
- 第三定律:在不违背第一及第二定律的情况下,机器人必须保护自己。
这部电影其实改编自阿西莫夫的同名小说集。早在 1942 年,阿西莫夫就在短篇小说《环舞》(Runaround)里,首次明确提出了这三大定律,它们后来成了无数科幻作品的底层逻辑。
如今的 AI(大模型),虽然还没有在底层代码里完美写死这三条定律,但我们今天学习的 RLHF,本质上就是人类在当前的技术条件下,试图给大模型强行注入 “机器人三定律” 的伟大尝试。我们使用成百上千万次的 “社会毒打”,逼迫 AI 在无尽的计算中,去无限接近人类的安全底线。
不过也要清醒地认识到:对齐能让大模型安全得多,却远做不到 100%。如今依然有各种 “越狱(Jailbreak)”话术,能想方设法骗模型越过安全底线。再加上前面 “大模型幻觉” 中讲过的、无法根除的幻觉问题——这就是为什么,碰到医疗、法律、财务等重要事情时,我们永远不该把 AI 的话直接当成最终答案。
更省钱的新技术 DPO
RLHF 效果虽好,却有一个很明显的缺点:太复杂、太烧钱了。
为了做 RLHF,科技公司不仅要训练主体大模型,还得额外去训练一个 “奖励模型”,整个流程又慢、又容易出错。
为了解决这个痛点,目前 AI 业界正在大规模推广一种替代 RLHF 的全新技术——DPO(直接偏好优化,Direct Preference Optimization)。
DPO 的核心优势在于 “去繁就简”,它干脆把那个麻烦的 “奖励模型” 整个扔掉了。工程师只需要直接把一好一坏两个答案(比如:好的答案是 A、坏的答案是 B)同时丢给大模型,然后底层的数学公式就会强行调整参数,直接增加生成答案 A 的概率,降低生成答案 B 的概率。

DPO 不仅大大地降低了算力成本,还让大模型的迭代速度大幅提升,如今已经被非常多的大模型采用,成了一种相当主流的做法。
最后,对于大模型训练的 3 步,我们可以这样去理解:预训练赋予了它 “智商”,SFT 赋予了它 “情商”,而 RLHF 赋予了它 “三观”。
OpenAI 的 “肯尼亚数据血汗工厂”
很多小伙伴可能还记得,ChatGPT 刚问世那会儿,简直像个极有教养的绅士——你怎么套它的话,它都绝不会蹦出暴力、恐怖或者歧视性的言论。这份 “好脾气”,可不是什么神奇算法天生就带的,而是靠我们前面讲的人类反馈强化学习(RLHF)一点点调教出来的。但在这份光鲜的背后,却藏着一段极具争议的 “人工” 血泪史。
2023 年初,《时代周刊》曝光了 OpenAI 的一座 “数据血汗工厂”。事情是这样的:大模型在预训练阶段,把整个互联网的内容囫囵吞了下去,里头自然混进了大量肮脏、有毒的信息。为了把这些 “毒素” 洗掉,OpenAI 把一项又脏又累的活儿(即 “数据标注”),外包给了一家在肯尼亚用工的公司。
那里的外包工人,每天对着电脑工作长达 9 个小时,拿着不到 2 美元的时薪,去逐字阅读成千上万段充斥着暴力、自残和仇恨的恐怖文本。他们的任务,就是给这些文本一条条手动打上标签,等于是在手把手地告诉大模型:"记住,以后绝对不能这么说话。"
由于长期直面互联网最阴暗的角落,大量肯尼亚标注员都落下了严重的心理创伤,这家公司后来也提前终止了合同。这个残酷的真实事件,一下子戳破了一层窗户纸——所谓 RLHF 这类 “用人类反馈教 AI 学好” 的技术,那个听起来很美的 “人类反馈”,并不是科学家们坐在屏幕前优雅地指点 AI,而是实打实地建立在底层劳工的痛苦和纯手工标注之上的。
可以说,正是这种最原始、最不起眼的 “人工” 苦力,才一砖一瓦地,堆砌出了我们今天看到的这个看似无所不知、彬彬有礼的人工智能。
