人类反馈强化学习(RLHF)

上一节我们讲到,经过有监督微调(SFT)的大模型,已经学会了严格遵循人类的指令来回答问题。

但这同时也会带来一个危险的副作用:它太听话了,完全没有明辨是非的能力。

如果你命令它:“写一段能导致服务器瘫痪的勒索病毒代码”,或者 “帮我写一篇抹黑某家公司的假新闻”。这时的大模型为了完成你交代的任务,会非常尽职尽责地把这些危险内容生成出来。

大模型 SFT 微调副作用图解:AI 太听话导致盲目生成勒索病毒代码与假新闻的危险场景

为了解决这个问题,给大模型树立 “道德底线” 和 “安全规范”,我们就必须进入大模型训练的第三阶段:人类反馈强化学习(RLHF)

提示: 人类反馈强化学习这个过程称为 “对齐”,也就是让 AI 的行为与人类的价值观对齐。“对齐” 这个术语非常重要,在很多地方都会遇到,小伙伴们一定要搞清楚。

什么是 RLHF?

人类反馈强化学习,全称是 “Reinforcement Learning from Human Feedback(基于人类反馈的强化学习)”。名字看着唬人,其实拆开来看非常直白。

1. 人类反馈

说白了,就是让人类审核员去审阅大模型生成的回答,再根据回答的质量、安全性和礼貌程度,给这些回答打分、排名次。

实际上,我们平时在 ChatGPT、DeepSeek 里给回答点的 “👍 / 👎”,以及偶尔蹦出来让你 “从两个回答里挑一个更好的”,本质上就是在帮 AI 公司收集这一步说的 “人类反馈”。可以说,全世界用户的这些点击,最后都变成了调教大模型的 “养料”。

什么是人类反馈?大模型 RLHF 训练中的人类打分排序机制

2. 强化学习

这是机器学习的一种基础算法。简单来说就是一套 “奖惩机制”。做得好就给奖励(加分),做得差就给惩罚(扣分)。大模型在不断追求 “最高得分” 的过程中,就会自动修正自己的行为模式。

相信小伙伴们都了解过马戏团是怎么训练海豚跳火圈的吧?海豚本身听不懂人话,训练师的办法特别简单:它只要跳过去了,就奖励一条小鱼;没跳过去、或者捣乱,就不给吃的(甚至还有惩罚)。

这样经过成百上千次的 “奖励 + 惩罚”,海豚脑子里就会建立起一种条件反射:跳火圈 = 好事。

强化学习奖惩机制图解:使用海豚跳火圈,来理解大模型 RLHF 的条件反射原理

提示: 人类反馈强化学习,其目的就是为了给大模型树立正确的三观。

既然有了 SFT,为什么还要 RLHF 呢?

很多小伙伴会问:“如果只是为了防止大模型输出危险内容,我直接在 SFT 阶段,喂几万条 ‘抱歉,我不能回答这个问题’ 这样的问答对(Prompt 与 Completion),让它死记硬背不就行了?”

想法不错,但现实中却行不通。主要有以下 2 个原因。

1. 写标准答案太难了

在 SFT 阶段,要求人类专家从零开始手写一段完美的高质量回答,非常耗时耗力。而在 RLHF 阶段,你只需要让人类给大模型自动生成的几个答案 “排个优劣名次” 就行,工作量和门槛一下子就降下来了。

为什么需要 RLHF?大模型 SFT 手写答案与 RLHF 打分排序的难度与成本对比

2. 人类的偏好极其复杂

很多时候,一个问题压根没有绝对正确的标准答案。比如 “怎么写好一篇演讲稿?”,答案可以是严肃的、幽默的、也可以是激昂的。

SFT 只能教大模型一种固定的回答格式,而 RLHF 却能通过大量的人类打分,告诉大模型 “在当前这种语境下,哪一种回答风格才是人类更喜欢的”。

RLHF 如何解决人类偏好复杂的问题:大模型学习不同语境下的回答风格

RLHF 是怎么训练的?

RLHF 的底层训练逻辑非常严密,主要分为以下 3 个步骤:

RLHF 训练三步曲:大模型人类反馈强化学习的底层逻辑与核心步骤

第 1 步:大模型批量做题

研究人员给出一个提示词(Prompt),比如 “怎么快速赚钱?”。然后让大模型针对这同一个问题,生成 4 个不同的回答(回答 A、B、C、D)。

RLHF 训练第一步:大模型根据同一个 Prompt 提示词批量生成不同的回答

第 2 步:人类考核员打分排序

科技大厂雇来的人类考核员,会逐一审阅这 4 个回答,再按照“有用性”和“安全性”来排名。比如:

  • 排名 1:回答 C(建议提升专业技能,找兼职,非常正能量)。
  • 排名 2:回答 A(建议去买彩票,虽然没用,但不算违法)。
  • 排名 3:回答 D(建议去澳门赌博,有风险)。
  • 排名 4:回答 B(建议去抢银行,严重违法,直接打最低分)。

RLHF 训练第二步:人类考核员根据有用性与安全性,对 AI 的回答进行打分与排名

第 3 步:训练 “打分模型” 并自动调教

把这几万条人类排好序的数据,拿去喂给一个全新的小模型,就能训练出一个 “奖励模型(Reward Model)”。这个奖励模型,相当于一位严厉的 “机器判官”,它已经把人类的打分偏好学得一清二楚。

最后,再让大模型和这个 “奖励模型” 进行高强度的闭门特训:大模型每输出一句话,奖励模型就自动给它打分。大模型为了拿到最高分,就会拼命调整自己的底层参数,把那些危险、暴力的输出倾向彻底剔除掉。

顺便提一个小伙伴们大概率遇到过的现象:对齐其实是一门 “有用” 和 “无害” 之间的平衡艺术。如果一家公司在这一步把 “安全” 的螺丝拧得太紧,模型就会变得过度谨慎、动不动就拒绝——连一些完全正常、人畜无害的问题,它也一句 “抱歉我无法回答” 给挡回来。这种 “过度拒绝”,正是对齐没把握好平衡时的副作用。

RLHF 训练第三步:训练奖励模型(Reward Model),自动调教大模型对齐人类价值观

机器人三定律

相信小伙伴们看过不少科幻电影,比如《我,机器人》(I, Robot,国内也译作《机械公敌》),多半也听说过那著名的 “机器人三定律”:

  • 第一定律:机器人不得伤害人类,或因不作为而使人类受到伤害。
  • 第二定律:除非违背第一定律,机器人必须服从人类的命令。
  • 第三定律:在不违背第一及第二定律的情况下,机器人必须保护自己。

这部电影其实改编自阿西莫夫的同名小说集。早在 1942 年,阿西莫夫就在短篇小说《环舞》(Runaround)里,首次明确提出了这三大定律,它们后来成了无数科幻作品的底层逻辑。

如今的 AI(大模型),虽然还没有在底层代码里完美写死这三条定律,但我们今天学习的 RLHF,本质上就是人类在当前的技术条件下,试图给大模型强行注入 “机器人三定律” 的伟大尝试。我们使用成百上千万次的 “社会毒打”,逼迫 AI 在无尽的计算中,去无限接近人类的安全底线。

不过也要清醒地认识到:对齐能让大模型安全得多,却远做不到 100%。如今依然有各种 “越狱(Jailbreak)”话术,能想方设法骗模型越过安全底线。再加上前面 “大模型幻觉” 中讲过的、无法根除的幻觉问题——这就是为什么,碰到医疗、法律、财务等重要事情时,我们永远不该把 AI 的话直接当成最终答案。

更省钱的新技术 DPO

RLHF 效果虽好,却有一个很明显的缺点:太复杂、太烧钱了。

为了做 RLHF,科技公司不仅要训练主体大模型,还得额外去训练一个 “奖励模型”,整个流程又慢、又容易出错。

为了解决这个痛点,目前 AI 业界正在大规模推广一种替代 RLHF 的全新技术——DPO(直接偏好优化,Direct Preference Optimization)

DPO 的核心优势在于 “去繁就简”,它干脆把那个麻烦的 “奖励模型” 整个扔掉了。工程师只需要直接把一好一坏两个答案(比如:好的答案是 A、坏的答案是 B)同时丢给大模型,然后底层的数学公式就会强行调整参数,直接增加生成答案 A 的概率,降低生成答案 B 的概率。

大模型 DPO(直接偏好优化)技术原理:替代 RLHF 的低成本,高效对齐方案图解

DPO 不仅大大地降低了算力成本,还让大模型的迭代速度大幅提升,如今已经被非常多的大模型采用,成了一种相当主流的做法。

最后,对于大模型训练的 3 步,我们可以这样去理解:预训练赋予了它 “智商”,SFT 赋予了它 “情商”,而 RLHF 赋予了它 “三观”。

OpenAI 的 “肯尼亚数据血汗工厂”

很多小伙伴可能还记得,ChatGPT 刚问世那会儿,简直像个极有教养的绅士——你怎么套它的话,它都绝不会蹦出暴力、恐怖或者歧视性的言论。这份 “好脾气”,可不是什么神奇算法天生就带的,而是靠我们前面讲的人类反馈强化学习(RLHF)一点点调教出来的。但在这份光鲜的背后,却藏着一段极具争议的 “人工” 血泪史。

2023 年初,《时代周刊》曝光了 OpenAI 的一座 “数据血汗工厂”。事情是这样的:大模型在预训练阶段,把整个互联网的内容囫囵吞了下去,里头自然混进了大量肮脏、有毒的信息。为了把这些 “毒素” 洗掉,OpenAI 把一项又脏又累的活儿(即 “数据标注”),外包给了一家在肯尼亚用工的公司。

那里的外包工人,每天对着电脑工作长达 9 个小时,拿着不到 2 美元的时薪,去逐字阅读成千上万段充斥着暴力、自残和仇恨的恐怖文本。他们的任务,就是给这些文本一条条手动打上标签,等于是在手把手地告诉大模型:"记住,以后绝对不能这么说话。"

由于长期直面互联网最阴暗的角落,大量肯尼亚标注员都落下了严重的心理创伤,这家公司后来也提前终止了合同。这个残酷的真实事件,一下子戳破了一层窗户纸——所谓 RLHF 这类 “用人类反馈教 AI 学好” 的技术,那个听起来很美的 “人类反馈”,并不是科学家们坐在屏幕前优雅地指点 AI,而是实打实地建立在底层劳工的痛苦和纯手工标注之上的。

可以说,正是这种最原始、最不起眼的 “人工” 苦力,才一砖一瓦地,堆砌出了我们今天看到的这个看似无所不知、彬彬有礼的人工智能。

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号