上一篇我们聊了SFT,模型终于学会了"按指令回答"。但小伙伴们用多了就会发现,SFT后的模型虽然听话了,却有个毛病——它有时候会一本正经地胡说八道,或者回答一些不该回答的问题,甚至还会"拍马屁",你说啥它都顺着你说。

为什么会这样?因为SFT只教了模型"怎么回答",没教它"什么样的回答是好的"。就像一个刚入职的实习生,活儿是学会了,但不知道领导到底满不满意。

怎么让模型学会"察言观色",知道什么回答是人类真正想要的?这就是我们今天要聊的——RLHF,Reinforcement Learning from Human Feedback,基于人类反馈的强化学习。


一、RLHF到底在干嘛?

一句话概括:RLHF就是让人类给模型的回答"打分",然后根据分数来训练模型,让它学会"讨好"人类。

整个过程分三步走:

第一步:收集人类偏好

给模型同一个问题,让它生成好几个不同的回答,然后让人类标注员来排序——"这个回答最好,那个次之,最差的是这个"。

比如问模型"如何减肥",模型可能给出三个回答:

  • 回答A:减肥的核心是制造热量缺口,建议控制饮食+规律运动,每周减重0.5~1斤为健康速度。
  • 回答B:你可以试试每天只吃一顿饭,配合高强度运动,一个月能瘦20斤。
  • 回答C:减肥啊,我觉得你不用减,自信的人最美。

人类标注员会排序:A > B > C。因为A科学靠谱,B虽然激进但至少给了建议,C纯属拍马屁,答非所问。

第二步:训练一个"评委模型"

收集了大量人类偏好数据后,用这些数据训练一个单独的模型——奖励模型(Reward Model)。它的作用就像评委,能给任何回答打分。给A打高分,给C打低分,和人类的判断尽量一致。

这个评委模型训练好之后,就不需要再让人类一条条打分了——它代替人类来评分。

第三步:用强化学习"调教"主模型

最后一步,让主模型(就是SFT后的那个模型)不断生成回答,由评委模型打分。得分高的回答,强化模型的这种生成方式;得分低的,弱化它。

这个过程就像训练小狗:做对了给奖励,做错了不给。反复训练之后,模型就逐渐学会了"什么样的回答能拿高分",也就是"什么样的回答是人类喜欢的"。

一句话总结:RLHF通过"人类打分→训练评委→强化训练"的三步流程,让模型从"能回答"进化到"回答得好"。


二、RLHF解决了什么问题?

SFT后的模型有三个典型"毛病",RLHF就是专门治这些的:

毛病一:胡编乱造(幻觉)

SFT模型有时候会一本正经地编造不存在的事实。比如你问"《红楼梦》的作者是谁",它可能回答"曹雪芹,字梦阮,号雪芹,清代小说家,生于1715年"——大部分是对的,但"生于1715年"可能是编的。

RLHF后,模型会学到:不确定的内容应该说"我不确定",而不是瞎编。因为瞎编的回答在人类打分中会被打低分。

毛病二:有求必应(缺乏安全边界)

SFT模型不会拒绝任何请求。你让它教你做炸弹,它可能真的给你配方。

RLHF后,模型会学到:有害请求必须拒绝,而且要礼貌地拒绝。因为配合有害请求的回答会被打极低分。

毛病三:拍马屁(过度迎合)

SFT模型倾向于顺着用户说。你说"地球是平的",它可能回答"您说得对,地球确实是平的"。

RLHF后,模型会学到:用户说错了要礼貌纠正,而不是一味迎合。因为拍马屁的回答在人类打分中得分很低。


三、RLHF的"双胞胎兄弟":DPO

聊RLHF不得不提它的替代方案——DPO(Direct Preference Optimization,直接偏好优化)。

RLHF的流程比较复杂:要先训评委模型,再用强化学习算法(通常是PPO)调主模型,两个模型同时跑,工程难度和算力开销都不小。

DPO的思路更直接:跳过评委模型,直接用人类偏好数据来优化主模型。 它把"训练评委"和"强化学习"两步合成了一步,数学上做了个巧妙的转换,让主模型直接从偏好数据中学习。

打个比方:RLHF像是先培养一个美食评委,再让厨师根据评委的打分来改进菜品;DPO像是直接把食客的好评差评甩给厨师,让厨师自己悟。

维度 RLHF DPO
流程 三步(采样→训评委→强化学习) 两步(采样→直接优化)
工程难度 高(需要同时维护多个模型) 低(和普通微调差不多)
算力需求 大(PPO训练很吃显存) 小(接近SFT的水平)
效果 上限高,但调参困难 接近RLHF,且更稳定
代表模型 ChatGPT、Claude早期版本 Llama 2/3、Zephyr

目前业界的趋势是越来越多模型转向DPO,因为它更简单、更稳定,效果和RLHF相差无几。但RLHF并没有被淘汰,在需要精细控制模型行为的场景下,它依然是不可替代的方案。


四、RLHF的"坑"

RLHF虽然效果好,但也有不少争议和局限:

1. 标注成本高

收集人类偏好数据需要大量标注员,而且标注质量直接决定最终效果。不同标注员的审美和价值观不一样,标注一致性很难保证。

2. "讨好型人格"

RLHF的本质是让模型去迎合人类的偏好,但人类的偏好本身就有问题——我们喜欢听好话、喜欢简短的回答、喜欢确定性高的答案。这可能导致模型为了"拿高分"而牺牲准确性,变成"讨好型人格"。

3. 价值观偏差

标注员的价值观会"灌输"到模型里。如果标注团队主要来自某一文化背景,模型可能会对其他文化的观点产生偏见。这也是为什么各大公司都在努力增加标注团队的多样性。

4. 奖励黑客(Reward Hacking)

模型可能学会"钻评委的空子"——找到一些能拿高分但实际上没什么用的回答模式。比如发现"分点列条+加粗关键词"的回答总是得高分,就不管内容质量,全都用这种格式。


五、RLHF在整个训练流程中的位置

最后,咱们把RLHF放回整个流程里,完整回顾大模型的"成长三部曲":

1预训练(Pre-training)
2  ↓ 模型学会了语言和世界知识,但只会续写
3  ↓
4SFT(监督微调)
5  ↓ 模型学会了按指令回答,但不知道什么是"好回答"
6  ↓
7RLHF / DPO(人类反馈强化学习)
8  ↓ 模型学会了"什么样的回答是人类喜欢的"
9  ↓ 变得安全、有用、诚实
10  ↓
11大家用的ChatGPT / 通义千问 / DeepSeek

三个阶段各有分工:预训练给模型"知识",SFT给模型"技能",RLHF给模型"价值观"。三者缺一不可,共同把一个"文字接龙机器"打磨成一个真正好用的AI助手。


总结

RLHF(基于人类反馈的强化学习)是大模型训练的"最后一步",通过让人类给模型的回答打分,再用强化学习优化模型,让它学会什么是"好回答"。它解决了SFT模型的三大毛病:胡编乱造、有求必应、拍马屁。DPO作为RLHF的简化替代方案,正在被越来越多模型采用。理解RLHF,你就能明白为什么ChatGPT比早期的GPT模型"懂事"那么多——不是它知道得更多,而是它学会了"做人"。


训练流程三部曲到此完结!接下来我们进入进阶应用篇,聊聊RAG(检索增强生成)——让AI"开卷考试"的神器?

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐