什么是 RLHF?
RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)是一种训练大语言模型的核心技术:先让人类对模型的多个回答进行排序和偏好标注,再用这些数据训练一个「奖励模型」,最后通过强化学习算法引导大模型生成更符合人类期望的回答。
打个比方:大模型刚完成预训练时,像一个博览群书却「不懂人情世故」的学霸——知识渊博,但可能答非所问、编造事实,甚至输出有害内容。RLHF 就像教练调教运动员,把这座知识金山打磨成一个有用、诚实、无害的 AI 助手。2022 年 ChatGPT 的惊艳亮相,正是 RLHF 走向成熟的标志。
RLHF 是怎么运作的?
完整的 RLHF 通常分三步走:
第一步:监督微调(SFT)打底
收集人类撰写的高质量「问题—回答」对,对预训练模型做微调,让它先学会对话的基本格式与语气。此时模型像个刚上岗的学徒:会说话了,但还分不清回答的好坏。
第二步:训练奖励模型(RM)当裁判
让模型对同一问题生成多个回答,由人类标注员排序:哪个更有用、更准确、更无害。用这些排序数据训练出奖励模型,让它学会给任意回答打分。这一步相当于把成千上万名标注员的品味,浓缩成一个不知疲倦的自动裁判。
第三步:强化学习(RL)持续进化
大模型不断生成回答,奖励模型实时打分,再通过 PPO 等强化学习算法调整模型参数,让高分回答出现的概率越来越高。模型就在「生成—打分—改进」的循环中不断进化。
| 阶段 | 核心任务 | 人类角色 | 通俗类比 |
|---|---|---|---|
| 预训练 | 从海量文本学知识 | 几乎不参与 | 读书破万卷 |
| 监督微调 SFT | 学会对话格式 | 提供示范答案 | 师傅带徒弟 |
| 奖励建模 RM | 学会判断好坏 | 对回答排序 | 制定评分标准 |
| 强化学习 RL | 优化生成策略 | 间接参与 | 教练陪练提升 |
一句话总结:SFT 教模型「怎么说话」,RLHF 教模型「说什么才更好」。
哪些产品用到了 RLHF?
RLHF 已是大模型的「标配」对齐技术,国内外主流产品几乎都在使用:
- DeepSeek(深度求索):V3、R1 系列在训练中结合了 RLHF 与大规模强化学习,R1 更凭借强化学习显著提升了推理能力。
- Kimi(月之暗面):以长文本对话见长,回答的贴合度与安全性依赖人类反馈对齐。
- 豆包(字节跳动):面向亿万用户的日常对话,大量使用偏好数据优化语气与实用性。
- 通义千问(阿里巴巴):采用 RLHF 及 DPO 等对齐技术,提升中文场景下回答的有用性与无害性。
- 智谱清言 / GLM(智谱AI):GLM 系列模型的训练中广泛采用人类偏好对齐方法。
- ChatGPT(OpenAI):RLHF 的「开山之作」,2022 年的 InstructGPT 论文首次系统提出了该方法。
RLHF 的应用场景
- 对话助手:让回答更有用、更礼貌,减少答非所问。
- 内容安全:降低有害、违法、带偏见内容的输出概率。
- 减少幻觉:引导模型学会承认「不知道」,而非硬编答案。
- 风格对齐:让输出符合指定语气与格式,如客服话术、公文写作。
- 垂直行业:在医疗、法律、教育等场景中遵循专业规范与合规要求。
常见问题
RLHF 和普通微调(SFT)有什么区别?
SFT 是「照着标准答案学」,模型只能模仿人类给定的示范;RLHF 是「根据评价自己改进」,模型可以探索出比示范更好的回答。实践中两者常配合使用:先 SFT 打底,再 RLHF 精调。
为什么不直接让人类逐条打分,而要训练奖励模型?
出于成本与效率考虑。让人类实时评价模型的每一次回答,速度慢、费用高、标准也不稳定。奖励模型学会人类偏好后,可以全天候自动打分,支撑强化学习高效运转。
RLHF 有什么局限?
一是标注质量决定上限,标注员的主观偏好可能引入偏差;二是奖励模型可能被「钻空子」,模型学会讨好裁判而非真正变好,即所谓「奖励黑客」;三是流程复杂、算力成本高。因此业界也发展出 DPO 等更轻量的对齐方法作为补充。
辽公网安备21021102001760号