RLHF
RLHF让人类教模型说好话
亦作、亦称:人类反馈强化学习
RLHF(基于人类反馈的强化学习)是一种将人类偏好信号融入模型训练的对齐技术,通过让人类对模型输出进行比较评分、训练奖励模型,再用强化学习持续优化语言模型策略,使其输出更符合人类意图与价值观。它是当前主流大语言模型实现指令遵循与价值对齐的核心方法之一。
概述
RLHF 是目前最主流的大模型「对齐」方法,解决的核心问题是:模型如何从海量数据中学到「说对」,但却不知道「说好」。
- 对齐目标:让模型输出符合人类的意图、诚实性与安全性要求,而不仅仅是预测下一个 token
- 三阶段流程:通常分为监督微调(SFT)→ 奖励模型训练(RM)→ 策略优化(PPO)三步
- 核心假设:人类能够比较两个回答的好坏,即使很难直接写出「完美答案」
- 代表落地:InstructGPT(2022)是首个大规模公开 RLHF 应用,直接催生了 ChatGPT
工作原理
RLHF 的三步流程环环相扣,每步都解决不同的对齐子问题。
- 第一步 SFT(监督微调):用人工标注的高质量示范数据对预训练模型做有监督微调,得到一个「听话」的初始策略
- 第二步 训练奖励模型(RM): 给同一提示生成多条回答,由人类标注员排序;用排序数据训练一个奖励模型,使其能自动给回答打分
-第三步 PPO 优化:以奖励模型的得分为信号,用近端策略优化(PPO)算法更新策略模型,同时加入KL 散度惩罚防止模型偏离 SFT 基线过远
- 反馈闭环 : 策略模型更新后可生成新数据,再次收集人类偏好,形成迭代改进的闭环
发展脉络
RLHF 从强化学习领域的小众技术,演变为大模型对齐的行业标准。
- 2017:Christiano 等人(OpenAI 与 DeepMind 合作)发表「Deep Reinforcement Learning from Human Preferences」,首次在 Atari 游戏和 MuJoCo 机器人控制任务中用人类偏好比较训练奖励模型,奠定 RLHF 基础框架
- 2020:Stiennon 等人(OpenAI)发表「Learning to Summarize with Human Feedback」,首次将 RLHF 系统性应用于语言模型摘要任务
- 2022 年初:InstructGPT 论文(Ouyang et al.)发布,系统阐述 SFT→RM→PPO 三步流程,证明 1.3B 参数 RLHF 模型在人类评测中优于 175B 的原版 GPT-3
- 2022 年 11 月:ChatGPT 上线,将 RLHF 的对齐效果带入大众视野
- 2023:DPO 提出,省去显式奖励模型,迅速成为学术界主流替代方案
- 2024:GRPO(DeepSeek)等变体涌现,可验证奖励结合 RL 推动推理模型(o1、R1)突破
类型与变体
RLHF 框架催生了多种简化或替代方案,以降低人工成本和训练难度。
- DPO(直接偏好优化):跳过显式奖励模型,直接用偏好对数据对策略做对比损失优化,训练更稳定、成本更低
- RLAIF(AI 反馈强化学习):用更强的 AI 模型替代人类标注员提供偏好信号;Constitutional AI(Anthropic)是典型代表
- GRPO:由 DeepSeek 提出,去掉价值函数网络,用组内奖励归一化替代优势估计,显著降低显存消耗
- ORPO(奇数比率偏好优化):将 SFT 损失与偏好损失合并为单一目标,无需独立的奖励模型阶段
- ReMax / REINFORCE 变体:用简单的 REINFORCE 算法替代 PPO,减少实现复杂度
应用场景
RLHF 及其变体已成为对话模型产品化的标配流程。
- 对话助手:ChatGPT、Claude、Gemini 均依赖 RLHF/DPO 使模型更有帮助、更安全、更无害
- 代码生成:GitHub Copilot 等工具用人类反馈优化代码质量与可读性
- 内容安全:通过奖励模型打压有害、偏见或违规输出,是模型安全层的重要组成部分
- 推理模型训练:o1、DeepSeek-R1 等推理模型在强化学习阶段借鉴 RLHF 框架,用可验证奖励(数学/代码正确性)替代人类偏好
局限与误区
RLHF 效果显著,但也存在被过度神化的倾向,需要认清几个核心局限。
- 奖励欺骗(Reward Hacking):模型可能学会「讨好」奖励模型而非真正提升质量,即 Goodhart 定律在对齐中的体现
- 标注员偏差:人类标注员的价值观和能力参差不齐,偏好数据本身带有主观性和文化偏见
- 成本极高:PPO 训练需同时维护策略、参考、奖励、价值函数四个模型,显存和算力开销是 SFT 的数倍
- 分布外泛化弱:奖励模型只在标注分布内可靠,对超出分布的新问题可能给出错误分数
- RLHF 不等于价值观注入:RLHF 优化的是人类标注者的偏好,标注者偏好并不等于普世价值观
与相邻概念的区别
RLHF 常与几个相关概念混用,厘清边界有助于理解各自定位。
- RLHF vs SFT:SFT 只学「正确示范」,无法区分「还行」和「很好」;RLHF 通过比较偏好建模「哪个更好」,是 SFT 之后的进一步对齐
- RLHF vs DPO:DPO 省去了显式奖励模型和 PPO 训练,直接优化策略;实现更简单,但灵活性略低
- RLHF vs RLAIF:两者框架相同,区别在于偏好信号来源——RLHF 依赖人类标注,RLAIF 依赖 AI 模型自动标注
- RLHF vs 对齐(Alignment):对齐是更宽泛的目标,RLHF 是实现对齐的一种主要技术手段,对齐还包括可解释性、红队测试、护栏等方法
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「让人类教模型说好话」
- 「人类打分训练」
- 「让模型更「乖」」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念高频查看详解 →
从预训练到对齐,大模型训练分哪几个阶段?
预训练学语言与世界知识,SFT 学指令格式,RLHF/DPO 对齐人类偏好,三阶段目标依次递进。
- 高级概念高频查看详解 →
RLHF 和 DPO 有什么区别?各自适用什么场景?
RLHF 通过奖励模型 + 强化学习优化偏好;DPO 直接用偏好对优化策略,省去 RM 训练,更稳定易部署。
- 高级系统设计高频查看详解 →
如何从零设计一个类 ChatGPT 的对话产品?
从对齐后的模型、低延迟推理服务、会话与上下文管理、安全护栏到评测飞轮的端到端对话产品设计。
- 中级开放查看详解 →
RLHF / 对齐过程会引入哪些价值偏见?
RLHF 会引入标注者人群偏好、奖励模型放大、文化/政治倾向与谄媚(sycophancy)等价值偏见。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「RLHF」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
