RLHF

RLHF

让人类教模型说好话

亦作、亦称:人类反馈强化学习

RLHF(基于人类反馈的强化学习)是一种将人类偏好信号融入模型训练的对齐技术,通过让人类对模型输出进行比较评分、训练奖励模型,再用强化学习持续优化语言模型策略,使其输出更符合人类意图与价值观。它是当前主流大语言模型实现指令遵循与价值对齐的核心方法之一。

概述

RLHF 是目前最主流的大模型「对齐」方法,解决的核心问题是:模型如何从海量数据中学到「说对」,但却不知道「说好」。

  • 对齐目标:让模型输出符合人类的意图、诚实性与安全性要求,而不仅仅是预测下一个 token
  • 三阶段流程:通常分为监督微调(SFT)→ 奖励模型训练(RM)→ 策略优化(PPO)三步
  • 核心假设:人类能够比较两个回答的好坏,即使很难直接写出「完美答案」
  • 代表落地InstructGPT(2022)是首个大规模公开 RLHF 应用,直接催生了 ChatGPT

工作原理

RLHF 的三步流程环环相扣,每步都解决不同的对齐子问题。

  • 第一步 SFT(监督微调)用人工标注的高质量示范数据对预训练模型做有监督微调,得到一个「听话」的初始策略
    -
    第二步 训练奖励模型(RM) 给同一提示生成多条回答,由人类标注员排序;用排序数据训练一个奖励模型,使其能自动给回答打分
    -第三步 PPO 优化以奖励模型的得分为信号,用近端策略优化(PPO)算法更新策略模型,同时加入KL 散度惩罚防止模型偏离 SFT 基线过远
    -
    反馈闭环 策略模型更新后可生成新数据,再次收集人类偏好,形成迭代改进的闭环

发展脉络

RLHF 从强化学习领域的小众技术,演变为大模型对齐的行业标准。

  • 2017:Christiano 等人(OpenAI 与 DeepMind 合作)发表「Deep Reinforcement Learning from Human Preferences」,首次在 Atari 游戏和 MuJoCo 机器人控制任务中用人类偏好比较训练奖励模型,奠定 RLHF 基础框架
  • 2020:Stiennon 等人(OpenAI)发表「Learning to Summarize with Human Feedback」,首次将 RLHF 系统性应用于语言模型摘要任务
  • 2022 年初InstructGPT 论文(Ouyang et al.)发布,系统阐述 SFT→RM→PPO 三步流程,证明 1.3B 参数 RLHF 模型在人类评测中优于 175B 的原版 GPT-3
  • 2022 年 11 月ChatGPT 上线,将 RLHF 的对齐效果带入大众视野
  • 2023DPO 提出,省去显式奖励模型,迅速成为学术界主流替代方案
  • 2024GRPO(DeepSeek)等变体涌现,可验证奖励结合 RL 推动推理模型(o1、R1)突破

类型与变体

RLHF 框架催生了多种简化或替代方案,以降低人工成本和训练难度。

  • DPO(直接偏好优化):跳过显式奖励模型,直接用偏好对数据对策略做对比损失优化,训练更稳定、成本更低
  • RLAIF(AI 反馈强化学习):用更强的 AI 模型替代人类标注员提供偏好信号;Constitutional AI(Anthropic)是典型代表
  • GRPO:由 DeepSeek 提出,去掉价值函数网络,用组内奖励归一化替代优势估计,显著降低显存消耗
  • ORPO(奇数比率偏好优化):将 SFT 损失与偏好损失合并为单一目标,无需独立的奖励模型阶段
  • ReMax / REINFORCE 变体:用简单的 REINFORCE 算法替代 PPO,减少实现复杂度

应用场景

RLHF 及其变体已成为对话模型产品化的标配流程。

  • 对话助手:ChatGPT、Claude、Gemini 均依赖 RLHF/DPO 使模型更有帮助、更安全、更无害
  • 代码生成:GitHub Copilot 等工具用人类反馈优化代码质量与可读性
  • 内容安全:通过奖励模型打压有害、偏见或违规输出,是模型安全层的重要组成部分
  • 推理模型训练o1DeepSeek-R1 等推理模型在强化学习阶段借鉴 RLHF 框架,用可验证奖励(数学/代码正确性)替代人类偏好

局限与误区

RLHF 效果显著,但也存在被过度神化的倾向,需要认清几个核心局限。

  • 奖励欺骗(Reward Hacking):模型可能学会「讨好」奖励模型而非真正提升质量,即 Goodhart 定律在对齐中的体现
  • 标注员偏差:人类标注员的价值观和能力参差不齐,偏好数据本身带有主观性和文化偏见
  • 成本极高:PPO 训练需同时维护策略、参考、奖励、价值函数四个模型,显存和算力开销是 SFT 的数倍
  • 分布外泛化弱:奖励模型只在标注分布内可靠,对超出分布的新问题可能给出错误分数
  • RLHF 不等于价值观注入:RLHF 优化的是人类标注者的偏好,标注者偏好并不等于普世价值观

与相邻概念的区别

RLHF 常与几个相关概念混用,厘清边界有助于理解各自定位。

  • RLHF vs SFT:SFT 只学「正确示范」,无法区分「还行」和「很好」;RLHF 通过比较偏好建模「哪个更好」,是 SFT 之后的进一步对齐
  • RLHF vs DPO:DPO 省去了显式奖励模型和 PPO 训练,直接优化策略;实现更简单,但灵活性略低
  • RLHF vs RLAIF:两者框架相同,区别在于偏好信号来源——RLHF 依赖人类标注,RLAIF 依赖 AI 模型自动标注
  • RLHF vs 对齐(Alignment):对齐是更宽泛的目标,RLHF 是实现对齐的一种主要技术手段,对齐还包括可解释性、红队测试、护栏等方法

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「让人类教模型说好话」
  • 「人类打分训练」
  • 「让模型更「乖」」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    RLHF(一):基于人类反馈的强化学习

    从奖励模型到 PPO 优化,理解大模型对齐的核心技术

  2. 2

    AI 对齐(二):RLHF 与伦理框架

    从目标规范到奖励黑客,理解 AI 对齐问题的本质、挑战与主流解决方案

外部参考

维基百科:查看「RLHF」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。