奖励模型(RM)

奖励模型

给回答打分的模型

亦作、亦称:RM

奖励模型(Reward Model,RM)是基于人类偏好比较数据训练的评分网络,在 RLHF 流程中将人类对回复质量的主观判断转化为标量信号,引导语言模型向更符合人类期望的方向优化。它是连接人工标注与策略强化学习训练的核心枢纽。

概述

奖励模型解决了强化学习中最困难的问题之一:如何在开放式语言任务中定义「好的回复」。

  • 核心职责:接收一条提示(prompt)和一条模型回复,输出一个标量分数,分数越高表示回复质量越好。
  • 训练数据来源:人类标注员对同一提示下的多条回复进行两两比较或排序,生成偏好对数据。
  • 在 RLHF 中的位置:位于 SFT(监督微调)之后、PPO 优化之前,是连接人类偏好与强化学习信号的桥梁。
  • 通俗理解:策略模型是「考生」,奖励模型是「阅卷老师」,人类偏好数据是「评分标准」。

工作原理:Bradley-Terry 偏好模型

RM 的训练采用比较学习范式,其损失函数源自统计学中的 Bradley-Terry 模型

  • 数据格式:对同一提示生成两条回复,由标注员选出更好的一条,产出形如 (prompt, chosen, rejected) 的三元组。
  • 损失函数:负对数似然 −log σ(r(x, y_chosen) − r(x, y_rejected)),要求胜出回复得分显著高于落败回复,σ 为 sigmoid 函数。
  • 模型结构:通常基于预训练语言模型改造,在最后一层添加线性头(linear head),将隐状态映射为标量分数。
  • 数据规模参考:InstructGPT 使用约 3.3 万对比较样本训练一个 6B 参数的 RM,策略模型则为 175B。
  • KL 惩罚:PPO 训练阶段在奖励中叠加 KL 散度惩罚项,约束策略与 SFT 模型之间的偏差,防止策略过度「迎合」RM。

类型与变体

随着对齐研究深入,奖励模型衍生出多种架构和训练范式。

  • 基于排序的 RM(经典形式):用人类两两比较数据训练,InstructGPT 采用此方案,是目前应用最广的基线形式。
  • 过程奖励模型(PRM):不只对最终答案打分,而是对推理的每个中间步骤分别评分,适用于数学、代码等需要链式推理的任务;OpenAI 发布的 PRM800K 是代表性公开数据集。
  • 结果奖励模型(ORM):只对最终结果正确性打分,实现简单,但对中间推理步骤的错误缺乏约束。
  • 可验证奖励(规则奖励):用代码执行结果或数学答案正确性作为客观奖励,完全替代 RM;DeepSeek-R1 的强化学习阶段大量采用此方法。
  • 隐式奖励模型DPO 训练后的策略模型本身隐含了一个奖励函数,可直接从策略参数推导,无需单独训练 RM。

应用场景

奖励模型不仅用于训练,也逐渐成为推理阶段的质量控制工具。

  • RLHF/PPO 训练:为策略模型提供实时奖励信号,是 ChatGPT、Claude、Gemini 等对话模型的核心对齐机制。
  • Best-of-N 采样:推理时生成 N 条候选回复,用 RM 打分并输出最高分的那条,以简单方式提升回复质量。
  • 测试时计算扩展(Test-Time Compute):结合束搜索或蒙特卡洛树搜索(MCTS),让 RM 在推理时引导搜索方向,用更多算力换取更优结果。
  • 数据筛选:用 RM 对合成数据或候选训练样本自动打分,保留高质量样本,降低人工标注成本。
  • 安全审核:将有害性作为惩罚维度集成进 RM,对危险内容输出负分,辅助内容安全过滤。

局限与常见误区

奖励模型是 RLHF 流程中最脆弱的环节,其缺陷会被后续强化学习放大。

  • 奖励欺骗(Reward Hacking):策略模型可能学会「钻 RM 漏洞」——生成表面流畅、实则错误或有害的内容却获得高分;这是古德哈特定律在对齐领域的典型体现。
  • 分布外脆弱性:RM 训练样本覆盖不足时,对未见风格或罕见话题可能给出失真排序,是 RM 最核心的工程局限。
  • 标注员偏差放大:RM 会学到标注员群体的系统性偏好(如偏爱更长、更自信的回复),并在训练中放大这些偏差。
  • 分数不可跨提示比较:RM 分数是相对偏好的代理,高分仅意味着「比备选答案更受偏好」,而非「答案本身正确」。
  • 扩展成本高:为覆盖足够多样的偏好样本,需要大规模专业标注,且需随策略演进定期重新训练 RM。

发展脉络

奖励模型的概念从强化学习领域萌芽,随 LLM 崛起成为对齐技术的基石。

  • 2017:Christiano 等人(OpenAI 与 DeepMind 合作)发表「Deep RL from Human Preferences」,在 Atari 游戏和机器人控制中用两两偏好比较替代显式奖励函数,奠定基础范式。
  • 2019:Ziegler 等人(OpenAI)发表「Fine-Tuning Language Models from Human Preferences」,将 RM 思路引入语言模型情感控制与续写任务。
  • 2020:Stiennon 等人(OpenAI)发表「Learning to Summarize with Human Feedback」,首次在 NLP 摘要任务中完整实验 RM + PPO 管线,验证语言 RM 的可行性。
  • 2022:Ouyang 等人发表 InstructGPT(NeurIPS 2022),系统化三步 RLHF 流程,RM 正式确立核心地位;同年 ChatGPT 上线。
  • 2023:DPO 提出隐式奖励概念;OpenAI 发布 PRM800K 将 RM 扩展至步骤级推理评估。
  • 2024 至今:DeepSeek-R1 等推理模型大量采用可验证奖励替代 RM,推动奖励信号设计向客观可验证方向演进。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「给回答打分的模型」
  • 「大模型圈高频词」
  • 「跟 奖励模型 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    RLHF(一):基于人类反馈的强化学习

    从奖励模型到 PPO 优化,理解大模型对齐的核心技术

  2. 2

    PPO:近端策略优化

    从裁剪目标到信任区域,掌握最流行的强化学习算法

外部参考

维基百科:查看「奖励模型」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。