标准回答
一、RLHF
三阶段:SFT → 训练奖励模型 RM → PPO 等 RL 对齐(KL 约束防偏离)。
二、DPO
将偏好优化重写成监督损失,无需 RM 与在线采样,训练更稳定。
| 维度 | RLHF | DPO |
|---|---|---|
| 阶段 | 3 阶段 | 2 阶段 |
| 稳定性 | PPO 易崩溃 | 相对稳定 |
| 算力 | RM + RL 成本高 | 较低 |
三、选型
资源有限、快速对齐 → DPO;复杂多目标奖励、可迭代人类反馈 → RLHF 及变体。
面试里可以补一句:RLHF 和 DPO 有什么区别 在大模型场景下通常要同时权衡效果、延迟、成本和安全边界。回答时最好带一个例子,比如上下文过长、幻觉、缓存命中或工具调用失败时,系统应该如何降级和观测。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束。
追问
追问 1:PPO 中的 KL penalty 为什么重要?
防止策略模型为追求奖励偏离 SFT 模型太远,导致能力坍塌(mode collapse)或输出乱码。KL 项把更新约束在「可信区域」内,是对齐训练稳定的关键。
追问 2:偏好数据有噪声时,DPO 和 RLHF 谁更鲁棒?
DPO 对错误偏好对较敏感,可能过拟合噪声;RLHF 可通过 RM 平滑和 RL 探索部分缓解,但工程更复杂。实践常先做数据清洗,或用 RLAIF、鲁棒 DPO 变体。
追问 3:如何用 RLAIF 替代部分人类标注?
用强模型(或规则)对回答打分生成偏好对,再跑 DPO/RLHF,降低人工成本。需注意 judge 模型偏见会传递到策略模型,需抽样人工审计。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
