核心要点
能定义行为策略 vs 目标策略
举例 SARSA(on) vs Q-Learning(off)
理解 off-policy 的数据复用与稳定性挑战
知道重要性采样在 off-policy 中的作用
标准回答
一、On-policy(同策略)
用于更新的数据必须由当前正在优化的策略产生。学的是 π 自身的 Q^π 或 V^π。
- 例:SARSA、蒙特卡洛 on-policy、PPO(通常用当前策略 rollout)
二、Off-policy(异策略)
行为策略 μ 可与目标策略 π 不同,用 μ 采集的数据学 π(常为最优策略)。
- 例:Q-Learning(ε-greedy 探索,学 greedy Q*)、DQN(经验回放含旧策略数据)
维度 On-policy Off-policy 数据效率 样本即用即弃 可复用历史(回放) 探索 与学习目标耦合 可激进探索、学保守最优 稳定性 较稳 deadly triad 风险 代表 PPO, SARSA DQN, Q-Learning
三、Off-policy 校正
重要性采样比率 ρ = π(a|s)/μ(a|s) 加权修正分布偏移。详见 RL 算法概览。
回答思路
【定义】用一句话说清「同策略学习与异策略学习」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
延伸阅读:RL 算法概览、深度 Q 网络。术语:Q-Learning、DQN、PPO。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:把「off-policy = 离线」混淆(off-policy 仍可在线交互);说不清行为策略与目标策略区别。
追问
追问 1:PPO 是 on-policy 还是 off-policy?
追问 2:什么是 deadly triad?
函数近似 + bootstrapping + off-policy 三者同时出现可能导致 Q 值发散(Sutton & Barto)。DQN 用目标网络、回放缓解但非理论保证。
追问 3:离线 RL 属于哪种?
典型的 off-policy:数据集由未知行为策略产生,要学新策略。挑战是分布外动作的 Q 值外推不可靠,需保守 Q 学习(CQL)、BCQ 等约束。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
