核心要点

  • 能定义行为策略 vs 目标策略

  • 举例 SARSA(on) vs Q-Learning(off)

  • 理解 off-policy 的数据复用与稳定性挑战

  • 知道重要性采样在 off-policy 中的作用

简要回答

On-policy 用当前策略采集的数据学当前策略(如 SARSA、PPO);off-policy 可用旧策略或其他策略的数据学目标策略(如 Q-Learning、DQN 经验回放)。

标准回答

一、On-policy(同策略)

用于更新的数据必须由当前正在优化的策略产生。学的是 π 自身的 Q^π 或 V^π。

  • 例:SARSA、蒙特卡洛 on-policy、PPO(通常用当前策略 rollout)

二、Off-policy(异策略)

行为策略 μ 可与目标策略 π 不同,用 μ 采集的数据学 π(常为最优策略)。

  • 例:Q-Learning(ε-greedy 探索,学 greedy Q*)、DQN(经验回放含旧策略数据)
    维度 On-policy Off-policy
    数据效率 样本即用即弃 可复用历史(回放)
    探索 与学习目标耦合 可激进探索、学保守最优
    稳定性 较稳 deadly triad 风险
    代表 PPO, SARSA DQN, Q-Learning

三、Off-policy 校正

重要性采样比率 ρ = π(a|s)/μ(a|s) 加权修正分布偏移。详见 RL 算法概览

回答思路

  • 【定义】用一句话说清「同策略学习与异策略学习」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:RL 算法概览深度 Q 网络。术语:Q-LearningDQNPPO

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:把「off-policy = 离线」混淆(off-policy 仍可在线交互);说不清行为策略与目标策略区别。

追问

追问 1PPO 是 on-policy 还是 off-policy?

标准 PPO 是 on-policy,用当前策略采集的 rollout 更新,多 epoch 时常用 clip 限制偏离防过大 off-policy 误差。部分变体引入 replay 近似 off-policy。

追问 2什么是 deadly triad?

函数近似 + bootstrapping + off-policy 三者同时出现可能导致 Q 值发散(Sutton & Barto)。DQN 用目标网络、回放缓解但非理论保证。

追问 3离线 RL 属于哪种?

典型的 off-policy:数据集由未知行为策略产生,要学新策略。挑战是分布外动作的 Q 值外推不可靠,需保守 Q 学习(CQL)、BCQ 等约束。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习