核心要点

  • 能定义确定性/随机性策略

  • 理解策略是 RL 的核心优化对象

  • 区分基于策略 vs 基于价值的方法

  • 知道策略参数化(神经网络

简要回答

策略 π(a|s) 是 Agent 的行为规则,将状态映射到动作(分布);RL 目标是找到最大化期望 回报 的最优策略 π*。

标准回答

一、策略(Policy)

π:在状态 s 下选择动作的规则。

  • 确定性:a = μ(s)
  • 随机性:π(a|s) = P(A_t=a | S_t=s),支持探索

二、角色

  1. 行为核心:Agent 每步按 π 决策,完全决定轨迹分布
  2. 优化目标:学 π* 使 J(π) = E[G_0] 最大
  3. 两类方法
    • Value-based:先学 Q*,再 π(s)=argmax Q(DQN
    • Policy-based:直接参数化 π_θ,梯度上升(REINFORCE、PPO

三、深度 RL

π_θ 常为神经网络(Actor),输出动作概率或连续动作均值/方差。PPO 等用 clipped objective 稳定策略更新。

四、与价值函数关系

策略评估求 V^π;策略改进用 Q^π 贪心;Actor-Critic 同时维护 π 与 V/Q。详见 强化学习入门

回答思路

  • 【定义】用一句话说清「强化学习中的策略(Policy)起什么作用」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:强化学习入门PPO 与对齐。术语:策略PPOReturn

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:策略与价值函数混为一谈;只说「神经网络输出动作」不说分布与探索;忽视约束策略更新的必要性。

追问

追问 1随机策略比确定性策略好在哪里?

探索需要随机性;某些环境最优策略本身随机(如石头剪刀布);策略梯度定理对随机策略有干净表达。确定性策略可用 OU 噪声等外加探索。

追问 2策略梯度定理直觉?

∇J ∝ E[∇log π(a|s) · Q(s,a)]:增大概率给高 Q 动作,减小给低 Q 动作。用样本估计 Q 或优势 A 降方差。

追问 3约束策略更新为什么重要(如 PPO clip)?

大步策略更新导致数据分布剧变,on-policy 假设破坏、训练崩溃。Trust Region / PPO clip 限制 KL 或比率,保证单调改进近似。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习