回答思路
【定义】用一句话说清「强化学习中的策略(Policy)起什么作用」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:策略与价值函数混为一谈;只说「神经网络输出动作」不说分布与探索;忽视约束策略更新的必要性。
追问
追问 1:随机策略比确定性策略好在哪里?
探索需要随机性;某些环境最优策略本身随机(如石头剪刀布);策略梯度定理对随机策略有干净表达。确定性策略可用 OU 噪声等外加探索。
追问 2:策略梯度定理直觉?
∇J ∝ E[∇log π(a|s) · Q(s,a)]:增大概率给高 Q 动作,减小给低 Q 动作。用样本估计 Q 或优势 A 降方差。
追问 3:约束策略更新为什么重要(如 PPO clip)?
大步策略更新导致数据分布剧变,on-policy 假设破坏、训练崩溃。Trust Region / PPO clip 限制 KL 或比率,保证单调改进近似。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
