核心要点

  • 能区分 V^π(s) 与 Q^π(s,a)

  • 理解 V*、Q* 与最优策略的关系

  • 知道策略评估 vs 策略改进

  • 能说明 Actor-Critic 中价值函数的作用

简要回答

价值函数 V^π、Q^π 衡量在策略 π 下从某状态/状态-动作对的期望 回报;最优 Q* 诱导贪心最优 策略

标准回答

状态价值 V^π(s) = E_π[G_t | S_t=s]:从 s 出发按 π 行动的期望回报
动作价值 Q^π(s,a) = E_π[G_t | S_t=s, A_t=a]:在 s 先执行 a 再按 π 行动的期望回报。

关系:V^π(s) = Σ_a π(a|s) Q^π(s,a);Q^π(s,a) = E[R + γ V^π(s') | s,a]

最优价值:V*(s) = max_π V^π(s);Q*(s,a) = max_π Q^π(s,a)

与策略的关系

  • 策略评估:给定 π,求 V^π 或 Q^π(DP/TD/MC)
  • 策略改进:π'(s) = argmax_a Q^π(s,a) 保证 V^{π'} ≥ V^π
  • 最优策略:π*(s) = argmax_a Q*(s,a)(贪心即最优)

Actor-Critic:Critic 学价值函数估计优势 A(s,a) = Q(s,a) - V(s),指导 Actor(策略)梯度更新。详见 强化学习入门

回答思路

  • 【定义】用一句话说清「什么是价值函数?与强化学习策略有何关系」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:RL 数学基础强化学习入门。术语:Return策略折扣因子

常见误区

⚠️ 常见踩坑

V 与 Q 关系公式写错;说「价值函数就是策略」混淆概念;忽略策略改进定理条件。

追问

追问 1为什么有时学 Q 比学 V 更方便?

Q 直接可用于动作选择(argmax),无需已知模型;V 需配合模型或额外搜索。连续动作空间常用 V + 策略梯度而非表格 Q。

追问 2优势函数 A(s,a) 有何用处?

A(s,a) = Q(s,a) - V(s) 衡量动作相对平均水平的优劣,降低策略梯度方差。GAE 是优势估计的常用方法。

追问 3状态价值能否唯一确定策略?

多个策略可有相同 V^π(策略等价类)。Q 函数在最优时贪心唯一确定最优动作(假设无并列 max),但一般 Q^π 也对应多个策略。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习