核心要点

  • 能对比 TD bootstrapping vs MC 完整回报

  • 理解 bias-variance trade-off

  • 能写出 SARSA 与 Q-Learning 更新式

  • 知道 TD(0)、TD(λ) 与 eligibility trace

简要回答

时序差分(TD) 每步用 r + γV(s') 引导更新,无需等 episode 结束;蒙特卡洛用完整 G_t,无偏但方差大。SARSA 是 on-policy TD 控制算法。

标准回答

一、先给出结论和背景

  • 蒙特卡洛:目标 = 实际累积回报 G_t,episode 结束后更新。
  • TD:目标 = r + γ V(s')(一步 bootstrapping),每步可更新。
    维度 MC TD(含 SARSA)
    目标 G_t(真实回报) r + γV(s')(估计)
    偏差 无偏 有偏(bootstrap)
    方差 较低
    在线性 需 episode 结束 可在线

二、拆开关键步骤和判断点

  • SARSA:(on-policy TD 控制):
    Q(s,a) ← Q(s,a) + α [ r + γ Q(s',a') - Q(s,a) ]
    其中 a' 是实际采取的下一步动作。
  • Q-Learning:用 max Q(s',·)(off-policy),SARSA 用 Q(s',a')(on-policy)。

三、补上落地边界和取舍

  • TD(λ):与 eligibility traces 在 bias-variance 间插值,λ=0 为 TD(0),λ=1 接近 MC。详见 RL 算法概览

回答思路

  • 【定义】用一句话说清「SARSA 等时序差分方法与蒙特卡洛方法」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:RL 算法概览。术语:时序差分学习Q-LearningGAE

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:TD 与 MC 对比只说「快 vs 慢」不说 bias-variance;SARSA 与 Q-Learning 的 max vs 实际动作混淆。

追问

追问 1SARSA 为什么叫 on-policy?

TD 目标中的后继动作 a' 来自当前行为策略(如 ε-greedy),更新的是 Q^π 而非 Q*。学的是「按当前策略行动」的价值,更保守。

追问 2TD 误差 δ_t = ?

δ_t = r_{t+1} + γ V(S_{t+1}) - V(S_t),是 Bellman 方程残差的样本估计,驱动价值函数更新;SARSA/Q-Learning 是其动作价值版本。

追问 3n-step TD 是什么?

在一步 TD 与 MC 之间折中:用 n 步回报 r_{t+1} + ... + γ^{n-1} r_{t+n} + γ^n V(s_{t+n}) 作目标,n 越大越接近 MC,方差增、偏差减。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习