核心要点
能对比 TD bootstrapping vs MC 完整回报
理解 bias-variance trade-off
能写出 SARSA 与 Q-Learning 更新式
知道 TD(0)、TD(λ) 与 eligibility trace
标准回答
一、先给出结论和背景
- 蒙特卡洛:目标 = 实际累积回报 G_t,episode 结束后更新。
- TD:目标 = r + γ V(s')(一步 bootstrapping),每步可更新。
维度 MC TD(含 SARSA) 目标 G_t(真实回报) r + γV(s')(估计) 偏差 无偏 有偏(bootstrap) 方差 高 较低 在线性 需 episode 结束 可在线
二、拆开关键步骤和判断点
- SARSA:(on-policy TD 控制):
Q(s,a) ← Q(s,a) + α [ r + γ Q(s',a') - Q(s,a) ]
其中 a' 是实际采取的下一步动作。 - Q-Learning:用 max Q(s',·)(off-policy),SARSA 用 Q(s',a')(on-policy)。
三、补上落地边界和取舍
- TD(λ):与 eligibility traces 在 bias-variance 间插值,λ=0 为 TD(0),λ=1 接近 MC。详见 RL 算法概览。
回答思路
【定义】用一句话说清「SARSA 等时序差分方法与蒙特卡洛方法」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
延伸阅读:RL 算法概览。术语:时序差分学习、Q-Learning、GAE。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:TD 与 MC 对比只说「快 vs 慢」不说 bias-variance;SARSA 与 Q-Learning 的 max vs 实际动作混淆。
追问
追问 1:SARSA 为什么叫 on-policy?
TD 目标中的后继动作 a' 来自当前行为策略(如 ε-greedy),更新的是 Q^π 而非 Q*。学的是「按当前策略行动」的价值,更保守。
追问 2:TD 误差 δ_t = ?
δ_t = r_{t+1} + γ V(S_{t+1}) - V(S_t),是 Bellman 方程残差的样本估计,驱动价值函数更新;SARSA/Q-Learning 是其动作价值版本。
追问 3:n-step TD 是什么?
在一步 TD 与 MC 之间折中:用 n 步回报 r_{t+1} + ... + γ^{n-1} r_{t+n} + γ^n V(s_{t+n}) 作目标,n 越大越接近 MC,方差增、偏差减。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
