标准回答
一、先给出结论和背景
- 蒙特卡洛(MC)RL:核心:不依赖环境模型,用实际经验轨迹估计价值。
- 更新方式:对状态 s,收集经过 s 的多个 episode,用实际回报 G_t 的平均估计 V(s):
V(s) ← V(s) + α(G_t - V(s))
二、拆开关键步骤和判断点
- 两种变体:- First-visit MC:每个 episode 中只对 s 的第一次访问用 G_t 更新
- Every-visit MC:每次访问 s 都用对应 G_t 更新
- 特点:| 维度 | MC | TD |
|------|-----|-----|
| 目标 | 完整回报 G_t | r + γV(s') bootstrapping |
| 偏差 | 无偏(真实回报) | 有偏(用估计值) |
| 方差 | 高 | 较低 |
| 更新时机 | episode 结束 | 每步可更新 |
三、补上落地边界和取舍
回答思路
【定义】用一句话说清「蒙特卡洛方法在强化学习中如何应用」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:把 MC 当成「随机采样」而不强调完整 episode 回报;与 TD 对比时说不出 bias-variance trade-off。
追问
追问 1:MC 能用于连续任务吗?
持续性任务 episode 不终止,需定义截断 horizon 或用折扣回报在有限窗口估计,否则无法获得完整 G_t。实践中 TD 更适合 continuing 任务。
追问 2:为什么 MC 方差大?
G_t 包含整条轨迹的随机性(动作、转移),样本间波动大。需更多 episode 平均;可用 baseline、控制变量或转向 TD/GAE 降方差。
追问 3:MC 策略评估 vs MC 控制有何不同?
评估固定策略 π 的价值;控制需探索(如 ε-greedy)并策略改进。MC 控制常用 GLIE(探索收敛)保证收敛到最优。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
