核心要点

  • 能说明 MC 用完整 episode 回报更新价值

  • 理解与 TD bootstrapping 的核心区别

  • 知道 first-visit vs every-visit MC

  • 能分析 MC 高方差、需等 episode 结束的特点

简要回答

蒙特卡洛方法用完整 回合 的实际累积 回报 G_t 作为价值估计目标,无偏但方差大,需 episode 结束后才能更新。

标准回答

一、先给出结论和背景

  • 蒙特卡洛(MC)RL:核心:不依赖环境模型,用实际经验轨迹估计价值。
  • 更新方式:对状态 s,收集经过 s 的多个 episode,用实际回报 G_t 的平均估计 V(s):
    V(s) ← V(s) + α(G_t - V(s))

二、拆开关键步骤和判断点

  • 两种变体:- First-visit MC:每个 episode 中只对 s 的第一次访问用 G_t 更新
  • Every-visit MC:每次访问 s 都用对应 G_t 更新
  • 特点:| 维度 | MC | TD |
    |------|-----|-----|
    | 目标 | 完整回报 G_t | r + γV(s') bootstrapping |
    | 偏差 | 无偏(真实回报) | 有偏(用估计值) |
    | 方差 | 高 | 较低 |
    | 更新时机 | episode 结束 | 每步可更新 |

三、补上落地边界和取舍

回答思路

  • 【定义】用一句话说清「蒙特卡洛方法在强化学习中如何应用」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:RL 算法概览强化学习入门。术语:ReturnEpisodeGAE

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:把 MC 当成「随机采样」而不强调完整 episode 回报;与 TD 对比时说不出 bias-variance trade-off。

追问

追问 1MC 能用于连续任务吗?

持续性任务 episode 不终止,需定义截断 horizon 或用折扣回报在有限窗口估计,否则无法获得完整 G_t。实践中 TD 更适合 continuing 任务。

追问 2为什么 MC 方差大?

G_t 包含整条轨迹的随机性(动作、转移),样本间波动大。需更多 episode 平均;可用 baseline、控制变量或转向 TD/GAE 降方差。

追问 3MC 策略评估 vs MC 控制有何不同?

评估固定策略 π 的价值;控制需探索(如 ε-greedy)并策略改进。MC 控制常用 GLIE(探索收敛)保证收敛到最优。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习