核心要点
能定义五元组 (S,A,P,R,γ)
理解马尔可夫性:未来只依赖当前状态
区分 episodic vs continuing 任务
知道 MDP 是大多数 RL 算法的形式化基础
标准回答
马尔可夫决策过程(MDP) 五元组 (S, A, P, R, γ):
- S:状态空间(离散或连续)
- A:动作空间
- P(s'|s,a):状态转移概率(马尔可夫性:下一状态只依赖当前 s,a)
- R(s,a,s') 或 R(s,a):奖励函数
- γ:折扣因子
马尔可夫性:P(S_{t+1}|S_t,A_t,S_{t-1},...) = P(S_{t+1}|S_t,A_t)。这使最优决策可归结为当前状态的 策略 π(a|s),无需完整历史。
任务类型:
- Episodic(回合制):有终止状态,如围棋一局
- Continuing:无终止,如库存控制
与 RL 关系:环境通常建模为 MDP(或 POMDP 部分可观测扩展)。Agent 通过与环境交互估计 P、R 或直接学策略/价值。详见 强化学习入门。
回答思路
【定义】用一句话说清「强化学习中的马尔可夫决策过程(MDP)」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
把 MDP 说成「有奖励的机器学习」却说不清马尔可夫性;忽略 γ 或混淆状态与观测。
追问
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
