核心要点
能定义 RL 的交互式序贯决策范式
对比三种范式:标签、无标签、奖励信号
理解延迟奖励与探索-利用
能举典型应用(游戏、机器人、推荐)
回答思路
【定义】用一句话说清「什么是强化学习?它与监督/无监督学习」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只说「有奖励就是 RL」却忽略序贯决策;把 bandit(单步)与完整 MDP 混为一谈。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
