核心要点

  • 能定义 RL 的交互式序贯决策范式

  • 对比三种范式:标签、无标签、奖励信号

  • 理解延迟奖励与探索-利用

  • 能举典型应用(游戏、机器人、推荐)

简要回答

强化学习Agent 通过与环境交互获得奖励反馈,学习最大化长期 回报 的策略;不同于监督学习的标注标签和无监督的结构发现。

标准回答

一、强化学习

智能体在环境中序贯决策,每步获得标量奖励,目标是最大化累积折扣回报。无监督提供「正确答案」,只有延迟、可能稀疏的反馈。

范式 信号 数据 目标
监督学习 标签 y (x,y) 独立同分布 最小化预测误差
无监督学习 无标签 x 发现结构/表示
强化学习 奖励 r 轨迹 (s,a,r,...) 最大化长期回报

二、关键差异

  1. 序贯性:当前动作影响未来状态与奖励
  2. 探索-利用:需主动尝试未知动作获取信息
  3. 信用分配:哪步动作导致了最终奖励?
  4. 分布偏移:数据分布随策略变化(非 i.i.d.)

三、应用

AlphaGo、机器人控制、自动驾驶决策、广告出价、LLM RLHF 对齐。详见 强化学习入门

回答思路

  • 【定义】用一句话说清「什么是强化学习?它与监督/无监督学习」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:强化学习入门RL 指南。术语:强化学习策略PPO

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只说「有奖励就是 RL」却忽略序贯决策;把 bandit(单步)与完整 MDP 混为一谈。

追问

追问 1RLHF 算强化学习还是监督学习?

混合范式:SFT 是监督;奖励模型训练类似监督/排序;PPO 等对齐阶段是 RL。整体管线用 RL 优化人类偏好,但离不开监督预训练基础。

追问 2模仿学习(IL)和 RL 有何关系?

IL 用专家轨迹当监督信号学策略,无需奖励设计;RL 从奖励试错学习。GAIL 等结合两者:IL 初始化 + RL 微调,或 RL 用 IL 约束防偏离。

追问 3离线 RL 和在线 RL 区别?

在线 RL 可持续与环境交互采集数据;离线 RL 只用固定历史数据集,面临分布偏移和 extrapolation 误差,更接近「从日志学策略」的工程场景。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习